AI 每日进展速报 - 2026-07-07
新旧
正在统计...
来源
当前筛选条件下没有条目。
数据状态 / Data Status
- 今日 arXiv RSS 未拉到新 announce 条目,未生成 2026-07-07 UTC cache;本次报告继续使用近 7 个工作日的本地 arXiv cache 以及其他数据源。
图像生成/编辑
arXiv
- UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios
- 赛道归属: 文生图(Text-to-Image Generation)/ 高分辨率生成 / 数据-模型协同设计
- 核心创新点: UltraFlux 针对将扩散Transformer扩展至原生4K分辨率时暴露的多因素耦合失效问题(位置编码、VAE压缩、优化策略),提出数据-模型协同设计范式,而非孤立解决单一瓶颈。核心贡献包括:(1)构建 MultiAspect-4K-1M 数据集,包含100万张多宽高比4K图像,从数据源头支撑多长宽比原生训练;(2)在 Flux-based DiT 架构上系统性地重新设计位置编码以适应极端宽高比与超高分辨率,同时改进VAE压缩策略以保留4K细节;(3)协同优化训练目标,使模型能够在多种宽高比下原生生成高保真4K图像,而非通过超分辨率后处理实现。整体方案证明了高分辨率多宽高比生成需要数据与模型层面的联合突破,任何单点优化均无法充分释放质量潜力。
- Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment
- 赛道归属: 文生图(Text-to-Image Generation)/ 语义对齐增强
- 核心创新点: 针对文生图模型中"唯一性对象"(如天体、地标、艺术品)受到强视觉先验干扰、导致概念关联偏差的问题,提出引入中间文本表示(Intermediate Text Representation, ITR)作为引导信号。核心思路是在生成过程中插入一个结构化的中间语义层,将原始提示词解耦为更精确的语义描述,从而绕过模型内化的视觉偏见,强化"一对一"(One-and-Only)对象的忠实渲染,而无需重新训练模型。
- Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation
- 赛道归属: 文生图(Text-to-Image Generation)/ 提示词重写与增强 / 视觉锚定对齐
- 核心创新点: FaithRewriter 针对现有提示词重写方法缺乏视觉基础导致"过度推断"从而引入意图偏差的问题,提出以视觉锚点(Visual Anchors)驱动提示词增强的新框架。核心创新在于:(1)在重写过程中引入视觉锚定机制,通过实际生成的或参考的视觉信号对重写内容进行约束与校验,而非纯粹依赖语言模型对文本的主观扩充,从而将"看见的内容"与"重写的描述"对齐;(2)构建对齐反馈回路,使重写后的提示词能够忠实反映用户的真实意图而非模型的想象性补全,有效缩小意图-生成鸿沟(intent-generation gap);(3)该框架可与现有T2I模型无缝结合,在不修改生成模型本身的前提下通过更精准的提示词提升生成结果与用户意图的一致性。
- DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation
- 赛道归属: 文生图 / 主体驱动文本生成图像评估基准 (Subject-Driven Text-to-Image Benchmark)
- 核心创新点: 提出DSH-Bench评测基准,核心贡献在于三个维度的系统性突破:① 构建了具有层次化主体分类体系(Hierarchical Subject Taxonomy)的多样化主体图像集,覆盖更广泛的主体类别;② 引入难度感知(Difficulty-Aware)机制,将主体图像按难度分级,实现对模型在不同难度主体上性能的细粒度区分;③ 设计场景感知(Scenario-Aware)评估框架,针对不同提示场景进行针对性评测,从而弥补现有基准在多样性、细粒度和场景覆盖方面的不足。
- Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
- 赛道归属: 文生图 / 布局条件自回归图像生成 (Layout-Conditioned Autoregressive Image Generation)
- 核心创新点: 提出SMARLI框架,针对自回归(AR)模型在布局条件生成中面临的稀疏条件利用不足与特征纠缠两大难题,提出结构化掩码(Structured Masking)机制作为核心技术手段。该方法通过设计专用的掩码策略,将空间布局约束显式地融入自回归生成过程,在不破坏AR模型原有序列生成范式的前提下,实现对图像中不同区域的精确空间控制,从而有效避免布局信息与图像特征之间的耦合干扰,提升生成图像与用户指定布局的空间一致性。
- SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion
- 赛道归属: 文生图基础模型 / 扩散模型训练加速(Text-to-Image Foundation Model, Diffusion Training Efficiency)
- 核心创新点: 提出 SeFi-Image,核心创新是"语义优先扩散(Semantic-First Diffusion)"这一新型潜在扩散建模范式。与传统扩散模型将语义信息视为条件输入不同,该范式将语义结构的学习置于扩散过程的优先位置,从而利用语义引导显著加速基础模型训练。关键突破在于将此范式成功扩展至大分辨率、大规模模型(多个参数量档位),突破了以往仅在 ImageNet 等简单数据集上小模型验证的局限。
- AccelAes: Accelerating Diffusion Transformers for Training-Free Aesthetic-Enhanced Image Generation
- 赛道归属: 文生图(Text-to-Image Generation)/ 推理加速与美学增强
- 核心创新点: 观察到扩散Transformer(DiT)在去噪过程中对美学相关token的注意力分布呈现空间非均匀性,美学区域具有更大的时序变化量,而非美学区域变化缓慢。据此提出AccelAes框架:针对美学token关联区域采用精细化计算,对其余区域进行缓存复用,实现训练无关的自适应稀疏注意力加速,在不牺牲美学质量的前提下显著降低DiT的推理延迟。
- UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention
- 赛道归属: 文生图(Text-to-Image Generation)/ 超高分辨率生成
- 核心创新点: 针对现有扩散模型(如FLUX、SD3)受限于注意力机制二次复杂度而难以突破2MP分辨率的瓶颈,提出UltraImageGen框架。核心技术创新在于分层局部注意力(Hierarchical Local Attention)机制,结合低分辨率全局语义锚定与高分辨率局部细节生成的两阶段策略,有效解耦全局结构一致性与局部纹理精度的矛盾,在训练数据稀缺的前提下实现超高分辨率图像的高效生成。
- EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation 🆕NEW
- 赛道归属: 文生图 / 公平性与偏见消除
- 核心创新点: 提出 EquiSteer,一种无需重新训练、无需批量控制、也无需针对特定提示词调优的推理时去偏方法。其核心技术突破在于通过操控扩散模型中的交叉注意力(Cross-Attention)层来引导生成结果趋向人口统计学公平性,将去偏干预解耦为对注意力图的轻量级定向引导,从而在单样本级别实现可扩展的公平生成,避免了现有方法因耦合训练或批量依赖而带来的灵活性瓶颈。
- Decoupled Guidance: Disentangling Subject and Context Pathways in Text-to-Image Personalization 🆕NEW
- 赛道归属: 文生图 / 图像个性化生成
- 核心创新点: 提出 Decoupled Guidance 框架,核心创新在于识别并解决了现有个性化生成方法中"条件纠缠(Conditioning Entanglement)"问题——即主体身份(保真度)与场景上下文(可编辑性)共享同一条件路径,导致注意力图资源竞争,造成保真度与可编辑性之间的固有权衡。该方法将主体路径与上下文路径显式解耦,分别建立独立的引导通道,并通过因果实验(将目标主体 token 替换为通用 token)提供了纠缠现象的因果证据,从机制层面突破了个性化生成中二者难以兼得的长期瓶颈。
GitHub
- [2026-07-07] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐12769
- [2026-07-06] Osmantic/ODS ⭐2623 🆕NEW
- [2026-07-06] jtydhr88/ComfyUI-qwenmultiangle ⭐1255 🆕NEW
- [2026-07-06] AceDataCloud/Nexior ⭐376
- [2026-07-07] Asilcanasil/Hent-AI-Synthesis-Engine ⭐151
HuggingFace Models
视频生成/编辑
arXiv
- Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation
- 赛道归属: 视频生成 / 训练优化与质量对齐(Text-to-Video Generation Quality Alignment)
- 核心创新点: 该工作提出了一种无需外部奖励模型或人工标注的视频生成质量对齐方法——Shell-LCC。其核心洞察是:高质量训练数据的流形结构本身即隐含了奖励信号。通过显式建模高质量视频数据的流形几何结构(Locally Connected Clusters, LCC),将数据流形作为内生奖励模型,引导扩散模型生成结果向高质量数据分布对齐。该方法规避了传统基于RLHF/DPO路线中高昂的标注成本和计算开销,同时在局部细节保真度上取得了更优的提升,为T2V生成的对齐范式提供了数据流形驱动的新思路。
- Event-Driven Video Generation
- 赛道归属: 视频生成(事件驱动/物理交互一致性)
- 核心创新点: 针对现有文生视频模型在处理局部物理交互(如接触、支撑、放置等)时产生时序错误的问题,提出事件驱动视频生成框架(EVD)。核心突破在于:在标准DiT架构中引入轻量级事件感知干预机制,打破"每一步更新所有潜在区域"的默认行为,将去噪过程与文本提示中隐含的局部交互事件绑定,使模型仅在事件激活的时空区域施加集中更新,从而显著提升接触一致性、动作完整性和支撑关系的物理合理性,且对现有DiT架构兼容、改动轻量。
- GimbalDiffusion: Gravity-Aware Camera Control for Video Generation
- 赛道归属: 视频生成 / 相机运动控制(Video Generation / Camera Motion Control)
- 核心创新点: GimbalDiffusion 提出了一种基于万向节(Gimbal)坐标系的重力感知相机控制框架,核心突破在于将相机运动分解为"绕重力轴旋转(pan/tilt)+ 横滚角(roll)"的物理直觉表示,替代了传统的相对/模糊相机轨迹编码方式。该表示天然对齐人类感知的"水平地面"先验,从根本上解决了现有方法在大角度旋转(如180°掉头、垂直俯仰)场景下几何控制精度不足的问题,使得视频生成模型能够支持精确的极端相机轨迹控制。
- Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption
- 赛道归属: 视频生成 / 自回归推理优化(Video Generation / Autoregressive Inference Optimization)
- 核心创新点: 针对自回归流式视频生成中KV Cache线性增长导致的内存瓶颈问题,提出了实例特定参数吸收(Instance-Specific Parametric Absorption, ISPA)框架。其核心创新在于:不采用传统的"丢弃冗余KV Token"压缩策略(该策略会破坏长程依赖,导致时序闪烁和身份丢失),而是将历史KV信息以参数化方式"吸收"进模型的轻量级实例特定参数中,在压缩内存占用的同时保留长程时序一致性。该方法实现了内存效率与生成质量的双重优化,为长视频自回归生成提供了新的推理范式。
- AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
- 赛道归属: 多模态生成(音视频联合生成)
- 核心创新点: 提出AVTok,一种用于音视频整体生成的一维统一tokenization方案。区别于主流双分支设计(视觉与音频各自独立tokenize和生成),AVTok的核心突破在于:将音频与视频信号共同映射到统一的1D离散token序列空间,消除跨模态表示鸿沟,避免双分支架构带来的大量冗余计算。该统一表示使单一自回归或生成模型可以同时建模音视频的时间同步性与语义对齐关系,在大幅降低训练资源消耗的同时,实现更细粒度的音画同步与整体语义一致性。
- EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics
- 赛道归属: 视频生成 / 云边协同推理加速(Cloud-Edge Collaborative Video Generation Inference)
- 核心创新点: EcoVideo 提出了一种基于熵编排的动态帧间解耦视频生成框架,专门针对 DiT 架构视频生成的高延迟痛点。其技术突破有三:①利用自注意力熵作为无需训练的帧级信息密度代理指标,实现自适应关键帧选取;②在云边协同架构中,高熵关键帧由云端大模型去噪,低熵非关键帧由边缘轻量模型处理,并通过跨帧特征复用减少冗余计算;③框架可根据系统动态(如带宽、负载变化)自适应调整解耦策略,超越了以往静态步间解耦方法的局限。整体实现了计算资源分配与视频质量的精细化平衡。
- OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data
- 赛道归属: 视频生成 / 多模态条件驱动舞蹈视频生成(Multimodal-Conditioned Dance Video Generation)
- 核心创新点: OmniDance 从数据与方法两个维度同时突破了音乐驱动舞蹈视频生成的瓶颈。在数据层面,构建了 CIPE-Dance 大规模互联网舞蹈视频数据集,填补了该领域高质量大规模数据的空白。在方法层面,提出了将音乐作为互补条件信号融入视频生成基础模型的原则性框架,创新性地设计了多模态条件注入机制,使音乐节拍、情感等信息与人体动作在时序上实现精确对齐,同时保持高视觉保真度。该工作的核心贡献在于将通用视频生成基础模型与特定领域多模态条件(音乐+姿态)进行系统性整合,为音乐驱动的人体运动合成建立了可扩展的新基准。
- Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control
- 赛道归属: 视频生成(自回归视频生成 / 可控视频生成)
- 核心创新点: 该工作针对自回归视频生成在长时序展开中存在的误差累积与时序退化问题,提出了一种融合人体运动与相机轨迹的异构复合控制框架。核心技术突破体现在以下几个方面:①设计了一种能够同时建模人体动作控制信号与相机运动轨迹的联合条件注入机制,解决了两类异构控制信号相互干扰、破坏预训练视频先验的问题;②针对自回归生成的长程稳定性,提出了有效抑制误差累积的架构设计,使模型在长时序rollout中保持视频质量;③在保证可控性的同时实现了快速自回归生成,在速度与质量之间取得了更优的平衡。整体方法为构建可交互、可控的世界模型提供了可扩展的技术路径。
- Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation 🆕NEW
- 赛道归属: 视频生成(交互式自回归视频生成)
- 核心创新点: 提出"Delta Forcing"方法,通过信任域引导(Trust Region Steering)机制解决交互式自回归视频生成中反应性与稳定性之间的核心矛盾。核心创新在于将用户交互信号转化为对自回归生成过程的增量式约束(delta forcing),在保证模型对新事件条件快速响应的同时,通过信任域限制防止生成轨迹大幅偏离,从而在长时序上维持时间连贯性,无需重新蒸馏或大规模微调现有模型。
- Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation 🆕NEW
- 赛道归属: 音视频联合生成(Human-Centric Audio-Video Generation)
- 核心创新点: 提出Unison统一生成框架,核心创新在于显式建模人体动作、语音和环境音效三种异质模态之间的时序对齐关系。针对这三种模态在时间特性上的内在差异(如语音的音素级精细对齐、肢体动作的节律性、音效的事件触发性),Unison通过统一的跨模态协同机制同步驱动多模态生成,从根本上解决了现有方法中音视频模态不一致、对齐错位的问题,实现以人为中心的高度同步音视频内容生成。
GitHub
- [2026-07-07] hao-ai-lab/FastVideo ⭐3802
- [2026-07-06] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1509
- [2026-07-06] wordghost1234/agnes-ai-storyboard-studio ⭐152
- [2026-07-06] guaardvark/guaardvark ⭐120
- [2026-07-06] heygen-com/heygen-cli ⭐85
音频生成
arXiv
- Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
- 赛道归属: 视频生成音频(Video-to-Audio Generation)
- 核心创新点: 受传统拟音(Foley)工作流启发,提出一种逐步式视频转音频生成框架。核心突破在于:将多音效合成问题分解为多个独立的"负引导V2A"步骤——每一步生成新的互补音效时,通过负向音频引导(Negative Audio Guidance)机制主动抑制已生成声音的重复,从而实现增量式、可控的多声音事件合成;该方法无需昂贵的多参考视频-音频配对数据集,显著降低了数据依赖,同时给予用户对各音效生成顺序与内容的细粒度控制能力。
- A Geometric Perspective on Composable Emotion Steering in Text-to-Speech Models
- 赛道归属: 文本转语音(TTS)/ 情感可控语音合成
- 核心创新点: 该工作从几何视角首次系统比较了语音语言模型(SLM)模块与条件流匹配(CFM)模块作为激活引导位点(activation steering sites)在混合情感语音合成中的特性差异。核心方法论突破体现在三个层面:① 利用线性探测(linear probing)与局部内在维度(Local Intrinsic Dimensionality, LID)对两类模块中的情感表征进行几何结构量化分析;② 将情感控制问题形式化为激活空间中的向量引导问题,揭示不同模块的情感表征可组合性(composability)与可操控性(steerability)之间的几何关联;③ 通过对比研究为混合TTS系统中情感模块的设计选择提供了可解释的几何依据,而非依赖经验性的黑箱调参。
- Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation
- 赛道归属: 语音合成评估(TTS Evaluation)
- 核心创新点: 针对TTS评估中"自然度"与"适切性"指标的内涵分歧问题,提出跨领域双维度评估框架。核心突破在于:系统性地区分了"类人程度(Human-likeness)"与"上下文适切性(Appropriateness)"两个独立维度,并在AI助手、朗读者、演员、动画角色、自发说话者五个不同应用域上对五个SOTA TTS系统进行对比评测,实证揭示了"自然"不等于"适切"——同一系统在不同下游场景下的适切性感知存在显著差异。该工作为TTS评估体系从单一自然度向多域适切性转型提供了重要的实证基础。
- SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation
- 赛道归属: 文本生成音频(Text-to-Audio Generation / 扩散模型推理加速)
- 核心创新点: 提出SwiftAudio,一个无需音频数据的一步式文本转音频蒸馏框架。核心突破在于:首次将变分得分蒸馏(Variational Score Distillation, VSD)引入TTA领域,仅依赖文本描述(caption)即可从预训练扩散教师模型中完成知识蒸馏,彻底摆脱了现有一步式方法对文本-音频配对数据的依赖。该方法在大幅压缩推理步骤(多步→单步)的同时,通过纯文本驱动的蒸馏策略保持了合成质量,在数据效率与推理速度之间取得了显著突破。
- HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech
- 赛道归属: 情感语音合成 / 文本转语音(Emotional TTS)
- 核心创新点: 针对基于大语言模型的TTS系统在情感表达上的局限性,该工作提出了HPRO(分层渐进式奖励优化)框架,核心突破体现在两个层面:
- 解耦潜空间设计:将内容信息与情感信息从共享隐空间中分离,解决了传统偏好优化中内容梯度与情感梯度相互冲突(reward hacking)的结构性问题;
- 分层渐进式偏好优化策略:通过从粗粒度到细粒度的渐进式偏好提取与奖励建模,逐层对情感韵律进行精细化优化,突破了标准SFT范式导致模型收敛于统计均值韵律的瓶颈,显著提升情感表现力。整体方案将偏好驱动学习与层次化情感表征深度结合,为情感TTS的强化学习对齐提供了新范式。
- Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS
- 赛道归属: 文本转语音(TTS)/ 基于流匹配的零样本语音合成引导策略
- 核心创新点: 针对流匹配(Flow-Matching)零样本 TTS 中分类器自由引导(CFG)的局限,提出联合残差重加权(Joint Residual Reweighting)方法。创新之处在于重新审视独立遮蔽条件下的 CFG 机制,通过对文本条件与说话人条件的残差项进行解耦重加权,突破了现有分支选择性引导方法在"文本正确性"与"说话人相似度"之间的权衡困境,实现两者的协同提升。
- ZEBRA: Zero-Shot Entropy-Regularized Prompt Learning for Base-to-Novel Generalization in Audio-Language Models 🆕NEW
- 赛道归属: 音频-语言模型 / 零样本泛化 / 提示学习
- 核心创新点: 针对音频-语言模型(ALMs)中提示学习导致的"基础类-新类泛化差距"问题,提出 ZEBRA 框架。核心方法是将熵正则化引入提示学习优化目标,通过约束模型在新类上的预测熵来防止过拟合基础类,从而在少样本有监督适配提升基础类精度的同时,保持甚至提升对新类的零样本泛化能力。这一设计避免了传统提示学习中"基础类增益 vs 新类退化"的内在矛盾。
- BP-TTA: Balanced and Prototype-Guided Test-Time Adaptation in Dynamic Scenarios 🆕NEW
- 赛道归属: 测试时自适应(TTA)/ 领域自适应 / 动态场景
- 核心创新点: 提出 BP-TTA 框架,专门解决真实世界 TTA 场景中类别不平衡与持续域偏移同时存在且相互耦合的问题(现有方法仅处理其一)。核心创新在于两个机制的协同:一是平衡策略,动态修正测试流中类别频率偏差对模型更新的干扰;二是原型引导机制,维护并动态更新每类的特征原型,以稳健的类中心替代噪声伪标签,从而在连续域漂移下实现更可靠的在线自适应。
- Beyond Binary Instrument QA: Probing Instrument Grounding in Music Audio-Language Models 🆕NEW
- 赛道归属: 音乐音频-语言模型 / 评测基准 / 乐器感知理解
- 核心创新点: 针对现有乐器问答基准可能存在的"捷径学习"问题,基于 OpenMIC 数据集构建了一套多维度诊断性评测基准序列。创新性地将简单二分类乐器存在性 QA 扩展为四个递进难度维度:减少流派先验偏差的样本、易混淆乐器辨别、长音频上下文理解、以及时序定位,系统性地探测模型是否具备真实的音频接地能力,而非依赖统计偏差,为评估音乐 ALM 的鲁棒性提供了更精细的诊断工具。
- MAGE: Modality-Agnostic Music Generation and Target-Source Extraction 🆕NEW
- 赛道归属: 音频生成 / 音乐生成 / 多模态音源分离
- 核心创新点: 提出 MAGE 统一框架,打破现有系统"要么生成、要么分离"的单任务设计局限。核心创新在于模态无关的条件机制:将文本、视觉、参考混合音频等异构条件输入统一编码并灵活组合,使同一模型能够在多种输入模态组合下无缝切换音乐生成与目标源提取两种任务模式。这种设计实现了生成与分离任务的参数共享与联合优化,显著提升了模型在真实多模态输入场景下的适用性。
GitHub
- [2026-07-06] huggingface/diffusers ⭐33999
- [2026-07-02] Stability-AI/stable-audio-tools ⭐3811
- [2026-07-06] BinWang28/audio-ai-hub ⭐937
- [2026-07-06] Ameobea/web-synth ⭐561
- [2026-07-06] dgrauet/ltx-2-mlx ⭐71
语言大模型
arXiv
- Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety
- 赛道归属: LLM安全与对抗防御(Adversarial Safety / AI Safety)
- 核心创新点: 提出了一种以"对抗性视角"为核心的LLM安全框架Yuvion,核心突破在于将安全问题重新定义为对抗性问题而非单纯的自然输入分布问题。该工作明确指出现有通用模型在涉及规划、工具调用等真实场景下的安全防护缺口,并通过构建对抗感知能力来应对策略性越狱与滥用攻击,而非仅依赖传统的过滤或拒绝机制。
- Online Data Selection for Instruction Tuning via Gaussian Processes
- 赛道归属: 指令微调 / 数据选择与质量优化(Instruction Tuning / Data Selection)
- 核心创新点: 提出GAIA框架,将数据价值评估从局部批次优化升级为全局估计过程。核心方法是引入高斯过程(Gaussian Processes)对数据效用进行全局建模,突破了现有在线数据选择方法"批次受限"的瓶颈,实现了跨批次的全局自适应指令微调数据筛选,从根本上改变了LLM训练中数据价值评估的范式。
- Search for Truth from Reasoning: A Dynamic Representation Editing Framework for Steering LLM Trajectories
- 赛道归属: 推理优化 / 表征编辑(Reasoning Optimization / Representation Editing)
- 核心创新点: 提出动态表征编辑框架,针对LLM推理轨迹中"真值"的几何结构进行深入分析,揭示了三项关键规律。与静态表征编辑(RepE)不同,该方法将内在控制机制动态注入展开中的推理链,能够在推理过程中实时引导模型向"真值"方向收敛,而非仅仅让模型"思考更多",从根本上解决了CoT等方法缺乏真值导向的问题。
- Optimal Self-Consistency for Efficient Reasoning with Large Language Models
- 赛道归属: 推理优化 / 测试时计算效率(Test-Time Compute Efficiency)
- 核心创新点: 针对自洽性(Self-Consistency)推理方法在大规模数据集上计算成本过高的问题,本文从理论层面建立了统一的最优自洽性框架。核心突破在于将多次采样的答案聚合过程形式化为经验众数估计问题,并推导出最优采样数量的理论界,从而在保持性能的前提下大幅减少不必要的采样次数,实现自适应的高效推理。
- Conversable Complexity: Agentic LLM Collectives as Interpretable Substrates
- 赛道归属: 多智能体系统 / LLM集体涌现行为与可解释性研究
- 核心创新点: 提出将LLM群体(Agentic LLM Collectives)作为"可对话的复杂系统基底"这一新框架,核心突破在于将复杂性与可解释性统一——单个LLM是静态工件,缺乏涌现特性,而通过多LLM交互构成的群体系统能够涌现出类似生命系统的复杂动态行为,同时因LLM天然具备语言表达能力,该系统可被直接"询问"以实现内在可解释性。突破了传统复杂系统"复杂则不透明"的二元对立困境。
- Persona Non Grata: LLM Persona-Driven Generations in MCQA are Unstable in Distinct Dimensions
- 赛道归属: LLM行为一致性与人格驱动生成稳定性分析
- 核心创新点: 针对LLM人格驱动生成(PDG)在多项选择题回答(MCQA)这类非自由文本输出场景中的稳定性问题,系统性地拆解出"不稳定性的多维度"这一核心发现。区别于以往仅关注对话等自由文本的人格一致性研究,本工作首次在MCQA场景下量化分析人格表达的不稳定性来源与维度差异,填补了结构化输出场景下人格一致性评估的研究空白。
- Real-Time Hard Negative Sampling via LLM-based Clustering for Large-Scale Two-Tower Retrieval
- 赛道归属: 推荐系统 / 双塔模型负样本采样优化
- 核心创新点: 提出基于LLM聚类的实时硬负样本采样方法,核心创新在于将LLM的语义理解能力引入双塔召回模型的训练流程:利用LLM对样本进行语义聚类,实时动态地从语义相近但标签为负的样本中构造高质量硬负样本,克服了传统in-batch和out-of-batch方法只能产生"简单负样本"的根本缺陷,以自监督方式显著提升大规模检索阶段模型的判别能力。
- SkillSelect-Serve: Budget-Controllable and QoS-Aware Skill Service Recommendation and Composition for Small LLM Agents
- 赛道归属: LLM智能体 / 技能服务推荐与组合优化
- 核心创新点: 提出SkillSelect-Serve框架,将LLM智能体的技能选择问题重新建模为"技能服务推荐与组合"问题,核心创新有三:①将原始技能封装为结构化"技能服务"(包含功能描述、依赖关系、上下文约束);②引入预算可控机制,使智能体在资源约束下动态调整技能调用策略;③融入QoS感知(服务质量感知)维度,超越了传统将技能视为可检索文档并返回固定Top-K列表的局限,实现了面向小型LLM智能体的高效、可控技能编排。
- RAISE: LLM-based Automated Heuristic Design with Robust Adversary Instance Search
- 赛道归属: 自动化启发式设计 / LLM驱动的组合优化(LLM-based Automated Heuristic Design)
- 核心创新点: 现有基于LLM的自动化启发式设计(AHD)方法在训练集固定分布上优化,面对真实世界的分布偏移时性能急剧下降。本文提出RAISE框架,其核心创新在于将受约束的最坏情况对抗实例搜索嵌入启发式优化循环中——在训练分布的受限邻域内主动搜索最具挑战性的对抗样本,并以此驱动启发式鲁棒性提升,从方法论上将鲁棒优化思想引入LLM启发式设计领域。
- Cross-lingual Relation Extraction with Large Language Models: Zero-Shot, Few-Shot, and Fine-Tuned Evaluation on Romanian
- 赛道归属: 跨语言信息抽取 / 低资源NLP(Cross-lingual Relation Extraction)
- 核心创新点: 针对低资源语言(罗马尼亚语)关系抽取缺乏标注语料的瓶颈,本文创新性地结合LLM驱动的自动数据集翻译流水线与多配置评估体系(零样本、少样本、QLoRA微调),系统性地验证了跨语言迁移可行性。核心方法突破在于以LLM翻译替代人工标注,并通过与多个编码器基线的横向对比,量化分析了不同适配策略在低资源跨语言场景下的性能边界。
GitHub
- [2026-07-07] sgl-project/sglang ⭐30004
- [2026-07-07] google-ai-edge/LiteRT-LM ⭐5790
- [2026-07-07] huhusmang/Awesome-LLMs-for-Vulnerability-Detection ⭐1113 🆕NEW
- [2026-07-07] openJiuwen-ai/jiuwenswarm ⭐994 🆕NEW
- [2026-07-07] wonglaitung/fortune ⭐58
HuggingFace Models
HuggingFace Datasets
- [2026-06-29] Glint-Research/Fable-5-traces
- [2026-06-21] Crownelius/Complete-FABLE.5-traces-2M
HuggingFace Spaces
多模态大模型
arXiv
- DataComp-VLM: Improved Open Datasets for Vision-Language Models
- 赛道归属: 多模态理解 / 数据工程与基准测试(Data-Centric VLM Benchmarking)
- 核心创新点: 提出首个系统性的视觉-语言模型数据配方基准 DCVLM,整合了160个数据集(涵盖图文对、多模态交错文档、纯文本及指令微调数据)构成6T规模语料库,将数据筛选策略的评估标准化,填补了社区在VLM训练数据系统性比较研究上的空白。其核心突破在于将"以数据为中心"的实验范式引入VLM领域,使研究者能够在受控条件下对比不同数据策略的效果,而非依赖模型架构变化来解释性能差异。
- VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models
- 赛道归属: 多模态理解 / 计算光学与视觉语言模型协同设计(Meta-Optic Co-design for VLM)
- 核心创新点: 提出 CODA 协同设计框架,针对冻结(frozen)视觉语言模型的特性,将前端元光学(meta-optic)硬件设计与 VLM 的感知偏好联合优化,而非追求传统人类可读的图像质量指标。核心突破在于:以 VLM 的任务性能(而非图像分辨率/像差等光学指标)作为优化目标,使紧凑型元光学在尺寸/成本受限场景下仍能维持高效的多模态理解能力,打通了物理光学设计与AI模型感知之间的优化闭环。
- RiverONE: Generating Knowledge-Intensive VLM by Simulated Quantum Machines
- 赛道归属: 多模态理解 / 轻量化模型与量子启发参数生成(Quantum-Inspired Compact VLM)
- 核心创新点: 提出 RiverONE,利用模拟量子计算(而非真实量子硬件)在模型构建阶段生成结构化参数,将量子叠加、纠缠和测量诱导的非线性特征引入经典神经网络的权重初始化或参数生成过程,从而构建知识密集型轻量视觉-语言模型。核心创新在于将量子计算的高维信息表示能力以"软件模拟"形式移植至经典AI系统参数设计中,为紧凑型VLM提供了一种全新的参数来源范式。
- LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving
- 赛道归属: 自动驾驶 / 多模态规划(VLM-Based Autonomous Driving Planning)
- 核心创新点: 提出 LWDrive 框架,通过逐层世界模型引导机制将 VLM 输出的粗粒度语义驾驶意图逐步细化为几何精确、具有未来感知能力和多视角一致性的轨迹规划。其核心突破在于打通 VLM 语义层与底层运动规划层之间的鸿沟——不再将 VLM 输出直接用作最终轨迹,而是将其作为世界模型各层的条件信号,实现语义理解与物理可行性的分层对齐。
- Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models
- 赛道归属: 多模态理解 / 模型评估与美学推理(MLLM Evaluation & Aesthetic Reasoning)
- 核心创新点: 针对开放式美学评论任务提出新的评估范式,突破了传统数值评分对齐方式的局限,转而将 MLLM 生成的评论与多个经人工排序的参考评论进行比对,使用 Reddit Photo Critique 数据集对五个开源 MLLM 进行评测。核心创新在于将"排名人类参考"引入美学评估,构建了更贴近真实人类批评行为的评判标准,为衡量模型在无唯一正确答案的主观推理任务上的能力提供了方法论参考。
- Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages
- 赛道归属: 多模态安全 / 内容审核与对抗鲁棒性(VLM Safety & Jailbreak Detection)
- 核心创新点: 系统性研究图像分辨率对 VLM 检测 ASCII 艺术形式有害内容的影响,覆盖八种字符构造模式(L1–L8,从密集块字符到词嵌入设计)及多语言场景,揭示了分辨率阈值与检测能力之间的定量关系。核心创新在于将分辨率作为核心变量引入 VLM 安全评估体系,首次量化了视觉编码的有害信息在不同渲染精度下对主流 VLM 内容审核能力的系统性威胁边界,为实际部署中的防御策略提供了可操作的技术依据。
- Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models
- 赛道归属: 多模态理解 / 视觉语言模型机制可解释性(VLM Mechanistic Interpretability)
- 核心创新点: 针对视觉语言模型中"视觉感知"与"先验知识"发生冲突时的决策机制,首次提出组件级因果分析方法,综合运用残差流、注意力头、MLP 子层三个粒度的激活修补(activation patching)与模型组件消融实验。核心发现是跨三个 VLM 家族均存在"视觉默认、先验覆盖"的层次化因果机制——模型默认优先处理视觉输入,但特定组件可触发先验知识对视觉证据的覆盖。该工作将行为层面的冲突描述推进至可追溯的内部因果机制层面,为提升多模态系统可靠性提供了可操作的机制洞察。
- Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception 🆕NEW
- 赛道归属: 多模态理解 / 视觉-语言模型感知能力评估
- 核心创新点: 通过系统性心理物理学对照实验,揭示了VLMs在纹理诱导表面倾斜感知任务上的根本性缺陷——模型输出呈现"锚点化"离散预测(集中于少数固定角度如0°、±25°),而非人类视觉系统所表现出的连续、渐变式偏差。这一发现从机制层面区分了VLMs与无监督CNN、有监督CNN在视觉感知上的本质差异,挑战了"VLMs具备类人感知能力"的普遍假设,为多模态模型的视觉理解能力边界提供了新的诊断维度。
- An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 医疗视频(手术视频)视觉-语言数据集构建
- 核心创新点: 针对手术视频数据集在细粒度时空动态标注上的缺失问题,提出了一套自动化数据集增强方法,通过构建交错式空间-时间关系的标注流程,系统性地捕捉手术操作中的复杂动作序列与器械-组织交互关系。核心突破在于以低成本、低错误率的方式替代昂贵人工标注,生成具备精细时空对齐的视觉-语言训练数据,从而为手术场景下VLMs的评估与训练提供更高质量的基准数据支撑。
- IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models 🆕NEW
- 赛道归属: 推理优化 / 大视觉语言模型Token剪枝加速
- 核心创新点: 从注意力机制的对偶形式视角出发,将Token剪枝重新表述为隐式权重剪枝问题——即通过分析注意力的等价线性层形式,将视觉Token的重要性评估转化为对该隐式权重矩阵的结构化稀疏化操作。该方法无需额外训练(training-free),在理论层面弥补了现有Token剪枝方法缺乏内在机制解释的不足,同时提供了一种更具原理性的Token保留/丢弃判据,相比纯经验性方法在效率与性能平衡上具有更坚实的理论基础。
GitHub
- [2026-07-06] Blaizzy/mlx-vlm ⭐5124
- [2026-07-01] EvolvingLMMs-Lab/NEO ⭐861
- [2026-07-03] zli12321/Vision-Language-Models-Overview ⭐649
- [2026-07-06] jamjamjon/usls ⭐427 🆕NEW
- [2026-07-06] ZjjConan/VLM-MMA ⭐100 🆕NEW
HuggingFace Models
强化学习
arXiv
- RoAd-RL: A Unified Library and Benchmark for Robust Adversarial Reinforcement Learning
- 赛道归属: 对抗鲁棒性强化学习 / Adversarial Robust Reinforcement Learning
- 核心创新点: RoAd-RL 提出了一个统一的开源对抗强化学习基准框架,核心突破在于:通过标准化抽象层统一了策略、攻击者和环境的接口,解决了现有研究中实现碎片化、评估协议不一致和可复现性差的问题。该框架将多种主流对抗攻击方法与鲁棒训练算法整合至单一平台,并建立了一致的评估协议,使不同方法之间的横向比较成为可能,推动了对抗RL研究的标准化与可重复性。
- FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
- 赛道归属: 大语言模型强化学习对齐 / LLM RL Alignment
- 核心创新点: 针对GRPO等策略梯度方法在训练中梯度方向不稳定的问题,提出反馈驱动的双目标协同强化学习框架(FBOS-RL)。核心突破在于同时优化策略目标与反馈信号目标,通过双目标协同机制动态校正梯度方向,避免单一奖励信号导致的训练偏移,从而更稳定地解锁大模型推理能力。
- Qwen-Image-2.0-RL Technical Report
- 赛道归属: 文生图 / RLHF后训练优化
- 核心创新点: 针对扩散模型的后训练流水线,创新性地将RLHF与在策略蒸馏(OPD)结合,构建任务特定的复合奖励模型,引入基于视觉语言模型微调的逐点打分范式(pointwise scoring)与链式思维推理(Chain-of-Thought),从而为文生图任务提供更可靠的奖励信号,同步提升视觉质量与指令遵循能力。
- Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training
- 赛道归属: 大语言模型后训练 / 强化学习效率优化(LLM Post-Training / RL Efficiency Optimization)
- 核心创新点: 本文系统性地研究了强化学习后训练中各Transformer层的贡献差异,挑战了"全参数均匀更新"的传统假设。核心发现是:仅训练单个Transformer层即可匹配全参数RL训练的性能,揭示了RL适应过程在层间分布高度不均的规律。该工作通过逐层消融实验定位出对RL增益贡献最关键的层,为高效参数化RL训练提供了理论依据,大幅降低了LLM后训练的计算开销,同时揭示了Transformer层在RL后训练中功能专业化的内在机制。
- From Pixels to Temporal Correlations: Learning Informative Representations for Reinforcement Learning Pre-training
- 赛道归属: 强化学习预训练 / 视觉表征学习(RL Pre-training / Visual Representation Learning)
- 核心创新点: 针对现有基于无监督视频预训练的RL表征方法过度保留像素空间中大量静态信息、忽视小但关键的动态信息的问题,本文提出了一种从像素到时序相关性的表征学习框架。核心创新在于引入了时序相关性预测目标,驱动模型捕获跨帧的动态变化模式而非静态背景冗余,从而在无动作标注的大规模互联网视频上学习到对RL任务更具信息量的紧凑表征。该方法有效提升了RL的样本效率与策略性能,尤其在需要感知细粒度运动信号的任务中表现突出。
- Flow-Map GRPO: Reinforcement Learning for Few-Step Flow-Map Generators via Anchored Stochastic Composition
- 赛道归属: 文生图 / 少步生成模型强化学习后训练(Text-to-Image / RL Post-Training for Few-Step Generative Models)
- 核心创新点: 本文针对一致性模型(Consistency Models)和MeanFlow等少步Flow-Map生成器确定性采样导致无法直接用于RL后训练的核心痛点,提出了Flow-Map GRPO方法。核心技术突破包括两点:① 提出锚定随机组合(Anchored Stochastic Composition)策略,通过在确定性flow-map上叠加可控随机扰动,构造出具有良好定义似然比的随机轨迹,使GRPO等基于策略梯度的RL算法得以适用;② 将该随机化机制与GRPO目标有机融合,实现了在保持少步采样加速优势的同时,利用RL奖励信号对模型进行偏好对齐优化。该方法填补了少步确定性生成模型与RL后训练范式之间的技术鸿沟。
- Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models
- 赛道归属: 具身智能 / 视觉-语言-动作模型强化学习后训练(VLA RL Post-Training)
- 核心创新点: 提出Z-1框架,专为基于流(Flow-based)的VLA模型设计RL后训练方案。核心突破在于:(1)将连续动作流的生成过程与RL奖励信号对接,解决了传统行为克隆无法从自身失败中学习的根本缺陷;(2)通过高效的RL后训练范式,在不依赖新增演示数据的情况下显著提升机器人操控策略的泛化能力和鲁棒性,为流式VLA模型引入了在线自我改进机制。
- Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning
- 赛道归属: 多模态理解 / 医学视觉问答与推理优化(Medical VLM Reasoning)
- 核心创新点: 提出双流强化学习框架(Dual-Stream RL),联合优化视觉Token稀疏化(VTP)与医学多模态推理两个任务。核心方法突破在于:识别到医学图像中有效视觉证据极度稀疏的特点,通过主动剪枝接地区域之外的视觉Token来强化临床推理质量;在统一的RL框架下,将视觉定位与语言推理解耦为双流结构,首次实现了自适应Token压缩与推理增强的协同训练,显著降低计算冗余的同时提升了医学诊断推理准确性。
- Stage-Transition Dense Reward Modeling for Reinforcement Learning
- 赛道归属: 具身智能 / 长时序机器人操控稠密奖励学习(Dense Reward Learning for Robotic RL)
- 核心创新点: 提出STDR(Stage-Transition Dense Reward)框架,核心创新在于:从无结构的专家视频中自动推断任务的阶段结构,并将阶段转换事件转化为逻辑一致的稠密奖励信号,无需人工设计奖励函数。方法上利用视觉语义理解自动识别任务关键阶段边界,将稀疏终止奖励转化为阶段级稠密监督,从根本上解决了长时序操控任务中奖励稀疏和延迟的核心挑战,且对环境变化和物体配置变化具备更强的泛化能力。
- Deep Reinforcement Learning for Spacecraft Attitude Control During Atmospheric Re-Entry
- 赛道归属: 航空航天控制 / 深度强化学习姿态控制(Spacecraft Attitude Control via DRL)
- 核心创新点: 将深度强化学习应用于航天器大气再入姿态控制这一高度非线性、强不确定性的安全关键场景。核心贡献在于:(1)以工业级增益调度PID控制器作为强基线,系统性地评估无模型RL与混合控制器(RL+传统控制结合)的性能边界;(2)探索了混合控制架构,将RL的自适应决策能力与传统控制器的稳定性保障相结合,为极端动力学条件下(高温、气动扰动、系统故障)的鲁棒姿态控制提供了新的技术路径。
GitHub
- [2026-07-06] Unity-Technologies/ml-agents ⭐19538
- [2026-07-06] huggingface/trl ⭐18782
- [2026-07-06] Farama-Foundation/PettingZoo ⭐3463
- [2026-07-07] Tencent-Hunyuan/UniRL ⭐769
- [2026-07-06] utilForever/baba-is-auto ⭐188
HuggingFace Models
HuggingFace Datasets
- [2025-01-15] mlabonne/open-perfectblend
- [2026-06-29] bcbl190626/SpanishBCBL
- [2026-07-05] ByteDance-Seed/EdgeBench
世界动作模型
arXiv
- ABot-M0.5: Unified Mobility-and-Manipulation World Action Model
- 赛道归属: 具身智能 / 移动操作世界动作模型(World Action Model for Mobile Manipulation)
- 核心创新点: 针对移动操作任务中现有WAM方法的三大结构性缺陷(粗粒度视频块处理、导航-操作动作耦合建模、逆动力学监督与自回归推理不匹配),ABot-M0.5提出了统一的移动操作世界动作模型框架。核心突破包括:① 以细粒度帧级别取代粗粒度视频块进行时序建模;② 将导航与操作动作解耦,分别建模以适配两类任务的异质性结构;③ 重新对齐逆动力学训练目标与自回归推理范式,使模型在推理阶段的动作生成更加一致。该工作将反应式VLA策略提升为具备显式世界建模能力的统一框架,实现对移动操作全流程的端到端动作预测。
- Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation
- 赛道归属: 具身导航 / 世界动作模型 / 空间感知规划
- 核心创新点: 现有基于世界模型的视觉导航规划器通常采用"验证中心范式",将目标意图与轨迹合成解耦,导致候选依赖、计算开销大、采样动作与预测视觉不一致等问题。本文提出 SWAM(空间感知世界动作模型),核心创新在于:
- 任务中心式联合生成框架:将观测(Observation)与动作(Action)的生成统一建模,在给定起始与目标 RGB 观测后,同步生成导航动作序列与中间视觉帧,彻底摆脱对候选集的依赖;
- 空间感知能力嵌入:在世界模型中显式引入空间感知模块,增强模型对三维场景结构的理解,使预测的视觉观测与动作保持几何一致性;
- 范式转变:从"先采样后验证"的两阶段解耦范式,转变为端到端的联合推断范式,有效降低计算开销并提升动作预测的可靠性。
- ReWorld: Learning Better Representations for World Action Models
- 赛道归属: 自动驾驶世界模型 / World Action Model for Autonomous Driving
- 核心创新点: 现有世界动作模型(WAMs)的研究主要集中于模型架构设计,而如何让模型高效学习更优质的世界表征以服务于规划任务,仍是一个待解决的问题。本文提出 ReWorld,这是首个专门面向自动驾驶世界动作模型的表征学习框架。其核心创新在于:突破了传统WAM仅依赖标准视频预测监督信号(即像素级重建损失)的局限,通过引入专门设计的表征学习目标(Representation Learning objectives),引导模型在训练过程中学习到更具语义性、结构性的世界状态表征,而非仅仅优化视觉保真度。这一框架与模型架构无关,具备良好的通用性,可作为现有WAM方法的即插即用增强模块,显著提升其用于规划时的表征质量。
- From World Models to World Action Models: A Concise Tutorial for Robotics
- 赛道归属: 具身智能 / 世界模型综述与设计空间分析(World Model Survey & Design Space for Robotics)
- 核心创新点: 本文以教程形式对机器人领域的世界模型研究进行系统性梳理,核心贡献在于提出了一套统一的"设计空间视图"(Design-Space View)分析框架。将世界模型统一定义为"动作条件化的预测模型"(action-conditioned predictive models),并按建模空间将其划分为观测空间世界模型(Observation-Space)与状态空间世界模型(State-Space)两大类,从视觉保真度、空间结构性、物理可解释性和计算效率等维度系统比较其权衡关系。进一步厘清了"世界模型"与"世界动作模型(WAM)"之间的概念边界,填补了跨社区之间概念模糊的空白,为后续研究提供了清晰的方法论参照。
GitHub
- [2026-07-03] OpenMOSS/Awesome-WAM ⭐1039
- [2026-07-06] shaohua-pan/StarWAM ⭐83 🆕NEW
- [2026-07-06] serene-sivy/AHA-WAM ⭐61
- [2026-07-03] youngzhou1999/DriveDreamer-Policy ⭐52
由 Research Daily 自动生成 生成时间: 2026-07-07 01:46:17