AI 每日进展速报 - 2026-07-04
图像生成/编辑
arXiv
- IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation
- 赛道归属: 文生图(结构可控生成 / 规划-渲染解耦)
- 核心创新点: 提出“隐式视觉思维链”作为潜空间的结构规划机制,将对象数量、空间关系、属性绑定与布局等“结构性意图”从外观渲染中解耦:先在潜变量中形成可组合的结构计划,再驱动后续生成以提升结构遵循能力;通过把结构推理从单一条件流的纠缠中分离,显著改善复杂结构提示下的可控性与一致性。
- UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios
- 赛道归属: 文生图 / 高分辨率生成 / 数据-模型协同设计
- 核心创新点: UltraFlux 针对将扩散Transformer扩展至原生4K分辨率时暴露的多因素耦合失效问题(位置编码、VAE压缩、优化策略),提出数据-模型协同设计范式,而非孤立解决单一瓶颈。核心贡献包括:(1)构建 MultiAspect-4K-1M 数据集,包含100万张多宽高比4K图像,从数据源头支撑多长宽比原生训练;(2)在 Flux-based DiT 架构上系统性地重新设计位置编码以适应极端宽高比与超高分辨率,同时改进VAE压缩策略以保留4K细节;(3)协同优化训练目标,使模型能够在多种宽高比下原生生成高保真4K图像,而非通过超分辨率后处理实现。整体方案证明了高分辨率多宽高比生成需要数据与模型层面的联合突破,任何单点优化均无法充分释放质量潜力。
- Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment
- 赛道归属: 文生图 / 语义对齐增强
- 核心创新点: 针对文生图模型中"唯一性对象"(如天体、地标、艺术品)受到强视觉先验干扰、导致概念关联偏差的问题,提出引入中间文本表示作为引导信号。核心思路是在生成过程中插入一个结构化的中间语义层,将原始提示词解耦为更精确的语义描述,从而绕过模型内化的视觉偏见,强化"一对一"对象的忠实渲染,而无需重新训练模型。
- Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation
- 赛道归属: 文生图 / 提示词重写与增强 / 视觉锚定对齐
- 核心创新点: FaithRewriter 针对现有提示词重写方法缺乏视觉基础导致"过度推断"从而引入意图偏差的问题,提出以视觉锚点驱动提示词增强的新框架。核心创新在于:(1)在重写过程中引入视觉锚定机制,通过实际生成的或参考的视觉信号对重写内容进行约束与校验,而非纯粹依赖语言模型对文本的主观扩充,从而将"看见的内容"与"重写的描述"对齐;(2)构建对齐反馈回路,使重写后的提示词能够忠实反映用户的真实意图而非模型的想象性补全,有效缩小意图-生成鸿沟;(3)该框架可与现有T2I模型无缝结合,在不修改生成模型本身的前提下通过更精准的提示词提升生成结果与用户意图的一致性。
- DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation
- 赛道归属: 文生图 / 主体驱动文本生成图像评估基准
- 核心创新点: 提出DSH-Bench评测基准,核心贡献在于三个维度的系统性突破:① 构建了具有层次化主体分类体系的多样化主体图像集,覆盖更广泛的主体类别;② 引入难度感知机制,将主体图像按难度分级,实现对模型在不同难度主体上性能的细粒度区分;③ 设计场景感知评估框架,针对不同提示场景进行针对性评测,从而弥补现有基准在多样性、细粒度和场景覆盖方面的不足。
- RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
- 赛道归属: 文生图 / 强化学习对齐
- 核心创新点: 提出 RubricRL 框架,核心突破在于用"评分标准"替代传统单一标量奖励或复合指标加权求和的方式来设计强化学习奖励信号。该方法通过将生成目标分解为可解释的、细粒度的评估维度,利用大模型或规则生成结构化评分,从而在保持灵活性的同时提升了奖励的可解释性和泛化性,避免了固定权重复合指标和人类偏好蒸馏模型的局限性。
- Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
- 赛道归属: 文生图 / 布局条件自回归图像生成
- 核心创新点: 提出SMARLI框架,针对自回归模型在布局条件生成中面临的稀疏条件利用不足与特征纠缠两大难题,提出结构化掩码机制作为核心技术手段。该方法通过设计专用的掩码策略,将空间布局约束显式地融入自回归生成过程,在不破坏AR模型原有序列生成范式的前提下,实现对图像中不同区域的精确空间控制,从而有效避免布局信息与图像特征之间的耦合干扰,提升生成图像与用户指定布局的空间一致性。
- PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation
- 赛道归属: 文生图安全(越狱评测 / 基准与复现管线)
- 核心创新点: 将T2I越狱从“单提示评测”提升为“端到端管线评测”,提出可自演化的 paper-to-pipeline 复现框架 PixJail:覆盖提示改写/攻击、图像生成、安全过滤、多模态裁判等多阶段,并把论文方法自动化落地为可运行管线以提升可复现性与可比性;核心突破在于用标准化、可扩展的管线级协议刻画越狱效果与防护强度,而非孤立的prompt成功率。
- SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion
- 赛道归属: 文生图基础模型 / 扩散模型训练加速
- 核心创新点: 提出 SeFi-Image,核心创新是"语义优先扩散"这一新型潜在扩散建模范式。与传统扩散模型将语义信息视为条件输入不同,该范式将语义结构的学习置于扩散过程的优先位置,从而利用语义引导显著加速基础模型训练。关键突破在于将此范式成功扩展至大分辨率、大规模模型(多个参数量档位),突破了以往仅在 ImageNet 等简单数据集上小模型验证的局限。
- AccelAes: Accelerating Diffusion Transformers for Training-Free Aesthetic-Enhanced Image Generation
- 赛道归属: 文生图 / 推理加速与美学增强
- 核心创新点: 观察到扩散Transformer在去噪过程中对美学相关token的注意力分布呈现空间非均匀性,美学区域具有更大的时序变化量,而非美学区域变化缓慢。据此提出AccelAes框架:针对美学token关联区域采用精细化计算,对其余区域进行缓存复用,实现训练无关的自适应稀疏注意力加速,在不牺牲美学质量的前提下显著降低DiT的推理延迟。
GitHub
- [2026-07-04] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐12743
- [2026-07-03] Yutong-Zhou-cv/Awesome-Text-to-Image ⭐2434
- [2026-07-03] AceDataCloud/Nexior ⭐376
- [2026-07-04] Asilcanasil/Hent-AI-Synthesis-Engine ⭐151
- [2026-07-03] hackclub/ai ⭐121 🆕NEW
HuggingFace Models
视频生成/编辑
arXiv
- Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation
- 赛道归属: 视频生成 / 训练优化与质量对齐
- 核心创新点: 该工作提出了一种无需外部奖励模型或人工标注的视频生成质量对齐方法——Shell-LCC。其核心洞察是:高质量训练数据的流形结构本身即隐含了奖励信号。通过显式建模高质量视频数据的流形几何结构,将数据流形作为内生奖励模型,引导扩散模型生成结果向高质量数据分布对齐。该方法规避了传统基于RLHF/DPO路线中高昂的标注成本和计算开销,同时在局部细节保真度上取得了更优的提升,为T2V生成的对齐范式提供了数据流形驱动的新思路。
- DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation
- 赛道归属: 视频生成 / 主体驱动文生视频
- 核心创新点: 提出 DomainShuttle 框架,专门针对开放域主体驱动文生视频中"跨域"场景的不足进行突破。现有方法主要聚焦于域内高保真主体重现,而 DomainShuttle 通过"域穿梭"机制,在保留主体本质特征的同时,允许与主体无关的属性(如风格、场景、外观)根据文本提示灵活变化,实现了自由形式的开放域生成能力,有效解决了跨域场景下主体特征保留与文本可控性之间的平衡难题。
- Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
- 赛道归属: 视频生成评估 / 物理合理性细粒度评测
- 核心创新点: 提出 Physics Question Scene Graph,一种基于层次化问题图的评估流水线,用于细粒度定位视频生成中的物理规律违反问题。与现有粗粒度评估方法不同,PQSG 通过构建包含物体、动作、属性及其物理关系的场景图,将物理合理性评估分解为结构化问答任务,实现了对物理违规的精准溯源与量化,填补了当前文生视频评估体系在物理合理性细粒度诊断上的空白。
- Event-Driven Video Generation
- 赛道归属: 视频生成(事件驱动/物理交互一致性)
- 核心创新点: 针对现有文生视频模型在处理局部物理交互(如接触、支撑、放置等)时产生时序错误的问题,提出事件驱动视频生成框架。核心突破在于:在标准DiT架构中引入轻量级事件感知干预机制,打破"每一步更新所有潜在区域"的默认行为,将去噪过程与文本提示中隐含的局部交互事件绑定,使模型仅在事件激活的时空区域施加集中更新,从而显著提升接触一致性、动作完整性和支撑关系的物理合理性,且对现有DiT架构兼容、改动轻量。
- GimbalDiffusion: Gravity-Aware Camera Control for Video Generation
- 赛道归属: 视频生成 / 相机运动控制
- 核心创新点: GimbalDiffusion 提出了一种基于万向节坐标系的重力感知相机控制框架,核心突破在于将相机运动分解为"绕重力轴旋转+ 横滚角"的物理直觉表示,替代了传统的相对/模糊相机轨迹编码方式。该表示天然对齐人类感知的"水平地面"先验,从根本上解决了现有方法在大角度旋转(如180°掉头、垂直俯仰)场景下几何控制精度不足的问题,使得视频生成模型能够支持精确的极端相机轨迹控制。
- Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption
- 赛道归属: 视频生成 / 自回归推理优化
- 核心创新点: 针对自回归流式视频生成中KV Cache线性增长导致的内存瓶颈问题,提出了实例特定参数吸收框架。其核心创新在于:不采用传统的"丢弃冗余KV Token"压缩策略(该策略会破坏长程依赖,导致时序闪烁和身份丢失),而是将历史KV信息以参数化方式"吸收"进模型的轻量级实例特定参数中,在压缩内存占用的同时保留长程时序一致性。该方法实现了内存效率与生成质量的双重优化,为长视频自回归生成提供了新的推理范式。
- AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
- 赛道归属: 多模态生成(音视频联合生成)
- 核心创新点: 提出AVTok,一种用于音视频整体生成的一维统一tokenization方案。区别于主流双分支设计(视觉与音频各自独立tokenize和生成),AVTok的核心突破在于:将音频与视频信号共同映射到统一的1D离散token序列空间,消除跨模态表示鸿沟,避免双分支架构带来的大量冗余计算。该统一表示使单一自回归或生成模型可以同时建模音视频的时间同步性与语义对齐关系,在大幅降低训练资源消耗的同时,实现更细粒度的音画同步与整体语义一致性。
- EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics
- 赛道归属: 视频生成 / 云边协同推理加速
- 核心创新点: EcoVideo 提出了一种基于熵编排的动态帧间解耦视频生成框架,专门针对 DiT 架构视频生成的高延迟痛点。其技术突破有三:①利用自注意力熵作为无需训练的帧级信息密度代理指标,实现自适应关键帧选取;②在云边协同架构中,高熵关键帧由云端大模型去噪,低熵非关键帧由边缘轻量模型处理,并通过跨帧特征复用减少冗余计算;③框架可根据系统动态(如带宽、负载变化)自适应调整解耦策略,超越了以往静态步间解耦方法的局限。整体实现了计算资源分配与视频质量的精细化平衡。
- OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data
- 赛道归属: 视频生成 / 多模态条件驱动舞蹈视频生成
- 核心创新点: OmniDance 从数据与方法两个维度同时突破了音乐驱动舞蹈视频生成的瓶颈。在数据层面,构建了 CIPE-Dance 大规模互联网舞蹈视频数据集,填补了该领域高质量大规模数据的空白。在方法层面,提出了将音乐作为互补条件信号融入视频生成基础模型的原则性框架,创新性地设计了多模态条件注入机制,使音乐节拍、情感等信息与人体动作在时序上实现精确对齐,同时保持高视觉保真度。该工作的核心贡献在于将通用视频生成基础模型与特定领域多模态条件(音乐+姿态)进行系统性整合,为音乐驱动的人体运动合成建立了可扩展的新基准。
- Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control
- 赛道归属: 视频生成(自回归视频生成 / 可控视频生成)
- 核心创新点: 该工作针对自回归视频生成在长时序展开中存在的误差累积与时序退化问题,提出了一种融合人体运动与相机轨迹的异构复合控制框架。核心技术突破体现在以下几个方面:①设计了一种能够同时建模人体动作控制信号与相机运动轨迹的联合条件注入机制,解决了两类异构控制信号相互干扰、破坏预训练视频先验的问题;②针对自回归生成的长程稳定性,提出了有效抑制误差累积的架构设计,使模型在长时序rollout中保持视频质量;③在保证可控性的同时实现了快速自回归生成,在速度与质量之间取得了更优的平衡。整体方法为构建可交互、可控的世界模型提供了可扩展的技术路径。
GitHub
- [2026-07-03] Anil-matcha/Open-Generative-AI ⭐22301
- [2026-07-04] hao-ai-lab/FastVideo ⭐3799
- [2026-07-03] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1489
- [2026-07-03] Anil-matcha/awesome-seedance-2.5-api-prompts ⭐227
- [2026-07-04] wordghost1234/agnes-ai-storyboard-studio ⭐152
音频生成
arXiv
- CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations
- 赛道归属: 文本转语音 / 跨语言口音强度可控语音合成
- 核心创新点: 提出 CrossAccentTTS 框架,核心突破在于对说话人身份与口音特征进行解耦表征,实现在保持说话人音色不变的前提下,独立控制目标口音类型及其强度。相比传统跨语言 TTS 系统缺乏口音显式控制的问题,该方法尤其针对低资源、音系多样的印度语系语言,提供了精细化的口音迁移与强度调节能力。
- Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
- 赛道归属: 视频生成音频
- 核心创新点: 受传统拟音工作流启发,提出一种逐步式视频转音频生成框架。核心突破在于:将多音效合成问题分解为多个独立的"负引导V2A"步骤——每一步生成新的互补音效时,通过负向音频引导机制主动抑制已生成声音的重复,从而实现增量式、可控的多声音事件合成;该方法无需昂贵的多参考视频-音频配对数据集,显著降低了数据依赖,同时给予用户对各音效生成顺序与内容的细粒度控制能力。
- Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis
- 赛道归属: 文本转语音 / 日语语音合成与汉字多音字消歧
- 核心创新点: 提出 Sarashina2.2-TTS,一个以日语为核心的 LLM-TTS 系统,针对日语中普遍存在的上下文依赖型汉字多音字问题,创新性地采用数据规模扩展与针对性数据合成双重策略加以解决。其核心突破在于通过定向数据构造弥补现有日语 TTS 数据集在多音字场景下覆盖不足的缺陷,有效提升了日语语音合成的发音准确率。
- A Geometric Perspective on Composable Emotion Steering in Text-to-Speech Models
- 赛道归属: 文本转语音 / 情感可控语音合成
- 核心创新点: 该工作从几何视角首次系统比较了语音语言模型模块与条件流匹配模块作为激活引导位点在混合情感语音合成中的特性差异。核心方法论突破体现在三个层面:① 利用线性探测与局部内在维度对两类模块中的情感表征进行几何结构量化分析;② 将情感控制问题形式化为激活空间中的向量引导问题,揭示不同模块的情感表征可组合性与可操控性之间的几何关联;③ 通过对比研究为混合TTS系统中情感模块的设计选择提供了可解释的几何依据,而非依赖经验性的黑箱调参。
- Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation
- 赛道归属: 语音合成评估
- 核心创新点: 针对TTS评估中"自然度"与"适切性"指标的内涵分歧问题,提出跨领域双维度评估框架。核心突破在于:系统性地区分了"类人程度"与"上下文适切性"两个独立维度,并在AI助手、朗读者、演员、动画角色、自发说话者五个不同应用域上对五个SOTA TTS系统进行对比评测,实证揭示了"自然"不等于"适切"——同一系统在不同下游场景下的适切性感知存在显著差异。该工作为TTS评估体系从单一自然度向多域适切性转型提供了重要的实证基础。
- SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation
- 赛道归属: 文本生成音频(Text-to-Audio Generation / 扩散模型推理加速)
- 核心创新点: 提出SwiftAudio,一个无需音频数据的一步式文本转音频蒸馏框架。核心突破在于:首次将变分得分蒸馏引入TTA领域,仅依赖文本描述即可从预训练扩散教师模型中完成知识蒸馏,彻底摆脱了现有一步式方法对文本-音频配对数据的依赖。该方法在大幅压缩推理步骤(多步→单步)的同时,通过纯文本驱动的蒸馏策略保持了合成质量,在数据效率与推理速度之间取得了显著突破。
- HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech
- 赛道归属: 情感语音合成 / 文本转语音
- 核心创新点: 针对基于大语言模型的TTS系统在情感表达上的局限性,该工作提出了HPRO(分层渐进式奖励优化)框架,核心突破体现在两个层面:
- 解耦潜空间设计:将内容信息与情感信息从共享隐空间中分离,解决了传统偏好优化中内容梯度与情感梯度相互冲突的结构性问题;
- 分层渐进式偏好优化策略:通过从粗粒度到细粒度的渐进式偏好提取与奖励建模,逐层对情感韵律进行精细化优化,突破了标准SFT范式导致模型收敛于统计均值韵律的瓶颈,显著提升情感表现力。整体方案将偏好驱动学习与层次化情感表征深度结合,为情感TTS的强化学习对齐提供了新范式。
- Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS
- 赛道归属: 文本转语音 / 基于流匹配的零样本语音合成引导策略
- 核心创新点: 针对流匹配零样本 TTS 中分类器自由引导的局限,提出联合残差重加权方法。创新之处在于重新审视独立遮蔽条件下的 CFG 机制,通过对文本条件与说话人条件的残差项进行解耦重加权,突破了现有分支选择性引导方法在"文本正确性"与"说话人相似度"之间的权衡困境,实现两者的协同提升。
- Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS
- 赛道归属: 文本转语音 / 基于扩散模型的韵律动态建模
- 核心创新点: 针对扩散模型 TTS 解码器在建模急剧韵律转换与快速音调变化时的不足,提出自适应振荡归纳偏置机制。相较于现有使用 Snake 激活函数的周期性非线性方法,该工作引入可自适应调整振幅与频率的激活函数设计,使模型在捕捉谐波结构的同时,具备对突变幅度和频率的灵活建模能力,有效提升表达性语音中细粒度韵律动态的合成质量。
- CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
- 赛道归属: TTS评测基准 / 中文新闻场景发音鲁棒性评测
- 核心创新点: 提出面向“原始输入”的中文新闻TTS目标级自动化评测基准,将易错的书面密集形式(比分、范围、单位符号、百分比、英文缩写、中英数混写专名等)显式定义为可定位的“发音目标”,并以目标是否被正确口播为核心指标,避免仅用整体MOS掩盖关键读音错误;强调在不做文本规范化前提下评估产品级TTS对真实新闻文本的读音保持与语义口播一致性。
GitHub
- [2026-07-03] huggingface/diffusers ⭐33976
- [2026-07-02] Stability-AI/stable-audio-tools ⭐3807
- [2026-06-29] BinWang28/audio-ai-hub ⭐934
- [2026-07-01] apocas/restai ⭐511
- [2026-07-01] dgrauet/ltx-2-mlx ⭐68
语言大模型
arXiv
- LLM-MINE: Large Language Model based Alzheimer's Disease and Related Dementias Phenotypes Mining from Clinical Notes
- 赛道归属: 医疗NLP / 临床文本信息抽取(表型挖掘)
- 核心创新点: 提出LLM-MINE,用大语言模型将非结构化临床笔记中的ADRD(阿尔茨海默病及相关痴呆)表型进行自动化抽取与结构化归因;方法上强调以“专家定义的表型 schema/标签体系 + LLM抽取流程”来覆盖分散在叙述文本中的关键信息,并通过专家标注/验证形成可用于早筛与分期的高质量表型数据资产。
- Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety
- 赛道归属: LLM安全与对抗防御
- 核心创新点: 提出了一种以"对抗性视角"为核心的LLM安全框架Yuvion,核心突破在于将安全问题重新定义为对抗性问题而非单纯的自然输入分布问题。该工作明确指出现有通用模型在涉及规划、工具调用等真实场景下的安全防护缺口,并通过构建对抗感知能力来应对策略性越狱与滥用攻击,而非仅依赖传统的过滤或拒绝机制。
- Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War
- 赛道归属: LLM评测基准 / 多智能体对抗与可靠性评测(推理+博弈+协议约束)
- 核心创新点: 提出Age of LLM这一1v1回合制对抗基准,将三类压力源系统化注入评测:战争迷雾(部分可观测)、完整外交沟通(谈判/停火/威胁且信息可隐藏)、以及严格JSON动作协议下的可靠性约束(非法动作被静默丢弃);通过私有引擎、随机地图种子与随机对手机制降低数据污染与“背题”风险,使评测更贴近真实交互式决策与工具/协议执行场景。
- Online Data Selection for Instruction Tuning via Gaussian Processes
- 赛道归属: 指令微调 / 数据选择与质量优化
- 核心创新点: 提出GAIA框架,将数据价值评估从局部批次优化升级为全局估计过程。核心方法是引入高斯过程对数据效用进行全局建模,突破了现有在线数据选择方法"批次受限"的瓶颈,实现了跨批次的全局自适应指令微调数据筛选,从根本上改变了LLM训练中数据价值评估的范式。
- 赛道归属: Instruction tuning / Data Selection & Quality Optimization
- Search for Truth from Reasoning: A Dynamic Representation Editing Framework for Steering LLM Trajectories
- 赛道归属: 推理优化 / 表征编辑
- 核心创新点: 提出动态表征编辑框架,针对LLM推理轨迹中"真值"的几何结构进行深入分析,揭示了三项关键规律。与静态表征编辑不同,该方法将内在控制机制动态注入展开中的推理链,能够在推理过程中实时引导模型向"真值"方向收敛,而非仅仅让模型"思考更多",从根本上解决了CoT等方法缺乏真值导向的问题。
- 赛道归属: Reasoning Optimization / Representation Editing
- Optimal Self-Consistency for Efficient Reasoning with Large Language Models
- 赛道归属: 推理优化 / 测试时计算效率
- 核心创新点: 针对自洽性推理方法在大规模数据集上计算成本过高的问题,本文从理论层面建立了统一的最优自洽性框架。核心突破在于将多次采样的答案聚合过程形式化为经验众数估计问题,并推导出最优采样数量的理论界,从而在保持性能的前提下大幅减少不必要的采样次数,实现自适应的高效推理。
- Conversable Complexity: Agentic LLM Collectives as Interpretable Substrates
- 赛道归属: 多智能体系统 / LLM集体涌现行为与可解释性研究
- 核心创新点: 提出将LLM群体作为"可对话的复杂系统基底"这一新框架,核心突破在于将复杂性与可解释性统一——单个LLM是静态工件,缺乏涌现特性,而通过多LLM交互构成的群体系统能够涌现出类似生命系统的复杂动态行为,同时因LLM天然具备语言表达能力,该系统可被直接"询问"以实现内在可解释性。突破了传统复杂系统"复杂则不透明"的二元对立困境。
- Persona Non Grata: LLM Persona-Driven Generations in MCQA are Unstable in Distinct Dimensions
- 赛道归属: LLM行为一致性与人格驱动生成稳定性分析
- 核心创新点: 针对LLM人格驱动生成在多项选择题回答这类非自由文本输出场景中的稳定性问题,系统性地拆解出"不稳定性的多维度"这一核心发现。区别于以往仅关注对话等自由文本的人格一致性研究,本工作首次在MCQA场景下量化分析人格表达的不稳定性来源与维度差异,填补了结构化输出场景下人格一致性评估的研究空白。
- Real-Time Hard Negative Sampling via LLM-based Clustering for Large-Scale Two-Tower Retrieval
- 赛道归属: 推荐系统 / 双塔模型负样本采样优化
- 核心创新点: 提出基于LLM聚类的实时硬负样本采样方法,核心创新在于将LLM的语义理解能力引入双塔召回模型的训练流程:利用LLM对样本进行语义聚类,实时动态地从语义相近但标签为负的样本中构造高质量硬负样本,克服了传统in-batch和out-of-batch方法只能产生"简单负样本"的根本缺陷,以自监督方式显著提升大规模检索阶段模型的判别能力。
- SkillSelect-Serve: Budget-Controllable and QoS-Aware Skill Service Recommendation and Composition for Small LLM Agents
- 赛道归属: LLM智能体 / 技能服务推荐与组合优化
- 核心创新点: 提出SkillSelect-Serve框架,将LLM智能体的技能选择问题重新建模为"技能服务推荐与组合"问题,核心创新有三:①将原始技能封装为结构化"技能服务"(包含功能描述、依赖关系、上下文约束);②引入预算可控机制,使智能体在资源约束下动态调整技能调用策略;③融入QoS感知(服务质量感知)维度,超越了传统将技能视为可检索文档并返回固定Top-K列表的局限,实现了面向小型LLM智能体的高效、可控技能编排。
GitHub
- [2026-07-04] sgl-project/sglang ⭐29878
- [2026-07-04] yamadashy/repomix ⭐26811 🆕NEW
- [2026-07-03] NVIDIA/TensorRT-LLM ⭐14022
- [2026-07-03] google-ai-edge/LiteRT-LM ⭐5773
- [2026-07-03] wonglaitung/fortune ⭐58
HuggingFace Models
HuggingFace Datasets
- [2026-06-29] Glint-Research/Fable-5-traces
Glint Research Dataset Card Fable 5 Pi Agent Traces A compact, high-signal corpus of Fable 5 coding-agen...
- [2026-06-21] Crownelius/Complete-FABLE.5-traces-2M
Complete FABLE.5 Traces 2M
Full FABLE.5 / Mythos corpus restored, with session-limit answer rows removed. Dataset Viewer | Parq...
多模态大模型
arXiv
- DataComp-VLM: Improved Open Datasets for Vision-Language Models
- 赛道归属: 多模态理解 / 数据工程与基准测试
- 核心创新点: 提出首个系统性的视觉-语言模型数据配方基准 DCVLM,整合了160个数据集(涵盖图文对、多模态交错文档、纯文本及指令微调数据)构成6T规模语料库,将数据筛选策略的评估标准化,填补了社区在VLM训练数据系统性比较研究上的空白。其核心突破在于将"以数据为中心"的实验范式引入VLM领域,使研究者能够在受控条件下对比不同数据策略的效果,而非依赖模型架构变化来解释性能差异。
- Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling
- 赛道归属: 多模态理解(长视频理解/高效采样与推理加速)
- 核心创新点: 将长视频帧选择形式化为“准高斯采样”问题,提出一种自适应、免训练的帧采样策略:用连续、可调的软采样分布替代传统关键帧“硬采样”,在计算/显存受限下更灵活地覆盖关键时刻并抑制噪声帧,从而在不改动模型训练的前提下提升长视频理解效率与效果。
- VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models
- 赛道归属: 多模态理解 / 计算光学与视觉语言模型协同设计
- 核心创新点: 提出 CODA 协同设计框架,针对冻结视觉语言模型的特性,将前端元光学硬件设计与 VLM 的感知偏好联合优化,而非追求传统人类可读的图像质量指标。核心突破在于:以 VLM 的任务性能(而非图像分辨率/像差等光学指标)作为优化目标,使紧凑型元光学在尺寸/成本受限场景下仍能维持高效的多模态理解能力,打通了物理光学设计与AI模型感知之间的优化闭环。
- AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs
- 赛道归属: 多模态理解 / 跨模态评测基准
- 核心创新点: 提出AMVICC基准,系统性地对比VLMs(图像→文本)与图像生成模型IGMs(文本→图像)在相同视觉概念上的失败模式,实现跨模态失效剖析。核心创新在于将图文双向任务置于同一评测框架下,通过"跨模态失败模式对齐"揭示两类模型在物体朝向、数量感知、空间关系等基础视觉概念上的共性与差异性缺陷,为多模态系统的弱点诊断提供了对称性视角。
- RiverONE: Generating Knowledge-Intensive VLM by Simulated Quantum Machines
- 赛道归属: 多模态理解 / 轻量化模型与量子启发参数生成
- 核心创新点: 提出 RiverONE,利用模拟量子计算(而非真实量子硬件)在模型构建阶段生成结构化参数,将量子叠加、纠缠和测量诱导的非线性特征引入经典神经网络的权重初始化或参数生成过程,从而构建知识密集型轻量视觉-语言模型。核心创新在于将量子计算的高维信息表示能力以"软件模拟"形式移植至经典AI系统参数设计中,为紧凑型VLM提供了一种全新的参数来源范式。
- LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving
- 赛道归属: 自动驾驶 / 多模态规划
- 核心创新点: 提出 LWDrive 框架,通过逐层世界模型引导机制将 VLM 输出的粗粒度语义驾驶意图逐步细化为几何精确、具有未来感知能力和多视角一致性的轨迹规划。其核心突破在于打通 VLM 语义层与底层运动规划层之间的鸿沟——不再将 VLM 输出直接用作最终轨迹,而是将其作为世界模型各层的条件信号,实现语义理解与物理可行性的分层对齐。
- Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models
- 赛道归属: 多模态理解 / 模型评估与美学推理
- 核心创新点: 针对开放式美学评论任务提出新的评估范式,突破了传统数值评分对齐方式的局限,转而将 MLLM 生成的评论与多个经人工排序的参考评论进行比对,使用 Reddit Photo Critique 数据集对五个开源 MLLM 进行评测。核心创新在于将"排名人类参考"引入美学评估,构建了更贴近真实人类批评行为的评判标准,为衡量模型在无唯一正确答案的主观推理任务上的能力提供了方法论参考。
- Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages
- 赛道归属: 多模态安全 / 内容审核与对抗鲁棒性
- 核心创新点: 系统性研究图像分辨率对 VLM 检测 ASCII 艺术形式有害内容的影响,覆盖八种字符构造模式(L1–L8,从密集块字符到词嵌入设计)及多语言场景,揭示了分辨率阈值与检测能力之间的定量关系。核心创新在于将分辨率作为核心变量引入 VLM 安全评估体系,首次量化了视觉编码的有害信息在不同渲染精度下对主流 VLM 内容审核能力的系统性威胁边界,为实际部署中的防御策略提供了可操作的技术依据。
- Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models
- 赛道归属: 多模态理解 / 视觉语言模型机制可解释性
- 核心创新点: 针对视觉语言模型中"视觉感知"与"先验知识"发生冲突时的决策机制,首次提出组件级因果分析方法,综合运用残差流、注意力头、MLP 子层三个粒度的激活修补与模型组件消融实验。核心发现是跨三个 VLM 家族均存在"视觉默认、先验覆盖"的层次化因果机制——模型默认优先处理视觉输入,但特定组件可触发先验知识对视觉证据的覆盖。该工作将行为层面的冲突描述推进至可追溯的内部因果机制层面,为提升多模态系统可靠性提供了可操作的机制洞察。
- Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
- 赛道归属: 多模态理解 / GUI智能体 / 不确定性量化
- 核心创新点: 提出Argus基准,专门针对"计算机操作智能体"场景下VLM预测的不确定性量化问题,系统评估多种后验UQ方法在跨模型、跨数据集、跨GUI界面变化下的稳定性。创新点在于引入"跨体制"评测范式,分离模型、数据集、界面三个维度的UQ排名漂移,并定义拒绝决策、空间安全区域等面向GUI点击执行的实用UQ指标,填补了GUI智能体可靠性评估的空白。
GitHub
- [2026-07-03] Blaizzy/mlx-vlm ⭐5115
- [2026-07-01] EvolvingLMMs-Lab/NEO ⭐850
- [2026-07-03] zli12321/Vision-Language-Models-Overview ⭐648 🆕NEW
- [2026-07-01] VITA-Group/VLM-3R ⭐419
- [2026-06-29] FeiElysia/Tempo ⭐74
HuggingFace Models
强化学习
arXiv
- RoAd-RL: A Unified Library and Benchmark for Robust Adversarial Reinforcement Learning
- 赛道归属: 对抗鲁棒性强化学习 / Adversarial Robust Reinforcement Learning
- 核心创新点: RoAd-RL 提出了一个统一的开源对抗强化学习基准框架,核心突破在于:通过标准化抽象层统一了策略、攻击者和环境的接口,解决了现有研究中实现碎片化、评估协议不一致和可复现性差的问题。该框架将多种主流对抗攻击方法与鲁棒训练算法整合至单一平台,并建立了一致的评估协议,使不同方法之间的横向比较成为可能,推动了对抗RL研究的标准化与可重复性。
- FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
- 赛道归属: 大语言模型强化学习对齐 / LLM RL Alignment
- 核心创新点: 针对GRPO等策略梯度方法在训练中梯度方向不稳定的问题,提出反馈驱动的双目标协同强化学习框架。核心突破在于同时优化策略目标与反馈信号目标,通过双目标协同机制动态校正梯度方向,避免单一奖励信号导致的训练偏移,从而更稳定地解锁大模型推理能力。
- Qwen-Image-2.0-RL Technical Report
- 赛道归属: 文生图 / RLHF后训练优化
- 核心创新点: 针对扩散模型的后训练流水线,创新性地将RLHF与在策略蒸馏结合,构建任务特定的复合奖励模型,引入基于视觉语言模型微调的逐点打分范式与链式思维推理,从而为文生图任务提供更可靠的奖励信号,同步提升视觉质量与指令遵循能力。
- Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training
- 赛道归属: 大语言模型后训练 / 强化学习效率优化
- 核心创新点: 本文系统性地研究了强化学习后训练中各Transformer层的贡献差异,挑战了"全参数均匀更新"的传统假设。核心发现是:仅训练单个Transformer层即可匹配全参数RL训练的性能,揭示了RL适应过程在层间分布高度不均的规律。该工作通过逐层消融实验定位出对RL增益贡献最关键的层,为高效参数化RL训练提供了理论依据,大幅降低了LLM后训练的计算开销,同时揭示了Transformer层在RL后训练中功能专业化的内在机制。
- From Pixels to Temporal Correlations: Learning Informative Representations for Reinforcement Learning Pre-training
- 赛道归属: 强化学习预训练 / 视觉表征学习
- 核心创新点: 针对现有基于无监督视频预训练的RL表征方法过度保留像素空间中大量静态信息、忽视小但关键的动态信息的问题,本文提出了一种从像素到时序相关性的表征学习框架。核心创新在于引入了时序相关性预测目标,驱动模型捕获跨帧的动态变化模式而非静态背景冗余,从而在无动作标注的大规模互联网视频上学习到对RL任务更具信息量的紧凑表征。该方法有效提升了RL的样本效率与策略性能,尤其在需要感知细粒度运动信号的任务中表现突出。
- Flow-Map GRPO: Reinforcement Learning for Few-Step Flow-Map Generators via Anchored Stochastic Composition
- 赛道归属: 文生图 / 少步生成模型强化学习后训练
- 核心创新点: 本文针对一致性模型和MeanFlow等少步Flow-Map生成器确定性采样导致无法直接用于RL后训练的核心痛点,提出了Flow-Map GRPO方法。核心技术突破包括两点:① 提出锚定随机组合策略,通过在确定性flow-map上叠加可控随机扰动,构造出具有良好定义似然比的随机轨迹,使GRPO等基于策略梯度的RL算法得以适用;② 将该随机化机制与GRPO目标有机融合,实现了在保持少步采样加速优势的同时,利用RL奖励信号对模型进行偏好对齐优化。该方法填补了少步确定性生成模型与RL后训练范式之间的技术鸿沟。
- Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models
- 赛道归属: 具身智能 / 视觉-语言-动作模型强化学习后训练
- 核心创新点: 提出Z-1框架,专为基于流的VLA模型设计RL后训练方案。核心突破在于:(1)将连续动作流的生成过程与RL奖励信号对接,解决了传统行为克隆无法从自身失败中学习的根本缺陷;(2)通过高效的RL后训练范式,在不依赖新增演示数据的情况下显著提升机器人操控策略的泛化能力和鲁棒性,为流式VLA模型引入了在线自我改进机制。
- Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning
- 赛道归属: 多模态理解 / 医学视觉问答与推理优化
- 核心创新点: 提出双流强化学习框架,联合优化视觉Token稀疏化与医学多模态推理两个任务。核心方法突破在于:识别到医学图像中有效视觉证据极度稀疏的特点,通过主动剪枝接地区域之外的视觉Token来强化临床推理质量;在统一的RL框架下,将视觉定位与语言推理解耦为双流结构,首次实现了自适应Token压缩与推理增强的协同训练,显著降低计算冗余的同时提升了医学诊断推理准确性。
- Stage-Transition Dense Reward Modeling for Reinforcement Learning
- 赛道归属: 具身智能 / 长时序机器人操控稠密奖励学习
- 核心创新点: 提出STDR框架,核心创新在于:从无结构的专家视频中自动推断任务的阶段结构,并将阶段转换事件转化为逻辑一致的稠密奖励信号,无需人工设计奖励函数。方法上利用视觉语义理解自动识别任务关键阶段边界,将稀疏终止奖励转化为阶段级稠密监督,从根本上解决了长时序操控任务中奖励稀疏和延迟的核心挑战,且对环境变化和物体配置变化具备更强的泛化能力。
- Deep Reinforcement Learning for Spacecraft Attitude Control During Atmospheric Re-Entry
- 赛道归属: 航空航天控制 / 深度强化学习姿态控制
- 核心创新点: 将深度强化学习应用于航天器大气再入姿态控制这一高度非线性、强不确定性的安全关键场景。核心贡献在于:(1)以工业级增益调度PID控制器作为强基线,系统性地评估无模型RL与混合控制器(RL+传统控制结合)的性能边界;(2)探索了混合控制架构,将RL的自适应决策能力与传统控制器的稳定性保障相结合,为极端动力学条件下(高温、气动扰动、系统故障)的鲁棒姿态控制提供了新的技术路径。
GitHub
- [2026-07-03] huggingface/trl ⭐18758
- [2026-07-03] PufferAI/PufferLib ⭐6106
- [2026-07-03] rllm-org/rllm ⭐5677
- [2026-07-03] google-deepmind/acme ⭐4008 🆕NEW
- [2026-07-04] OpenMLRL/CoMLRL ⭐91
HuggingFace Models
HuggingFace Datasets
- [2025-01-15] mlabonne/open-perfectblend
🎨 Open-PerfectBlend
Open-PerfectBlend is an open-source reproduction of the instruction dataset introduced in the paper "The Perfect B...
- [2026-06-29] bcbl190626/SpanishBCBL
DECOMEG — Brain Activity During Typing (MEG & EEG)
Non-invasive brain recordings (magnetoencephalography, MEG; and electroencephalograp...
- [2026-06-24] Qwen/AgentWorldBench
AgentWorldBench
AgentWorldBench is a comprehensive evaluation benchmark for language world models, constructed from real-world observat...
世界动作模型
arXiv
- ABot-M0.5: Unified Mobility-and-Manipulation World Action Model
- 赛道归属: 具身智能 / 移动操作世界动作模型
- 核心创新点: 针对移动操作任务中现有WAM方法的三大结构性缺陷(粗粒度视频块处理、导航-操作动作耦合建模、逆动力学监督与自回归推理不匹配),ABot-M0.5提出了统一的移动操作世界动作模型框架。核心突破包括:① 以细粒度帧级别取代粗粒度视频块进行时序建模;② 将导航与操作动作解耦,分别建模以适配两类任务的异质性结构;③ 重新对齐逆动力学训练目标与自回归推理范式,使模型在推理阶段的动作生成更加一致。该工作将反应式VLA策略提升为具备显式世界建模能力的统一框架,实现对移动操作全流程的端到端动作预测。
- Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation
- 赛道归属: 具身导航 / 世界动作模型 / 空间感知规划
赛道归属 : Embodied Navigation / World Action Model / Spatial-Aware Planning
- 核心创新点: 现有基于世界模型的视觉导航规划器通常采用"验证中心范式",将目标意图与轨迹合成解耦,导致候选依赖、计算开销大、采样动作与预测视觉不一致等问题。本文提出 SWAM(空间感知世界动作模型),核心创新在于:
- 任务中心式联合生成框架:将观测与动作的生成统一建模,在给定起始与目标 RGB 观测后,同步生成导航动作序列与中间视觉帧,彻底摆脱对候选集的依赖;
- 空间感知能力嵌入:在世界模型中显式引入空间感知模块,增强模型对三维场景结构的理解,使预测的视觉观测与动作保持几何一致性;
- 范式转变:从"先采样后验证"的两阶段解耦范式,转变为端到端的联合推断范式,有效降低计算开销并提升动作预测的可靠性。
核心创新点 :
- ReWorld: Learning Better Representations for World Action Models
- 赛道归属 : 自动驾驶世界模型 / World Action Model for Autonomous Driving
- 核心创新点 :
[中文] 现有世界动作模型的研究主要集中于模型架构设计,而如何让模型高效学习更优质的世界表征以服务于规划任务,仍是一个待解决的问题。本文提出 ReWorld,这是首个专门面向自动驾驶世界动作模型的表征学习框架。其核心创新在于:突破了传统WAM仅依赖标准视频预测监督信号(即像素级重建损失)的局限,通过引入专门设计的表征学习目标,引导模型在训练过程中学习到更具语义性、结构性的世界状态表征,而非仅仅优化视觉保真度。这一框架与模型架构无关,具备良好的通用性,可作为现有WAM方法的即插即用增强模块,显著提升其用于规划时的表征质量。
- From World Models to World Action Models: A Concise Tutorial for Robotics
- 赛道归属: 具身智能 / 世界模型综述与设计空间分析
- 核心创新点: 本文以教程形式对机器人领域的世界模型研究进行系统性梳理,核心贡献在于提出了一套统一的"设计空间视图"分析框架。将世界模型统一定义为"动作条件化的预测模型",并按建模空间将其划分为观测空间世界模型与状态空间世界模型两大类,从视觉保真度、空间结构性、物理可解释性和计算效率等维度系统比较其权衡关系。进一步厘清了"世界模型"与"世界动作模型"之间的概念边界,填补了跨社区之间概念模糊的空白,为后续研究提供了清晰的方法论参照。
GitHub
- [2026-07-03] OpenMOSS/Awesome-WAM ⭐1022
- [2026-07-03] youngzhou1999/DriveDreamer-Policy ⭐51 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-07-04 01:00:18