AI 每日进展速报 - 2026-06-30
图像生成/编辑
arXiv
- IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation
- 赛道归属: 文生图(结构可控生成 / 规划-渲染解耦)
- 核心创新点: 提出“隐式视觉思维链”作为潜空间的结构规划机制,将对象数量、空间关系、属性绑定与布局等“结构性意图”从外观渲染中解耦:先在潜变量中形成可组合的结构计划,再驱动后续生成以提升结构遵循能力;通过把结构推理从单一条件流的纠缠中分离,显著改善复杂结构提示下的可控性与一致性。
- RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
- 赛道归属: 文生图 / 强化学习对齐
- 核心创新点: 提出 RubricRL 框架,核心突破在于用"评分标准"替代传统单一标量奖励或复合指标加权求和的方式来设计强化学习奖励信号。该方法通过将生成目标分解为可解释的、细粒度的评估维度,利用大模型或规则生成结构化评分,从而在保持灵活性的同时提升了奖励的可解释性和泛化性,避免了固定权重复合指标和人类偏好蒸馏模型的局限性。
- PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation
- 赛道归属: 文生图安全(越狱评测 / 基准与复现管线)
- 核心创新点: 将T2I越狱从“单提示评测”提升为“端到端管线评测”,提出可自演化的 paper-to-pipeline 复现框架 PixJail:覆盖提示改写/攻击、图像生成、安全过滤、多模态裁判等多阶段,并把论文方法自动化落地为可运行管线以提升可复现性与可比性;核心突破在于用标准化、可扩展的管线级协议刻画越狱效果与防护强度,而非孤立的prompt成功率。
- SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion
- 赛道归属: 文生图基础模型 / 扩散模型训练加速
- 核心创新点: 提出 SeFi-Image,核心创新是"语义优先扩散"这一新型潜在扩散建模范式。与传统扩散模型将语义信息视为条件输入不同,该范式将语义结构的学习置于扩散过程的优先位置,从而利用语义引导显著加速基础模型训练。关键突破在于将此范式成功扩展至大分辨率、大规模模型(多个参数量档位),突破了以往仅在 ImageNet 等简单数据集上小模型验证的局限。
- CSD: Content-aware Speculative Decoding for Efficient Image Generation 🆕NEW
- 赛道归属: 推理优化 / 自回归图像生成加速
- 核心创新点: 针对自回归图像生成中投机解码接受率低、直接放宽标准导致图像质量下降的问题,提出内容感知投机解码算法CSD。核心创新在于引入基于熵的概率松弛机制,根据当前token的信息熵动态调整接受标准(高熵区域更宽松、低熵区域更严格),并结合最优重采样策略,在不显著牺牲生成质量的前提下大幅提升推理效率。方法上实现了"接受率"与"图像质量"之间的帕累托最优权衡。
- Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation 🆕NEW
- 赛道归属: 文生图 / 智能体增强图像生成
- 核心创新点: 针对文生图模型面对真实世界请求时存在的"上下文鸿沟"问题——即用户意图模糊、隐含或依赖实时知识——提出统一智能体框架Qwen-Image-Agent。核心创新在于将规划、推理、搜索、记忆与反馈五大模块以"上下文为中心"的方式统一集成:通过实时检索补全缺失知识,通过多步规划将隐含需求显式化,通过反馈机制迭代修正生成结果。相较于端到端T2I模型,该框架将语义理解与图像生成解耦,显著提升了对复杂、开放域请求的响应能力。
- SpatialFlow-GRPO: Where Spatial Credit Drives Image Editing 🆕NEW
- 赛道归属: 图像编辑 / 基于强化学习的图像编辑优化
- 核心创新点: 针对现有Flow-GRPO类方法依赖单一全局图像奖励信号、无法区分不同空间区域对编辑质量贡献的问题,提出SpatialFlow-GRPO框架。核心创新在于引入空间感知信用分配机制:将奖励信号从图像级细化至空间区域级,使强化学习优化过程能够精确定位"编辑是否发生在正确位置"。通过空间信用驱动策略梯度更新,解决了图像编辑中"空间均匀性假设"的根本缺陷,实现对局部精细编辑的针对性优化,显著提升复杂指令下的编辑精度。
- PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing 🆕NEW
- 赛道归属: 图像编辑 / 评测基准
- 核心创新点: 现有图像编辑基准普遍缺乏对物理常识推理能力的系统性评估。PhyEditBench提出首个面向物理感知图像编辑的真实世界多阶段基准,核心创新在于构建了层次化物理分类体系(4大主类、12个子类),涵盖力学、材质、光影、空间关系等物理规律维度,并收录238张高质量高分辨率真实图像样本。"多阶段"设计使其能够评估模型在编辑过程中对物理因果链的理解深度,而非仅评估最终结果,为推动多模态生成模型的物理理解能力提供了标准化评测工具。
- Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning
- 赛道归属: 文生图评测(因果推理 / 反事实基准)
- 核心创新点: 提出反事实世界基准 CF-World,用“规则被改变的世界”来测试T2I是否具备因果/机制性理解而非相关性拟合:通过构造与训练分布相关性相冲突的反事实规则,要求模型在生成时遵循新因果机制;方法论突破在于用可控的反事实设定隔离“视觉真实感”与“因果一致性”,从生成结果中诊断模型的因果泛化能力。
- Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing 🆕NEW
- 赛道归属: 图像编辑 / 多轮对话式图像编辑
- 核心创新点: 针对现有方法局限于单轮编辑、忽视多轮迭代场景的问题,Edit-R2提出基于上下文感知强化学习的多轮图像编辑框架。核心创新在于同时应对多轮编辑中两种耦合失效模式:长上下文遗忘(模型忘记历史编辑约束)与指令漂移(模型偏离当前轮次指令)。通过设计上下文感知的奖励机制,使强化学习信号能够同时衡量"当前指令执行准确性"与"历史会话约束保持程度",在不依赖大规模多轮标注数据的条件下,实现对渐进式图像精修场景的有效优化,填补了多轮图像编辑在方法论上的空白。
GitHub
- [2026-06-30] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐12711
- [2026-06-29] Light-Heart-Labs/ODS ⭐2387
- [2026-06-29] varunvasudeva1/llm-server-docs ⭐799
- [2026-06-29] AceDataCloud/Nexior ⭐374
- [2026-06-29] etkecc/baibot ⭐233
HuggingFace Models
视频生成/编辑
arXiv
- DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation
- 赛道归属: 视频生成 / 主体驱动文生视频
- 核心创新点: 提出 DomainShuttle 框架,专门针对开放域主体驱动文生视频中"跨域"场景的不足进行突破。现有方法主要聚焦于域内高保真主体重现,而 DomainShuttle 通过"域穿梭"机制,在保留主体本质特征的同时,允许与主体无关的属性(如风格、场景、外观)根据文本提示灵活变化,实现了自由形式的开放域生成能力,有效解决了跨域场景下主体特征保留与文本可控性之间的平衡难题。
- Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
- 赛道归属: 视频生成评估 / 物理合理性细粒度评测
- 核心创新点: 提出 Physics Question Scene Graph,一种基于层次化问题图的评估流水线,用于细粒度定位视频生成中的物理规律违反问题。与现有粗粒度评估方法不同,PQSG 通过构建包含物体、动作、属性及其物理关系的场景图,将物理合理性评估分解为结构化问答任务,实现了对物理违规的精准溯源与量化,填补了当前文生视频评估体系在物理合理性细粒度诊断上的空白。
- Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control 🆕NEW
- 赛道归属: 视频生成(自回归视频生成 / 可控视频生成)
- 核心创新点: 该工作针对自回归视频生成在长时序展开中存在的误差累积与时序退化问题,提出了一种融合人体运动与相机轨迹的异构复合控制框架。核心技术突破体现在以下几个方面:①设计了一种能够同时建模人体动作控制信号与相机运动轨迹的联合条件注入机制,解决了两类异构控制信号相互干扰、破坏预训练视频先验的问题;②针对自回归生成的长程稳定性,提出了有效抑制误差累积的架构设计,使模型在长时序rollout中保持视频质量;③在保证可控性的同时实现了快速自回归生成,在速度与质量之间取得了更优的平衡。整体方法为构建可交互、可控的世界模型提供了可扩展的技术路径。
- Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models
- 赛道归属: 视频生成 / 自回归扩散蒸馏与流式视频生成
- 核心创新点: 提出 Causal-rCM,将先进扩散蒸馏框架 rCM 扩展至因果扩散变换器的自回归视频生成范式。核心创新在于统一了"Teacher-Forcing"(教师强制)与"Self-Forcing"(自强制)两种训练模式的开放配方:利用一致性模型的逆向散度与分布匹配蒸馏的正向散度互补性,在保持实时流式生成能力的同时显著提升采样效率,为交互式世界模型和动作条件视频生成提供了统一的高效蒸馏解决方案。
- Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation
- 赛道归属: 视频生成推理优化 / 跨请求稀疏注意力复用
- 核心创新点: 提出 Chorus II,针对图生视频大规模服务场景,首次发现并利用相似请求之间高度一致的稀疏注意力模式这一规律。与现有仅复用特征的跨请求加速方法不同,Chorus II 通过跨请求复用历史稀疏掩码,在不显著降低生成质量的前提下大幅减少注意力计算开销,为 I2V 扩散模型的高效部署提供了新的系统级优化维度。
- GeoT2V-Bench: Benchmarking 3D Consistency in Text-to-Video Models via 3D Reconstruction
- 赛道归属: 视频生成评测 / 3D一致性评测(Text-to-Video + 3D重建诊断)
- 核心创新点: 提出基于“显式3D重建可行性”的T2V评测范式:不再只看逐帧观感,而是将相机提示下生成的视频作为多视图观测,接入刚体3D重建流程,用重建质量/稳定性来量化跨视角几何一致性;以重建为“诊断器”定位T2V在相机运动、视差、结构漂移等方面的失败模式,从而把“看起来合理”提升为“可支持单一静态3D场景证据”的可检验指标。
- Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models
- 赛道归属: 视频生成 / 世界模型与可控性学习
- 核心创新点: 将“视频生成=世界建模”的命题具体化为“可反事实控制的自演化世界模型”:强调仅靠视觉预测尺度化不足以获得可用的物理代理,提出以反事实可控性为目标,让模型不仅能续写视频,还能在干预变量下生成一致且可区分的反事实轨迹;通过把生成过程组织为可被操控、可自我改进的闭环,使世界模型从隐式表征走向可用于决策/干预评估的生成式模拟器。
- BioVid: Autoregressive Video Generation with Biological Behavior Semantic Comprehension
- 赛道归属: 视频生成 / 生物行为自适应长度视频生成
- 核心创新点: 提出 BioVid,一个专为生物行为视频生成设计的数据驱动自回归框架,核心创新在于将"动作持续时长"作为语义属性内化于模型学习中,而非依赖外部指定。采用 2D 编码/3D 解码混合分词器架构,实现了自适应长度的生物行为视频生成,突破了现有模型固定时序窗口或外部续帧的局限,使生成视频的时长能够由行为语义自主驱动。
- MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation
- 赛道归属: 多模态视频生成评估 / 多镜头音视频生成基准
- 核心创新点: 提出 MSAVBench,首个专为多镜头音视频生成设计的综合评估基准与自适应混合评估框架。针对现有基准在评估范围、数据多样性和评估管道刚性方面的不足,MSAVBench 引入自适应混合评估机制,能够系统、可靠地评估现代 MSAV 模型在叙事一致性、音视频同步、跨镜头连贯性等维度的能力,推动视频生成从单镜头合成向复杂多镜头叙事的评估体系升级。
- SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation
- 赛道归属: 视频生成 / 联合摄像机运动与物体动态控制
- 核心创新点: 提出 SymphoMotion,首个在单一模型内联合控制摄像机轨迹与物体动态的统一运动控制框架。核心突破在于同时引入显式摄像机参数和物体运动控制机制,从根本上解决了现有方法依赖模糊2D线索导致摄像机视差与真实物体运动相互纠缠的问题,实现了摄像机运动与物体动力学的解耦感知与协同控制,显著提升了生成视频的连贯性与表达力。
GitHub
- [2026-06-29] hao-ai-lab/FastVideo ⭐3782
- [2026-06-29] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1461
- [2026-06-29] PurpleDoubleD/locally-uncensored ⭐828 🆕NEW
- [2026-06-30] alexchan197611/ai_media_assistant ⭐173
- [2026-06-29] TIGER-AI-Lab/Context-Forcing ⭐91 🆕NEW
音频生成
arXiv
- CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations
- 赛道归属: 文本转语音 / 跨语言口音强度可控语音合成
- 核心创新点: 提出 CrossAccentTTS 框架,核心突破在于对说话人身份与口音特征进行解耦表征,实现在保持说话人音色不变的前提下,独立控制目标口音类型及其强度。相比传统跨语言 TTS 系统缺乏口音显式控制的问题,该方法尤其针对低资源、音系多样的印度语系语言,提供了精细化的口音迁移与强度调节能力。
- Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis
- 赛道归属: 文本转语音 / 日语语音合成与汉字多音字消歧
- 核心创新点: 提出 Sarashina2.2-TTS,一个以日语为核心的 LLM-TTS 系统,针对日语中普遍存在的上下文依赖型汉字多音字问题,创新性地采用数据规模扩展与针对性数据合成双重策略加以解决。其核心突破在于通过定向数据构造弥补现有日语 TTS 数据集在多音字场景下覆盖不足的缺陷,有效提升了日语语音合成的发音准确率。
- HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech 🆕NEW
- 赛道归属: 情感语音合成 / 文本转语音
- 核心创新点: 针对基于大语言模型的TTS系统在情感表达上的局限性,该工作提出了HPRO(分层渐进式奖励优化)框架,核心突破体现在两个层面:
- 解耦潜空间设计:将内容信息与情感信息从共享隐空间中分离,解决了传统偏好优化中内容梯度与情感梯度相互冲突的结构性问题;
- 分层渐进式偏好优化策略:通过从粗粒度到细粒度的渐进式偏好提取与奖励建模,逐层对情感韵律进行精细化优化,突破了标准SFT范式导致模型收敛于统计均值韵律的瓶颈,显著提升情感表现力。整体方案将偏好驱动学习与层次化情感表征深度结合,为情感TTS的强化学习对齐提供了新范式。
- Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS
- 赛道归属: 文本转语音 / 基于流匹配的零样本语音合成引导策略
- 核心创新点: 针对流匹配零样本 TTS 中分类器自由引导的局限,提出联合残差重加权方法。创新之处在于重新审视独立遮蔽条件下的 CFG 机制,通过对文本条件与说话人条件的残差项进行解耦重加权,突破了现有分支选择性引导方法在"文本正确性"与"说话人相似度"之间的权衡困境,实现两者的协同提升。
- Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS
- 赛道归属: 文本转语音 / 基于扩散模型的韵律动态建模
- 核心创新点: 针对扩散模型 TTS 解码器在建模急剧韵律转换与快速音调变化时的不足,提出自适应振荡归纳偏置机制。相较于现有使用 Snake 激活函数的周期性非线性方法,该工作引入可自适应调整振幅与频率的激活函数设计,使模型在捕捉谐波结构的同时,具备对突变幅度和频率的灵活建模能力,有效提升表达性语音中细粒度韵律动态的合成质量。
- CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
- 赛道归属: TTS评测基准 / 中文新闻场景发音鲁棒性评测
- 核心创新点: 提出面向“原始输入”的中文新闻TTS目标级自动化评测基准,将易错的书面密集形式(比分、范围、单位符号、百分比、英文缩写、中英数混写专名等)显式定义为可定位的“发音目标”,并以目标是否被正确口播为核心指标,避免仅用整体MOS掩盖关键读音错误;强调在不做文本规范化前提下评估产品级TTS对真实新闻文本的读音保持与语义口播一致性。
- Joycent: Diffusion-based Accent TTS without Accented Phone Prediction
- 赛道归属: 文本转语音 / 基于扩散模型的口音语音合成
- 核心创新点: 提出 Joycent,摒弃了传统口音 TTS 依赖的两阶段管线(标准音素序列→口音音素序列→语音合成),避免了误差积累及对稀缺配对标注数据的依赖。核心创新在于直接在扩散模型框架内,通过声学特征层面的口音表征来建模口音特性,无需显式的文本级口音音素预测步骤,从而实现更自然、更精准的口音语音合成。
- Task-Vector Arithmetic for Emotional Expressivity Control in Language-Model-Based Text-to-Speech
- 赛道归属: 文本转语音 / 基于语言模型的情感表达强度控制
- 核心创新点: 将计算机视觉与 NLP 领域成熟的任务向量算术方法迁移至大规模 LM-TTS 系统的情感强度控制任务。通过系统性消融研究,在 Qwen3-TTS 模型上逐层对比 LoRA 权重、连续编解码嵌入、离散编解码 Token 及说话人嵌入四类操作空间,揭示了任务向量算术在不同操作粒度下对跨说话人情感强度迁移的有效性边界,为 LM-TTS 情感可控性提供了系统性的方法论基准。
- Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages
- 赛道归属: TTS主观评测方法 / 多语言(印度语系)偏好分析
- 核心创新点: 构建“受控的多维度成对评测框架”,通过语言学控制(覆盖母语与混码句、跨10种Indic语言)与感知维度标注相结合,降低TTS成对偏好评测在多语言场景中的高方差与不可解释性;在大规模众包设置下,把偏好拆解到可感知维度并进行系统性偏好归因分析,从而更稳定地比较多模型/多语言TTS质量差异。
- WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models
- 赛道归属: TTS推理优化 / 高效自回归TTS
- 核心创新点: 提出WAND框架,将预训练decoder-only AR-TTS从“全序列自注意力的二次复杂度”改造为近似常数复杂度:把注意力拆分为对条件token的持久全局注意力与对生成序列的局部窗口注意力,在保持条件可达性的同时限制生成侧上下文;再结合知识蒸馏把全注意力教师的质量迁移到窗口注意力学生,实现显著降低显存/算力开销而尽量维持音质与韵律。
GitHub
- [2026-06-30] huggingface/diffusers ⭐33957
- [2026-06-29] BinWang28/audio-ai-hub ⭐935
- [2026-06-27] Ameobea/web-synth ⭐559
- [2026-06-28] apocas/restai ⭐510
- [2026-06-29] dgrauet/ltx-2-mlx ⭐64
语言大模型
arXiv
- LLM-MINE: Large Language Model based Alzheimer's Disease and Related Dementias Phenotypes Mining from Clinical Notes
- 赛道归属: 医疗NLP / 临床文本信息抽取(表型挖掘)
- 核心创新点: 提出LLM-MINE,用大语言模型将非结构化临床笔记中的ADRD(阿尔茨海默病及相关痴呆)表型进行自动化抽取与结构化归因;方法上强调以“专家定义的表型 schema/标签体系 + LLM抽取流程”来覆盖分散在叙述文本中的关键信息,并通过专家标注/验证形成可用于早筛与分期的高质量表型数据资产。
- Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety 🆕NEW
- 赛道归属: LLM安全与对抗防御
- 核心创新点: 提出了一种以"对抗性视角"为核心的LLM安全框架Yuvion,核心突破在于将安全问题重新定义为对抗性问题而非单纯的自然输入分布问题。该工作明确指出现有通用模型在涉及规划、工具调用等真实场景下的安全防护缺口,并通过构建对抗感知能力来应对策略性越狱与滥用攻击,而非仅依赖传统的过滤或拒绝机制。
- Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War
- 赛道归属: LLM评测基准 / 多智能体对抗与可靠性评测(推理+博弈+协议约束)
- 核心创新点: 提出Age of LLM这一1v1回合制对抗基准,将三类压力源系统化注入评测:战争迷雾(部分可观测)、完整外交沟通(谈判/停火/威胁且信息可隐藏)、以及严格JSON动作协议下的可靠性约束(非法动作被静默丢弃);通过私有引擎、随机地图种子与随机对手机制降低数据污染与“背题”风险,使评测更贴近真实交互式决策与工具/协议执行场景。
- From Detection to Action: Using LLM Agents for Fault-Tolerant Control 🆕NEW
- 赛道归属: LLM智能体应用(LLM Agents / 工业自动化控制)
- 核心创新点: 提出了一种面向主动容错控制的多智能体LLM框架,核心创新在于将故障检测输出转化为具有约束感知的恢复动作。通过引入"数字过程工厂孪生体"作为物理世界接口,在执行前进行仿真验证,并设计了监控、规划、动作合成、仿真、验证、重提示等多阶段工作流,实现了LLM推理能力与工业控制系统知识的结构化融合。
- Mitigating LLM-based p-Hacking by Preregistering for the Next LLM 🆕NEW
- 赛道归属: LLM研究方法论与科研可信度
- 核心创新点: 针对LLM辅助研究中普遍存在的p-hacking问题,提出了一种基于预注册的协议性解决方案。核心创新在于将实验设计与模型选择锁定在新LLM发布之前,利用"时间不可逆性"作为天然的防篡改机制,从制度层面而非技术层面切断研究者对提示词、解码参数及输出格式进行事后调优以迎合期望结果的可能性。
- Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge 🆕NEW
- 赛道归属: 跨模态知识迁移(Cross-Modal Knowledge Distillation / 视觉-语言)
- 核心创新点: 提出LaViD(语言到视觉知识蒸馏)框架,核心突破在于无需配对多模态数据,即可将纯语言LLM中的细粒度概念知识迁移至纯视觉模型。通过从LLM中主动"激发"语义概念信号作为软监督,打破了跨模态监督必须依赖视觉-语言对齐数据的传统范式,实现了单模态视觉学生模型对LLM高层语义理解能力的吸收。
- Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents 🆕NEW
- 赛道归属: LLM智能体记忆管理(LLM Agent Memory / 长会话知识更新)
- 核心创新点: 聚焦于LLM智能体在多轮长会话中的"记忆更新缺口"问题,即正确识别并丢弃已被supersede(覆盖)的过时事实。通过在真实对话数据(LongMemEval知识更新子集)上系统量化该能力缺陷,并提出针对性的诊断框架与训练方法,将记忆更新能力作为一项独立的、可测量的能力维度加以建模,填补了现有记忆管理研究忽视事实动态变更场景的空白。
- Delayed Verification Destabilizes Multi-Agent LLM Belief: Instability Thresholds and Optimal Corrector Placement 🆕NEW
- 赛道归属: 多智能体LLM系统稳定性(Multi-Agent LLM Systems / 信念传播与验证机制)
- 核心创新点: 将多智能体LLM系统中因验证延迟导致的幻觉传播问题建模为带接地校正节点的图上延迟共识问题,并利用接地Laplacian的谱分解推导出验证剂量的闭合形式稳定性阈值。核心理论突破在于揭示了"过强或过延迟的纠正均可将共识转变为振荡"这一反直觉现象,并给出最优校正节点放置策略,为多智能体系统的架构设计提供了理论指导。
- How Large Language Models Source Brand Reputation Across Languages and Markets
- 赛道归属: 大语言模型 / 品牌声誉分析 / 引用溯源
- 核心创新点: 该研究将分析视角从LLM生成的答案文本前移一步,聚焦于LLM回答时所引用的URL来源。通过融合三个Rankfor.AI数据集,覆盖128个品牌、12个市场、13种语言,对167,551条URL级别的引用记录进行系统性分类与跨语言/跨市场比较分析,揭示了LLM在品牌信息溯源过程中的语言偏差与市场差异规律,为企业AI品牌可见性管理提供了以"引用来源"为核心的新分析框架。
- Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation
- 赛道归属: 大语言模型安全评估 / 对抗鲁棒性 / 轻量化安全分类器
- 核心创新点: 针对LLM安全评估中判别器部署成本高、延迟大的痛点,系统性地探索以ModernBERT家族(含ModernBERT与Ettin)为代表的现代编码器微调分类器能否替代基于解码器的LLM安全判别器。研究通过对比编码器与解码器在对抗样本识别上的性能-成本权衡,为工业界在低延迟、低成本约束下构建安全护栏提供了系统性实证依据,核心突破在于验证了轻量级编码器架构在对抗安全评估场景中的竞争力。
GitHub
- [2026-06-30] sgl-project/sglang ⭐29799
- [2026-06-30] NVIDIA-NeMo/Speech ⭐17657 🆕NEW
- [2026-06-30] NVIDIA/TensorRT-LLM ⭐13996
- [2026-06-30] oliviazzzu/minimal-embodiment ⭐216 🆕NEW
- [2026-06-30] wonglaitung/fortune ⭐58
HuggingFace Models
HuggingFace Datasets
- [2026-06-29] Glint-Research/Fable-5-traces
Glint Research Dataset Card Fable 5 Pi Agent Traces A compact, high-signal corpus of Fable 5 coding-agen...
- [2026-06-21] Crownelius/Complete-FABLE.5-traces-2M
Complete FABLE.5 Traces 2M
Full FABLE.5 / Mythos corpus restored, with session-limit answer rows removed. Dataset Viewer | Parq...
- [2026-05-18] WithinUsAI/claude_mythos_distilled_25k
Claude Mythos Distilled 25K
A high-quality synthetic supervised fine-tuning (SFT) dataset designed to train and fine-tune any LLM to mi...
多模态大模型
arXiv
- Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling
- 赛道归属: 多模态理解(长视频理解/高效采样与推理加速)
- 核心创新点: 将长视频帧选择形式化为“准高斯采样”问题,提出一种自适应、免训练的帧采样策略:用连续、可调的软采样分布替代传统关键帧“硬采样”,在计算/显存受限下更灵活地覆盖关键时刻并抑制噪声帧,从而在不改动模型训练的前提下提升长视频理解效率与效果。
- VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 计算光学与视觉语言模型协同设计
- 核心创新点: 提出 CODA 协同设计框架,针对冻结视觉语言模型的特性,将前端元光学硬件设计与 VLM 的感知偏好联合优化,而非追求传统人类可读的图像质量指标。核心突破在于:以 VLM 的任务性能(而非图像分辨率/像差等光学指标)作为优化目标,使紧凑型元光学在尺寸/成本受限场景下仍能维持高效的多模态理解能力,打通了物理光学设计与AI模型感知之间的优化闭环。
- AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs
- 赛道归属: 多模态理解 / 跨模态评测基准
- 核心创新点: 提出AMVICC基准,系统性地对比VLMs(图像→文本)与图像生成模型IGMs(文本→图像)在相同视觉概念上的失败模式,实现跨模态失效剖析。核心创新在于将图文双向任务置于同一评测框架下,通过"跨模态失败模式对齐"揭示两类模型在物体朝向、数量感知、空间关系等基础视觉概念上的共性与差异性缺陷,为多模态系统的弱点诊断提供了对称性视角。
- Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 视觉语言模型机制可解释性
- 核心创新点: 针对视觉语言模型中"视觉感知"与"先验知识"发生冲突时的决策机制,首次提出组件级因果分析方法,综合运用残差流、注意力头、MLP 子层三个粒度的激活修补与模型组件消融实验。核心发现是跨三个 VLM 家族均存在"视觉默认、先验覆盖"的层次化因果机制——模型默认优先处理视觉输入,但特定组件可触发先验知识对视觉证据的覆盖。该工作将行为层面的冲突描述推进至可追溯的内部因果机制层面,为提升多模态系统可靠性提供了可操作的机制洞察。
- Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
- 赛道归属: 多模态理解 / GUI智能体 / 不确定性量化
- 核心创新点: 提出Argus基准,专门针对"计算机操作智能体"场景下VLM预测的不确定性量化问题,系统评估多种后验UQ方法在跨模型、跨数据集、跨GUI界面变化下的稳定性。创新点在于引入"跨体制"评测范式,分离模型、数据集、界面三个维度的UQ排名漂移,并定义拒绝决策、空间安全区域等面向GUI点击执行的实用UQ指标,填补了GUI智能体可靠性评估的空白。
- Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding
- 赛道归属: 多模态理解 / 流式视频理解
- 核心创新点: 提出CausalMem,一种无需训练的流式视频理解方法,通过构建"动态且固定预算"的记忆库来应对无限增长的视频帧。核心创新在于以因果推断视角设计帧重要性评估机制,在固定存储预算约束下动态淘汰低价值帧、保留关键语义信息,同时利用对未来指令的不确定性建模来增强记忆的通用性,实现了无训练开销下的高效长视频在线处理。
- Steering Vision-Language Models with Joint Sparse Autoencoders
- 赛道归属: 多模态理解 / 模型可解释性 / 跨模态表示控制
- 核心创新点: 提出联合稀疏自编码器,通过引入显式跨模态对齐约束,将视觉激活序列与语言激活序列联合分解为共享的、可解释的图文级别特征。相比传统单模态SAE,JSAE能从VLM内部提取真正跨模态的可控特征方向,使视觉特征可直接用作语言生成的引导向量,实现了对VLM内部多模态表示的精准解耦与可控操纵。
- AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression
- 赛道归属: 多模态理解(长时音视频理解/上下文压缩与检索式建模)
- 核心创新点: 提出 AVOC,在模态编码器与LLM之间插入可学习的 token 压缩模块,借鉴检索思想将长时音视频的冗余 token 压缩为更“可检索/可聚合”的紧凑表示,以缓解上下文窗口限制与跨模态冗余;通过在不牺牲关键信息的前提下降低 token 数,实现小时级音视频输入的可扩展理解。
- Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models
- 赛道归属: 推理优化(MLLM 视觉token剪枝/训练免调优加速)
- 核心创新点: 提出基于“谱演化”信号的免训练 token 剪枝框架:不再依赖单层注意力或相似度等局部指标,而是利用跨层表示变换的谱特征来评估 token 的全局贡献,减少位置偏置并更稳健地识别冗余视觉 token,在加速推理的同时尽量保持跨模态推理能力。
- MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism
- 赛道归属: 多模态理解 / 长视频理解 / 智能体推理
- 核心创新点: 提出MemDreamer框架,通过将感知与推理解耦,将小时级长视频理解转化为智能体式探索过程。核心创新包括:①构建层次化图记忆(三层自顶向下语义抽象结构),以增量流式方式处理视频并压缩长程时序信息;②设计智能体检索机制,按需动态查询记忆图中的相关节点,规避全序列注意力的token爆炸问题。该框架为即插即用设计,无需对底层VLM进行重新训练。
GitHub
- [2026-06-29] Blaizzy/mlx-vlm ⭐5100
- [2026-06-28] waybarrios/vllm-mlx ⭐1378
- [2026-06-25] EvolvingLMMs-Lab/NEO ⭐842
- [2026-06-26] liudaizong/Awesome-LVLM-Attack ⭐565
- [2026-06-29] FeiElysia/Tempo ⭐72 🆕NEW
强化学习
arXiv
- FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
- 赛道归属: 大语言模型强化学习对齐 / LLM RL Alignment
- 核心创新点: 针对GRPO等策略梯度方法在训练中梯度方向不稳定的问题,提出反馈驱动的双目标协同强化学习框架。核心突破在于同时优化策略目标与反馈信号目标,通过双目标协同机制动态校正梯度方向,避免单一奖励信号导致的训练偏移,从而更稳定地解锁大模型推理能力。
- Qwen-Image-2.0-RL Technical Report 🆕NEW
- 赛道归属: 文生图 / RLHF后训练优化
- 核心创新点: 针对扩散模型的后训练流水线,创新性地将RLHF与在策略蒸馏结合,构建任务特定的复合奖励模型,引入基于视觉语言模型微调的逐点打分范式与链式思维推理,从而为文生图任务提供更可靠的奖励信号,同步提升视觉质量与指令遵循能力。
- NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning 🆕NEW
- 赛道归属: 文生图 / 流匹配模型强化学习后训练
- 核心创新点: 首次系统性地识别并量化了基于流匹配模型在RL后训练中存在的"速度范数膨胀"现象(per-step velocity norm膨胀5%-15%),并提出NormGuard方法——在保持奖励提升的同时,通过范数约束抑制感知质量退化。该方法揭示了RL微调中隐藏的结构性漂移问题,填补了CFG范数重缩放理论在RL场景中的空白。
- PerturbCellRL: Verifier-Guided Reinforcement Learning for Single-Cell Perturbation Prediction 🆕NEW
- 赛道归属: 生物信息学 / 单细胞扰动预测 / 强化学习后训练
- 核心创新点: 提出PerturbCellRL框架,首次将验证器引导的强化学习引入单细胞转录组生成模型的后训练,设计多维度细胞级验证器作为奖励函数,显式约束单个生成细胞的生物一致性,突破了以往生成模型仅优化群体级预测、忽略个体细胞合理性的局限。
- Retroactive Advantage Correction: Closed-Form V-Trace Bias Correction for Delay-Aware RLHF 🆕NEW
- 赛道归属: 大语言模型对齐 / RLHF异步训练优化
- 核心创新点: 针对生产环境中奖励信号异步延迟(代码执行验证器、慢速评判集成等)导致标准PPO假设失效的问题,提出RAC方法。核心创新在于设计了闭合形式的V-Trace偏差校正机制,通过非负核函数对延迟奖励进行时序老化处理并以裁剪残差重注入,在无需修改采样架构的前提下消除延迟引入的策略梯度偏差。
- PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration 🆕NEW
- 赛道归属: 大语言模型对齐 / RLHF奖励模型校准
- 核心创新点: 针对RLHF奖励模型中多标注者偏好聚合的校准偏差问题,提出PEBS方法。创新性地为每位标注者独立拟合仿射校准器,并通过Morris-James-Stein经验贝叶斯收缩向全局先验压缩,解决了传统全局单一校准器无法捕捉标注者系统性评分偏移与斜率差异的问题,实现个性化与泛化之间的最优权衡。
- Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience 🆕NEW
- 赛道归属: 机器人控制 / Sim-to-Real迁移 / 支持约束强化学习
- 核心创新点: 提出支持约束强化学习框架,通过将策略改进限制在真实世界数据所覆盖的状态-动作支持集内,在仿真中进行无需真实世界交互的策略优化。核心创新在于利用支持约束替代传统正则化手段(如域随机化),有效规避仿真中接触与动力学不匹配导致的策略利用漏洞,确保仿真中优化的行为可安全迁移至真实硬件。
- Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It
- 赛道归属: 大语言模型智能体 / 多步工具调用强化学习
- 核心创新点: 系统性分析了多步工具调用场景下RL训练崩溃的根本原因——特定控制token的概率异常尖峰导致工具调用结构失效。核心创新在于引入监督信号对控制token进行约束,通过混合监督-强化学习范式稳定工具调用格式,从根本上解决agentic RL在工具使用场景中的稳定性问题。
- OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning
- 赛道归属: 开放域任务强化学习对齐 / Open-Ended RL Alignment
- 核心创新点: 针对创意写作等开放域任务中LLM-as-a-judge奖励模型存在风格偏见和位置不一致性问题,提出OPERA框架,以基于困惑度的内在奖励替代外部评判模型。核心突破在于利用参考模型的困惑度作为客观、无偏的奖励信号,摆脱了对外部评判器的依赖,实现开放域任务的稳定RL训练。
- Memory-Efficient Policy Libraries with Low-Rank Adaptation in Reinforcement Learning
- 赛道归属: 机器人强化学习 / 参数高效多任务策略学习
- 核心创新点: 将NLP领域的低秩适配技术迁移至机器人多任务强化学习场景,构建内存高效的策略库。核心突破在于用LoRA低秩矩阵参数化各专项任务策略,在显著降低内存占用和计算开销的同时,维持多任务策略库的性能,验证了PEFT方法在具身智能RL领域的可行性与优越性。
GitHub
- [2026-06-30] huggingface/trl ⭐18734
- [2026-06-29] rllm-org/rllm ⭐5667 🆕NEW
- [2026-06-30] radixark/miles ⭐1636
- [2026-06-29] Tencent-Hunyuan/UniRL ⭐729 🆕NEW
- [2026-06-29] Kim-Hammar/csle ⭐148 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-06-24] Qwen/AgentWorldBench
AgentWorldBench
AgentWorldBench is a comprehensive evaluation benchmark for language world models, constructed from real-world observat...
- [2025-01-15] mlabonne/open-perfectblend
🎨 Open-PerfectBlend
Open-PerfectBlend is an open-source reproduction of the instruction dataset introduced in the paper "The Perfect Blend...
世界动作模型
arXiv
- ReWorld: Learning Better Representations for World Action Models 🆕NEW
- 赛道归属 : 自动驾驶世界模型 / World Action Model for Autonomous Driving
- 核心创新点 :
[中文] 现有世界动作模型的研究主要集中于模型架构设计,而如何让模型高效学习更优质的世界表征以服务于规划任务,仍是一个待解决的问题。本文提出 ReWorld,这是首个专门面向自动驾驶世界动作模型的表征学习框架。其核心创新在于:突破了传统WAM仅依赖标准视频预测监督信号(即像素级重建损失)的局限,通过引入专门设计的表征学习目标,引导模型在训练过程中学习到更具语义性、结构性的世界状态表征,而非仅仅优化视觉保真度。这一框架与模型架构无关,具备良好的通用性,可作为现有WAM方法的即插即用增强模块,显著提升其用于规划时的表征质量。
GitHub
- [2026-06-26] OpenMOSS/Awesome-WAM ⭐984
- [2026-06-26] yuyangalin/ImageWAM ⭐92
由 Research Daily 自动生成 生成时间: 2026-06-30 01:02:35