AI 每日进展速报 - 2026-09-30
新旧
正在统计...
来源
当前筛选条件下没有条目。
数据状态 / Data Status
- GitHub 数据源本次没有返回条目;可能是暂无匹配结果,也可能是接口异常,请结合日志确认。
图像生成/编辑
arXiv
- Amplify What You Gaze At: Target Saliency Boosting in Text-to-Image Generation
- 赛道归属: 文生图 / 可控生成
- 核心创新点: 提出“目标显著性增强”任务,关注在不依赖任何视觉先验的前提下,让生成图像中指定对象更突出。其关键方法是将显著性视为相对量,通过建模目标对象与全局场景之间的相对关系来提升目标可见性,而不是仅对单个对象做局部强化。
- InGuard: Towards Generalized Inner Guardrail for Safe Text-to-Image Generation
- 赛道归属: 文生图 / 安全对齐
- 核心创新点: 提出面向安全生成的“内生护栏”思路,将安全控制从生成前后的外部分类器,转向利用模型内部表征进行更深度的风险约束。核心突破在于把安全判断与生成过程耦合,旨在提升对 NSFW 内容的泛化防护能力,而非依赖独立的事前/事后检测器。
- Beyond Emotion Prompts: Fine-Grained Text-to-Image Generation Driven by Valence-Arousal-Dominance
- 赛道归属: 文生图 / 情感可控生成
- 核心创新点: 提出基于心理学 VAD(valence-arousal-dominance)坐标的情感控制框架,将情绪强度从自然语言描述中解耦出来,转化为独立于内容文本的生成条件。方法上的关键点是用连续、可排序且语义稳定的情感控制尺度,替代模糊的情绪提示词,实现更细粒度的图像情感调控。
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- 赛道归属: 文生图 / 少步生成加速
- 核心创新点: 面向 CFG 蒸馏中的少步生成,提出信息瓶颈引导的蒸馏策略,针对不同去噪阶段动态分配指导强度,而不是采用全局静态的 guidance 注入。其方法突破在于从“粗粒度、盲目注入”转向“阶段自适应、信息选择性压缩”,以更高效地保留 CFG 轨迹中的关键信息。
- OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation
- 赛道归属: 文生图 / 偏好优化 / 细粒度对齐
- 核心创新点: 提出对象中心的自我改进偏好优化框架,聚焦提升对象属性级别的对齐能力,如颜色、形状和空间关系。核心方法是围绕对象构建偏好优化过程,并强调自举式改进,以缓解传统 DPO/GRPO 在偏好构造和计算成本上的问题,同时提升细粒度文本-图像一致性。
- AdaPilot: Towards Scene-Adaptive Policy Learning for Cross-Generator Text-to-Image Quality Optimization
- 赛道归属: 文生图 / 跨生成器质量优化
- 核心创新点: 提出场景自适应的质量优化策略,学习一种可跨生成器迁移的通用质量优化 policy,而不是为单一模型或单一任务定制。方法上的关键突破在于将质量优化从“模型绑定”转向“场景感知、跨生成器可迁移”的策略学习,使其具备更强泛化性。
- VIF-Bench: Evaluating Visual Instruction Following in Multi-Reference Image Generation 🆕NEW
- 赛道归属: 多模态图像生成评测 / 参考图像生成
- 核心创新点: 构建面向多参考、多视觉指令联合输入的评测基准,系统覆盖多参考生成、异构视觉指令组合、参考图与指令冲突等复杂场景。其创新价值主要在于补齐现有 benchmark 对“多参考 + 多视觉指令”联合设定的评测空白,并揭示模型在遵循指令与避免伪影之间的权衡规律。
- Weeding Out Bad Seeds: Initial-Noise-Robust Unlearning for Text-to-Image Diffusion Models 🆕NEW
- 赛道归属: 文生图 / 模型遗忘 / 安全卸载
- 核心创新点: 针对扩散模型遗忘中的“概率性遗忘”问题,提出初始噪声鲁棒的自适应采样策略。核心方法是根据目标概念在噪声空间中的出现区域,动态聚焦梯度更新、降低无信息区域的采样权重,从而提升概念擦除的稳定性与对抗鲁棒性,避免在特定随机初始噪声下概念重新出现。
- Attention-Scoped Guidance: Training-Free Spatial Control for Image Editing 🆕NEW
- 赛道归属: 图像编辑 / 训练无关空间控制
- 核心创新点: 提出 Attention-Scoped Guidance,将双 CFG 中原本全局统一的引导权重改为随空间位置变化的局部权重。方法直接复用编辑器已有的注意力支持图,无需训练、无需外部 mask、无需额外网络前向,即可在需要编辑的区域增强文本引导、在非编辑区域增强源图锚定,从而更好地保留背景与未编辑内容。
- V-Engram: Trigger-Indexed External Memory for Modular Text-to-Image Personalization 🆕NEW
- 赛道归属: 文生图 / 个性化生成 / 模块化记忆
- 核心创新点: 提出触发词索引的外部记忆机制,用显式 trigger 检索概念专属记忆,并将其以残差形式注入冻结的文本编码器与生成主干上下文状态。方法上的关键突破在于把个性化能力从参数微调转为可检索、可组合、可隔离的外部记忆接口,从而支持多概念访问、按提示选择性加载以及减少概念间干扰。
HuggingFace Models
HuggingFace Spaces
视频生成/编辑
arXiv
- WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
- 赛道归属: 视频生成 / 提示词增强
- 核心创新点: 提出 WanPE 作为面向现代文本到视频生成的“电影级提示词增强”模型,利用 397B 参数并基于 105 万真实视频训练,将原始文本提示提升为更适合导演式分镜规划的高质量提示,重点强化动作、镜头轨迹、光照与声音等多镜头要素的表达能力。
- CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation
- 赛道归属: 视频生成 / 物理一致性建模
- 核心创新点: 提出 CompAdapt,用于构建可适配的复合运动建模框架,面向文本到视频生成中的物理一致性问题;其方法重点突破了单一运动类型、依赖手工参数以及难以泛化到未见物理规律的限制,强调对复杂运动组合的适应能力。
- TempQ-Jail: Query-Constrained Candidate Ranking for Text-to-Video Jailbreak Attacks
- 赛道归属: 视频安全 / 文本到视频越狱攻击
- 核心创新点: 将文本到视频越狱攻击形式化为“查询受限的候选分配与排序”问题,提出 TempQ-Jail,通过组合异构攻击机制扩展候选覆盖,并估计候选的端到端攻击效果,用于在生成与安全评估代价较高的场景下更高效地筛选攻击候选。
- MotionSpec: Spectral Trajectory Supervision for Motion-Consistent Video Generation
- 赛道归属: 视频生成 / 运动一致性约束
- 核心创新点: 提出 MotionSpec,通过频谱轨迹监督为视频生成提供显式的运动级约束,针对复杂动作下的时间不连续、动作推进不一致和结构畸变问题,强化模型对运动演化过程的建模,而不仅仅依赖逐帧生成质量。
- VideoGen-Agent: Reinforcing Video Generation Agents
- 赛道归属: 视频生成 / 多模态智能体
- 核心创新点: 提出 VideoGen-Agent,将视频生成任务转化为可调用外部工具的多轮智能体决策问题,并通过多任务 agentic reinforcement learning 学习工具使用策略;方法结合监督微调与强化学习,利用类别感知的混合奖励来同时约束工具调用有效性、任务适配性与生成质量。
- Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding
- 赛道归属: 视频生成 / 身份保持
- 核心创新点: 提出 Slot-ID,利用参考视频中的时序与多视角身份信息进行槽位式身份编码,弥补单张参考图无法表达身份随视角、表情和光照变化的问题,从而缓解面部变形、姿态锁定、身份漂移和过度平滑等现象。
- LongLive-Plug: Once-for-All Distillation for Video Generation 🆕NEW
- 赛道归属: 视频生成 / 蒸馏加速与长视频生成
- 核心创新点: 提出 LongLive-Plug,一种 once-for-all 蒸馏框架,将单步 CFG、少步采样和长上下文误差修正等能力蒸馏为可复用 LoRA,并以训练无关、即插即用的方式部署到兼容下游模型中,避免针对每个专用模型重复蒸馏。
- FracGen: Learning How Objects Stretch and Tear with Physics-Informed Video Generation 🆕NEW
- 赛道归属: 视频生成 / 物理驱动生成
- 核心创新点: 提出 FracGen,将断裂动力学引入视频生成,通过物理信号条件控制物体撕裂过程;同时构建 FracSim 生成带有像素对齐物理场的断裂数据,并结合联合预测物理场与 RGB 视频、以及物理一致性损失,使模型能学习材料特异的断裂行为并支持细粒度可控生成。
- LIFT: Layout-In-Future Video Generation under Large Viewpoint Change via On-Policy Self-Distillation 🆕NEW
- 赛道归属: 视频生成 / 可控视角与布局控制
- 核心创新点: 提出 LIFT,在相机控制之外引入 Layout-In-Future 控制,允许用户显式指定未来视角中“出现什么以及出现在哪里”;针对仅有稀疏最后一帧布局监督的困难,进一步提出 on-policy self-distillation,将密集布局教师的控制能力迁移到仅依赖最后一帧布局的学生模型。
- Rollout-Marginal Distillation for Long-Horizon Autoregressive Video Generation 🆕NEW
- 赛道归属: 视频生成 / 自回归长时程蒸馏
- 核心创新点: 提出 Rollout-Marginal Distillation(RMD),将自回归视频生成中的长 rollout 训练拆分为“逐块独立质量评分 + 视频级时序一致性恢复”两阶段:先用 chunk teacher 对每个片段独立打分以避免上下文伪影干扰质量优化,再用视频级 DMD 恢复整体时间连贯性,从而缓解长序列误差累积。
音频生成
arXiv
- Interactive TTS: Dynamic Speaking Style Adaptation for Expressive Speech Synthesis
- 赛道归属: 文本到语音(TTS)/多轮上下文感知语音合成
- 核心创新点: 针对多轮多模态对话中的说话风格动态迁移问题,提出显式建模上下文与风格决策的TTS方法,缓解传统端到端上下文映射带来的“风格、音色、内容”纠缠问题,从而提升指令跟随能力并减少跨轮次音色漂移。
- TinyAudio: Compact and Efficient Text-to-Audio Generation for Low-Resource Deployment
- 赛道归属: 文本到音频生成(TTA)/轻量化端侧部署
- 核心创新点: 提出面向低资源部署的紧凑型流匹配TTA框架,将生成模型、文本编码器与音频VAE进行小参数化设计,核心是以单流Transformer流匹配模型为主干,并配套音频对齐文本编码器与轻量音频表征模块,在尽量压缩参数规模的同时保持文本到音频生成能力。
- ReaFlow-TTS: Realization-Conditioned Flow Matching for High-Quality and Controllable Speech Synthesis
- 赛道归属: 文本到语音(TTS)/可控语音合成
- 核心创新点: 提出 realization-conditioned flow matching 框架,针对同一条件下不同语音实现会对应不同目标速度场的问题,引入“实现条件”来建模生成分歧,并提供更具语义可解释性的属性操控接口,解决确定性速度场只能学习条件均值、难以表达实现差异的局限。
- UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation
- 赛道归属: 文本到音频生成(TTA)/联合表征学习与生成建模
- 核心创新点: 打破“先训练音频tokenizer、再冻结后做生成”的两阶段范式,提出连续tokenization与潜空间流匹配联合学习框架,使表征学习与生成目标同步优化,从而避免仅以重建为导向的离散/潜表示对生成任务不一定最优的问题。
- TTS-Guard: Black-Box Ownership Verification of Text-to-Speech Models via Adaptive Adversarial Speaker-Pair Fingerprints
- 赛道归属: 文本到语音(TTS)/模型水印与版权验证
- 核心创新点: 面向黑盒TTS模型所有权验证,提出自适应对抗式说话人对指纹方案,通过设计对抗性说话人对特征来嵌入可验证信号,并考虑语音波形易被常规处理破坏、且人耳感知预算严格的约束,实现对TTS模型的黑盒归属验证。
- COT-TTS: Audio Context-Aware Text-to-Speech with Chain-of-Thought Reasoning
- 赛道归属: 文本到语音(TTS)/上下文推理式语音合成
- 核心创新点: 将链式思维推理引入TTS上下文建模,构建基于历史对话音频、目标文本与参考语音的推理式语音合成任务,使模型不再仅依赖显式风格指令,而是从历史对话中推断当前应采用的说话风格。
- ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling 🆕NEW
- 赛道归属: 视频到音频生成(V2A)/多模态可控生成
- 核心创新点: 提出统一的多模态V2A框架,支持视频、文本与参考音频的联合控制;通过融合CLIP与时空音视频编码器增强视觉-文本对齐,采用时间-音色解耦抑制冗余时序信息并保留可辨识音色特征,同时引入统一表示对齐与随机模态dropout提升跨模态冲突下的鲁棒可控性。
- EmoRES-TTS: Residual-Enhanced Vector Steering for Emotional Speech Generation 🆕NEW
- 赛道归属: 文本到语音(TTS)/情感可控语音合成
- 核心创新点: 提出无需重新训练主干模型的情感向量操控方法,将情感 steering vector 分解为“远离中性表达的共享分量”和“指向目标情感的残差分量”,并分别控制两部分以增强情感遵循度,在冻结模型上实现更强的情感可控性。
- RAWD-TTS: Ratio-Free Reward Alignment for Discrete-Diffusion Voice Cloning 🆕NEW
- 赛道归属: 文本到语音(TTS)/离散扩散声纹克隆与奖励对齐
- 核心创新点: 提出 ratio-free 的奖励对齐训练方法,在离散扩散声纹克隆中直接对解码样本进行识别与说话人奖励打分,再用组内相对优势加权掩码token重建,避免依赖反向轨迹似然或目标音频,从而更好对齐内容准确性与说话人身份保持。
- RVQ Position Aware Speculative Decoding for On Device Text to Speech 🆕NEW
- 赛道归属: 文本到语音(TTS)/端侧推理加速
- 核心创新点: 针对RVQ码本逐步解码的高串行开销,提出位置感知的 speculative decoding 方案,在MultiCodeDecoder中对残差向量量化token进行并行猜测与验证,以极小额外参数和较低验证开销显著减少模型调用次数,并保持与原系统一致的采样分布与识别性能。
HuggingFace Models
HuggingFace Datasets
- [2026-09-28] espnet/yodas3
语言大模型
arXiv
- DRIFT: Data Selection for LLM Instruction Tuning via On-Policy Attribution 🆕NEW
- 赛道归属: 推理优化 / 数据选择 / 指令微调
- 核心创新点: 提出基于 on-policy attribution 的数据选择方法 DRIFT,用模型自身在验证查询上的采样回答构造验证目标,并按这些回答对原始训练样本的影响力进行排序;同时对影响分数中的梯度范数依赖进行校正。其关键突破在于不再以“节省数据”为目标,而是通过选择同一语料中的高影响样本继续微调,尝试突破全量数据训练的性能上限。
- When Context Misleads: In-context Learning with Jurisdiction in Large Language Models
- 赛道归属: 复杂推理 / 上下文学习 / 对齐鲁棒性评测
- 核心创新点: 构建 FakeContextBench,用伪科学式上下文干扰来专门评测模型的“context authority”,即判断上下文信息是否应当主导最终答案的能力。该工作强调现有 ICL 后训练方法往往只学会从示例中抽取模式,却忽视了对上下文权威性的辨别,从而暴露模型在“上下文误导”场景下的脆弱性。
- Representation-guided in-context learning for medical image interpretation with multimodal large language models
- 赛道归属: 多模态理解 / 医疗影像 / 上下文学习
- 核心创新点: 提出训练免费的 representation-guided in-context learning 框架 RG-ICL,通过冻结编码器检索与查询表示对齐的示例,再用于多模态大模型的上下文学习。方法核心在于用表示相似性引导示例选择,从而在不进行任务特定参数更新的情况下,提升医疗影像解释能力。
- Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning
- 赛道归属: 机器人规划 / 开放世界智能体 / 神经符号推理
- 核心创新点: 提出融合符号规划、强化学习与 LLM 的神经符号架构,用于应对开放世界中的新颖性。其方法重点在于:当符号规划器因缺少新对象交互算子而无法生成计划时,借助 LLM 与 RL 学习如何处理新对象,从而补齐规划域中的能力缺口。
- ReCAP: Retrieval-Guided Capability Reuse for Multimodal Continual Instruction Tuning 🆕NEW
- 赛道归属: 多模态持续学习 / 指令微调 / 检索增强
- 核心创新点: 提出 ReCAP,通过外部检索与 LLM 构建领域知识、推理知识和格式知识库,并在每个持续阶段为指令检索相关知识,指导能力复用与实例级能力路径生成。进一步引入 adaptive subspace recycling,用共享基与阶段特定核心参数化可复用能力模块,在保留历史重要方向的同时回收剩余容量,以缓解跨阶段遗忘。
- Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training 🆕NEW
- 赛道归属: 推理优化 / 强化学习后训练 / 无奖励优化
- 核心创新点: 提出 RFPO,将预训练且校准后的 critic 重新利用为 rollout 级奖励、GAE 的 value baseline,以及未完成前缀的成功预测器,实现无需外部奖励标签、逐步标注或完整 rollout 的策略优化。其关键方法突破是利用 critic 对未来结果的预测能力提供稠密学习信号,并通过二值化去偏分数抑制长度偏置,从而在降低计算与显存开销的同时保持性能。
- SeOPD: Self-Evolving LLMs via Online Policy Distillation from Self-Generated Chain-of-Thought 🆕NEW
- 赛道归属: 自我进化 / 在线策略蒸馏 / 思维链学习
- 核心创新点: 提出 SeOPD,让同一个 LLM 的 deep-thinking 模式生成 CoT,再将该 CoT 作为 privileged information 去监督 non-thinking 模式的 token 级输出,实现无需外部标注或环境反馈的在线策略蒸馏。方法的核心在于把模型自身推理过程中涌现的信息内化到共享参数中,从而同时提升非思考与深度思考能力。
- LLM Alignment--Utility Asymmetry under Semantic-Preserving Transformations 🆕NEW
- 赛道归属: 对齐鲁棒性 / 安全性评测 / 分布偏移
- 核心创新点: 通过语义保持、规则可逆的合成变换,系统检验 LLM 对分布偏移下的对齐泛化能力,提出“Alignment-utility asymmetry”现象:模型在变换输入上往往仍能保持任务效用,但安全对齐失效会更显著地恶化。该工作的方法价值在于把对齐问题从攻击视角转为受控探针,揭示语义不变但表面形式变化时,效用与安全的泛化并不同步。
- TemporalGraphLLM: Temporal Graph Neural Networks with Large Language Models for Dynamic Text-Attributed Graphs 🆕NEW
- 赛道归属: 动态图学习 / 多模态图推理 / 图文联合建模
- 核心创新点: 提出 TemporalGraphLLM,将任意 temporal GNN 与 LLM 结合,用于动态文本属性图的联合建模。其关键创新包括:通过 graph-time-aware instruction tuning 让 LLM 学习图-时间任务格式,并用 temporal GNN injection 以图嵌入替代专门的附加 token,从而把时序图结构信息更直接地注入 LLM 推理过程。
- From Concept Alignment to Causal Grounding: An Intervention Test of Chain-of-Thought Faithfulness
- 赛道归属: 思维链可解释性 / 机制可解释性 / 因果分析
- 核心创新点: 将 CoT faithful 重新定义为“内部概念 grounding”问题,通过干预测试考察模型的 CoT 推理是否调用了与直接预测相同的内部概念,以及这些共享概念是否对答案具有因果驱动作用。该工作的方法突破在于从输入输出相关性转向内部计算机制的因果检验,以评估 CoT 是否真正反映模型的真实推理过程。
HuggingFace Datasets
- [2026-09-26] XiaomiMiMo/MiMo-V2.6-RL-oss
- [2026-09-24] MoreThought/Fable-5.1-Max-Reasoning-Filtered-10000x
多模态大模型
arXiv
- Similar Choices, Different Attention: Cross-Modal Associations in Humans and Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 跨模态注意力分析
- 核心创新点: 该工作在相同刺激条件下同时比较人类与VLM的选择结果和眼动轨迹,避免了以往“人机使用不同任务或不同刺激”带来的不可比问题;进一步通过人类选择微调、以人类注视训练模型注意力等方式,分别检验“选择对齐”和“注意力对齐”是否足以代表人类一致的跨模态加工,揭示二者并不等价,且模型注意力与人类凝视的匹配甚至不如中心偏置基线。
- PRISM-VLM: A Multi-Axis Discriminative Benchmark for Compact Vision-Language Models
- 赛道归属: 多模态理解 / 紧凑型VLM评测
- 核心创新点: 提出PRISM-VLM这一多轴判别式基准,不再把模型压缩为单一准确率,而是沿七个维度对每个样本进行细粒度评分,用于刻画紧凑型VLM的典型失效模式;其方法论突破在于从“单点分数”转向“多维诊断”,更适合比较小型VLM在不同能力侧面的差异。
- SalQ-VLM: Fine-Grained Saliency-Guided Quantization for Vision-Language Models
- 赛道归属: 模型压缩 / 视觉语言模型量化
- 核心创新点: 提出面向VLM的细粒度显著性引导量化方法SalQ-VLM,针对VLM中固有的激活特征设计量化策略;核心思路是利用细粒度显著性信息来指导后训练量化,从而在无需重训练的前提下更有针对性地压缩模型并降低精度损失,补足了VLM量化研究相对不足的问题。
- Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
- 赛道归属: 多模态理解 / 情感推理与因果分析
- 核心创新点: 通过基于steering vector的因果归因框架,分析并增强大视觉语言模型中的情感电路,重点刻画跨模态信息如何从视觉刺激流向情感叙事生成;方法上将“情感理解”从黑箱表征转为可干预、可归因的跨模态信息流问题,从而支持对情感相关内部机制的解释与增强。
- When Words Speak Louder than Images: Towards Understanding Language Bias in Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 语言偏置诊断
- 核心创新点: 该工作提出一个四阶段推理诊断框架,把VLM中的语言偏置传播过程拆解为若干相互依赖的推理阶段,并分别考察语言先验与跨模态覆盖在各阶段中的演化;其方法论贡献在于不只判断“是否有偏置”,而是追踪偏置如何在推理链路中形成、累积并最终导致错误预测。
- OmniMoE-VL: A Sparse Vision-Language Model with Coupled Visual-Depth Routing 🆕NEW
- 赛道归属: 稀疏多模态模型 / 视觉-语言路由
- 核心创新点: 提出OmniMoE-VL,通过耦合的视觉深度路由投影器,为每个图像-提示对动态选择一组稀疏的中间视觉层,并将该全局偏好同时用于局部patch融合与向语言模型的动态视觉注入;创新点在于把“哪些视觉中间表征应暴露给语言侧”变成问题相关的路由决策,并与MoE式专家路由协同,从而实现更灵活的问答式视觉访问。
- Gradient-Guided Decoupled Adaptation for Geospatial Vision-Language Models 🆕NEW
- 赛道归属: 地理多模态理解 / 多任务优化
- 核心创新点: 提出Gradient-Guided Decoupled Adaptation(G2DA),利用任务梯度特征对地理VLM的多任务适配进行解耦组织:先按梯度引导将任务划分为视觉中心与语言中心组,再基于梯度相似性构建模态专属课程,并通过双向回放缓解顺序优化带来的遗忘;其关键突破是用梯度结构显式建模任务间冲突,而非简单共享统一多任务训练。
- Does Local Video Understanding Transfer Across Encounters? The EgoGears Benchmark 🆕NEW
- 赛道归属: 具身多模态理解 / 跨视频迁移评测
- 核心创新点: 提出EgoGears基准,将单视频与多视频问题结合起来,专门诊断局部视频理解能否跨遭遇迁移;其设计通过同一路线的重复行走、不同速度与光照条件下的egocentric记录,区分“局部感知能力”与“跨视频证据绑定、对应关系建立、路线状态跟踪”三类能力,揭示多视频性能下降主要来自观察—证据绑定与顺序状态追踪,而非仅仅因为视频数量增加。
- It's Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them 🆕NEW
- 赛道归属: 多模态评测 / VLM鲁棒性与替代性测试
- 核心创新点: 提出MIST(Misleading-Image Stress Test),用“对齐图像、误导图像、无图像”三种条件测试VLM裁判是否真正依赖图像内容;方法上通过让标签理论上应只由文本决定,系统检验图像存在本身是否会扰动判断,结果显示影响主要来自“有图像”这一配置而非图像语义本身,从而指出替代性评估必须控制上下文干扰。
- Selective Channel Restoration for Backdoored Vision-Language Models 🆕NEW
- 赛道归属: 多模态安全 / 后门防御
- 核心创新点: 提出Perturb-Select-Restore(PSR)后训练防御,通过发现后门VLM投影层存在“projection fragility”——对有界扰动更敏感——来定位最脆弱的输出通道,并将这些通道参数恢复为预训练值;其方法优势在于只对投影接口做稀疏更新、推理时零额外开销,同时能显著压低攻击成功率并尽量保持干净任务性能。
HuggingFace Models
- apple/LensVLM-9B 🆕NEW
强化学习
arXiv
- MaD-RL: Matching Distributions for Calibrating LLMs with Reinforcement Learning 🆕NEW
- 赛道归属: 大语言模型后训练 / 分布匹配式强化学习
- 核心创新点: 提出面向输出分布控制的通用RL框架,将传统只优化单个输出期望奖励的后训练范式扩展为“分布匹配”;通过对潜在类别属性的目标分布建模,设计KL、JS等不同散度对应的奖励函数,并指出已有方法可视为L2散度的特例,从而实现对模型输出多样性、类别比例与约束满足的更精细控制。
- RL Starts before RL: On Policy Distillation for Better Reinforcement Learning
- 赛道归属: 大语言模型后训练 / 策略蒸馏与强化学习初始化
- 核心创新点: 研究on-policy distillation作为RL前置阶段,强调“从什么策略开始训练”会显著影响最终RL性能;核心发现是蒸馏不仅提升初始准确率,还能在共享RL设置下带来更高的最终性能,说明策略蒸馏可作为强化学习的有效预热与初始化机制。
- Jaxolotl: A Unified High-Performance Benchmark Suite for LTL-Based Multi-Task RL 🆕NEW
- 赛道归属: 多任务强化学习 / LTL指令跟随基准与评测
- 核心创新点: 构建统一的高性能LTL多任务RL基准套件,将六种代表性算法与四个环境整合到模块化JAX实现中,并通过静态数组预编译符号任务表示实现全流程JIT加速;同时引入标准化、统计稳健的评测协议,使不同方法能够在更大规模、更可复现的条件下进行公平比较。
- Guide, Then Let Go: Gap-Adaptive Teacher Scheduling for Sparse-Reward Agentic RL 🆕NEW
- 赛道归属: 稀疏奖励智能体强化学习 / 教师-学生协同训练
- 核心创新点: 提出Gap-Adaptive Teacher Scheduling,将on-policy distillation项的权重与师生性能差动态绑定:当教师明显强于学生时提供过程级引导,随着学生逼近教师性能逐步减弱并最终撤除指导;该机制解决了稀疏奖励下的冷启动问题,同时避免后期过度依赖教师而抑制学生继续提升。
- Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL 🆕NEW
- 赛道归属: 音频-视频联合生成 / 多奖励强化学习
- 核心创新点: 提出Adaptive Reward Routing,在forward-process RL中同时自适应“更新作用位置”和“多奖励协调方式”;一方面利用跨注意力响应作为跨模态影响的代理,动态重加权token级损失并缩放跨模态层梯度,另一方面保留预设奖励权重作为偏好先验,并用分支级奖励-梯度交互进行残差修正,以缓解训练过程中多目标冲突与主导奖励压制弱目标的问题。
- HaPRL: Human-Anchored Process Reinforcement Learning for Visual Search Agent 🆕NEW
- 赛道归属: 视觉搜索智能体 / 过程级强化学习
- 核心创新点: 提出HaPRL,将人类搜索行为作为过程监督锚点来强化视觉搜索轨迹,而不仅仅奖励最终答案;通过构建标注平台收集细粒度人类搜索数据,并设计基于人类轨迹的任务自适应判别器对rollout进行打分,从而纠正“结果对但路径错”的训练偏差,提升过程对齐与后续结果优化效率。
- State Trace Rationale As Auxiliary Task in Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习辅助表征学习 / 可解释状态追踪
- 核心创新点: 提出STRAT作为辅助任务,让RL智能体在线预测自身状态的短文本轨迹;该轨迹由环境规则自动生成,无需人工标注,并通过单一辅助头接入标准策略网络,在稀疏奖励任务中同时增强状态表征、缓解表示塌缩,还提供了低成本、可读的智能体信念解释。
- RoXDrive: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving via Action-Faithful Rollouts 🆕NEW
- 赛道归属: 自动驾驶 / 闭环强化学习后训练
- 核心创新点: 提出RoXDrive,通过“动作忠实”的世界模型rollout筛选来做闭环RL后训练;先用动作-视觉忠实度评估器判断生成的未来场景是否真实反映条件动作,再仅保留忠实rollout进行密集安全评分与场景级优化,从而缓解基于日志模仿学习的因果混淆以及世界模型中的动作-视觉不一致问题。
- Where Does Staleness Accumulate? Pool Aware Effective Staleness Control for Asynchronous RL in LLM Post-Training 🆕NEW
- 赛道归属: 大语言模型后训练 / 异步强化学习与时效性控制
- 核心创新点: 提出PACE,将轨迹陈旧度拆解为生成阶段与等待阶段两部分,并基于池容量构造自适应拒绝预算;同时用结合前缀感知生成陈旧度与等待陈旧度的有效陈旧度分数筛选轨迹,避免长轨迹因跨越多个策略版本而被不公平惩罚,在保留异步训练吞吐优势的同时控制policy lag。
- Group-Marginalized Self-Rewarding RL Drives Zero-Label Self-Evolving 🆕NEW
- 赛道归属: 大语言模型自奖励强化学习 / 零标注自进化
- 核心创新点: 提出Group-Marginalized Advantage Estimation,将基于rollout组的奖励信号从单一组上下文扩展为跨可能上下文的响应级分布估计;通过对不同组上下文下的奖励实现进行边缘化,计算更稳定的期望优势,从而减少随机组上下文带来的奖励噪声,提升自奖励RL的稳定性、泛化性与低成本自进化能力。
HuggingFace Models
HuggingFace Datasets
- [2026-09-30] FineEnvs/SmolDataEnvs
- [2026-09-21] Harland/OmniVChat
- [2026-09-25] genrobot2025/Gen-HumanEgo 🆕NEW
世界动作模型
arXiv
- EVO-WAM: Evolving World Action Models through Video-Action Verification 🆕NEW
- 赛道归属: 机器人操作 / 世界动作模型 / 测试时自适应
- 核心创新点: 提出 EVO-WAM,通过“自生成轨迹再训练”的方式让世界动作模型适配未见任务;先加入状态预测与锚定多帧上下文以支持无需外部执行反馈的自回归展开,再用视觉语言模型筛选任务完成前缀、结合逆动力学模型验证视频-动作一致性,最后对已验证前缀进行迭代训练,从而在不额外采集专家演示的情况下提升新任务成功率。
- V2X-WAM: A Cooperative World Action Model for End-to-End Autonomous Driving 🆕NEW
- 赛道归属: 自动驾驶 / V2X协同感知 / 世界动作模型
- 核心创新点: 提出 V2X-WAM,将协同场景理解、动作生成与未来世界推理紧密耦合;利用车端与路侧观测构建可靠性感知的时空表示,并将路侧信息压缩为量化消息以降低通信开销;在此基础上,规划器生成候选轨迹并显式条件化未来占用与动态流预测,再将预测到的世界后果反馈用于修正轨迹,实现动作与环境演化的闭环交互。
- NeuronDiscover: Agent-in-Twin for Mechanistic Discovery in Neuronal Microenvironments with World Action Models 🆕NEW
- 赛道归属: 科学发现 / 神经机制发现 / 交互式实验设计 / 世界动作模型
- 核心创新点: 提出 NeuronDiscover,将共享的、机制约束的 WAM 用于“预测—干预—观测”一体化决策;通过显式建模 twin confounding,联合维护机制与模型偏差的信念,并据此设计实验;同时用 MIOY 图记录与修订机制-干预-观测-结果关系,最终编译为带有偏差校正接受边界的可执行程序,以提升在稀疏观测下的机制判别与关系解析能力。
- What Makes World Action Models Generalize? An Empirical Study of Test-Time Future Modeling 🆕NEW
- 赛道归属: 世界动作模型 / 测试时推理 / 泛化能力分析
- 核心创新点: 通过系统实证分析明确 WAM 泛化收益的来源,发现去掉推理阶段未来条件化后,模型在环境扰动、数据效率和任务泛化三方面均明显退化;进一步指出收益主要来自“首个去噪步骤”而非完整未来生成,据此提出 Simple-WAM,将未来建模简化为一次对全噪声视频 token 的前向处理,并同步调整训练时噪声日程,使其在保持高效推理的同时保留更强泛化能力。
- AquaWAM: A Dynamics-aware World Action Model for Underwater Embodied Agents 🆕NEW
- 赛道归属: 水下机器人 / 具身智能 / 世界动作模型
- 核心创新点: 提出 AquaWAM,面向水下具身体系统式建模动作相关与被动物理动力学,而非仅预测未来图像;显式纳入推进器死区、惯性滑行和环境流等持续影响因素,并利用 DVL、IMU、压力传感器和关节编码器等紧凑状态进行建模,摄像头仅用于语义理解目标与位姿,从而在降低模型规模与计算成本的同时,更适配水下场景的动力学特性。
- InternW0-$\Delta$: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data
- 赛道归属: 机器人操作 / 世界动作模型 / 大规模预训练
- 核心创新点: 该工作提出 InternW0-Δ,核心在于用 2 万小时以上的异构开放数据预训练统一 WAM,将视觉动力学、场景语义、几何与运动等多种先验整合到同一动作生成框架中,以提升通用机器人操作能力;摘要中强调其在仿真基准与真实机器人平台上均优于先前方法。
- Rolling-WAM: World Action Models with Rolling Imagination
- 赛道归属: 机器人操作 / 世界动作模型 / 低延迟闭环规划
- 核心创新点: 提出 Rolling-WAM,将联合视频-动作去噪分摊到连续重规划周期中;通过维护一个处于不同噪声层级的滑动窗口,在每一步只推进部分去噪与更新,从而避免每次重规划都完整执行一次联合去噪,降低延迟并提升闭环响应速度。
- Latent evolving World Action Model
- 赛道归属: 世界动作模型 / 潜空间建模 / 生成式控制
- 核心创新点: 该工作聚焦于基于 VDM 的 WAM 效率瓶颈,提出“latent evolving”范式以摆脱对大规模视频生成预训练的强依赖;核心思路是将观察先编码为 VAE 潜变量,再在更轻量的潜空间中演化并提取对动作生成有效的特征,从而提升 WAM 的效率与可扩展性。
- The Right Future for Action: Learning Action-Relevant Predictive States in World Action Models
- 赛道归属: 世界动作模型 / 表征学习 / 控制相关预测状态
- 核心创新点: 通过表征诊断指出“未来越可预测”并不等于“越利于动作解码”,因此提出学习动作相关预测状态;该方向强调未来变化中真正对控制有用的信息应被显式保留,且可线性读取的动作信息具有空间集中性,从而推动 WAM 从泛化式未来表征转向面向控制的预测状态学习。
- ME-Dex 1.0: Bringing Heterogeneous Tactile Sensing into World Action Modeling
- 赛道归属: 多模态机器人感知 / 触觉-视觉融合 / 世界动作模型
- 核心创新点: 提出将触觉纳入 WAM 的统一建模框架,不再把触觉仅作为条件输入,而是与视觉、动作一起联合预测未来触觉状态、视觉观测和动作;其关键突破在于把触觉信号视作与视频同等重要的“演化观测”,用于补足物理交互中的直接接触信息,从而增强世界模型对接触过程的刻画能力。
由 Research Daily 自动生成 生成时间: 2026-09-30 13:30:54