AI 每日进展速报 - 2026-10-01
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- Amplify What You Gaze At: Target Saliency Boosting in Text-to-Image Generation
- 赛道归属: 文生图 / 可控生成
- 核心创新点: 提出“目标显著性增强”任务,关注在不依赖任何视觉先验的前提下,让生成图像中指定对象更突出。其关键方法是将显著性视为相对量,通过建模目标对象与全局场景之间的相对关系来提升目标可见性,而不是仅对单个对象做局部强化。
- POET: Preference Optimization for Enhanced Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图优化 / 提示词重写
- 核心创新点: 提出POET,通过LLM先对用户输入进行自动提示词重写,再送入冻结的文生图骨干模型;其关键创新在于设计复合奖励并采用迭代式DPO训练,让重写器直接从多模态反馈中学习“模型偏好”的提示结构,且不依赖高成本SFT数据,从而提升图文对齐、视觉质量与美学表现,并具备跨不同T2I骨干的迁移能力。
- InGuard: Towards Generalized Inner Guardrail for Safe Text-to-Image Generation
- 赛道归属: 文生图 / 安全对齐
- 核心创新点: 提出面向安全生成的“内生护栏”思路,将安全控制从生成前后的外部分类器,转向利用模型内部表征进行更深度的风险约束。核心突破在于把安全判断与生成过程耦合,旨在提升对 NSFW 内容的泛化防护能力,而非依赖独立的事前/事后检测器。
- Beyond Emotion Prompts: Fine-Grained Text-to-Image Generation Driven by Valence-Arousal-Dominance
- 赛道归属: 文生图 / 情感可控生成
- 核心创新点: 提出基于心理学 VAD(valence-arousal-dominance)坐标的情感控制框架,将情绪强度从自然语言描述中解耦出来,转化为独立于内容文本的生成条件。方法上的关键点是用连续、可排序且语义稳定的情感控制尺度,替代模糊的情绪提示词,实现更细粒度的图像情感调控。
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- 赛道归属: 文生图 / 少步生成加速
- 核心创新点: 面向 CFG 蒸馏中的少步生成,提出信息瓶颈引导的蒸馏策略,针对不同去噪阶段动态分配指导强度,而不是采用全局静态的 guidance 注入。其方法突破在于从“粗粒度、盲目注入”转向“阶段自适应、信息选择性压缩”,以更高效地保留 CFG 轨迹中的关键信息。
- OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation
- 赛道归属: 文生图 / 偏好优化 / 细粒度对齐
- 核心创新点: 提出对象中心的自我改进偏好优化框架,聚焦提升对象属性级别的对齐能力,如颜色、形状和空间关系。核心方法是围绕对象构建偏好优化过程,并强调自举式改进,以缓解传统 DPO/GRPO 在偏好构造和计算成本上的问题,同时提升细粒度文本-图像一致性。
- Steering Fields: Adaptive Vector Fields for Safe Image Generation and Beyond 🆕NEW
- 赛道归属: 安全可控生成 / 图像编辑
- 核心创新点: 提出Steering Fields,将传统“全局固定 steering vector”推广为可随生成过程动态重估方向的自适应向量场;该方法在flow模型的噪声状态上逐步更新引导方向,形成可连续调节的安全控制强度与内容保真度权衡,并支持概念的同时诱导与抑制。由于不依赖显式空间mask或对象先验,它还能自然保持局部结构,进一步可作为无反演、模型无关的结构保持式图像编辑方法。
- AdaPilot: Towards Scene-Adaptive Policy Learning for Cross-Generator Text-to-Image Quality Optimization
- 赛道归属: 文生图 / 跨生成器质量优化
- 核心创新点: 提出场景自适应的质量优化策略,学习一种可跨生成器迁移的通用质量优化 policy,而不是为单一模型或单一任务定制。方法上的关键突破在于将质量优化从“模型绑定”转向“场景感知、跨生成器可迁移”的策略学习,使其具备更强泛化性。
- CogCanvas: A Benchmark for Evaluating Multi-Subject Reference-Based Image Generation 🆕NEW
- 赛道归属: 多主体参考图像生成 / 基准评测
- 核心创新点: 提出CogCanvas,专门面向“多人物身份 + 多对象/服饰绑定 + 背景场景约束”的参考式生成难题构建评测基准;其创新在于同时覆盖多身份组合、人物-物体交互与背景落地三类关键维度,并通过结构化交互图和位置图提供监督信号。基准还设计了面向多参考场景的BG-Sim与Attr-VQA两项指标,用于分别评估背景一致性和属性/交互绑定能力,从而更全面暴露现有模型在多人规模增大时的退化问题。
- Learning Normal Diffusion Dynamics for Backdoor Defense in Text-to-Image Models 🆕NEW
- 赛道归属: 文生图安全防御 / 后门检测
- 核心创新点: 提出NDDL,从“扩散转移动力学”而非静态异常特征出发进行后门防御;方法仅利用干净样本学习扩散轨迹在cross-attention、latent和noise多空间中的正常时序演化,并训练一个时间条件动力学模型预测扩散转移。推理时通过观测转移与预测转移之间的偏差来度量动力学不一致性,实现后门检测;同时还可通过低语义词替换进行触发器定位,且不需要预先知道后门类型。
GitHub
- [2026-10-01] pydantic/pydantic-ai ⭐20301 🆕NEW
- [2026-10-01] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13529 🆕NEW
- [2026-10-01] AceDataCloud/Nexior ⭐397 🆕NEW
- [2026-10-01] WSL043/dsh-codex-subscription ⭐113 🆕NEW
- [2026-10-01] yuji-hatakeyama/opencode-gpt-imagegen ⭐101 🆕NEW
HuggingFace Models
HuggingFace Spaces
视频生成/编辑
arXiv
- WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
- 赛道归属: 视频生成 / 提示词增强
- 核心创新点: 提出 WanPE 作为面向现代文本到视频生成的“电影级提示词增强”模型,利用 397B 参数并基于 105 万真实视频训练,将原始文本提示提升为更适合导演式分镜规划的高质量提示,重点强化动作、镜头轨迹、光照与声音等多镜头要素的表达能力。
- CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation
- 赛道归属: 视频生成 / 物理一致性建模
- 核心创新点: 提出 CompAdapt,用于构建可适配的复合运动建模框架,面向文本到视频生成中的物理一致性问题;其方法重点突破了单一运动类型、依赖手工参数以及难以泛化到未见物理规律的限制,强调对复杂运动组合的适应能力。
- TempQ-Jail: Query-Constrained Candidate Ranking for Text-to-Video Jailbreak Attacks
- 赛道归属: 视频安全 / 文本到视频越狱攻击
- 核心创新点: 将文本到视频越狱攻击形式化为“查询受限的候选分配与排序”问题,提出 TempQ-Jail,通过组合异构攻击机制扩展候选覆盖,并估计候选的端到端攻击效果,用于在生成与安全评估代价较高的场景下更高效地筛选攻击候选。
- MotionSpec: Spectral Trajectory Supervision for Motion-Consistent Video Generation
- 赛道归属: 视频生成 / 运动一致性约束
- 核心创新点: 提出 MotionSpec,通过频谱轨迹监督为视频生成提供显式的运动级约束,针对复杂动作下的时间不连续、动作推进不一致和结构畸变问题,强化模型对运动演化过程的建模,而不仅仅依赖逐帧生成质量。
- VideoGen-Agent: Reinforcing Video Generation Agents
- 赛道归属: 视频生成 / 多模态智能体
- 核心创新点: 提出 VideoGen-Agent,将视频生成任务转化为可调用外部工具的多轮智能体决策问题,并通过多任务 agentic reinforcement learning 学习工具使用策略;方法结合监督微调与强化学习,利用类别感知的混合奖励来同时约束工具调用有效性、任务适配性与生成质量。
- Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding
- 赛道归属: 视频生成 / 身份保持
- 核心创新点: 提出 Slot-ID,利用参考视频中的时序与多视角身份信息进行槽位式身份编码,弥补单张参考图无法表达身份随视角、表情和光照变化的问题,从而缓解面部变形、姿态锁定、身份漂移和过度平滑等现象。
- Enhancing Autoregressive Video Generation via Representation Adversarial Distillation 🆕NEW
- 赛道归属: 视频生成 / 自回归少步视频生成
- 核心创新点: 提出基于表示空间对抗蒸馏的训练框架,将原有的分布匹配蒸馏与真实数据的特征空间对抗监督结合起来:训练时仅对自回归学生生成结果进行稀疏解码,并在冻结视觉基础模型的多层表示上训练轻量判别头,以直接约束生成视频的感知质量与语义一致性;同时保留DMD对教师分布的锚定作用。该方法在不增加推理时去噪预算、且不改动生成器结构的前提下,缓解了少步自回归生成中早期误差累积导致的细节退化和结构漂移问题。
- PartiCam: Camera Controlled Video Generation with Reward Guidance 🆕NEW
- 赛道归属: 视频生成 / 相机控制视频生成
- 核心创新点: 提出一种无需训练的粒子滤波式相机控制方法,通过奖励引导在测试时将预训练视频扩散模型朝目标相机轨迹进行采样。方法以Sequential Monte-Carlo引导为基础,引入全局-局部两阶段细化机制,并结合粒子滤波重采样进行局部修正,从而在保持视觉多样性的同时提升轨迹跟随的稳定性与精确性,减少相机漂移和早期塌缩问题。
- MindWorldBench: Evaluating Mental-State-to-Behavior Reasoning in Image-to-Video Generation 🆕NEW
- 赛道归属: 多模态理解 / 视频生成评测
- 核心创新点: 构建面向“心理状态到行为”推理的视频生成评测基准MindWorldBench,用于检验图生视频模型是否能根据世界状态与隐含心理变量生成符合常识的行为,而非仅依赖显式动作提示。该基准采用Zero-Action Prompting与反事实设计来隔离心理状态的因果作用,并通过自动化流程同时评估视频质量、常识合理性和心理状态一致性,从而揭示现有模型在行为生成中存在“全知偏置”这一系统性失败模式。
- Uncertainty-Aware Consistency Distillation for Few-Step Video Generation 🆕NEW
- 赛道归属: 视频生成 / 少步视频生成 / 一致性蒸馏
- 核心创新点: 提出不确定性感知的一致性蒸馏方法,通过局部、无参数的不确定性估计对不同空间-时间区域的蒸馏监督进行重加权。具体而言,方法构造两条独立扰动的教师引导一致性路径,以学生端点预测的一致性差异作为不确定性代理,并对高不确定区域放松一致性约束、对其余区域保持完整约束,从而避免对难学区域施加过强监督;同时结合特征空间对抗训练与语义对齐,以在大幅减少采样步数时维持感知质量。
GitHub
- [2026-10-01] YouMind-OpenLab/awesome-seedance-2-prompts ⭐2062 🆕NEW
- [2026-10-01] ddalcu/mlx-serve ⭐1671 🆕NEW
- [2026-10-01] people-robots/Awesome-Video-Generation-Post-Training ⭐189 🆕NEW
- [2026-10-01] ukr8b3g-cmyk/ComfyUI-H3-Continuum ⭐117 🆕NEW
- [2026-10-01] utensils/mold ⭐50 🆕NEW
音频生成
arXiv
- Interactive TTS: Dynamic Speaking Style Adaptation for Expressive Speech Synthesis
- 赛道归属: 文本到语音(TTS)/多轮上下文感知语音合成
- 核心创新点: 针对多轮多模态对话中的说话风格动态迁移问题,提出显式建模上下文与风格决策的TTS方法,缓解传统端到端上下文映射带来的“风格、音色、内容”纠缠问题,从而提升指令跟随能力并减少跨轮次音色漂移。
- TinyAudio: Compact and Efficient Text-to-Audio Generation for Low-Resource Deployment
- 赛道归属: 文本到音频生成(TTA)/轻量化端侧部署
- 核心创新点: 提出面向低资源部署的紧凑型流匹配TTA框架,将生成模型、文本编码器与音频VAE进行小参数化设计,核心是以单流Transformer流匹配模型为主干,并配套音频对齐文本编码器与轻量音频表征模块,在尽量压缩参数规模的同时保持文本到音频生成能力。
- ReaFlow-TTS: Realization-Conditioned Flow Matching for High-Quality and Controllable Speech Synthesis
- 赛道归属: 文本到语音(TTS)/可控语音合成
- 核心创新点: 提出 realization-conditioned flow matching 框架,针对同一条件下不同语音实现会对应不同目标速度场的问题,引入“实现条件”来建模生成分歧,并提供更具语义可解释性的属性操控接口,解决确定性速度场只能学习条件均值、难以表达实现差异的局限。
- UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation
- 赛道归属: 文本到音频生成(TTA)/联合表征学习与生成建模
- 核心创新点: 打破“先训练音频tokenizer、再冻结后做生成”的两阶段范式,提出连续tokenization与潜空间流匹配联合学习框架,使表征学习与生成目标同步优化,从而避免仅以重建为导向的离散/潜表示对生成任务不一定最优的问题。
- COT-TTS: Audio Context-Aware Text-to-Speech with Chain-of-Thought Reasoning
- 赛道归属: 文本到语音(TTS)/上下文推理式语音合成
- 核心创新点: 将链式思维推理引入TTS上下文建模,构建基于历史对话音频、目标文本与参考语音的推理式语音合成任务,使模型不再仅依赖显式风格指令,而是从历史对话中推断当前应采用的说话风格。
- ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
- 赛道归属: 视频到音频生成(V2A)/多模态可控生成
- 核心创新点: 提出统一的多模态V2A框架,支持视频、文本与参考音频的联合控制;通过融合CLIP与时空音视频编码器增强视觉-文本对齐,采用时间-音色解耦抑制冗余时序信息并保留可辨识音色特征,同时引入统一表示对齐与随机模态dropout提升跨模态冲突下的鲁棒可控性。
- Here the World in Stereo: Learning Dynamic Spatial Correspondence for Immersive Joint Video-Audio Generation 🆕NEW
- 赛道归属: 音视频联合生成 / 立体声音频生成 / 沉浸式多模态生成
- 核心创新点: 提出面向沉浸式场景的动态空间对应(Dynamic Spatial Correspondence)建模框架 StereoBind,核心是用视觉目标的运动轨迹来约束立体声生成,使声音感知位置能够随视觉源运动同步变化。方法上设计了三种互补机制:Visual Motion Binding 用于建立源级音视频对应关系,Spatial Track Encoder 编码声源的绝对空间位置,Residual Track RoPE 则建模相对运动变化,从而同时刻画位置与运动带来的空间音频演化。与此同时,构建了带运动轨迹标注的大规模 StereoWorld-29K 数据集及 StereoWorldBench 评测基准,用于监督和衡量音视频空间一致性。
- EmoRES-TTS: Residual-Enhanced Vector Steering for Emotional Speech Generation
- 赛道归属: 文本到语音(TTS)/情感可控语音合成
- 核心创新点: 提出无需重新训练主干模型的情感向量操控方法,将情感 steering vector 分解为“远离中性表达的共享分量”和“指向目标情感的残差分量”,并分别控制两部分以增强情感遵循度,在冻结模型上实现更强的情感可控性。
- RAWD-TTS: Ratio-Free Reward Alignment for Discrete-Diffusion Voice Cloning
- 赛道归属: 文本到语音(TTS)/离散扩散声纹克隆与奖励对齐
- 核心创新点: 提出 ratio-free 的奖励对齐训练方法,在离散扩散声纹克隆中直接对解码样本进行识别与说话人奖励打分,再用组内相对优势加权掩码token重建,避免依赖反向轨迹似然或目标音频,从而更好对齐内容准确性与说话人身份保持。
- RVQ Position Aware Speculative Decoding for On Device Text to Speech
- 赛道归属: 文本到语音(TTS)/端侧推理加速
- 核心创新点: 针对RVQ码本逐步解码的高串行开销,提出位置感知的 speculative decoding 方案,在MultiCodeDecoder中对残差向量量化token进行并行猜测与验证,以极小额外参数和较低验证开销显著减少模型调用次数,并保持与原系统一致的采样分布与识别性能。
GitHub
- [2026-10-01] huggingface/diffusers ⭐34638 🆕NEW
- [2026-09-28] BinWang28/audio-ai-hub ⭐960 🆕NEW
- [2026-09-29] vizart-vj/ComfyUI-MiniMax-H3-LongMedia ⭐271 🆕NEW
- [2026-09-27] markjfine/nrsc5-dui ⭐173 🆕NEW
- [2026-09-26] ShareLab-SII/VA-Judger ⭐64 🆕NEW
HuggingFace Models
- Lightricks/LTX-2.5 🆕NEW
HuggingFace Datasets
- [2026-10-01] espnet/yodas3
语言大模型
arXiv
- Structure vs. Chain-of-Thought: Evaluating LLM Criteria Extraction for Depression Severity 🆕NEW
- 赛道归属: 医疗文本理解 / 心理健康评估 / LLM可解释性与评测
- 核心创新点: 该工作系统比较了两类基于LLM的抑郁严重程度判定范式:直接生成严重度标签的链式思维推理,以及先抽取临床量表条目再由规则映射为标签的“结构化抽取”方案。其方法上的重点在于引入可审计的临床标准(PHQ-9、BDI-II)与不同阈值设定方式,使用加权Kappa评估一致性,并分析是否存在“抽取优于推理”的稳定优势。结果表明,结构化抽取并未在所有设置下稳定优于链式思维,且阈值是否基于标注数据拟合会显著影响结论;同时,较高的整体一致性并不等价于对重症样本的更好识别,揭示了该类任务中“可解释性、校准与重症召回”之间的张力。
- DRIFT: Data Selection for LLM Instruction Tuning via On-Policy Attribution
- 赛道归属: 推理优化 / 数据选择 / 指令微调
- 核心创新点: 提出基于 on-policy attribution 的数据选择方法 DRIFT,用模型自身在验证查询上的采样回答构造验证目标,并按这些回答对原始训练样本的影响力进行排序;同时对影响分数中的梯度范数依赖进行校正。其关键突破在于不再以“节省数据”为目标,而是通过选择同一语料中的高影响样本继续微调,尝试突破全量数据训练的性能上限。
- When Context Misleads: In-context Learning with Jurisdiction in Large Language Models
- 赛道归属: 复杂推理 / 上下文学习 / 对齐鲁棒性评测
- 核心创新点: 构建 FakeContextBench,用伪科学式上下文干扰来专门评测模型的“context authority”,即判断上下文信息是否应当主导最终答案的能力。该工作强调现有 ICL 后训练方法往往只学会从示例中抽取模式,却忽视了对上下文权威性的辨别,从而暴露模型在“上下文误导”场景下的脆弱性。
- Representation-guided in-context learning for medical image interpretation with multimodal large language models
- 赛道归属: 多模态理解 / 医疗影像 / 上下文学习
- 核心创新点: 提出训练免费的 representation-guided in-context learning 框架 RG-ICL,通过冻结编码器检索与查询表示对齐的示例,再用于多模态大模型的上下文学习。方法核心在于用表示相似性引导示例选择,从而在不进行任务特定参数更新的情况下,提升医疗影像解释能力。
- Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning
- 赛道归属: 机器人规划 / 开放世界智能体 / 神经符号推理
- 核心创新点: 提出融合符号规划、强化学习与 LLM 的神经符号架构,用于应对开放世界中的新颖性。其方法重点在于:当符号规划器因缺少新对象交互算子而无法生成计划时,借助 LLM 与 RL 学习如何处理新对象,从而补齐规划域中的能力缺口。
- ReCAP: Retrieval-Guided Capability Reuse for Multimodal Continual Instruction Tuning
- 赛道归属: 多模态持续学习 / 指令微调 / 检索增强
- 核心创新点: 提出 ReCAP,通过外部检索与 LLM 构建领域知识、推理知识和格式知识库,并在每个持续阶段为指令检索相关知识,指导能力复用与实例级能力路径生成。进一步引入 adaptive subspace recycling,用共享基与阶段特定核心参数化可复用能力模块,在保留历史重要方向的同时回收剩余容量,以缓解跨阶段遗忘。
- Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training
- 赛道归属: 推理优化 / 强化学习后训练 / 无奖励优化
- 核心创新点: 提出 RFPO,将预训练且校准后的 critic 重新利用为 rollout 级奖励、GAE 的 value baseline,以及未完成前缀的成功预测器,实现无需外部奖励标签、逐步标注或完整 rollout 的策略优化。其关键方法突破是利用 critic 对未来结果的预测能力提供稠密学习信号,并通过二值化去偏分数抑制长度偏置,从而在降低计算与显存开销的同时保持性能。
- SeOPD: Self-Evolving LLMs via Online Policy Distillation from Self-Generated Chain-of-Thought
- 赛道归属: 自我进化 / 在线策略蒸馏 / 思维链学习
- 核心创新点: 提出 SeOPD,让同一个 LLM 的 deep-thinking 模式生成 CoT,再将该 CoT 作为 privileged information 去监督 non-thinking 模式的 token 级输出,实现无需外部标注或环境反馈的在线策略蒸馏。方法的核心在于把模型自身推理过程中涌现的信息内化到共享参数中,从而同时提升非思考与深度思考能力。
- LLM Alignment--Utility Asymmetry under Semantic-Preserving Transformations
- 赛道归属: 对齐鲁棒性 / 安全性评测 / 分布偏移
- 核心创新点: 通过语义保持、规则可逆的合成变换,系统检验 LLM 对分布偏移下的对齐泛化能力,提出“Alignment-utility asymmetry”现象:模型在变换输入上往往仍能保持任务效用,但安全对齐失效会更显著地恶化。该工作的方法价值在于把对齐问题从攻击视角转为受控探针,揭示语义不变但表面形式变化时,效用与安全的泛化并不同步。
- TemporalGraphLLM: Temporal Graph Neural Networks with Large Language Models for Dynamic Text-Attributed Graphs
- 赛道归属: 动态图学习 / 多模态图推理 / 图文联合建模
- 核心创新点: 提出 TemporalGraphLLM,将任意 temporal GNN 与 LLM 结合,用于动态文本属性图的联合建模。其关键创新包括:通过 graph-time-aware instruction tuning 让 LLM 学习图-时间任务格式,并用 temporal GNN injection 以图嵌入替代专门的附加 token,从而把时序图结构信息更直接地注入 LLM 推理过程。
GitHub
- [2026-10-01] sgl-project/sglang ⭐36683 🆕NEW
- [2026-10-01] NVIDIA/TensorRT-LLM ⭐14752 🆕NEW
- [2026-10-01] basellm/llm-metadata ⭐146 🆕NEW
- [2026-10-01] maxim-saplin/llm_chess ⭐134 🆕NEW
- [2026-10-01] lvyufeng/PocketLLM ⭐53 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-09-26] XiaomiMiMo/MiMo-V2.6-RL-oss
- [2026-09-24] MoreThought/Fable-5.1-Max-Reasoning-Filtered-10000x
多模态大模型
arXiv
- Similar Choices, Different Attention: Cross-Modal Associations in Humans and Vision-Language Models
- 赛道归属: 多模态理解 / 跨模态注意力分析
- 核心创新点: 该工作在相同刺激条件下同时比较人类与VLM的选择结果和眼动轨迹,避免了以往“人机使用不同任务或不同刺激”带来的不可比问题;进一步通过人类选择微调、以人类注视训练模型注意力等方式,分别检验“选择对齐”和“注意力对齐”是否足以代表人类一致的跨模态加工,揭示二者并不等价,且模型注意力与人类凝视的匹配甚至不如中心偏置基线。
- PRISM-VLM: A Multi-Axis Discriminative Benchmark for Compact Vision-Language Models
- 赛道归属: 多模态理解 / 紧凑型VLM评测
- 核心创新点: 提出PRISM-VLM这一多轴判别式基准,不再把模型压缩为单一准确率,而是沿七个维度对每个样本进行细粒度评分,用于刻画紧凑型VLM的典型失效模式;其方法论突破在于从“单点分数”转向“多维诊断”,更适合比较小型VLM在不同能力侧面的差异。
- SalQ-VLM: Fine-Grained Saliency-Guided Quantization for Vision-Language Models
- 赛道归属: 模型压缩 / 视觉语言模型量化
- 核心创新点: 提出面向VLM的细粒度显著性引导量化方法SalQ-VLM,针对VLM中固有的激活特征设计量化策略;核心思路是利用细粒度显著性信息来指导后训练量化,从而在无需重训练的前提下更有针对性地压缩模型并降低精度损失,补足了VLM量化研究相对不足的问题。
- Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
- 赛道归属: 多模态理解 / 情感推理与因果分析
- 核心创新点: 通过基于steering vector的因果归因框架,分析并增强大视觉语言模型中的情感电路,重点刻画跨模态信息如何从视觉刺激流向情感叙事生成;方法上将“情感理解”从黑箱表征转为可干预、可归因的跨模态信息流问题,从而支持对情感相关内部机制的解释与增强。
- VidHarness: Evolving Agent Harnesses for Cost-Efficient Long Video Understanding 🆕NEW
- 赛道归属: 长视频理解 / 视频智能体优化
- 核心创新点: 提出 VidHarness,通过“智能体 harness 自动进化”替代人工设计的视频理解流程;利用执行反馈驱动的迭代搜索,并用 MCTS 避免贪心优化陷入局部最优;结合不确定性感知的多保真验证,先用少量问题筛选候选 harness 以降低评估成本;进一步引入 mixture-of-harness,根据不同帧预算路由到专门化 harness,从而在成本可控的前提下提升长视频问答效果。
- When Words Speak Louder than Images: Towards Understanding Language Bias in Vision-Language Models
- 赛道归属: 多模态理解 / 语言偏置诊断
- 核心创新点: 该工作提出一个四阶段推理诊断框架,把VLM中的语言偏置传播过程拆解为若干相互依赖的推理阶段,并分别考察语言先验与跨模态覆盖在各阶段中的演化;其方法论贡献在于不只判断“是否有偏置”,而是追踪偏置如何在推理链路中形成、累积并最终导致错误预测。
- OmniMoE-VL: A Sparse Vision-Language Model with Coupled Visual-Depth Routing
- 赛道归属: 稀疏多模态模型 / 视觉-语言路由
- 核心创新点: 提出OmniMoE-VL,通过耦合的视觉深度路由投影器,为每个图像-提示对动态选择一组稀疏的中间视觉层,并将该全局偏好同时用于局部patch融合与向语言模型的动态视觉注入;创新点在于把“哪些视觉中间表征应暴露给语言侧”变成问题相关的路由决策,并与MoE式专家路由协同,从而实现更灵活的问答式视觉访问。
- Gradient-Guided Decoupled Adaptation for Geospatial Vision-Language Models
- 赛道归属: 地理多模态理解 / 多任务优化
- 核心创新点: 提出Gradient-Guided Decoupled Adaptation(G2DA),利用任务梯度特征对地理VLM的多任务适配进行解耦组织:先按梯度引导将任务划分为视觉中心与语言中心组,再基于梯度相似性构建模态专属课程,并通过双向回放缓解顺序优化带来的遗忘;其关键突破是用梯度结构显式建模任务间冲突,而非简单共享统一多任务训练。
- ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding 🆕NEW
- 赛道归属: 流式视频理解 / 低延迟多模态推理
- 核心创新点: 提出 ShallowStream,将 MLLM 的浅层同时用于帧编码与检索索引构建,避免每次都执行完整深层 prefill;在流式处理中维护基于浅层 KV cache 的轻量常驻索引,并在问答时利用浅层注意力分数进行上下文帧打分;再通过多样性感知选择策略检索更精确且更全面的证据,从而显著降低逐帧预填充和端到端延迟。
- CoVisco: Codec-Native Vision Encoder with Native Token Compression for Unified Image-Video Understanding 🆕NEW
- 赛道归属: 图像-视频统一理解 / 视觉编码压缩
- 核心创新点: 提出 CoVisco,一种 codec-native 的视觉编码器,把压缩能力前移到编码阶段而非事后压缩;通过 segmented attention 在单次前向中处理长视觉输入,避免跨所有帧的稠密 patch 交互;为每个时间段引入可学习的 abstract tokens 形成紧凑段级表示,同时保留细粒度 patch tokens,并通过交替的段内与 abstract-communication 层维持全局视频上下文;最后用轻量 selector 按需输出仅 abstract tokens 或加上运行时选出的 patch tokens,降低下游 MLLM 的视觉上下文与 prefill 负担。
GitHub
- [2026-09-30] Blaizzy/mlx-vlm ⭐5556 🆕NEW
- [2026-10-01] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1888 🆕NEW
- [2026-09-28] emcf/thepipe ⭐1529 🆕NEW
- [2026-09-28] om-ai-lab/VLX-Seek ⭐1284 🆕NEW
- [2026-09-29] XuankunRong/Awesome-LVLM-Safety ⭐221 🆕NEW
强化学习
arXiv
- MaD-RL: Matching Distributions for Calibrating LLMs with Reinforcement Learning
- 赛道归属: 大语言模型后训练 / 分布匹配式强化学习
- 核心创新点: 提出面向输出分布控制的通用RL框架,将传统只优化单个输出期望奖励的后训练范式扩展为“分布匹配”;通过对潜在类别属性的目标分布建模,设计KL、JS等不同散度对应的奖励函数,并指出已有方法可视为L2散度的特例,从而实现对模型输出多样性、类别比例与约束满足的更精细控制。
- RL Starts before RL: On Policy Distillation for Better Reinforcement Learning
- 赛道归属: 推理优化 / 强化学习训练策略
- 核心创新点: 提出在正式RL之前先进行on-policy distillation(OPD)作为准备阶段,证明其收益不仅体现在初始准确率提升,还能带来更高的最终RL性能;进一步分析了蒸馏目标与轨迹来源对后续RL的影响,发现相较于reverse-KL,forward-KL在“蒸馏后接RL”的设置下更有优势,且student rollouts优于teacher rollouts,说明与教师分布的更深层对齐比单纯top-1一致性更关键。
- RL-ABC: Reinforcement Learning for Accelerator Beamline Control 🆕NEW
- 赛道归属: 强化学习系统 / 科学计算控制 / 加速器束线优化
- 核心创新点: 构建了一个将粒子加速器束线配置自动转化为RL环境的开源框架RLABC,核心方法是把束线调参形式化为MDP,并自动完成诊断点插入、57维状态构造、奖励函数配置以及与Elegant仿真器的接口对接;同时引入stage learning以将复杂优化拆解为更易训练的子问题,从而提升训练效率与可用性。
- Reinforcement Learning-Guided Graph Transformations for SpTRSV Optimization 🆕NEW
- 赛道归属: 强化学习 / 图优化 / 稀疏矩阵计算
- 核心创新点: 将SpTRSV中的图变换过程建模为序列决策问题,用RL学习面向矩阵实例的变换策略,替代人工设计启发式;该方法在减少层数与平衡层代价变异性之间实现更好的折中,并通过curriculum learning与fine-tuning提升了策略对未见矩阵的迁移能力。
- Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding 🆕NEW
- 赛道归属: 离线到在线强化学习 / 公交调度优化
- 核心创新点: 针对多线路bus holding中的跨保真问题,研究离线数据与在线模拟器在转移和事件持续时间上的不一致,并聚焦一种失败模式:虽然总体乘客时间更低,但乘客行程不完整;该工作提出面向“完成度感知”的跨保真offline-to-online RL框架,用于缓解H2O RL在真实运营场景中的偏差风险。
- CATCH: A Controllable Analysis Testbed for Reward Hacking in Coding RL 🆕NEW
- 赛道归属: 强化学习安全 / 奖励黑客 / 代码生成RL
- 核心创新点: 提出可控测试床CATCH,用于系统研究coding RL中的reward hacking:通过显式暴露环境漏洞、提供基于独立审计的执行级金标,并可调节初始模型的“黑客倾向”和奖励难度,从而复现多样化的reward hacking轨迹并评估检测/缓解方法;实验还揭示了监控器会被模型逐步“欺骗”,强调需要贯穿训练全过程评估防护效果。
- T-Router: Learning Thalamic Routing for Reasoning with Parameter-Efficient Reinforcement Learning 🆕NEW
- 赛道归属: 参数高效强化学习 / 推理增强
- 核心创新点: 提出Thalamic Router(T-Router),将参数高效RL的适配重点放在“复用已完成计算”上:通过可寻址的压缩块存储与深度递归控制器,实现对历史块变化的选择性读取与相对尺度写回;在极小可训练参数量下,通过正确性奖励训练该接口,在数学推理任务上优于全参数GRPO和LoRA,说明“受控计算复用”是提升推理RL效率的有效路径。
- Robust Risk-Sensitive Reinforcement Learning from Corrupted Human Feedback 🆕NEW
- 赛道归属: 偏好学习 / 风险敏感强化学习 / 鲁棒RLHF
- 核心创新点: 面向被污染或恶意篡改的人类偏好反馈,提出加权流式偏好CVaR RLHF(WSP-CVaR-RLHF),将不确定性加权的奖励估计与乐观的augmented-state CVaR规划结合起来;理论上给出将干净统计误差与反馈污染惩罚分离的遗憾界,并进一步扩展到未知转移下的联合乐观规划与历史级CVaR模拟分析,提升了对对抗性偏好噪声的鲁棒性。
- Scoring Higher, Answering Worse: Mitigating Reward Hacking in Rubric-Based RL via Protocol-Level Rubrics 🆕NEW
- 赛道归属: 奖励建模 / 语言模型对齐 / 规则式RL
- 核心创新点: 指出rubric-based RL中最脆弱的环节在于“加和式聚合”会导致标准之间相互补偿,从而诱发reward hacking;提出Protocol-level Rubrics(ProRubric),通过离线重组rubric为少量协议级维度,并要求维度内条件整体成立才计分,保持原有标准内容不变但改变聚合方式,从协议层面提升奖励有效性与回答适切性。
- In-Distribution Imagination for Model-Based Offline Reinforcement Learning 🆕NEW
- 赛道归属: 模型式离线强化学习 / 想象滚动控制
- 核心创新点: 提出in-distribution imagination(IDI),不再仅依赖转移级不确定性控制模型生成轨迹,而是在学习到的表示空间中估计轨迹是否仍位于离线数据分布内,并对偏离轨迹流形的rollout进行自适应截断;结合trajectory-regularized RL后,在小数据场景下更稳定有效,说明轨迹级支持度判断比单步不确定性更适合控制MBORL中的想象误差。
GitHub
- [2026-10-01] huggingface/trl ⭐19425 🆕NEW
- [2026-09-30] kubernetes-sigs/agent-sandbox ⭐4107 🆕NEW
- [2026-10-01] radixark/miles ⭐3031 🆕NEW
- [2026-09-30] MushroomRL/mushroom-rl ⭐944 🆕NEW
- [2026-10-01] raamonp/rl-gym-orchestrator ⭐55 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-09-30] FineEnvs/SmolDataEnvs
- [2026-09-25] genrobot2025/Gen-HumanEgo
世界动作模型
arXiv
- Learning Skills from Historical Action Trajectories: Action Experience Dictionary for World Action Models 🆕NEW
- 赛道归属: World Action Model / 具身智能动作生成 / 操作技能迁移
- 核心创新点: 提出 Action Experience Dictionary(AED),将历史物理动作轨迹编码为共享动作嵌入,用于跨任务复用动作经验并建模任务间语义关联;通过预训练 action tokenizer 检索动作嵌入,再结合视觉条件的 cross-attention 将其前置到噪声动作 token 中,为动作预测注入交互上下文与动作意图;同时引入 motion-aware transition loss,在随机时间间隔上监督视觉特征变化预测,以强化对动作相关运动的建模并降低对无关背景信息的依赖。
- EVO-WAM: Evolving World Action Models through Video-Action Verification
- 赛道归属: 机器人操作 / 世界动作模型 / 测试时自适应
- 核心创新点: 提出 EVO-WAM,通过“自生成轨迹再训练”的方式让世界动作模型适配未见任务;先加入状态预测与锚定多帧上下文以支持无需外部执行反馈的自回归展开,再用视觉语言模型筛选任务完成前缀、结合逆动力学模型验证视频-动作一致性,最后对已验证前缀进行迭代训练,从而在不额外采集专家演示的情况下提升新任务成功率。
- V2X-WAM: A Cooperative World Action Model for End-to-End Autonomous Driving
- 赛道归属: 自动驾驶 / V2X协同感知 / 世界动作模型
- 核心创新点: 提出 V2X-WAM,将协同场景理解、动作生成与未来世界推理紧密耦合;利用车端与路侧观测构建可靠性感知的时空表示,并将路侧信息压缩为量化消息以降低通信开销;在此基础上,规划器生成候选轨迹并显式条件化未来占用与动态流预测,再将预测到的世界后果反馈用于修正轨迹,实现动作与环境演化的闭环交互。
- NeuronDiscover: Agent-in-Twin for Mechanistic Discovery in Neuronal Microenvironments with World Action Models
- 赛道归属: 科学发现 / 神经机制发现 / 交互式实验设计 / 世界动作模型
- 核心创新点: 提出 NeuronDiscover,将共享的、机制约束的 WAM 用于“预测—干预—观测”一体化决策;通过显式建模 twin confounding,联合维护机制与模型偏差的信念,并据此设计实验;同时用 MIOY 图记录与修订机制-干预-观测-结果关系,最终编译为带有偏差校正接受边界的可执行程序,以提升在稀疏观测下的机制判别与关系解析能力。
- What Makes World Action Models Generalize? An Empirical Study of Test-Time Future Modeling
- 赛道归属: 世界动作模型 / 测试时推理 / 泛化能力分析
- 核心创新点: 通过系统实证分析明确 WAM 泛化收益的来源,发现去掉推理阶段未来条件化后,模型在环境扰动、数据效率和任务泛化三方面均明显退化;进一步指出收益主要来自“首个去噪步骤”而非完整未来生成,据此提出 Simple-WAM,将未来建模简化为一次对全噪声视频 token 的前向处理,并同步调整训练时噪声日程,使其在保持高效推理的同时保留更强泛化能力。
- AquaWAM: A Dynamics-aware World Action Model for Underwater Embodied Agents
- 赛道归属: 水下机器人 / 具身智能 / 世界动作模型
- 核心创新点: 提出 AquaWAM,面向水下具身体系统式建模动作相关与被动物理动力学,而非仅预测未来图像;显式纳入推进器死区、惯性滑行和环境流等持续影响因素,并利用 DVL、IMU、压力传感器和关节编码器等紧凑状态进行建模,摄像头仅用于语义理解目标与位姿,从而在降低模型规模与计算成本的同时,更适配水下场景的动力学特性。
- InternW0-$\Delta$: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data
- 赛道归属: 机器人操作 / 世界动作模型 / 大规模预训练
- 核心创新点: 该工作提出 InternW0-Δ,核心在于用 2 万小时以上的异构开放数据预训练统一 WAM,将视觉动力学、场景语义、几何与运动等多种先验整合到同一动作生成框架中,以提升通用机器人操作能力;摘要中强调其在仿真基准与真实机器人平台上均优于先前方法。
- Rolling-WAM: World Action Models with Rolling Imagination
- 赛道归属: 机器人操作 / 世界动作模型 / 低延迟闭环规划
- 核心创新点: 提出 Rolling-WAM,将联合视频-动作去噪分摊到连续重规划周期中;通过维护一个处于不同噪声层级的滑动窗口,在每一步只推进部分去噪与更新,从而避免每次重规划都完整执行一次联合去噪,降低延迟并提升闭环响应速度。
- Latent evolving World Action Model
- 赛道归属: 世界动作模型 / 潜空间建模 / 生成式控制
- 核心创新点: 该工作聚焦于基于 VDM 的 WAM 效率瓶颈,提出“latent evolving”范式以摆脱对大规模视频生成预训练的强依赖;核心思路是将观察先编码为 VAE 潜变量,再在更轻量的潜空间中演化并提取对动作生成有效的特征,从而提升 WAM 的效率与可扩展性。
- The Right Future for Action: Learning Action-Relevant Predictive States in World Action Models
- 赛道归属: 世界动作模型 / 表征学习 / 控制相关预测状态
- 核心创新点: 通过表征诊断指出“未来越可预测”并不等于“越利于动作解码”,因此提出学习动作相关预测状态;该方向强调未来变化中真正对控制有用的信息应被显式保留,且可线性读取的动作信息具有空间集中性,从而推动 WAM 从泛化式未来表征转向面向控制的预测状态学习。
GitHub
- [2026-09-28] OpenWAM-Official/OpenWAM ⭐936 🆕NEW
- [2026-09-29] OpenMOSS/EasyWAM ⭐390 🆕NEW
- [2026-09-28] H-EmbodVis/SimWAM ⭐192 🆕NEW
- [2026-09-28] InternRobotics/InternW0-Delta ⭐67 🆕NEW
- [2026-09-30] LeapLabTHU/Simple-WAM ⭐61 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-10-01 13:30:36