AI 每日进展速报 - 2026-10-05
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- Keep It CALM: Analyzing the Limits of Global Unsafety in Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图安全对齐 / 训练时无关安全防护
- 核心创新点: 该工作分析了“全局不安全方向/子空间”这类训练无关安全方法的适用边界,指出其存在“覆盖性-选择性”权衡:过于紧凑的安全子空间难以覆盖多样化的有害语义,过于宽泛的聚合又会误伤安全邻近的正常提示词。基于这一几何分析,提出 CALM,通过匹配有害-安全锚点进行提示词局部反事实修正,只对触发违规的 token 表征做最小化安全侧编辑,并抑制正向对齐的有害残差,从而以更细粒度的局部修正替代统一的全局不安全信号移除。
- Amplify What You Gaze At: Target Saliency Boosting in Text-to-Image Generation
- 赛道归属: 文生图 / 可控生成
- 核心创新点: 提出“目标显著性增强”任务,关注在不依赖任何视觉先验的前提下,让生成图像中指定对象更突出。其关键方法是将显著性视为相对量,通过建模目标对象与全局场景之间的相对关系来提升目标可见性,而不是仅对单个对象做局部强化。
- POET: Preference Optimization for Enhanced Text-to-Image Generation
- 赛道归属: 文生图优化 / 提示词重写
- 核心创新点: 提出POET,通过LLM先对用户输入进行自动提示词重写,再送入冻结的文生图骨干模型;其关键创新在于设计复合奖励并采用迭代式DPO训练,让重写器直接从多模态反馈中学习“模型偏好”的提示结构,且不依赖高成本SFT数据,从而提升图文对齐、视觉质量与美学表现,并具备跨不同T2I骨干的迁移能力。
- TerraVis: Towards Evaluation of World-Grounded Visual Consistency in Text-to-Image Generation via MLLM Workflows 🆕NEW
- 赛道归属: 文生图评测 / 世界一致性评估
- 核心创新点: 该工作提出 TerraVis,用于评估生成图像是否符合真实世界的结构与物理常识,而不仅是视觉质量或文本对齐。其核心方法是构建覆盖对象、交互和场景层面的世界一致性违规 taxonomy,并设计多阶段 MLLM 评估流程:先判断图像是否适合评估,再识别 18 类违规类型,并将其划分为轻微/严重以形成总体世界一致性分数。该框架强调对“看起来好但不符合常识”的失败模式进行系统化量化与诊断。
- OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation
- 赛道归属: 文生图 / 偏好优化 / 细粒度对齐
- 核心创新点: 提出对象中心的自我改进偏好优化框架,聚焦提升对象属性级别的对齐能力,如颜色、形状和空间关系。核心方法是围绕对象构建偏好优化过程,并强调自举式改进,以缓解传统 DPO/GRPO 在偏好构造和计算成本上的问题,同时提升细粒度文本-图像一致性。
- Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards 🆕NEW
- 赛道归属: 文生图后训练 / 偏好优化 / 奖励建模
- 核心创新点: 该工作提出一种面向开放域文生图模型的后训练配方,通过组合互补奖励来同时优化整体人类偏好与提示词忠实度等细粒度属性。方法上包含两类奖励:基于大规模人类偏好数据、采用 Bradley-Terry 目标训练的偏好奖励,以及显式评估 prompt faithfulness 等属性并用于防止 reward hacking 的 rubric 奖励。其关键突破在于不采用简单加权平均,而是设计更有效的奖励组合策略,以更好平衡偏好优化与规则满足。
- Traversing the Satisfaction-Diversity Frontier in Text-to-Image Diffusion 🆕NEW
- 赛道归属: 文生图扩散模型采样 / 多样性-满意度权衡
- 核心创新点: 该工作将多图生成建模为“satisficing”问题:每个候选图都必须达到最低奖励阈值,同时整批结果还需满足多样性下限,从而显式刻画“满意度-多样性”前沿。为遍历这一前沿,提出训练无关的推理时方法 SatisDive,利用 batch-relative reward cutoff 区分低奖励与高奖励候选,对低于阈值的样本侧重提升奖励,对高于阈值的样本侧重保持多样性。其方法论重点在于把奖励与多样性从单一聚合目标改为分层约束与分区调控。
- When Text-to-Image Helps Editing: The Effects of Conditioning During Denoising
- 赛道归属: 图像编辑 / 扩散模型采样策略优化
- 核心创新点: 研究统一式编辑模型在去噪过程中不同条件信息的作用变化,发现纯编辑流程中源图像条件在部分编辑任务上会随采样轨迹逐渐减弱;据此提出“任务切换”策略,在去噪的有限区间内切换到文本到图像(T2I)任务,让模型调用其生成能力,再切回编辑模式。该方法利用同一统一模型已训练的两种条件模式,通过切换时机在编辑质量与内容保真之间取得更优平衡。
- Steering Fields: Adaptive Vector Fields for Safe Image Generation and Beyond
- 赛道归属: 安全可控生成 / 图像编辑
- 核心创新点: 提出Steering Fields,将传统“全局固定 steering vector”推广为可随生成过程动态重估方向的自适应向量场;该方法在flow模型的噪声状态上逐步更新引导方向,形成可连续调节的安全控制强度与内容保真度权衡,并支持概念的同时诱导与抑制。由于不依赖显式空间mask或对象先验,它还能自然保持局部结构,进一步可作为无反演、模型无关的结构保持式图像编辑方法。
- AdaPilot: Towards Scene-Adaptive Policy Learning for Cross-Generator Text-to-Image Quality Optimization
- 赛道归属: 文生图 / 跨生成器质量优化
- 核心创新点: 提出场景自适应的质量优化策略,学习一种可跨生成器迁移的通用质量优化 policy,而不是为单一模型或单一任务定制。方法上的关键突破在于将质量优化从“模型绑定”转向“场景感知、跨生成器可迁移”的策略学习,使其具备更强泛化性。
GitHub
- [2026-10-05] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13536
- [2026-10-05] kadevin/ilab-conjure ⭐716 🆕NEW
- [2026-10-05] AceDataCloud/Nexior ⭐399
- [2026-10-05] etkecc/baibot ⭐250
- [2026-10-05] Syh1906/openai-compatible-imagegen ⭐55 🆕NEW
HuggingFace Models
HuggingFace Spaces
视频生成/编辑
arXiv
- WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
- 赛道归属: 视频生成 / 提示词增强
- 核心创新点: 提出 WanPE 作为面向现代文本到视频生成的“电影级提示词增强”模型,利用 397B 参数并基于 105 万真实视频训练,将原始文本提示提升为更适合导演式分镜规划的高质量提示,重点强化动作、镜头轨迹、光照与声音等多镜头要素的表达能力。
- CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation
- 赛道归属: 视频生成 / 物理一致性建模
- 核心创新点: 提出 CompAdapt,用于构建可适配的复合运动建模框架,面向文本到视频生成中的物理一致性问题;其方法重点突破了单一运动类型、依赖手工参数以及难以泛化到未见物理规律的限制,强调对复杂运动组合的适应能力。
- MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation
- 赛道归属: 视频生成 / 长时序自回归生成 / 记忆增强
- 核心创新点: 提出 MosaiChunk 记忆机制,将跨空间与时间的历史 KV 选择性组合成“马赛克”式记忆,在冻结视频生成器的前提下,仅训练轻量路由器决定在固定记忆预算下保留哪些历史片段,从而让模型在对象或场景重新出现时仍能恢复细粒度视觉细节;同时构建 RememBench,用于评测长时序重访场景下的文本到视频与图像到视频一致性。
- DramaAgent: Agentic Storytelling Video Generation
- 赛道归属: 视频生成 / 长视频叙事生成 / Agentic 控制
- 核心创新点: 提出 DramaAgent 这一分层、具备代理式控制的长篇视频与音频生成框架,不直接改造底层生成模型,而是在上层引入故事规划、持久角色条件控制、按场景合成以及反思驱动的定向修复流程;通过维护可复用的故事与角色状态,并对身份漂移、场景语义缺失、时序断裂和跨模态不匹配进行诊断与分阶段修复,提升长程叙事一致性与音视频协同。
- TempQ-Jail: Query-Constrained Candidate Ranking for Text-to-Video Jailbreak Attacks
- 赛道归属: 视频安全 / 文本到视频越狱攻击
- 核心创新点: 将文本到视频越狱攻击形式化为“查询受限的候选分配与排序”问题,提出 TempQ-Jail,通过组合异构攻击机制扩展候选覆盖,并估计候选的端到端攻击效果,用于在生成与安全评估代价较高的场景下更高效地筛选攻击候选。
- VideoGen-Agent: Reinforcing Video Generation Agents
- 赛道归属: 视频生成 / 多模态智能体
- 核心创新点: 提出 VideoGen-Agent,将视频生成任务转化为可调用外部工具的多轮智能体决策问题,并通过多任务 agentic reinforcement learning 学习工具使用策略;方法结合监督微调与强化学习,利用类别感知的混合奖励来同时约束工具调用有效性、任务适配性与生成质量。
- DuoMatching: Joint-Marginal Distribution Matching for Few-Step Video Generation 🆕NEW
- 赛道归属: 视频生成 / 少步视频生成 / 分布匹配蒸馏
- 核心创新点: 提出 DuoMatching,将视频生成的分布匹配从单一的联合分布匹配扩展为“联合-边缘”统一建模:在原有 joint matching 基础上增加 marginal matching,为每一帧引入来自图像生成器的专门监督,以补充视觉质量与语义对齐能力;同时通过 LatentBridge 解决视频学生模型与图像教师之间的潜空间表示不一致问题,并用 Latent Variation Sampling 将帧级监督分散到不同时间片段,减少冗余、增强时序覆盖,从而在尽量保持运动动态的前提下提升画质、构图和语义一致性
- Weave Forcing: Compositional Memory Routing for Interactive Long Video Generation 🆕NEW
- 赛道归属: 视频生成 / 交互式长视频生成 / 训练免费记忆路由
- 核心创新点: 提出 Weave Forcing,用于交互式长视频中“跨历史镜头组合式复用”记忆:首先借助 LLM 做语义槽位路由,将用户提示拆分为角色与背景等组件,并分别检索最合适的历史参考;随后通过 masked memory weaving,利用基于语义槽位的对比注意力图构造精细语义掩码,只暴露压缩历史 KV 记忆中与当前组件相关的 token 来指导生成;最后引入 coverage adaptive RoPE,根据参考覆盖是无/部分/完整三种情况自适应调整时间偏移与记忆保留,缓解不完整历史参考靠近当前生成时产生的视觉伪影
- VDOT++: Unified Few-Step Video Generation via Unbalanced Optimal Transport Distillation 🆕NEW
- 赛道归属: 视频生成 / 少步视频生成 / 蒸馏优化 / 条件视频生成
- 核心创新点: 提出 VDOT++,将同一套蒸馏训练范式统一应用于文本到视频、图像到视频和条件生成三类任务,并针对输出多样性对最优传输蒸馏进行改造:采用非平衡(unbalanced)OT 形式,让不可靠的学生 token 分配更少质量,从而避免平衡 OT 在多解条件下强行一一对齐带来的失配;同时用 $\ell_1$ ground cost 替代均值式聚合,改为更保模式的加权中位数聚合,降低远距离传输目标的干扰;此外结合分布匹配与对抗细化的顺序反向传播,并利用解耦 score network 做跨尺度蒸馏,以更小模型继承更大模型能力
- In-Distribution Forcing for Long Video Generation at Test Time 🆕NEW
- 赛道归属: 视频生成 / 长视频生成 / 测试时优化
- 核心创新点: 提出 In-Distribution Forcing(ID-Forcing),针对自回归视频扩展到长视频时的漂移问题,不仅优化 KV conditioning,还同时约束 KV caching 与训练分布一致;其关键机制 self-caching 在构建每个 chunk 的缓存时不再依赖前序 KV,从源头避免缓存条目变成分布外(OOD),解决“KV-provenance”问题,即缓存本身在滚动过程中逐渐偏离训练分布;通过让滚动窗口始终保持 in-distribution,ID-Forcing 能将短时模型无缝扩展到分钟级视频生成,并显著缓解颜色、纹理与运动动态衰减
GitHub
- [2026-10-05] YouMind-OpenLab/awesome-seedance-2-prompts ⭐2078
- [2026-10-05] szczyglis-dev/py-gpt ⭐1974 🆕NEW
- [2026-10-05] ddalcu/mlx-serve ⭐1749
- [2026-10-05] YouMind-OpenLab/awesome-grok-imagine-prompts ⭐53
- [2026-10-05] utensils/mold ⭐51
音频生成
arXiv
- TinyAudio: Compact and Efficient Text-to-Audio Generation for Low-Resource Deployment
- 赛道归属: 文本到音频生成(TTA)/轻量化端侧部署
- 核心创新点: 提出面向低资源部署的紧凑型流匹配TTA框架,将生成模型、文本编码器与音频VAE进行小参数化设计,核心是以单流Transformer流匹配模型为主干,并配套音频对齐文本编码器与轻量音频表征模块,在尽量压缩参数规模的同时保持文本到音频生成能力。
- ReaFlow-TTS: Realization-Conditioned Flow Matching for High-Quality and Controllable Speech Synthesis
- 赛道归属: 文本到语音(TTS)/可控语音合成
- 核心创新点: 提出 realization-conditioned flow matching 框架,针对同一条件下不同语音实现会对应不同目标速度场的问题,引入“实现条件”来建模生成分歧,并提供更具语义可解释性的属性操控接口,解决确定性速度场只能学习条件均值、难以表达实现差异的局限。
- UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation
- 赛道归属: 文本到音频生成(TTA)/联合表征学习与生成建模
- 核心创新点: 打破“先训练音频tokenizer、再冻结后做生成”的两阶段范式,提出连续tokenization与潜空间流匹配联合学习框架,使表征学习与生成目标同步优化,从而避免仅以重建为导向的离散/潜表示对生成任务不一定最优的问题。
- COT-TTS: Audio Context-Aware Text-to-Speech with Chain-of-Thought Reasoning
- 赛道归属: 文本到语音(TTS)/上下文推理式语音合成
- 核心创新点: 将链式思维推理引入TTS上下文建模,构建基于历史对话音频、目标文本与参考语音的推理式语音合成任务,使模型不再仅依赖显式风格指令,而是从历史对话中推断当前应采用的说话风格。
- ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
- 赛道归属: 视频到音频生成(V2A)/多模态可控生成
- 核心创新点: 提出统一的多模态V2A框架,支持视频、文本与参考音频的联合控制;通过融合CLIP与时空音视频编码器增强视觉-文本对齐,采用时间-音色解耦抑制冗余时序信息并保留可辨识音色特征,同时引入统一表示对齐与随机模态dropout提升跨模态冲突下的鲁棒可控性。
- Articulatory Source-Filter TTS: Physically Grounded Control through Vocal Tract Kinematics
- 赛道归属: 可控文本到语音生成 / 语音合成
- 核心创新点: 提出一种基于发音器官运动学的 source-filter TTS 架构,将声道滤波器与声源显式解耦:通过 Acoustic-to-Articulatory Inversion 生成伪运动轨迹来条件化滤波器响应,并用预测的基频与能量轮廓参数化声门声源;同时引入 Optimal Transport Conditional Flow Matching 对声源进行细化,再与滤波器重组为最终频谱。该方法的关键突破在于把原本黑盒式的 TTS 转化为具备物理可解释控制的生成过程,支持稳定的韵律缩放、跨说话人声源/滤波器重组,以及对发音轨迹的直接操控。
- PLACE: Positional Latent Adaptation via Conditioned Embeddings for Binaural Audio Generation
- 赛道归属: 双耳音频生成 / 多模态条件音频生成
- 核心创新点: 在预训练 any-to-audio 模型 AudioX 上扩展出面向双耳生成的条件适配方法:利用 Perception Encoder Core 特征增强视频条件,引入文本与视频表示对齐以提取空间线索,并通过依赖条件的低秩变换调制生成潜变量。训练时再用解码音频的双耳线索目标(ITD/ILD)进行监督,从而把空间感知信息注入生成过程。其方法重点在于把文本、视频和可选音频提示统一到可控的空间音频生成框架中,提升空间一致性与跨模态控制能力。
- Rubric-Based Optimization for Text-to-Music Generation 🆕NEW
- 赛道归属: 文生音乐生成 / 音频生成后训练优化
- 核心创新点: 该工作提出用预训练音频语言模型(ALM)构造结构化的 rubric 评分,作为文本到音乐生成模型的后训练信号。方法上将同一文本提示下多个候选音频按 rubric 分数排序,并转化为偏好对用于 DPO,同时也可将 rubric 分数直接作为扩散模型的标量奖励进行优化。核心价值在于把“难以用单一自动指标刻画的音乐质量”拆解为可操作的多维评价,并系统比较了这种通用 rubric 奖励与针对 tempo、key、instrumentation 的专门目标奖励,揭示了两类奖励各自适用的能力边界。
- DriftTTS: Few-Step Text-to-Speech Without Distillation via Distribution-Matching Drift 🆕NEW
- 赛道归属: 文本转语音生成 / 少步数TTS / 非蒸馏生成
- 核心创新点: 该工作提出 DriftTTS,一种无需生成式教师、无需蒸馏、也无需对抗判别器的少步数语音生成方法。其关键创新是使用“distribution-matching drift”目标,在由原始 mel 以及冻结的掩码自编码器编码器定义的 mel 域特征空间中学习生成过程,并通过 on-policy rollout 让模型在自身中间状态上训练,从而支持按训练时 rollout 深度进行推理。方法突破在于:在不依赖多步教师的前提下,实现了可竞争的少步数 TTS 质量与可懂度。
- Refinement Buys Intelligibility, Search Buys Identity: What Test-Time Compute Buys in Masked-Diffusion TTS 🆕NEW
- 赛道归属: 文本转语音生成 / 推理计算分配 / 测试时计算分析
- 核心创新点: 该工作系统分析了 masked-diffusion TTS 中“模型深度”和“推理 refinement 步数”对不同能力的贡献差异。通过在多种模型规模与推理步数设置下评估零样本合成,作者发现 refinement 对可懂度提升更显著,而对说话人身份保持的提升有限;相反,best-of-K 搜索更能恢复身份信息。方法论上的关键贡献是把测试时计算拆解为不同形式的能力增益来源,证明深度与步数并非可互换资源,并指出身份瓶颈更多来自 codec 而非生成器本身。
GitHub
- [2026-10-05] huggingface/diffusers ⭐34652
- [2026-09-29] vizart-vj/ComfyUI-MiniMax-H3-LongMedia ⭐274
HuggingFace Models
HuggingFace Datasets
- [2026-10-01] espnet/yodas3
语言大模型
arXiv
- Structure vs. Chain-of-Thought: Evaluating LLM Criteria Extraction for Depression Severity
- 赛道归属: 医疗文本理解 / 心理健康评估 / LLM可解释性与评测
- 核心创新点: 该工作系统比较了两类基于LLM的抑郁严重程度判定范式:直接生成严重度标签的链式思维推理,以及先抽取临床量表条目再由规则映射为标签的“结构化抽取”方案。其方法上的重点在于引入可审计的临床标准(PHQ-9、BDI-II)与不同阈值设定方式,使用加权Kappa评估一致性,并分析是否存在“抽取优于推理”的稳定优势。结果表明,结构化抽取并未在所有设置下稳定优于链式思维,且阈值是否基于标注数据拟合会显著影响结论;同时,较高的整体一致性并不等价于对重症样本的更好识别,揭示了该类任务中“可解释性、校准与重症召回”之间的张力。
- DRIFT: Data Selection for LLM Instruction Tuning via On-Policy Attribution
- 赛道归属: 推理优化 / 数据选择 / 指令微调
- 核心创新点: 提出基于 on-policy attribution 的数据选择方法 DRIFT,用模型自身在验证查询上的采样回答构造验证目标,并按这些回答对原始训练样本的影响力进行排序;同时对影响分数中的梯度范数依赖进行校正。其关键突破在于不再以“节省数据”为目标,而是通过选择同一语料中的高影响样本继续微调,尝试突破全量数据训练的性能上限。
- Which LLM to pick? Online Active Model Selection for Large Language Models
- 赛道归属: LLM在线模型选择 / 主动学习 / 流式数据评测
- 核心创新点: 提出 ONLINE LLM PICKER,用于在流式查询场景下、在有限标注预算内主动挑选最有信息量的样本进行人工标注,从而识别候选模型中表现最佳或近似最佳的LLM。其方法核心在于将“模型选择”从依赖静态基准分数,转为面向在线数据流的主动标注决策问题,并通过选择最具判别力的提示来降低标注成本,同时支持在未标注样本上进行顺序生成时更早锁定优选模型。
- Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning
- 赛道归属: 具身智能 / 神经符号规划 / LLM辅助强化学习
- 核心创新点: 将大语言模型、符号规划与强化学习进行混合式整合:利用LLM的常识推理能力识别环境中的缺失算子,借助符号规划器生成可执行计划,再由LLM为新识别的算子自动撰写奖励函数,指导强化学习代理学习对应控制策略,从而实现对开放世界中新颖对象的适应与操作学习。
- Enhancing Biomedical Named Entity Recognition via Multiple Programming Languages Instruction Tuning and Ensemble Method 🆕NEW
- 赛道归属: 生物医学命名实体识别 / 指令微调 / 结构化信息抽取
- 核心创新点: 将BioNER重构为“结构到结构”的生成任务,把指令和实体输出都表示为代码格式,并通过Python、C++、Java等多种编程语言模板构造多样化监督信号,在不依赖外部生物医学知识的情况下增强结构约束与数据多样性;同时在推理阶段采用跨格式实体级投票集成,降低不同语言表示带来的预测方差,提升鲁棒性与跨数据集泛化能力。
- Spatial Strategies, Not Actions: Vector-Quantized Geodesics as Tools for LLM-Driven Agents
- 赛道归属: LLM智能体 / 空间推理 / 工具使用
- 核心创新点: 提出一种将几何轨迹作为工具、由LLM进行高层编排的两层智能体框架:先在网格世界中收集地理路径轨迹,再通过向量量化从中提取代表性轨迹集合;离线阶段让LLM为每条选中的轨迹关联自然语言行为描述,形成可调用工具;在线阶段LLM根据当前状态与目标选择合适工具,底层则由原始动作执行对应轨迹。该方法把工具发现交给无监督轨迹量化,把推理与决策交给LLM,从而在部分可观测动态环境中以更低推理成本实现接近更强链式思维版本的目标达成效果。
- ReCAP: Retrieval-Guided Capability Reuse for Multimodal Continual Instruction Tuning
- 赛道归属: 多模态持续学习 / 指令微调 / 检索增强
- 核心创新点: 提出 ReCAP,通过外部检索与 LLM 构建领域知识、推理知识和格式知识库,并在每个持续阶段为指令检索相关知识,指导能力复用与实例级能力路径生成。进一步引入 adaptive subspace recycling,用共享基与阶段特定核心参数化可复用能力模块,在保留历史重要方向的同时回收剩余容量,以缓解跨阶段遗忘。
- Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training
- 赛道归属: 推理优化 / 强化学习后训练 / 无奖励优化
- 核心创新点: 提出 RFPO,将预训练且校准后的 critic 重新利用为 rollout 级奖励、GAE 的 value baseline,以及未完成前缀的成功预测器,实现无需外部奖励标签、逐步标注或完整 rollout 的策略优化。其关键方法突破是利用 critic 对未来结果的预测能力提供稠密学习信号,并通过二值化去偏分数抑制长度偏置,从而在降低计算与显存开销的同时保持性能。
- SeOPD: Self-Evolving LLMs via Online Policy Distillation from Self-Generated Chain-of-Thought
- 赛道归属: 自我进化 / 在线策略蒸馏 / 思维链学习
- 核心创新点: 提出 SeOPD,让同一个 LLM 的 deep-thinking 模式生成 CoT,再将该 CoT 作为 privileged information 去监督 non-thinking 模式的 token 级输出,实现无需外部标注或环境反馈的在线策略蒸馏。方法的核心在于把模型自身推理过程中涌现的信息内化到共享参数中,从而同时提升非思考与深度思考能力。
- LLM Alignment--Utility Asymmetry under Semantic-Preserving Transformations
- 赛道归属: 对齐鲁棒性 / 安全性评测 / 分布偏移
- 核心创新点: 通过语义保持、规则可逆的合成变换,系统检验 LLM 对分布偏移下的对齐泛化能力,提出“Alignment-utility asymmetry”现象:模型在变换输入上往往仍能保持任务效用,但安全对齐失效会更显著地恶化。该工作的方法价值在于把对齐问题从攻击视角转为受控探针,揭示语义不变但表面形式变化时,效用与安全的泛化并不同步。
GitHub
- [2026-10-05] sgl-project/sglang ⭐36789
- [2026-10-05] zchoi/Awesome-Embodied-Robotics-and-Agent ⭐1898 🆕NEW
- [2026-10-05] maxbbraun/llama4micro ⭐561 🆕NEW
- [2026-10-05] Jacobinwwey/obsidian-NotEMD ⭐311 🆕NEW
- [2026-10-05] basellm/llm-metadata ⭐146
HuggingFace Models
HuggingFace Datasets
- [2026-09-26] XiaomiMiMo/MiMo-V2.6-RL-oss
- [2026-09-24] MoreThought/Fable-5.1-Max-Reasoning-Filtered-10000x
- [2026-09-20] aidigestorg/ai-village 🆕NEW
HuggingFace Spaces
多模态大模型
arXiv
- A Vision-Language Model (VLM)-based Pipeline for End-to-End Procedural Modeling of Field-Grown Maize from Point Clouds 🆕NEW
- 赛道归属: 3D生成 / 点云到可编辑3D建模 / 多模态理解
- 核心创新点: 提出一条从原始田间玉米点云到参数化、可编辑三维作物模型的端到端自动化流程:先用视觉语言模型在渲染的正交视图中标注叶片中线,再通过确定性的几何回投、跨视图一致性融合与基于方向加权表面图的中线生长,将2D标注转化为3D叶片结构;随后把测得的器官参数填入基于NURBS的程序化模型生成器,并用可微NURBS拟合对叶片表面进行精修。该方法的关键突破在于不依赖人工调参或物种特定训练数据,把VLM的语义标注与后续几何约束结合,转化为可用于程序化建模的器官级测量。
- Similar Choices, Different Attention: Cross-Modal Associations in Humans and Vision-Language Models
- 赛道归属: 多模态理解 / 跨模态注意力分析
- 核心创新点: 该工作在相同刺激条件下同时比较人类与VLM的选择结果和眼动轨迹,避免了以往“人机使用不同任务或不同刺激”带来的不可比问题;进一步通过人类选择微调、以人类注视训练模型注意力等方式,分别检验“选择对齐”和“注意力对齐”是否足以代表人类一致的跨模态加工,揭示二者并不等价,且模型注意力与人类凝视的匹配甚至不如中心偏置基线。
- SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
- 赛道归属: 多模态理解 / 音视频理解评测
- 核心创新点: 提出SONIC-O1这一面向真实世界音视频理解的系统化评测基准,覆盖60小时、231个片段、13个对话场景,并由人工全量核验;同时联合评估开放式总结、选择题问答与带理由的时间定位三类能力,尤其强调对“时序对齐+推理依据”的考察,并附带人口统计元数据以分析模型在不同群体上的行为差异。
- Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
- 赛道归属: 多模态理解 / 情感推理与因果分析
- 核心创新点: 通过基于steering vector的因果归因框架,分析并增强大视觉语言模型中的情感电路,重点刻画跨模态信息如何从视觉刺激流向情感叙事生成;方法上将“情感理解”从黑箱表征转为可干预、可归因的跨模态信息流问题,从而支持对情感相关内部机制的解释与增强。
- VidHarness: Evolving Agent Harnesses for Cost-Efficient Long Video Understanding
- 赛道归属: 长视频理解 / 视频智能体优化
- 核心创新点: 提出 VidHarness,通过“智能体 harness 自动进化”替代人工设计的视频理解流程;利用执行反馈驱动的迭代搜索,并用 MCTS 避免贪心优化陷入局部最优;结合不确定性感知的多保真验证,先用少量问题筛选候选 harness 以降低评估成本;进一步引入 mixture-of-harness,根据不同帧预算路由到专门化 harness,从而在成本可控的前提下提升长视频问答效果。
- When Words Speak Louder than Images: Towards Understanding Language Bias in Vision-Language Models
- 赛道归属: 多模态理解 / 语言偏置诊断
- 核心创新点: 该工作提出一个四阶段推理诊断框架,把VLM中的语言偏置传播过程拆解为若干相互依赖的推理阶段,并分别考察语言先验与跨模态覆盖在各阶段中的演化;其方法论贡献在于不只判断“是否有偏置”,而是追踪偏置如何在推理链路中形成、累积并最终导致错误预测。
- OmniMoE-VL: A Sparse Vision-Language Model with Coupled Visual-Depth Routing
- 赛道归属: 稀疏多模态模型 / 视觉-语言路由
- 核心创新点: 提出OmniMoE-VL,通过耦合的视觉深度路由投影器,为每个图像-提示对动态选择一组稀疏的中间视觉层,并将该全局偏好同时用于局部patch融合与向语言模型的动态视觉注入;创新点在于把“哪些视觉中间表征应暴露给语言侧”变成问题相关的路由决策,并与MoE式专家路由协同,从而实现更灵活的问答式视觉访问。
- Gradient-Guided Decoupled Adaptation for Geospatial Vision-Language Models
- 赛道归属: 地理多模态理解 / 多任务优化
- 核心创新点: 提出Gradient-Guided Decoupled Adaptation(G2DA),利用任务梯度特征对地理VLM的多任务适配进行解耦组织:先按梯度引导将任务划分为视觉中心与语言中心组,再基于梯度相似性构建模态专属课程,并通过双向回放缓解顺序优化带来的遗忘;其关键突破是用梯度结构显式建模任务间冲突,而非简单共享统一多任务训练。
- ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding
- 赛道归属: 流式视频理解 / 低延迟多模态推理
- 核心创新点: 提出 ShallowStream,将 MLLM 的浅层同时用于帧编码与检索索引构建,避免每次都执行完整深层 prefill;在流式处理中维护基于浅层 KV cache 的轻量常驻索引,并在问答时利用浅层注意力分数进行上下文帧打分;再通过多样性感知选择策略检索更精确且更全面的证据,从而显著降低逐帧预填充和端到端延迟。
- MedVL-SAM2: A unified 3D medical vision-language model for multimodal reasoning and prompt-driven segmentation
- 赛道归属: 3D医学多模态理解 / 3D医学分割
- 核心创新点: 提出统一的3D医学视觉语言模型MedVL-SAM2,将报告生成、VQA与多范式分割(语义、指代、交互式)整合到单一框架中;方法上通过3D CT图文大规模预训练对齐体数据视觉特征与放射学语言嵌入,再结合语言理解与分割目标联合优化,并引入基于SAM2的体数据分割模块,实现语言、点、框等多种提示方式下的精细空间定位与跨模态推理统一。
GitHub
- [2026-10-03] Blaizzy/mlx-vlm ⭐5566
- [2026-10-02] jingyi0000/VLM_survey ⭐3126 🆕NEW
- [2026-10-05] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1903
- [2026-09-29] XuankunRong/Awesome-LVLM-Safety ⭐221
- [2026-10-03] hcompai/holo-desktop-cli ⭐50
强化学习
arXiv
- MaD-RL: Matching Distributions for Calibrating LLMs with Reinforcement Learning
- 赛道归属: 大语言模型后训练 / 分布匹配式强化学习
- 核心创新点: 提出面向输出分布控制的通用RL框架,将传统只优化单个输出期望奖励的后训练范式扩展为“分布匹配”;通过对潜在类别属性的目标分布建模,设计KL、JS等不同散度对应的奖励函数,并指出已有方法可视为L2散度的特例,从而实现对模型输出多样性、类别比例与约束满足的更精细控制。
- RL Starts before RL: On Policy Distillation for Better Reinforcement Learning
- 赛道归属: 推理优化 / 强化学习训练策略
- 核心创新点: 提出在正式RL之前先进行on-policy distillation(OPD)作为准备阶段,证明其收益不仅体现在初始准确率提升,还能带来更高的最终RL性能;进一步分析了蒸馏目标与轨迹来源对后续RL的影响,发现相较于reverse-KL,forward-KL在“蒸馏后接RL”的设置下更有优势,且student rollouts优于teacher rollouts,说明与教师分布的更深层对齐比单纯top-1一致性更关键。
- RL-ABC: Reinforcement Learning for Accelerator Beamline Control
- 赛道归属: 强化学习系统 / 科学计算控制 / 加速器束线优化
- 核心创新点: 构建了一个将粒子加速器束线配置自动转化为RL环境的开源框架RLABC,核心方法是把束线调参形式化为MDP,并自动完成诊断点插入、57维状态构造、奖励函数配置以及与Elegant仿真器的接口对接;同时引入stage learning以将复杂优化拆解为更易训练的子问题,从而提升训练效率与可用性。
- UniIntervene++: An Adaptive Intervention Agent for Efficient Real-World Reinforcement Learning 🆕NEW
- 赛道归属: 真实世界机器人强化学习 / 在线强化学习干预控制
- 核心创新点: 提出自适应干预代理 UniIntervene++,将自主策略、轨迹纠正和任务结构化 CodePolicy 统一建模为半马尔可夫决策过程中的 Options,并在线学习它们的相对价值;通过“能力自适应干预”周期性探测当前策略的无辅助执行能力,使干预时机随策略进步动态调整;再结合耦合经验学习,让辅助行为反向促进 RL 策略提升,从而联合决定“何时干预、如何干预、何时放权”。
- OuroReward: Sequential Reward Scheduling for Reinforcement Learning in Text-to-3D Generation 🆕NEW
- 赛道归属: 文生3D生成 / 强化学习奖励设计
- 核心创新点: 提出 OuroReward,一种面向多质量维度的顺序式奖励调度方法,不再将多个奖励简单并行聚合,而是先估计维度间的成对依赖关系,构造尽量降低累计干扰的循环优化路径,再将其转化为单次顺序优化流程;训练过程中根据当前奖励维度的剩余优化空间自适应决定何时切换到下一个奖励,并引入 AdaSelect 选择与当前模型能力匹配、信息更可靠的提示词,以提升训练稳定性与多维质量均衡优化效果。
- Understanding Enrichment in Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习理论分析 / 稀疏奖励与奖励富集
- 核心创新点: 系统分析了在稀疏奖励 RLVR 中使用提示或中间引导进行“enrichment”时,若不做重要性修正或采用截断修正,会如何隐式重加权原始奖励,并将梯度误差分解为尺度、旋转和方差三类效应;同时提出一种顺序蒙特卡洛(SMC)权重修正机制,在稳定性与粒子顺序假设下,将标准修正随样本长度指数式累积的方差问题,缓解为加性累积,从而使富集样本的修正更可行。
- VIGOR: Zero-Shot Visual Generalization via Latent-Space Consistency in Model-Based Reinforcement Learning 🆕NEW
- 赛道归属: 模型式强化学习 / 视觉泛化
- 核心创新点: 提出 VIGOR,用于解决模型式 RL 在未见视觉扰动下的零样本泛化问题;方法从潜空间一致性出发,联合设计了非对称弱到强增强、动力学层一致性约束和编码器层稳定化三部分:前者在同一批次中构造弱视图与弱到强视图,后两者分别通过直接潜变量回归约束转移预测对增强不变,并防止编码器在跨增强监督下漂移,从而缓解视觉扰动在递归潜空间 rollout 中的误差累积。
- OPD Before RL: Warm-Starting Rubric-Based RL with On-Policy Distillation 🆕NEW
- 赛道归属: 大语言模型对齐 / 基于规则的强化学习
- 核心创新点: 提出两阶段训练框架 OPD Before RL,先用 rubric 作为特权教师上下文进行 token 级密集监督,再用 rubric 奖励继续强化学习;其中 RP-OPD 让不直接看到 rubric 的学生模型,在自身生成的前缀上匹配 rubric-aware 教师的下一词分布,实现更细粒度的决策引导,随后再进入基于 rubric 的 RL 阶段以突破蒸馏平台期,从而缓解仅靠终局奖励难以定位具体贡献决策的问题。
- Reward Inflation: A Healthy Stimulus for Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习优化技巧 / 奖励调度
- 核心创新点: 提出 reward inflation,即在训练过程中逐步放大奖励幅度,而不是保持固定奖励尺度;理论上该做法会诱导隐式的近期样本加权,增强对新经验的适应速度,并在策略趋于饱和时维持梯度信号、抑制“休眠神经元”出现、保持网络可塑性;同时给出自适应版本 Fed,可在线调整膨胀强度以适配不同训练阶段。
- Multi-Fidelity Policy Gradients Stabilize Data-Scarce Reinforcement Learning 🆕NEW
- 赛道归属: 数据稀缺强化学习 / 多保真策略梯度
- 核心创新点: 将多保真策略梯度从传统 REINFORCE 扩展到现代 actor-critic 与 PPO 场景,核心思路是只把低保真数据用于构造控制变量,以降低高保真目标域数据的梯度方差而不引入偏差;针对直接套用 PPO 会丢失跨保真相关性或放大方差的问题,重新设计了采样、优势估计和控制变量构造方式,并通过不确定性监控避免方差膨胀;此外还提出预算感知版本,在固定采样预算下动态分配高/低保真数据。
GitHub
- [2026-10-05] huggingface/trl ⭐19450
- [2026-10-05] kubernetes-sigs/agent-sandbox ⭐4142
- [2026-10-05] Tencent-Hunyuan/UniRL ⭐1001 🆕NEW
- [2026-10-05] n3428093-rgb/rl-gym-forge ⭐56 🆕NEW
- [2026-10-05] raamonp/rl-gym-orchestrator ⭐55
HuggingFace Models
HuggingFace Datasets
- [2026-10-04] ankitjh4/bharat-government-documents 🆕NEW
世界动作模型
arXiv
- XGenAct: Geometry-Enhanced World Action Models through Cross-Task Generation 🆕NEW
- 赛道归属: 机器人控制 / 世界动作模型 / 3D感知增强
- 核心创新点: 将RGB观测、机器人动作、度量深度、表面法线和功能角色分割统一编码为RGB视频表示,通过确定性codec把多种感知与动作任务纳入同一个视频扩散Transformer中联合学习;训练时通过采样不同感知与动作任务,用单一模型和单一目标学习跨空间的时序预测,避免了为不同模态设计专门头部或分支的碎片化架构。
- Native Action-Prior Learning from Videos for World Action Models 🆕NEW
- 赛道归属: 机器人控制 / 世界动作模型 / 观察视频预训练
- 核心创新点: 提出从仅含观察的视频中直接预训练动作策略的“native action-prior learning”,不再依赖先学表征再迁移到控制,也不需要单独的潜变量动作模型;方法上先用未来视频流匹配监督,通过带有转移结构的联合注意力把视觉转移信息传递到Action-DiT中学习动作先验,再用带动作标注的示范进行联合视频-动作流匹配后训练,并通过非对称注意力将视觉分支与动作去噪解耦以支持高效动作推理。
- PointWAM: 3D World Action Modeling for Dexterous Robotic Manipulation 🆕NEW
- 赛道归属: 机器人控制 / 世界动作模型 / 3D点云动作建模
- 核心创新点: 将世界表示从RGB提升到3D点轨迹,把场景与手部分解为两个实体,并在共享的时空坐标系中联合预测二者的3D演化;这种显式、解耦的3D表示使模型能够直接利用大规模人类演示视频进行预训练,无需任务特定的物体或关键点选择,随后再将预测到的手部运动重定向为机器人动作,从而更好建模灵巧操作中的空间结构与接触几何。
- World Action Modeling with Progressive Visual Planning 🆕NEW
- 赛道归属: 机器人控制 / 世界动作模型 / 分层视觉规划
- 核心创新点: 用“进度式”视觉子目标序列替代密集视频回放,将动作生成与有序的稀疏视觉子目标联合预测,使模型在执行过程中获得显式视觉引导;同时利用可从大规模无动作视频中学习子目标预测的设计,把复杂视觉规划从动作策略中分离出去,并通过一次视频骨干前向缓存稀疏子目标特征,避免迭代式全视频生成,只保留轻量级动作去噪用于重规划。
- Completion Aware Guidance for World Action Models
- 赛道归属: 世界动作模型 / 机器人控制 / 生成式规划
- 核心创新点: 提出无需训练的 Completion Aware Guidance(CAG)采样方法,在生成阶段引导世界动作模型更偏向“任务完成”而非仅仅局部合理的短期延续,从而缓解任务不完整想象问题;其关键突破在于指出该问题主要来自短 chunk 控制下的采样偏置,并通过推理时引导直接改善视觉未来与动作预测的任务完成性。
- CtrlWAM: Controllable World Action Models with Aligned Intent and Foresight
- 赛道归属: 世界动作模型 / 可控生成 / 多智能体动作-视频联合建模
- 核心创新点: 提出 CtrlWAM,通过在模拟器中执行扰动后的动作并配对其对应的噪声视觉结果,解决传统“动作加噪与视频加噪”训练中动作反事实与视频仍绑定真实轨迹的错配问题;同时设计 warped video-action noise schedules,使视频与动作在不同去噪需求下保持协调,并将动作接口从单一自我控制扩展到可变数量的多智能体流,从而统一支持预测未来与接收外部指令的多主体控制。
- Learning Skills from Historical Action Trajectories: Action Experience Dictionary for World Action Models
- 赛道归属: 机器人控制 / 世界动作模型 / 动作经验检索与复用
- 核心创新点: 构建动作经验词典(AED),把历史物理动作轨迹编码为共享动作嵌入,用于跨任务技能复用和跨任务语义关系建模;具体做法是先将历史动作与视觉观测对齐,再通过预训练动作分词器从词典中检索动作嵌入,并用交叉注意力进行视觉条件化后前置到噪声动作token中,为预测提供交互上下文与动作意图;同时引入运动感知的转移损失,监督随机时间间隔上的视觉特征变化,以减少背景干扰、强化动作相关运动建模。
- EVO-WAM: Evolving World Action Models through Video-Action Verification
- 赛道归属: 机器人操作 / 世界动作模型 / 测试时自适应
- 核心创新点: 提出 EVO-WAM,通过“自生成轨迹再训练”的方式让世界动作模型适配未见任务;先加入状态预测与锚定多帧上下文以支持无需外部执行反馈的自回归展开,再用视觉语言模型筛选任务完成前缀、结合逆动力学模型验证视频-动作一致性,最后对已验证前缀进行迭代训练,从而在不额外采集专家演示的情况下提升新任务成功率。
- V2X-WAM: A Cooperative World Action Model for End-to-End Autonomous Driving
- 赛道归属: 自动驾驶 / V2X协同感知 / 世界动作模型
- 核心创新点: 提出 V2X-WAM,将协同场景理解、动作生成与未来世界推理紧密耦合;利用车端与路侧观测构建可靠性感知的时空表示,并将路侧信息压缩为量化消息以降低通信开销;在此基础上,规划器生成候选轨迹并显式条件化未来占用与动态流预测,再将预测到的世界后果反馈用于修正轨迹,实现动作与环境演化的闭环交互。
- NeuronDiscover: Agent-in-Twin for Mechanistic Discovery in Neuronal Microenvironments with World Action Models
- 赛道归属: 科学发现 / 神经机制发现 / 交互式实验设计 / 世界动作模型
- 核心创新点: 提出 NeuronDiscover,将共享的、机制约束的 WAM 用于“预测—干预—观测”一体化决策;通过显式建模 twin confounding,联合维护机制与模型偏差的信念,并据此设计实验;同时用 MIOY 图记录与修订机制-干预-观测-结果关系,最终编译为带有偏差校正接受边界的可执行程序,以提升在稀疏观测下的机制判别与关系解析能力。
GitHub
- [2026-10-01] OpenWAM-Official/OpenWAM ⭐946
- [2026-10-02] OpenMOSS/EasyWAM ⭐393
- [2026-10-02] black-forest-labs/flux-action ⭐131 🆕NEW
- [2026-10-05] LeapLabTHU/Simple-WAM ⭐70
由 Research Daily 自动生成 生成时间: 2026-10-05 13:30:38