AI 每日进展速报 - 2026-10-07
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- Keep It CALM: Analyzing the Limits of Global Unsafety in Text-to-Image Generation
- 赛道归属: 文生图安全对齐 / 训练时无关安全防护
- 核心创新点: 该工作分析了“全局不安全方向/子空间”这类训练无关安全方法的适用边界,指出其存在“覆盖性-选择性”权衡:过于紧凑的安全子空间难以覆盖多样化的有害语义,过于宽泛的聚合又会误伤安全邻近的正常提示词。基于这一几何分析,提出 CALM,通过匹配有害-安全锚点进行提示词局部反事实修正,只对触发违规的 token 表征做最小化安全侧编辑,并抑制正向对齐的有害残差,从而以更细粒度的局部修正替代统一的全局不安全信号移除。
- POET: Preference Optimization for Enhanced Text-to-Image Generation
- 赛道归属: 文生图优化 / 提示词重写
- 核心创新点: 提出POET,通过LLM先对用户输入进行自动提示词重写,再送入冻结的文生图骨干模型;其关键创新在于设计复合奖励并采用迭代式DPO训练,让重写器直接从多模态反馈中学习“模型偏好”的提示结构,且不依赖高成本SFT数据,从而提升图文对齐、视觉质量与美学表现,并具备跨不同T2I骨干的迁移能力。
- TerraVis: Towards Evaluation of World-Grounded Visual Consistency in Text-to-Image Generation via MLLM Workflows
- 赛道归属: 文生图评测 / 世界一致性评估
- 核心创新点: 该工作提出 TerraVis,用于评估生成图像是否符合真实世界的结构与物理常识,而不仅是视觉质量或文本对齐。其核心方法是构建覆盖对象、交互和场景层面的世界一致性违规 taxonomy,并设计多阶段 MLLM 评估流程:先判断图像是否适合评估,再识别 18 类违规类型,并将其划分为轻微/严重以形成总体世界一致性分数。该框架强调对“看起来好但不符合常识”的失败模式进行系统化量化与诊断。
- Two Halves are More than One: Phase-wise Velocity Distillation for Fast and High-Quality Image Generation 🆕NEW
- 赛道归属: 文生图 / 图像生成加速与蒸馏
- 核心创新点: 提出 Phase-wise Velocity Distillation(PVD),将生成过程划分为“粗阶段”和“细阶段”,分别用两个半尺寸的阶段专属专家建模各自的平均速度,从而把结构生成与细节修复解耦;在保持总计算量等价于一次完整骨干前向的前提下,相比单一大一统学生模型更能避免过度平滑,并在高质量快速生成上取得更优效果。
- Safe Image Generation via Reinforcement Learning
- 赛道归属: 文生图安全生成 / 生成过程安全控制
- 核心创新点: 提出一种“生成中”安全框架,不再只依赖生成前过滤或生成后审核,而是在扩散去噪轨迹中监测中间表示里的NSFW信号;进一步结合强化学习,将检测到的风险轨迹主动引导到安全图像生成方向,实现对NSFW提示词的可控安全生成,并尽量保持图像质量与提示词一致性。
- VisualErase: Dual-Branch Visual Trajectory Redirection for Robust Concept Erasure in Text-to-Image Diffusion Models
- 赛道归属: 文生图概念擦除 / 扩散模型知识移除
- 核心创新点: 提出双分支的视觉轨迹重定向范式,目标不是仅改写文本到图像映射,而是直接将包含目标概念的视觉生成轨迹重定向到“概念已移除”的结果;通过结构保持的图像编辑构造内容对齐但去除目标概念的对应样本,并据此建立去噪目标,同时对有条件与无条件预测施加联合约束,再结合对应内容保留损失,以增强擦除鲁棒性并减少对非目标生成能力的破坏。
- Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards
- 赛道归属: 文生图后训练 / 偏好优化 / 奖励建模
- 核心创新点: 该工作提出一种面向开放域文生图模型的后训练配方,通过组合互补奖励来同时优化整体人类偏好与提示词忠实度等细粒度属性。方法上包含两类奖励:基于大规模人类偏好数据、采用 Bradley-Terry 目标训练的偏好奖励,以及显式评估 prompt faithfulness 等属性并用于防止 reward hacking 的 rubric 奖励。其关键突破在于不采用简单加权平均,而是设计更有效的奖励组合策略,以更好平衡偏好优化与规则满足。
- Traversing the Satisfaction-Diversity Frontier in Text-to-Image Diffusion
- 赛道归属: 文生图扩散模型采样 / 多样性-满意度权衡
- 核心创新点: 该工作将多图生成建模为“satisficing”问题:每个候选图都必须达到最低奖励阈值,同时整批结果还需满足多样性下限,从而显式刻画“满意度-多样性”前沿。为遍历这一前沿,提出训练无关的推理时方法 SatisDive,利用 batch-relative reward cutoff 区分低奖励与高奖励候选,对低于阈值的样本侧重提升奖励,对高于阈值的样本侧重保持多样性。其方法论重点在于把奖励与多样性从单一聚合目标改为分层约束与分区调控。
- When Text-to-Image Helps Editing: The Effects of Conditioning During Denoising
- 赛道归属: 图像编辑 / 扩散模型采样策略优化
- 核心创新点: 研究统一式编辑模型在去噪过程中不同条件信息的作用变化,发现纯编辑流程中源图像条件在部分编辑任务上会随采样轨迹逐渐减弱;据此提出“任务切换”策略,在去噪的有限区间内切换到文本到图像(T2I)任务,让模型调用其生成能力,再切回编辑模式。该方法利用同一统一模型已训练的两种条件模式,通过切换时机在编辑质量与内容保真之间取得更优平衡。
- Steering Fields: Adaptive Vector Fields for Safe Image Generation and Beyond
- 赛道归属: 安全可控生成 / 图像编辑
- 核心创新点: 提出Steering Fields,将传统“全局固定 steering vector”推广为可随生成过程动态重估方向的自适应向量场;该方法在flow模型的噪声状态上逐步更新引导方向,形成可连续调节的安全控制强度与内容保真度权衡,并支持概念的同时诱导与抑制。由于不依赖显式空间mask或对象先验,它还能自然保持局部结构,进一步可作为无反演、模型无关的结构保持式图像编辑方法。
GitHub
- [2026-10-07] pydantic/pydantic-ai ⭐20459
- [2026-10-07] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13540
- [2026-10-07] alfredxw/denova ⭐874 🆕NEW
- [2026-10-07] AceDataCloud/Nexior ⭐399
- [2026-10-07] etkecc/baibot ⭐250
HuggingFace Models
- Qwen/Qwen-Image-2.1 🆕NEW
HuggingFace Spaces
视频生成/编辑
arXiv
- TasteRoute: Personalized Routing for Video Generation
- 赛道归属: 视频生成 / 个性化路由 / 成本感知生成
- 核心创新点: 提出面向视频生成请求的个性化路由框架,将输入需求、用户偏好与生成预算联合建模,用于在多个视频生成模型之间选择合适的生成器;同时构建了包含多模型视频对比、质量判断、偏好排序和用户画像信号的标注数据集,支持偏好路由与成本控制的联合优化。
- MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation
- 赛道归属: 视频生成 / 长时序自回归生成 / 记忆增强
- 核心创新点: 提出 MosaiChunk 记忆机制,将跨空间与时间的历史 KV 选择性组合成“马赛克”式记忆,在冻结视频生成器的前提下,仅训练轻量路由器决定在固定记忆预算下保留哪些历史片段,从而让模型在对象或场景重新出现时仍能恢复细粒度视觉细节;同时构建 RememBench,用于评测长时序重访场景下的文本到视频与图像到视频一致性。
- DramaAgent: Agentic Storytelling Video Generation
- 赛道归属: 视频生成 / 长视频叙事生成 / Agentic 控制
- 核心创新点: 提出 DramaAgent 这一分层、具备代理式控制的长篇视频与音频生成框架,不直接改造底层生成模型,而是在上层引入故事规划、持久角色条件控制、按场景合成以及反思驱动的定向修复流程;通过维护可复用的故事与角色状态,并对身份漂移、场景语义缺失、时序断裂和跨模态不匹配进行诊断与分阶段修复,提升长程叙事一致性与音视频协同。
- VideoGen-Agent: Reinforcing Video Generation Agents
- 赛道归属: 视频生成 / 多模态智能体
- 核心创新点: 提出 VideoGen-Agent,将视频生成任务转化为可调用外部工具的多轮智能体决策问题,并通过多任务 agentic reinforcement learning 学习工具使用策略;方法结合监督微调与强化学习,利用类别感知的混合奖励来同时约束工具调用有效性、任务适配性与生成质量。
- DrawVideo: Grounded and Faithful Multi-Shot Video Generation from Storyboard Keyframe Sketches
- 赛道归属: 视频生成 / 草图引导生成 / 多镜头故事板控制
- 核心创新点: 提出以故事板关键帧草图为核心的多镜头视频生成框架,将每个镜头拆解为黑白草图、外观提示和运动提示三类条件;方法上先生成结构对齐的参考关键帧,再将运动描述展开为有序动作状态的派生关键帧,最后在相邻关键帧之间合成局部视频片段,从而实现对空间结构、外观一致性和镜头级运动的显式控制。
- Keepsake: Selective Spatial Memory for Long-Horizon Video Generation
- 赛道归属: 视频生成 / 长时序视频生成 / 选择性记忆
- 核心创新点: 提出一种训练免费的在线空间记忆控制器,在固定容量下动态评估历史观测的保留价值;其关键在于构建位姿-外观图,将相机位姿接近性与视觉相似性结合起来计算保留优先级,并根据当前记忆库中的替代关系持续重估每个观测的价值,从而在不改动主生成器的前提下提升长时序一致性与生成质量。
- Kepler4D: Controllable Future Video Generation via 4D Scene State Evolution
- 赛道归属: 视频生成 / 可控未来视频生成 / 4D场景建模
- 核心创新点: 提出通过显式4D场景状态演化来生成未来视频的框架,将单目视频中的背景几何、物体运动历史、空间支撑和语义上下文统一到共享3D表示中;方法上利用 Chain-of-Motion 总结已观测运动,并借助视觉语言模型选择结构化的速度、方向等决策,再通过确定性滚动生成未来轨迹,最后将演化中的代理渲染为几何控制信号输入预训练视频生成器,实现运动可控与场景一致性的解耦。
- DuoMatching: Joint-Marginal Distribution Matching for Few-Step Video Generation
- 赛道归属: 视频生成 / 少步视频生成 / 分布匹配蒸馏
- 核心创新点: 提出 DuoMatching,将视频生成的分布匹配从单一的联合分布匹配扩展为“联合-边缘”统一建模:在原有 joint matching 基础上增加 marginal matching,为每一帧引入来自图像生成器的专门监督,以补充视觉质量与语义对齐能力;同时通过 LatentBridge 解决视频学生模型与图像教师之间的潜空间表示不一致问题,并用 Latent Variation Sampling 将帧级监督分散到不同时间片段,减少冗余、增强时序覆盖,从而在尽量保持运动动态的前提下提升画质、构图和语义一致性
- Weave Forcing: Compositional Memory Routing for Interactive Long Video Generation
- 赛道归属: 视频生成 / 交互式长视频生成 / 训练免费记忆路由
- 核心创新点: 提出 Weave Forcing,用于交互式长视频中“跨历史镜头组合式复用”记忆:首先借助 LLM 做语义槽位路由,将用户提示拆分为角色与背景等组件,并分别检索最合适的历史参考;随后通过 masked memory weaving,利用基于语义槽位的对比注意力图构造精细语义掩码,只暴露压缩历史 KV 记忆中与当前组件相关的 token 来指导生成;最后引入 coverage adaptive RoPE,根据参考覆盖是无/部分/完整三种情况自适应调整时间偏移与记忆保留,缓解不完整历史参考靠近当前生成时产生的视觉伪影
- VDOT++: Unified Few-Step Video Generation via Unbalanced Optimal Transport Distillation
- 赛道归属: 视频生成 / 少步视频生成 / 蒸馏优化 / 条件视频生成
- 核心创新点: 提出 VDOT++,将同一套蒸馏训练范式统一应用于文本到视频、图像到视频和条件生成三类任务,并针对输出多样性对最优传输蒸馏进行改造:采用非平衡(unbalanced)OT 形式,让不可靠的学生 token 分配更少质量,从而避免平衡 OT 在多解条件下强行一一对齐带来的失配;同时用 $\ell_1$ ground cost 替代均值式聚合,改为更保模式的加权中位数聚合,降低远距离传输目标的干扰;此外结合分布匹配与对抗细化的顺序反向传播,并利用解耦 score network 做跨尺度蒸馏,以更小模型继承更大模型能力
GitHub
- [2026-10-07] Anil-matcha/Open-Generative-AI ⭐29754 🆕NEW
- [2026-10-07] YouMind-OpenLab/awesome-seedance-2-prompts ⭐2085
- [2026-10-07] ddalcu/mlx-serve ⭐1781
- [2026-10-07] nexscope-ai/ecommerce-ai-tools ⭐56
- [2026-10-07] utensils/mold ⭐52
音频生成
arXiv
- FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision
- 赛道归属: 视频到音频生成 / Foley音效生成 / 多模态可控音频生成
- 核心创新点: 提出统一的video-to-audio框架,将多模态控制、帧级时间对齐和细粒度语义建模整合到同一生成流程中;通过条件注入机制支持音频控制的VTA与Foley扩展,通过多模态动态掩码策略保持训练阶段的时序同步,并引入基于副词的数据增强方法,结合信号处理与大语言模型增强文本监督的语义精度。
- ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
- 赛道归属: 视频到音频生成(V2A)/多模态可控生成
- 核心创新点: 提出统一的多模态V2A框架,支持视频、文本与参考音频的联合控制;通过融合CLIP与时空音视频编码器增强视觉-文本对齐,采用时间-音色解耦抑制冗余时序信息并保留可辨识音色特征,同时引入统一表示对齐与随机模态dropout提升跨模态冲突下的鲁棒可控性。
- NeuMark-Native: Robust Text-to-Speech-Native Watermarking Through Full Utilization of Neural Audio Codec Latent Space
- 赛道归属: 语音水印 / TTS安全与溯源 / 神经音频编解码器
- 核心创新点: 提出TTS-native水印框架,将载荷信息嵌入神经音频编解码器的每一层latent表示中,而不是在波形生成后进行外加扰动;在冻结预训练TTS模型和codec的前提下,仅优化水印模块,使水印在后续DSP攻击和神经codec重采样攻击下更稳健,同时尽量保持语音自然度、可懂度和音质。
- Prompt-Consistency Inference for Zero-Shot Flow-Matching Text-to-Speech Models
- 赛道归属: 零样本文本转语音 / 流匹配TTS推理优化
- 核心创新点: 提出训练无关的Prompt-Consistency Inference(PCI)推理规则,在每次速度场评估前将prompt对应的状态恢复到其解析形式,而不改变待生成区域;利用prompt轨迹可闭式求解这一性质,减少采样过程中prompt状态漂移带来的条件偏差,从而在不增加额外网络前向的情况下提升说话人相似度和可懂度。
- Articulatory Source-Filter TTS: Physically Grounded Control through Vocal Tract Kinematics
- 赛道归属: 可控文本到语音生成 / 语音合成
- 核心创新点: 提出一种基于发音器官运动学的 source-filter TTS 架构,将声道滤波器与声源显式解耦:通过 Acoustic-to-Articulatory Inversion 生成伪运动轨迹来条件化滤波器响应,并用预测的基频与能量轮廓参数化声门声源;同时引入 Optimal Transport Conditional Flow Matching 对声源进行细化,再与滤波器重组为最终频谱。该方法的关键突破在于把原本黑盒式的 TTS 转化为具备物理可解释控制的生成过程,支持稳定的韵律缩放、跨说话人声源/滤波器重组,以及对发音轨迹的直接操控。
- PLACE: Positional Latent Adaptation via Conditioned Embeddings for Binaural Audio Generation
- 赛道归属: 双耳音频生成 / 多模态条件音频生成
- 核心创新点: 在预训练 any-to-audio 模型 AudioX 上扩展出面向双耳生成的条件适配方法:利用 Perception Encoder Core 特征增强视频条件,引入文本与视频表示对齐以提取空间线索,并通过依赖条件的低秩变换调制生成潜变量。训练时再用解码音频的双耳线索目标(ITD/ILD)进行监督,从而把空间感知信息注入生成过程。其方法重点在于把文本、视频和可选音频提示统一到可控的空间音频生成框架中,提升空间一致性与跨模态控制能力。
- Zero-Shot Lombard Speech Synthesis with Controllable Style Embeddings 🆕NEW
- 赛道归属: 文本转语音(TTS)/零样本风格可控语音合成
- 核心创新点: 在不依赖 Lombard 专门训练数据的前提下,基于 F5-TTS 扩展出可学习的风格嵌入表示,并通过 PCA 分析潜空间中与 Lombard 属性相关的方向,再对这些方向进行操控,实现对发声力度、咬字清晰度等 Lombard 风格因素的可解释控制;该方法支持零样本合成不同强度的 Lombard-like 语音,同时保持说话人身份与自然度,并提升噪声环境下的可懂度。
- Pronunciation-Oriented Reinforcement Learning for Japanese Text-to-Speech with Kana-Domain ASR Rewards 🆕NEW
- 赛道归属: 文本转语音(TTS)/强化学习后训练/日语发音优化
- 核心创新点: 针对日语中“字形错误率”与“发音优化目标”之间的表示不匹配问题,提出在假名域计算 ASR 奖励的 Kana-CER,用于 RL 后训练中的可懂度优化;相比基于正字法 CER 的奖励,Kana-CER 更直接对齐发音层面的目标,在相同 GRPO 条件下显著降低目标汉字读音错误,并在更少优化步数内达到最佳验证效果,同时通过 KL 正则抑制了未约束优化带来的语音拉长问题。
- Region-Aware Masking for Accent-Robust Cross-Lingual Text-to-Speech 🆕NEW
- 赛道归属: 跨语种文本转语音(Cross-lingual TTS)/口音鲁棒语音合成
- 核心创新点: 针对零样本跨语种 TTS 中的口音泄漏问题,提出 region-aware masking:将双语语句拼接,并把重建掩码放置在语言边界附近,使训练阶段的掩码重建模式与推理时的跨语种条件更一致;该方法无需语言 ID、口音标签、平行同说话人数据或结构改动,仅通过掩码几何设计即可显著降低目标语音中的源语言口音,同时保持可懂度和自然度,并揭示了“掩码位置”比“掩码比例”更关键。
- A Comprehensive Objective Evaluation of Modern Text-to-Speech for Turkish Using Speech Quality Assessment Models
- 赛道归属: 文本转语音评测 / 多指标客观评估 / 低资源语言TTS基准
- 核心创新点: 构建了面向土耳其语TTS的系统性客观评测基准,对多种现代TTS系统在微调与零样本设置下进行统一比较;使用18个互补的客观指标覆盖自然度、可懂度、说话人相似度、分布一致性和低层声学特征,并进一步分析句长影响与长文本分块下的时序一致性漂移,为低资源、形态丰富语言的TTS评估提供了可复现的标准化方案。
GitHub
- [2026-10-07] huggingface/diffusers ⭐34676
- [2026-10-05] BinWang28/audio-ai-hub ⭐960
- [2026-10-01] apocas/restai ⭐514
- [2026-10-06] kandinskylab/kandinsky-6 ⭐133 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-10-01] espnet/yodas3
- [2026-10-04] cloud0day3/alania-synthetic-speech-tr
语言大模型
arXiv
- Structure vs. Chain-of-Thought: Evaluating LLM Criteria Extraction for Depression Severity
- 赛道归属: 医疗文本理解 / 心理健康评估 / LLM可解释性与评测
- 核心创新点: 该工作系统比较了两类基于LLM的抑郁严重程度判定范式:直接生成严重度标签的链式思维推理,以及先抽取临床量表条目再由规则映射为标签的“结构化抽取”方案。其方法上的重点在于引入可审计的临床标准(PHQ-9、BDI-II)与不同阈值设定方式,使用加权Kappa评估一致性,并分析是否存在“抽取优于推理”的稳定优势。结果表明,结构化抽取并未在所有设置下稳定优于链式思维,且阈值是否基于标注数据拟合会显著影响结论;同时,较高的整体一致性并不等价于对重症样本的更好识别,揭示了该类任务中“可解释性、校准与重症召回”之间的张力。
- DRIFT: Data Selection for LLM Instruction Tuning via On-Policy Attribution
- 赛道归属: 推理优化 / 数据选择 / 指令微调
- 核心创新点: 提出基于 on-policy attribution 的数据选择方法 DRIFT,用模型自身在验证查询上的采样回答构造验证目标,并按这些回答对原始训练样本的影响力进行排序;同时对影响分数中的梯度范数依赖进行校正。其关键突破在于不再以“节省数据”为目标,而是通过选择同一语料中的高影响样本继续微调,尝试突破全量数据训练的性能上限。
- AutoDP-LLM: Automating Data Pre-processing for Intrusion Detection Systems using Large Language Models
- 赛道归属: 网络安全 / 入侵检测 / LLM驱动的数据预处理自动化
- 核心创新点: 提出 AutoDP-LLM,将大语言模型用于自动生成、验证并执行入侵检测数据预处理流水线;通过“确定性主机侧规划 + LLM专家代理”协同生成处理策略与可执行代码,并结合语义推理与训练统计证据自适应筛选特征,在不预设特征预算的情况下实现紧凑、可执行的自动化预处理流程。
- Which LLM to pick? Online Active Model Selection for Large Language Models
- 赛道归属: LLM在线模型选择 / 主动学习 / 流式数据评测
- 核心创新点: 提出 ONLINE LLM PICKER,用于在流式查询场景下、在有限标注预算内主动挑选最有信息量的样本进行人工标注,从而识别候选模型中表现最佳或近似最佳的LLM。其方法核心在于将“模型选择”从依赖静态基准分数,转为面向在线数据流的主动标注决策问题,并通过选择最具判别力的提示来降低标注成本,同时支持在未标注样本上进行顺序生成时更早锁定优选模型。
- An Agentic AI Framework with Large Language Models and Chain-of-Thought for UAV-Assisted Logistics Scheduling with Mobile Edge Computing
- 赛道归属: 物流调度 / 边缘计算 / UAV协同优化 / Agentic AI
- 核心创新点: 构建一个面向UAV辅助物流与MEC联合调度的agentic AI框架,利用LLM、检索增强生成和Chain-of-Thought将用户需求转化为可解释的数学建模;同时设计分层PPO强化学习,上层学习UAV路径规划,下层优化每时隙任务执行与资源分配,以处理路由、能耗、计算与通信资源及截止期约束的耦合优化问题。
- Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning
- 赛道归属: 具身智能 / 神经符号规划 / LLM辅助强化学习
- 核心创新点: 将大语言模型、符号规划与强化学习进行混合式整合:利用LLM的常识推理能力识别环境中的缺失算子,借助符号规划器生成可执行计划,再由LLM为新识别的算子自动撰写奖励函数,指导强化学习代理学习对应控制策略,从而实现对开放世界中新颖对象的适应与操作学习。
- Towards In-Parameter Memory Augmentation for Large Language Models 🆕NEW
- 赛道归属: 大语言模型记忆增强 / 参数化记忆注入
- 核心创新点: 这是一篇综述性质工作,系统梳理了面向部署阶段的“in-parameter memory”增强范式,即将可复用的记忆信息编码到模型参数、适配器或类似参数对象中,并在推理时并入前向计算。文章提出了两个组织维度:一是按记忆注入位置划分为 Embedding、Attention、FFN 和 Hybrid;二是按记忆获取时机划分为离线获取与在线获取。其方法论价值在于明确了该类方法的边界、统一了不同路线的比较框架,并总结了干扰、安全性、与上下文学习协同以及递归自我改进等开放问题。
- Correct Verdicts, Flawed Reasoning: Structured Auditing of LLM-based Vulnerability Reasoning
- 赛道归属: 软件安全 / 漏洞分析 / LLM推理审计
- 核心创新点: 提出 VERA,用结构化推理记录(SRR)替代自由文本CoT,让模型以机器可读字段显式输出指针、内存操作和状态转移;再通过多阶段审计器对八类推理失败模式进行确定性检查,并仅在语义歧义处调用LLM,从而实现对漏洞推理过程的自动化、可扩展审计,同时支持大规模自动变异测试评估审计器能力。
- Enhancing Biomedical Named Entity Recognition via Multiple Programming Languages Instruction Tuning and Ensemble Method
- 赛道归属: 生物医学命名实体识别 / 指令微调 / 结构化信息抽取
- 核心创新点: 将BioNER重构为“结构到结构”的生成任务,把指令和实体输出都表示为代码格式,并通过Python、C++、Java等多种编程语言模板构造多样化监督信号,在不依赖外部生物医学知识的情况下增强结构约束与数据多样性;同时在推理阶段采用跨格式实体级投票集成,降低不同语言表示带来的预测方差,提升鲁棒性与跨数据集泛化能力。
- Spatial Strategies, Not Actions: Vector-Quantized Geodesics as Tools for LLM-Driven Agents
- 赛道归属: LLM智能体 / 空间推理 / 工具使用
- 核心创新点: 提出一种将几何轨迹作为工具、由LLM进行高层编排的两层智能体框架:先在网格世界中收集地理路径轨迹,再通过向量量化从中提取代表性轨迹集合;离线阶段让LLM为每条选中的轨迹关联自然语言行为描述,形成可调用工具;在线阶段LLM根据当前状态与目标选择合适工具,底层则由原始动作执行对应轨迹。该方法把工具发现交给无监督轨迹量化,把推理与决策交给LLM,从而在部分可观测动态环境中以更低推理成本实现接近更强链式思维版本的目标达成效果。
GitHub
- [2026-10-07] sgl-project/sglang ⭐36828
- [2026-10-07] NVIDIA/TensorRT-LLM ⭐14771
- [2026-10-07] yaolinli/MLLM-Token-Compression ⭐226 🆕NEW
- [2026-10-07] basellm/llm-metadata ⭐146
- [2026-10-07] lvyufeng/PocketLLM ⭐53
HuggingFace Models
HuggingFace Datasets
- [2026-09-26] XiaomiMiMo/MiMo-V2.6-RL-oss
- [2026-09-20] aidigestorg/ai-village
- [2026-09-24] MoreThought/Fable-5.1-Max-Reasoning-Filtered-10000x
HuggingFace Spaces
多模态大模型
arXiv
- A Vision-Language Model (VLM)-based Pipeline for End-to-End Procedural Modeling of Field-Grown Maize from Point Clouds
- 赛道归属: 3D生成 / 点云到可编辑3D建模 / 多模态理解
- 核心创新点: 提出一条从原始田间玉米点云到参数化、可编辑三维作物模型的端到端自动化流程:先用视觉语言模型在渲染的正交视图中标注叶片中线,再通过确定性的几何回投、跨视图一致性融合与基于方向加权表面图的中线生长,将2D标注转化为3D叶片结构;随后把测得的器官参数填入基于NURBS的程序化模型生成器,并用可微NURBS拟合对叶片表面进行精修。该方法的关键突破在于不依赖人工调参或物种特定训练数据,把VLM的语义标注与后续几何约束结合,转化为可用于程序化建模的器官级测量。
- Similar Choices, Different Attention: Cross-Modal Associations in Humans and Vision-Language Models
- 赛道归属: 多模态理解 / 跨模态注意力分析
- 核心创新点: 该工作在相同刺激条件下同时比较人类与VLM的选择结果和眼动轨迹,避免了以往“人机使用不同任务或不同刺激”带来的不可比问题;进一步通过人类选择微调、以人类注视训练模型注意力等方式,分别检验“选择对齐”和“注意力对齐”是否足以代表人类一致的跨模态加工,揭示二者并不等价,且模型注意力与人类凝视的匹配甚至不如中心偏置基线。
- LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
- 赛道归属: 多模态理解 / 语言能力恢复
- 核心创新点: 提出无需额外适配器的选择性跨模态蒸馏方法,利用微调前冻结的原始语言模型作为教师,在多模态后训练阶段专门监督语言能力恢复。关键技术是层级 KV-cache 共享,使纯文本教师能够感知学生的多模态表示而无需改动模型结构;同时仅在语言占比高的数据上进行蒸馏,避免削弱视觉对齐能力。该方法在不增加参数和推理开销的前提下,缓解了多模态微调导致的语言遗忘。
- SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
- 赛道归属: 多模态理解 / 音视频理解评测
- 核心创新点: 提出SONIC-O1这一面向真实世界音视频理解的系统化评测基准,覆盖60小时、231个片段、13个对话场景,并由人工全量核验;同时联合评估开放式总结、选择题问答与带理由的时间定位三类能力,尤其强调对“时序对齐+推理依据”的考察,并附带人口统计元数据以分析模型在不同群体上的行为差异。
- ReMem: Streaming Video Understanding With Long Context Retention
- 赛道归属: 视频理解 / 流式视频理解 / 长上下文记忆
- 核心创新点: 提出一种训练无关的流式视频适配方法,通过双记忆机制提升长上下文保留能力。其一是 Streaming Context Memory,使用与查询无关的注意力持续压缩历史上下文;其二是 Retrieved Vision Memory,从记忆中检索与当前查询最相关的视觉上下文补充输入。该方法面向任意长度流式视频,在不依赖额外训练的情况下增强长视频信息保留,并兼顾流式与长视频理解任务表现。
- FlashGaze: Training-Free Multi-Scale Patch Pruning For Efficient Video Understanding
- 赛道归属: 视频理解 / 高效视频推理 / 视觉token剪枝
- 核心创新点: 提出训练无关的多尺度 patch 剪枝方法,在 ViT 编码之前就减少时空冗余,从源头降低计算开销。方法以像素空间差异作为信息损失的代理,并通过四叉树动态规划联合优化 patch 的丢弃、合并与保留,在固定预算下实现更优的效率-精度权衡。相比在编码后剪枝的方案,该方法更早削减计算成本,且无需辅助网络训练,能够在大幅加速的同时尽量保持视频理解精度。
- VidHarness: Evolving Agent Harnesses for Cost-Efficient Long Video Understanding
- 赛道归属: 长视频理解 / 视频智能体优化
- 核心创新点: 提出 VidHarness,通过“智能体 harness 自动进化”替代人工设计的视频理解流程;利用执行反馈驱动的迭代搜索,并用 MCTS 避免贪心优化陷入局部最优;结合不确定性感知的多保真验证,先用少量问题筛选候选 harness 以降低评估成本;进一步引入 mixture-of-harness,根据不同帧预算路由到专门化 harness,从而在成本可控的前提下提升长视频问答效果。
- When Words Speak Louder than Images: Towards Understanding Language Bias in Vision-Language Models
- 赛道归属: 多模态理解 / 语言偏置诊断
- 核心创新点: 该工作提出一个四阶段推理诊断框架,把VLM中的语言偏置传播过程拆解为若干相互依赖的推理阶段,并分别考察语言先验与跨模态覆盖在各阶段中的演化;其方法论贡献在于不只判断“是否有偏置”,而是追踪偏置如何在推理链路中形成、累积并最终导致错误预测。
- OmniMoE-VL: A Sparse Vision-Language Model with Coupled Visual-Depth Routing
- 赛道归属: 稀疏多模态模型 / 视觉-语言路由
- 核心创新点: 提出OmniMoE-VL,通过耦合的视觉深度路由投影器,为每个图像-提示对动态选择一组稀疏的中间视觉层,并将该全局偏好同时用于局部patch融合与向语言模型的动态视觉注入;创新点在于把“哪些视觉中间表征应暴露给语言侧”变成问题相关的路由决策,并与MoE式专家路由协同,从而实现更灵活的问答式视觉访问。
- Gradient-Guided Decoupled Adaptation for Geospatial Vision-Language Models
- 赛道归属: 地理多模态理解 / 多任务优化
- 核心创新点: 提出Gradient-Guided Decoupled Adaptation(G2DA),利用任务梯度特征对地理VLM的多任务适配进行解耦组织:先按梯度引导将任务划分为视觉中心与语言中心组,再基于梯度相似性构建模态专属课程,并通过双向回放缓解顺序优化带来的遗忘;其关键突破是用梯度结构显式建模任务间冲突,而非简单共享统一多任务训练。
GitHub
- [2026-10-06] Blaizzy/mlx-vlm ⭐5575
- [2026-10-05] jingyi0000/VLM_survey ⭐3126
- [2026-10-07] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1911
- [2026-10-07] lablup/mlxcel ⭐473 🆕NEW
- [2026-10-02] kyegomez/ScreenAI ⭐386
强化学习
arXiv
- CORE-RL: Confidence-Oriented Reliability Evaluation of Black-Box Reinforcement Learning Policies
- 赛道归属: 强化学习安全评估 / 黑盒策略可靠性验证
- 核心创新点: 提出面向黑盒RL策略的统一可靠性评估流程,将早停终止与安全约束违规纳入同一可靠性指标,避免策略通过提前结束回合掩盖失败;同时在感知噪声、执行噪声和环境动力学变化的噪声认证包络下,结合有限样本统计界给出安全性与期望性能的高置信证书,并据此定义安全运行设计域(ODD)用于自动筛除不合规策略。
- MaD-RL: Matching Distributions for Calibrating LLMs with Reinforcement Learning
- 赛道归属: 大语言模型后训练 / 分布匹配式强化学习
- 核心创新点: 提出面向输出分布控制的通用RL框架,将传统只优化单个输出期望奖励的后训练范式扩展为“分布匹配”;通过对潜在类别属性的目标分布建模,设计KL、JS等不同散度对应的奖励函数,并指出已有方法可视为L2散度的特例,从而实现对模型输出多样性、类别比例与约束满足的更精细控制。
- RL Starts before RL: On Policy Distillation for Better Reinforcement Learning
- 赛道归属: 推理优化 / 强化学习训练策略
- 核心创新点: 提出在正式RL之前先进行on-policy distillation(OPD)作为准备阶段,证明其收益不仅体现在初始准确率提升,还能带来更高的最终RL性能;进一步分析了蒸馏目标与轨迹来源对后续RL的影响,发现相较于reverse-KL,forward-KL在“蒸馏后接RL”的设置下更有优势,且student rollouts优于teacher rollouts,说明与教师分布的更深层对齐比单纯top-1一致性更关键。
- RL-ABC: Reinforcement Learning for Accelerator Beamline Control
- 赛道归属: 强化学习系统 / 科学计算控制 / 加速器束线优化
- 核心创新点: 构建了一个将粒子加速器束线配置自动转化为RL环境的开源框架RLABC,核心方法是把束线调参形式化为MDP,并自动完成诊断点插入、57维状态构造、奖励函数配置以及与Elegant仿真器的接口对接;同时引入stage learning以将复杂优化拆解为更易训练的子问题,从而提升训练效率与可用性。
- TrustMed-RL: Long-Horizon Reinforcement Learning for Evidence-Grounded Clinical Diagnosis
- 赛道归属: 医疗多轮诊断 / 临床推理强化学习
- 核心创新点: 构建面向长时程、证据驱动诊断的多轮RL框架,将问诊、查体、检查、专科会诊与文献检索等状态相关动作纳入统一策略学习;通过临床适配的GiGPO与覆盖率调整后的诊断奖励,强化模型在给出诊断的同时主动获取支持性证据,从而提升诊断准确率与证据扎实度。
- QF3: Fast Flow RL with Filtered Q-Gradients 🆕NEW
- 赛道归属: 机器人强化学习 / 流式策略优化
- 核心创新点: 提出 QF3,一种在线离策略的 flow RL 方法,将 flow matching 与 critic 的动作梯度结合,并通过对 flow 输出的一步预测进行反向传播来更新策略;同时仅在动作维度与回放动作保持接近时才应用 critic 梯度,以过滤不可靠更新。该方法配合高吞吐离策略训练流程,实现了从零训练人形机器人运动策略并可零样本迁移到硬件,也能用于微调基于示范预训练的 flow 操作策略。
- Reinforcement Learning with Conformal Action Sets: An Application to Sequential Recommendation 🆕NEW
- 赛道归属: 序列推荐 / 强化学习排序优化
- 核心创新点: 提出 RLCP(Reinforcement Learning with Calibrated Pruning),利用 critic 分数与在线阈值自适应调整保留动作集合大小,并通过“集合是否包含代理目标动作”的二元反馈更新阈值。方法上给出了对代理漏检率的确定性界,以及将价值损失精确分解为过滤损失和选择损失的分析框架,从而在不要求参数收敛的前提下建立有限会话奖励上界。
- Selective Transfer of RL Updates for Visual Reasoning 🆕NEW
- 赛道归属: 多模态理解 / 视觉推理能力迁移
- 核心创新点: 提出 Selective-RL,从训练阶段的 RL 更新而非模型终点参数出发进行能力迁移,先隔离 RL 阶段产生的参数变化,再分析其跨模型可迁移性。方法上不直接迁移完整更新,而是保留更新中的主导矩阵方向并保持其幅值,将这些选择性更新转移到 VLM 的语言模块中,以提升视觉推理能力迁移效果。
- Reinforcement Learning for Hierarchical Reasoning Rewards: Minimax-Optimal Rates with Transformers 🆕NEW
- 赛道归属: 大模型推理优化 / 强化学习理论
- 核心创新点: 针对带有层级结构的推理奖励,建立了一个 Transformer actor-critic 的理论分析框架:策略在 KL 正则下进行 on-policy 采样,critic 拟合观测奖励,随后更新策略。论文证明该方法在查询预算和正则强度上达到 minimax 最优速率(至多差对数因子),并指出固定参考分布的离线式奖励建模在该层级奖励设定下会显著限制 regret 衰减。
- Reinforcement Learning with Segment Reward Feedback under Linear Function Approximation 🆕NEW
- 赛道归属: 强化学习理论 / 分段反馈学习
- 核心创新点: 研究线性函数逼近下的 segment reward feedback RL,统一刻画介于逐步奖励与轨迹级反馈之间的反馈粒度。针对已知转移与等长分段,分别为二元反馈和求和反馈设计了基于后验采样、规划与 E-optimal 设计的高效算法,并给出近乎匹配的下界;针对未知转移,提出统一的 least-squares value iteration 框架;进一步允许任意分段,分析表明分段特征对 regret 的影响主要只体现在对数因子上。
GitHub
- [2026-10-07] huggingface/trl ⭐19462
- [2026-10-07] radixark/miles ⭐3052
- [2026-10-07] Tencent-Hunyuan/UniRL ⭐1005
- [2026-10-07] ChuaCheowHuan/gym-continuousDoubleAuction ⭐155 🆕NEW
- [2026-10-07] selab-gatech/autoresttest ⭐53 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-10-04] ankitjh4/bharat-government-documents
- [2026-10-07] Cirquar-Tech/wm_imagined 🆕NEW
世界动作模型
arXiv
- TAPDreamer: Transferable Adversarial Patches for World Action Models
- 赛道归属: 世界动作模型安全攻击 / 对抗扰动
- 核心创新点: 提出一种无需访问目标模型输出、仅依赖公开编码器的可迁移对抗补丁攻击方法。其关键突破在于利用补丁引发的注意力权重与 value 向量交互,诱导一种可在图像大范围传播且跨任务稳定的表征偏移;并通过仅用单一源任务的6帧样本,直接优化干净与补丁编码表示之间的全局 L1 距离,从而得到可跨任务、跨动作架构迁移的固定局部扰动。
- RealtimeWAM: One-Step Asynchronous World Action Models
- 赛道归属: 世界动作模型推理加速 / 低延迟动作生成
- 核心创新点: 提出一种面向世界动作模型的极致高效推理框架,将动作生成压缩为单步,并通过异步执行减少视频专家与动作专家之间的等待开销。方法上包含两项关键设计:一是 Teacher-Anchored Consistency Distillation,用冻结教师的多步 rollout 终点补足仅靠局部一致性训练带来的“局部-全局误差鸿沟”,从而实现准确的一步动作生成;二是 Cross-Expert Wavefront Pipelining,通过块级共享视频 KV cache 并仅在动作注意力真正消费前同步,消除专家级串行等待。整体实现了近乎无损的性能保持与显著端到端加速。
- Future Anchored Verification and Online Recovery for World Action Models
- 赛道归属: 世界动作模型在线验证 / 执行恢复
- 核心创新点: 提出 FAVOR 框架,将世界动作模型在执行前预测出的未来帧作为“锚点”,同时用于偏差检测与在线恢复,而不是仅在偏离后决定是否停止。其方法核心是:通过 Anchor Verifier 将当前观测与对应锚点及已执行动作联合比对,识别破坏任务进程的偏移;再由 Anchor-Guided Recovery 借助视觉语言模型把被标记的锚点转化为简短纠正指令,促使模型回到原先预测的未来轨迹后继续执行。该工作把“监测”扩展为“验证 + 恢复”的闭环机制,且无需修改原策略。
- WAMJET: A Harness for World Action Model Acceleration
- 赛道归属: 世界动作模型推理加速 / 系统优化
- 核心创新点: 提出 WAMJET 这一面向世界动作模型加速的 agentic harness,通过为编码代理提供可复用的优化指导、测量与验证工具,自动化完成加速方案的选择、组合与迭代优化。其方法论重点在于采用“瓶颈驱动”的工作流:先剖析推理瓶颈,再定向修改代码,随后验证收益并根据瓶颈迁移继续优化,从而减少人工工程成本并保持动作质量。该框架可跨模型与硬件平台生成有效的加速栈,实现无损或近无损的显著提速。
- XGenAct: Geometry-Enhanced World Action Models through Cross-Task Generation
- 赛道归属: 机器人控制 / 世界动作模型 / 3D感知增强
- 核心创新点: 将RGB观测、机器人动作、度量深度、表面法线和功能角色分割统一编码为RGB视频表示,通过确定性codec把多种感知与动作任务纳入同一个视频扩散Transformer中联合学习;训练时通过采样不同感知与动作任务,用单一模型和单一目标学习跨空间的时序预测,避免了为不同模态设计专门头部或分支的碎片化架构。
- Native Action-Prior Learning from Videos for World Action Models
- 赛道归属: 机器人控制 / 世界动作模型 / 观察视频预训练
- 核心创新点: 提出从仅含观察的视频中直接预训练动作策略的“native action-prior learning”,不再依赖先学表征再迁移到控制,也不需要单独的潜变量动作模型;方法上先用未来视频流匹配监督,通过带有转移结构的联合注意力把视觉转移信息传递到Action-DiT中学习动作先验,再用带动作标注的示范进行联合视频-动作流匹配后训练,并通过非对称注意力将视觉分支与动作去噪解耦以支持高效动作推理。
- PointWAM: 3D World Action Modeling for Dexterous Robotic Manipulation
- 赛道归属: 机器人控制 / 世界动作模型 / 3D点云动作建模
- 核心创新点: 将世界表示从RGB提升到3D点轨迹,把场景与手部分解为两个实体,并在共享的时空坐标系中联合预测二者的3D演化;这种显式、解耦的3D表示使模型能够直接利用大规模人类演示视频进行预训练,无需任务特定的物体或关键点选择,随后再将预测到的手部运动重定向为机器人动作,从而更好建模灵巧操作中的空间结构与接触几何。
- World Action Modeling with Progressive Visual Planning
- 赛道归属: 机器人控制 / 世界动作模型 / 分层视觉规划
- 核心创新点: 用“进度式”视觉子目标序列替代密集视频回放,将动作生成与有序的稀疏视觉子目标联合预测,使模型在执行过程中获得显式视觉引导;同时利用可从大规模无动作视频中学习子目标预测的设计,把复杂视觉规划从动作策略中分离出去,并通过一次视频骨干前向缓存稀疏子目标特征,避免迭代式全视频生成,只保留轻量级动作去噪用于重规划。
- Completion Aware Guidance for World Action Models
- 赛道归属: 世界动作模型 / 机器人控制 / 生成式规划
- 核心创新点: 提出无需训练的 Completion Aware Guidance(CAG)采样方法,在生成阶段引导世界动作模型更偏向“任务完成”而非仅仅局部合理的短期延续,从而缓解任务不完整想象问题;其关键突破在于指出该问题主要来自短 chunk 控制下的采样偏置,并通过推理时引导直接改善视觉未来与动作预测的任务完成性。
- CtrlWAM: Controllable World Action Models with Aligned Intent and Foresight
- 赛道归属: 世界动作模型 / 可控生成 / 多智能体动作-视频联合建模
- 核心创新点: 提出 CtrlWAM,通过在模拟器中执行扰动后的动作并配对其对应的噪声视觉结果,解决传统“动作加噪与视频加噪”训练中动作反事实与视频仍绑定真实轨迹的错配问题;同时设计 warped video-action noise schedules,使视频与动作在不同去噪需求下保持协调,并将动作接口从单一自我控制扩展到可变数量的多智能体流,从而统一支持预测未来与接收外部指令的多主体控制。
GitHub
- [2026-10-02] OpenMOSS/EasyWAM ⭐399
- [2026-10-02] black-forest-labs/flux-action ⭐139
- [2026-10-07] OpenWAM/OpenWAM ⭐108 🆕NEW
- [2026-10-05] LeapLabTHU/Simple-WAM ⭐75
- [2026-10-06] youngzhou1999/DriveDreamer-Policy ⭐60
由 Research Daily 自动生成 生成时间: 2026-10-07 13:30:32