AI 每日进展速报 - 2026-10-02
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- Amplify What You Gaze At: Target Saliency Boosting in Text-to-Image Generation
- 赛道归属: 文生图 / 可控生成
- 核心创新点: 提出“目标显著性增强”任务,关注在不依赖任何视觉先验的前提下,让生成图像中指定对象更突出。其关键方法是将显著性视为相对量,通过建模目标对象与全局场景之间的相对关系来提升目标可见性,而不是仅对单个对象做局部强化。
- POET: Preference Optimization for Enhanced Text-to-Image Generation
- 赛道归属: 文生图优化 / 提示词重写
- 核心创新点: 提出POET,通过LLM先对用户输入进行自动提示词重写,再送入冻结的文生图骨干模型;其关键创新在于设计复合奖励并采用迭代式DPO训练,让重写器直接从多模态反馈中学习“模型偏好”的提示结构,且不依赖高成本SFT数据,从而提升图文对齐、视觉质量与美学表现,并具备跨不同T2I骨干的迁移能力。
- InGuard: Towards Generalized Inner Guardrail for Safe Text-to-Image Generation
- 赛道归属: 文生图 / 安全对齐
- 核心创新点: 提出面向安全生成的“内生护栏”思路,将安全控制从生成前后的外部分类器,转向利用模型内部表征进行更深度的风险约束。核心突破在于把安全判断与生成过程耦合,旨在提升对 NSFW 内容的泛化防护能力,而非依赖独立的事前/事后检测器。
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- 赛道归属: 文生图 / 少步生成加速
- 核心创新点: 面向 CFG 蒸馏中的少步生成,提出信息瓶颈引导的蒸馏策略,针对不同去噪阶段动态分配指导强度,而不是采用全局静态的 guidance 注入。其方法突破在于从“粗粒度、盲目注入”转向“阶段自适应、信息选择性压缩”,以更高效地保留 CFG 轨迹中的关键信息。
- OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation
- 赛道归属: 文生图 / 偏好优化 / 细粒度对齐
- 核心创新点: 提出对象中心的自我改进偏好优化框架,聚焦提升对象属性级别的对齐能力,如颜色、形状和空间关系。核心方法是围绕对象构建偏好优化过程,并强调自举式改进,以缓解传统 DPO/GRPO 在偏好构造和计算成本上的问题,同时提升细粒度文本-图像一致性。
- When Text-to-Image Helps Editing: The Effects of Conditioning During Denoising 🆕NEW
- 赛道归属: 图像编辑 / 扩散模型采样策略优化
- 核心创新点: 研究统一式编辑模型在去噪过程中不同条件信息的作用变化,发现纯编辑流程中源图像条件在部分编辑任务上会随采样轨迹逐渐减弱;据此提出“任务切换”策略,在去噪的有限区间内切换到文本到图像(T2I)任务,让模型调用其生成能力,再切回编辑模式。该方法利用同一统一模型已训练的两种条件模式,通过切换时机在编辑质量与内容保真之间取得更优平衡。
- Steering Fields: Adaptive Vector Fields for Safe Image Generation and Beyond
- 赛道归属: 安全可控生成 / 图像编辑
- 核心创新点: 提出Steering Fields,将传统“全局固定 steering vector”推广为可随生成过程动态重估方向的自适应向量场;该方法在flow模型的噪声状态上逐步更新引导方向,形成可连续调节的安全控制强度与内容保真度权衡,并支持概念的同时诱导与抑制。由于不依赖显式空间mask或对象先验,它还能自然保持局部结构,进一步可作为无反演、模型无关的结构保持式图像编辑方法。
- AdaPilot: Towards Scene-Adaptive Policy Learning for Cross-Generator Text-to-Image Quality Optimization
- 赛道归属: 文生图 / 跨生成器质量优化
- 核心创新点: 提出场景自适应的质量优化策略,学习一种可跨生成器迁移的通用质量优化 policy,而不是为单一模型或单一任务定制。方法上的关键突破在于将质量优化从“模型绑定”转向“场景感知、跨生成器可迁移”的策略学习,使其具备更强泛化性。
- CogCanvas: A Benchmark for Evaluating Multi-Subject Reference-Based Image Generation
- 赛道归属: 多主体参考图像生成 / 基准评测
- 核心创新点: 提出CogCanvas,专门面向“多人物身份 + 多对象/服饰绑定 + 背景场景约束”的参考式生成难题构建评测基准;其创新在于同时覆盖多身份组合、人物-物体交互与背景落地三类关键维度,并通过结构化交互图和位置图提供监督信号。基准还设计了面向多参考场景的BG-Sim与Attr-VQA两项指标,用于分别评估背景一致性和属性/交互绑定能力,从而更全面暴露现有模型在多人规模增大时的退化问题。
- Do MLLM Judges Judge the Edit? Auditing Bias in Image Editing Evaluation with Verified Quality Preservation 🆕NEW
- 赛道归属: 图像编辑评测 / 多模态大模型裁判鲁棒性分析
- 核心创新点: 提出 EditJudgeBias 反事实基准,用于审计多模态大模型(MLLM)作为图像编辑自动裁判时是否会被与编辑质量无关的线索影响。该基准包含经过验证“质量保持”的编辑样本,并在四个评测位置注入多种干扰线索,结合校准后的多模态验证器、控制实验和人工检查确保干预不改变真实编辑质量。进一步从三个维度系统评估裁判偏差:对质量保持线索的不变性、与人工判断的一致性、以及成对偏好的稳定性,并将观测到的变化与各裁判自身的噪声底线比较,从而更严格地识别偏置与鲁棒性问题。
GitHub
- [2026-10-02] pydantic/pydantic-ai ⭐20342
- [2026-10-02] AceDataCloud/Nexior ⭐397
- [2026-10-02] etkecc/baibot ⭐251 🆕NEW
- [2026-10-02] franksong2702/dsh-codex-connect ⭐132 🆕NEW
- [2026-10-02] Z1rconium/gpt-image-panel ⭐116 🆕NEW
HuggingFace Models
HuggingFace Spaces
视频生成/编辑
arXiv
- WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
- 赛道归属: 视频生成 / 提示词增强
- 核心创新点: 提出 WanPE 作为面向现代文本到视频生成的“电影级提示词增强”模型,利用 397B 参数并基于 105 万真实视频训练,将原始文本提示提升为更适合导演式分镜规划的高质量提示,重点强化动作、镜头轨迹、光照与声音等多镜头要素的表达能力。
- CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation
- 赛道归属: 视频生成 / 物理一致性建模
- 核心创新点: 提出 CompAdapt,用于构建可适配的复合运动建模框架,面向文本到视频生成中的物理一致性问题;其方法重点突破了单一运动类型、依赖手工参数以及难以泛化到未见物理规律的限制,强调对复杂运动组合的适应能力。
- MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation 🆕NEW
- 赛道归属: 视频生成 / 长时序自回归生成 / 记忆增强
- 核心创新点: 提出 MosaiChunk 记忆机制,将跨空间与时间的历史 KV 选择性组合成“马赛克”式记忆,在冻结视频生成器的前提下,仅训练轻量路由器决定在固定记忆预算下保留哪些历史片段,从而让模型在对象或场景重新出现时仍能恢复细粒度视觉细节;同时构建 RememBench,用于评测长时序重访场景下的文本到视频与图像到视频一致性。
- DramaAgent: Agentic Storytelling Video Generation 🆕NEW
- 赛道归属: 视频生成 / 长视频叙事生成 / Agentic 控制
- 核心创新点: 提出 DramaAgent 这一分层、具备代理式控制的长篇视频与音频生成框架,不直接改造底层生成模型,而是在上层引入故事规划、持久角色条件控制、按场景合成以及反思驱动的定向修复流程;通过维护可复用的故事与角色状态,并对身份漂移、场景语义缺失、时序断裂和跨模态不匹配进行诊断与分阶段修复,提升长程叙事一致性与音视频协同。
- TempQ-Jail: Query-Constrained Candidate Ranking for Text-to-Video Jailbreak Attacks
- 赛道归属: 视频安全 / 文本到视频越狱攻击
- 核心创新点: 将文本到视频越狱攻击形式化为“查询受限的候选分配与排序”问题,提出 TempQ-Jail,通过组合异构攻击机制扩展候选覆盖,并估计候选的端到端攻击效果,用于在生成与安全评估代价较高的场景下更高效地筛选攻击候选。
- MotionSpec: Spectral Trajectory Supervision for Motion-Consistent Video Generation
- 赛道归属: 视频生成 / 运动一致性约束
- 核心创新点: 提出 MotionSpec,通过频谱轨迹监督为视频生成提供显式的运动级约束,针对复杂动作下的时间不连续、动作推进不一致和结构畸变问题,强化模型对运动演化过程的建模,而不仅仅依赖逐帧生成质量。
- VideoGen-Agent: Reinforcing Video Generation Agents
- 赛道归属: 视频生成 / 多模态智能体
- 核心创新点: 提出 VideoGen-Agent,将视频生成任务转化为可调用外部工具的多轮智能体决策问题,并通过多任务 agentic reinforcement learning 学习工具使用策略;方法结合监督微调与强化学习,利用类别感知的混合奖励来同时约束工具调用有效性、任务适配性与生成质量。
- HiPhy: Hierarchical Alignment for Physically-Plausible Multi-Principle Video Generation 🆕NEW
- 赛道归属: 视频生成 / 物理一致性生成 / 强化学习对齐
- 核心创新点: 提出 HiPhy(Hierarchical Physical Alignment)强化学习框架,通过双层目标将视频生成与物理规律对齐:局部层面约束单个物理原则的时间动力学,全局层面保证整个场景的物理与语义一致性;同时构建 50K 提示数据集并推出 MultiPhyBench,覆盖多种共现物理事件,用于评估多物理原则同时出现时的生成能力。
- DiVid: Diagnosing Dimension-Specific Diversity Collapse in Video Generation Models 🆕NEW
- 赛道归属: 视频生成 / 多样性评估 / 诊断分析
- 核心创新点: 提出 DiVid 维度级诊断框架,将视频生成多样性拆解为语义、风格、主体、场景、运动和镜头六个可解释维度,并通过可复现的计算机视觉流程分别测量;进一步结合质量与指令遵循度分析,定位多样性塌缩的具体维度与原因,揭示模型在运动和镜头维度上最易退化,以及开放式提示下的默认模式收敛和显式请求下的实现缺口。
- VTR-Bench: A Systematic Benchmark for Evaluating Visual Text Rendering in Video Generation 🆕NEW
- 赛道归属: 视频生成 / 视觉文本渲染 / 评测基准与代理式生成
- 核心创新点: 构建 VTR-Bench,用 300 个覆盖广告、科学视频等五类场景的提示系统评测视频中的文本渲染能力,并设计带有人类对齐的自动化评估流程,分别衡量文本忠实度与场景/运动要求;同时提出 Keyframe-Guided Agentic Framework,由 Director agent 协调图像与视频生成及视觉评估,通过反馈驱动迭代修正与候选筛选,提升场景文字生成质量。
GitHub
- [2026-10-02] hao-ai-lab/FastVideo ⭐4535 🆕NEW
- [2026-10-02] YouMind-OpenLab/awesome-seedance-2-prompts ⭐2068
- [2026-10-02] ddalcu/mlx-serve ⭐1696
- [2026-10-02] AlonzoLeeeooo/awesome-video-generation ⭐786 🆕NEW
- [2026-10-02] YouMind-OpenLab/awesome-grok-imagine-prompts ⭐52 🆕NEW
音频生成
arXiv
- TinyAudio: Compact and Efficient Text-to-Audio Generation for Low-Resource Deployment
- 赛道归属: 文本到音频生成(TTA)/轻量化端侧部署
- 核心创新点: 提出面向低资源部署的紧凑型流匹配TTA框架,将生成模型、文本编码器与音频VAE进行小参数化设计,核心是以单流Transformer流匹配模型为主干,并配套音频对齐文本编码器与轻量音频表征模块,在尽量压缩参数规模的同时保持文本到音频生成能力。
- ReaFlow-TTS: Realization-Conditioned Flow Matching for High-Quality and Controllable Speech Synthesis
- 赛道归属: 文本到语音(TTS)/可控语音合成
- 核心创新点: 提出 realization-conditioned flow matching 框架,针对同一条件下不同语音实现会对应不同目标速度场的问题,引入“实现条件”来建模生成分歧,并提供更具语义可解释性的属性操控接口,解决确定性速度场只能学习条件均值、难以表达实现差异的局限。
- UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation
- 赛道归属: 文本到音频生成(TTA)/联合表征学习与生成建模
- 核心创新点: 打破“先训练音频tokenizer、再冻结后做生成”的两阶段范式,提出连续tokenization与潜空间流匹配联合学习框架,使表征学习与生成目标同步优化,从而避免仅以重建为导向的离散/潜表示对生成任务不一定最优的问题。
- COT-TTS: Audio Context-Aware Text-to-Speech with Chain-of-Thought Reasoning
- 赛道归属: 文本到语音(TTS)/上下文推理式语音合成
- 核心创新点: 将链式思维推理引入TTS上下文建模,构建基于历史对话音频、目标文本与参考语音的推理式语音合成任务,使模型不再仅依赖显式风格指令,而是从历史对话中推断当前应采用的说话风格。
- ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
- 赛道归属: 视频到音频生成(V2A)/多模态可控生成
- 核心创新点: 提出统一的多模态V2A框架,支持视频、文本与参考音频的联合控制;通过融合CLIP与时空音视频编码器增强视觉-文本对齐,采用时间-音色解耦抑制冗余时序信息并保留可辨识音色特征,同时引入统一表示对齐与随机模态dropout提升跨模态冲突下的鲁棒可控性。
- Articulatory Source-Filter TTS: Physically Grounded Control through Vocal Tract Kinematics 🆕NEW
- 赛道归属: 可控文本到语音生成 / 语音合成
- 核心创新点: 提出一种基于发音器官运动学的 source-filter TTS 架构,将声道滤波器与声源显式解耦:通过 Acoustic-to-Articulatory Inversion 生成伪运动轨迹来条件化滤波器响应,并用预测的基频与能量轮廓参数化声门声源;同时引入 Optimal Transport Conditional Flow Matching 对声源进行细化,再与滤波器重组为最终频谱。该方法的关键突破在于把原本黑盒式的 TTS 转化为具备物理可解释控制的生成过程,支持稳定的韵律缩放、跨说话人声源/滤波器重组,以及对发音轨迹的直接操控。
- PLACE: Positional Latent Adaptation via Conditioned Embeddings for Binaural Audio Generation 🆕NEW
- 赛道归属: 双耳音频生成 / 多模态条件音频生成
- 核心创新点: 在预训练 any-to-audio 模型 AudioX 上扩展出面向双耳生成的条件适配方法:利用 Perception Encoder Core 特征增强视频条件,引入文本与视频表示对齐以提取空间线索,并通过依赖条件的低秩变换调制生成潜变量。训练时再用解码音频的双耳线索目标(ITD/ILD)进行监督,从而把空间感知信息注入生成过程。其方法重点在于把文本、视频和可选音频提示统一到可控的空间音频生成框架中,提升空间一致性与跨模态控制能力。
- Balalaika-Longform: A Russian Speech Corpus for Continuous Long-Form Text-to-Speech 🆕NEW
- 赛道归属: 长音频文本到语音数据集 / 长篇语音合成
- 核心创新点: 构建了一个面向连续长篇 TTS 的俄语语料 Balalaika-Longform,包含 30 秒到 15 分钟的连续长单位,并同时提供匹配的短窗口视图,便于在相同源录音上比较不同训练序列长度的影响。其核心价值不在模型结构,而在于数据与评测协议设计:保留每一次合成尝试、在连续生成场景下评估长文本保持能力,从而更准确地暴露遗漏和提前停止问题。该工作通过统一的连续生成测试,系统分析了训练序列长度对长篇语音保持的影响。
- Pushing CPU Speech Synthesis to the Wall: Extreme Inference Tuning under Serverless Architecture and Billing 🆕NEW
- 赛道归属: 语音合成推理优化 / CPU 部署与服务系统
- 核心创新点: 面向 serverless CPU 场景提出了以计费成本为目标的 TTS 推理优化方案,不再只优化吞吐或延迟,而是直接优化 CPU-seconds 和 GB-seconds。方法上通过 request-sized concurrent inference 限制单请求 CPU 并行度,减少并发下的 CPU 争用;同时设计可回收的实例生命周期,在空闲时释放推理状态和页缓存内存,但保留服务进程与编译缓存,以降低持续计费的驻留开销。该工作的突破点在于把模型推理效率与云计费机制联动起来,实现更低的 serverless 语音合成成本。
- Here the World in Stereo: Learning Dynamic Spatial Correspondence for Immersive Joint Video-Audio Generation
- 赛道归属: 音视频联合生成 / 立体声音频生成 / 沉浸式多模态生成
- 核心创新点: 提出面向沉浸式场景的动态空间对应(Dynamic Spatial Correspondence)建模框架 StereoBind,核心是用视觉目标的运动轨迹来约束立体声生成,使声音感知位置能够随视觉源运动同步变化。方法上设计了三种互补机制:Visual Motion Binding 用于建立源级音视频对应关系,Spatial Track Encoder 编码声源的绝对空间位置,Residual Track RoPE 则建模相对运动变化,从而同时刻画位置与运动带来的空间音频演化。与此同时,构建了带运动轨迹标注的大规模 StereoWorld-29K 数据集及 StereoWorldBench 评测基准,用于监督和衡量音视频空间一致性。
GitHub
- [2026-10-01] huggingface/diffusers ⭐34640
- [2026-09-28] BinWang28/audio-ai-hub ⭐960
- [2026-09-29] vizart-vj/ComfyUI-MiniMax-H3-LongMedia ⭐271
- [2026-09-27] markjfine/nrsc5-dui ⭐173
- [2026-09-26] ShareLab-SII/VA-Judger ⭐64
HuggingFace Models
HuggingFace Datasets
- [2026-10-01] espnet/yodas3
语言大模型
arXiv
- Structure vs. Chain-of-Thought: Evaluating LLM Criteria Extraction for Depression Severity
- 赛道归属: 医疗文本理解 / 心理健康评估 / LLM可解释性与评测
- 核心创新点: 该工作系统比较了两类基于LLM的抑郁严重程度判定范式:直接生成严重度标签的链式思维推理,以及先抽取临床量表条目再由规则映射为标签的“结构化抽取”方案。其方法上的重点在于引入可审计的临床标准(PHQ-9、BDI-II)与不同阈值设定方式,使用加权Kappa评估一致性,并分析是否存在“抽取优于推理”的稳定优势。结果表明,结构化抽取并未在所有设置下稳定优于链式思维,且阈值是否基于标注数据拟合会显著影响结论;同时,较高的整体一致性并不等价于对重症样本的更好识别,揭示了该类任务中“可解释性、校准与重症召回”之间的张力。
- DRIFT: Data Selection for LLM Instruction Tuning via On-Policy Attribution
- 赛道归属: 推理优化 / 数据选择 / 指令微调
- 核心创新点: 提出基于 on-policy attribution 的数据选择方法 DRIFT,用模型自身在验证查询上的采样回答构造验证目标,并按这些回答对原始训练样本的影响力进行排序;同时对影响分数中的梯度范数依赖进行校正。其关键突破在于不再以“节省数据”为目标,而是通过选择同一语料中的高影响样本继续微调,尝试突破全量数据训练的性能上限。
- Which LLM to pick? Online Active Model Selection for Large Language Models 🆕NEW
- 赛道归属: LLM在线模型选择 / 主动学习 / 流式数据评测
- 核心创新点: 提出 ONLINE LLM PICKER,用于在流式查询场景下、在有限标注预算内主动挑选最有信息量的样本进行人工标注,从而识别候选模型中表现最佳或近似最佳的LLM。其方法核心在于将“模型选择”从依赖静态基准分数,转为面向在线数据流的主动标注决策问题,并通过选择最具判别力的提示来降低标注成本,同时支持在未标注样本上进行顺序生成时更早锁定优选模型。
- When Context Misleads: In-context Learning with Jurisdiction in Large Language Models
- 赛道归属: 复杂推理 / 上下文学习 / 对齐鲁棒性评测
- 核心创新点: 构建 FakeContextBench,用伪科学式上下文干扰来专门评测模型的“context authority”,即判断上下文信息是否应当主导最终答案的能力。该工作强调现有 ICL 后训练方法往往只学会从示例中抽取模式,却忽视了对上下文权威性的辨别,从而暴露模型在“上下文误导”场景下的脆弱性。
- Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning
- 赛道归属: 机器人规划 / 开放世界智能体 / 神经符号推理
- 核心创新点: 提出融合符号规划、强化学习与 LLM 的神经符号架构,用于应对开放世界中的新颖性。其方法重点在于:当符号规划器因缺少新对象交互算子而无法生成计划时,借助 LLM 与 RL 学习如何处理新对象,从而补齐规划域中的能力缺口。
- Spatial Strategies, Not Actions: Vector-Quantized Geodesics as Tools for LLM-Driven Agents 🆕NEW
- 赛道归属: LLM智能体 / 空间推理 / 工具使用
- 核心创新点: 提出一种将几何轨迹作为工具、由LLM进行高层编排的两层智能体框架:先在网格世界中收集地理路径轨迹,再通过向量量化从中提取代表性轨迹集合;离线阶段让LLM为每条选中的轨迹关联自然语言行为描述,形成可调用工具;在线阶段LLM根据当前状态与目标选择合适工具,底层则由原始动作执行对应轨迹。该方法把工具发现交给无监督轨迹量化,把推理与决策交给LLM,从而在部分可观测动态环境中以更低推理成本实现接近更强链式思维版本的目标达成效果。
- ReCAP: Retrieval-Guided Capability Reuse for Multimodal Continual Instruction Tuning
- 赛道归属: 多模态持续学习 / 指令微调 / 检索增强
- 核心创新点: 提出 ReCAP,通过外部检索与 LLM 构建领域知识、推理知识和格式知识库,并在每个持续阶段为指令检索相关知识,指导能力复用与实例级能力路径生成。进一步引入 adaptive subspace recycling,用共享基与阶段特定核心参数化可复用能力模块,在保留历史重要方向的同时回收剩余容量,以缓解跨阶段遗忘。
- Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training
- 赛道归属: 推理优化 / 强化学习后训练 / 无奖励优化
- 核心创新点: 提出 RFPO,将预训练且校准后的 critic 重新利用为 rollout 级奖励、GAE 的 value baseline,以及未完成前缀的成功预测器,实现无需外部奖励标签、逐步标注或完整 rollout 的策略优化。其关键方法突破是利用 critic 对未来结果的预测能力提供稠密学习信号,并通过二值化去偏分数抑制长度偏置,从而在降低计算与显存开销的同时保持性能。
- SeOPD: Self-Evolving LLMs via Online Policy Distillation from Self-Generated Chain-of-Thought
- 赛道归属: 自我进化 / 在线策略蒸馏 / 思维链学习
- 核心创新点: 提出 SeOPD,让同一个 LLM 的 deep-thinking 模式生成 CoT,再将该 CoT 作为 privileged information 去监督 non-thinking 模式的 token 级输出,实现无需外部标注或环境反馈的在线策略蒸馏。方法的核心在于把模型自身推理过程中涌现的信息内化到共享参数中,从而同时提升非思考与深度思考能力。
- LLM Alignment--Utility Asymmetry under Semantic-Preserving Transformations
- 赛道归属: 对齐鲁棒性 / 安全性评测 / 分布偏移
- 核心创新点: 通过语义保持、规则可逆的合成变换,系统检验 LLM 对分布偏移下的对齐泛化能力,提出“Alignment-utility asymmetry”现象:模型在变换输入上往往仍能保持任务效用,但安全对齐失效会更显著地恶化。该工作的方法价值在于把对齐问题从攻击视角转为受控探针,揭示语义不变但表面形式变化时,效用与安全的泛化并不同步。
GitHub
- [2026-10-02] sgl-project/sglang ⭐36708
- [2026-10-02] NVIDIA/TensorRT-LLM ⭐14757
- [2026-10-02] google-ai-edge/LiteRT-LM ⭐6558 🆕NEW
- [2026-10-02] basellm/llm-metadata ⭐146
- [2026-10-02] maxim-saplin/llm_chess ⭐134
HuggingFace Datasets
- [2026-09-26] XiaomiMiMo/MiMo-V2.6-RL-oss
- [2026-09-24] MoreThought/Fable-5.1-Max-Reasoning-Filtered-10000x
多模态大模型
arXiv
- Similar Choices, Different Attention: Cross-Modal Associations in Humans and Vision-Language Models
- 赛道归属: 多模态理解 / 跨模态注意力分析
- 核心创新点: 该工作在相同刺激条件下同时比较人类与VLM的选择结果和眼动轨迹,避免了以往“人机使用不同任务或不同刺激”带来的不可比问题;进一步通过人类选择微调、以人类注视训练模型注意力等方式,分别检验“选择对齐”和“注意力对齐”是否足以代表人类一致的跨模态加工,揭示二者并不等价,且模型注意力与人类凝视的匹配甚至不如中心偏置基线。
- PRISM-VLM: A Multi-Axis Discriminative Benchmark for Compact Vision-Language Models
- 赛道归属: 多模态理解 / 紧凑型VLM评测
- 核心创新点: 提出PRISM-VLM这一多轴判别式基准,不再把模型压缩为单一准确率,而是沿七个维度对每个样本进行细粒度评分,用于刻画紧凑型VLM的典型失效模式;其方法论突破在于从“单点分数”转向“多维诊断”,更适合比较小型VLM在不同能力侧面的差异。
- SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding 🆕NEW
- 赛道归属: 多模态理解 / 音视频理解评测
- 核心创新点: 提出SONIC-O1这一面向真实世界音视频理解的系统化评测基准,覆盖60小时、231个片段、13个对话场景,并由人工全量核验;同时联合评估开放式总结、选择题问答与带理由的时间定位三类能力,尤其强调对“时序对齐+推理依据”的考察,并附带人口统计元数据以分析模型在不同群体上的行为差异。
- Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
- 赛道归属: 多模态理解 / 情感推理与因果分析
- 核心创新点: 通过基于steering vector的因果归因框架,分析并增强大视觉语言模型中的情感电路,重点刻画跨模态信息如何从视觉刺激流向情感叙事生成;方法上将“情感理解”从黑箱表征转为可干预、可归因的跨模态信息流问题,从而支持对情感相关内部机制的解释与增强。
- VidHarness: Evolving Agent Harnesses for Cost-Efficient Long Video Understanding
- 赛道归属: 长视频理解 / 视频智能体优化
- 核心创新点: 提出 VidHarness,通过“智能体 harness 自动进化”替代人工设计的视频理解流程;利用执行反馈驱动的迭代搜索,并用 MCTS 避免贪心优化陷入局部最优;结合不确定性感知的多保真验证,先用少量问题筛选候选 harness 以降低评估成本;进一步引入 mixture-of-harness,根据不同帧预算路由到专门化 harness,从而在成本可控的前提下提升长视频问答效果。
- When Words Speak Louder than Images: Towards Understanding Language Bias in Vision-Language Models
- 赛道归属: 多模态理解 / 语言偏置诊断
- 核心创新点: 该工作提出一个四阶段推理诊断框架,把VLM中的语言偏置传播过程拆解为若干相互依赖的推理阶段,并分别考察语言先验与跨模态覆盖在各阶段中的演化;其方法论贡献在于不只判断“是否有偏置”,而是追踪偏置如何在推理链路中形成、累积并最终导致错误预测。
- OmniMoE-VL: A Sparse Vision-Language Model with Coupled Visual-Depth Routing
- 赛道归属: 稀疏多模态模型 / 视觉-语言路由
- 核心创新点: 提出OmniMoE-VL,通过耦合的视觉深度路由投影器,为每个图像-提示对动态选择一组稀疏的中间视觉层,并将该全局偏好同时用于局部patch融合与向语言模型的动态视觉注入;创新点在于把“哪些视觉中间表征应暴露给语言侧”变成问题相关的路由决策,并与MoE式专家路由协同,从而实现更灵活的问答式视觉访问。
- Gradient-Guided Decoupled Adaptation for Geospatial Vision-Language Models
- 赛道归属: 地理多模态理解 / 多任务优化
- 核心创新点: 提出Gradient-Guided Decoupled Adaptation(G2DA),利用任务梯度特征对地理VLM的多任务适配进行解耦组织:先按梯度引导将任务划分为视觉中心与语言中心组,再基于梯度相似性构建模态专属课程,并通过双向回放缓解顺序优化带来的遗忘;其关键突破是用梯度结构显式建模任务间冲突,而非简单共享统一多任务训练。
- ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding
- 赛道归属: 流式视频理解 / 低延迟多模态推理
- 核心创新点: 提出 ShallowStream,将 MLLM 的浅层同时用于帧编码与检索索引构建,避免每次都执行完整深层 prefill;在流式处理中维护基于浅层 KV cache 的轻量常驻索引,并在问答时利用浅层注意力分数进行上下文帧打分;再通过多样性感知选择策略检索更精确且更全面的证据,从而显著降低逐帧预填充和端到端延迟。
- MedVL-SAM2: A unified 3D medical vision-language model for multimodal reasoning and prompt-driven segmentation 🆕NEW
- 赛道归属: 3D医学多模态理解 / 3D医学分割
- 核心创新点: 提出统一的3D医学视觉语言模型MedVL-SAM2,将报告生成、VQA与多范式分割(语义、指代、交互式)整合到单一框架中;方法上通过3D CT图文大规模预训练对齐体数据视觉特征与放射学语言嵌入,再结合语言理解与分割目标联合优化,并引入基于SAM2的体数据分割模块,实现语言、点、框等多种提示方式下的精细空间定位与跨模态推理统一。
GitHub
- [2026-10-02] Blaizzy/mlx-vlm ⭐5560
- [2026-10-02] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1896
- [2026-09-28] om-ai-lab/VLX-Seek ⭐1313
- [2026-09-29] XuankunRong/Awesome-LVLM-Safety ⭐221
- [2026-10-01] hcompai/holo-desktop-cli ⭐50 🆕NEW
强化学习
arXiv
- MaD-RL: Matching Distributions for Calibrating LLMs with Reinforcement Learning
- 赛道归属: 大语言模型后训练 / 分布匹配式强化学习
- 核心创新点: 提出面向输出分布控制的通用RL框架,将传统只优化单个输出期望奖励的后训练范式扩展为“分布匹配”;通过对潜在类别属性的目标分布建模,设计KL、JS等不同散度对应的奖励函数,并指出已有方法可视为L2散度的特例,从而实现对模型输出多样性、类别比例与约束满足的更精细控制。
- RL Starts before RL: On Policy Distillation for Better Reinforcement Learning
- 赛道归属: 推理优化 / 强化学习训练策略
- 核心创新点: 提出在正式RL之前先进行on-policy distillation(OPD)作为准备阶段,证明其收益不仅体现在初始准确率提升,还能带来更高的最终RL性能;进一步分析了蒸馏目标与轨迹来源对后续RL的影响,发现相较于reverse-KL,forward-KL在“蒸馏后接RL”的设置下更有优势,且student rollouts优于teacher rollouts,说明与教师分布的更深层对齐比单纯top-1一致性更关键。
- RL-ABC: Reinforcement Learning for Accelerator Beamline Control
- 赛道归属: 强化学习系统 / 科学计算控制 / 加速器束线优化
- 核心创新点: 构建了一个将粒子加速器束线配置自动转化为RL环境的开源框架RLABC,核心方法是把束线调参形式化为MDP,并自动完成诊断点插入、57维状态构造、奖励函数配置以及与Elegant仿真器的接口对接;同时引入stage learning以将复杂优化拆解为更易训练的子问题,从而提升训练效率与可用性。
- Homomorphic Advantage Operator: Stabilizing Reinforcement Learning Under Fully Homomorphic Encryption Constraints 🆕NEW
- 赛道归属: 隐私保护强化学习 / 同态加密下的强化学习优化
- 核心创新点: 提出 Homomorphic Advantage Operator(HAO),将 advantage-based 的零均值中心化投影直接作用于 TD 目标,用线性投影消除驱动 Bellman drift 的统一状态价值基线,从而在不增加额外非线性乘法深度、也不依赖昂贵 bootstrapping 的前提下,稳定 FHE 场景下的深度强化学习训练,并将网络前激活严格限制在安全多项式近似域内。
- CARM: Cancellation-Aware Response Masking for LLM Reinforcement Learning 🆕NEW
- 赛道归属: 大语言模型强化学习 / 序列级离策略控制
- 核心创新点: 提出 Cancellation-Aware Response Masking(CARM),在序列级 masking 中对每个 token 的 log-ratio 先取绝对值再平均,避免正负概率变化相互抵消而掩盖策略漂移;同时给出可证明的接受响应约束,使被接受样本满足对越界比例及其平均越界距离的联合界,从而更稳健地处理 rollout 与训练引擎不一致带来的 off-policy 问题。
- Bellman Meets Lyapunov: Unsupervised Reinforcement Learning via Mastering Chaos 🆕NEW
- 赛道归属: 无监督强化学习 / 内在动机学习
- 核心创新点: 提出 Forward CIP(F-CIP),将 Controllable Information Production 重新表述为 RL 原生目标,直接由系统动力学定义而不需要人为选择信息变量,避免了传统内在动机方法中重新引入领域先验的问题;该目标可与现有算法兼容,并能诱导出平衡、维持可控性等原始行为,为后续更复杂机器人技能学习提供基础。
- Token-Level Video Reinforcement Learning 🆕NEW
- 赛道归属: 视频生成 / 视频强化学习
- 核心创新点: 提出 Token-Level Video Reinforcement Learning(TVRL),利用冻结视觉语言模型的答案似然同时提供视频级奖励与 token 级归因信号:通过视频输入梯度幅值定位对奖励影响最大的生成 token,再将这种 question-conditioned 的 token credit map 融入 GRPO 中,对密集去噪转移的 log-probability 进行重加权,实现从“整段视频一个标量奖励”到“token 级信用分配”的细粒度优化。
- Same Reward, Different Skills: When Multimodal RL Learns to Look 🆕NEW
- 赛道归属: 多模态理解 / 视觉推理强化学习
- 核心创新点: 提出“visual resolvability”设计原则,要求任务中的视觉证据对正确回答是必要且可学习的,并通过反事实坐标场景构造让模型必须在图像中定位目标才能作答;实验表明,基于标准 GRPO 和正确性/格式奖励的 RL 会学到真正的“看图找目标”能力,而不是仅靠文本捷径,从而揭示奖励设计会直接决定多模态 RL 学到的技能类型。
- LineupRL: Verifiable Reinforcement Learning for Time Series Captioning via Caption-to-Series Identification 🆕NEW
- 赛道归属: 时间序列理解 / 时间序列描述生成强化学习
- 核心创新点: 提出 LineupRL,将奖励设计为“caption-to-series identification”验证任务:冻结 LLM verifier 读取生成 caption 与候选时间序列原始数值,从多个干扰项中选出被描述的序列,以此作为可验证奖励;该设计比直接写问题或人工评判 caption 更轻量,且能在 captioning、forecasting、reconstruction 等任务上稳定优于 SFT 和传统 RL 基线,并表现出较强的抗 reward hacking 能力。
- Function-Structured Reinforcement Learning with Executable Verifiers for Mathematical Reasoning 🆕NEW
- 赛道归属: 数学推理 / 可执行验证器驱动的强化学习
- 核心创新点: 提出 Function-Structured Graph Reinforcement Learning(FSG-RL),将子问题图与 Python 实现结合,并引入多验证器反馈机制:先用 SFT 学习从函数图生成代码,再用 GRPO 结合 answer-gated reward 与 span-level credit assignment 进行优化,同时支持 teacher supervision 和 structured memory;该框架把“结构化分解—可执行代码—验证反馈”串联起来,显著提升最终答案准确率与完整解成功率。
GitHub
- [2026-10-02] huggingface/trl ⭐19433
- [2026-10-02] Farama-Foundation/Gymnasium ⭐12608 🆕NEW
- [2026-10-02] Farama-Foundation/PettingZoo ⭐3524 🆕NEW
- [2026-10-02] radixark/miles ⭐3036
- [2026-10-02] lubludrova/rl-handbook ⭐200 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-09-30] FineEnvs/SmolDataEnvs
世界动作模型
arXiv
- Completion Aware Guidance for World Action Models 🆕NEW
- 赛道归属: 世界动作模型 / 机器人控制 / 生成式规划
- 核心创新点: 提出无需训练的 Completion Aware Guidance(CAG)采样方法,在生成阶段引导世界动作模型更偏向“任务完成”而非仅仅局部合理的短期延续,从而缓解任务不完整想象问题;其关键突破在于指出该问题主要来自短 chunk 控制下的采样偏置,并通过推理时引导直接改善视觉未来与动作预测的任务完成性。
- CtrlWAM: Controllable World Action Models with Aligned Intent and Foresight 🆕NEW
- 赛道归属: 世界动作模型 / 可控生成 / 多智能体动作-视频联合建模
- 核心创新点: 提出 CtrlWAM,通过在模拟器中执行扰动后的动作并配对其对应的噪声视觉结果,解决传统“动作加噪与视频加噪”训练中动作反事实与视频仍绑定真实轨迹的错配问题;同时设计 warped video-action noise schedules,使视频与动作在不同去噪需求下保持协调,并将动作接口从单一自我控制扩展到可变数量的多智能体流,从而统一支持预测未来与接收外部指令的多主体控制。
- Learning Skills from Historical Action Trajectories: Action Experience Dictionary for World Action Models
- 赛道归属: World Action Model / 具身智能动作生成 / 操作技能迁移
- 核心创新点: 提出 Action Experience Dictionary(AED),将历史物理动作轨迹编码为共享动作嵌入,用于跨任务复用动作经验并建模任务间语义关联;通过预训练 action tokenizer 检索动作嵌入,再结合视觉条件的 cross-attention 将其前置到噪声动作 token 中,为动作预测注入交互上下文与动作意图;同时引入 motion-aware transition loss,在随机时间间隔上监督视觉特征变化预测,以强化对动作相关运动的建模并降低对无关背景信息的依赖。
- EVO-WAM: Evolving World Action Models through Video-Action Verification
- 赛道归属: 机器人操作 / 世界动作模型 / 测试时自适应
- 核心创新点: 提出 EVO-WAM,通过“自生成轨迹再训练”的方式让世界动作模型适配未见任务;先加入状态预测与锚定多帧上下文以支持无需外部执行反馈的自回归展开,再用视觉语言模型筛选任务完成前缀、结合逆动力学模型验证视频-动作一致性,最后对已验证前缀进行迭代训练,从而在不额外采集专家演示的情况下提升新任务成功率。
- V2X-WAM: A Cooperative World Action Model for End-to-End Autonomous Driving
- 赛道归属: 自动驾驶 / V2X协同感知 / 世界动作模型
- 核心创新点: 提出 V2X-WAM,将协同场景理解、动作生成与未来世界推理紧密耦合;利用车端与路侧观测构建可靠性感知的时空表示,并将路侧信息压缩为量化消息以降低通信开销;在此基础上,规划器生成候选轨迹并显式条件化未来占用与动态流预测,再将预测到的世界后果反馈用于修正轨迹,实现动作与环境演化的闭环交互。
- NeuronDiscover: Agent-in-Twin for Mechanistic Discovery in Neuronal Microenvironments with World Action Models
- 赛道归属: 科学发现 / 神经机制发现 / 交互式实验设计 / 世界动作模型
- 核心创新点: 提出 NeuronDiscover,将共享的、机制约束的 WAM 用于“预测—干预—观测”一体化决策;通过显式建模 twin confounding,联合维护机制与模型偏差的信念,并据此设计实验;同时用 MIOY 图记录与修订机制-干预-观测-结果关系,最终编译为带有偏差校正接受边界的可执行程序,以提升在稀疏观测下的机制判别与关系解析能力。
- What Makes World Action Models Generalize? An Empirical Study of Test-Time Future Modeling
- 赛道归属: 世界动作模型 / 测试时推理 / 泛化能力分析
- 核心创新点: 通过系统实证分析明确 WAM 泛化收益的来源,发现去掉推理阶段未来条件化后,模型在环境扰动、数据效率和任务泛化三方面均明显退化;进一步指出收益主要来自“首个去噪步骤”而非完整未来生成,据此提出 Simple-WAM,将未来建模简化为一次对全噪声视频 token 的前向处理,并同步调整训练时噪声日程,使其在保持高效推理的同时保留更强泛化能力。
- AquaWAM: A Dynamics-aware World Action Model for Underwater Embodied Agents
- 赛道归属: 水下机器人 / 具身智能 / 世界动作模型
- 核心创新点: 提出 AquaWAM,面向水下具身体系统式建模动作相关与被动物理动力学,而非仅预测未来图像;显式纳入推进器死区、惯性滑行和环境流等持续影响因素,并利用 DVL、IMU、压力传感器和关节编码器等紧凑状态进行建模,摄像头仅用于语义理解目标与位姿,从而在降低模型规模与计算成本的同时,更适配水下场景的动力学特性。
- InternW0-$\Delta$: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data
- 赛道归属: 机器人操作 / 世界动作模型 / 大规模预训练
- 核心创新点: 该工作提出 InternW0-Δ,核心在于用 2 万小时以上的异构开放数据预训练统一 WAM,将视觉动力学、场景语义、几何与运动等多种先验整合到同一动作生成框架中,以提升通用机器人操作能力;摘要中强调其在仿真基准与真实机器人平台上均优于先前方法。
- Rolling-WAM: World Action Models with Rolling Imagination
- 赛道归属: 机器人操作 / 世界动作模型 / 低延迟闭环规划
- 核心创新点: 提出 Rolling-WAM,将联合视频-动作去噪分摊到连续重规划周期中;通过维护一个处于不同噪声层级的滑动窗口,在每一步只推进部分去噪与更新,从而避免每次重规划都完整执行一次联合去噪,降低延迟并提升闭环响应速度。
GitHub
- [2026-10-01] OpenWAM-Official/OpenWAM ⭐939
- [2026-10-01] OpenMOSS/EasyWAM ⭐390
- [2026-09-28] H-EmbodVis/SimWAM ⭐192
- [2026-09-28] InternRobotics/InternW0-Delta ⭐70
- [2026-09-30] LeapLabTHU/Simple-WAM ⭐62
由 Research Daily 自动生成 生成时间: 2026-10-02 13:30:36