AI 每日进展速报 - 2026-10-09
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- Keep It CALM: Analyzing the Limits of Global Unsafety in Text-to-Image Generation
- 赛道归属: 文生图安全对齐 / 训练时无关安全防护
- 核心创新点: 该工作分析了“全局不安全方向/子空间”这类训练无关安全方法的适用边界,指出其存在“覆盖性-选择性”权衡:过于紧凑的安全子空间难以覆盖多样化的有害语义,过于宽泛的聚合又会误伤安全邻近的正常提示词。基于这一几何分析,提出 CALM,通过匹配有害-安全锚点进行提示词局部反事实修正,只对触发违规的 token 表征做最小化安全侧编辑,并抑制正向对齐的有害残差,从而以更细粒度的局部修正替代统一的全局不安全信号移除。
- POET: Preference Optimization for Enhanced Text-to-Image Generation
- 赛道归属: 文生图优化 / 提示词重写
- 核心创新点: 提出POET,通过LLM先对用户输入进行自动提示词重写,再送入冻结的文生图骨干模型;其关键创新在于设计复合奖励并采用迭代式DPO训练,让重写器直接从多模态反馈中学习“模型偏好”的提示结构,且不依赖高成本SFT数据,从而提升图文对齐、视觉质量与美学表现,并具备跨不同T2I骨干的迁移能力。
- TerraVis: Towards Evaluation of World-Grounded Visual Consistency in Text-to-Image Generation via MLLM Workflows
- 赛道归属: 文生图评测 / 世界一致性评估
- 核心创新点: 该工作提出 TerraVis,用于评估生成图像是否符合真实世界的结构与物理常识,而不仅是视觉质量或文本对齐。其核心方法是构建覆盖对象、交互和场景层面的世界一致性违规 taxonomy,并设计多阶段 MLLM 评估流程:先判断图像是否适合评估,再识别 18 类违规类型,并将其划分为轻微/严重以形成总体世界一致性分数。该框架强调对“看起来好但不符合常识”的失败模式进行系统化量化与诊断。
- Two Halves are More than One: Phase-wise Velocity Distillation for Fast and High-Quality Image Generation
- 赛道归属: 文生图 / 图像生成加速与蒸馏
- 核心创新点: 提出 Phase-wise Velocity Distillation(PVD),将生成过程划分为“粗阶段”和“细阶段”,分别用两个半尺寸的阶段专属专家建模各自的平均速度,从而把结构生成与细节修复解耦;在保持总计算量等价于一次完整骨干前向的前提下,相比单一大一统学生模型更能避免过度平滑,并在高质量快速生成上取得更优效果。
- Safe Image Generation via Reinforcement Learning
- 赛道归属: 文生图安全生成 / 生成过程安全控制
- 核心创新点: 提出一种“生成中”安全框架,不再只依赖生成前过滤或生成后审核,而是在扩散去噪轨迹中监测中间表示里的NSFW信号;进一步结合强化学习,将检测到的风险轨迹主动引导到安全图像生成方向,实现对NSFW提示词的可控安全生成,并尽量保持图像质量与提示词一致性。
- VisualErase: Dual-Branch Visual Trajectory Redirection for Robust Concept Erasure in Text-to-Image Diffusion Models
- 赛道归属: 文生图概念擦除 / 扩散模型知识移除
- 核心创新点: 提出双分支的视觉轨迹重定向范式,目标不是仅改写文本到图像映射,而是直接将包含目标概念的视觉生成轨迹重定向到“概念已移除”的结果;通过结构保持的图像编辑构造内容对齐但去除目标概念的对应样本,并据此建立去噪目标,同时对有条件与无条件预测施加联合约束,再结合对应内容保留损失,以增强擦除鲁棒性并减少对非目标生成能力的破坏。
- Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards
- 赛道归属: 文生图后训练 / 偏好优化 / 奖励建模
- 核心创新点: 该工作提出一种面向开放域文生图模型的后训练配方,通过组合互补奖励来同时优化整体人类偏好与提示词忠实度等细粒度属性。方法上包含两类奖励:基于大规模人类偏好数据、采用 Bradley-Terry 目标训练的偏好奖励,以及显式评估 prompt faithfulness 等属性并用于防止 reward hacking 的 rubric 奖励。其关键突破在于不采用简单加权平均,而是设计更有效的奖励组合策略,以更好平衡偏好优化与规则满足。
- Traversing the Satisfaction-Diversity Frontier in Text-to-Image Diffusion
- 赛道归属: 文生图扩散模型采样 / 多样性-满意度权衡
- 核心创新点: 该工作将多图生成建模为“satisficing”问题:每个候选图都必须达到最低奖励阈值,同时整批结果还需满足多样性下限,从而显式刻画“满意度-多样性”前沿。为遍历这一前沿,提出训练无关的推理时方法 SatisDive,利用 batch-relative reward cutoff 区分低奖励与高奖励候选,对低于阈值的样本侧重提升奖励,对高于阈值的样本侧重保持多样性。其方法论重点在于把奖励与多样性从单一聚合目标改为分层约束与分区调控。
- When Text-to-Image Helps Editing: The Effects of Conditioning During Denoising
- 赛道归属: 图像编辑 / 扩散模型采样策略优化
- 核心创新点: 研究统一式编辑模型在去噪过程中不同条件信息的作用变化,发现纯编辑流程中源图像条件在部分编辑任务上会随采样轨迹逐渐减弱;据此提出“任务切换”策略,在去噪的有限区间内切换到文本到图像(T2I)任务,让模型调用其生成能力,再切回编辑模式。该方法利用同一统一模型已训练的两种条件模式,通过切换时机在编辑质量与内容保真之间取得更优平衡。
- Steering Fields: Adaptive Vector Fields for Safe Image Generation and Beyond
- 赛道归属: 安全可控生成 / 图像编辑
- 核心创新点: 提出Steering Fields,将传统“全局固定 steering vector”推广为可随生成过程动态重估方向的自适应向量场;该方法在flow模型的噪声状态上逐步更新引导方向,形成可连续调节的安全控制强度与内容保真度权衡,并支持概念的同时诱导与抑制。由于不依赖显式空间mask或对象先验,它还能自然保持局部结构,进一步可作为无反演、模型无关的结构保持式图像编辑方法。
GitHub
- [2026-10-09] pydantic/pydantic-ai ⭐20495
- [2026-10-09] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13551
- [2026-10-09] yincongcyincong/MuseBot ⭐1650 🆕NEW
- [2026-10-09] etkecc/baibot ⭐250
- [2026-10-09] hypersniper05/MCP-Image-Generator-Uncensored ⭐63 🆕NEW
HuggingFace Models
HuggingFace Spaces
视频生成/编辑
arXiv
- TasteRoute: Personalized Routing for Video Generation
- 赛道归属: 视频生成 / 个性化路由 / 成本感知生成
- 核心创新点: 提出面向视频生成请求的个性化路由框架,将输入需求、用户偏好与生成预算联合建模,用于在多个视频生成模型之间选择合适的生成器;同时构建了包含多模型视频对比、质量判断、偏好排序和用户画像信号的标注数据集,支持偏好路由与成本控制的联合优化。
- MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation
- 赛道归属: 视频生成 / 长时序自回归生成 / 记忆增强
- 核心创新点: 提出 MosaiChunk 记忆机制,将跨空间与时间的历史 KV 选择性组合成“马赛克”式记忆,在冻结视频生成器的前提下,仅训练轻量路由器决定在固定记忆预算下保留哪些历史片段,从而让模型在对象或场景重新出现时仍能恢复细粒度视觉细节;同时构建 RememBench,用于评测长时序重访场景下的文本到视频与图像到视频一致性。
- DramaAgent: Agentic Storytelling Video Generation
- 赛道归属: 视频生成 / 长视频叙事生成 / Agentic 控制
- 核心创新点: 提出 DramaAgent 这一分层、具备代理式控制的长篇视频与音频生成框架,不直接改造底层生成模型,而是在上层引入故事规划、持久角色条件控制、按场景合成以及反思驱动的定向修复流程;通过维护可复用的故事与角色状态,并对身份漂移、场景语义缺失、时序断裂和跨模态不匹配进行诊断与分阶段修复,提升长程叙事一致性与音视频协同。
- VideoGen-Agent: Reinforcing Video Generation Agents
- 赛道归属: 视频生成 / 多模态智能体
- 核心创新点: 提出 VideoGen-Agent,将视频生成任务转化为可调用外部工具的多轮智能体决策问题,并通过多任务 agentic reinforcement learning 学习工具使用策略;方法结合监督微调与强化学习,利用类别感知的混合奖励来同时约束工具调用有效性、任务适配性与生成质量。
- DrawVideo: Grounded and Faithful Multi-Shot Video Generation from Storyboard Keyframe Sketches
- 赛道归属: 视频生成 / 草图引导生成 / 多镜头故事板控制
- 核心创新点: 提出以故事板关键帧草图为核心的多镜头视频生成框架,将每个镜头拆解为黑白草图、外观提示和运动提示三类条件;方法上先生成结构对齐的参考关键帧,再将运动描述展开为有序动作状态的派生关键帧,最后在相邻关键帧之间合成局部视频片段,从而实现对空间结构、外观一致性和镜头级运动的显式控制。
- Towards Unified Evaluation of Prompt Enhancers for Video Generation 🆕NEW
- 赛道归属: 视频生成 / 提示词增强评测
- 核心创新点: 提出 PEBench,首次将视频生成中的 Prompt Enhancer(PE)从“依赖渲染视频结果”的间接评测,转为可直接评估的统一基准,覆盖文生视频、图生视频和参考视频生成三类场景;构建了包含 1100 个专家验证案例、1005 个视觉资产、35 个细粒度任务的评测集,并设计了结合模态感知事实抽取与基于 rubric 的 24 项标准评估框架,使提示词质量评估能够更直接地反映语义保真、电影化规划与多模态约束满足能力。
- Expression-Diverse References for Identity-Preserving Video Generation 🆕NEW
- 赛道归属: 视频生成 / 身份保持生成
- 核心创新点: 针对单一人脸参考图难以覆盖表情变化导致身份保持不稳定的问题,提出表达多样的参考集合思路,用多个不同表情状态的参考图来刻画身份在表情变化下的外观分布;同时将身份相似度评测从“对单一中性参考比对”扩展为“对参考库匹配”,并按轻度、强烈、极端表情分别报告结果,以更准确暴露表情强度对身份保持的影响。方法上,基于表达多样参考集扩展 Stand-In 进行条件生成,并设计数据整理流程从训练视频中提取一致且多样的人脸裁剪;在仅有单张肖像时,还可借助预训练人脸重演模型合成额外表情参考,从而提升强表情场景下的身份一致性。
- GRACE: Generation-aware latent compression for efficient video generation
- 赛道归属: 视频生成 / 高效视频生成
- 核心创新点: 提出生成感知的潜空间压缩框架 GRACE,在压缩预训练视频自编码器时,不是只追求重建质量,而是同时保持其与预训练 DiT 的兼容性。方法上采用“两阶段”设计:先保留冻结的基础 latent,再学习补偿压缩损失的残差 latent,并在冻结 DiT 的特征空间中对压缩 latent 进行对齐;随后用轻量微调和非对称去噪适配 DiT,使基础部分先去噪、残差后去噪,从而在大幅降低 token 数和推理延迟的同时维持生成质量。
- SGF+: Decoupling Gradient Flows for Autoregressive Video Generation
- 赛道归属: 视频生成 / 自回归视频生成
- 核心创新点: 针对自回归视频生成中“当前帧去噪”和“未来上下文写入”共享参数、梯度方向冲突的问题,提出 SGF+ 将两种角色解耦为独立参数分支,并通过因果注意力保持二者交互。该方法不依赖额外损失或更长训练,只用原始生成目标联合优化,让上下文写入通过其对未来预测的贡献获得监督,从而同时提升视觉质量与长程时间一致性,并支持超长时间连续生成。
- AdSpark: A Large-Scale Dataset and Benchmark for Product-Centric Advertisement Video Generation
- 赛道归属: 视频生成 / 广告视频生成数据集与评测
- 核心创新点: 构建面向商品广告视频生成的 AdSpark 大规模数据集与基准,重点补齐该任务中“商品身份保持 + 多镜头广告叙事”的数据与评测缺口。数据集包含约 30 万组图像-提示词-视频三元组,并提供商品身份、卖点描述、创意方案和对齐音频脚本等结构化标注;同时提出 AdSpark-Bench,从视觉质量、商品保真、指令遵循、时序一致性、音频对齐和广告效果六个维度进行诊断式评测,为该细分赛道提供统一的数据与评价框架。
GitHub
- [2026-10-09] ddalcu/mlx-serve ⭐1805
- [2026-10-09] tetherto/qvac ⭐683 🆕NEW
- [2026-10-09] AlibabaResearch/SparkDiffusion ⭐541 🆕NEW
- [2026-10-09] HaroldChen19/Awesome-AR-Video-Memory ⭐83 🆕NEW
- [2026-10-09] nexscope-ai/ecommerce-ai-tools ⭐70
音频生成
arXiv
- FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision
- 赛道归属: 视频到音频生成 / Foley音效生成 / 多模态可控音频生成
- 核心创新点: 提出统一的video-to-audio框架,将多模态控制、帧级时间对齐和细粒度语义建模整合到同一生成流程中;通过条件注入机制支持音频控制的VTA与Foley扩展,通过多模态动态掩码策略保持训练阶段的时序同步,并引入基于副词的数据增强方法,结合信号处理与大语言模型增强文本监督的语义精度。
- NeuMark-Native: Robust Text-to-Speech-Native Watermarking Through Full Utilization of Neural Audio Codec Latent Space
- 赛道归属: 语音水印 / TTS安全与溯源 / 神经音频编解码器
- 核心创新点: 提出TTS-native水印框架,将载荷信息嵌入神经音频编解码器的每一层latent表示中,而不是在波形生成后进行外加扰动;在冻结预训练TTS模型和codec的前提下,仅优化水印模块,使水印在后续DSP攻击和神经codec重采样攻击下更稳健,同时尽量保持语音自然度、可懂度和音质。
- Prompt-Consistency Inference for Zero-Shot Flow-Matching Text-to-Speech Models
- 赛道归属: 零样本文本转语音 / 流匹配TTS推理优化
- 核心创新点: 提出训练无关的Prompt-Consistency Inference(PCI)推理规则,在每次速度场评估前将prompt对应的状态恢复到其解析形式,而不改变待生成区域;利用prompt轨迹可闭式求解这一性质,减少采样过程中prompt状态漂移带来的条件偏差,从而在不增加额外网络前向的情况下提升说话人相似度和可懂度。
- Articulatory Source-Filter TTS: Physically Grounded Control through Vocal Tract Kinematics
- 赛道归属: 可控文本到语音生成 / 语音合成
- 核心创新点: 提出一种基于发音器官运动学的 source-filter TTS 架构,将声道滤波器与声源显式解耦:通过 Acoustic-to-Articulatory Inversion 生成伪运动轨迹来条件化滤波器响应,并用预测的基频与能量轮廓参数化声门声源;同时引入 Optimal Transport Conditional Flow Matching 对声源进行细化,再与滤波器重组为最终频谱。该方法的关键突破在于把原本黑盒式的 TTS 转化为具备物理可解释控制的生成过程,支持稳定的韵律缩放、跨说话人声源/滤波器重组,以及对发音轨迹的直接操控。
- PLACE: Positional Latent Adaptation via Conditioned Embeddings for Binaural Audio Generation
- 赛道归属: 双耳音频生成 / 多模态条件音频生成
- 核心创新点: 在预训练 any-to-audio 模型 AudioX 上扩展出面向双耳生成的条件适配方法:利用 Perception Encoder Core 特征增强视频条件,引入文本与视频表示对齐以提取空间线索,并通过依赖条件的低秩变换调制生成潜变量。训练时再用解码音频的双耳线索目标(ITD/ILD)进行监督,从而把空间感知信息注入生成过程。其方法重点在于把文本、视频和可选音频提示统一到可控的空间音频生成框架中,提升空间一致性与跨模态控制能力。
- Post-Training Zero-Shot TTS for Fine-Grained Emotion and Duration Control via Natural Language
- 赛道归属: 文本到语音生成(TTS)/ 后训练控制
- 核心创新点: 提出一种面向预训练TTS模型的统一后训练框架,通过监督微调先建立“自然语言指令—语音生成”的对应关系,再结合带组相对策略优化的强化学习,用情感与时长奖励联合内容、说话人保持目标,进一步提升段级情感与语速控制精度;该方法直接复用预训练架构,不引入额外推理时控制模块,实现了细粒度、零样式控制能力的增强。
- Zero-Shot Lombard Speech Synthesis with Controllable Style Embeddings
- 赛道归属: 文本转语音(TTS)/零样本风格可控语音合成
- 核心创新点: 在不依赖 Lombard 专门训练数据的前提下,基于 F5-TTS 扩展出可学习的风格嵌入表示,并通过 PCA 分析潜空间中与 Lombard 属性相关的方向,再对这些方向进行操控,实现对发声力度、咬字清晰度等 Lombard 风格因素的可解释控制;该方法支持零样本合成不同强度的 Lombard-like 语音,同时保持说话人身份与自然度,并提升噪声环境下的可懂度。
- Beyond Speech Captions: Speech-Rewarded Style Planning for Conversational Text-to-Speech 🆕NEW
- 赛道归属: 文本到语音生成(可控TTS / 风格规划)
- 核心创新点: 提出 Speech-Rewarded Style Planning(SRSP),用冻结的下游TTS模型作为“奖励信号”来训练基于文本的风格规划器,而不是直接依赖风格描述文本本身作为伪标签。方法上通过生成候选风格指令,并以目标语音token的teacher-forced likelihood作为奖励,结合GRPO优化,使规划器学习到更贴近实际合成效果的指令选择,从而提升语音风格、情感相似度以及上下文适配性。
- Edit Who Speaks, Control How They Speak: Global Timbre Editing and Local Instruction Control for TTS 🆕NEW
- 赛道归属: 文本到语音生成(可控TTS / 音色编辑与局部指令控制)
- 核心创新点: 提出 EDICT,将“全局音色编辑”和“局部表达指令控制”统一到一个框架中。其关键做法是先将参考音频与结构化音色编辑信息结合,在codec-token空间生成“编辑后的参考音色”,作为冻结TTS骨干模型的共享声音锚点;同时通过分段自然语言指令控制局部表达。为兼顾指令更新与语音连续性,方法在每个分段边界重建KV cache,在刷新指令条件的同时保留有限的历史声学上下文,从而更好地平衡音色一致性、局部指令遵循和过渡自然性。
- Training-Free Instruction TTS Gender Bias Calibration Using Model-Adaptive Steering
- 赛道归属: 文本到语音生成(TTS)/ 偏差校准与可控生成
- 核心创新点: 提出一种无需训练的模型自适应 steering 方法,用于校准指令式TTS中由职业、人物设定等描述性提示词引入的隐式性别偏置;方法通过在后编码器条件表示上施加群体偏差向量,并在开发集上进行由粗到细的强度搜索来确定干预幅度,同时加入确定性的词法门控,在检测到显式性别词时自动跳过干预,以避免破坏用户明确意图。
GitHub
- [2026-10-09] huggingface/diffusers ⭐34695
- [2026-10-07] Stability-AI/stable-audio-tools ⭐3875
- [2026-10-08] kandinskylab/kandinsky-6 ⭐234
- [2026-10-06] Tencent-Hunyuan/Prism ⭐88
- [2026-10-07] ShareLab-SII/VA-Judger ⭐66
HuggingFace Models
HuggingFace Datasets
- [2026-10-07] espnet/yodas3
- [2026-09-22] witfoo/precinct6-cybersecurity
语言大模型
arXiv
- Structure vs. Chain-of-Thought: Evaluating LLM Criteria Extraction for Depression Severity
- 赛道归属: 医疗文本理解 / 心理健康评估 / LLM可解释性与评测
- 核心创新点: 该工作系统比较了两类基于LLM的抑郁严重程度判定范式:直接生成严重度标签的链式思维推理,以及先抽取临床量表条目再由规则映射为标签的“结构化抽取”方案。其方法上的重点在于引入可审计的临床标准(PHQ-9、BDI-II)与不同阈值设定方式,使用加权Kappa评估一致性,并分析是否存在“抽取优于推理”的稳定优势。结果表明,结构化抽取并未在所有设置下稳定优于链式思维,且阈值是否基于标注数据拟合会显著影响结论;同时,较高的整体一致性并不等价于对重症样本的更好识别,揭示了该类任务中“可解释性、校准与重症召回”之间的张力。
- AutoDP-LLM: Automating Data Pre-processing for Intrusion Detection Systems using Large Language Models
- 赛道归属: 网络安全 / 入侵检测 / LLM驱动的数据预处理自动化
- 核心创新点: 提出 AutoDP-LLM,将大语言模型用于自动生成、验证并执行入侵检测数据预处理流水线;通过“确定性主机侧规划 + LLM专家代理”协同生成处理策略与可执行代码,并结合语义推理与训练统计证据自适应筛选特征,在不预设特征预算的情况下实现紧凑、可执行的自动化预处理流程。
- Which LLM to pick? Online Active Model Selection for Large Language Models
- 赛道归属: LLM在线模型选择 / 主动学习 / 流式数据评测
- 核心创新点: 提出 ONLINE LLM PICKER,用于在流式查询场景下、在有限标注预算内主动挑选最有信息量的样本进行人工标注,从而识别候选模型中表现最佳或近似最佳的LLM。其方法核心在于将“模型选择”从依赖静态基准分数,转为面向在线数据流的主动标注决策问题,并通过选择最具判别力的提示来降低标注成本,同时支持在未标注样本上进行顺序生成时更早锁定优选模型。
- An Agentic AI Framework with Large Language Models and Chain-of-Thought for UAV-Assisted Logistics Scheduling with Mobile Edge Computing
- 赛道归属: 物流调度 / 边缘计算 / UAV协同优化 / Agentic AI
- 核心创新点: 构建一个面向UAV辅助物流与MEC联合调度的agentic AI框架,利用LLM、检索增强生成和Chain-of-Thought将用户需求转化为可解释的数学建模;同时设计分层PPO强化学习,上层学习UAV路径规划,下层优化每时隙任务执行与资源分配,以处理路由、能耗、计算与通信资源及截止期约束的耦合优化问题。
- Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning
- 赛道归属: 具身智能 / 神经符号规划 / LLM辅助强化学习
- 核心创新点: 将大语言模型、符号规划与强化学习进行混合式整合:利用LLM的常识推理能力识别环境中的缺失算子,借助符号规划器生成可执行计划,再由LLM为新识别的算子自动撰写奖励函数,指导强化学习代理学习对应控制策略,从而实现对开放世界中新颖对象的适应与操作学习。
- Thought-Like-Pro: Enhancing Reasoning of Large Language Models through Self-Bootstrapped Prolog-based Chain-of-Thought 🆕NEW
- 赛道归属: 大语言模型推理优化 / 符号推理增强
- 核心创新点: 提出 Thought-Like-Pro 框架,将符号逻辑引擎 Prolog 与大模型的 Chain-of-Thought 学习结合起来:先由大模型在提示引导下生成规则与陈述,再借助 Prolog 进行符号推理得到可验证的推理轨迹,随后把这些 Prolog 推导出的连续推理过程转换为自然语言 CoT,用于模仿学习。该方法的关键突破在于通过“自举式”构造高质量、可验证的推理监督信号,增强大模型的推理能力与跨分布泛化能力。
- Towards In-Parameter Memory Augmentation for Large Language Models
- 赛道归属: 大语言模型记忆增强 / 参数化记忆注入
- 核心创新点: 这是一篇综述性质工作,系统梳理了面向部署阶段的“in-parameter memory”增强范式,即将可复用的记忆信息编码到模型参数、适配器或类似参数对象中,并在推理时并入前向计算。文章提出了两个组织维度:一是按记忆注入位置划分为 Embedding、Attention、FFN 和 Hybrid;二是按记忆获取时机划分为离线获取与在线获取。其方法论价值在于明确了该类方法的边界、统一了不同路线的比较框架,并总结了干扰、安全性、与上下文学习协同以及递归自我改进等开放问题。
- Correct Verdicts, Flawed Reasoning: Structured Auditing of LLM-based Vulnerability Reasoning
- 赛道归属: 软件安全 / 漏洞分析 / LLM推理审计
- 核心创新点: 提出 VERA,用结构化推理记录(SRR)替代自由文本CoT,让模型以机器可读字段显式输出指针、内存操作和状态转移;再通过多阶段审计器对八类推理失败模式进行确定性检查,并仅在语义歧义处调用LLM,从而实现对漏洞推理过程的自动化、可扩展审计,同时支持大规模自动变异测试评估审计器能力。
- Enhancing Biomedical Named Entity Recognition via Multiple Programming Languages Instruction Tuning and Ensemble Method
- 赛道归属: 生物医学命名实体识别 / 指令微调 / 结构化信息抽取
- 核心创新点: 将BioNER重构为“结构到结构”的生成任务,把指令和实体输出都表示为代码格式,并通过Python、C++、Java等多种编程语言模板构造多样化监督信号,在不依赖外部生物医学知识的情况下增强结构约束与数据多样性;同时在推理阶段采用跨格式实体级投票集成,降低不同语言表示带来的预测方差,提升鲁棒性与跨数据集泛化能力。
- Spatial Strategies, Not Actions: Vector-Quantized Geodesics as Tools for LLM-Driven Agents
- 赛道归属: LLM智能体 / 空间推理 / 工具使用
- 核心创新点: 提出一种将几何轨迹作为工具、由LLM进行高层编排的两层智能体框架:先在网格世界中收集地理路径轨迹,再通过向量量化从中提取代表性轨迹集合;离线阶段让LLM为每条选中的轨迹关联自然语言行为描述,形成可调用工具;在线阶段LLM根据当前状态与目标选择合适工具,底层则由原始动作执行对应轨迹。该方法把工具发现交给无监督轨迹量化,把推理与决策交给LLM,从而在部分可观测动态环境中以更低推理成本实现接近更强链式思维版本的目标达成效果。
GitHub
- [2026-10-09] sgl-project/sglang ⭐36902
- [2026-10-09] NVIDIA/TensorRT-LLM ⭐14776
- [2026-10-09] google-ai-edge/LiteRT-LM ⭐6617
- [2026-10-09] flagos-ai/FlagGems ⭐1131 🆕NEW
- [2026-10-09] cartertemm/AI-content-describer ⭐70 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-09-26] XiaomiMiMo/MiMo-V2.6-RL-oss
- [2026-09-23] bakrianoo/jabarti-llm-dataset
- [2026-10-07] aidigestorg/ai-village
- [2026-10-08] MoreThought/Fable-5.1-Max-Reasoning-Filtered-10000x
HuggingFace Spaces
多模态大模型
arXiv
- CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving 🆕NEW
- 赛道归属: 自动驾驶 / 多模态传感器融合 / 不确定性建模
- 核心创新点: 提出一种由视觉-语言模型(VLM)引导的不确定性感知跨模态融合框架,将VLM的先验知识与上下文推理能力用于生成更细粒度的像素级不确定性估计,从而为融合过程提供更精细的可靠性指引;同时引入动态自适应机制,显式建模并捕获跨模态依赖关系,以更充分利用摄像头、LiDAR、雷达等多传感器之间的互补信息。
- MoR-MLLM: Mixture of Recursions for Efficient Multimodal Large Language Models
- 赛道归属: 多模态大模型推理优化 / 计算效率优化
- 核心创新点: 基于 Mixture-of-Recursions 框架,将“静态稀疏”改为“按 token 自适应递归深度分配”,使模型能够针对视觉或语言中更复杂的 token 动态增加计算、对简单 token 跳过冗余递归,从而实现计算稀疏化;同时提出三阶段 MoR-Tuning 训练策略,并结合熵正则化损失稳定多模态场景下的递归稀疏训练,提升路由分布多样性,在降低训练显存与计算开销的同时尽量保持任务性能。
- A Vision-Language Model (VLM)-based Pipeline for End-to-End Procedural Modeling of Field-Grown Maize from Point Clouds
- 赛道归属: 3D生成 / 点云到可编辑3D建模 / 多模态理解
- 核心创新点: 提出一条从原始田间玉米点云到参数化、可编辑三维作物模型的端到端自动化流程:先用视觉语言模型在渲染的正交视图中标注叶片中线,再通过确定性的几何回投、跨视图一致性融合与基于方向加权表面图的中线生长,将2D标注转化为3D叶片结构;随后把测得的器官参数填入基于NURBS的程序化模型生成器,并用可微NURBS拟合对叶片表面进行精修。该方法的关键突破在于不依赖人工调参或物种特定训练数据,把VLM的语义标注与后续几何约束结合,转化为可用于程序化建模的器官级测量。
- Similar Choices, Different Attention: Cross-Modal Associations in Humans and Vision-Language Models
- 赛道归属: 多模态理解 / 跨模态注意力分析
- 核心创新点: 该工作在相同刺激条件下同时比较人类与VLM的选择结果和眼动轨迹,避免了以往“人机使用不同任务或不同刺激”带来的不可比问题;进一步通过人类选择微调、以人类注视训练模型注意力等方式,分别检验“选择对齐”和“注意力对齐”是否足以代表人类一致的跨模态加工,揭示二者并不等价,且模型注意力与人类凝视的匹配甚至不如中心偏置基线。
- LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
- 赛道归属: 多模态理解 / 语言能力恢复
- 核心创新点: 提出无需额外适配器的选择性跨模态蒸馏方法,利用微调前冻结的原始语言模型作为教师,在多模态后训练阶段专门监督语言能力恢复。关键技术是层级 KV-cache 共享,使纯文本教师能够感知学生的多模态表示而无需改动模型结构;同时仅在语言占比高的数据上进行蒸馏,避免削弱视觉对齐能力。该方法在不增加参数和推理开销的前提下,缓解了多模态微调导致的语言遗忘。
- SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
- 赛道归属: 多模态理解 / 音视频理解评测
- 核心创新点: 提出SONIC-O1这一面向真实世界音视频理解的系统化评测基准,覆盖60小时、231个片段、13个对话场景,并由人工全量核验;同时联合评估开放式总结、选择题问答与带理由的时间定位三类能力,尤其强调对“时序对齐+推理依据”的考察,并附带人口统计元数据以分析模型在不同群体上的行为差异。
- PathLang: A Language-Centered Benchmark for Vision-Language Models in Computational Pathology 🆕NEW
- 赛道归属: 医学多模态理解 / 病理视觉语言模型评测 / 零样本基准
- 核心创新点: 构建了一个以语言为中心的病理VLM零样本基准PathLang,核心不是改变图像内容,而是固定切片、标签和图文评测方向,仅系统性变化诊断语言,从而专门评估模型对术语、具体性和报告风格变化的鲁棒性;同时覆盖分类、检索、释义鲁棒性和开放词表诊断检索四类任务,并由临床病理专家验证提示词与候选集,使得评测能够更真实地反映临床语境下“同义不同表述”对模型行为的影响。
- ReMem: Streaming Video Understanding With Long Context Retention
- 赛道归属: 视频理解 / 流式视频理解 / 长上下文记忆
- 核心创新点: 提出一种训练无关的流式视频适配方法,通过双记忆机制提升长上下文保留能力。其一是 Streaming Context Memory,使用与查询无关的注意力持续压缩历史上下文;其二是 Retrieved Vision Memory,从记忆中检索与当前查询最相关的视觉上下文补充输入。该方法面向任意长度流式视频,在不依赖额外训练的情况下增强长视频信息保留,并兼顾流式与长视频理解任务表现。
- FlashGaze: Training-Free Multi-Scale Patch Pruning For Efficient Video Understanding
- 赛道归属: 视频理解 / 高效视频推理 / 视觉token剪枝
- 核心创新点: 提出训练无关的多尺度 patch 剪枝方法,在 ViT 编码之前就减少时空冗余,从源头降低计算开销。方法以像素空间差异作为信息损失的代理,并通过四叉树动态规划联合优化 patch 的丢弃、合并与保留,在固定预算下实现更优的效率-精度权衡。相比在编码后剪枝的方案,该方法更早削减计算成本,且无需辅助网络训练,能够在大幅加速的同时尽量保持视频理解精度。
- VidHarness: Evolving Agent Harnesses for Cost-Efficient Long Video Understanding
- 赛道归属: 长视频理解 / 视频智能体优化
- 核心创新点: 提出 VidHarness,通过“智能体 harness 自动进化”替代人工设计的视频理解流程;利用执行反馈驱动的迭代搜索,并用 MCTS 避免贪心优化陷入局部最优;结合不确定性感知的多保真验证,先用少量问题筛选候选 harness 以降低评估成本;进一步引入 mixture-of-harness,根据不同帧预算路由到专门化 harness,从而在成本可控的前提下提升长视频问答效果。
GitHub
- [2026-10-08] Blaizzy/mlx-vlm ⭐5589
- [2026-10-09] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1914
- [2026-10-07] ydyhello/Awesome-VLM-Streaming-Video ⭐212
- [2026-10-07] THUSI-Lab/GameVerse ⭐53
- [2026-10-08] hcompai/holo-desktop-cli ⭐51
强化学习
arXiv
- OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems
- 赛道归属: 多智能体系统对齐 / 强化学习驱动的LLM代理优化
- 核心创新点: 提出 Out-of-Money Reinforcement Learning(OOM-RL)这一目标对齐范式,将真实金融市场中的资本亏损、滑点和执行成本作为外部施加的负反馈信号,用“经济后果”替代传统内部评估中的不确定性监督;同时在长期实证中推动代理架构与治理机制演化,并进一步形式化出严格的测试驱动工作流与单向状态锁约束,用于提升执行感知能力与系统鲁棒性。
- CORE-RL: Confidence-Oriented Reliability Evaluation of Black-Box Reinforcement Learning Policies
- 赛道归属: 强化学习安全评估 / 黑盒策略可靠性验证
- 核心创新点: 提出面向黑盒RL策略的统一可靠性评估流程,将早停终止与安全约束违规纳入同一可靠性指标,避免策略通过提前结束回合掩盖失败;同时在感知噪声、执行噪声和环境动力学变化的噪声认证包络下,结合有限样本统计界给出安全性与期望性能的高置信证书,并据此定义安全运行设计域(ODD)用于自动筛除不合规策略。
- RL Starts before RL: On Policy Distillation for Better Reinforcement Learning
- 赛道归属: 推理优化 / 强化学习训练策略
- 核心创新点: 提出在正式RL之前先进行on-policy distillation(OPD)作为准备阶段,证明其收益不仅体现在初始准确率提升,还能带来更高的最终RL性能;进一步分析了蒸馏目标与轨迹来源对后续RL的影响,发现相较于reverse-KL,forward-KL在“蒸馏后接RL”的设置下更有优势,且student rollouts优于teacher rollouts,说明与教师分布的更深层对齐比单纯top-1一致性更关键。
- RL-ABC: Reinforcement Learning for Accelerator Beamline Control
- 赛道归属: 强化学习系统 / 科学计算控制 / 加速器束线优化
- 核心创新点: 构建了一个将粒子加速器束线配置自动转化为RL环境的开源框架RLABC,核心方法是把束线调参形式化为MDP,并自动完成诊断点插入、57维状态构造、奖励函数配置以及与Elegant仿真器的接口对接;同时引入stage learning以将复杂优化拆解为更易训练的子问题,从而提升训练效率与可用性。
- DVLA-RL++: Dual-Level Vision-Language Alignment with Reinforcement Learning Gating for Few-Shot Learning 🆕NEW
- 赛道归属: 小样本学习 / 视觉-语言对齐
- 核心创新点: 提出双层视觉-语言对齐框架 DVLA-RL++,在原有方法上加入补充语义净化(CSP)与反事实强化学习门控(CRG)。CSP 将支持样本拆分为“内在语义”和“噪声/偶然上下文”两类描述,并通过与每个支持 token 的一致性比较来抑制上下文污染;同时引入基于歧义程度的拒绝边界与内在语义锚点,在视觉证据不可靠时提供回退。CRG 则通过奖励函数学习逐层语义融合强度,并借助独立参考轨迹形成配对学习信号,从而提升原型稳定性与融合策略的可学习性。
- TrustMed-RL: Long-Horizon Reinforcement Learning for Evidence-Grounded Clinical Diagnosis
- 赛道归属: 医疗多轮诊断 / 临床推理强化学习
- 核心创新点: 构建面向长时程、证据驱动诊断的多轮RL框架,将问诊、查体、检查、专科会诊与文献检索等状态相关动作纳入统一策略学习;通过临床适配的GiGPO与覆盖率调整后的诊断奖励,强化模型在给出诊断的同时主动获取支持性证据,从而提升诊断准确率与证据扎实度。
- A Balanced Data Diet: Addressing the Exploration Bottleneck in Mega-Scale RL for Robot Control 🆕NEW
- 赛道归属: 机器人强化学习 / 大规模并行仿真控制
- 核心创新点: 提出 Success Guided Sampling(SGS)自适应采样器,针对大规模并行仿真中“探索瓶颈”和训练批次中大量无效经验的问题,动态将训练资源集中到策略能力边界附近的任务配置上。该方法不再对 reset 分布进行均匀采样,而是优先采样更接近“已掌握/尚不可达”分界的样本,从而提高每个 batch 的学习信号利用率,增强超大规模并行 RL 的可扩展性,并支持从仿真到真实机器人的零样本迁移。
- MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement 🆕NEW
- 赛道归属: 大模型强化学习 / 多模态自我提升
- 核心创新点: 系统性扩展 RL 计算规模以推动基础模型自我提升,围绕三条主线进行放大:更大 batch 与更高吞吐的异步训练、更丰富复杂的跨域环境,以及更强的 grader 计算用于更准确的奖励信号。方法上引入 groupwise agentic grading 来提升长程任务的奖励质量并引导模型生成更短、更高效的解答;同时通过冻结 MoE router 和多层防御机制抑制 reward hacking,配套统一轨迹表示、高并发多框架 rollout、解耦控制/数据平面等基础设施,支撑混合任务的 agentic RL 训练。
- GRPODropout: Less is More for Online Reinforcement Learning Rollouts 🆕NEW
- 赛道归属: 大语言模型强化学习 / 在线 rollout 优化
- 核心创新点: 从“哪些 rollout 应该参与更新”这一角度缓解 GRPO 类方法中的策略熵塌缩问题,提出 GRPODropout。该方法在标准更新前,选择性移除少量高概率、正优势的 rollout,并对保留样本的优势值重新中心化,从而在不改变主体算法、且几乎不增加计算开销的前提下,提升探索多样性与训练效果。其核心贡献在于把 rollout 级别的筛选机制引入在线 RL 更新流程,并给出相应的理论分析来指导阈值选择。
- Can Jev be Your Q or Policy in Reinforcement Learning? 🆕NEW
- 赛道归属: 强化学习基础方法 / 冻结决策模型辅助训练
- 核心创新点: 探索将 Jev 这种“单次前向、输出校准决策结果”的冻结决策模型作为 RL 训练组件使用,而非仅作为被训练对象或提示式生成器。论文先分析 RL 系统各对象对输入输出的需求,指出 Jev 可满足除价值函数外的多数角色,然后将其用于参考策略、探索判别器和回放评分器三个位置,以分别提升样本效率、探索质量和学习性能。该工作的重要方法论突破在于证明了冻结决策模型可以直接嵌入 RL 学习过程,并在多个环境中替代或增强传统 RL 组件。
GitHub
- [2026-10-09] OpenPipe/ART ⭐10788 🆕NEW
- [2026-10-09] pytorch/rl ⭐3594 🆕NEW
- [2026-10-09] radixark/miles ⭐3069
- [2026-10-09] raamonp/rl-gym-orchestrator ⭐55
- [2026-10-09] selab-gatech/autoresttest ⭐53
HuggingFace Models
世界动作模型
arXiv
- LeWAM: A JEPA World Action Model with Diffusion-Steering-Based MPC 🆕NEW
- 赛道归属: 机器人操作 / 世界动作模型 / 具身智能控制
- 核心创新点: 提出 LeWAM,将世界动作模型构建为基于 decoder-free JEPA 潜空间的双向 Transformer,并在同一潜表示上端到端联合训练前向、后向、逆动力学和策略预测四种模式。其方法上的关键突破在于:用更干净的 JEPA latent 替代重建式表示,减少噪声与冗余信息;通过双向建模增强状态与动作表征对齐;并进一步指出规划时在策略头的噪声空间中采样,比直接采样原始动作更有利于 MPC 闭环性能提升。
- Humanoid World Action Model With Joint State--Action Generation 🆕NEW
- 赛道归属: 人形机器人操作 / 世界动作模型 / 具身动作生成
- 核心创新点: 提出 HWAM,将“执行后的本体感知状态”显式纳入预测目标,联合生成参考动作与实际实现的身体状态,以缓解分层人形系统中的 action-execution gap。方法上通过三条互补条件路径协同训练:策略路径在仅基于当前观测的条件下去噪状态-动作轨迹,前向动力学路径用动作和执行后状态预测未来视觉结果,逆动力学路径从视觉转移重建联合轨迹,从而把参考动作、真实身体运动和视觉后果直接连接起来。
- WAM-Cache: Staleness-Bounded KV Reuse for Efficient World Action Models 🆕NEW
- 赛道归属: 机器人推理加速 / 世界动作模型推理优化 / KV 缓存复用
- 核心创新点: 提出 WAM-Cache,一种无需训练的 WAM 加速框架,通过跨 chunk 复用视频 DiT 的分层 KV 表示,仅对少量刷新 token 进行重计算,降低每个控制 chunk 的预填充开销。其方法上的关键点在于:不再按“视觉漂移”直觉选刷新 token,而是结合动作专家的 cross-attention 关注区域与视觉 latent surprise 来决定刷新集合,并引入严格的 age bound 抑制误差累积,从而在保持接近稠密基线性能的同时显著减少 FLOPs。
- TAPDreamer: Transferable Adversarial Patches for World Action Models
- 赛道归属: 世界动作模型安全攻击 / 对抗扰动
- 核心创新点: 提出一种无需访问目标模型输出、仅依赖公开编码器的可迁移对抗补丁攻击方法。其关键突破在于利用补丁引发的注意力权重与 value 向量交互,诱导一种可在图像大范围传播且跨任务稳定的表征偏移;并通过仅用单一源任务的6帧样本,直接优化干净与补丁编码表示之间的全局 L1 距离,从而得到可跨任务、跨动作架构迁移的固定局部扰动。
- RealtimeWAM: One-Step Asynchronous World Action Models
- 赛道归属: 世界动作模型推理加速 / 低延迟动作生成
- 核心创新点: 提出一种面向世界动作模型的极致高效推理框架,将动作生成压缩为单步,并通过异步执行减少视频专家与动作专家之间的等待开销。方法上包含两项关键设计:一是 Teacher-Anchored Consistency Distillation,用冻结教师的多步 rollout 终点补足仅靠局部一致性训练带来的“局部-全局误差鸿沟”,从而实现准确的一步动作生成;二是 Cross-Expert Wavefront Pipelining,通过块级共享视频 KV cache 并仅在动作注意力真正消费前同步,消除专家级串行等待。整体实现了近乎无损的性能保持与显著端到端加速。
- Future Anchored Verification and Online Recovery for World Action Models
- 赛道归属: 世界动作模型在线验证 / 执行恢复
- 核心创新点: 提出 FAVOR 框架,将世界动作模型在执行前预测出的未来帧作为“锚点”,同时用于偏差检测与在线恢复,而不是仅在偏离后决定是否停止。其方法核心是:通过 Anchor Verifier 将当前观测与对应锚点及已执行动作联合比对,识别破坏任务进程的偏移;再由 Anchor-Guided Recovery 借助视觉语言模型把被标记的锚点转化为简短纠正指令,促使模型回到原先预测的未来轨迹后继续执行。该工作把“监测”扩展为“验证 + 恢复”的闭环机制,且无需修改原策略。
- WAMJET: A Harness for World Action Model Acceleration
- 赛道归属: 世界动作模型推理加速 / 系统优化
- 核心创新点: 提出 WAMJET 这一面向世界动作模型加速的 agentic harness,通过为编码代理提供可复用的优化指导、测量与验证工具,自动化完成加速方案的选择、组合与迭代优化。其方法论重点在于采用“瓶颈驱动”的工作流:先剖析推理瓶颈,再定向修改代码,随后验证收益并根据瓶颈迁移继续优化,从而减少人工工程成本并保持动作质量。该框架可跨模型与硬件平台生成有效的加速栈,实现无损或近无损的显著提速。
- XGenAct: Geometry-Enhanced World Action Models through Cross-Task Generation
- 赛道归属: 机器人控制 / 世界动作模型 / 3D感知增强
- 核心创新点: 将RGB观测、机器人动作、度量深度、表面法线和功能角色分割统一编码为RGB视频表示,通过确定性codec把多种感知与动作任务纳入同一个视频扩散Transformer中联合学习;训练时通过采样不同感知与动作任务,用单一模型和单一目标学习跨空间的时序预测,避免了为不同模态设计专门头部或分支的碎片化架构。
- Native Action-Prior Learning from Videos for World Action Models
- 赛道归属: 机器人控制 / 世界动作模型 / 观察视频预训练
- 核心创新点: 提出从仅含观察的视频中直接预训练动作策略的“native action-prior learning”,不再依赖先学表征再迁移到控制,也不需要单独的潜变量动作模型;方法上先用未来视频流匹配监督,通过带有转移结构的联合注意力把视觉转移信息传递到Action-DiT中学习动作先验,再用带动作标注的示范进行联合视频-动作流匹配后训练,并通过非对称注意力将视觉分支与动作去噪解耦以支持高效动作推理。
- PointWAM: 3D World Action Modeling for Dexterous Robotic Manipulation
- 赛道归属: 机器人控制 / 世界动作模型 / 3D点云动作建模
- 核心创新点: 将世界表示从RGB提升到3D点轨迹,把场景与手部分解为两个实体,并在共享的时空坐标系中联合预测二者的3D演化;这种显式、解耦的3D表示使模型能够直接利用大规模人类演示视频进行预训练,无需任务特定的物体或关键点选择,随后再将预测到的手部运动重定向为机器人动作,从而更好建模灵巧操作中的空间结构与接触几何。
GitHub
- [2026-10-08] NVlabs/LongLive ⭐2699
- [2026-10-07] OpenWAM/OpenWAM ⭐161
- [2026-10-03] UniWAM/UniWAM ⭐97 🆕NEW
- [2026-10-05] LeapLabTHU/Simple-WAM ⭐79
- [2026-10-06] youngzhou1999/DriveDreamer-Policy ⭐60
由 Research Daily 自动生成 生成时间: 2026-10-09 13:30:32