AI 每日进展速报 - 2026-10-06
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- Keep It CALM: Analyzing the Limits of Global Unsafety in Text-to-Image Generation
- 赛道归属: 文生图安全对齐 / 训练时无关安全防护
- 核心创新点: 该工作分析了“全局不安全方向/子空间”这类训练无关安全方法的适用边界,指出其存在“覆盖性-选择性”权衡:过于紧凑的安全子空间难以覆盖多样化的有害语义,过于宽泛的聚合又会误伤安全邻近的正常提示词。基于这一几何分析,提出 CALM,通过匹配有害-安全锚点进行提示词局部反事实修正,只对触发违规的 token 表征做最小化安全侧编辑,并抑制正向对齐的有害残差,从而以更细粒度的局部修正替代统一的全局不安全信号移除。
- Amplify What You Gaze At: Target Saliency Boosting in Text-to-Image Generation
- 赛道归属: 文生图 / 可控生成
- 核心创新点: 提出“目标显著性增强”任务,关注在不依赖任何视觉先验的前提下,让生成图像中指定对象更突出。其关键方法是将显著性视为相对量,通过建模目标对象与全局场景之间的相对关系来提升目标可见性,而不是仅对单个对象做局部强化。
- POET: Preference Optimization for Enhanced Text-to-Image Generation
- 赛道归属: 文生图优化 / 提示词重写
- 核心创新点: 提出POET,通过LLM先对用户输入进行自动提示词重写,再送入冻结的文生图骨干模型;其关键创新在于设计复合奖励并采用迭代式DPO训练,让重写器直接从多模态反馈中学习“模型偏好”的提示结构,且不依赖高成本SFT数据,从而提升图文对齐、视觉质量与美学表现,并具备跨不同T2I骨干的迁移能力。
- TerraVis: Towards Evaluation of World-Grounded Visual Consistency in Text-to-Image Generation via MLLM Workflows
- 赛道归属: 文生图评测 / 世界一致性评估
- 核心创新点: 该工作提出 TerraVis,用于评估生成图像是否符合真实世界的结构与物理常识,而不仅是视觉质量或文本对齐。其核心方法是构建覆盖对象、交互和场景层面的世界一致性违规 taxonomy,并设计多阶段 MLLM 评估流程:先判断图像是否适合评估,再识别 18 类违规类型,并将其划分为轻微/严重以形成总体世界一致性分数。该框架强调对“看起来好但不符合常识”的失败模式进行系统化量化与诊断。
- OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation
- 赛道归属: 文生图 / 偏好优化 / 细粒度对齐
- 核心创新点: 提出对象中心的自我改进偏好优化框架,聚焦提升对象属性级别的对齐能力,如颜色、形状和空间关系。核心方法是围绕对象构建偏好优化过程,并强调自举式改进,以缓解传统 DPO/GRPO 在偏好构造和计算成本上的问题,同时提升细粒度文本-图像一致性。
- Safe Image Generation via Reinforcement Learning 🆕NEW
- 赛道归属: 文生图安全生成 / 生成过程安全控制
- 核心创新点: 提出一种“生成中”安全框架,不再只依赖生成前过滤或生成后审核,而是在扩散去噪轨迹中监测中间表示里的NSFW信号;进一步结合强化学习,将检测到的风险轨迹主动引导到安全图像生成方向,实现对NSFW提示词的可控安全生成,并尽量保持图像质量与提示词一致性。
- VisualErase: Dual-Branch Visual Trajectory Redirection for Robust Concept Erasure in Text-to-Image Diffusion Models 🆕NEW
- 赛道归属: 文生图概念擦除 / 扩散模型知识移除
- 核心创新点: 提出双分支的视觉轨迹重定向范式,目标不是仅改写文本到图像映射,而是直接将包含目标概念的视觉生成轨迹重定向到“概念已移除”的结果;通过结构保持的图像编辑构造内容对齐但去除目标概念的对应样本,并据此建立去噪目标,同时对有条件与无条件预测施加联合约束,再结合对应内容保留损失,以增强擦除鲁棒性并减少对非目标生成能力的破坏。
- Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards
- 赛道归属: 文生图后训练 / 偏好优化 / 奖励建模
- 核心创新点: 该工作提出一种面向开放域文生图模型的后训练配方,通过组合互补奖励来同时优化整体人类偏好与提示词忠实度等细粒度属性。方法上包含两类奖励:基于大规模人类偏好数据、采用 Bradley-Terry 目标训练的偏好奖励,以及显式评估 prompt faithfulness 等属性并用于防止 reward hacking 的 rubric 奖励。其关键突破在于不采用简单加权平均,而是设计更有效的奖励组合策略,以更好平衡偏好优化与规则满足。
- Traversing the Satisfaction-Diversity Frontier in Text-to-Image Diffusion
- 赛道归属: 文生图扩散模型采样 / 多样性-满意度权衡
- 核心创新点: 该工作将多图生成建模为“satisficing”问题:每个候选图都必须达到最低奖励阈值,同时整批结果还需满足多样性下限,从而显式刻画“满意度-多样性”前沿。为遍历这一前沿,提出训练无关的推理时方法 SatisDive,利用 batch-relative reward cutoff 区分低奖励与高奖励候选,对低于阈值的样本侧重提升奖励,对高于阈值的样本侧重保持多样性。其方法论重点在于把奖励与多样性从单一聚合目标改为分层约束与分区调控。
- When Text-to-Image Helps Editing: The Effects of Conditioning During Denoising
- 赛道归属: 图像编辑 / 扩散模型采样策略优化
- 核心创新点: 研究统一式编辑模型在去噪过程中不同条件信息的作用变化,发现纯编辑流程中源图像条件在部分编辑任务上会随采样轨迹逐渐减弱;据此提出“任务切换”策略,在去噪的有限区间内切换到文本到图像(T2I)任务,让模型调用其生成能力,再切回编辑模式。该方法利用同一统一模型已训练的两种条件模式,通过切换时机在编辑质量与内容保真之间取得更优平衡。
GitHub
- [2026-10-06] pydantic/pydantic-ai ⭐20424
- [2026-10-06] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13537
- [2026-10-06] AceDataCloud/Nexior ⭐398
- [2026-10-06] ZSeven-W/dsh-crew ⭐156 🆕NEW
- [2026-10-06] dickpy/dsh-imagegen ⭐99 🆕NEW
HuggingFace Models
HuggingFace Spaces
视频生成/编辑
arXiv
- CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation
- 赛道归属: 视频生成 / 物理一致性建模
- 核心创新点: 提出 CompAdapt,用于构建可适配的复合运动建模框架,面向文本到视频生成中的物理一致性问题;其方法重点突破了单一运动类型、依赖手工参数以及难以泛化到未见物理规律的限制,强调对复杂运动组合的适应能力。
- TasteRoute: Personalized Routing for Video Generation 🆕NEW
- 赛道归属: 视频生成 / 个性化路由 / 成本感知生成
- 核心创新点: 提出面向视频生成请求的个性化路由框架,将输入需求、用户偏好与生成预算联合建模,用于在多个视频生成模型之间选择合适的生成器;同时构建了包含多模型视频对比、质量判断、偏好排序和用户画像信号的标注数据集,支持偏好路由与成本控制的联合优化。
- MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation
- 赛道归属: 视频生成 / 长时序自回归生成 / 记忆增强
- 核心创新点: 提出 MosaiChunk 记忆机制,将跨空间与时间的历史 KV 选择性组合成“马赛克”式记忆,在冻结视频生成器的前提下,仅训练轻量路由器决定在固定记忆预算下保留哪些历史片段,从而让模型在对象或场景重新出现时仍能恢复细粒度视觉细节;同时构建 RememBench,用于评测长时序重访场景下的文本到视频与图像到视频一致性。
- DramaAgent: Agentic Storytelling Video Generation
- 赛道归属: 视频生成 / 长视频叙事生成 / Agentic 控制
- 核心创新点: 提出 DramaAgent 这一分层、具备代理式控制的长篇视频与音频生成框架,不直接改造底层生成模型,而是在上层引入故事规划、持久角色条件控制、按场景合成以及反思驱动的定向修复流程;通过维护可复用的故事与角色状态,并对身份漂移、场景语义缺失、时序断裂和跨模态不匹配进行诊断与分阶段修复,提升长程叙事一致性与音视频协同。
- TempQ-Jail: Query-Constrained Candidate Ranking for Text-to-Video Jailbreak Attacks
- 赛道归属: 视频安全 / 文本到视频越狱攻击
- 核心创新点: 将文本到视频越狱攻击形式化为“查询受限的候选分配与排序”问题,提出 TempQ-Jail,通过组合异构攻击机制扩展候选覆盖,并估计候选的端到端攻击效果,用于在生成与安全评估代价较高的场景下更高效地筛选攻击候选。
- VideoGen-Agent: Reinforcing Video Generation Agents
- 赛道归属: 视频生成 / 多模态智能体
- 核心创新点: 提出 VideoGen-Agent,将视频生成任务转化为可调用外部工具的多轮智能体决策问题,并通过多任务 agentic reinforcement learning 学习工具使用策略;方法结合监督微调与强化学习,利用类别感知的混合奖励来同时约束工具调用有效性、任务适配性与生成质量。
- DrawVideo: Grounded and Faithful Multi-Shot Video Generation from Storyboard Keyframe Sketches 🆕NEW
- 赛道归属: 视频生成 / 草图引导生成 / 多镜头故事板控制
- 核心创新点: 提出以故事板关键帧草图为核心的多镜头视频生成框架,将每个镜头拆解为黑白草图、外观提示和运动提示三类条件;方法上先生成结构对齐的参考关键帧,再将运动描述展开为有序动作状态的派生关键帧,最后在相邻关键帧之间合成局部视频片段,从而实现对空间结构、外观一致性和镜头级运动的显式控制。
- Keepsake: Selective Spatial Memory for Long-Horizon Video Generation 🆕NEW
- 赛道归属: 视频生成 / 长时序视频生成 / 选择性记忆
- 核心创新点: 提出一种训练免费的在线空间记忆控制器,在固定容量下动态评估历史观测的保留价值;其关键在于构建位姿-外观图,将相机位姿接近性与视觉相似性结合起来计算保留优先级,并根据当前记忆库中的替代关系持续重估每个观测的价值,从而在不改动主生成器的前提下提升长时序一致性与生成质量。
- Kepler4D: Controllable Future Video Generation via 4D Scene State Evolution 🆕NEW
- 赛道归属: 视频生成 / 可控未来视频生成 / 4D场景建模
- 核心创新点: 提出通过显式4D场景状态演化来生成未来视频的框架,将单目视频中的背景几何、物体运动历史、空间支撑和语义上下文统一到共享3D表示中;方法上利用 Chain-of-Motion 总结已观测运动,并借助视觉语言模型选择结构化的速度、方向等决策,再通过确定性滚动生成未来轨迹,最后将演化中的代理渲染为几何控制信号输入预训练视频生成器,实现运动可控与场景一致性的解耦。
- DuoMatching: Joint-Marginal Distribution Matching for Few-Step Video Generation
- 赛道归属: 视频生成 / 少步视频生成 / 分布匹配蒸馏
- 核心创新点: 提出 DuoMatching,将视频生成的分布匹配从单一的联合分布匹配扩展为“联合-边缘”统一建模:在原有 joint matching 基础上增加 marginal matching,为每一帧引入来自图像生成器的专门监督,以补充视觉质量与语义对齐能力;同时通过 LatentBridge 解决视频学生模型与图像教师之间的潜空间表示不一致问题,并用 Latent Variation Sampling 将帧级监督分散到不同时间片段,减少冗余、增强时序覆盖,从而在尽量保持运动动态的前提下提升画质、构图和语义一致性
GitHub
- [2026-10-06] ddalcu/mlx-serve ⭐1765
- [2026-10-06] people-robots/Awesome-Video-Generation-Post-Training ⭐208
- [2026-10-06] Tenney95/AI-Canvas-tauri ⭐201 🆕NEW
- [2026-10-06] nexscope-ai/ecommerce-ai-tools ⭐52 🆕NEW
- [2026-10-06] utensils/mold ⭐51
音频生成
arXiv
- TinyAudio: Compact and Efficient Text-to-Audio Generation for Low-Resource Deployment
- 赛道归属: 文本到音频生成(TTA)/轻量化端侧部署
- 核心创新点: 提出面向低资源部署的紧凑型流匹配TTA框架,将生成模型、文本编码器与音频VAE进行小参数化设计,核心是以单流Transformer流匹配模型为主干,并配套音频对齐文本编码器与轻量音频表征模块,在尽量压缩参数规模的同时保持文本到音频生成能力。
- COT-TTS: Audio Context-Aware Text-to-Speech with Chain-of-Thought Reasoning
- 赛道归属: 文本到语音(TTS)/上下文推理式语音合成
- 核心创新点: 将链式思维推理引入TTS上下文建模,构建基于历史对话音频、目标文本与参考语音的推理式语音合成任务,使模型不再仅依赖显式风格指令,而是从历史对话中推断当前应采用的说话风格。
- FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision 🆕NEW
- 赛道归属: 视频到音频生成 / Foley音效生成 / 多模态可控音频生成
- 核心创新点: 提出统一的video-to-audio框架,将多模态控制、帧级时间对齐和细粒度语义建模整合到同一生成流程中;通过条件注入机制支持音频控制的VTA与Foley扩展,通过多模态动态掩码策略保持训练阶段的时序同步,并引入基于副词的数据增强方法,结合信号处理与大语言模型增强文本监督的语义精度。
- ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
- 赛道归属: 视频到音频生成(V2A)/多模态可控生成
- 核心创新点: 提出统一的多模态V2A框架,支持视频、文本与参考音频的联合控制;通过融合CLIP与时空音视频编码器增强视觉-文本对齐,采用时间-音色解耦抑制冗余时序信息并保留可辨识音色特征,同时引入统一表示对齐与随机模态dropout提升跨模态冲突下的鲁棒可控性。
- NeuMark-Native: Robust Text-to-Speech-Native Watermarking Through Full Utilization of Neural Audio Codec Latent Space 🆕NEW
- 赛道归属: 语音水印 / TTS安全与溯源 / 神经音频编解码器
- 核心创新点: 提出TTS-native水印框架,将载荷信息嵌入神经音频编解码器的每一层latent表示中,而不是在波形生成后进行外加扰动;在冻结预训练TTS模型和codec的前提下,仅优化水印模块,使水印在后续DSP攻击和神经codec重采样攻击下更稳健,同时尽量保持语音自然度、可懂度和音质。
- Prompt-Consistency Inference for Zero-Shot Flow-Matching Text-to-Speech Models 🆕NEW
- 赛道归属: 零样本文本转语音 / 流匹配TTS推理优化
- 核心创新点: 提出训练无关的Prompt-Consistency Inference(PCI)推理规则,在每次速度场评估前将prompt对应的状态恢复到其解析形式,而不改变待生成区域;利用prompt轨迹可闭式求解这一性质,减少采样过程中prompt状态漂移带来的条件偏差,从而在不增加额外网络前向的情况下提升说话人相似度和可懂度。
- Articulatory Source-Filter TTS: Physically Grounded Control through Vocal Tract Kinematics
- 赛道归属: 可控文本到语音生成 / 语音合成
- 核心创新点: 提出一种基于发音器官运动学的 source-filter TTS 架构,将声道滤波器与声源显式解耦:通过 Acoustic-to-Articulatory Inversion 生成伪运动轨迹来条件化滤波器响应,并用预测的基频与能量轮廓参数化声门声源;同时引入 Optimal Transport Conditional Flow Matching 对声源进行细化,再与滤波器重组为最终频谱。该方法的关键突破在于把原本黑盒式的 TTS 转化为具备物理可解释控制的生成过程,支持稳定的韵律缩放、跨说话人声源/滤波器重组,以及对发音轨迹的直接操控。
- PLACE: Positional Latent Adaptation via Conditioned Embeddings for Binaural Audio Generation
- 赛道归属: 双耳音频生成 / 多模态条件音频生成
- 核心创新点: 在预训练 any-to-audio 模型 AudioX 上扩展出面向双耳生成的条件适配方法:利用 Perception Encoder Core 特征增强视频条件,引入文本与视频表示对齐以提取空间线索,并通过依赖条件的低秩变换调制生成潜变量。训练时再用解码音频的双耳线索目标(ITD/ILD)进行监督,从而把空间感知信息注入生成过程。其方法重点在于把文本、视频和可选音频提示统一到可控的空间音频生成框架中,提升空间一致性与跨模态控制能力。
- A Comprehensive Objective Evaluation of Modern Text-to-Speech for Turkish Using Speech Quality Assessment Models 🆕NEW
- 赛道归属: 文本转语音评测 / 多指标客观评估 / 低资源语言TTS基准
- 核心创新点: 构建了面向土耳其语TTS的系统性客观评测基准,对多种现代TTS系统在微调与零样本设置下进行统一比较;使用18个互补的客观指标覆盖自然度、可懂度、说话人相似度、分布一致性和低层声学特征,并进一步分析句长影响与长文本分块下的时序一致性漂移,为低资源、形态丰富语言的TTS评估提供了可复现的标准化方案。
- Tracing a Sparse Emotion-Control Circuit in LLM-Based Text-to-Speech 🆕NEW
- 赛道归属: 文本转语音可解释性 / 情感控制机制分析 / 机制可解释研究
- 核心创新点: 通过定义两类情感敏感指标并结合activation patching,定位LLM-based TTS中从参考情感到生成语音情感的稀疏因果电路;发现仅约5%的注意力头和MLP组件即可恢复或抑制大部分情感读出变化,并揭示共享骨干与情感特定组件的组合机制,同时用跨情感激活交换验证该电路对最终语音的音高、能量和频谱亮度具有直接因果影响。
GitHub
- [2026-10-06] huggingface/diffusers ⭐34660
- [2026-10-05] BinWang28/audio-ai-hub ⭐960
- [2026-10-01] apocas/restai ⭐513 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-10-01] espnet/yodas3
- [2026-10-04] cloud0day3/alania-synthetic-speech-tr 🆕NEW
语言大模型
arXiv
- Structure vs. Chain-of-Thought: Evaluating LLM Criteria Extraction for Depression Severity
- 赛道归属: 医疗文本理解 / 心理健康评估 / LLM可解释性与评测
- 核心创新点: 该工作系统比较了两类基于LLM的抑郁严重程度判定范式:直接生成严重度标签的链式思维推理,以及先抽取临床量表条目再由规则映射为标签的“结构化抽取”方案。其方法上的重点在于引入可审计的临床标准(PHQ-9、BDI-II)与不同阈值设定方式,使用加权Kappa评估一致性,并分析是否存在“抽取优于推理”的稳定优势。结果表明,结构化抽取并未在所有设置下稳定优于链式思维,且阈值是否基于标注数据拟合会显著影响结论;同时,较高的整体一致性并不等价于对重症样本的更好识别,揭示了该类任务中“可解释性、校准与重症召回”之间的张力。
- DRIFT: Data Selection for LLM Instruction Tuning via On-Policy Attribution
- 赛道归属: 推理优化 / 数据选择 / 指令微调
- 核心创新点: 提出基于 on-policy attribution 的数据选择方法 DRIFT,用模型自身在验证查询上的采样回答构造验证目标,并按这些回答对原始训练样本的影响力进行排序;同时对影响分数中的梯度范数依赖进行校正。其关键突破在于不再以“节省数据”为目标,而是通过选择同一语料中的高影响样本继续微调,尝试突破全量数据训练的性能上限。
- AutoDP-LLM: Automating Data Pre-processing for Intrusion Detection Systems using Large Language Models 🆕NEW
- 赛道归属: 网络安全 / 入侵检测 / LLM驱动的数据预处理自动化
- 核心创新点: 提出 AutoDP-LLM,将大语言模型用于自动生成、验证并执行入侵检测数据预处理流水线;通过“确定性主机侧规划 + LLM专家代理”协同生成处理策略与可执行代码,并结合语义推理与训练统计证据自适应筛选特征,在不预设特征预算的情况下实现紧凑、可执行的自动化预处理流程。
- Which LLM to pick? Online Active Model Selection for Large Language Models
- 赛道归属: LLM在线模型选择 / 主动学习 / 流式数据评测
- 核心创新点: 提出 ONLINE LLM PICKER,用于在流式查询场景下、在有限标注预算内主动挑选最有信息量的样本进行人工标注,从而识别候选模型中表现最佳或近似最佳的LLM。其方法核心在于将“模型选择”从依赖静态基准分数,转为面向在线数据流的主动标注决策问题,并通过选择最具判别力的提示来降低标注成本,同时支持在未标注样本上进行顺序生成时更早锁定优选模型。
- An Agentic AI Framework with Large Language Models and Chain-of-Thought for UAV-Assisted Logistics Scheduling with Mobile Edge Computing 🆕NEW
- 赛道归属: 物流调度 / 边缘计算 / UAV协同优化 / Agentic AI
- 核心创新点: 构建一个面向UAV辅助物流与MEC联合调度的agentic AI框架,利用LLM、检索增强生成和Chain-of-Thought将用户需求转化为可解释的数学建模;同时设计分层PPO强化学习,上层学习UAV路径规划,下层优化每时隙任务执行与资源分配,以处理路由、能耗、计算与通信资源及截止期约束的耦合优化问题。
- Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning
- 赛道归属: 具身智能 / 神经符号规划 / LLM辅助强化学习
- 核心创新点: 将大语言模型、符号规划与强化学习进行混合式整合:利用LLM的常识推理能力识别环境中的缺失算子,借助符号规划器生成可执行计划,再由LLM为新识别的算子自动撰写奖励函数,指导强化学习代理学习对应控制策略,从而实现对开放世界中新颖对象的适应与操作学习。
- Correct Verdicts, Flawed Reasoning: Structured Auditing of LLM-based Vulnerability Reasoning 🆕NEW
- 赛道归属: 软件安全 / 漏洞分析 / LLM推理审计
- 核心创新点: 提出 VERA,用结构化推理记录(SRR)替代自由文本CoT,让模型以机器可读字段显式输出指针、内存操作和状态转移;再通过多阶段审计器对八类推理失败模式进行确定性检查,并仅在语义歧义处调用LLM,从而实现对漏洞推理过程的自动化、可扩展审计,同时支持大规模自动变异测试评估审计器能力。
- Enhancing Biomedical Named Entity Recognition via Multiple Programming Languages Instruction Tuning and Ensemble Method
- 赛道归属: 生物医学命名实体识别 / 指令微调 / 结构化信息抽取
- 核心创新点: 将BioNER重构为“结构到结构”的生成任务,把指令和实体输出都表示为代码格式,并通过Python、C++、Java等多种编程语言模板构造多样化监督信号,在不依赖外部生物医学知识的情况下增强结构约束与数据多样性;同时在推理阶段采用跨格式实体级投票集成,降低不同语言表示带来的预测方差,提升鲁棒性与跨数据集泛化能力。
- Spatial Strategies, Not Actions: Vector-Quantized Geodesics as Tools for LLM-Driven Agents
- 赛道归属: LLM智能体 / 空间推理 / 工具使用
- 核心创新点: 提出一种将几何轨迹作为工具、由LLM进行高层编排的两层智能体框架:先在网格世界中收集地理路径轨迹,再通过向量量化从中提取代表性轨迹集合;离线阶段让LLM为每条选中的轨迹关联自然语言行为描述,形成可调用工具;在线阶段LLM根据当前状态与目标选择合适工具,底层则由原始动作执行对应轨迹。该方法把工具发现交给无监督轨迹量化,把推理与决策交给LLM,从而在部分可观测动态环境中以更低推理成本实现接近更强链式思维版本的目标达成效果。
- ReCAP: Retrieval-Guided Capability Reuse for Multimodal Continual Instruction Tuning
- 赛道归属: 多模态持续学习 / 指令微调 / 检索增强
- 核心创新点: 提出 ReCAP,通过外部检索与 LLM 构建领域知识、推理知识和格式知识库,并在每个持续阶段为指令检索相关知识,指导能力复用与实例级能力路径生成。进一步引入 adaptive subspace recycling,用共享基与阶段特定核心参数化可复用能力模块,在保留历史重要方向的同时回收剩余容量,以缓解跨阶段遗忘。
GitHub
- [2026-10-06] sgl-project/sglang ⭐36808
- [2026-10-06] NVIDIA/TensorRT-LLM ⭐14765
- [2026-10-06] google-ai-edge/LiteRT-LM ⭐6587
- [2026-10-06] basellm/llm-metadata ⭐146
- [2026-10-06] lvyufeng/PocketLLM ⭐53
HuggingFace Models
- autotrust/JEV-27B-VL 🆕NEW
HuggingFace Datasets
- [2026-09-26] XiaomiMiMo/MiMo-V2.6-RL-oss
- [2026-09-24] MoreThought/Fable-5.1-Max-Reasoning-Filtered-10000x
- [2026-09-20] aidigestorg/ai-village
HuggingFace Spaces
多模态大模型
arXiv
- A Vision-Language Model (VLM)-based Pipeline for End-to-End Procedural Modeling of Field-Grown Maize from Point Clouds
- 赛道归属: 3D生成 / 点云到可编辑3D建模 / 多模态理解
- 核心创新点: 提出一条从原始田间玉米点云到参数化、可编辑三维作物模型的端到端自动化流程:先用视觉语言模型在渲染的正交视图中标注叶片中线,再通过确定性的几何回投、跨视图一致性融合与基于方向加权表面图的中线生长,将2D标注转化为3D叶片结构;随后把测得的器官参数填入基于NURBS的程序化模型生成器,并用可微NURBS拟合对叶片表面进行精修。该方法的关键突破在于不依赖人工调参或物种特定训练数据,把VLM的语义标注与后续几何约束结合,转化为可用于程序化建模的器官级测量。
- Similar Choices, Different Attention: Cross-Modal Associations in Humans and Vision-Language Models
- 赛道归属: 多模态理解 / 跨模态注意力分析
- 核心创新点: 该工作在相同刺激条件下同时比较人类与VLM的选择结果和眼动轨迹,避免了以往“人机使用不同任务或不同刺激”带来的不可比问题;进一步通过人类选择微调、以人类注视训练模型注意力等方式,分别检验“选择对齐”和“注意力对齐”是否足以代表人类一致的跨模态加工,揭示二者并不等价,且模型注意力与人类凝视的匹配甚至不如中心偏置基线。
- LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation 🆕NEW
- 赛道归属: 多模态理解 / 语言能力恢复
- 核心创新点: 提出无需额外适配器的选择性跨模态蒸馏方法,利用微调前冻结的原始语言模型作为教师,在多模态后训练阶段专门监督语言能力恢复。关键技术是层级 KV-cache 共享,使纯文本教师能够感知学生的多模态表示而无需改动模型结构;同时仅在语言占比高的数据上进行蒸馏,避免削弱视觉对齐能力。该方法在不增加参数和推理开销的前提下,缓解了多模态微调导致的语言遗忘。
- SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
- 赛道归属: 多模态理解 / 音视频理解评测
- 核心创新点: 提出SONIC-O1这一面向真实世界音视频理解的系统化评测基准,覆盖60小时、231个片段、13个对话场景,并由人工全量核验;同时联合评估开放式总结、选择题问答与带理由的时间定位三类能力,尤其强调对“时序对齐+推理依据”的考察,并附带人口统计元数据以分析模型在不同群体上的行为差异。
- ReMem: Streaming Video Understanding With Long Context Retention 🆕NEW
- 赛道归属: 视频理解 / 流式视频理解 / 长上下文记忆
- 核心创新点: 提出一种训练无关的流式视频适配方法,通过双记忆机制提升长上下文保留能力。其一是 Streaming Context Memory,使用与查询无关的注意力持续压缩历史上下文;其二是 Retrieved Vision Memory,从记忆中检索与当前查询最相关的视觉上下文补充输入。该方法面向任意长度流式视频,在不依赖额外训练的情况下增强长视频信息保留,并兼顾流式与长视频理解任务表现。
- FlashGaze: Training-Free Multi-Scale Patch Pruning For Efficient Video Understanding 🆕NEW
- 赛道归属: 视频理解 / 高效视频推理 / 视觉token剪枝
- 核心创新点: 提出训练无关的多尺度 patch 剪枝方法,在 ViT 编码之前就减少时空冗余,从源头降低计算开销。方法以像素空间差异作为信息损失的代理,并通过四叉树动态规划联合优化 patch 的丢弃、合并与保留,在固定预算下实现更优的效率-精度权衡。相比在编码后剪枝的方案,该方法更早削减计算成本,且无需辅助网络训练,能够在大幅加速的同时尽量保持视频理解精度。
- VidHarness: Evolving Agent Harnesses for Cost-Efficient Long Video Understanding
- 赛道归属: 长视频理解 / 视频智能体优化
- 核心创新点: 提出 VidHarness,通过“智能体 harness 自动进化”替代人工设计的视频理解流程;利用执行反馈驱动的迭代搜索,并用 MCTS 避免贪心优化陷入局部最优;结合不确定性感知的多保真验证,先用少量问题筛选候选 harness 以降低评估成本;进一步引入 mixture-of-harness,根据不同帧预算路由到专门化 harness,从而在成本可控的前提下提升长视频问答效果。
- When Words Speak Louder than Images: Towards Understanding Language Bias in Vision-Language Models
- 赛道归属: 多模态理解 / 语言偏置诊断
- 核心创新点: 该工作提出一个四阶段推理诊断框架,把VLM中的语言偏置传播过程拆解为若干相互依赖的推理阶段,并分别考察语言先验与跨模态覆盖在各阶段中的演化;其方法论贡献在于不只判断“是否有偏置”,而是追踪偏置如何在推理链路中形成、累积并最终导致错误预测。
- OmniMoE-VL: A Sparse Vision-Language Model with Coupled Visual-Depth Routing
- 赛道归属: 稀疏多模态模型 / 视觉-语言路由
- 核心创新点: 提出OmniMoE-VL,通过耦合的视觉深度路由投影器,为每个图像-提示对动态选择一组稀疏的中间视觉层,并将该全局偏好同时用于局部patch融合与向语言模型的动态视觉注入;创新点在于把“哪些视觉中间表征应暴露给语言侧”变成问题相关的路由决策,并与MoE式专家路由协同,从而实现更灵活的问答式视觉访问。
- Gradient-Guided Decoupled Adaptation for Geospatial Vision-Language Models
- 赛道归属: 地理多模态理解 / 多任务优化
- 核心创新点: 提出Gradient-Guided Decoupled Adaptation(G2DA),利用任务梯度特征对地理VLM的多任务适配进行解耦组织:先按梯度引导将任务划分为视觉中心与语言中心组,再基于梯度相似性构建模态专属课程,并通过双向回放缓解顺序优化带来的遗忘;其关键突破是用梯度结构显式建模任务间冲突,而非简单共享统一多任务训练。
GitHub
- [2026-10-06] Blaizzy/mlx-vlm ⭐5569
- [2026-10-05] jingyi0000/VLM_survey ⭐3126
- [2026-10-06] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1907
- [2026-10-02] kyegomez/ScreenAI ⭐386 🆕NEW
- [2026-10-03] hcompai/holo-desktop-cli ⭐50
强化学习
arXiv
- CORE-RL: Confidence-Oriented Reliability Evaluation of Black-Box Reinforcement Learning Policies 🆕NEW
- 赛道归属: 强化学习安全评估 / 黑盒策略可靠性验证
- 核心创新点: 提出面向黑盒RL策略的统一可靠性评估流程,将早停终止与安全约束违规纳入同一可靠性指标,避免策略通过提前结束回合掩盖失败;同时在感知噪声、执行噪声和环境动力学变化的噪声认证包络下,结合有限样本统计界给出安全性与期望性能的高置信证书,并据此定义安全运行设计域(ODD)用于自动筛除不合规策略。
- MaD-RL: Matching Distributions for Calibrating LLMs with Reinforcement Learning
- 赛道归属: 大语言模型后训练 / 分布匹配式强化学习
- 核心创新点: 提出面向输出分布控制的通用RL框架,将传统只优化单个输出期望奖励的后训练范式扩展为“分布匹配”;通过对潜在类别属性的目标分布建模,设计KL、JS等不同散度对应的奖励函数,并指出已有方法可视为L2散度的特例,从而实现对模型输出多样性、类别比例与约束满足的更精细控制。
- RL Starts before RL: On Policy Distillation for Better Reinforcement Learning
- 赛道归属: 推理优化 / 强化学习训练策略
- 核心创新点: 提出在正式RL之前先进行on-policy distillation(OPD)作为准备阶段,证明其收益不仅体现在初始准确率提升,还能带来更高的最终RL性能;进一步分析了蒸馏目标与轨迹来源对后续RL的影响,发现相较于reverse-KL,forward-KL在“蒸馏后接RL”的设置下更有优势,且student rollouts优于teacher rollouts,说明与教师分布的更深层对齐比单纯top-1一致性更关键。
- RL-ABC: Reinforcement Learning for Accelerator Beamline Control
- 赛道归属: 强化学习系统 / 科学计算控制 / 加速器束线优化
- 核心创新点: 构建了一个将粒子加速器束线配置自动转化为RL环境的开源框架RLABC,核心方法是把束线调参形式化为MDP,并自动完成诊断点插入、57维状态构造、奖励函数配置以及与Elegant仿真器的接口对接;同时引入stage learning以将复杂优化拆解为更易训练的子问题,从而提升训练效率与可用性。
- TrustMed-RL: Long-Horizon Reinforcement Learning for Evidence-Grounded Clinical Diagnosis 🆕NEW
- 赛道归属: 医疗多轮诊断 / 临床推理强化学习
- 核心创新点: 构建面向长时程、证据驱动诊断的多轮RL框架,将问诊、查体、检查、专科会诊与文献检索等状态相关动作纳入统一策略学习;通过临床适配的GiGPO与覆盖率调整后的诊断奖励,强化模型在给出诊断的同时主动获取支持性证据,从而提升诊断准确率与证据扎实度。
- LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches 🆕NEW
- 赛道归属: 大语言模型强化学习训练优化 / 低内存RL
- 核心创新点: 通过低秩梯度草图保留RL训练中的有效学习信号,用紧凑表示同时支持参数更新与策略同步,显著降低训练显存占用;再结合预测式KL步长控制,在更新前估计策略变化并自适应调节步幅,避免过大更新破坏训练稳定性,使原本内存受限的LLM RL后训练变得可行。
- GPlaceRL: An Open-Source Graph Reinforcement Learning Framework for Detailed Placement 🆕NEW
- 赛道归属: 芯片EDA / 版图优化中的强化学习
- 核心创新点: 提出面向详细布线/细化放置的开源图强化学习框架,将合法化后的版图表示为图结构,并提供可模块化配置的图编码器、策略网络、奖励设计与局部动作空间;通过在多基准上系统评估PPO+GAT方案,验证了紧凑图注意力结构与灵活局部动作对放置优化的关键作用。
- The Assistance Dilemma: Learning to Teach via Multi-Turn Reinforcement Learning 🆕NEW
- 赛道归属: 教学型对话模型 / 多轮强化学习
- 核心创新点: 针对“教与答”混淆问题,设计掩码式近迁移后测奖励:学生在未见变体题目上的表现作为回报来源,且屏蔽教师话语对奖励的直接影响,从机制上抑制“直接告诉答案”的投机策略;同时用“事实正确”和“未交出解法”两个二元奖励门控替代连续惩罚,促使模型学习真正提升学生独立解题能力的教学行为。
- Ontology Concept Overlap as a Training Signal: Knowledge-Grounded Reinforcement Learning for Clinical Question Answering 🆕NEW
- 赛道归属: 临床问答 / 知识约束强化学习
- 核心创新点: 将UMLS概念唯一标识重叠构造成软验证器,把临床答案与受控医学词表的概念级重叠作为可分级、外部指定的奖励信号;再与熵归一化的LLM裁判和一致性惩罚组成三项复合奖励,在GRPO中联合优化,从而同时兼顾实体级正确性、证据/安全维度与训练早期样本可评分性。
- VepAgent: Bridging Causal-Transition via Tool-Augmented Reinforcement Learning for Video Event Prediction 🆕NEW
- 赛道归属: 视频事件预测 / 多模态智能体强化学习
- 核心创新点: 提出将因果转移推理与工具增强RL结合的VepAgent,通过构建面向未来事件预测的链式思维SFT数据,显式补足从已观测终态到未来事件之间的因果逻辑;同时引入状态跟踪、帧检索与区域放大等诊断工具,并用联合奖励同时优化预测准确性、因果一致性与可靠先验,迫使模型依赖真实视觉证据而非表面文本相关性。
GitHub
- [2026-10-06] rllm-org/rllm ⭐5860 🆕NEW
- [2026-10-06] radixark/miles ⭐3050
- [2026-10-06] Algorineko/AgenticArXiv-RL ⭐200 🆕NEW
- [2026-10-06] n3428093-rgb/rl-gym-forge ⭐56
- [2026-10-06] raamonp/rl-gym-orchestrator ⭐55
HuggingFace Models
HuggingFace Datasets
- [2026-10-04] ankitjh4/bharat-government-documents
世界动作模型
arXiv
- TAPDreamer: Transferable Adversarial Patches for World Action Models 🆕NEW
- 赛道归属: 世界动作模型安全攻击 / 对抗扰动
- 核心创新点: 提出一种不依赖目标模型输出查询的通用对抗补丁攻击方法,直接利用公开编码器构造固定局部扰动,并通过少量源任务帧优化补丁,使其在不同任务与动作架构间具备可迁移性。其关键突破在于揭示了补丁会通过注意力权重与 value 向量的交互,将表示偏移从局部区域广播到更大范围,且这种偏移在任务间保持稳定;因此攻击目标从“操纵动作/未来预测”转向“破坏共享视觉表征”,从而显著削弱下游动作生成能力。
- RealtimeWAM: One-Step Asynchronous World Action Models 🆕NEW
- 赛道归属: 世界动作模型推理加速 / 低延迟动作生成
- 核心创新点: 提出一种面向世界动作模型的极致高效推理框架,将动作生成压缩为单步,并通过异步执行减少视频专家与动作专家之间的等待开销。方法上包含两项关键设计:一是 Teacher-Anchored Consistency Distillation,用冻结教师的多步 rollout 终点补足仅靠局部一致性训练带来的“局部-全局误差鸿沟”,从而实现准确的一步动作生成;二是 Cross-Expert Wavefront Pipelining,通过块级共享视频 KV cache 并仅在动作注意力真正消费前同步,消除专家级串行等待。整体实现了近乎无损的性能保持与显著端到端加速。
- Future Anchored Verification and Online Recovery for World Action Models 🆕NEW
- 赛道归属: 世界动作模型在线验证 / 执行恢复
- 核心创新点: 提出 FAVOR 框架,将世界动作模型在执行前预测出的未来帧作为“锚点”,同时用于偏差检测与在线恢复,而不是仅在偏离后决定是否停止。其方法核心是:通过 Anchor Verifier 将当前观测与对应锚点及已执行动作联合比对,识别破坏任务进程的偏移;再由 Anchor-Guided Recovery 借助视觉语言模型把被标记的锚点转化为简短纠正指令,促使模型回到原先预测的未来轨迹后继续执行。该工作把“监测”扩展为“验证 + 恢复”的闭环机制,且无需修改原策略。
- WAMJET: A Harness for World Action Model Acceleration 🆕NEW
- 赛道归属: 世界动作模型推理加速 / 系统优化
- 核心创新点: 提出 WAMJET 这一面向世界动作模型加速的 agentic harness,通过为编码代理提供可复用的优化指导、测量与验证工具,自动化完成加速方案的选择、组合与迭代优化。其方法论重点在于采用“瓶颈驱动”的工作流:先剖析推理瓶颈,再定向修改代码,随后验证收益并根据瓶颈迁移继续优化,从而减少人工工程成本并保持动作质量。该框架可跨模型与硬件平台生成有效的加速栈,实现无损或近无损的显著提速。
- XGenAct: Geometry-Enhanced World Action Models through Cross-Task Generation
- 赛道归属: 机器人控制 / 世界动作模型 / 3D感知增强
- 核心创新点: 将RGB观测、机器人动作、度量深度、表面法线和功能角色分割统一编码为RGB视频表示,通过确定性codec把多种感知与动作任务纳入同一个视频扩散Transformer中联合学习;训练时通过采样不同感知与动作任务,用单一模型和单一目标学习跨空间的时序预测,避免了为不同模态设计专门头部或分支的碎片化架构。
- Native Action-Prior Learning from Videos for World Action Models
- 赛道归属: 机器人控制 / 世界动作模型 / 观察视频预训练
- 核心创新点: 提出从仅含观察的视频中直接预训练动作策略的“native action-prior learning”,不再依赖先学表征再迁移到控制,也不需要单独的潜变量动作模型;方法上先用未来视频流匹配监督,通过带有转移结构的联合注意力把视觉转移信息传递到Action-DiT中学习动作先验,再用带动作标注的示范进行联合视频-动作流匹配后训练,并通过非对称注意力将视觉分支与动作去噪解耦以支持高效动作推理。
- PointWAM: 3D World Action Modeling for Dexterous Robotic Manipulation
- 赛道归属: 机器人控制 / 世界动作模型 / 3D点云动作建模
- 核心创新点: 将世界表示从RGB提升到3D点轨迹,把场景与手部分解为两个实体,并在共享的时空坐标系中联合预测二者的3D演化;这种显式、解耦的3D表示使模型能够直接利用大规模人类演示视频进行预训练,无需任务特定的物体或关键点选择,随后再将预测到的手部运动重定向为机器人动作,从而更好建模灵巧操作中的空间结构与接触几何。
- World Action Modeling with Progressive Visual Planning
- 赛道归属: 机器人控制 / 世界动作模型 / 分层视觉规划
- 核心创新点: 用“进度式”视觉子目标序列替代密集视频回放,将动作生成与有序的稀疏视觉子目标联合预测,使模型在执行过程中获得显式视觉引导;同时利用可从大规模无动作视频中学习子目标预测的设计,把复杂视觉规划从动作策略中分离出去,并通过一次视频骨干前向缓存稀疏子目标特征,避免迭代式全视频生成,只保留轻量级动作去噪用于重规划。
- Completion Aware Guidance for World Action Models
- 赛道归属: 世界动作模型 / 机器人控制 / 生成式规划
- 核心创新点: 提出无需训练的 Completion Aware Guidance(CAG)采样方法,在生成阶段引导世界动作模型更偏向“任务完成”而非仅仅局部合理的短期延续,从而缓解任务不完整想象问题;其关键突破在于指出该问题主要来自短 chunk 控制下的采样偏置,并通过推理时引导直接改善视觉未来与动作预测的任务完成性。
- CtrlWAM: Controllable World Action Models with Aligned Intent and Foresight
- 赛道归属: 世界动作模型 / 可控生成 / 多智能体动作-视频联合建模
- 核心创新点: 提出 CtrlWAM,通过在模拟器中执行扰动后的动作并配对其对应的噪声视觉结果,解决传统“动作加噪与视频加噪”训练中动作反事实与视频仍绑定真实轨迹的错配问题;同时设计 warped video-action noise schedules,使视频与动作在不同去噪需求下保持协调,并将动作接口从单一自我控制扩展到可变数量的多智能体流,从而统一支持预测未来与接收外部指令的多主体控制。
GitHub
- [2026-10-01] OpenWAM-Official/OpenWAM ⭐952
- [2026-10-02] OpenMOSS/EasyWAM ⭐396
- [2026-10-02] black-forest-labs/flux-action ⭐133
- [2026-10-05] LeapLabTHU/Simple-WAM ⭐72
- [2026-10-06] youngzhou1999/DriveDreamer-Policy ⭐60 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-10-06 13:30:41