AI 每日进展速报 - 2026-09-29
新旧
正在统计...
来源
当前筛选条件下没有条目。
数据状态 / Data Status
- GitHub 数据源本次没有返回条目;可能是暂无匹配结果,也可能是接口异常,请结合日志确认。
图像生成/编辑
arXiv
- Amplify What You Gaze At: Target Saliency Boosting in Text-to-Image Generation
- 赛道归属: 文生图 / 可控生成
- 核心创新点: 提出“目标显著性增强”这一新任务,关注在不依赖任何视觉先验的前提下,提升文本生成图像中指定对象的视觉注意力占比。方法上强调显著性是相对属性,通过联合建模目标对象与全局场景的注意力分配关系,实现对目标对象“更醒目”的生成控制,而不仅仅是位置、属性或数量的控制。
- InGuard: Towards Generalized Inner Guardrail for Safe Text-to-Image Generation
- 赛道归属: 文生图安全对齐 / 安全生成
- 核心创新点: 提出“内置式”安全护栏思路,将安全约束从传统的生成前/生成后外部分类器,转移到扩散模型内部表示与生成过程之中;通过利用模型自身的中间表征进行风险识别与抑制,增强对 NSFW 等风险内容的泛化拦截能力,减少外部护栏与生成模型脱节带来的漏检问题。
- Beyond Emotion Prompts: Fine-Grained Text-to-Image Generation Driven by Valence-Arousal-Dominance
- 赛道归属: 文生图 / 情感可控图像生成
- 核心创新点: 提出EMOTRANS框架,将心理学中经过验证的VAD(效价-唤醒度-支配度)三维情感坐标系转化为独立于内容描述的生成条件。核心突破在于将情感控制从模糊的自然语言提示中解耦出来,赋予情感维度可量化、可排序的连续控制尺度,使创作者无需修改内容描述即可精细调控图像所传递的情感强度与类型,解决了自然语言情感提示语义不稳定、缺乏细粒度控制的根本缺陷。
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- 赛道归属: 文生图加速 / 少步采样 / CFG 蒸馏
- 核心创新点: 面向少步文生图推理中的 CFG 蒸馏问题,引入信息瓶颈约束来指导蒸馏过程,使模型不再采用全局静态、粗粒度的 guidance 注入方式,而是学习更具选择性的条件信息传递机制;该方法旨在在显著减少采样步数的同时,尽量保留 CFG 轨迹中的关键语义与视觉质量,从而提升少步生成的效率与稳定性。
- OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation
- 赛道归属: 文生图 / 偏好优化
- 核心创新点: 提出面向对象级细粒度对齐的自我改进偏好优化框架,针对颜色、形状、空间关系等属性错误进行优化。其关键突破在于以对象为中心构建偏好信号,并通过自举式的自我改进机制降低传统DPO/GRPO在偏好构造与训练上的高成本,使模型能够更高效地提升文本-图像的局部语义一致性与属性遵循能力。
- AdaPilot: Towards Scene-Adaptive Policy Learning for Cross-Generator Text-to-Image Quality Optimization
- 赛道归属: 文生图质量优化 / 跨生成器图像生成控制
- 核心创新点: 提出面向不同场景自适应的质量优化策略学习框架 AdaPilot,将“图像质量提升”从依赖单一生成器的局部优化,推进到可跨生成器迁移的通用策略学习。其关键突破在于不再仅针对某个特定模型做微调或提示词搜索,而是通过学习场景感知的决策策略,在多轮视觉反馈下动态调整优化动作,从而实现对不同文本到图像生成器的泛化适配与质量提升能力迁移。
- HyperErase: Scale-Calibrated Hypernetwork for Multi-Concept Erasure in Text-to-Image Models
- 赛道归属: 文生图 / 概念擦除 / 安全对齐
- 核心创新点: 提出尺度校准的超网络框架,用于多概念擦除场景下的动态参数生成与适配。相较于静态冻结式adapter,该方法通过超网络按不同概念与提示分布生成可调权重,缓解多概念叠加时的参数干扰与泛化不足问题,从而提升概念擦除在多样提示和多目标安全约束下的稳定性与可扩展性。
- IMPLICIT-Bench: Measuring Implicit Bias in Text-to-Image Models under Neutral Prompts
- 赛道归属: 文生图 / 模型偏见评测
- 核心创新点: 提出IMPLICIT-Bench基准,专门针对"中性提示下的隐式偏见"这一此前被忽视的评测盲区。与现有基准依赖显式槽位模板(如"[职业]的照片")不同,该工作聚焦于当人口统计属性未被明确指定时模型仍会输出刻板印象的隐式偏见现象,构建了基于自然提示的系统性评测体系,从方法论上填补了T2I模型偏见评估从"显式属性探测"向"隐式语境偏见测量"的跨越。
- PixelART: Image-to-Layer Decomposition without Latents or Text-to-Image Pretraining
- 赛道归属: 图像编辑 / 图层分解
- 核心创新点: 提出PixelART,彻底摒弃了现有图层分解方法对大型预训练文生图模型、RGBA自编码器及可变层数架构模块的依赖,转而在像素空间中从零训练一个基于整流流(Rectified Flow)的Transformer模型。核心突破在于证明图像到可编辑RGBA图层的分解任务本身并不需要依托潜空间扩散模型或文生图预训练的重量级组件,以更轻量、更纯粹的架构实现了同等乃至更优的元素级图层分解能力,重新审视并简化了该任务的设计范式。
- Paint-Anything: Unified Any-Color Control for Image Generation and Editing
- 赛道归属: 图像生成 / 图像编辑 / 颜色可控生成
- 核心创新点: 提出 Paint-Anything 框架,实现对任意24位十六进制颜色值的精确可控生成与编辑。核心创新在于利用大语言模型天然具备的十六进制颜色语义理解能力,设计了一个统一的共享表示空间,将颜色控制信号直接以 hex 值形式注入生成/编辑流程,无需依赖专用颜色表示(如调色板、色块参考图)或特殊推理流程。该方法将颜色控制的精度从粗粒度语义描述提升至精确的24位色彩空间,同时统一了生成与编辑两个任务的控制接口。
HuggingFace Models
HuggingFace Spaces
视频生成/编辑
arXiv
- WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
- 赛道归属: 文生视频提示词优化 / 视频生成前端规划
- 核心创新点: 提出面向“导演级”视频创作的提示词增强模型,将文本提示从简单描述提升为可执行的电影化分镜计划;通过在大规模真实视频数据上训练,学习对动作编排、镜头运动、光照变化、场景切换与声音节奏等要素进行结构化重写与补全,从而显著增强复杂长视频生成中的条件表达能力与生成可控性。
- CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation
- 赛道归属: 视频生成(物理一致性文生视频)
- 核心创新点: 提出CompAdapt框架,针对现有文生视频模型无法正确建模物理动力学的问题,设计了一种可自适应的复合运动建模机制。核心突破在于:能够同时处理多种类型的复合运动(而非单一运动类型),无需人工指定物理参数,并具备对未见物理规律的泛化能力。通过将显式物理动力学先验与扩散模型生成过程有机结合,实现了更具物理一致性的视频生成。
- TempQ-Jail: Query-Constrained Candidate Ranking for Text-to-Video Jailbreak Attacks
- 赛道归属: 视频安全攻防 / 文生视频越狱攻击
- 核心创新点: 将文本到视频(T2V)越狱从“寻找更强攻击样本”重构为“在查询预算受限条件下的候选分配与排序”问题,针对受限评测场景设计了 TempQ-Jail。方法上通过融合多种异构攻击机制扩大候选覆盖面,再对每个候选的端到端攻击效果进行估计与排序,从而在无法大规模试错的情况下优先选择高收益候选,提高有限查询下的攻击效率与命中率。
- MotionSpec: Spectral Trajectory Supervision for Motion-Consistent Video Generation
- 赛道归属: 视频生成 / 文生视频 / 运动一致性建模
- 核心创新点: 提出基于运动轨迹频谱监督的训练思路,将视频中的时序运动从像素级外观约束提升到更具结构性的轨迹表示上进行优化。该方法通过对运动轨迹的频域特征施加监督,显式约束动作演化的连续性、平滑性与一致性,从而缓解传统生成目标对“单帧真实、跨帧不稳”问题监督不足的缺陷。其关键价值在于把复杂运动的时序一致性问题转化为可学习的谱域约束,增强长时运动生成的物理合理性与结构稳定性。
- Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding
- 赛道归属: 视频生成(身份保持/人物一致性)
- 核心创新点: 提出基于"槽(Slot)"的时序身份编码机制,突破了现有方法仅依赖单张参考图像的局限。核心创新在于从参考视频片段中提取多帧、多视角的身份特征,通过槽注意力机制将动态变化的身份线索(表情、姿态、光照)聚合为结构化的时序身份表示,从而有效解决了单帧参考导致的人脸变形、姿态锁定和身份漂移问题,实现了在大幅视角/表情变化下的鲁棒身份保持视频生成。
- TrafficImag: A Benchmark for Counterfactual Roadside Traffic Video Generation
- 赛道归属: 视频生成 / 反事实视频生成 / 自动驾驶交通场景基准
- 核心创新点: 提出首个面向路侧交通场景反事实视频生成的基准 TrafficImag,专门评测“修改指定交通参与者后,未来视频是否仍保持道路拓扑与无关交通流一致性”的生成能力。该工作不仅构建了大规模路侧数据资源,还围绕反事实编辑这一更细粒度、更具因果约束的任务设计评测体系,使模型能力从传统的感知、预测扩展到受约束的未来视频合成与一致性保持。
- MVAgent: Multi-Agent Video Generation via Consistent Condition Construction and Shot-Level Policy Optimization
- 赛道归属: 视频生成 / 多智能体协同生成 / 分镜级视频合成
- 核心创新点: 针对多镜头、多角色视频生成中“角色外观一致、跨镜头空间布局稳定、角色状态连续”难以同时满足的问题,提出 MVAgent,将任务重构为“条件构造”而非直接依赖重复文本提示。方法上采用多智能体流水线,通过类型化条件输入协同生成各镜头所需约束,并结合环境图像提供视角相关信息;同时引入镜头级策略优化,在分镜粒度上学习如何构造更有效的条件,从而提升跨镜头一致性与长程叙事连贯性。
- AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation
- 赛道归属: 音视频联合生成 / 多模态强化学习后训练
- 核心创新点: 提出模态锚定的解耦扩散强化学习框架,将音频与视频两条生成塔的优化过程分离,并通过模态锚点缓解多模态奖励耦合带来的信用分配困难;该方法针对文本对齐、单模态保真度与跨模态同步三个目标进行联合后训练,在强化学习阶段实现更稳定的多目标优化,提升音视频生成的一致性与协调性。
- SALI: Shot-Aware Late Interaction for Cross-Shot Relation Matching in Text-to-Video Retrieval using Film-Grammar Knowledge
- 赛道归属: 文本到视频检索 / 跨镜头关系匹配
- 核心创新点: 引入基于电影语法知识的 shot-aware late interaction 机制,突破传统“单一视频向量”表示对跨镜头人物关系建模不足的问题;方法先从查询中显式抽取主体与客体,再在镜头级别进行细粒度交互匹配,以保留诸如正反打、对话对切等跨镜头关系信息,从而更准确地识别文本中描述的人物交互与叙事关系。
- The Past Frames the Future: Memory for Autoregressive Video Generation
- 赛道归属: 视频生成 / 自回归视频生成 / 长时序记忆建模
- 核心创新点: 针对自回归视频生成在长序列扩展中面临的上下文窗口受限、历史信息衰减和身份/状态漂移问题,引入记忆机制来保留并检索关键过去帧信息。该工作强调将“过去”作为显式可访问的外部记忆,用于补足仅依赖有限上下文进行滚动预测时的历史缺失,从而提升长程生成中的实体一致性、场景连续性和状态演化稳定性。其方法论突破在于把视频生成从纯粹的局部因果预测,推进到带有长期记忆检索与状态保持能力的序列建模框架。
音频生成
arXiv
- Interactive TTS: Dynamic Speaking Style Adaptation for Expressive Speech Synthesis
- 赛道归属: 文本转语音(TTS)/ 对话式语音合成 / 风格自适应
- 核心创新点: 针对多轮多模态交互中说话风格动态适应问题,提出 InteractiveTTS 框架。核心突破在于将隐式端到端的上下文风格建模拆解为显式的两阶段流程:先从对话上下文中显式预测风格标签(解耦风格决策与声学生成),再以此为条件驱动语音合成。这一设计使风格决策可监督、可解释,同时通过解耦音色、内容与风格三者的表示,有效缓解了多轮合成中的音色漂移(timbre drift)问题,并增强了指令跟随能力。
- TinyAudio: Compact and Efficient Text-to-Audio Generation for Low-Resource Deployment
- 赛道归属: 文生音频(Text-to-Audio)生成 / 轻量化端侧部署
- 核心创新点: 提出面向低资源部署的紧凑型文本到音频生成框架 TinyAudio,采用基于 flow-matching 的单流 Transformer(TA-DiT)作为主干,在保持生成能力的同时显著压缩参数规模;同时配套设计音频对齐文本编码器 TA-CLAP 与音频 VAE(TA-VAE),形成从文本语义对齐、潜空间建模到音频重建的轻量化闭环。该工作的关键突破在于将高质量 TTA 生成从大参数模型范式推进到可端侧落地的高效架构,并通过模块化设计兼顾生成质量与计算/存储效率。
- ReaFlow-TTS: Realization-Conditioned Flow Matching for High-Quality and Controllable Speech Synthesis
- 赛道归属: 文本到语音生成(TTS)/ 可控语音合成
- 核心创新点: 提出 realization-conditioned flow matching 框架,将“同一文本条件下不同语音实现”显式纳入建模,而不是只学习其条件均值速度场;通过对实现差异进行条件化,缓解确定性流匹配对多样性与可控性的折中问题,并为语音属性操控提供更具语义可解释性的接口,从而提升合成质量与可控性。
- UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation
- 赛道归属: 文生音频生成 / 音频表示学习与生成联合建模
- 核心创新点: 提出联合学习连续音频分词器与潜空间流匹配生成模型的框架,打破传统“先重建、后冻结”的两阶段范式。该方法不再将tokenizer仅作为重建工具,而是让表示学习与生成目标协同优化,使潜空间更适配文本到音频生成任务,从而提升生成质量与表示效率。
- TTS-Guard: Black-Box Ownership Verification of Text-to-Speech Models via Adaptive Adversarial Speaker-Pair Fingerprints
- 赛道归属: 文本转语音(TTS)模型安全与版权保护
- 核心创新点: 提出了一种针对TTS模型的黑盒所有权验证框架TTS-Guard。核心创新在于设计了"自适应对抗说话人对指纹"机制:通过构造一对对抗性说话人样本作为模型指纹,使得目标模型在该说话人对上的输出行为呈现出可统计验证的特异性差异,而无需访问模型内部参数。该方法专门针对语音信号的连续波形特性和人类听觉感知约束进行设计,能够在常规信号处理(如压缩、重采样)破坏扰动后仍保持指纹的鲁棒性,填补了TTS模型知识产权保护领域的空白。
- COT-TTS: Audio Context-Aware Text-to-Speech with Chain-of-Thought Reasoning
- 赛道归属: 文本转语音(TTS)/ 上下文感知语音合成
- 核心创新点: 提出COT-TTS框架,将链式思维(Chain-of-Thought)推理机制引入TTS任务。核心创新在于:系统不依赖用户显式指定的风格指令,而是以历史对话音频作为上下文输入,通过CoT推理过程自动推断目标文本应采用的说话风格(语气、情感、节奏等),再驱动语音合成。这一范式将TTS从"指令驱动"升级为"上下文推理驱动",使合成语音的风格能够自然地与对话语境保持一致,更贴近真实人类对话场景。
- Harmonizing Spectral Evolution in Conditional Flow Matching for TTS 🆕NEW
- 赛道归属: 文本到语音生成(TTS)/ 频谱生成稳定性优化
- 核心创新点: 提出一种无需训练的频率选择性增强策略,用离散小波变换(DWT)显式分析并调节推理过程中的频谱演化,缓解条件流匹配(CFM)在生成时出现的频率不协调问题。该方法针对 TTS 中声学动态“非协调”这一特性设计,而非直接套用扩散模型中的通用频谱修正方案,因此更适配 CFM 的生成机制,并能在不改动模型参数的前提下提升语音频谱一致性与生成质量。
- Controlling Speaking Rate in Autoregressive TTS via Activation Steering 🆕NEW
- 赛道归属: 文本到语音生成(TTS)/ 语速可控生成
- 核心创新点: 通过激活引导(activation steering)实现自回归 TTS 的推理时语速控制,无需重新训练模型。方法从解码器内部分析中恢复出一个“速度方向”轴,并识别中性点与强度尺度,在推理阶段直接将某层激活在该方向上的投影钳制到指定值,从而连续、稳定地调节 speaking rate。该工作将可控生成从外部条件注入推进到模型内部表征操控,具有较强的通用性和低成本部署优势。
- DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTS 🆕NEW
- 赛道归属: 文本到语音生成(TTS)/ 零样本语音克隆与口音控制
- 核心创新点: 提出 DEFINE 框架,将说话人身份与口音信息解耦,并分别由不同的音频示例进行条件控制,从而解决零样本 TTS 中“身份-口音纠缠”的问题。该方法在推理阶段引入单一指导权重即可连续调节口音强度,无需额外训练即可实现可控迁移;同时结合 F5-TTS 与参数高效的 LoRA 适配,使模型能够在保持说话人相似度的同时更精准地控制目标口音,提升了零样本场景下的可控性与可解释性。
- NVAlign: Direct-Gradient Optimization for Non-Verbal Control in Continuous Autoregressive Flow Matching Text-to-Speech 🆕NEW
- 赛道归属: 文本到语音生成(TTS)/ 非语言发声控制与后训练对齐
- 核心创新点: 提出 NVAlign,用直接梯度优化的后训练框架增强连续自回归 flow-matching TTS 对非语言发声标签(如停顿、笑声、呼吸等)的遵循能力。该方法先通过监督微调建立基础能力,再利用直接梯度信号对模型进行针对性对齐,专门优化 NVV tag-following 的可控性,而不是仅依赖数据拟合或提示工程。其创新点在于把非语言控制从“生成副产物”提升为可显式优化的目标,适合解决 TTS 中细粒度韵律与非语言事件的准确插入问题。
HuggingFace Models
HuggingFace Datasets
- [2026-09-28] espnet/yodas3 🆕NEW
语言大模型
arXiv
- When Context Misleads: In-context Learning with Jurisdiction in Large Language Models
- 赛道归属: 大模型推理与上下文学习鲁棒性评估
- 核心创新点: 该工作聚焦于 In-Context Learning 中“上下文权威性(context authority)”这一被忽视的能力,即模型不仅要从示例中归纳模式,还要判断上下文信息是否应当主导最终答案。论文提出 FakeContextBench,通过跨七个领域的伪科学陈述构建评测集,系统检验模型在“上下文是否可信、是否应被采纳”上的判断能力,从而揭示现有 ICL 后训练方法在面对误导性上下文时的脆弱性,并补足了传统只看模式提取而忽略上下文裁决的评测空白。
- Representation-guided in-context learning for medical image interpretation with multimodal large language models
- 赛道归属: 多模态大模型 / 医学图像理解
- 核心创新点: 提出表示引导的上下文学习(RG-ICL)框架,核心突破在于无需任何任务特定微调即可适配医学图像解读任务。通过冻结的视觉编码器检索与查询图像语义对齐的示例作为上下文演示,将检索增强与上下文学习结合,绕过了传统领域适配中资源密集型参数更新的瓶颈。在组织病理学、放射影像和视网膜眼底镜等八个跨模态医学数据集上验证了其泛化能力。
- Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning
- 赛道归属: 具身智能 / 神经符号规划 / 强化学习
- 核心创新点: 提出一种将符号规划、强化学习与大语言模型结合的混合式架构,用于处理开放世界中的“新颖性”障碍;当传统规划器因缺少新对象相关算子而无法生成计划时,系统通过LLM辅助识别新对象与任务语义,再结合RL学习补足可执行操作策略,从而实现对未知环境变化的自适应规划与行动。
- From Concept Alignment to Causal Grounding: An Intervention Test of Chain-of-Thought Faithfulness
- 赛道归属: 大语言模型推理 / 思维链可解释性
- 核心创新点: 将思维链(CoT)的忠实性问题重新定义为内部概念因果锚定问题,而非传统的输入-输出行为分析。通过干预测试(intervention test)检验LLM的CoT推理是否激活了与直接预测相同的内部概念表征,并进一步验证这些共享概念是否对最终答案具有因果驱动作用。这一框架从模型内部计算层面揭示了CoT是否真正参与推理,而非仅作表面文字对齐。
- Frontier Learning: Training LLM Reasoners at the Edge of Capability 🆕NEW
- 赛道归属: 推理优化 / 强化学习后训练
- 核心创新点: 提出“前沿学习”式的动态训练范式,针对传统基于固定题库的RL后训练中“有效样本迅速过时”的问题,不再依赖静态问题池,而是持续挖掘当前策略边界上的新训练信号;其关键突破在于把训练重点转移到模型能力边缘的高信息量样本上,使学习过程能够随着模型提升而自适应更新,从而缓解固定数据分布带来的信号衰减与训练停滞。
- Measuring Collapse and Correction in Homogeneous-Panel LLM Debate 🆕NEW
- 赛道归属: 多智能体推理 / LLM辩论评测
- 核心创新点: 提出一种可审计的同质多轮辩论分析协议,不再只看最终答案准确率,而是将每次辩论显式记录为“崩塌、纠正、起始状态、带符号影响”等转移过程;其方法论突破在于把辩论中的“答案变化”拆解为可区分的正负机制,从而能够识别辩论究竟是在修正错误还是破坏正确答案,避免传统评测对改善与恶化的混淆。
- Echoes of Deeds: Moral History Can Shape and Steer LLM Behavioral Choices 🆕NEW
- 赛道归属: 价值对齐 / LLM行为评测
- 核心创新点: 研究LLM的“道德历史效应”,即模型先前无关行为是否会影响后续道德决策;其创新点在于将决策评估从单次孤立判断扩展为带历史条件的行为轨迹分析,系统检验过去行为对后续选择的偏置与引导作用,从而揭示LLM在道德判断上可能存在类似人类的历史依赖性与行为惯性。
- VEX-Bench: Benchmarking Verification Complexity of LLM-Generated Misinformation 🆕NEW
- 赛道归属: 事实核查 / 生成式虚假信息评测
- 核心创新点: 构建VEX-Bench统一基准,用于衡量LLM生成虚假信息在“筛查阶段”的验证复杂度,而不仅是内容是否虚假;其方法上的突破在于把评测目标从“检测准确率”转向“验证成本与优先级决策难度”,在时间、人工和预算受限的现实约束下,量化不同模型与生成方式所产生信息的核查负担,为事实核查资源分配提供更贴近实务的评估标准。
- SeLMRoute: Probabilistic Semantic Evidence for Large Language Model Routing 🆕NEW
- 赛道归属: LLM路由 / 模型选择
- 核心创新点: 提出SeLMRoute路由框架,将“候选无关的语义证据提取”与“路由决策学习”解耦;其核心突破在于不再直接依赖查询向量或相似样本做黑箱匹配,而是先抽取能够明确表达查询需求的概率化语义证据,再据此进行模型选择,从而提升路由决策的可解释性与任务适配性,减少仅凭表征相似度带来的误路由。
- How to Tame a Multi-Headed Hydra? Adaptive Multi-Category Safety Steering for Large Language Models 🆕NEW
- 赛道归属: LLM安全对齐 / 激活引导
- 核心创新点: 提出面向多类别风险的自适应安全steering方法,针对单一安全方向难以覆盖复合有害提示的问题,在推理阶段动态调整内部激活以同时抑制多个伤害类别;其方法论突破在于从“单标签、静态”安全控制升级为“多类别、可自适应”的内部表征干预机制,避免只对某一类风险有效而对其他风险失效的局限。
HuggingFace Datasets
- [2026-09-26] XiaomiMiMo/MiMo-V2.6-RL-oss
- [2026-09-24] MoreThought/Fable-5.1-Max-Reasoning-Filtered-10000x
- [2026-09-06] openbmb/UltraData-SFT-Agent-2609
多模态大模型
arXiv
- PRISM-VLM: A Multi-Axis Discriminative Benchmark for Compact Vision-Language Models
- 赛道归属: 多模态理解 / 视觉语言模型评测基准
- 核心创新点: 提出一个面向紧凑型视觉语言模型的多轴判别式评测基准 PRISM-VLM,突破了传统“单一准确率”式评测范式。该工作将样本从多个维度进行细粒度打分,覆盖模型常见失效模式,从而能够更全面地区分不同模型在任务质量、鲁棒性、行为偏差等方面的差异,提升了对小型 VLM 能力边界与短板的诊断能力。
- SalQ-VLM: Fine-Grained Saliency-Guided Quantization for Vision-Language Models
- 赛道归属: 多模态理解 / 推理优化(视觉语言模型量化压缩)
- 核心创新点: 针对视觉语言模型(VLM)的后训练量化(PTQ)问题,提出了细粒度显著性引导量化方法 SalQ-VLM。核心突破在于识别并解决了VLM激活中两类固有挑战:一是视觉与语言模态间的激活分布异质性,二是跨层的激活尖峰问题。通过引入显著性感知的细粒度量化策略,对不同模态和不同重要性的激活区域施加差异化的量化精度,在保持模型性能的同时大幅降低内存占用和推理开销,填补了PTQ在VLM领域研究不足的空白。
- Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
- 赛道归属: 多模态理解 / 情感推理 / 可解释性分析
- 核心创新点: 提出基于跨模态信息流的因果归因框架,用 steering vector 对 LVLM 内部情感表征进行干预与追踪,分析视觉刺激如何逐步转化为情绪叙事;通过构建情感电路的可解释路径,定位模型中负责情绪理解的关键跨模态通路,并进一步验证和增强这些电路,从机制层面提升情感理解能力
- From Knowing to Abstaining: Bridging the Representation-Action Gap in Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 视觉语言模型鲁棒性与拒答
- 核心创新点: 该工作聚焦视觉语言模型在“可回答/不可回答”场景中的拒答能力,核心是弥合“表征能力”与“行动决策”之间的鸿沟。论文指出现有评测与训练数据存在捷径线索和显式“不可回答”选项,导致模型难以真实反映自发拒答能力,因此提出更贴近真实使用场景的评估与学习范式,强调模型不仅要会回答,更要在缺乏可靠依据时主动 abstain。方法上的突破在于将拒答从简单分类问题提升为与多模态推理、置信判断和决策策略紧密耦合的能力建模,从而提升模型在开放世界场景中的安全性与可靠性。
- From Reward Signal to Visual Utility: A Controlled Audit of Medical VLM Post-Training
- 赛道归属: 医疗多模态理解 / VLM后训练评估
- 核心创新点: 该工作不是单纯追求答案准确率,而是通过受控审计系统性分析医疗VLM后训练目标与“图像条件化决策”之间的关系。作者对比了仅语言侧LoRA、扩展到多模态模块的适配、标准仅答案监督的GRPO,以及引入反事实证据目标等多种后训练策略,重点考察模型是否真正利用了视觉证据而非依赖语言先验。其方法价值在于把“性能提升”与“视觉可用性”解耦评估,揭示不同训练目标对模型证据使用能力的真实影响,为医疗VLM后训练提供了更可靠的诊断框架。
- FLIP: Final Layer Inference-Time Probing for Vision-Language Models
- 赛道归属: 多模态理解 / 视觉语言模型可解释性与推理探测
- 核心创新点: 该工作提出FLIP,通过在推理阶段对VLM最终层归一化隐藏状态施加元素级截断/钳制,来测试某个logit-facing干预点是否承载结构化、任务相关的计算,而不仅仅是引起泛化扰动。其关键创新在于把“内部干预导致行为变化”这一现象拆解为可区分的机制假设:是否更好利用视觉证据、是否只是输出不稳定、或是否直接退化。FLIP将探测位置固定在最终层,并以推理时轻量干预的方式实现机制审计,适合用于分析开源VLM的决策表征与任务依赖性。
- FRESHLATENT: Channel-Aware Latent Adaptation for Resource-Constrained Embodied VLM Perception
- 赛道归属: 具身多模态感知 / 分裂式VLM部署与通信鲁棒性
- 核心创新点: FreshLatent面向资源受限的UAV具身场景,针对分裂式VLM在“端侧编码—无线传输—云/边端解码”链路中因信道腐化导致的部署失配问题,提出了一个轻量级的信道感知潜变量适配器。其核心方法是训练一个功率归一化的编码器-解码器,使中间特征在无线扰动下仍保持可恢复性,同时兼顾机载算力与通信开销约束。创新点在于把通信信道条件显式纳入VLM感知表征学习过程,而不是仅依赖离线干净特征,从而提升真实部署中的鲁棒性与可用性。
- ProCAP: Probabilistic Cross-Attentive Prompt Learning for Vision-Language Models
- 赛道归属: 少样本视觉语言学习 / 提示学习
- 核心创新点: ProCAP提出概率化的交叉注意力提示学习框架,用于增强冻结式VLM在少样本和分布偏移场景下的适应能力。与传统仅在单模态分支上做轻量prompt调参的方法不同,ProCAP通过概率建模与跨模态交互机制,强化视觉与文本分支之间的耦合,使提示参数不仅编码类别信息,还能更稳健地吸收跨模态对齐信号。其方法突破主要体现在:在参数高效前提下提升跨模态协同建模能力,从而缓解低样本条件下提示学习易脆弱、泛化不足的问题。
- The Alignment Illusion in Multimodal Large Language Models
- 赛道归属: 多模态大模型 / 对齐机制分析 / 表征可解释性
- 核心创新点: 通过对视觉流进行受控替换实验,系统检验 MLLM 中“层间视觉-文本相似度”是否真的代表跨模态内容融合;结果表明许多常用对齐指标可能只反映表面统计相关而非语义交互,揭示了“对齐幻觉”现象,从方法上纠正了对多模态表征对齐的传统解释框架
- Seeing Is Not Measuring: Tool-Augmented Metric Spatial Reasoning for Vision-Language Models
- 赛道归属: 多模态理解 / 空间推理 / 工具增强推理
- 核心创新点: 构建一个与底层预测器解耦的模块化工具增强框架,将 3D 目标检测、度量深度估计和确定性几何求解器引入 VLM,用于处理绝对距离、物体尺寸和方位等度量级空间问题;通过在对象最佳视角下进行检测并结合相机位姿进行几何计算,显著弥补了纯 VLM 在 3D 结构推理上的短板,实现从“描述场景”到“精确测量场景”的能力升级
强化学习
arXiv
- RL Starts before RL: On Policy Distillation for Better Reinforcement Learning
- 赛道归属: 大语言模型推理优化 / 强化学习训练策略
- 核心创新点: 提出“先蒸馏、后强化学习”的预训练式初始化思路,将 on-policy distillation 作为 RL 前的准备阶段,用更贴近目标策略分布的学生模型替代直接从监督微调或原始策略进入 RL;实验表明,这种初始化不仅提升起点性能,还能在后续 RL 中带来更高的最终性能,说明蒸馏的价值不只是加速收敛,而是改善了可优化性与最终可达上限。
- Survival Reinforcement Learning: Toward Scalable Self-Supervised RL
- 赛道归属: 自监督强化学习 / 目标条件规划
- 核心创新点: 提出"生存强化学习"(SRL)框架,以在线分类替代对比损失,通过最大化智能体在目标状态的"驻留时间"来学习生存价值函数。核心突破在于从根本上规避了对比学习中"均匀性-容忍度困境"(uniformity-tolerance dilemma),使得深度网络扩展时长视野目标条件规划不再退化,同时保留了CRL的深度可扩展性优势。
- Quality Determines Direction, Length Shapes Magnitude: Length Control for Open-Ended Reinforcement Learning 🆕NEW
- 赛道归属: 大语言模型强化学习 / 开放式任务的长度控制与效率优化
- 核心创新点: 提出面向开放式强化学习的长度控制方法,显式区分“质量提升”和“长度膨胀”两类效应:一方面利用质量信号决定输出方向,另一方面将长度作为控制幅度的调节变量,从而在不牺牲任务质量的前提下抑制无效扩写、提升 token 效率。该工作针对开放式任务缺乏自然终止边界、质量与长度强耦合、组内奖励差距过小等问题,提供了更稳健的长度约束机制。
- Save Your Saturated Data: Learning Beyond Reward Saturation in Group-Based RL 🆕NEW
- 赛道归属: 大语言模型强化学习 / 组相对强化学习的数据再利用与奖励饱和处理
- 核心创新点: 针对 group-based RL 中“奖励饱和”导致组内相对优势消失的问题,提出从饱和数据中重新挖掘学习信号的方法。核心思路是在高奖励、低方差样本组中,不再依赖传统组内奖励差异,而是通过更细粒度的信号重构或再加权机制恢复可学习的偏好方向,使原本被判定为“无信息”的数据重新具备训练价值,从而延缓高质量数据失效、提升样本利用率。
- Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL 🆕NEW
- 赛道归属: 代码智能体强化学习 / 代码生成与智能体行为优化
- 核心创新点: 面向代码智能体的 RL 训练,提出组内智能体式评分与优势重分配机制,解决仅用测试通过/失败二值奖励时,所有通过样本被赋予相同优势、无法区分实现质量的问题。该方法在组内对轨迹进行更细致的质量评估,并将优势从“是否通过测试”进一步重分配到“实现是否简洁、是否贴合任务、是否避免无关修改”等维度,从而引导策略偏向更高质量、更聚焦的代码实现,而非仅追求表面通过。
- PoEM: Predicting RL Outcomes from Existing Policies
- 赛道归属: 强化学习后训练评估 / RL结果预测
- 核心创新点: 提出一种无需实际执行强化学习即可预测“给定新奖励函数下RL后模型表现”的方法,直接基于已有策略与奖励信息估计RL结果,从而缓解传统RL后训练计算开销大、训练不稳定、且在奖励变化或多奖励组合时需要反复从头训练的问题。其方法价值在于把“训练前评估”前移到可预测层面,为奖励设计、策略选择和多目标后训练提供快速筛选能力。
- SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL
- 赛道归属: 工具调用智能体 / 强化学习优化
- 核心创新点: 针对工具调用轨迹中“结构化工具调用”和“面向用户的自然语言总结”混合输出带来的信用分配错误,提出细粒度的分段信用归因机制,解决标准GRPO类方法将同一个轨迹级优势值粗暴广播到所有token所导致的跨段误归因问题。该工作核心突破在于显式区分不同输出片段的功能角色,抑制总结段梯度噪声对工具决策token的污染,从而提升工具选择与调用决策的稳定性和可学习性。
- Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs for Agentic Reinforcement Learning
- 赛道归属: 智能体强化学习 / 步级信用分配优化
- 核心创新点: 通过构建轨迹图(trajectory graphs)来估计步级优势,突破了GRPO及其变体主要依赖轨迹级、组归一化优势而难以准确反映单步贡献的局限。该方法强调从轨迹结构中重建步骤之间的依赖与贡献关系,避免“整条轨迹失败但其中某些步骤有价值”被一并惩罚的问题,从而实现更精细的信用分配,提升面向推理与智能体任务的强化学习训练质量。
- ForgetMimic: Motion Unlearning for Reinforcement Learning Humanoid Control
- 赛道归属: 人形机器人控制 / 强化学习安全遗忘
- 核心创新点: 面向人形控制中的“动作删除”问题,提出 motion unlearning 框架,目标是在保留整体运动能力的同时,选择性移除特定动作模式;该工作将遗忘需求引入 RL 控制策略学习,强调对恶意、污染、低质量或受版权保护动作的定向消除,从方法上补足了传统模仿学习/RL 只能“学会”而难以“忘掉”的缺口。
- Robust Adversarial Reinforcement Learning with Risk Sensitivity and Critic Consistency Regularization
- 赛道归属: 强化学习鲁棒性 / 对抗强化学习
- 核心创新点: 在对抗强化学习中同时引入风险敏感建模与 critic 一致性正则,缓解传统 RARL 中“对抗过强导致训练失稳”和“价值估计被扰动放大”的问题;其关键突破在于不只优化最坏情况收益,还通过风险偏好控制对极端扰动的敏感度,并约束 critic 在原始与对抗样本上的估值一致性,从而提升鲁棒性与训练稳定性。
HuggingFace Models
HuggingFace Datasets
- [2026-09-27] FineEnvs/SmolDataEnvs
- [2026-09-21] Harland/OmniVChat
世界动作模型
arXiv
- InternW0-$\Delta$: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data
- 赛道归属: 机器人操作 / 世界动作模型(World Action Model)
- 核心创新点: 提出统一的世界动作模型预训练框架,将大规模开放数据中的视觉动力学、场景语义、几何结构与运动先验整合到同一模型中,实现“预测世界演化 + 生成机器人动作”的联合建模;通过20K+小时异构数据预训练,增强了模型对真实机器人操作场景的泛化能力,并在仿真与真机平台上取得优于现有方法的表现。
- Rolling-WAM: World Action Models with Rolling Imagination
- 赛道归属: 机器人操作 / World Action Model / 闭环动作规划
- 核心创新点: 提出 Rolling-WAM,将原本每个重规划周期内一次性完成的“联合视频-动作去噪”改为跨多个重规划周期滚动分摊执行;通过维护一个处于不同噪声阶段的滑动窗口式视频-动作块,在每一步仅更新部分状态,从而显著降低单次推理延迟、提升动作刷新频率与闭环响应速度,同时保持未来视觉预测与动作生成的一致性。
- Latent evolving World Action Model
- 赛道归属: 世界动作模型 / 视频生成驱动的动作决策建模
- 核心创新点: 该工作围绕基于视频扩散模型的世界动作模型效率瓶颈展开,提出以“潜空间演化”为核心的建模思路,弱化对大规模视频生成预训练骨干的依赖。其关键突破在于不再完全依赖重型视频扩散主干来提取动作生成所需特征,而是直接在压缩潜变量空间中建模环境状态的动态演化与动作关联,从而在保持世界建模能力的同时显著提升训练与推理效率,并改善此类模型的可扩展性。
- The Right Future for Action: Learning Action-Relevant Predictive States in World Action Models
- 赛道归属: 世界动作模型 / 具身智能 / 视频表征学习
- 核心创新点: 针对"无生成式世界动作模型(WAMs)"中表征学习目标不明确的问题,提出了一套表征诊断框架,揭示了三个关键发现:(1) 未来变化可预测性强的表征并不必然使线性动作解码更容易;(2) 观测到的未来变化能提供超越当前帧的额外动作信息;(3) 线性可读的动作信息在空间上具有集中分布特性。基于此,提出学习"动作相关预测状态"的方法,明确界定了WAM内部视频特征在控制任务中应保留的信息类型,为WAM表征设计提供了理论指导。
- ME-Dex 1.0: Bringing Heterogeneous Tactile Sensing into World Action Modeling
- 赛道归属: 具身智能 / 世界动作模型 / 多模态触觉感知
- 核心创新点: 提出将异构触觉传感信号纳入世界动作模型的统一建模框架(ME-Dex 1.0)。核心突破在于不再将触觉特征仅作为条件输入,而是将未来触觉状态、视觉观测与机器人动作进行联合预测,使触觉信号与视频信号一样被视为世界状态演化的观测序列。这一设计使模型能够在物理交互层面形成更完整的多模态世界状态表征,弥补了纯视觉世界模型在接触力学感知上的盲区。
- CSWAM: Better Causal Semantic Representations for Out-of-Distribution Generalization in World Action Models
- 赛道归属: 世界动作模型(World Action Model)/ 具身智能 / 分布外泛化
- 核心创新点: 针对 FastWAM 类世界动作模型在视觉分布偏移下泛化能力差的问题,提出因果语义世界动作模型(CSWAM)。核心突破在于:①将重建导向的表征替换为因果语义表征,剥离外观特异性细节,聚焦任务相关的状态变化与运动信息,从而降低对视觉外观的过拟合;②在无观测历史的纯动作推理框架下,引入时序因果证据机制,增强模型在陌生视觉场景和未见物体下对任务相关状态变化的鲁棒识别能力。该方法从表征层面解决了世界动作模型在 OOD 场景下的泛化瓶颈,而非依赖更多数据或更大模型规模。
- Making Latent Evolution Explicit: Operator-Structured Transitions for World Action Models
- 赛道归属: 具身智能 / 世界动作模型 / 潜空间动态建模
- 核心创新点: 针对现有基于Transformer的潜空间世界动作模型中"状态转移"建模结构不合理的问题,提出以算子结构化(Operator-Structured)方式显式建模潜空间中的时序演化过程。核心突破在于将潜变量的转移从以token交互为中心的注意力机制中解耦出来,改为以时序演化为归纳偏置的算子形式,使潜空间中的状态转移过程更加显式、可解释,并与控制相关信息的传播逻辑更为一致,从而提升世界动作模型在潜空间预测中的结构合理性与泛化能力。
- Keep the Future, Drop the Rollout: RIFT for World Action Models
- 赛道归属: 机器人操作 / 世界动作模型推理加速
- 核心创新点: 针对WAM依赖迭代视频rollout带来的高时延问题,系统分析了“动作生成是否真的需要完整的未来轨迹”这一关键假设;通过闭环干预实验发现,动作执行更依赖未来表示而非逐步展开的rollout过程,从而提出可复用未来缓存、减少或替代rollout计算的思路,在保持控制效果的同时显著降低部署开销。
- Decoupling Intention from Trajectory: A Representational Deduction Framework for World Action Models
- 赛道归属: 机器人操作 / 世界动作模型表征学习
- 核心创新点: 提出一种将“意图”与“轨迹”解耦的表征推导框架,指出现有WAM视觉分支主要学习静态观测预测,难以显式建模动作交互下的潜在状态转移;该方法通过分离高层物理状态演化信息与低层动作轨迹生成信号,缓解表征纠缠,使模型更准确地捕捉世界状态变化与动作规划之间的因果关系。
- DeltaWAM: Delta World Action Models for Bimanual Manipulation
- 赛道归属: 机器人操作 / World Action Model / 双臂操控
- 核心创新点: 提出 DeltaWAM,用“增量变化”替代对完整未来帧的密集建模,重点预测场景中真正发生变化的部分,从而减少对大面积静态内容的重复建模,并削弱动作条件动态与外观噪声之间的耦合;在推理阶段进一步通过更轻量的增量式视频专家加速少步动作生成,提升双臂操作场景下的效率与控制精度。
由 Research Daily 自动生成 生成时间: 2026-09-29 05:33:18