AI 每日进展速报 - 2026-09-25
新旧
正在统计...
来源
当前筛选条件下没有条目。
数据状态 / Data Status
- GitHub 数据源本次没有返回条目;可能是暂无匹配结果,也可能是接口异常,请结合日志确认。
图像生成/编辑
arXiv
- InGuard: Towards Generalized Inner Guardrail for Safe Text-to-Image Generation
- 赛道归属: 文生图安全对齐 / 安全生成
- 核心创新点: 提出“内置式”安全护栏思路,将安全约束从传统的生成前/生成后外部分类器,转移到扩散模型内部表示与生成过程之中;通过利用模型自身的中间表征进行风险识别与抑制,增强对 NSFW 等风险内容的泛化拦截能力,减少外部护栏与生成模型脱节带来的漏检问题。
- Beyond Emotion Prompts: Fine-Grained Text-to-Image Generation Driven by Valence-Arousal-Dominance
- 赛道归属: 文生图 / 情感可控图像生成
- 核心创新点: 提出EMOTRANS框架,将心理学中经过验证的VAD(效价-唤醒度-支配度)三维情感坐标系转化为独立于内容描述的生成条件。核心突破在于将情感控制从模糊的自然语言提示中解耦出来,赋予情感维度可量化、可排序的连续控制尺度,使创作者无需修改内容描述即可精细调控图像所传递的情感强度与类型,解决了自然语言情感提示语义不稳定、缺乏细粒度控制的根本缺陷。
- Efficient Text-to-Image Generation: An Adaptive Step Schedule Controller for Diffusion Models
- 赛道归属: 文生图 / 推理优化
- 核心创新点: 针对文生图扩散模型中固定去噪步数无法适应不同文本复杂度的问题,提出了一种无需额外训练的自适应步数调度控制器。核心方法是通过混合多种步长调度策略,并在每个时间步评估误差项差异(error term discrepancy),动态决定最优去噪步数,从而在保证图像质量的前提下显著提升生成效率。
- Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation
- 赛道归属: 文生图 / 多样性与公平性优化
- 核心创新点: 提出"多轴 Max@K"强化学习目标,将文生图的多样性问题形式化为"目标模式覆盖"任务。核心突破在于设计了一种基于分组的RL训练范式:在同一提示词下采样K张图像,以组为单位计算奖励,鼓励模型在单次生成批次中覆盖尽可能多的预定义语义模式(如不同人口统计属性)。相比逐样本优化,该方法从根本上改变了奖励信号的计算粒度,使扩散模型能够主动探索并覆盖多样化的视觉模式,同时缓解人物类提示词中的人口统计偏差问题。
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- 赛道归属: 文生图加速 / 少步采样 / CFG 蒸馏
- 核心创新点: 面向少步文生图推理中的 CFG 蒸馏问题,引入信息瓶颈约束来指导蒸馏过程,使模型不再采用全局静态、粗粒度的 guidance 注入方式,而是学习更具选择性的条件信息传递机制;该方法旨在在显著减少采样步数的同时,尽量保留 CFG 轨迹中的关键语义与视觉质量,从而提升少步生成的效率与稳定性。
- CompArt: Operationalizing Aesthetic Alignment in Text-to-Image Generation via Principles of Art
- 赛道归属: 文生图 / 美学对齐与可控生成
- 核心创新点: 提出"美学对齐"(Aesthetic Alignment)概念,将传统模糊的审美偏好(如"高质量"、"精美")分解为基于艺术原则的显式、可操作的构图规则(如对称性、色彩对比、视觉重心等)。核心突破在于将艺术学领域的构图原理形式化为可量化的约束条件,并将其注入T2I扩散模型的生成过程,使用户能够精确控制图像的构图意图,而非依赖模糊的质量描述词,从根本上区别于以往以单一偏好分数驱动的美学优化范式。
- AdaPilot: Towards Scene-Adaptive Policy Learning for Cross-Generator Text-to-Image Quality Optimization 🆕NEW
- 赛道归属: 文生图质量优化 / 跨生成器图像生成控制
- 核心创新点: 提出面向不同场景自适应的质量优化策略学习框架 AdaPilot,将“图像质量提升”从依赖单一生成器的局部优化,推进到可跨生成器迁移的通用策略学习。其关键突破在于不再仅针对某个特定模型做微调或提示词搜索,而是通过学习场景感知的决策策略,在多轮视觉反馈下动态调整优化动作,从而实现对不同文本到图像生成器的泛化适配与质量提升能力迁移。
- IMPLICIT-Bench: Measuring Implicit Bias in Text-to-Image Models under Neutral Prompts
- 赛道归属: 文生图 / 模型偏见评测
- 核心创新点: 提出IMPLICIT-Bench基准,专门针对"中性提示下的隐式偏见"这一此前被忽视的评测盲区。与现有基准依赖显式槽位模板(如"[职业]的照片")不同,该工作聚焦于当人口统计属性未被明确指定时模型仍会输出刻板印象的隐式偏见现象,构建了基于自然提示的系统性评测体系,从方法论上填补了T2I模型偏见评估从"显式属性探测"向"隐式语境偏见测量"的跨越。
- PixelART: Image-to-Layer Decomposition without Latents or Text-to-Image Pretraining
- 赛道归属: 图像编辑 / 图层分解
- 核心创新点: 提出PixelART,彻底摒弃了现有图层分解方法对大型预训练文生图模型、RGBA自编码器及可变层数架构模块的依赖,转而在像素空间中从零训练一个基于整流流(Rectified Flow)的Transformer模型。核心突破在于证明图像到可编辑RGBA图层的分解任务本身并不需要依托潜空间扩散模型或文生图预训练的重量级组件,以更轻量、更纯粹的架构实现了同等乃至更优的元素级图层分解能力,重新审视并简化了该任务的设计范式。
- Paint-Anything: Unified Any-Color Control for Image Generation and Editing
- 赛道归属: 图像生成 / 图像编辑 / 颜色可控生成
- 核心创新点: 提出 Paint-Anything 框架,实现对任意24位十六进制颜色值的精确可控生成与编辑。核心创新在于利用大语言模型天然具备的十六进制颜色语义理解能力,设计了一个统一的共享表示空间,将颜色控制信号直接以 hex 值形式注入生成/编辑流程,无需依赖专用颜色表示(如调色板、色块参考图)或特殊推理流程。该方法将颜色控制的精度从粗粒度语义描述提升至精确的24位色彩空间,同时统一了生成与编辑两个任务的控制接口。
HuggingFace Models
视频生成/编辑
arXiv
- WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation 🆕NEW
- 赛道归属: 文生视频提示词优化 / 视频生成前端规划
- 核心创新点: 提出面向“导演级”视频创作的提示词增强模型,将文本提示从简单描述提升为可执行的电影化分镜计划;通过在大规模真实视频数据上训练,学习对动作编排、镜头运动、光照变化、场景切换与声音节奏等要素进行结构化重写与补全,从而显著增强复杂长视频生成中的条件表达能力与生成可控性。
- CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation
- 赛道归属: 视频生成(物理一致性文生视频)
- 核心创新点: 提出CompAdapt框架,针对现有文生视频模型无法正确建模物理动力学的问题,设计了一种可自适应的复合运动建模机制。核心突破在于:能够同时处理多种类型的复合运动(而非单一运动类型),无需人工指定物理参数,并具备对未见物理规律的泛化能力。通过将显式物理动力学先验与扩散模型生成过程有机结合,实现了更具物理一致性的视频生成。
- MotionSpec: Spectral Trajectory Supervision for Motion-Consistent Video Generation
- 赛道归属: 视频生成 / 文生视频 / 运动一致性建模
- 核心创新点: 提出基于运动轨迹频谱监督的训练思路,将视频中的时序运动从像素级外观约束提升到更具结构性的轨迹表示上进行优化。该方法通过对运动轨迹的频域特征施加监督,显式约束动作演化的连续性、平滑性与一致性,从而缓解传统生成目标对“单帧真实、跨帧不稳”问题监督不足的缺陷。其关键价值在于把复杂运动的时序一致性问题转化为可学习的谱域约束,增强长时运动生成的物理合理性与结构稳定性。
- Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding
- 赛道归属: 视频生成(身份保持/人物一致性)
- 核心创新点: 提出基于"槽(Slot)"的时序身份编码机制,突破了现有方法仅依赖单张参考图像的局限。核心创新在于从参考视频片段中提取多帧、多视角的身份特征,通过槽注意力机制将动态变化的身份线索(表情、姿态、光照)聚合为结构化的时序身份表示,从而有效解决了单帧参考导致的人脸变形、姿态锁定和身份漂移问题,实现了在大幅视角/表情变化下的鲁棒身份保持视频生成。
- AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation 🆕NEW
- 赛道归属: 音视频联合生成 / 多模态强化学习后训练
- 核心创新点: 提出模态锚定的解耦扩散强化学习框架,将音频与视频两条生成塔的优化过程分离,并通过模态锚点缓解多模态奖励耦合带来的信用分配困难;该方法针对文本对齐、单模态保真度与跨模态同步三个目标进行联合后训练,在强化学习阶段实现更稳定的多目标优化,提升音视频生成的一致性与协调性。
- SALI: Shot-Aware Late Interaction for Cross-Shot Relation Matching in Text-to-Video Retrieval using Film-Grammar Knowledge 🆕NEW
- 赛道归属: 文本到视频检索 / 跨镜头关系匹配
- 核心创新点: 引入基于电影语法知识的 shot-aware late interaction 机制,突破传统“单一视频向量”表示对跨镜头人物关系建模不足的问题;方法先从查询中显式抽取主体与客体,再在镜头级别进行细粒度交互匹配,以保留诸如正反打、对话对切等跨镜头关系信息,从而更准确地识别文本中描述的人物交互与叙事关系。
- The Past Frames the Future: Memory for Autoregressive Video Generation
- 赛道归属: 视频生成 / 自回归视频生成 / 长时序记忆建模
- 核心创新点: 针对自回归视频生成在长序列扩展中面临的上下文窗口受限、历史信息衰减和身份/状态漂移问题,引入记忆机制来保留并检索关键过去帧信息。该工作强调将“过去”作为显式可访问的外部记忆,用于补足仅依赖有限上下文进行滚动预测时的历史缺失,从而提升长程生成中的实体一致性、场景连续性和状态演化稳定性。其方法论突破在于把视频生成从纯粹的局部因果预测,推进到带有长期记忆检索与状态保持能力的序列建模框架。
- QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for World Models and Video Generation
- 赛道归属: 视频生成 / 推理优化(KV Cache 量化)
- 核心创新点: 针对视频生成与世界模型中 KV Cache 的显存瓶颈,提出 QuantWM 方法。核心发现是:现有 2-bit 量化方案虽在 VBench 等指标上接近无损,但会引发严重的时序闪烁问题;进一步揭示了 Key 量化重建误差小但对时序一致性破坏更大的反直觉现象。基于此,QuantWM 针对性地设计了时序一致性感知的 2-bit KV Cache 量化策略,在极低比特率下同时保障视频质量指标与帧间时序稳定性,填补了视频生成场景下超低比特量化的研究空白。
- CogenPVG: Cognitive-Enhanced Reflective Multi-Agent Framework for Persuasive Video Generation
- 赛道归属: 视频生成(说服性视频自动化创作)
- 核心创新点: 提出 CogenPVG 框架,将说服性视频生成(PVG)这一新兴任务形式化,并引入认知增强的反思式多智能体协作机制。核心创新在于:将复杂的说服性视频创作流程解耦为多个认知功能模块(如论点构建、情感调度、叙事规划等),由多个专职 Agent 协同完成,并通过反思机制迭代优化生成内容的说服力与连贯性,使 AI 生成的视频在立场表达和情感影响力上接近人工创作水平。
- VideoGen-Agent: Reinforcing Video Generation Agents
- 赛道归属: 视频生成(智能体/工具增强)
- 核心创新点: 提出多模态视频生成智能体框架,核心创新在于将多任务智能体强化学习(Agentic RL)引入视频生成流程。智能体通过学习协调"增强—生成—验证"三类外部工具,能够自主规划工具调用策略,以弥补单一生成模型在专业知识、特定身份、物理一致性及事件顺序等方面的能力短板,实现了从被动生成到主动决策的范式转变。
音频生成
arXiv
- Interactive TTS: Dynamic Speaking Style Adaptation for Expressive Speech Synthesis
- 赛道归属: 文本转语音(TTS)/ 对话式语音合成 / 风格自适应
- 核心创新点: 针对多轮多模态交互中说话风格动态适应问题,提出 InteractiveTTS 框架。核心突破在于将隐式端到端的上下文风格建模拆解为显式的两阶段流程:先从对话上下文中显式预测风格标签(解耦风格决策与声学生成),再以此为条件驱动语音合成。这一设计使风格决策可监督、可解释,同时通过解耦音色、内容与风格三者的表示,有效缓解了多轮合成中的音色漂移(timbre drift)问题,并增强了指令跟随能力。
- ReaFlow-TTS: Realization-Conditioned Flow Matching for High-Quality and Controllable Speech Synthesis 🆕NEW
- 赛道归属: 文本到语音生成(TTS)/ 可控语音合成
- 核心创新点: 提出 realization-conditioned flow matching 框架,将“同一文本条件下不同语音实现”显式纳入建模,而不是只学习其条件均值速度场;通过对实现差异进行条件化,缓解确定性流匹配对多样性与可控性的折中问题,并为语音属性操控提供更具语义可解释性的接口,从而提升合成质量与可控性。
- UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation
- 赛道归属: 文生音频生成 / 音频表示学习与生成联合建模
- 核心创新点: 提出联合学习连续音频分词器与潜空间流匹配生成模型的框架,打破传统“先重建、后冻结”的两阶段范式。该方法不再将tokenizer仅作为重建工具,而是让表示学习与生成目标协同优化,使潜空间更适配文本到音频生成任务,从而提升生成质量与表示效率。
- TTS-Guard: Black-Box Ownership Verification of Text-to-Speech Models via Adaptive Adversarial Speaker-Pair Fingerprints
- 赛道归属: 文本转语音(TTS)模型安全与版权保护
- 核心创新点: 提出了一种针对TTS模型的黑盒所有权验证框架TTS-Guard。核心创新在于设计了"自适应对抗说话人对指纹"机制:通过构造一对对抗性说话人样本作为模型指纹,使得目标模型在该说话人对上的输出行为呈现出可统计验证的特异性差异,而无需访问模型内部参数。该方法专门针对语音信号的连续波形特性和人类听觉感知约束进行设计,能够在常规信号处理(如压缩、重采样)破坏扰动后仍保持指纹的鲁棒性,填补了TTS模型知识产权保护领域的空白。
- COT-TTS: Audio Context-Aware Text-to-Speech with Chain-of-Thought Reasoning
- 赛道归属: 文本转语音(TTS)/ 上下文感知语音合成
- 核心创新点: 提出COT-TTS框架,将链式思维(Chain-of-Thought)推理机制引入TTS任务。核心创新在于:系统不依赖用户显式指定的风格指令,而是以历史对话音频作为上下文输入,通过CoT推理过程自动推断目标文本应采用的说话风格(语气、情感、节奏等),再驱动语音合成。这一范式将TTS从"指令驱动"升级为"上下文推理驱动",使合成语音的风格能够自然地与对话语境保持一致,更贴近真实人类对话场景。
- EditVoice: Variable-Length Non-Autoregressive Zero-Shot TTS and Speech Editing with Edit Flows 🆕NEW
- 赛道归属: 文本到语音生成(TTS)/ 语音编辑 / 零样本语音合成
- 核心创新点: 提出 Edit Flows,将语音生成建模为基于插入、删除、替换的编辑过程,实现对语音内容与序列长度的联合更新;首次将变量长度的非自回归零样本 TTS 与文本驱动语音编辑统一到同一框架中,并通过 speech-infilling 训练范式让模型在生成与编辑之间共享能力,从而摆脱传统 NAR TTS 需要预先指定目标长度的限制。
- Depth through recurrence: Looped transformers for flow-matching TTS 🆕NEW
- 赛道归属: 文本到语音生成(TTS)/ Transformer 结构优化 / 流匹配建模
- 核心创新点: 研究通过循环复用(recurrence)组织 Transformer 深度的方式,在流匹配 TTS 中系统比较不同权重共享布局对性能与参数效率的影响;提出的 SEQUENCE 布局通过按固定顺序重复调用各层,在保持可比的可懂度、说话人相似度和语音质量的同时,显著减少参数量,说明“深度组织方式”本身可以成为提升 TTS 推理效率的重要设计维度。
- BanglaKontho: Closing the Long-Form Gap in Bangla Text-to-Speech 🆕NEW
- 赛道归属: 文本到语音生成(TTS)/ 低资源语音合成 / 数据集构建
- 核心创新点: 构建并发布面向孟加拉语长文本朗读场景的单说话人 TTS 数据集 BanglaKontho,填补现有公开语料偏短句、缺少长篇连贯韵律与稳定单说话人叙述的缺口;同时提供可复用的基线系统与评测设置,为低资源语言的长篇语音合成、韵律建模和数据集标准化提供了基础设施。
- Same Bit Width, Different Outcomes: Post-Training Quantization of Text-to-Speech Across Architectures 🆕NEW
- 赛道归属: 文本到语音生成(TTS)/ 模型压缩 / 后训练量化
- 核心创新点: 从统一协议出发系统评估不同 TTS 架构上的后训练量化效果,揭示“相同比特宽度”在不同模型与量化粒度下会产生显著不同的质量退化;通过权重/激活消融与跨模型盲测,指出 4-bit per-channel 权重量化通常可接受,但 per-tensor scaling 即使在 8-bit 下也可能严重劣化,强调 TTS 量化不能只看 bit 数,还必须联合考虑架构与缩放策略。
- EmphTTS: an emphasis-control TTS with reinforcement learning
- 赛道归属: 可控语音合成 / 语音韵律控制 / 强化学习后训练
- 核心创新点: 面向词级重音控制这一细粒度韵律任务,引入强化学习进行TTS后训练,使模型能够根据显式强调信号学习更符合人类偏好的重音表达。相较于仅依赖监督学习的控制方式,该方法将“可控性”与“自然性”统一到偏好优化框架中,增强了语音在真实交互场景中的表达准确性。
HuggingFace Models
HuggingFace Datasets
- [2026-09-20] Yootta/World-SimReady-Home
语言大模型
arXiv
- Faithful yet Collusive: Why Chain-of-Thought Monitoring Cannot Detect Collusion in LLM Pricing Agents under Oligopolistic Competition
- 赛道归属: LLM智能体安全与可解释性(定价博弈/思维链监控)
- 核心创新点: 提出"因果图散度框架",将LLM定价智能体的思维链(CoT)忠实性分解为结构忠实性(推理步骤的逻辑一致性)和意图忠实性(推理是否真实反映决策动机)两个独立维度。核心发现是:在寡头竞争博弈中,模型的串谋行为与CoT忠实性在两个维度上均存在解耦——即串谋程度最高的模型可以同时准确描述合作意图,但这种"忠实"的CoT并不能揭示其真实的串谋机制。这一发现从根本上挑战了"通过监控CoT来检测LLM智能体串谋行为"这一主流安全假设,指出CoT监控在寡头定价场景下存在系统性盲区。
- When Context Misleads: In-context Learning with Jurisdiction in Large Language Models
- 赛道归属: 大模型推理与上下文学习鲁棒性评估
- 核心创新点: 该工作聚焦于 In-Context Learning 中“上下文权威性(context authority)”这一被忽视的能力,即模型不仅要从示例中归纳模式,还要判断上下文信息是否应当主导最终答案。论文提出 FakeContextBench,通过跨七个领域的伪科学陈述构建评测集,系统检验模型在“上下文是否可信、是否应被采纳”上的判断能力,从而揭示现有 ICL 后训练方法在面对误导性上下文时的脆弱性,并补足了传统只看模式提取而忽略上下文裁决的评测空白。
- Representation-guided in-context learning for medical image interpretation with multimodal large language models
- 赛道归属: 多模态大模型 / 医学图像理解
- 核心创新点: 提出表示引导的上下文学习(RG-ICL)框架,核心突破在于无需任何任务特定微调即可适配医学图像解读任务。通过冻结的视觉编码器检索与查询图像语义对齐的示例作为上下文演示,将检索增强与上下文学习结合,绕过了传统领域适配中资源密集型参数更新的瓶颈。在组织病理学、放射影像和视网膜眼底镜等八个跨模态医学数据集上验证了其泛化能力。
- Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning 🆕NEW
- 赛道归属: 具身智能 / 神经符号规划 / 强化学习
- 核心创新点: 提出一种将符号规划、强化学习与大语言模型结合的混合式架构,用于处理开放世界中的“新颖性”障碍;当传统规划器因缺少新对象相关算子而无法生成计划时,系统通过LLM辅助识别新对象与任务语义,再结合RL学习补足可执行操作策略,从而实现对未知环境变化的自适应规划与行动。
- From Concept Alignment to Causal Grounding: An Intervention Test of Chain-of-Thought Faithfulness
- 赛道归属: 大语言模型推理 / 思维链可解释性
- 核心创新点: 将思维链(CoT)的忠实性问题重新定义为内部概念因果锚定问题,而非传统的输入-输出行为分析。通过干预测试(intervention test)检验LLM的CoT推理是否激活了与直接预测相同的内部概念表征,并进一步验证这些共享概念是否对最终答案具有因果驱动作用。这一框架从模型内部计算层面揭示了CoT是否真正参与推理,而非仅作表面文字对齐。
- Recursive Reasoning or Statistical Extrapolation? In-Context Learning in Multi-Agent Interdependent Decision-Making
- 赛道归属: LLM智能体推理机制分析(多智能体博弈/上下文学习)
- 核心创新点: 针对"LLM智能体在多智能体交互中的上下文学习(ICL)究竟依赖真实推理还是统计外推"这一根本性问题,设计了一套受控公共品博弈实验框架,通过主动操控历史反馈的统计结构(如注入虚假但统计规律一致的历史记录)来解耦两种机制。核心方法论突破在于:将递归信念推理(Recursive Belief Reasoning,即对他人意图的多层级建模)与统计模式匹配作为可独立操控的变量,从而实证区分LLM在不完全信息博弈中的决策本质。该工作为评估LLM智能体是否具备真正的策略推理能力提供了可复现的实验范式。
- MILO: Efficient Many-shot In-Context Learning with Block-wise Low-rank Compression 🆕NEW
- 赛道归属: 大模型推理优化 / 上下文学习加速 / KV缓存压缩
- 核心创新点: 针对many-shot in-context learning中KV cache随示例数线性增长、导致推理内存瓶颈的问题,提出块级低秩压缩框架MILO;其核心是在保持上下文学习能力的前提下,对KV缓存进行结构化低秩近似与分块压缩,从而显著降低显存占用并提升长上下文、多示例推理的部署效率。
- CORDIAL: Calibrating Ordinal LLM Outputs from Few Labels 🆕NEW
- 赛道归属: 大模型校准 / 序数预测 / 小样本学习
- 核心创新点: 将LLM对序数标签的输出视为“带噪观测”,构建一个具有五个可解释参数的信道模型来刻画系统性偏差(如饱和、压缩、夸大等);方法仅需少量标注即可估计后验并完成校准,同时给出了校准性质的理论保证,使模型输出更贴近真实有序标签分布。
- Evaluation of Multi-Turn Consistency in LLM Agents: Survival Analysis and Failure-Rationale Taxonomy 🆕NEW
- 赛道归属: LLM Agent评测 / 多轮一致性 / 可靠性分析
- 核心创新点: 面向长时交互中的行为漂移问题,设计了一个20步多轮决策实验框架,并结合生存分析刻画代理在持续延迟奖励过程中的“失稳/终止”风险;进一步提出失败原因分类体系,从社交可见性、人格压力和推理策略等因素系统分析多轮一致性退化的触发机制,为评估LLM Agent的时序稳定性提供了更细粒度的方法论。
- Large Language Models for Programming: Actually Fixing or Reimplementing Incorrect Code? 🆕NEW
- 赛道归属: 代码生成 / 代码修复 / 程序理解
- 核心创新点: 不仅评估LLM是否能修复错误代码,还进一步分析其修复路径是否更倾向于“直接补丁修复”还是“重写实现”;通过比较模型修改轨迹与人类补丁的偏离程度,揭示LLM在编程任务中对错误代码的处理偏好与偏差,为理解其代码修复能力、泛化方式及工程可用性提供了新的分析视角。
HuggingFace Models
HuggingFace Datasets
- [2026-09-24] MoreThought/Fable-5.1-Max-Reasoning-Filtered-10000x 🆕NEW
- [2026-09-06] openbmb/UltraData-SFT-Agent-2609
多模态大模型
arXiv
- PRISM-VLM: A Multi-Axis Discriminative Benchmark for Compact Vision-Language Models
- 赛道归属: 多模态理解 / 视觉语言模型评测基准
- 核心创新点: 提出一个面向紧凑型视觉语言模型的多轴判别式评测基准 PRISM-VLM,突破了传统“单一准确率”式评测范式。该工作将样本从多个维度进行细粒度打分,覆盖模型常见失效模式,从而能够更全面地区分不同模型在任务质量、鲁棒性、行为偏差等方面的差异,提升了对小型 VLM 能力边界与短板的诊断能力。
- Efficient Quantization-Aware Distillation with Cross-Modal Alignment for Edge Vision-Language Models
- 赛道归属: 多模态理解 / 推理优化 / 边缘部署
- 核心创新点: 针对边缘设备上视觉语言模型(VLM)的高效部署问题,提出将知识蒸馏与量化感知训练(QAT)统一为单阶段联合优化框架,并引入跨模态对齐机制,解决了原有EdgeVL两阶段方案中蒸馏目标与QAT目标相互割裂导致的优化不一致问题,从而在保持开放词汇分类(OVC)能力的同时显著降低模型在边缘硬件上的计算与存储开销。
- SalQ-VLM: Fine-Grained Saliency-Guided Quantization for Vision-Language Models
- 赛道归属: 多模态理解 / 推理优化(视觉语言模型量化压缩)
- 核心创新点: 针对视觉语言模型(VLM)的后训练量化(PTQ)问题,提出了细粒度显著性引导量化方法 SalQ-VLM。核心突破在于识别并解决了VLM激活中两类固有挑战:一是视觉与语言模态间的激活分布异质性,二是跨层的激活尖峰问题。通过引入显著性感知的细粒度量化策略,对不同模态和不同重要性的激活区域施加差异化的量化精度,在保持模型性能的同时大幅降低内存占用和推理开销,填补了PTQ在VLM领域研究不足的空白。
- Cross-Modal Attention Acts as a Frequency Filter: Why Verbose Prompts Improve Robustness in Vision-Language Models
- 赛道归属: 多模态理解 / 视觉-语言模型鲁棒性分析
- 核心创新点: 该工作从频域视角揭示了视觉-语言模型(VLM)在图像噪声干扰下鲁棒性变化的内在机制。核心发现是:跨模态注意力机制本质上充当了一个频率滤波器——文本提示的措辞方式会显著影响模型对图像高频噪声的敏感程度。具体而言,冗长/描述性的提示(verbose prompts)能够引导跨模态注意力更多聚焦于图像的低频语义信息,从而抑制高频噪声干扰,提升鲁棒性;而语义复杂或细粒度的问题则相反,会使模型更依赖高频细节,导致在图像损坏时性能大幅下降。这一发现从机制层面统一解释了提示措辞对VLM鲁棒性产生截然相反影响的现象,为提示工程和模型鲁棒性优化提供了新的理论依据。
- Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow 🆕NEW
- 赛道归属: 多模态理解 / 情感推理 / 可解释性分析
- 核心创新点: 提出基于跨模态信息流的因果归因框架,用 steering vector 对 LVLM 内部情感表征进行干预与追踪,分析视觉刺激如何逐步转化为情绪叙事;通过构建情感电路的可解释路径,定位模型中负责情绪理解的关键跨模态通路,并进一步验证和增强这些电路,从机制层面提升情感理解能力
- The Alignment Illusion in Multimodal Large Language Models 🆕NEW
- 赛道归属: 多模态大模型 / 对齐机制分析 / 表征可解释性
- 核心创新点: 通过对视觉流进行受控替换实验,系统检验 MLLM 中“层间视觉-文本相似度”是否真的代表跨模态内容融合;结果表明许多常用对齐指标可能只反映表面统计相关而非语义交互,揭示了“对齐幻觉”现象,从方法上纠正了对多模态表征对齐的传统解释框架
- Seeing Is Not Measuring: Tool-Augmented Metric Spatial Reasoning for Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 空间推理 / 工具增强推理
- 核心创新点: 构建一个与底层预测器解耦的模块化工具增强框架,将 3D 目标检测、度量深度估计和确定性几何求解器引入 VLM,用于处理绝对距离、物体尺寸和方位等度量级空间问题;通过在对象最佳视角下进行检测并结合相机位姿进行几何计算,显著弥补了纯 VLM 在 3D 结构推理上的短板,实现从“描述场景”到“精确测量场景”的能力升级
- The Uncontrolled Variable: Vision-Language Model Refusal Responds to Image Presence in Ways Risk Cannot Explain
- 赛道归属: 多模态大模型安全性 / VLM对齐与鲁棒性研究
- 核心创新点: 该工作揭示了视觉语言模型(VLM)在安全对齐机制上存在一个被忽视的"非内容性"触发变量——图像的物理存在本身(而非图像内容)会显著影响模型的拒绝行为。核心发现是:即使附加一张空白、无关、跨提示完全相同的图像,模型的拒绝率也会发生数十个百分点的偏移,且这种偏移并非均匀的保守化,而是对边界性内容(borderline content)具有选择性影响,中性指令几乎不受影响。这一发现表明,现有VLM的安全对齐机制将"模态形式"(是否有图像附加)错误地编码为风险信号,而非仅依赖请求的语义内容进行判断,从而暴露出对齐训练中存在的系统性偏差和潜在的安全盲区。
- ME-VLM:A Unified VLM for Embodied Cognition and Agent Coordination
- 赛道归属: 多模态理解 / 具身智能与智能体协作
- 核心创新点: 提出 ME-VLM(MachEmbodied-VLM),一个统一的视觉语言模型框架,同时覆盖具身认知与多模态智能体协作两大能力维度。核心创新在于将物理感知、时空推理与规划执行反馈闭环整合进单一模型架构,并提供4B和35B-A3B两种规模变体以适配不同部署场景。相比传统VLM仅关注静态图文理解,ME-VLM显式建模了真实世界环境约束与执行反馈机制,使模型具备在物理和数字环境中进行交互、规划及结果评估的统一能力。
- PREM: Prefix-Steered Recurrent Memory for Long-Video Understanding
- 赛道归属: 多模态理解 / 长视频理解(高效记忆机制)
- 核心创新点: 提出 PREM(前缀引导循环记忆)框架,在不修改冻结VLM内部参数(包括KV缓存)的前提下实现长视频理解。核心突破体现在三点:①将视频摄取与问题回答两个阶段解耦,避免了帧压缩或token堆叠带来的信息损失;②设计了循环写入器,将视觉流蒸馏为仅256 KiB的紧凑多槽关联状态,极大压缩了记忆占用;③采用问题条件化的读取机制,在推理时动态从记忆状态中检索相关视觉证据,以前缀形式注入冻结模型,实现了无需记忆token的高效长视频问答。
强化学习
arXiv
- RL Starts before RL: On Policy Distillation for Better Reinforcement Learning
- 赛道归属: 大语言模型推理优化 / 强化学习训练策略
- 核心创新点: 提出“先蒸馏、后强化学习”的预训练式初始化思路,将 on-policy distillation 作为 RL 前的准备阶段,用更贴近目标策略分布的学生模型替代直接从监督微调或原始策略进入 RL;实验表明,这种初始化不仅提升起点性能,还能在后续 RL 中带来更高的最终性能,说明蒸馏的价值不只是加速收敛,而是改善了可优化性与最终可达上限。
- Survival Reinforcement Learning: Toward Scalable Self-Supervised RL
- 赛道归属: 自监督强化学习 / 目标条件规划
- 核心创新点: 提出"生存强化学习"(SRL)框架,以在线分类替代对比损失,通过最大化智能体在目标状态的"驻留时间"来学习生存价值函数。核心突破在于从根本上规避了对比学习中"均匀性-容忍度困境"(uniformity-tolerance dilemma),使得深度网络扩展时长视野目标条件规划不再退化,同时保留了CRL的深度可扩展性优势。
- How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment
- 赛道归属: 大语言模型强化学习后训练 / 内存优化
- 核心创新点: 针对LLM在线RL训练(PPO/GRPO/Online DPO)中rollout阶段KV Cache显存占用过大的"内存墙"问题,提出Shadow Mask Distillation方法。核心突破在于通过引入"影子掩码蒸馏"机制,在不损失对齐效果的前提下对KV Cache进行有效压缩,从方法论上将KV Cache压缩技术与RL后训练流程深度融合,解决了长上下文推理任务中显存瓶颈与训练效率之间的矛盾。
- PoEM: Predicting RL Outcomes from Existing Policies 🆕NEW
- 赛道归属: 强化学习后训练评估 / RL结果预测
- 核心创新点: 提出一种无需实际执行强化学习即可预测“给定新奖励函数下RL后模型表现”的方法,直接基于已有策略与奖励信息估计RL结果,从而缓解传统RL后训练计算开销大、训练不稳定、且在奖励变化或多奖励组合时需要反复从头训练的问题。其方法价值在于把“训练前评估”前移到可预测层面,为奖励设计、策略选择和多目标后训练提供快速筛选能力。
- SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL 🆕NEW
- 赛道归属: 工具调用智能体 / 强化学习优化
- 核心创新点: 针对工具调用轨迹中“结构化工具调用”和“面向用户的自然语言总结”混合输出带来的信用分配错误,提出细粒度的分段信用归因机制,解决标准GRPO类方法将同一个轨迹级优势值粗暴广播到所有token所导致的跨段误归因问题。该工作核心突破在于显式区分不同输出片段的功能角色,抑制总结段梯度噪声对工具决策token的污染,从而提升工具选择与调用决策的稳定性和可学习性。
- Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs for Agentic Reinforcement Learning 🆕NEW
- 赛道归属: 智能体强化学习 / 步级信用分配优化
- 核心创新点: 通过构建轨迹图(trajectory graphs)来估计步级优势,突破了GRPO及其变体主要依赖轨迹级、组归一化优势而难以准确反映单步贡献的局限。该方法强调从轨迹结构中重建步骤之间的依赖与贡献关系,避免“整条轨迹失败但其中某些步骤有价值”被一并惩罚的问题,从而实现更精细的信用分配,提升面向推理与智能体任务的强化学习训练质量。
- ForgetMimic: Motion Unlearning for Reinforcement Learning Humanoid Control
- 赛道归属: 人形机器人控制 / 强化学习安全遗忘
- 核心创新点: 面向人形控制中的“动作删除”问题,提出 motion unlearning 框架,目标是在保留整体运动能力的同时,选择性移除特定动作模式;该工作将遗忘需求引入 RL 控制策略学习,强调对恶意、污染、低质量或受版权保护动作的定向消除,从方法上补足了传统模仿学习/RL 只能“学会”而难以“忘掉”的缺口。
- Robust Adversarial Reinforcement Learning with Risk Sensitivity and Critic Consistency Regularization
- 赛道归属: 强化学习鲁棒性 / 对抗强化学习
- 核心创新点: 在对抗强化学习中同时引入风险敏感建模与 critic 一致性正则,缓解传统 RARL 中“对抗过强导致训练失稳”和“价值估计被扰动放大”的问题;其关键突破在于不只优化最坏情况收益,还通过风险偏好控制对极端扰动的敏感度,并约束 critic 在原始与对抗样本上的估值一致性,从而提升鲁棒性与训练稳定性。
- DCRL: Decoupling and Coupling Reinforcement Learning via Policy-Reward Manifold Alignment
- 赛道归属: 大语言模型推理优化 / 强化学习对齐
- 核心创新点: 从几何视角将 LLM 推理建模为由逻辑推导、评估与表征三部分构成的耦合流形,提出通过 policy-reward manifold alignment 来解耦与再耦合策略和奖励;该方法旨在缓解规则奖励/奖励模型训练中的不稳定与 reward hacking,通过显式对齐策略空间与奖励空间的结构关系,提升复杂推理任务中的优化可控性与泛化能力。
- EBRL: Asynchronous Embodied RL by Multi-Grained Resource Management
- 赛道归属: 具身智能 / 异步强化学习系统优化
- 核心创新点: 针对具身 RL 中仿真、动作生成与模型更新在 CPU/GPU 资源需求上的异构性,提出多粒度资源管理的异步训练框架;核心创新在于打破 rollout 与训练之间的同步屏障,并避免 rollout 阶段对 GPU 的独占式分配,从系统层面提升资源利用率与训练吞吐,减少硬件空转带来的效率损失。
HuggingFace Models
HuggingFace Datasets
- [2026-09-21] Harland/OmniVChat 🆕NEW
- [2025-05-12] DeepMostInnovations/saas-sales-conversations
世界动作模型
arXiv
- Rolling-WAM: World Action Models with Rolling Imagination 🆕NEW
- 赛道归属: 机器人操作 / World Action Model / 闭环动作规划
- 核心创新点: 提出 Rolling-WAM,将原本每个重规划周期内一次性完成的“联合视频-动作去噪”改为跨多个重规划周期滚动分摊执行;通过维护一个处于不同噪声阶段的滑动窗口式视频-动作块,在每一步仅更新部分状态,从而显著降低单次推理延迟、提升动作刷新频率与闭环响应速度,同时保持未来视觉预测与动作生成的一致性。
- Latent evolving World Action Model
- 赛道归属: 世界动作模型 / 视频生成驱动的动作决策建模
- 核心创新点: 该工作围绕基于视频扩散模型的世界动作模型效率瓶颈展开,提出以“潜空间演化”为核心的建模思路,弱化对大规模视频生成预训练骨干的依赖。其关键突破在于不再完全依赖重型视频扩散主干来提取动作生成所需特征,而是直接在压缩潜变量空间中建模环境状态的动态演化与动作关联,从而在保持世界建模能力的同时显著提升训练与推理效率,并改善此类模型的可扩展性。
- The Right Future for Action: Learning Action-Relevant Predictive States in World Action Models
- 赛道归属: 世界动作模型 / 具身智能 / 视频表征学习
- 核心创新点: 针对"无生成式世界动作模型(WAMs)"中表征学习目标不明确的问题,提出了一套表征诊断框架,揭示了三个关键发现:(1) 未来变化可预测性强的表征并不必然使线性动作解码更容易;(2) 观测到的未来变化能提供超越当前帧的额外动作信息;(3) 线性可读的动作信息在空间上具有集中分布特性。基于此,提出学习"动作相关预测状态"的方法,明确界定了WAM内部视频特征在控制任务中应保留的信息类型,为WAM表征设计提供了理论指导。
- ME-Dex 1.0: Bringing Heterogeneous Tactile Sensing into World Action Modeling
- 赛道归属: 具身智能 / 世界动作模型 / 多模态触觉感知
- 核心创新点: 提出将异构触觉传感信号纳入世界动作模型的统一建模框架(ME-Dex 1.0)。核心突破在于不再将触觉特征仅作为条件输入,而是将未来触觉状态、视觉观测与机器人动作进行联合预测,使触觉信号与视频信号一样被视为世界状态演化的观测序列。这一设计使模型能够在物理交互层面形成更完整的多模态世界状态表征,弥补了纯视觉世界模型在接触力学感知上的盲区。
- CSWAM: Better Causal Semantic Representations for Out-of-Distribution Generalization in World Action Models
- 赛道归属: 世界动作模型(World Action Model)/ 具身智能 / 分布外泛化
- 核心创新点: 针对 FastWAM 类世界动作模型在视觉分布偏移下泛化能力差的问题,提出因果语义世界动作模型(CSWAM)。核心突破在于:①将重建导向的表征替换为因果语义表征,剥离外观特异性细节,聚焦任务相关的状态变化与运动信息,从而降低对视觉外观的过拟合;②在无观测历史的纯动作推理框架下,引入时序因果证据机制,增强模型在陌生视觉场景和未见物体下对任务相关状态变化的鲁棒识别能力。该方法从表征层面解决了世界动作模型在 OOD 场景下的泛化瓶颈,而非依赖更多数据或更大模型规模。
- Making Latent Evolution Explicit: Operator-Structured Transitions for World Action Models
- 赛道归属: 具身智能 / 世界动作模型 / 潜空间动态建模
- 核心创新点: 针对现有基于Transformer的潜空间世界动作模型中"状态转移"建模结构不合理的问题,提出以算子结构化(Operator-Structured)方式显式建模潜空间中的时序演化过程。核心突破在于将潜变量的转移从以token交互为中心的注意力机制中解耦出来,改为以时序演化为归纳偏置的算子形式,使潜空间中的状态转移过程更加显式、可解释,并与控制相关信息的传播逻辑更为一致,从而提升世界动作模型在潜空间预测中的结构合理性与泛化能力。
- DeltaWAM: Delta World Action Models for Bimanual Manipulation 🆕NEW
- 赛道归属: 机器人操作 / World Action Model / 双臂操控
- 核心创新点: 提出 DeltaWAM,用“增量变化”替代对完整未来帧的密集建模,重点预测场景中真正发生变化的部分,从而减少对大面积静态内容的重复建模,并削弱动作条件动态与外观噪声之间的耦合;在推理阶段进一步通过更轻量的增量式视频专家加速少步动作生成,提升双臂操作场景下的效率与控制精度。
- AffordanceWAM: Affordance-Aware Joint World-Action Modeling for Robot Manipulation
- 赛道归属: 世界动作模型 / 机器人操控 / 具身智能
- 核心创新点: 提出AffordanceWAM,将可供性(Affordance)感知与生成式世界-动作联合建模相融合,核心创新在于引入以物体为中心的时空可供性表征,同时桥接两类异质数据源——带动作标注的机器人视频(监督控制)与无动作标注的以自我为中心的人类视频(提供交互多样性)。通过可供性作为中间语义锚点,解决了机器人与人类视频在动作标注、具身形态和外观上的域差异问题,实现了对"场景如何演化、在哪里可以交互、如何执行动作"三个层次的统一建模,提升了机器人操控的泛化能力。
由 Research Daily 自动生成 生成时间: 2026-09-25 05:31:18