AI 每日进展速报 - 2026-09-28
新旧
正在统计...
来源
当前筛选条件下没有条目。
数据状态 / Data Status
- GitHub 数据源本次没有返回条目;可能是暂无匹配结果,也可能是接口异常,请结合日志确认。
图像生成/编辑
arXiv
- Amplify What You Gaze At: Target Saliency Boosting in Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图 / 可控生成
- 核心创新点: 提出“目标显著性增强”这一新任务,关注在不依赖任何视觉先验的前提下,提升文本生成图像中指定对象的视觉注意力占比。方法上强调显著性是相对属性,通过联合建模目标对象与全局场景的注意力分配关系,实现对目标对象“更醒目”的生成控制,而不仅仅是位置、属性或数量的控制。
- InGuard: Towards Generalized Inner Guardrail for Safe Text-to-Image Generation
- 赛道归属: 文生图安全对齐 / 安全生成
- 核心创新点: 提出“内置式”安全护栏思路,将安全约束从传统的生成前/生成后外部分类器,转移到扩散模型内部表示与生成过程之中;通过利用模型自身的中间表征进行风险识别与抑制,增强对 NSFW 等风险内容的泛化拦截能力,减少外部护栏与生成模型脱节带来的漏检问题。
- Beyond Emotion Prompts: Fine-Grained Text-to-Image Generation Driven by Valence-Arousal-Dominance
- 赛道归属: 文生图 / 情感可控图像生成
- 核心创新点: 提出EMOTRANS框架,将心理学中经过验证的VAD(效价-唤醒度-支配度)三维情感坐标系转化为独立于内容描述的生成条件。核心突破在于将情感控制从模糊的自然语言提示中解耦出来,赋予情感维度可量化、可排序的连续控制尺度,使创作者无需修改内容描述即可精细调控图像所传递的情感强度与类型,解决了自然语言情感提示语义不稳定、缺乏细粒度控制的根本缺陷。
- Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation
- 赛道归属: 文生图 / 多样性与公平性优化
- 核心创新点: 提出"多轴 Max@K"强化学习目标,将文生图的多样性问题形式化为"目标模式覆盖"任务。核心突破在于设计了一种基于分组的RL训练范式:在同一提示词下采样K张图像,以组为单位计算奖励,鼓励模型在单次生成批次中覆盖尽可能多的预定义语义模式(如不同人口统计属性)。相比逐样本优化,该方法从根本上改变了奖励信号的计算粒度,使扩散模型能够主动探索并覆盖多样化的视觉模式,同时缓解人物类提示词中的人口统计偏差问题。
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- 赛道归属: 文生图加速 / 少步采样 / CFG 蒸馏
- 核心创新点: 面向少步文生图推理中的 CFG 蒸馏问题,引入信息瓶颈约束来指导蒸馏过程,使模型不再采用全局静态、粗粒度的 guidance 注入方式,而是学习更具选择性的条件信息传递机制;该方法旨在在显著减少采样步数的同时,尽量保留 CFG 轨迹中的关键语义与视觉质量,从而提升少步生成的效率与稳定性。
- OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图 / 偏好优化
- 核心创新点: 提出面向对象级细粒度对齐的自我改进偏好优化框架,针对颜色、形状、空间关系等属性错误进行优化。其关键突破在于以对象为中心构建偏好信号,并通过自举式的自我改进机制降低传统DPO/GRPO在偏好构造与训练上的高成本,使模型能够更高效地提升文本-图像的局部语义一致性与属性遵循能力。
- AdaPilot: Towards Scene-Adaptive Policy Learning for Cross-Generator Text-to-Image Quality Optimization
- 赛道归属: 文生图质量优化 / 跨生成器图像生成控制
- 核心创新点: 提出面向不同场景自适应的质量优化策略学习框架 AdaPilot,将“图像质量提升”从依赖单一生成器的局部优化,推进到可跨生成器迁移的通用策略学习。其关键突破在于不再仅针对某个特定模型做微调或提示词搜索,而是通过学习场景感知的决策策略,在多轮视觉反馈下动态调整优化动作,从而实现对不同文本到图像生成器的泛化适配与质量提升能力迁移。
- HyperErase: Scale-Calibrated Hypernetwork for Multi-Concept Erasure in Text-to-Image Models 🆕NEW
- 赛道归属: 文生图 / 概念擦除 / 安全对齐
- 核心创新点: 提出尺度校准的超网络框架,用于多概念擦除场景下的动态参数生成与适配。相较于静态冻结式adapter,该方法通过超网络按不同概念与提示分布生成可调权重,缓解多概念叠加时的参数干扰与泛化不足问题,从而提升概念擦除在多样提示和多目标安全约束下的稳定性与可扩展性。
- IMPLICIT-Bench: Measuring Implicit Bias in Text-to-Image Models under Neutral Prompts
- 赛道归属: 文生图 / 模型偏见评测
- 核心创新点: 提出IMPLICIT-Bench基准,专门针对"中性提示下的隐式偏见"这一此前被忽视的评测盲区。与现有基准依赖显式槽位模板(如"[职业]的照片")不同,该工作聚焦于当人口统计属性未被明确指定时模型仍会输出刻板印象的隐式偏见现象,构建了基于自然提示的系统性评测体系,从方法论上填补了T2I模型偏见评估从"显式属性探测"向"隐式语境偏见测量"的跨越。
- PixelART: Image-to-Layer Decomposition without Latents or Text-to-Image Pretraining
- 赛道归属: 图像编辑 / 图层分解
- 核心创新点: 提出PixelART,彻底摒弃了现有图层分解方法对大型预训练文生图模型、RGBA自编码器及可变层数架构模块的依赖,转而在像素空间中从零训练一个基于整流流(Rectified Flow)的Transformer模型。核心突破在于证明图像到可编辑RGBA图层的分解任务本身并不需要依托潜空间扩散模型或文生图预训练的重量级组件,以更轻量、更纯粹的架构实现了同等乃至更优的元素级图层分解能力,重新审视并简化了该任务的设计范式。
HuggingFace Models
HuggingFace Spaces
视频生成/编辑
arXiv
- WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
- 赛道归属: 文生视频提示词优化 / 视频生成前端规划
- 核心创新点: 提出面向“导演级”视频创作的提示词增强模型,将文本提示从简单描述提升为可执行的电影化分镜计划;通过在大规模真实视频数据上训练,学习对动作编排、镜头运动、光照变化、场景切换与声音节奏等要素进行结构化重写与补全,从而显著增强复杂长视频生成中的条件表达能力与生成可控性。
- CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation
- 赛道归属: 视频生成(物理一致性文生视频)
- 核心创新点: 提出CompAdapt框架,针对现有文生视频模型无法正确建模物理动力学的问题,设计了一种可自适应的复合运动建模机制。核心突破在于:能够同时处理多种类型的复合运动(而非单一运动类型),无需人工指定物理参数,并具备对未见物理规律的泛化能力。通过将显式物理动力学先验与扩散模型生成过程有机结合,实现了更具物理一致性的视频生成。
- TempQ-Jail: Query-Constrained Candidate Ranking for Text-to-Video Jailbreak Attacks 🆕NEW
- 赛道归属: 视频安全攻防 / 文生视频越狱攻击
- 核心创新点: 将文本到视频(T2V)越狱从“寻找更强攻击样本”重构为“在查询预算受限条件下的候选分配与排序”问题,针对受限评测场景设计了 TempQ-Jail。方法上通过融合多种异构攻击机制扩大候选覆盖面,再对每个候选的端到端攻击效果进行估计与排序,从而在无法大规模试错的情况下优先选择高收益候选,提高有限查询下的攻击效率与命中率。
- MotionSpec: Spectral Trajectory Supervision for Motion-Consistent Video Generation
- 赛道归属: 视频生成 / 文生视频 / 运动一致性建模
- 核心创新点: 提出基于运动轨迹频谱监督的训练思路,将视频中的时序运动从像素级外观约束提升到更具结构性的轨迹表示上进行优化。该方法通过对运动轨迹的频域特征施加监督,显式约束动作演化的连续性、平滑性与一致性,从而缓解传统生成目标对“单帧真实、跨帧不稳”问题监督不足的缺陷。其关键价值在于把复杂运动的时序一致性问题转化为可学习的谱域约束,增强长时运动生成的物理合理性与结构稳定性。
- Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding
- 赛道归属: 视频生成(身份保持/人物一致性)
- 核心创新点: 提出基于"槽(Slot)"的时序身份编码机制,突破了现有方法仅依赖单张参考图像的局限。核心创新在于从参考视频片段中提取多帧、多视角的身份特征,通过槽注意力机制将动态变化的身份线索(表情、姿态、光照)聚合为结构化的时序身份表示,从而有效解决了单帧参考导致的人脸变形、姿态锁定和身份漂移问题,实现了在大幅视角/表情变化下的鲁棒身份保持视频生成。
- TrafficImag: A Benchmark for Counterfactual Roadside Traffic Video Generation 🆕NEW
- 赛道归属: 视频生成 / 反事实视频生成 / 自动驾驶交通场景基准
- 核心创新点: 提出首个面向路侧交通场景反事实视频生成的基准 TrafficImag,专门评测“修改指定交通参与者后,未来视频是否仍保持道路拓扑与无关交通流一致性”的生成能力。该工作不仅构建了大规模路侧数据资源,还围绕反事实编辑这一更细粒度、更具因果约束的任务设计评测体系,使模型能力从传统的感知、预测扩展到受约束的未来视频合成与一致性保持。
- MVAgent: Multi-Agent Video Generation via Consistent Condition Construction and Shot-Level Policy Optimization 🆕NEW
- 赛道归属: 视频生成 / 多智能体协同生成 / 分镜级视频合成
- 核心创新点: 针对多镜头、多角色视频生成中“角色外观一致、跨镜头空间布局稳定、角色状态连续”难以同时满足的问题,提出 MVAgent,将任务重构为“条件构造”而非直接依赖重复文本提示。方法上采用多智能体流水线,通过类型化条件输入协同生成各镜头所需约束,并结合环境图像提供视角相关信息;同时引入镜头级策略优化,在分镜粒度上学习如何构造更有效的条件,从而提升跨镜头一致性与长程叙事连贯性。
- AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation
- 赛道归属: 音视频联合生成 / 多模态强化学习后训练
- 核心创新点: 提出模态锚定的解耦扩散强化学习框架,将音频与视频两条生成塔的优化过程分离,并通过模态锚点缓解多模态奖励耦合带来的信用分配困难;该方法针对文本对齐、单模态保真度与跨模态同步三个目标进行联合后训练,在强化学习阶段实现更稳定的多目标优化,提升音视频生成的一致性与协调性。
- SALI: Shot-Aware Late Interaction for Cross-Shot Relation Matching in Text-to-Video Retrieval using Film-Grammar Knowledge
- 赛道归属: 文本到视频检索 / 跨镜头关系匹配
- 核心创新点: 引入基于电影语法知识的 shot-aware late interaction 机制,突破传统“单一视频向量”表示对跨镜头人物关系建模不足的问题;方法先从查询中显式抽取主体与客体,再在镜头级别进行细粒度交互匹配,以保留诸如正反打、对话对切等跨镜头关系信息,从而更准确地识别文本中描述的人物交互与叙事关系。
- The Past Frames the Future: Memory for Autoregressive Video Generation
- 赛道归属: 视频生成 / 自回归视频生成 / 长时序记忆建模
- 核心创新点: 针对自回归视频生成在长序列扩展中面临的上下文窗口受限、历史信息衰减和身份/状态漂移问题,引入记忆机制来保留并检索关键过去帧信息。该工作强调将“过去”作为显式可访问的外部记忆,用于补足仅依赖有限上下文进行滚动预测时的历史缺失,从而提升长程生成中的实体一致性、场景连续性和状态演化稳定性。其方法论突破在于把视频生成从纯粹的局部因果预测,推进到带有长期记忆检索与状态保持能力的序列建模框架。
音频生成
arXiv
- Interactive TTS: Dynamic Speaking Style Adaptation for Expressive Speech Synthesis
- 赛道归属: 文本转语音(TTS)/ 对话式语音合成 / 风格自适应
- 核心创新点: 针对多轮多模态交互中说话风格动态适应问题,提出 InteractiveTTS 框架。核心突破在于将隐式端到端的上下文风格建模拆解为显式的两阶段流程:先从对话上下文中显式预测风格标签(解耦风格决策与声学生成),再以此为条件驱动语音合成。这一设计使风格决策可监督、可解释,同时通过解耦音色、内容与风格三者的表示,有效缓解了多轮合成中的音色漂移(timbre drift)问题,并增强了指令跟随能力。
- TinyAudio: Compact and Efficient Text-to-Audio Generation for Low-Resource Deployment 🆕NEW
- 赛道归属: 文生音频(Text-to-Audio)生成 / 轻量化端侧部署
- 核心创新点: 提出面向低资源部署的紧凑型文本到音频生成框架 TinyAudio,采用基于 flow-matching 的单流 Transformer(TA-DiT)作为主干,在保持生成能力的同时显著压缩参数规模;同时配套设计音频对齐文本编码器 TA-CLAP 与音频 VAE(TA-VAE),形成从文本语义对齐、潜空间建模到音频重建的轻量化闭环。该工作的关键突破在于将高质量 TTA 生成从大参数模型范式推进到可端侧落地的高效架构,并通过模块化设计兼顾生成质量与计算/存储效率。
- ReaFlow-TTS: Realization-Conditioned Flow Matching for High-Quality and Controllable Speech Synthesis
- 赛道归属: 文本到语音生成(TTS)/ 可控语音合成
- 核心创新点: 提出 realization-conditioned flow matching 框架,将“同一文本条件下不同语音实现”显式纳入建模,而不是只学习其条件均值速度场;通过对实现差异进行条件化,缓解确定性流匹配对多样性与可控性的折中问题,并为语音属性操控提供更具语义可解释性的接口,从而提升合成质量与可控性。
- UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation
- 赛道归属: 文生音频生成 / 音频表示学习与生成联合建模
- 核心创新点: 提出联合学习连续音频分词器与潜空间流匹配生成模型的框架,打破传统“先重建、后冻结”的两阶段范式。该方法不再将tokenizer仅作为重建工具,而是让表示学习与生成目标协同优化,使潜空间更适配文本到音频生成任务,从而提升生成质量与表示效率。
- TTS-Guard: Black-Box Ownership Verification of Text-to-Speech Models via Adaptive Adversarial Speaker-Pair Fingerprints
- 赛道归属: 文本转语音(TTS)模型安全与版权保护
- 核心创新点: 提出了一种针对TTS模型的黑盒所有权验证框架TTS-Guard。核心创新在于设计了"自适应对抗说话人对指纹"机制:通过构造一对对抗性说话人样本作为模型指纹,使得目标模型在该说话人对上的输出行为呈现出可统计验证的特异性差异,而无需访问模型内部参数。该方法专门针对语音信号的连续波形特性和人类听觉感知约束进行设计,能够在常规信号处理(如压缩、重采样)破坏扰动后仍保持指纹的鲁棒性,填补了TTS模型知识产权保护领域的空白。
- COT-TTS: Audio Context-Aware Text-to-Speech with Chain-of-Thought Reasoning
- 赛道归属: 文本转语音(TTS)/ 上下文感知语音合成
- 核心创新点: 提出COT-TTS框架,将链式思维(Chain-of-Thought)推理机制引入TTS任务。核心创新在于:系统不依赖用户显式指定的风格指令,而是以历史对话音频作为上下文输入,通过CoT推理过程自动推断目标文本应采用的说话风格(语气、情感、节奏等),再驱动语音合成。这一范式将TTS从"指令驱动"升级为"上下文推理驱动",使合成语音的风格能够自然地与对话语境保持一致,更贴近真实人类对话场景。
- Tracing and Relearning Detection Evidence in Text-to-Speech Systems 🆕NEW
- 赛道归属: 语音合成安全 / 深度伪造检测 / TTS 可检测性分析
- 核心创新点: 通过受控重合成与检测器适配,系统追踪文本转语音(TTS)流水线中“检测证据”究竟来自哪一阶段,重点区分声码器重建与声学生成对可检测性的贡献。方法上先固定声码器以排除重建伪差,再通过对抗式微调声学生成模块,观察检测器分离能力的变化,从而证明检测信号主要源于声学生成阶段而非单纯的声码器重建差异。该工作的重要价值在于把“黑盒检测”问题转化为可归因、可干预的机制分析,为后续构建更稳健的合成语音检测器提供了方法论基础。
- EditVoice: Variable-Length Non-Autoregressive Zero-Shot TTS and Speech Editing with Edit Flows
- 赛道归属: 文本到语音生成(TTS)/ 语音编辑 / 零样本语音合成
- 核心创新点: 提出 Edit Flows,将语音生成建模为基于插入、删除、替换的编辑过程,实现对语音内容与序列长度的联合更新;首次将变量长度的非自回归零样本 TTS 与文本驱动语音编辑统一到同一框架中,并通过 speech-infilling 训练范式让模型在生成与编辑之间共享能力,从而摆脱传统 NAR TTS 需要预先指定目标长度的限制。
- Depth through recurrence: Looped transformers for flow-matching TTS
- 赛道归属: 文本到语音生成(TTS)/ Transformer 结构优化 / 流匹配建模
- 核心创新点: 研究通过循环复用(recurrence)组织 Transformer 深度的方式,在流匹配 TTS 中系统比较不同权重共享布局对性能与参数效率的影响;提出的 SEQUENCE 布局通过按固定顺序重复调用各层,在保持可比的可懂度、说话人相似度和语音质量的同时,显著减少参数量,说明“深度组织方式”本身可以成为提升 TTS 推理效率的重要设计维度。
- BanglaKontho: Closing the Long-Form Gap in Bangla Text-to-Speech
- 赛道归属: 文本到语音生成(TTS)/ 低资源语音合成 / 数据集构建
- 核心创新点: 构建并发布面向孟加拉语长文本朗读场景的单说话人 TTS 数据集 BanglaKontho,填补现有公开语料偏短句、缺少长篇连贯韵律与稳定单说话人叙述的缺口;同时提供可复用的基线系统与评测设置,为低资源语言的长篇语音合成、韵律建模和数据集标准化提供了基础设施。
HuggingFace Models
语言大模型
arXiv
- When Context Misleads: In-context Learning with Jurisdiction in Large Language Models
- 赛道归属: 大模型推理与上下文学习鲁棒性评估
- 核心创新点: 该工作聚焦于 In-Context Learning 中“上下文权威性(context authority)”这一被忽视的能力,即模型不仅要从示例中归纳模式,还要判断上下文信息是否应当主导最终答案。论文提出 FakeContextBench,通过跨七个领域的伪科学陈述构建评测集,系统检验模型在“上下文是否可信、是否应被采纳”上的判断能力,从而揭示现有 ICL 后训练方法在面对误导性上下文时的脆弱性,并补足了传统只看模式提取而忽略上下文裁决的评测空白。
- Representation-guided in-context learning for medical image interpretation with multimodal large language models
- 赛道归属: 多模态大模型 / 医学图像理解
- 核心创新点: 提出表示引导的上下文学习(RG-ICL)框架,核心突破在于无需任何任务特定微调即可适配医学图像解读任务。通过冻结的视觉编码器检索与查询图像语义对齐的示例作为上下文演示,将检索增强与上下文学习结合,绕过了传统领域适配中资源密集型参数更新的瓶颈。在组织病理学、放射影像和视网膜眼底镜等八个跨模态医学数据集上验证了其泛化能力。
- Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning
- 赛道归属: 具身智能 / 神经符号规划 / 强化学习
- 核心创新点: 提出一种将符号规划、强化学习与大语言模型结合的混合式架构,用于处理开放世界中的“新颖性”障碍;当传统规划器因缺少新对象相关算子而无法生成计划时,系统通过LLM辅助识别新对象与任务语义,再结合RL学习补足可执行操作策略,从而实现对未知环境变化的自适应规划与行动。
- From Concept Alignment to Causal Grounding: An Intervention Test of Chain-of-Thought Faithfulness
- 赛道归属: 大语言模型推理 / 思维链可解释性
- 核心创新点: 将思维链(CoT)的忠实性问题重新定义为内部概念因果锚定问题,而非传统的输入-输出行为分析。通过干预测试(intervention test)检验LLM的CoT推理是否激活了与直接预测相同的内部概念表征,并进一步验证这些共享概念是否对最终答案具有因果驱动作用。这一框架从模型内部计算层面揭示了CoT是否真正参与推理,而非仅作表面文字对齐。
- Nonparametric In-Context Learning under Growing Geometric Complexity: Minimax Optimality and Local Geometry-Adaptivity of Transformers 🆕NEW
- 赛道归属: 推理优化 / 理论分析 / 机器学习理论
- 核心创新点: 从非参数在上下文学习(ICL)的理论角度出发,研究 Transformer 在几何复杂度逐渐增长、且局部几何结构未知的数据上的学习能力,突破了以往主要局限于欧氏空间或单一流形的分析框架。该工作建立了面向未知局部几何的非参数预测理论,重点刻画 Transformer 如何利用任务相关的局部结构,并给出最小极大最优性与局部几何自适应性的理论结论,说明其在复杂异质几何数据上的学习具有统计最优性与结构适应性。
- DIAL: Position-Debiased LLM Judges with Adaptive Human Preference Calibration 🆕NEW
- 赛道归属: LLM评测 / 偏好对齐 / 人类反馈校准
- 核心创新点: 提出 DIAL 框架,将大量 LLM 两两比较与少量人工比较统一建模,用于同时分离“位置偏置”与真实偏好结构,并将去偏后的 LLM 偏好进一步校准到人类偏好空间。方法上通过显式建模评审顺序带来的系统性偏差,学习共享的去偏偏好表示,再利用有限人工标注进行自适应校准,从而提升 LLM-as-a-judge 的稳定性、可解释性与人类一致性。
- Cheap, open agents make LLM pollution harder to mitigate 🆕NEW
- 赛道归属: LLM安全 / 数据污染检测 / Agent评测
- 核心创新点: 研究开放权重模型与开源 Agent 框架普及后,LLM 污染(synthetic response contamination)更难被缓解的问题,系统比较了多种 Agent 配置在问卷任务中的表现与可检测性。该工作的重要价值在于揭示“低成本、可自动化”的开放式 Agent 会显著放大污染风险,并从实验上评估不同开放/闭源组合在生成行为与可识别性上的差异,为后续的数据治理、污染检测和采样防护机制提供了实证依据。
- Same Text, Different Numbers: The Divergence of LLM-Based Measures 🆕NEW
- 赛道归属: LLM评测 / 文本量化建模 / 企业文本分析
- 核心创新点: 系统检验了基于 LLM 的文本测度在不同模型之间的一致性,发现同一文本在不同模型下生成的企业文本指标存在显著分歧,跨模型排序相关性整体偏低。该工作的方法论贡献在于将“模型选择”作为文本量化研究中的关键不确定性来源进行量化评估,表明 sentiment、uncertainty、clarity 等常用指标并非天然稳健,从而对依赖 LLM 生成变量的实证研究提出了可重复性与稳健性方面的重要警示。
- Financial Fragility in Societies of LLM Agents: Coordination Failures and Stabilizing Mechanisms 🆕NEW
- 赛道归属: 多智能体系统 / 金融决策安全 / 协同博弈
- 核心创新点: 构建 FRAIL 实验框架,将 LLM Agent 放入银行挤兑、债务展期和奖励众筹等动态金融环境中,研究个体“自我保护”决策如何在群体层面诱发协调失败与系统性脆弱性。该工作强调金融 AI 安全不能只看单个 Agent 的局部最优,而要分析多 Agent 交互下的集体动力学,并进一步探索稳定机制以缓解由局部理性导致的整体失稳问题。
- Effects of Transcript Compression on LLM-based Medical Misinformation Detection in Japanese YouTube Videos 🆕NEW
- 赛道归属: 医疗信息检测 / 长文本理解 / 证据压缩
- 核心创新点: 聚焦日语医疗 YouTube 视频中的错误信息检测,系统比较了完整转录、摘要、检索增强生成(RAG)与 claim screening 等多种 transcript 压缩输入方式对 LLM 事实判别性能的影响。该研究的关键贡献在于揭示:长文本输入并非越完整越好,压缩策略会显著改变模型的 veracity classification 表现;因此,如何在信息保真与输入长度之间做结构化取舍,是 LLM 处理长视频医疗内容时的重要方法问题。
HuggingFace Datasets
- [2026-09-26] XiaomiMiMo/MiMo-V2.6-RL-oss 🆕NEW
- [2026-09-24] MoreThought/Fable-5.1-Max-Reasoning-Filtered-10000x
- [2026-09-06] openbmb/UltraData-SFT-Agent-2609
多模态大模型
arXiv
- PRISM-VLM: A Multi-Axis Discriminative Benchmark for Compact Vision-Language Models
- 赛道归属: 多模态理解 / 视觉语言模型评测基准
- 核心创新点: 提出一个面向紧凑型视觉语言模型的多轴判别式评测基准 PRISM-VLM,突破了传统“单一准确率”式评测范式。该工作将样本从多个维度进行细粒度打分,覆盖模型常见失效模式,从而能够更全面地区分不同模型在任务质量、鲁棒性、行为偏差等方面的差异,提升了对小型 VLM 能力边界与短板的诊断能力。
- SalQ-VLM: Fine-Grained Saliency-Guided Quantization for Vision-Language Models
- 赛道归属: 多模态理解 / 推理优化(视觉语言模型量化压缩)
- 核心创新点: 针对视觉语言模型(VLM)的后训练量化(PTQ)问题,提出了细粒度显著性引导量化方法 SalQ-VLM。核心突破在于识别并解决了VLM激活中两类固有挑战:一是视觉与语言模态间的激活分布异质性,二是跨层的激活尖峰问题。通过引入显著性感知的细粒度量化策略,对不同模态和不同重要性的激活区域施加差异化的量化精度,在保持模型性能的同时大幅降低内存占用和推理开销,填补了PTQ在VLM领域研究不足的空白。
- Cross-Modal Attention Acts as a Frequency Filter: Why Verbose Prompts Improve Robustness in Vision-Language Models
- 赛道归属: 多模态理解 / 视觉-语言模型鲁棒性分析
- 核心创新点: 该工作从频域视角揭示了视觉-语言模型(VLM)在图像噪声干扰下鲁棒性变化的内在机制。核心发现是:跨模态注意力机制本质上充当了一个频率滤波器——文本提示的措辞方式会显著影响模型对图像高频噪声的敏感程度。具体而言,冗长/描述性的提示(verbose prompts)能够引导跨模态注意力更多聚焦于图像的低频语义信息,从而抑制高频噪声干扰,提升鲁棒性;而语义复杂或细粒度的问题则相反,会使模型更依赖高频细节,导致在图像损坏时性能大幅下降。这一发现从机制层面统一解释了提示措辞对VLM鲁棒性产生截然相反影响的现象,为提示工程和模型鲁棒性优化提供了新的理论依据。
- Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
- 赛道归属: 多模态理解 / 情感推理 / 可解释性分析
- 核心创新点: 提出基于跨模态信息流的因果归因框架,用 steering vector 对 LVLM 内部情感表征进行干预与追踪,分析视觉刺激如何逐步转化为情绪叙事;通过构建情感电路的可解释路径,定位模型中负责情绪理解的关键跨模态通路,并进一步验证和增强这些电路,从机制层面提升情感理解能力
- From Reward Signal to Visual Utility: A Controlled Audit of Medical VLM Post-Training 🆕NEW
- 赛道归属: 医疗多模态理解 / VLM后训练评估
- 核心创新点: 该工作不是单纯追求答案准确率,而是通过受控审计系统性分析医疗VLM后训练目标与“图像条件化决策”之间的关系。作者对比了仅语言侧LoRA、扩展到多模态模块的适配、标准仅答案监督的GRPO,以及引入反事实证据目标等多种后训练策略,重点考察模型是否真正利用了视觉证据而非依赖语言先验。其方法价值在于把“性能提升”与“视觉可用性”解耦评估,揭示不同训练目标对模型证据使用能力的真实影响,为医疗VLM后训练提供了更可靠的诊断框架。
- FLIP: Final Layer Inference-Time Probing for Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 视觉语言模型可解释性与推理探测
- 核心创新点: 该工作提出FLIP,通过在推理阶段对VLM最终层归一化隐藏状态施加元素级截断/钳制,来测试某个logit-facing干预点是否承载结构化、任务相关的计算,而不仅仅是引起泛化扰动。其关键创新在于把“内部干预导致行为变化”这一现象拆解为可区分的机制假设:是否更好利用视觉证据、是否只是输出不稳定、或是否直接退化。FLIP将探测位置固定在最终层,并以推理时轻量干预的方式实现机制审计,适合用于分析开源VLM的决策表征与任务依赖性。
- FRESHLATENT: Channel-Aware Latent Adaptation for Resource-Constrained Embodied VLM Perception 🆕NEW
- 赛道归属: 具身多模态感知 / 分裂式VLM部署与通信鲁棒性
- 核心创新点: FreshLatent面向资源受限的UAV具身场景,针对分裂式VLM在“端侧编码—无线传输—云/边端解码”链路中因信道腐化导致的部署失配问题,提出了一个轻量级的信道感知潜变量适配器。其核心方法是训练一个功率归一化的编码器-解码器,使中间特征在无线扰动下仍保持可恢复性,同时兼顾机载算力与通信开销约束。创新点在于把通信信道条件显式纳入VLM感知表征学习过程,而不是仅依赖离线干净特征,从而提升真实部署中的鲁棒性与可用性。
- ProCAP: Probabilistic Cross-Attentive Prompt Learning for Vision-Language Models 🆕NEW
- 赛道归属: 少样本视觉语言学习 / 提示学习
- 核心创新点: ProCAP提出概率化的交叉注意力提示学习框架,用于增强冻结式VLM在少样本和分布偏移场景下的适应能力。与传统仅在单模态分支上做轻量prompt调参的方法不同,ProCAP通过概率建模与跨模态交互机制,强化视觉与文本分支之间的耦合,使提示参数不仅编码类别信息,还能更稳健地吸收跨模态对齐信号。其方法突破主要体现在:在参数高效前提下提升跨模态协同建模能力,从而缓解低样本条件下提示学习易脆弱、泛化不足的问题。
- The Alignment Illusion in Multimodal Large Language Models
- 赛道归属: 多模态大模型 / 对齐机制分析 / 表征可解释性
- 核心创新点: 通过对视觉流进行受控替换实验,系统检验 MLLM 中“层间视觉-文本相似度”是否真的代表跨模态内容融合;结果表明许多常用对齐指标可能只反映表面统计相关而非语义交互,揭示了“对齐幻觉”现象,从方法上纠正了对多模态表征对齐的传统解释框架
- Seeing Is Not Measuring: Tool-Augmented Metric Spatial Reasoning for Vision-Language Models
- 赛道归属: 多模态理解 / 空间推理 / 工具增强推理
- 核心创新点: 构建一个与底层预测器解耦的模块化工具增强框架,将 3D 目标检测、度量深度估计和确定性几何求解器引入 VLM,用于处理绝对距离、物体尺寸和方位等度量级空间问题;通过在对象最佳视角下进行检测并结合相机位姿进行几何计算,显著弥补了纯 VLM 在 3D 结构推理上的短板,实现从“描述场景”到“精确测量场景”的能力升级
强化学习
arXiv
- RL Starts before RL: On Policy Distillation for Better Reinforcement Learning
- 赛道归属: 大语言模型推理优化 / 强化学习训练策略
- 核心创新点: 提出“先蒸馏、后强化学习”的预训练式初始化思路,将 on-policy distillation 作为 RL 前的准备阶段,用更贴近目标策略分布的学生模型替代直接从监督微调或原始策略进入 RL;实验表明,这种初始化不仅提升起点性能,还能在后续 RL 中带来更高的最终性能,说明蒸馏的价值不只是加速收敛,而是改善了可优化性与最终可达上限。
- Survival Reinforcement Learning: Toward Scalable Self-Supervised RL
- 赛道归属: 自监督强化学习 / 目标条件规划
- 核心创新点: 提出"生存强化学习"(SRL)框架,以在线分类替代对比损失,通过最大化智能体在目标状态的"驻留时间"来学习生存价值函数。核心突破在于从根本上规避了对比学习中"均匀性-容忍度困境"(uniformity-tolerance dilemma),使得深度网络扩展时长视野目标条件规划不再退化,同时保留了CRL的深度可扩展性优势。
- PoEM: Predicting RL Outcomes from Existing Policies
- 赛道归属: 强化学习后训练评估 / RL结果预测
- 核心创新点: 提出一种无需实际执行强化学习即可预测“给定新奖励函数下RL后模型表现”的方法,直接基于已有策略与奖励信息估计RL结果,从而缓解传统RL后训练计算开销大、训练不稳定、且在奖励变化或多奖励组合时需要反复从头训练的问题。其方法价值在于把“训练前评估”前移到可预测层面,为奖励设计、策略选择和多目标后训练提供快速筛选能力。
- SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL
- 赛道归属: 工具调用智能体 / 强化学习优化
- 核心创新点: 针对工具调用轨迹中“结构化工具调用”和“面向用户的自然语言总结”混合输出带来的信用分配错误,提出细粒度的分段信用归因机制,解决标准GRPO类方法将同一个轨迹级优势值粗暴广播到所有token所导致的跨段误归因问题。该工作核心突破在于显式区分不同输出片段的功能角色,抑制总结段梯度噪声对工具决策token的污染,从而提升工具选择与调用决策的稳定性和可学习性。
- Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs for Agentic Reinforcement Learning
- 赛道归属: 智能体强化学习 / 步级信用分配优化
- 核心创新点: 通过构建轨迹图(trajectory graphs)来估计步级优势,突破了GRPO及其变体主要依赖轨迹级、组归一化优势而难以准确反映单步贡献的局限。该方法强调从轨迹结构中重建步骤之间的依赖与贡献关系,避免“整条轨迹失败但其中某些步骤有价值”被一并惩罚的问题,从而实现更精细的信用分配,提升面向推理与智能体任务的强化学习训练质量。
- ForgetMimic: Motion Unlearning for Reinforcement Learning Humanoid Control
- 赛道归属: 人形机器人控制 / 强化学习安全遗忘
- 核心创新点: 面向人形控制中的“动作删除”问题,提出 motion unlearning 框架,目标是在保留整体运动能力的同时,选择性移除特定动作模式;该工作将遗忘需求引入 RL 控制策略学习,强调对恶意、污染、低质量或受版权保护动作的定向消除,从方法上补足了传统模仿学习/RL 只能“学会”而难以“忘掉”的缺口。
- Robust Adversarial Reinforcement Learning with Risk Sensitivity and Critic Consistency Regularization
- 赛道归属: 强化学习鲁棒性 / 对抗强化学习
- 核心创新点: 在对抗强化学习中同时引入风险敏感建模与 critic 一致性正则,缓解传统 RARL 中“对抗过强导致训练失稳”和“价值估计被扰动放大”的问题;其关键突破在于不只优化最坏情况收益,还通过风险偏好控制对极端扰动的敏感度,并约束 critic 在原始与对抗样本上的估值一致性,从而提升鲁棒性与训练稳定性。
- DCRL: Decoupling and Coupling Reinforcement Learning via Policy-Reward Manifold Alignment
- 赛道归属: 大语言模型推理优化 / 强化学习对齐
- 核心创新点: 从几何视角将 LLM 推理建模为由逻辑推导、评估与表征三部分构成的耦合流形,提出通过 policy-reward manifold alignment 来解耦与再耦合策略和奖励;该方法旨在缓解规则奖励/奖励模型训练中的不稳定与 reward hacking,通过显式对齐策略空间与奖励空间的结构关系,提升复杂推理任务中的优化可控性与泛化能力。
- EBRL: Asynchronous Embodied RL by Multi-Grained Resource Management
- 赛道归属: 具身智能 / 异步强化学习系统优化
- 核心创新点: 针对具身 RL 中仿真、动作生成与模型更新在 CPU/GPU 资源需求上的异构性,提出多粒度资源管理的异步训练框架;核心创新在于打破 rollout 与训练之间的同步屏障,并避免 rollout 阶段对 GPU 的独占式分配,从系统层面提升资源利用率与训练吞吐,减少硬件空转带来的效率损失。
- Turning Safety into Competence: Minimally Exploitable Robot Policies via Safety-Filtered Reinforcement Learning
- 赛道归属: 机器人安全控制 / 竞争性强化学习
- 核心创新点: 提出两阶段的 Safety-Filtered RL,将“安全合成”和“竞争任务学习”解耦:先学习可过滤攻击与失败风险的安全策略,再在此基础上进行竞争性任务优化;该方法的关键价值在于把安全从与任务目标纠缠的联合优化问题,转化为可分离的前置约束能力,从而降低策略在对抗环境中的可利用性与脆弱性。
HuggingFace Models
HuggingFace Datasets
- [2026-09-27] FineEnvs/SmolDataEnvs 🆕NEW
- [2026-09-21] Harland/OmniVChat
世界动作模型
arXiv
- InternW0-$\Delta$: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data 🆕NEW
- 赛道归属: 机器人操作 / 世界动作模型(World Action Model)
- 核心创新点: 提出统一的世界动作模型预训练框架,将大规模开放数据中的视觉动力学、场景语义、几何结构与运动先验整合到同一模型中,实现“预测世界演化 + 生成机器人动作”的联合建模;通过20K+小时异构数据预训练,增强了模型对真实机器人操作场景的泛化能力,并在仿真与真机平台上取得优于现有方法的表现。
- Rolling-WAM: World Action Models with Rolling Imagination
- 赛道归属: 机器人操作 / World Action Model / 闭环动作规划
- 核心创新点: 提出 Rolling-WAM,将原本每个重规划周期内一次性完成的“联合视频-动作去噪”改为跨多个重规划周期滚动分摊执行;通过维护一个处于不同噪声阶段的滑动窗口式视频-动作块,在每一步仅更新部分状态,从而显著降低单次推理延迟、提升动作刷新频率与闭环响应速度,同时保持未来视觉预测与动作生成的一致性。
- Latent evolving World Action Model
- 赛道归属: 世界动作模型 / 视频生成驱动的动作决策建模
- 核心创新点: 该工作围绕基于视频扩散模型的世界动作模型效率瓶颈展开,提出以“潜空间演化”为核心的建模思路,弱化对大规模视频生成预训练骨干的依赖。其关键突破在于不再完全依赖重型视频扩散主干来提取动作生成所需特征,而是直接在压缩潜变量空间中建模环境状态的动态演化与动作关联,从而在保持世界建模能力的同时显著提升训练与推理效率,并改善此类模型的可扩展性。
- The Right Future for Action: Learning Action-Relevant Predictive States in World Action Models
- 赛道归属: 世界动作模型 / 具身智能 / 视频表征学习
- 核心创新点: 针对"无生成式世界动作模型(WAMs)"中表征学习目标不明确的问题,提出了一套表征诊断框架,揭示了三个关键发现:(1) 未来变化可预测性强的表征并不必然使线性动作解码更容易;(2) 观测到的未来变化能提供超越当前帧的额外动作信息;(3) 线性可读的动作信息在空间上具有集中分布特性。基于此,提出学习"动作相关预测状态"的方法,明确界定了WAM内部视频特征在控制任务中应保留的信息类型,为WAM表征设计提供了理论指导。
- ME-Dex 1.0: Bringing Heterogeneous Tactile Sensing into World Action Modeling
- 赛道归属: 具身智能 / 世界动作模型 / 多模态触觉感知
- 核心创新点: 提出将异构触觉传感信号纳入世界动作模型的统一建模框架(ME-Dex 1.0)。核心突破在于不再将触觉特征仅作为条件输入,而是将未来触觉状态、视觉观测与机器人动作进行联合预测,使触觉信号与视频信号一样被视为世界状态演化的观测序列。这一设计使模型能够在物理交互层面形成更完整的多模态世界状态表征,弥补了纯视觉世界模型在接触力学感知上的盲区。
- CSWAM: Better Causal Semantic Representations for Out-of-Distribution Generalization in World Action Models
- 赛道归属: 世界动作模型(World Action Model)/ 具身智能 / 分布外泛化
- 核心创新点: 针对 FastWAM 类世界动作模型在视觉分布偏移下泛化能力差的问题,提出因果语义世界动作模型(CSWAM)。核心突破在于:①将重建导向的表征替换为因果语义表征,剥离外观特异性细节,聚焦任务相关的状态变化与运动信息,从而降低对视觉外观的过拟合;②在无观测历史的纯动作推理框架下,引入时序因果证据机制,增强模型在陌生视觉场景和未见物体下对任务相关状态变化的鲁棒识别能力。该方法从表征层面解决了世界动作模型在 OOD 场景下的泛化瓶颈,而非依赖更多数据或更大模型规模。
- Making Latent Evolution Explicit: Operator-Structured Transitions for World Action Models
- 赛道归属: 具身智能 / 世界动作模型 / 潜空间动态建模
- 核心创新点: 针对现有基于Transformer的潜空间世界动作模型中"状态转移"建模结构不合理的问题,提出以算子结构化(Operator-Structured)方式显式建模潜空间中的时序演化过程。核心突破在于将潜变量的转移从以token交互为中心的注意力机制中解耦出来,改为以时序演化为归纳偏置的算子形式,使潜空间中的状态转移过程更加显式、可解释,并与控制相关信息的传播逻辑更为一致,从而提升世界动作模型在潜空间预测中的结构合理性与泛化能力。
- Keep the Future, Drop the Rollout: RIFT for World Action Models 🆕NEW
- 赛道归属: 机器人操作 / 世界动作模型推理加速
- 核心创新点: 针对WAM依赖迭代视频rollout带来的高时延问题,系统分析了“动作生成是否真的需要完整的未来轨迹”这一关键假设;通过闭环干预实验发现,动作执行更依赖未来表示而非逐步展开的rollout过程,从而提出可复用未来缓存、减少或替代rollout计算的思路,在保持控制效果的同时显著降低部署开销。
- Decoupling Intention from Trajectory: A Representational Deduction Framework for World Action Models 🆕NEW
- 赛道归属: 机器人操作 / 世界动作模型表征学习
- 核心创新点: 提出一种将“意图”与“轨迹”解耦的表征推导框架,指出现有WAM视觉分支主要学习静态观测预测,难以显式建模动作交互下的潜在状态转移;该方法通过分离高层物理状态演化信息与低层动作轨迹生成信号,缓解表征纠缠,使模型更准确地捕捉世界状态变化与动作规划之间的因果关系。
- DeltaWAM: Delta World Action Models for Bimanual Manipulation
- 赛道归属: 机器人操作 / World Action Model / 双臂操控
- 核心创新点: 提出 DeltaWAM,用“增量变化”替代对完整未来帧的密集建模,重点预测场景中真正发生变化的部分,从而减少对大面积静态内容的重复建模,并削弱动作条件动态与外观噪声之间的耦合;在推理阶段进一步通过更轻量的增量式视频专家加速少步动作生成,提升双臂操作场景下的效率与控制精度。
由 Research Daily 自动生成 生成时间: 2026-09-28 05:31:09