AI 每日进展速报 - 2026-09-03
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- SpatialGuard: Harness-Guided Verifiable Spatial Reasoning for Text-to-Image Generation
- 赛道归属: 文生图 / 空间推理增强
- 核心创新点: 提出 SpatialGuard 框架,在文本到图像生成流程中引入可优化、可验证的结构化空间中间表示("harness"),作为语言描述与视觉采样之间的几何桥梁。核心突破在于将3D空间关系(遮挡、可见性、相机约束等)显式编码为可校验的布局约束,从而在多轮生成中防止空间几何信息的退化,解决了现有提示驱动或布局条件方法缺乏可验证空间中间体的根本缺陷。
- T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图 / 评测基准
- 核心创新点: 提出首个专注于"局部语义控制"的文生图评测基准 T2LSC-Bench,核心创新在于定义并量化了"目标文本关联语义泄漏"现象——即在指定区域渲染目标文字时,对主体身份或周围场景语义造成非预期改变的问题。该基准系统性地评估模型在产品标签、标牌等应用场景下,能否在保持预定主体身份与场景语义不变的前提下,精准完成局部文字渲染,填补了现有评测体系对局部文字可控性考察的空白。
- RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing
- 赛道归属: 图像生成/编辑 · 奖励模型与对齐
- 核心创新点: 提出 RubricRM,一种基于动态评分标准(Rubric)的生成式奖励建模框架。与现有视觉奖励模型依赖单一标量分数或固定评估维度不同,RubricRM 能够根据不同的输入指令动态生成评估维度(Rubric),再基于这些维度进行成对比较打分。这一设计使奖励模型同时具备可解释性和任务自适应性,能够针对文生图和指令驱动图像编辑等不同任务的差异化需求灵活调整评估标准,突破了固定准则在多样化任务场景下泛化能力不足的瓶颈。
- Multi-Tool Image Editing Attribution in Facial Forgery 🆕NEW
- 赛道归属: 图像编辑 / 取证溯源
- 核心创新点: 突破了现有图像编辑归因方法"单工具假设"的局限,首次系统性地建模并解决多工具复合编辑场景下的归因问题。核心方法论创新在于处理不同编辑工具留下的伪影在图像中相互叠加、混合的复杂情形,能够从单张人脸图像中同时识别出多个参与编辑的AI工具,而非仅判断单一工具,更贴近真实世界中生成式AI滥用的复杂场景。
- AffectDelta: Beyond Emotion Labels for Image Editing 🆕NEW
- 赛道归属: 图像编辑 / 情感驱动生成
- 核心创新点: 提出超越单一情感类别标签的情感驱动图像编辑框架 AffectDelta,核心创新在于以"情感增量(Delta)"替代粗粒度情感类别作为编辑目标。传统方法将复杂情感状态折叠为单一标签,且依赖文本指令描述视觉变换,存在语义精度不足的问题。该工作通过建模情感空间中的方向性变化,实现更细粒度、更连续的情感视觉线索修改,同时保持场景整体构图与语义结构的一致性。
- SR-Edit: Region-Aware Image Editing via Self-Refinement 🆕NEW
- 赛道归属: 图像编辑 / 区域感知编辑
- 核心创新点: 提出基于自精炼(Self-Refinement)机制的区域感知图像编辑方法 SR-Edit,核心创新在于无需外部区域标注的前提下,通过模型自身的迭代自精炼过程自动推断编辑区域与非编辑区域的边界,并对非编辑区域施加一致性约束。相较于现有自动区域推断方法,该方法在精准修改目标区域的同时,对非目标区域的保真度保持更为严格,解决了外部区域标注难以获取与编辑溢出之间的核心矛盾。
- Blending Concepts: Benchmarking Visual Metaphor Generation in Text-to-Image Models 🆕NEW
- 赛道归属: 文生图 / 创意生成 / 评测基准
- 核心创新点: 提出首个专门评估文生图模型视觉隐喻生成能力的基准 VMetaphor-Bench,填补了该领域评测空白。核心创新在于将视觉隐喻这一高阶创意认知任务形式化为可量化的评测问题——即模型能否通过融合两个不同语义域的元素来传达抽象概念。基准包含1500个来自真实创意图像的视觉隐喻样本,系统性地揭示了当前T2I模型在抽象概念组合与跨域语义融合方面的能力边界。
- Domain shift-robust object detection with GenAI image editing 🆕NEW
- 赛道归属: 图像编辑 / 目标检测 / 数据增强
- 核心创新点: 将扩散模型驱动的生成式图像编辑引入目标检测的域偏移鲁棒性问题,核心创新在于利用生成式编辑技术在低数据场景下合成覆盖光照、天气、遮挡等多种域变化的训练样本,从而缓解检测器对训练分布视觉捷径的过度依赖。该方法无需大规模真实世界跨域数据采集,通过可控的图像编辑定向扩充训练分布,为专业化小样本场景下的域泛化提供了一条数据驱动的新路径。
- CameraEditor: Camera-Controlled Image Editing via Video-Prior Sequential Modeling
- 赛道归属: 图像编辑 / 相机视角控制
- 核心创新点: 提出 CameraEditor,将相机参数控制的图像编辑问题转化为视频先验序列建模任务。核心创新在于借助视频生成模型所蕴含的时序几何先验,将"视角变换前后的两帧图像"建模为视频序列中的起止帧,从而在大幅透视变换场景下同时避免结构撕裂和几何指令被忽略的双重困境,实现了显式相机参数驱动的高质量图像编辑。
- Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate
- 赛道归属: 文生图 / 安全对抗(Jailbreak攻击)
- 核心创新点: 针对现有文生图模型多层异构安全防护栈(文本过滤器、图像分类器、跨模态检测器组合),提出基于多智能体辩论(Multi-Agent Debate)的越狱攻击框架。核心突破在于将不同安全层的约束冲突显式建模,通过多智能体协作识别当前激活的约束层并针对性地绕过,解决了现有方法无法区分多层过滤器、难以适应异构安全栈的核心瓶颈。
GitHub
- [2026-09-03] pydantic/pydantic-ai ⭐19686
- [2026-09-03] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13352
- [2026-09-03] Osmantic/ODS ⭐5962
- [2026-09-03] sunchaokun/PPT-Design-Skill ⭐1184
- [2026-09-03] etkecc/baibot ⭐242 🆕NEW
视频生成/编辑
arXiv
- ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation 🆕NEW
- 赛道归属: 视频生成(角色一致性文生视频)
- 核心创新点: 提出 ContextAnyone 框架,核心突破在于将参考图像从传统的"条件信号"升级为"上下文令牌",通过上下文感知扩散机制,将参考图像的外观信息以独立上下文序列的形式注入去噪过程,避免了参考特征与噪声视频令牌直接交互导致的细粒度外观信息衰减问题,从而在角色经历大幅度姿态变化、运动变化和场景切换时,仍能保持单参考图像中角色的整体外观一致性。
- CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation
- 赛道归属: 文生视频 / 评测基准
- 核心创新点: 提出首个专门评估文生视频模型文化理解能力的综合基准 CultureVidBench,突破现有基准仅关注感知质量、物理合理性和文本对齐的局限,系统性地引入文化特定对象、动作、仪式、可见文字及音频线索等多维度文化评估指标,填补了T2V模型跨文化表征能力评测的空白。
- The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation 🆕NEW
- 赛道归属: 视频生成(脚本驱动音视频联合生成)
- 核心创新点: 针对现有联合音视频生成模型在精确时序控制上的缺失,提出"时序上下文路由"(Temporal Context Routing)机制,核心突破在于在共享时间轴的基础上引入专用的时序路由模块,显式建模镜头转换时刻与对话发生时刻的精确对齐关系,使模型能够依据脚本中的时序标注精准控制画面切换和语音起止点,解决了现有方法时序误差导致叙事连贯性破坏的问题,为脚本驱动的内容创作提供了细粒度时序可控能力。
- MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video Generation
- 赛道归属: 视频生成 / 相机控制视频生成
- 核心创新点: 针对现有相机控制视频生成中几何感知位置编码在真实度量相机轨迹下存在的尺度依赖失效问题(齐次投影编码导致注意力logits和特征范数随物理平移基线无界增长),提出MeRoPE(度量旋转位置编码)。其核心突破在于设计了一种范数保持的相对相机编码方式,将相机外参和每个token的视线方向以旋转不变的相对形式嵌入注意力机制,从根本上消除了绝对度量尺度对注意力计算的数值不稳定影响,使模型能够泛化到任意物理尺度的相机运动轨迹。
- Physically Plausible Video Generation via Visual-Semantic Chain-of-Events Conditioning
- 赛道归属: 视频生成 / 物理合理性视频生成
- 核心创新点: 针对物理合理视频生成中自然语言条件描述不足(仅整体描述物理现象、忽略中间状态和过渡动态)的核心问题,将物理合理视频生成任务重新建模为以"事件链"为中心的生成范式。提出Visual-Semantic Chain-of-Events(视觉语义事件链)条件机制,将物理演化过程显式分解为一系列具有中间状态和转变动态的离散事件节点,并以此作为生成条件。相比传统CoT仅在语义层面增强提示词,该方法同时引入视觉与语义双层事件链约束,有效弥合了语言描述与物理动态过程之间的语义鸿沟。
- Streaming4D: Accelerate 4D World Models via Block-wise Video Generation and Incremental Reconstruction
- 赛道归属: 4D生成 / 动态场景重建
- 核心创新点: 针对现有4D生成范式中视频生成与3D重建串行解耦导致高交互延迟的瓶颈问题,提出Streaming4D流式同步框架。核心创新在于将分块自回归视频生成(block-wise autoregressive generation)与增量式3D重建(incremental 3D reconstruction)紧密耦合为同步流水线:视频以块为单位逐步生成的同时,即时触发对应块的几何重建,彻底打破"先完整生成视频、再整体重建"的串行依赖,大幅降低端到端延迟,使4D世界模型具备面向实时交互场景的可行性。
- DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
- 赛道归属: 视频生成(原生音视频联合生成)
- 核心创新点: 提出了一种原生音视频联合生成框架 DreamX-Creator 1.0,核心突破在于摒弃了传统"先生成视频、再后处理音频"的两阶段流水线范式,转而在单一 7B 参数生成器内同步对音频流与视频流进行联合去噪。网络架构上采用"前半段独立处理、后半段门控耦合"的设计策略:两路模态专属流在网络前半部分各自独立建模,在后半部分通过门控注意力机制实现跨模态交互,从而在保留各模态独立表征能力的同时,捕捉视觉动态与声学事件之间的因果关联。此外,系统支持以首帧图像与文本提示为条件的 2K 分辨率生成,在紧凑模型规模下实现了高分辨率原生音视频的端到端合成。
- LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation
- 赛道归属: 视频生成(长视频生成 / 自回归扩散模型记忆机制)
- 核心创新点: 针对自回归视频扩散模型在长视频生成中的长程一致性问题,提出了一种状态感知的记忆路由机制 LayerRecall。其核心突破在于:通过分析视频 DiT 各层对"当前帧、近期帧、远期帧"上下文的差异化偏好,设计了一个以层状态为条件的动态路由器,使不同层能够自适应地从历史记忆中检索与自身语义需求最匹配的上下文信息。相较于传统的基于时间近邻的缓存策略(仅保留最近片段),该方法在历史信息被驱逐后仍能有效召回远期关键线索(如重复出现的人物、场景、属性),从而在不扩大滑动窗口的前提下显著提升跨片段的长程语义一致性。
- TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models
- 赛道归属: 视频生成 / 安全攻防
- 核心创新点: 针对图生视频(I2V)模型提出"时序越狱攻击"(TempJail)新范式,揭示了视频生成模型在时间维度上独有的安全漏洞——有害内容可以不出现在单帧中,而是通过跨帧时序演化隐蔽地涌现。研究构建了三种攻击场景,突破了现有安全研究仅聚焦单帧违规的局限,将攻击面从空间域扩展至时间域。
- RECAP-Forcing: Retaining Content Appearances for Long Video Generation
- 赛道归属: 视频生成 / 长视频生成
- 核心创新点: 提出 RECAP-Forcing 方法,颠覆了长视频自回归生成中以"时间顺序"组织记忆的传统范式,改为以"外观新颖性"为核心组织记忆。通过识别并优先保留视频中出现的新主体、对象和场景的关键帧,而非简单保留最近帧,从而在有限注意力窗口内更有效地维持长视频中内容外观的一致性。
GitHub
- [2026-09-03] Anil-matcha/Open-Generative-AI ⭐27610 🆕NEW
- [2026-09-03] leofan90/Awesome-World-Models ⭐1994
- [2026-09-03] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1942
- [2026-09-03] AceDataCloud/Nexior ⭐397
- [2026-09-03] princepainter/ComfyUI-PainterNodes ⭐192 🆕NEW
HuggingFace Models
HuggingFace Spaces
音频生成
arXiv
- EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis
- 赛道归属: 情感语音合成(Emotional Text-to-Speech)
- 核心创新点: 针对现有情感TTS系统仅支持单一静态情感标签/嵌入的局限性,提出EmoTra-TTS框架,核心突破在于实现句内(Intra-Utterance)连续情感动态过渡。该方法摒弃了传统"一句一情感"的离散建模范式,转而在单条语音合成过程中对情感状态进行时序连续建模,使情感能够在毫秒级时间尺度上自然地上升、衰减与转变,从而与心理学研究中情感作为连续动态过程的本质规律对齐,同时保持对情感轨迹的显式可控性——这一点也弥补了LLM-based TTS系统虽能隐式变化韵律但缺乏精确情感控制的不足。
- Hearing the Whispers: Black-Box Membership Inference Attacks on Finetuned TTS Models 🆕NEW
- 赛道归属: 文本转语音(TTS)安全 / 成员推断攻击
- 核心创新点: 针对微调TTS模型提出首个黑盒成员推断攻击框架。核心突破在于解决TTS场景下的双重条件查询生成问题(同时依赖合成文本与参考语音),以及面向语音模态的表征工程方法。通过专门设计的查询构造策略和音频表征分析手段,在无需访问模型内部参数的前提下,有效推断目标语音样本是否参与了模型微调训练,揭示了个性化TTS模型在生物特征隐私方面的潜在安全威胁。
- Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation
- 赛道归属: 文本转语音(TTS)/ LLM对齐优化
- 核心创新点: 将LLM生成TTS友好文本的问题重新定义为偏好对齐任务,而非依赖下游改写模块。核心方法是构建两个偏好数据集(SPA),通过直接偏好优化(DPO)等对齐技术,使LLM在生成阶段即输出适合口语化朗读的文本(如避免缩写、歧义停顿、书面化表达等),从源头解决TTS输入质量问题,而非事后修补。
- Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech
- 赛道归属: 文本转语音(TTS)/ 多语言与代码切换语音合成
- 核心创新点: 提出短语级语言对比引导(LCG),一种无需训练的推理时框架,专门解决代码切换场景下外语短语被主语言口音"污染"的问题。核心突破在于将原本作用于整句的单一语言引导信号,替换为分段式、短语定位的对比引导——对代码切换短语单独施加其母语的语言引导,从而在不重新训练模型的前提下,精准恢复该短语的原生口音,实现细粒度的口音控制。
- Vagdhenu: A Vrutta (Meter) Aware Shloka-to-Chant (TTS) System for Sanskrit
- 赛道归属: 文本转语音(TTS)/ 梵语吟诵合成
- 核心创新点: 针对梵语颂诗(Shloka)的吟诵合成任务,提出了一套专用前端处理流水线,核心突破在于:①通过卡纳达语正字法路由规避了梵文天城体(Devanagari)在印地语TTS模型中常见的"schwa删除"问题,从而保留梵语发音的完整性;②引入韵律(Vrutta/Meter)感知机制,使合成语音能够忠实还原传统吟诵(Parayana)的节律特征。整体方案以现成的流匹配(Flow-Matching)TTS骨干网络和大规模神经声码器为基础,重点贡献在于领域适配的前端工程设计,而非新架构提出。
- CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents
- 赛道归属: 文本转语音(TTS)/ 零样本语音合成
- 核心创新点: CuteTTS 提出了一种基于连续潜变量自回归建模的高效高质量语音合成框架。核心突破在于:设计了一种紧凑的低码率连续潜变量序列表示,在保留充分声学细节的同时降低自回归预测的序列长度;同时针对扩散采样和无分类器引导在每个自回归步骤中带来的高推理开销问题,提出了优化方案,在流式低延迟场景下实现了保真度与推理效率的平衡,适用于交互式助手、个性化媒体等实时应用场景。
- Backdoor Attacks on Speech Emotion Recognition via TTS-Generated Poisoning 🆕NEW
- 赛道归属: 语音情感识别(SER)安全 / 后门攻击
- 核心创新点: 首次系统性研究基于投毒的后门攻击在语音情感识别任务中的威胁,核心创新在于利用TTS生成音频作为投毒数据源,并设计了一种低能量、人耳难以察觉的隐蔽声学触发器。该触发器可无缝嵌入自然语音与合成语音中,实现可扩展且难以检测的后门植入,对依赖自监督声学表征的SER系统构成实质性威胁,填补了该领域训练时攻击研究的空白。
- Joycent: Multi-Accent TTS via Disentangled Accent Modeling and Layer-Specific Conditioning
- 赛道归属: 语音合成(TTS)/ 多口音语音生成
- 核心创新点: 提出 Joycent,一个基于扩散模型的多口音 TTS 框架,核心突破在于双层解耦策略:在表示学习阶段将口音特征与说话人身份特征显式分离,并在 TTS 条件注入阶段采用层级特定条件化(Layer-Specific Conditioning)机制,将两类解耦因子分别注入扩散模型的不同层,从而在保留说话人音色的同时实现精准的目标口音迁移,解决了传统方法中口音与说话人特征相互纠缠导致生成质量下降的问题。
- Self-EmoQ: Plutchik-Guided Value-based Planning to Drive Streaming Emotional TTS
- 赛道归属: 情感语音合成(Emotional TTS)/ 对话式AI / 强化学习
- 核心创新点: 提出Self-EmoQ框架,首次引入情绪先验规划机制,使系统在文本生成之前即自主决定情绪状态,从而驱动下游流式情感TTS合成。核心创新包括:以Plutchik情绪轮为理论基础构建情绪价值空间,通过强化学习(RL)训练即插即用的LLM情绪规划模块,打破了传统情感TTS依赖外部情绪标注或事后情绪注入的范式,实现了情绪感知与语音生成的端到端流式协同。
- Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 可控语音合成
- 核心创新点: 提出面向"方向跟随"TTS任务的可扩展伪三元组构建流水线,核心突破在于解决该任务缺乏配对训练数据的瓶颈。通过"声音印象"(Voice Impression)引导机制,自动构建包含参考语音、修改方向描述与目标语音的伪三元组训练样本,使模型能够在保持说话人身份和语言内容不变的前提下,依据相对性能方向指令灵活调整语音表达风格,实现了数据高效的可控语音生成范式。
GitHub
- [2026-09-03] huggingface/diffusers ⭐34431
- [2026-09-02] Stability-AI/stable-audio-tools ⭐3853 🆕NEW
- [2026-08-29] gemelo-ai/vocos ⭐1157
- [2026-08-31] BinWang28/audio-ai-hub ⭐952
- [2026-08-28] xiaomi-research/controlfoley ⭐149
HuggingFace Models
语言大模型
arXiv
- Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning
- 赛道归属: 推理优化 / 链式思维控制
- 核心创新点: 将推理过程的引导建模为马尔可夫决策过程(MDP),提出 ACTS 框架,通过一个控制器智能体在推理过程中自适应地选择推理策略(如快速跳过、深度展开等),使推理行为在推理时可显式控制,而非依赖隐式的长度压缩或早停机制,实现了效率与可控性的统一。
- Triggering Chain-of-Thought via Latent Feature Interventions in Large Language Models
- 赛道归属: 推理机制可解释性 / 链式思维触发机制
- 核心创新点: 利用稀疏自编码器(SAE)捕获 LLM 内部表示中的稀疏特征,系统性地识别出与链式思维(CoT)推理行为因果相关的少量潜在特征,并通过定向激活干预验证其因果性,首次从内部表示层面揭示了触发 CoT 行为的神经机制,为推理行为的可解释性与可干预性提供了新路径。
- When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models
- 赛道归属: 推理优化 / 测试时计算扩展(Test-Time Scaling)综述
- 核心创新点: 将测试时计算扩展(TTS)统一抽象为"推理即搜索"的框架,系统梳理了从 CoT 单轨迹解码到树搜索(如 MCTS、Beam Search)等多种推理范式,构建了覆盖搜索空间定义、状态评估、搜索策略的统一分类体系,为该领域提供了系统性的理论视角和研究路线图。
- Detecting Hidden Chain-of-Thought in Large Language Models with Linguistic, Behavioral, and Mechanistic Indicators
- 赛道归属: 推理机制可解释性 / 隐式链式思维检测
- 核心创新点: 提出隐式 CoT 检测分数(HCDS),通过对比中性提示下模型行为与显式 CoT / 显式无 CoT 提示下行为的语言学、行为学及机制层面的对齐程度,构建了一套无需直接观测内部推理过程即可判断模型是否进行隐式推理的量化框架,填补了隐式推理检测方法论的空白。
- Improving LLM Interpretability with User-Centric Chain-of-Thought Reasoning
- 赛道归属: LLM可解释性 / 推理链优化
- 核心创新点: 提出以用户为中心的思维链(Chain-of-Thought)设计范式,核心突破在于将推理轨迹的优化目标从"提升模型性能"转向"提升人类可读性与可检验性"。通过基于自我一致性(self-consistency)的结构化推理轨迹设计,使中间推理步骤更符合人类认知习惯,从而在保持模型能力的同时增强人机协作中的可信度与透明度。
- When Persona Attributes Improve Population Alignment in Large Language Models 🆕NEW
- 赛道归属: LLM人格对齐 / 社会模拟
- 核心创新点: 系统性研究了人格属性(社会人口统计、态度、行为等)在提示词中对LLM群体对齐效果的影响差异,揭示了并非所有人格属性都能等效提升对齐质量的规律,为人格提示工程提供了属性选择层面的实证指导,突破了以往将人格提示视为整体的粗粒度研究范式。
- Task-Level Natural Language Priors as Learning Signals for Low-Resource LLM Training 🆕NEW
- 赛道归属: LLM低资源训练 / 参数高效微调
- 核心创新点: 提出Prior-Guided Tuning(PGT)框架,将任务级自然语言先验从传统的"输入上下文"角色转变为训练阶段的辅助学习信号,在低资源场景下有效缓解训练数据模糊或不完整问题。核心突破在于将语言先验注入梯度优化过程而非仅作为推理时的条件输入,从而在训练层面实现知识引导。
- WeaveMark: Robust and Scalable Multi-bit LLM Watermarking via Coded Payload Spreading 🆕NEW
- 赛道归属: LLM水印 / 内容溯源安全
- 核心创新点: 提出WeaveMark方案,采用编码载荷扩频(Coded Payload Spreading)技术实现多比特LLM水印,通过每token嵌入多比特信息突破了现有方法在提取精度、文本质量与载荷容量三者之间的固有权衡瓶颈,在不显著损害生成文本质量的前提下大幅提升水印容量与鲁棒性。
- A Tri-Agent Framework for Evaluating and Aligning Question Clarification Capabilities of Large Language Models 🆕NEW
- 赛道归属: LLM对话能力评估 / 问题澄清对齐
- 核心创新点: 设计了一套三智能体协作框架(问题澄清智能体QCA、用户模拟智能体、评估智能体),专门用于评估和对齐LLM在模糊查询场景下的主动澄清能力。核心创新在于将澄清能力的评估从静态基准转变为动态多轮对话仿真,并通过三方角色分离实现对澄清行为的细粒度、可重复评测。
- Act More, Decide Less: Skill-Guided Adaptive Action Chunking for Long-Horizon LLM Agents 🆕NEW
- 赛道归属: LLM智能体 / 长时序任务规划
- 核心创新点: 提出技能引导的自适应动作分块(Skill-Guided Adaptive Action Chunking)机制,使LLM智能体能够动态输出可变长度的动作序列块而非逐步单动作,解决了标准强化学习训练下动作分块策略易退化为单步或过长块的崩溃问题。核心突破在于引入技能先验约束动作块的边界划分,在保持灵活重规划能力的同时大幅提升长时序任务的执行效率。
GitHub
- [2026-09-03] sgl-project/sglang ⭐33587
- [2026-09-03] AI4Finance-Foundation/FinGPT ⭐21201 🆕NEW
- [2026-09-03] NVIDIA/TensorRT-LLM ⭐14537
- [2026-09-03] openJiuwen-ai/jiuwenswarm ⭐7388
- [2026-09-03] google-ai-edge/LiteRT-LM ⭐6361
HuggingFace Models
HuggingFace Datasets
- [2026-08-20] llm-jp/AnswerCarefully 🆕NEW
多模态大模型
arXiv
- Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models 🆕NEW
- 赛道归属: 多模态安全 / 多模态大模型安全对齐
- 核心创新点: 提出"跨模态安全漂移"概念,系统性研究视觉模态如何使原本良性的文本查询携带有害意图而绕过安全机制。核心方法是设计"安全意识迁移"机制,将文本模态中已有的安全感知能力迁移至视觉-语言联合理解场景,从而弥补多模态模型在跨模态语境下安全响应率显著低于纯文本场景的缺陷。
- Detecting Object Hallucinations in Large Vision-Language Models via Cross-Modal Attention Drifts and Mask-Based Verification 🆕NEW
- 赛道归属: 多模态理解 / 视觉语言模型幻觉检测
- 核心创新点: 提出CADMP框架,创新性地利用相邻层间跨模态注意力漂移(而非单一层注意力)来刻画视觉定位的动态演化过程,结合目标区域遮蔽的预测敏感性验证,实现轻量级的对象幻觉检测。相比现有方法仅分析单层注意力的局限,CADMP通过跨层注意力变化趋势与掩码扰动响应的双重信号提升幻觉判断的准确性。
- SpanCalib-VLM: Calibrated Hallucination Span Detection in Vision-Language Models
- 赛道归属: 多模态理解 / 幻觉检测与校准
- 核心创新点: 提出 SpanCalib-VLM 混合双系统框架,专门用于视觉语言模型(VLM)中幻觉文本片段的检测与置信度校准。核心创新在于将生成式 VLM(擅长幻觉片段定位但存在过度自信和高推理延迟问题)与判别式序列标注器(具备确定性速度和更优校准性但召回率偏低)进行互补融合,通过双系统协同弥补各自短板,同时实现精准的 span 级幻觉定位与良好校准的置信度输出,在 SHROOM-Visions 共享任务上验证了该方案的有效性。
- StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models
- 赛道归属: 多模态理解 / 流式视频理解
- 核心创新点: 提出StreamEMS机制,在传统流式视频记忆框架"读/写"操作之外,引入"自进化记忆"模块,通过对记忆本身的表征能力进行持续优化(而非仅优化数据注入和检索流程),使历史记忆能够随时间自适应地提炼和增强,从而提升视觉语言模型在长时流式视频理解中的信息利用效率。
- VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models
- 赛道归属: 多模态理解 / 长视频理解
- 核心创新点: 提出递归套索自改进(Recursive Harness Self-Improvement, RSI)框架,在冻结视觉语言模型参数的前提下,专注于优化视频上下文构建过程本身。核心突破在于将上下文构建程序(context-construction harness)作为独立优化目标,通过递归自改进机制迭代提升可执行上下文的质量,从而在不修改底层模型权重的情况下显著提升长视频理解性能。这一方法将上下文构建与模型能力解耦,揭示了仅通过改进推理时的信息组织策略所能带来的性能上限。
- GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
- 赛道归属: 多模态理解 / 交通视频分析
- 核心创新点: 提出GHR-VLM框架,将视觉定位(Grounding)与混合推理(Hybrid Reasoning)结合,实现对公交车载长视频的零样本分析。核心突破在于融合监督视频模型的时序感知能力与VLM的语义推理能力,通过视觉锚定机制将VLM的推理范围约束在关键片段上,规避直接对长视频进行端到端推理带来的高成本和低可靠性问题。
- ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding 🆕NEW
- 赛道归属: 多模态理解 / 流式视频理解与推理优化
- 核心创新点: 提出ShallowStream框架,核心思路是"浅层索引、深层回答"的异步两阶段架构:利用模型浅层(低计算代价)对连续视频帧进行快速重要性索引与筛选,仅将关键帧送入深层进行精细理解与回答生成。该方法在保持理解质量的同时大幅降低流式视频处理的计算开销,突破了现有方法在token剪枝、合并等策略上的性能-效率权衡瓶颈。
- TempoGround: State-Aware Streaming Visual Grounding with Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 流式视频视觉定位(Streaming Visual Grounding)
- 核心创新点: 提出TempoGround框架,专门针对流式输入场景下视觉定位的三大痛点(身份漂移、跨帧不一致、遮挡下定位脆弱)。核心创新在于引入状态感知机制,通过VLM原生方式检测跨帧目标对应关系并维护目标状态,实现在连续流式视频中稳定、一致的开放词汇视觉定位,无需依赖外部跟踪模块。
- YesTrack: Referring Multi-Object Tracking via MLLM-based Yes/No Verification 🆕NEW
- 赛道归属: 多模态理解 / 指代多目标跟踪(Referring Multi-Object Tracking)
- 核心创新点: 提出YesTrack框架,将MLLM从传统RMOT流程中"仅作字幕生成器"的辅助角色升级为核心决策者。创新性地将目标匹配问题转化为二元Yes/No验证任务,直接利用MLLM的视觉-语言对齐能力对候选目标与语言表达进行端到端判断,消除了对外部决策模块的依赖,降低推理延迟的同时充分释放MLLM的内在语义理解潜力。
- FairLens: Benchmarking Fairness in Vision-Language Models for High-Stakes Decision-Making 🆕NEW
- 赛道归属: 多模态理解 / 视觉语言模型公平性评测
- 核心创新点: 构建FAIRLENS基准,专注于高风险决策场景(招聘、法律、医疗)下VLM的公平性与有效性评估。核心创新在于设计四维互补评估视角(人口统计公平性、回答有效性、开放/封闭式问题双模式),并以真实人脸图像覆盖性别、种族、年龄等多维群体属性,构建超过10万图文对的大规模评测集,系统性揭示VLM在敏感群体决策中的偏见分布规律。
GitHub
- [2026-09-02] Blaizzy/mlx-vlm ⭐5463
- [2026-09-03] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1841
- [2026-09-02] emcf/thepipe ⭐1524
- [2026-09-02] om-ai-lab/VLX-Seek ⭐425 🆕NEW
- [2026-09-02] mala-lab/Awesome-Anomaly-Detection-Foundation-Models ⭐218 🆕NEW
强化学习
arXiv
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning
- 赛道归属: 强化学习 / LLM智能体训练
- 核心创新点: 提出ARISE-RL全周期自进化框架,核心突破在于将评分标准(Rubric)的生成与策略优化解耦并迭代耦合:首先由模型自动生成可验证的评分标准以解决开放任务缺乏金标答案的问题,再通过基于标准的奖励信号驱动GRPO策略更新;针对长时域任务中奖励稀疏导致的rollout对比度弱问题,引入组内对比增强机制,从而在能力边界附近提供更细粒度的优化信号,实现模型自我进化的闭环。
- Iterative GRPO: Batch-Online Policy Iteration for Multi-Turn RL via Single-Turn RLHF
- 赛道归属: 强化学习 / 多轮对话LLM训练
- 核心创新点: 提出Iterative GRPO方法,将多轮对话RL训练转化为单轮RLHF问题的批量在线策略迭代。核心突破在于:通过将多轮交互轨迹"展平"为单轮形式,使得无需实时外部环境(真实用户)参与训练循环,利用离线或模拟的对话历史构造批次,以单轮RLHF的GRPO算法迭代更新策略,从而绕开多轮RL中环境响应依赖的工程瓶颈,同时保持策略的近似在线性。
- Eliciting ESG Preferences for Reinforcement Learning-Based Portfolio Optimization 🆕NEW
- 赛道归属: 强化学习 · 金融投资组合优化 / ESG多目标决策
- 核心创新点: 针对现有RL投资组合优化方法仅依赖单一ESG评级提供商、忽视不同机构评级方法论差异的问题,提出了一种能够从多个ESG评级来源中主动引导偏好的RL框架。核心突破在于将多ESG评级提供商之间的分歧显式建模,并通过偏好引导机制替代人工手动加权冲突目标的方式,使RL智能体能够在风险调整收益与多维ESG约束之间实现更鲁棒的自适应平衡,从而解决了传统方法中ESG目标不直观、不可扩展的根本缺陷。
- Recursive Value Learning for Long-Horizon Offline Goal-Conditioned RL 🆕NEW
- 赛道归属: 强化学习 · 离线目标条件RL / 长时序规划
- 核心创新点: 针对长时序离线目标条件RL中价值估计误差随回传步数累积放大的问题,提出DCRL(分治强化学习)方法。核心创新在于将轨迹段递归分解为平衡二叉树结构,并从叶节点到根节点逐层训练价值函数——每个父节点仅在其子节点价值收敛后才进行更新。这一分治式回传机制从根本上切断了长程价值传播中的误差累积链路,避免了传统max-based价值回传因多步传播导致的过估计放大问题,有效提升了长时序稀疏奖励任务下的价值学习稳定性。
- DiDrive: A Risk-Aware Hierarchical Diffusion Framework for Safe Offline Reinforcement Learning in Autonomous Driving 🆕NEW
- 赛道归属: 强化学习 · 自动驾驶离线RL / 扩散模型安全决策
- 核心创新点: 针对自动驾驶离线RL中分布偏移、重尾风险信号、OOD动作生成及高维状态冗余四大核心挑战,提出DiDrive框架,融合两项协同创新:①风险感知分层扩散架构(RHDif),通过层次化扩散过程显式建模多模态行为先验并嵌入风险感知约束,抑制OOD动作的生成;②3D状态表征模块,压缩高维状态冗余以提升策略泛化能力。其核心突破在于将扩散模型的多模态生成能力与离线RL的保守约束机制有机结合,在保持行为多样性的同时实现了对重尾风险的主动规避,为安全关键场景下的离线策略学习提供了新范式。
- Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs
- 赛道归属: 强化学习 / LLM后训练资源分配
- 核心创新点: 首次将SFT与RL标注预算分配问题形式化为"近最优性"框架,而非寻找单一最优比例。核心创新在于:通过跨模型规模的系统性实验,发现最优SFT-RL分配比例存在可迁移的规律性,并提出基于小模型实验结果预测大模型最优分配策略的方法,为固定预算下的后训练资源调度提供了可操作的理论依据,填补了该问题缺乏原则性框架的空白。
- From Base Rollouts to RL Reasoning: A Budgeted Search Perspective
- 赛道归属: 强化学习 / LLM推理能力分析
- 核心创新点: 提出统一解码框架(UDF),将token级采样、束搜索、树搜索和序列级重采样统一表达为可执行策略,从推理时计算预算视角重新审视RLVR的增益来源。核心发现是:RL的推理提升在很大程度上可被解释为对基础模型已有但低概率轨迹的分布重加权,而非创造全新推理能力;由此揭示了RL训练与推理时搜索之间的等价性边界,为理解RLVR的本质机制提供了行为层面的统一解释。
- Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents
- 赛道归属: 强化学习 / LLM长时域智能体训练
- 核心创新点: 挑战"小模型结果导向RL存在天花板"的主流观点,将瓶颈归因于两类具体失效:信号饥饿(稀疏奖励下组相对RL对比度不足)和策略漂移(长时域探索中策略偏离有效区域)。核心创新在于提出针对性修复方案:通过自适应探索扩大有效rollout覆盖范围,同时引入漂移抑制机制约束策略更新幅度,证明在不依赖密集奖励、SFT先验或多智能体编排的条件下,纯结果导向RL即可在长时域交互任务上取得显著效果。
- Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPC
- 赛道归属: 强化学习 / 模型预测控制(MPC)加速
- 核心创新点: 针对权重可变MPC场景下RL训练收敛慢的问题,提出利用MPC求解器梯度(Solver-Gradient)直接引导RL策略参数更新的加速框架。核心突破在于:通过对MPC数值解关于代价函数权重的隐式微分,将求解器内部的优化结构信息转化为策略梯度的引导信号,在偏差-方差权衡中兼顾RL的闭环优化性与MPC梯度的低方差指向性,从而显著加速在线自适应权重策略的学习收敛速度。
- Small Language Models as Judges for Rubric-Based Reinforcement Learning
- 赛道归属: 强化学习 / 奖励模型优化
- 核心创新点: 针对基于评分标准的强化学习(Rubric-based RL)中奖励计算成本高昂的痛点,提出使用小型语言模型(Small Language Models)替代大型专有API或7B+参数本地模型担任评判者。核心突破在于:构建了专用评测基准 PointRubric 以量化小模型作为评判者的可靠性,并系统验证了小模型在实例特定评分标准下的判断能力,从而在保持奖励信号质量的前提下大幅降低训练阶段的计算开销,使 Rubric-based RL 的规模化训练更具实用性。
GitHub
- [2026-09-03] OpenPipe/ART ⭐10690
- [2026-09-03] RLinf/RLinf ⭐4710
- [2026-09-03] kubernetes-sigs/agent-sandbox ⭐3720
- [2026-09-03] radixark/miles ⭐2354
- [2026-09-03] raamonp/rl-gym-orchestrator ⭐55
HuggingFace Datasets
- [2026-09-02] hamzabagirsakci/turkish-court-decisions
世界动作模型
arXiv
- Spatially Aware World Action Model via Geometric Latent Diffusion 🆕NEW
- 赛道归属: 世界动作模型 / 机器人策略学习 / 3D空间感知视频生成
- 核心创新点: 提出空间感知世界动作模型(SA-WAM),核心突破在于将几何信息(深度图等3D结构)以几何潜在扩散的方式融入原本仅依赖RGB观测的视频扩散框架中。通过复用预训练视频扩散模型并引入几何潜在空间,使模型在预测未来视觉观测的同时能够感知和利用三维空间结构,从而为机器人策略学习提供更丰富的物理先验,弥补了现有WAM缺乏3D空间理解的关键缺陷。
- World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action Models 🆕NEW
- 赛道归属: 世界动作模型 / 机器人策略学习 / 测试时规划与推理优化
- 核心创新点: 提出世界一致性解码(World-Coherent Decoding, WCD)框架,核心突破在于将WAM的多次前向采样结果视为"可证伪的未来-动作假设",并利用模型自身的内部生成信号(无需外部奖励或额外监督)对候选轨迹进行自我验证与排序。该方法在推理阶段(测试时)通过多候选采样+内生一致性评分机制,有效过滤低质量的随机生成结果,解决了WAM输出对采样结果高度敏感的问题,实现了无需重新训练模型的测试时规划增强。
- Making Latent Evolution Explicit: Operator-Structured Transitions for World Action Models
- 赛道归属: 世界动作模型 / 机器人策略学习 / 潜空间动态建模
- 核心创新点: 针对现有基于Transformer的潜空间状态转移预测器存在的结构性缺陷(其归纳偏置聚焦于token间交互而非时序演化),提出了一种算子结构化的潜空间转移机制(Operator-Structured Transitions)。核心突破在于将潜空间中的状态转移过程显式化——通过引入具有明确时序演化归纳偏置的算子结构,替代通用Transformer预测器,使潜在状态的演化路径在结构层面得到显式约束与表达,从而提升世界动作模型在任务相关场景状态预测上的精度与可控性。
- 4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting
- 赛道归属: 世界动作模型 / 4D场景表示与预测
- 核心创新点: 提出基于4D高斯散射(4DGS)的以物体为中心的世界动作模型(WAM),核心突破在于将动态物体与静态背景解耦建模,摒弃传统WAM在2D视觉数据上操作的范式。通过显式4DGS表示在三维空间中对场景进行结构化建模,避免了对冗余背景内容的重复处理,同时解决了点云在多视角对齐与累积上的困难。该方法将过去的观测与未来的预测通过统一的4D时空表示桥接,赋予模型对单个物体的显式空间结构感知能力,从而在保持高视觉质量的同时提升了场景理解的几何精确性与可操控性。
- GeoWAM: Visual Geometry World Action Models for Autonomous Driving
- 赛道归属: 自动驾驶 / 世界动作模型(World Action Model)/ 几何感知视频生成与轨迹预测
- 核心创新点: GeoWAM 的核心突破在于将世界动作模型的建模空间从像素域迁移至视觉几何域。传统WAM在像素空间学习场景动态,导致几何、运动与外观、纹理、光照相互耦合,表征效率低下。GeoWAM 提出以几何结构(如深度图、点云或几何特征)作为场景演化的主要建模对象,将未来帧预测与自车轨迹预测统一在几何表示空间中,从而实现对场景动态更直接、更紧凑的建模,降低了外观变化对运动与几何推理的干扰,提升了动作预测的精度与泛化能力。
- ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training
- 赛道归属: 具身智能 / 世界动作模型 / 机器人操控预训练
- 核心创新点: ZimaBlue 的核心创新在于提出了一种可扩展的无动作标注视频预训练范式,用于构建可泛化的世界动作模型。其方法论突破体现在以下几点:①将大规模第一人称(Egocentric)视频作为替代机器人轨迹数据的预训练来源,绕开了动作标注数据稀缺且多样性不足的瓶颈;②设计了将"无动作"视频经验有效转化为可用于机器人操控的动作先验的训练机制,使模型能从丰富的物体交互、接触动力学和工具使用视频中学习物理世界的通用规律;③通过规模化预训练提升模型的跨场景泛化能力,使其在下游机器人任务上无需大量动作标注数据即可实现有效迁移。该工作的本质是将视频生成/理解领域的扩展规律引入具身智能,以互联网级视频数据驱动世界动作模型的通用化。
- GameWAM: A World Action Model for Video Games
- 赛道归属: 世界动作模型 / 游戏智能体 / 视频游戏动态建模
- 核心创新点: 首次将世界动作模型(WAM)框架系统性地拓展至视频游戏领域,提出GameWAM。其核心创新在于统一了两类此前相互割裂的研究范式——"视觉-动作直接映射的游戏智能体"与"基于动作输入预测视觉未来的交互式游戏世界模型"——在单一模型中同时实现任务策略执行与世界动态建模。针对视频游戏特有的挑战(第一人称感知、快速视觉变化、持久世界状态、异构原生控制接口),设计了适配该场景的WAM架构,填补了WAM在开放式、高动态交互环境下应用的空白。
- SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
- 赛道归属: 自动驾驶 / 世界动作模型(World Action Model)/ 端到端驾驶推理优化
- 核心创新点: SimWAM 的核心突破在于将未来视频预测从推理时计算负担转化为训练时监督信号,彻底消除了现有WAM在测试阶段进行未来想象所带来的高昂计算开销。具体方法上,SimWAM 联合训练一个预训练视频专家模型与一个轻量级动作专家模型,采用联合流匹配(joint flow matching)框架统一两者的训练目标;同时设计了隔离注意力掩码(isolated attention mask)机制,使动作预测分支在前向推理时完全独立于未来帧信息,从而在保留视频动态先验迁移收益的同时,实现推理阶段的高效轻量化部署。
GitHub
- [2026-09-01] OpenMOSS/Awesome-WAM ⭐1370
- [2026-09-01] DravenALG/awesome-vla-wam ⭐1000
- [2026-08-30] robbyant-research/Zero-WAM ⭐249
- [2026-09-03] OpenMOSS/EasyWAM ⭐60 🆕NEW
- [2026-08-31] hustvl/FasterWAM ⭐54
由 Research Daily 自动生成 生成时间: 2026-09-03 05:31:45