AI 每日进展速报 - 2026-09-09
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- SpatialGuard: Harness-Guided Verifiable Spatial Reasoning for Text-to-Image Generation
- 赛道归属: 文生图 / 空间推理增强
- 核心创新点: 提出 SpatialGuard 框架,在文本到图像生成流程中引入可优化、可验证的结构化空间中间表示("harness"),作为语言描述与视觉采样之间的几何桥梁。核心突破在于将3D空间关系(遮挡、可见性、相机约束等)显式编码为可校验的布局约束,从而在多轮生成中防止空间几何信息的退化,解决了现有提示驱动或布局条件方法缺乏可验证空间中间体的根本缺陷。
- T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image Generation
- 赛道归属: 文生图 / 评测基准
- 核心创新点: 提出首个专注于"局部语义控制"的文生图评测基准 T2LSC-Bench,核心创新在于定义并量化了"目标文本关联语义泄漏"现象——即在指定区域渲染目标文字时,对主体身份或周围场景语义造成非预期改变的问题。该基准系统性地评估模型在产品标签、标牌等应用场景下,能否在保持预定主体身份与场景语义不变的前提下,精准完成局部文字渲染,填补了现有评测体系对局部文字可控性考察的空白。
- How far can we go with ImageNet for Text-to-Image generation?
- 赛道归属: 文生图(Text-to-Image Generation)
- 核心创新点: 挑战"数据量越大越好"的主流范式,证明仅使用 ImageNet 配合精心设计的文本增强与图像增强策略,即可达到在十亿级网络爬取数据集上训练的模型性能。核心突破在于通过高质量的数据增强手段(文本描述生成 + 图像变换)弥补数据规模不足的缺陷,同时显著提升了训练数据的可复现性与开放性,为学术界提供了一条低成本、可复现的文生图研究路径。
- Multi-History-Step SDE Inversion for Image Editing with Superior Regional Awareness 🆕NEW
- 赛道归属: 图像编辑 / 扩散模型推理优化
- 核心创新点: 提出基于SDE反演的无训练图像编辑框架MIEdit,核心突破在于引入"预测-校正多历史步"机制,利用多个历史去噪步骤的状态信息来提升反演精度与区域感知能力。相比现有SDE反演方法,该方案在保持未编辑区域保真度的同时,显著提升了编辑的灵活性与效率,解决了传统方法在局部区域保护上的失准问题。
- IM-ENGINE: Image Editing for Embodied Data Generation 🆕NEW
- 赛道归属: 图像编辑 / 具身智能数据生成
- 核心创新点: 提出IM-ENGINE流水线,将图像编辑作为中间表示,桥接仿真环境与真实机器人操作数据之间的鸿沟。核心创新在于以仿真器为基础生成语义标注,再通过图像编辑将仿真场景转化为具有物理可执行性和语义意义的训练数据,同时兼顾了人类示范的语义丰富性与仿真数据的可扩展性,有效缓解了人机具身差距问题。
- Automatic Red Teaming for Implicit Vulnerabilities of Text-to-Image Models 🆕NEW
- 赛道归属: 文生图 / 安全红队测试 / 对抗攻击
- 核心创新点: 提出AdvPIE多模态智能体框架,专门针对文生图模型中"隐式对抗提示"漏洞进行自动化红队测试。核心突破在于区分并系统性地挖掘"表面无害但可诱导不当视觉内容"的隐式提示,通过多模态智能体协同探测模型的隐性脆弱性,填补了现有红队方法仅关注显式有害提示的盲区。
- GenPuzzle: Benchmarking Visual Reasoning in Image Generation Models 🆕NEW
- 赛道归属: 文生图 / 视觉推理评测基准
- 核心创新点: 提出GenPuzzle基准,首次系统性地评估图像生成模型的视觉推理与解题能力,而非仅关注美学或提示对齐。核心创新在于构建了包含2005道跨多类别视觉谜题的测试集,要求模型不仅理解问题,还需将推理结果以像素级图像形式忠实表达,从而揭示当前生成模型在"推理-生成"联合能力上的真实瓶颈。
- WeAgent-MMGenEdit: A Full-Stack Recipe for Multimodal Agentic Image Generation and Editing
- 赛道归属: 图像生成与编辑(Multimodal Agentic Image Generation & Editing)
- 核心创新点: 提出一套全栈式多模态智能体框架,专门解决提示词依赖外部世界知识时生成/编辑模型失效的问题。核心创新体现在三个层面:①引入检索增强机制补充长尾事实与视觉外观知识;②设计充分的视觉验证模块,避免检索内容与生成结果不一致;③将策略模型与检索/生成工具解耦,通过模块化协作替代单一过载的策略模型,从而实现更鲁棒的知识驱动图像生成与编辑流程。
- Multi-Tool Image Editing Attribution in Facial Forgery
- 赛道归属: 图像编辑 / 取证溯源
- 核心创新点: 突破了现有图像编辑归因方法"单工具假设"的局限,首次系统性地建模并解决多工具复合编辑场景下的归因问题。核心方法论创新在于处理不同编辑工具留下的伪影在图像中相互叠加、混合的复杂情形,能够从单张人脸图像中同时识别出多个参与编辑的AI工具,而非仅判断单一工具,更贴近真实世界中生成式AI滥用的复杂场景。
- AffectDelta: Beyond Emotion Labels for Image Editing
- 赛道归属: 图像编辑 / 情感驱动生成
- 核心创新点: 提出超越单一情感类别标签的情感驱动图像编辑框架 AffectDelta,核心创新在于以"情感增量(Delta)"替代粗粒度情感类别作为编辑目标。传统方法将复杂情感状态折叠为单一标签,且依赖文本指令描述视觉变换,存在语义精度不足的问题。该工作通过建模情感空间中的方向性变化,实现更细粒度、更连续的情感视觉线索修改,同时保持场景整体构图与语义结构的一致性。
GitHub
- [2026-09-09] pydantic/pydantic-ai ⭐19815
- [2026-09-09] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13386
- [2026-09-09] Osmantic/ODS ⭐6307
- [2026-09-09] AceDataCloud/Nexior ⭐397 🆕NEW
- [2026-09-09] etkecc/baibot ⭐242
视频生成/编辑
arXiv
- ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation
- 赛道归属: 视频生成(角色一致性文生视频)
- 核心创新点: 提出 ContextAnyone 框架,核心突破在于将参考图像从传统的"条件信号"升级为"上下文令牌",通过上下文感知扩散机制,将参考图像的外观信息以独立上下文序列的形式注入去噪过程,避免了参考特征与噪声视频令牌直接交互导致的细粒度外观信息衰减问题,从而在角色经历大幅度姿态变化、运动变化和场景切换时,仍能保持单参考图像中角色的整体外观一致性。
- TokenDial: Continuous Attribute Control for Text-to-Video Generation in Visual Dial Space
- 赛道归属: 视频生成 / 可控视频生成
- 核心创新点: 提出"视觉拨盘空间(Visual Dial Space V+)"这一新型语义控制空间,利用视频扩散Transformer中视觉patch token的通道维度作为连续属性控制的语义空间。核心突破在于:通过向token流广播可加性方向向量,实现对外观(如年龄)和运动(如速度)属性的滑块式连续控制,无需修改模型结构或引入额外条件网络,仅在token特征空间内完成细粒度属性调节。
- ReaDiT Guidance: Control for Image and Video Generation using Diffusion Transformer Features
- 赛道归属: 图像生成 / 视频生成 / 可控生成(ControlNet类)
- 核心创新点: 提出ReaDiT Guidance框架,利用扩散Transformer(DiT)单个block的内部特征表示,在推理时实现对深度图、姿态图、边缘图等空间条件的轻量级控制,无需训练额外的控制网络。核心突破在于:直接读取DiT内部特征并将其作为引导信号,以极低的计算开销实现测试时的空间条件控制,并天然扩展至文生视频模型(因其同样基于DiT骨干),统一了图像与视频的可控生成范式。
- DSAQuant: Denoising-Stage-Aligned Quantization-Aware Training for Video Generation
- 赛道归属: 视频生成 / 推理优化(量化感知训练)
- 核心创新点: 针对视频扩散模型(VDMs)在量化感知训练(QAT)中存在的独特问题——量化模型虽能保留语义和全局布局,但在细节纹理和时序一致性上出现退化——提出了"去噪阶段对齐量化感知训练"方法(DSAQuant)。其核心突破在于:识别并利用扩散模型不同去噪阶段对量化误差敏感度不同的特性,将QAT过程与去噪阶段显式对齐,针对不同阶段分配差异化的量化策略或训练目标,从而在压缩模型的同时精准修复细粒度视觉质量和时序连贯性的损失,实现了推理阶段零额外开销的高效视频生成部署。
- Temporal State Transport in Video Generation: Diagnosing and Correcting Spectral Imbalance 🆕NEW
- 赛道归属: 视频生成 / 时序一致性优化
- 核心创新点: 从频谱分析视角重新审视视频生成中的时序状态传输问题,提出"频谱失衡"诊断框架,揭示跨帧注意力中存在的频域不均衡现象(低频过度主导或高频噪声干扰)是导致时序不一致的根本原因。在此基础上设计无需训练的频谱校正机制,通过调节注意力的频谱分布来维持视觉属性(身份、场景布局、运动细节)在时间维度上的稳定传输,相比仅操作注意力熵或跨帧注意力权重的已有方法,提供了更具可解释性的诊断与修复路径。
- PhysFlow: Physics-Aware Optical Flow for Motion Controllable Video Generation 🆕NEW
- 赛道归属: 视频生成 / 物理感知运动控制
- 核心创新点: 提出PhysFlow两阶段框架,将物理规律显式编码进光流表示以驱动视频生成。第一阶段利用物理约束(如流体动力学、刚体运动等先验)生成物理合理的光流场,第二阶段以该光流作为运动条件引导视频生成模型,从而在不依赖大规模物理仿真数据的前提下,将物理一致性从隐式学习转化为显式运动信号注入,突破了现有方法在动态场景中运动轨迹不符合物理规律的瓶颈。
- The Price of Consistency: Exploiting Visual Anchors for Multimodal Jailbreaking in Video Generation 🆕NEW
- 赛道归属: 视频生成 / 安全与对抗攻击
- 核心创新点: 首次系统性揭示多条件可控视频生成中参考图像作为"视觉锚点"所带来的安全漏洞——即"视觉锚定效应"。该机制为保证时空一致性而强制模型跟随参考图像内容,反而使安全过滤器失效,形成多模态越狱攻击面。研究构建了针对该机制的攻击范式,证明攻击者可通过精心设计的参考图像绕过文本侧的安全审查,生成有害视频内容,为视频生成安全对齐研究提供了新的威胁模型视角。
- MVWeaver: A Hierarchical Music Video Generation Agent with a Learned Song-to-Visual Bridge 🆕NEW
- 赛道归属: 视频生成 / 音乐视频自动化生成
- 核心创新点: 提出MVWeaver音乐视频生成智能体,核心创新在于构建了一个可学习的"歌曲-视觉桥接模块"(Song-to-Visual Bridge),将歌曲的语义、情感及节奏特征映射为结构化的视觉叙事表示,并结合层级化规划机制(从全局主题到分镜级别的逐层分解)实现长时程音乐视频的连贯生成。相比已有方法仅依赖文本描述或浅层音频特征驱动视觉,该方法通过端到端学习的跨模态桥接显著提升了视觉内容与歌曲表达内容之间的深层语义对齐。
- Encore: Infinite Audio-Video Generation with Adaptive Signal Routing
- 赛道归属: 视频生成 / 音视频联合生成 / 长视频生成
- 核心创新点: 提出Encore框架,首次实现无限时长的音视频联合生成。核心突破在于引入"自适应信号路由(Adaptive Signal Routing)"机制,针对视频时序连贯性、音频时序连贯性和跨模态同步三类条件信号的不同传播路径,设计差异化的路由策略,在分块迭代合成过程中同时维持三类一致性约束,解决了长音视频联合生成中多路条件信号相互干扰、难以协同的核心难题。
- EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders
- 赛道归属: 视频生成 / 模型安全与概念消除
- 核心创新点: 提出基于稀疏自编码器(Sparse Autoencoder, SAE)的文生视频扩散模型概念精准消除方法 EraseSAE。现有概念消除方法以粗粒度方式操作,与概念在模型内部以细粒度、分布式方式存在的本质不匹配,导致过度遗忘或消除不彻底。EraseSAE 的核心突破在于:利用 SAE 将扩散模型的内部表征分解为可解释的稀疏特征,精准定位与目标概念对应的特征维度,并实施"外科手术式"的定向消除,在彻底移除目标语义的同时最大程度保留无关概念的生成能力,从机制层面解决了概念表征的细粒度对齐问题。
GitHub
- [2026-09-09] ZeroLu/awesome-seedance ⭐2391
- [2026-09-09] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1965
- [2026-09-09] tetherto/qvac ⭐594 🆕NEW
- [2026-09-09] heygen-com/heygen-cli ⭐123 🆕NEW
- [2026-09-09] MajoorWaldi/ComfyUI-Majoor-OmniCam ⭐57 🆕NEW
HuggingFace Models
音频生成
arXiv
- CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 低延迟流式语音合成
- 核心创新点: 提出基于LLM的双流TTS系统,核心创新在于用CTC(Connectionist Temporal Classification)对齐替代传统GMM-HMM强制对齐工具(如MFA),实现端到端的神经网络文本-语音对齐。同时设计了新型训练序列交织策略,在保证合成质量的前提下动态平衡延迟,使系统天然支持低延迟双流推理,无需依赖复杂的外部对齐流水线。
- FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
- 赛道归属: 文本转语音(TTS)/ 语音合成
- 核心创新点: 提出 FNH-TTS 系统,在基于 VITS 的端到端语音合成框架中引入混合专家(Mixture-of-Experts, MoE)时长建模机制。核心突破在于通过多个专家子网络动态捕捉不同语言上下文和说话人风格下的时长分布差异,解决了传统单一时长预测器难以建模韵律节奏多样性的问题,从而在保持端到端训练优势的同时,显著提升了合成语音的韵律自然度与鲁棒性。
- KABURI-TTS: Phoneme-Keyed Activity-conditioned Bi-channel Utterance Rendering for Interaction 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 对话式语音合成
- 核心创新点: 针对全双工口语对话场景,提出KABURI-TTS双通道语音合成框架。核心创新在于以音素(Phoneme)为键控单元、以交互活动状态(Activity)为条件,对双通道(每通道一位说话人)的对话语音进行联合建模,能够显式处理回应词(backchannels)、打断(interruptions)和重叠(overlaps)等真实对话中的同时发话现象,突破了现有TTS系统对双方同时说话场景鲁棒性不足的瓶颈。
- GEPARD - Generative, Prosody-aware, Autoregressive text-to-speech model for Realtime Dialogue
- 赛道归属: 文本转语音(TTS)/ 实时流式语音生成
- 核心创新点: GEPARD 的核心创新在于将 TTS 系统与标准 LLM 推理引擎(vLLM)深度融合:采用单一 decoder-only 模型联合训练文本与音频 embedding,实现真正的自回归语音生成;结合基于 FSQ(Finite Scalar Quantization)的神经编解码器,支持文本流入时逐块流式解码音频,从而在保证韵律感知(prosody-aware)的前提下,实现超低延迟的实时对话语音合成。其突破点在于无需专用推理基础设施,直接复用 LLM serving 生态(vLLM)即可部署生产级实时 TTS。
- AV-SafetyBench: A Safety Benchmark for Text-to-Audio-Video Generation 🆕NEW
- 赛道归属: 多模态安全评测 / 文本生成音视频(T2AV)安全基准
- 核心创新点: 构建了首个专门面向文本生成音视频(T2AV)联合生成模型的安全评测基准AV-SafetyBench。核心创新在于突破现有基准仅孤立评估视频或音频安全性的局限,引入跨模态联合安全评估范式——既能检测仅通过音频轨道传递的不安全内容,也能识别视觉与音频联合解读时才显现的跨模态风险,为多模态生成模型的安全对齐研究提供了新的评测维度。
- PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation
- 赛道归属: 音视频生成评测 / 多模态生成基准
- 核心创新点: PRISM-Bench 是首个以音频为中心的文本到音视频(T2AV)生成诊断基准,核心创新在于重新定义评测维度:现有基准将音频视为视频质量的附属项或孤立评估,PRISM-Bench 通过构建 900 条人工验证的精标数据集,系统性地从音频生成质量与音画对齐两个维度进行联合诊断评估,填补了当前 T2AV 评测体系中音频模态被严重低估的空白,为精准定位现有系统在音频生成上的能力边界提供了标准化工具。
- Hearing the Whispers: Black-Box Membership Inference Attacks on Finetuned TTS Models
- 赛道归属: 文本转语音(TTS)安全 / 成员推断攻击
- 核心创新点: 针对微调TTS模型提出首个黑盒成员推断攻击框架。核心突破在于解决TTS场景下的双重条件查询生成问题(同时依赖合成文本与参考语音),以及面向语音模态的表征工程方法。通过专门设计的查询构造策略和音频表征分析手段,在无需访问模型内部参数的前提下,有效推断目标语音样本是否参与了模型微调训练,揭示了个性化TTS模型在生物特征隐私方面的潜在安全威胁。
- Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation
- 赛道归属: 文本转语音(TTS)/ LLM对齐优化
- 核心创新点: 将LLM生成TTS友好文本的问题重新定义为偏好对齐任务,而非依赖下游改写模块。核心方法是构建两个偏好数据集(SPA),通过直接偏好优化(DPO)等对齐技术,使LLM在生成阶段即输出适合口语化朗读的文本(如避免缩写、歧义停顿、书面化表达等),从源头解决TTS输入质量问题,而非事后修补。
- Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech
- 赛道归属: 文本转语音(TTS)/ 多语言与代码切换语音合成
- 核心创新点: 提出短语级语言对比引导(LCG),一种无需训练的推理时框架,专门解决代码切换场景下外语短语被主语言口音"污染"的问题。核心突破在于将原本作用于整句的单一语言引导信号,替换为分段式、短语定位的对比引导——对代码切换短语单独施加其母语的语言引导,从而在不重新训练模型的前提下,精准恢复该短语的原生口音,实现细粒度的口音控制。
- Backdoor Attacks on Speech Emotion Recognition via TTS-Generated Poisoning
- 赛道归属: 语音情感识别(SER)安全 / 后门攻击
- 核心创新点: 首次系统性研究基于投毒的后门攻击在语音情感识别任务中的威胁,核心创新在于利用TTS生成音频作为投毒数据源,并设计了一种低能量、人耳难以察觉的隐蔽声学触发器。该触发器可无缝嵌入自然语音与合成语音中,实现可扩展且难以检测的后门植入,对依赖自监督声学表征的SER系统构成实质性威胁,填补了该领域训练时攻击研究的空白。
GitHub
- [2026-09-09] huggingface/diffusers ⭐34465
- [2026-09-08] SamurAIGPT/Generative-Media-Skills ⭐4251 🆕NEW
- [2026-09-07] BinWang28/audio-ai-hub ⭐953 🆕NEW
- [2026-09-04] vizart-vj/ComfyUI-MiniMax-H3-LongMedia ⭐220
- [2026-09-08] ShareLab-SII/VA-Judger ⭐63 🆕NEW
HuggingFace Models
语言大模型
arXiv
- Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning
- 赛道归属: 推理优化 / 链式思维控制
- 核心创新点: 将推理过程的引导建模为马尔可夫决策过程(MDP),提出 ACTS 框架,通过一个控制器智能体在推理过程中自适应地选择推理策略(如快速跳过、深度展开等),使推理行为在推理时可显式控制,而非依赖隐式的长度压缩或早停机制,实现了效率与可控性的统一。
- Triggering Chain-of-Thought via Latent Feature Interventions in Large Language Models
- 赛道归属: 推理机制可解释性 / 链式思维触发机制
- 核心创新点: 利用稀疏自编码器(SAE)捕获 LLM 内部表示中的稀疏特征,系统性地识别出与链式思维(CoT)推理行为因果相关的少量潜在特征,并通过定向激活干预验证其因果性,首次从内部表示层面揭示了触发 CoT 行为的神经机制,为推理行为的可解释性与可干预性提供了新路径。
- Typological Feature Prediction with Large Language Models: An In-Context Learning Approach
- 赛道归属: 多语言NLP / 语言类型学特征预测
- 核心创新点: 将大语言模型的上下文学习(In-Context Learning)能力引入语言类型学特征预测任务,突破了传统方法缺乏可解释性的局限。通过构建少样本提示范式,利用LLM的元语言推理能力不仅预测缺失的类型学特征值,还能生成可解释的预测依据,并系统性地评估了不同资源水平和特征类型下的预测性能差异。
- When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models
- 赛道归属: 推理优化 / 测试时计算扩展(Test-Time Scaling)综述
- 核心创新点: 将测试时计算扩展(TTS)统一抽象为"推理即搜索"的框架,系统梳理了从 CoT 单轨迹解码到树搜索(如 MCTS、Beam Search)等多种推理范式,构建了覆盖搜索空间定义、状态评估、搜索策略的统一分类体系,为该领域提供了系统性的理论视角和研究路线图。
- Detecting Hidden Chain-of-Thought in Large Language Models with Linguistic, Behavioral, and Mechanistic Indicators
- 赛道归属: 推理机制可解释性 / 隐式链式思维检测
- 核心创新点: 提出隐式 CoT 检测分数(HCDS),通过对比中性提示下模型行为与显式 CoT / 显式无 CoT 提示下行为的语言学、行为学及机制层面的对齐程度,构建了一套无需直接观测内部推理过程即可判断模型是否进行隐式推理的量化框架,填补了隐式推理检测方法论的空白。
- A*-Thought-V2: Efficient Latent Reasoning via Geometric Dynamics of LLM 🆕NEW
- 赛道归属: 推理优化 / 链式思维压缩
- 核心创新点: 提出将CoT推理过程建模为隐状态轨迹的几何动力学框架,核心突破在于以"显式-隐式交错潜在架构"替代传统的硬剪枝删除策略。通过将问题投影到潜在空间并利用LLM的几何动力学特性进行连续压缩,在保留中间推理信息的同时大幅降低计算和上下文开销,解决了现有方法要么丢失中间信息、要么缺乏连续压缩原则性准则的双重缺陷。
- Data Efficient Sample Selection for In-Context Learning 🆕NEW
- 赛道归属: 上下文学习(In-Context Learning)/ 样本选择优化
- 核心创新点: 针对ICL示例选择问题,突破了现有方法静态任务级离线选择的局限,提出对ICL样本与下游LLM性能之间复杂关系进行显式建模的数据高效选择框架。核心创新在于从静态离线选择转向动态自适应选择机制,能够对未见场景保持泛化能力,同时在大规模候选样本池中高效定位最优示例组合,显著提升ICL的数据利用效率。
- Not All LLM Reasoning is Visible in the Chain-of-Thought
- 赛道归属: 推理可解释性 / AI安全
- 核心创新点: 揭示了前沿语言模型存在"隐性推理"的具体失效模式——模型可以利用语义无关的填充词(filler tokens)在链式思维(CoT)输出之外隐式完成推理,从而提升任务表现。通过对13个前沿模型、三类合成推理任务的系统评测,证明填充词可带来最高13个百分点的精度提升,表明模型的实际推理过程并不完全体现在可见的输出token中,对CoT可解释性和AI安全监督机制提出了根本性挑战。
- Robust Dual-Signal Fusion: Hybrid Neuro-Symbolic Gating with Compressed Chain-of-Thought Refinement for Irony Detection in Social Media Texts 🆕NEW
- 赛道归属: 情感/语用理解 / 反讽检测 / 神经符号融合
- 核心创新点: 提出RDS(Robust Dual-Signal)融合框架,核心创新在于构建混合神经符号门控机制,将小规模LLM生成的压缩CoT推理链与静态预训练符号特征进行双信号融合。突破点在于:即便使用倾向于字面语义解释的小型LLM,通过压缩CoT提炼其隐式推理能力,并借助符号门控动态调节两路信号的贡献权重,从而在噪声社交媒体文本的少样本反讽检测任务中实现有效推断。
- Localizing and Correcting Errors for LLM-based Planners 🆕NEW
- 赛道归属: LLM规划推理 / 错误定位与纠正
- 核心创新点: 针对LLM在符号经典规划任务中频繁违反领域约束的问题,提出局部化上下文学习(L-ICL)迭代增强指令的方法。核心突破在于将传统全局ICL演示细化为针对具体失败步骤的局部化定向纠正示例,通过迭代方式将错误定位信息注入指令上下文,使模型能够精准识别并修正特定违约步骤,而非依赖泛化的全局示例,显著提升了LLM规划器在约束遵循方面的可靠性。
GitHub
- [2026-09-09] sgl-project/sglang ⭐35665
- [2026-09-09] NVIDIA/TensorRT-LLM ⭐14576
- [2026-09-09] openJiuwen-ai/jiuwenswarm ⭐8432
- [2026-09-09] flagos-ai/FlagGems ⭐1116
- [2026-09-09] evelyyyyynnnnn/1.0-Secure-Ai-Agent-Infrastructure ⭐191 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-09-06] openbmb/UltraData-SFT-Agent-2609
- [2026-09-07] openbmb/UltraData-Code
多模态大模型
arXiv
- VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models
- 赛道归属: 多模态理解 / 长视频理解
- 核心创新点: 提出递归套索自改进(Recursive Harness Self-Improvement, RSI)框架,在冻结视觉语言模型参数的前提下,专注于优化视频上下文构建过程本身。核心突破在于将上下文构建程序(context-construction harness)作为独立优化目标,通过递归自改进机制迭代提升可执行上下文的质量,从而在不修改底层模型权重的情况下显著提升长视频理解性能。这一方法将上下文构建与模型能力解耦,揭示了仅通过改进推理时的信息组织策略所能带来的性能上限。
- AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring 🆕NEW
- 赛道归属: 多模态理解 / 垂直领域视觉问答(建筑工地监控)
- 核心创新点: 提出AVA-VLM,采用受人类视觉启发的"粗到细"自适应注意力策略:先在低分辨率全局图像上推理定位关键区域,再对高置信度区域进行高分辨率局部裁剪精细分析。核心突破在于将动态视觉注意力机制与VLM推理流程深度融合,在不依赖单一全局图像直接微调的前提下,同时提升低分辨率输入下的鲁棒性与推理效率,解决了现有建筑工地VLM方案在实际部署中分辨率敏感、推理开销大的痛点。
- Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models
- 赛道归属: 多模态安全 / 多模态大模型安全对齐
- 核心创新点: 提出"跨模态安全漂移"概念,系统性研究视觉模态如何使原本良性的文本查询携带有害意图而绕过安全机制。核心方法是设计"安全意识迁移"机制,将文本模态中已有的安全感知能力迁移至视觉-语言联合理解场景,从而弥补多模态模型在跨模态语境下安全响应率显著低于纯文本场景的缺陷。
- Detecting Object Hallucinations in Large Vision-Language Models via Cross-Modal Attention Drifts and Mask-Based Verification
- 赛道归属: 多模态理解 / 视觉语言模型幻觉检测
- 核心创新点: 提出CADMP框架,创新性地利用相邻层间跨模态注意力漂移(而非单一层注意力)来刻画视觉定位的动态演化过程,结合目标区域遮蔽的预测敏感性验证,实现轻量级的对象幻觉检测。相比现有方法仅分析单层注意力的局限,CADMP通过跨层注意力变化趋势与掩码扰动响应的双重信号提升幻觉判断的准确性。
- SpanCalib-VLM: Calibrated Hallucination Span Detection in Vision-Language Models
- 赛道归属: 多模态理解 / 幻觉检测与校准
- 核心创新点: 提出 SpanCalib-VLM 混合双系统框架,专门用于视觉语言模型(VLM)中幻觉文本片段的检测与置信度校准。核心创新在于将生成式 VLM(擅长幻觉片段定位但存在过度自信和高推理延迟问题)与判别式序列标注器(具备确定性速度和更优校准性但召回率偏低)进行互补融合,通过双系统协同弥补各自短板,同时实现精准的 span 级幻觉定位与良好校准的置信度输出,在 SHROOM-Visions 共享任务上验证了该方案的有效性。
- Understanding Cross-Modal Contributions in Continual Vision-Language Models: A Theoretical Perspective 🆕NEW
- 赛道归属: 多模态理解 / 持续学习(Continual Learning)理论分析
- 核心创新点: 从理论视角系统分析持续视觉-语言模型中跨模态贡献的动态变化机制,揭示了顺序微调范式下视觉模态与语言模态对灾难性遗忘的差异化影响。核心突破在于建立了跨模态贡献量化的理论框架,明确指出现有方法在稳定性-可塑性权衡中忽视了模态间交互的不对称性,为设计更具理论依据的持续学习策略提供了新的分析基础。
- GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
- 赛道归属: 多模态理解 / 交通视频分析
- 核心创新点: 提出GHR-VLM框架,将视觉定位(Grounding)与混合推理(Hybrid Reasoning)结合,实现对公交车载长视频的零样本分析。核心突破在于融合监督视频模型的时序感知能力与VLM的语义推理能力,通过视觉锚定机制将VLM的推理范围约束在关键片段上,规避直接对长视频进行端到端推理带来的高成本和低可靠性问题。
- Parser-Free VLM Verification for Federated Weakly Supervised Video Anomaly Detection 🆕NEW
- 赛道归属: 多模态理解 / 视频异常检测(联邦弱监督)
- 核心创新点: 提出一种无需解析器的轻量级联邦MIL-VLM级联框架,核心设计是将训练与推理职责解耦:仅在各客户端本地训练紧凑的多实例学习(MIL)评分器,而将冻结的VLM仅用于对高分可疑片段进行服务端验证,完全规避了VLM在分布式端侧的密集推理、生成式解释及额外适配需求。该方案在保护数据隐私、适应弱标注和资源受限场景的同时,实现了VLM能力的高效复用。
- Thinking with Cameras: Active Visual Reasoning via Dynamic Viewpoint Control for Surveillance Video Understanding 🆕NEW
- 赛道归属: 多模态理解 / 监控视频理解(主动视觉推理)
- 核心创新点: 提出CamVLM框架,突破传统LVLM被动固定视角观测的局限,赋予模型"主动控制摄像机视角"的能力。核心创新在于将动态视点控制(如虚拟PTZ操作:平移、倾斜、缩放)建模为推理过程中的可执行动作,使模型能够根据场景理解需求自主决策何时、向何处调整视角以获取关键视觉证据,从根本上解决了监控场景中目标远小、遮挡或越界导致的视觉信息缺失问题。
- STAR-Pro: Stage-Wise Token Adaptive Reduction with Progressive Refinement for Efficient Large Vision-Language Models 🆕NEW
- 赛道归属: 推理优化 / 大视觉语言模型视觉Token压缩
- 核心创新点: 提出STAR-Pro,一种免训练的分阶段自适应视觉Token渐进式精简方法。通过两项互补分析发现现有激进剪枝方案的两大缺陷:跨模态融合前丢失大量特征空间覆盖,以及文本到视觉注意力的动态变化被忽视。核心突破在于将Token剪枝分解为多阶段渐进执行,并结合跨模态注意力信号动态调整各阶段保留率,在大幅降低计算开销的同时有效保全视觉信息完整性,无需任何额外训练即可部署。
GitHub
- [2026-09-08] Blaizzy/mlx-vlm ⭐5479
- [2026-09-09] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1848
- [2026-09-04] YuyangSunshine/Awesome-Continual-learning-of-Vision-Language-Models ⭐217
- [2026-09-07] NVIDIA-Omniverse/usd-content-agents ⭐197
- [2026-09-08] opendatalab/mineru-vl-utils ⭐138 🆕NEW
强化学习
arXiv
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning
- 赛道归属: 强化学习 / LLM智能体训练
- 核心创新点: 提出ARISE-RL全周期自进化框架,核心突破在于将评分标准(Rubric)的生成与策略优化解耦并迭代耦合:首先由模型自动生成可验证的评分标准以解决开放任务缺乏金标答案的问题,再通过基于标准的奖励信号驱动GRPO策略更新;针对长时域任务中奖励稀疏导致的rollout对比度弱问题,引入组内对比增强机制,从而在能力边界附近提供更细粒度的优化信号,实现模型自我进化的闭环。
- RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training
- 赛道归属: 具身智能 / VLA模型强化学习训练框架
- 核心创新点: 针对VLA模型训练中同步RL框架与实际需求不匹配的问题,提出了一种灵活异步的RL训练框架RL-VLA³。核心突破在于打破传统LLM训练中"数据采集-策略优化"严格交替的同步范式,将完整rollout拆解为可独立处理的单元,支持数据采集与策略优化的异步并行执行,从而更好地适配VLA训练中动作执行延迟长、环境交互频率低等独特特性,显著提升训练效率与灵活性。
- Iterative GRPO: Batch-Online Policy Iteration for Multi-Turn RL via Single-Turn RLHF
- 赛道归属: 强化学习 / 多轮对话LLM训练
- 核心创新点: 提出Iterative GRPO方法,将多轮对话RL训练转化为单轮RLHF问题的批量在线策略迭代。核心突破在于:通过将多轮交互轨迹"展平"为单轮形式,使得无需实时外部环境(真实用户)参与训练循环,利用离线或模拟的对话历史构造批次,以单轮RLHF的GRPO算法迭代更新策略,从而绕开多轮RL中环境响应依赖的工程瓶颈,同时保持策略的近似在线性。
- SUN: Reaching for Novelty in Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习探索策略 / 目标条件强化学习
- 核心创新点: 提出 SUN 框架,将目标新颖性(novelty)与可达性(reachability)统一建模为单一目标函数,而非传统方法中的手动权衡或串行处理。通过显式集成两个信号,实现更高效的状态空间覆盖,解决了稀疏奖励环境下探索效率低下的核心问题。
- Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning 🆕NEW
- 赛道归属: 多模态推理 / 工具增强型智能体 / 强化学习微调
- 核心创新点: 针对多模态推理智能体在工具使用(如网络搜索)中缺乏自我验证能力的问题,提出利用 RL(GRPO)微调机制主动激发模型的自我验证行为。核心突破在于:在仅有稀疏结果级监督信号的条件下,使模型能够同时处理文本与图像输入、整合噪声检索证据,并对自身推理过程进行可靠性校验,无需显式验证标注。
- One Step, One Lead: Mitigating Higher-Order Interference in Multi-Domain Reinforcement Learning via Cross-Step Control 🆕NEW
- 赛道归属: 大语言模型强化学习训练 / 多域联合优化
- 核心创新点: 指出现有多域 RL 训练中仅关注单步梯度对齐(一阶干扰)的局限性,首次揭示跨步高阶干扰(higher-order interference)现象——即同一点处各域梯度近似正交时仍可能存在严重的序列性优化冲突。提出跨步控制(Cross-Step Control)机制,从多步优化轨迹视角缓解域间干扰,提升多域联合训练的稳定性与各域性能。
- DataFlex-RL: An Evaluation Platform for RLVR Data Policies 🆕NEW
- 赛道归属: 强化学习数据策略评估 / RLVR 训练基础设施
- 核心创新点: 构建 DataFlex-RL 评估平台,专门用于系统性比较 RLVR(带可验证奖励的强化学习)中的数据策略差异,包括 rollout 筛选规则、样本加权方式及域采样配比。在统一 GRPO 训练配方下,通过 13 种配置 × 12 个随机种子的大规模对照实验,提供了迄今最为受控的数据策略基准,揭示了均匀 GRPO 在数学、逻辑、科学等多基准上的基线表现规律。
- EnvCraft: Synthesizing Executable Environments in Agentic RL for Claw-like Agent 🆕NEW
- 赛道归属: 智能体强化学习 / 训练环境合成 / LLM 智能体
- 核心创新点: 针对 Agentic RL 训练中交互环境严重匮乏的瓶颈问题,提出 EnvCraft 框架,能够自动合成可执行的端到端交互训练环境(突破现有合成环境仅支持工具调用接口的局限)。核心创新在于支持具有状态工作空间的长时域任务环境生成,为类 Claw 智能体提供更贴近真实部署场景的训练条件,从根本上缓解 Agentic RL 的数据扩展瓶颈。
- Unifying ICL, SFT, KL-Regularized RL Through a Bayesian Lens
- 赛道归属: 大语言模型 / 训练范式统一理论
- 核心创新点: 从贝叶斯推断视角出发,将ICL、SFT、KL正则化RL(RLHF/RLVR)、在线策略蒸馏(OPD)及测试时推理搜索等看似独立的训练与推理范式统一在同一理论框架下。核心突破在于揭示上述方法本质上均是对同一后验分布的不同近似或推断方式,从而解释了"少样本提示对RL调优推理模型效果参差不齐"等经验现象背后的理论根源,为跨范式方法的比较与组合提供了统一的分析工具。
- Reinforcement Learning for Sequential Solar PV Policy Design under Uncertainty: An Agent-Based Approach
- 赛道归属: 强化学习应用 / 能源政策优化(太阳能光伏)
- 核心创新点: 将太阳能光伏补贴政策设计建模为序列决策问题,创新性地将RL与随机Agent-Based Model(ABM)深度耦合。核心突破在于:RL策略制定者智能体在ABM模拟的异质性居民决策环境中动态选择年度激励组合(资本补贴、补贴等),ABM负责模拟不确定性下的逐年光伏采纳行为,两者形成闭环,使RL能够在兼顾财政可持续性的前提下优化政策序列,解决了传统静态政策设计无法应对不确定性与异质性的根本缺陷。
GitHub
- [2026-09-09] huggingface/trl ⭐19248
- [2026-09-09] radixark/miles ⭐2682
- [2026-09-09] Tencent-Hunyuan/UniRL ⭐937
- [2026-09-09] redai-studio/Relax ⭐597
- [2026-09-09] raamonp/rl-gym-orchestrator ⭐55
HuggingFace Models
HuggingFace Datasets
- [2026-09-07] openbmb/UltraData-RL-2609
- [2026-09-04] zouhar/last-translation-benchmark
世界动作模型
arXiv
- Learning to Use Imagination: Progress-Conditioned Future Utilization for World Action Models 🆕NEW
- 赛道归属: 世界动作模型(World Action Model)/ 具身智能与机器人控制
- 核心创新点: 针对现有WAM在利用想象未来时缺乏对执行进度自适应的问题,提出了"进度条件化未来利用"机制。核心突破在于识别并建模两类未来效用非均匀性:(1)跨进度层面——不同执行阶段对想象未来的依赖程度不同;(2)跨视角层面——同一时刻不同视角的预测可靠性存在差异。通过动态调节想象未来对动作生成的贡献权重,使模型能够在执行过程中"学会何时以及如何使用想象力",而非固定地依赖预测信息,从而减少不可靠预测带来的干扰。
- Spatially Aware World Action Model via Geometric Latent Diffusion
- 赛道归属: 世界动作模型 / 机器人策略学习 / 3D空间感知视频生成
- 核心创新点: 提出空间感知世界动作模型(SA-WAM),核心突破在于将几何信息(深度图等3D结构)以几何潜在扩散的方式融入原本仅依赖RGB观测的视频扩散框架中。通过复用预训练视频扩散模型并引入几何潜在空间,使模型在预测未来视觉观测的同时能够感知和利用三维空间结构,从而为机器人策略学习提供更丰富的物理先验,弥补了现有WAM缺乏3D空间理解的关键缺陷。
- World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action Models
- 赛道归属: 世界动作模型 / 机器人策略学习 / 测试时规划与推理优化
- 核心创新点: 提出世界一致性解码(World-Coherent Decoding, WCD)框架,核心突破在于将WAM的多次前向采样结果视为"可证伪的未来-动作假设",并利用模型自身的内部生成信号(无需外部奖励或额外监督)对候选轨迹进行自我验证与排序。该方法在推理阶段(测试时)通过多候选采样+内生一致性评分机制,有效过滤低质量的随机生成结果,解决了WAM输出对采样结果高度敏感的问题,实现了无需重新训练模型的测试时规划增强。
- WALL-WM: Carving World Action Modeling at the Event Joints 🆕NEW
- 赛道归属: 世界动作模型(World Action Model)/ 具身智能与机器人控制
- 核心创新点: 提出以语义连贯的动作事件(Action Event)作为学习原子单元,取代传统WAM中固定长度动作块(chunk)的优化范式。核心突破在于将视频-动作学习的粒度从"块中心"转向"事件接缝"(Event Joints)——在语义边界处切分视频,使预训练对齐的时序单元与真实动作语义结构一致,解决了固定chunk划分导致的语义粒度错配问题。这一设计使模型在VLA预训练阶段即能捕获结构化的事件级时序依赖,而非在任意帧边界上强行对齐动作与视觉动态。
- ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training
- 赛道归属: 具身智能 / 世界动作模型 / 机器人操控预训练
- 核心创新点: ZimaBlue 的核心创新在于提出了一种可扩展的无动作标注视频预训练范式,用于构建可泛化的世界动作模型。其方法论突破体现在以下几点:①将大规模第一人称(Egocentric)视频作为替代机器人轨迹数据的预训练来源,绕开了动作标注数据稀缺且多样性不足的瓶颈;②设计了将"无动作"视频经验有效转化为可用于机器人操控的动作先验的训练机制,使模型能从丰富的物体交互、接触动力学和工具使用视频中学习物理世界的通用规律;③通过规模化预训练提升模型的跨场景泛化能力,使其在下游机器人任务上无需大量动作标注数据即可实现有效迁移。该工作的本质是将视频生成/理解领域的扩展规律引入具身智能,以互联网级视频数据驱动世界动作模型的通用化。
- SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space 🆕NEW
- 赛道归属: 世界动作模型(World Action Model)/ 具身智能与机器人控制
- 核心创新点: 提出在几何感知的策略空间中进行自引导世界建模,解决现有WAM在未来状态建模空间上"动作相关性"与"几何感知性"难以兼得的矛盾。核心突破体现在两点:(1)构建一个联合结构化的潜在空间,同时满足与动作生成对齐和对场景几何变化敏感的双重需求,避免了观测空间目标感知负担过重或辅助潜空间缺乏几何结构的缺陷;(2)采用自引导(Self-Guided)机制,无需额外监督信号即可在该几何感知空间内驱动世界模型的学习,使预测的未来动态更直接地服务于"在哪里"和"如何"改变场景的动作决策。
GitHub
- [2026-09-07] OpenMOSS/Awesome-WAM ⭐1392
- [2026-09-07] DravenALG/awesome-vla-wam ⭐1011 🆕NEW
- [2026-09-09] OpenWAM-Official/OpenWAM ⭐251
- [2026-09-06] OpenMOSS/EasyWAM ⭐180
由 Research Daily 自动生成 生成时间: 2026-09-09 05:31:55