AI 每日进展速报 - 2026-09-07
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- SpatialGuard: Harness-Guided Verifiable Spatial Reasoning for Text-to-Image Generation
- 赛道归属: 文生图 / 空间推理增强
- 核心创新点: 提出 SpatialGuard 框架,在文本到图像生成流程中引入可优化、可验证的结构化空间中间表示("harness"),作为语言描述与视觉采样之间的几何桥梁。核心突破在于将3D空间关系(遮挡、可见性、相机约束等)显式编码为可校验的布局约束,从而在多轮生成中防止空间几何信息的退化,解决了现有提示驱动或布局条件方法缺乏可验证空间中间体的根本缺陷。
- T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image Generation
- 赛道归属: 文生图 / 评测基准
- 核心创新点: 提出首个专注于"局部语义控制"的文生图评测基准 T2LSC-Bench,核心创新在于定义并量化了"目标文本关联语义泄漏"现象——即在指定区域渲染目标文字时,对主体身份或周围场景语义造成非预期改变的问题。该基准系统性地评估模型在产品标签、标牌等应用场景下,能否在保持预定主体身份与场景语义不变的前提下,精准完成局部文字渲染,填补了现有评测体系对局部文字可控性考察的空白。
- How far can we go with ImageNet for Text-to-Image generation? 🆕NEW
- 赛道归属: 文生图(Text-to-Image Generation)
- 核心创新点: 挑战"数据量越大越好"的主流范式,证明仅使用 ImageNet 配合精心设计的文本增强与图像增强策略,即可达到在十亿级网络爬取数据集上训练的模型性能。核心突破在于通过高质量的数据增强手段(文本描述生成 + 图像变换)弥补数据规模不足的缺陷,同时显著提升了训练数据的可复现性与开放性,为学术界提供了一条低成本、可复现的文生图研究路径。
- RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing
- 赛道归属: 图像生成/编辑 · 奖励模型与对齐
- 核心创新点: 提出 RubricRM,一种基于动态评分标准(Rubric)的生成式奖励建模框架。与现有视觉奖励模型依赖单一标量分数或固定评估维度不同,RubricRM 能够根据不同的输入指令动态生成评估维度(Rubric),再基于这些维度进行成对比较打分。这一设计使奖励模型同时具备可解释性和任务自适应性,能够针对文生图和指令驱动图像编辑等不同任务的差异化需求灵活调整评估标准,突破了固定准则在多样化任务场景下泛化能力不足的瓶颈。
- WeAgent-MMGenEdit: A Full-Stack Recipe for Multimodal Agentic Image Generation and Editing 🆕NEW
- 赛道归属: 图像生成与编辑(Multimodal Agentic Image Generation & Editing)
- 核心创新点: 提出一套全栈式多模态智能体框架,专门解决提示词依赖外部世界知识时生成/编辑模型失效的问题。核心创新体现在三个层面:①引入检索增强机制补充长尾事实与视觉外观知识;②设计充分的视觉验证模块,避免检索内容与生成结果不一致;③将策略模型与检索/生成工具解耦,通过模块化协作替代单一过载的策略模型,从而实现更鲁棒的知识驱动图像生成与编辑流程。
- Multi-Tool Image Editing Attribution in Facial Forgery
- 赛道归属: 图像编辑 / 取证溯源
- 核心创新点: 突破了现有图像编辑归因方法"单工具假设"的局限,首次系统性地建模并解决多工具复合编辑场景下的归因问题。核心方法论创新在于处理不同编辑工具留下的伪影在图像中相互叠加、混合的复杂情形,能够从单张人脸图像中同时识别出多个参与编辑的AI工具,而非仅判断单一工具,更贴近真实世界中生成式AI滥用的复杂场景。
- AffectDelta: Beyond Emotion Labels for Image Editing
- 赛道归属: 图像编辑 / 情感驱动生成
- 核心创新点: 提出超越单一情感类别标签的情感驱动图像编辑框架 AffectDelta,核心创新在于以"情感增量(Delta)"替代粗粒度情感类别作为编辑目标。传统方法将复杂情感状态折叠为单一标签,且依赖文本指令描述视觉变换,存在语义精度不足的问题。该工作通过建模情感空间中的方向性变化,实现更细粒度、更连续的情感视觉线索修改,同时保持场景整体构图与语义结构的一致性。
- SR-Edit: Region-Aware Image Editing via Self-Refinement
- 赛道归属: 图像编辑 / 区域感知编辑
- 核心创新点: 提出基于自精炼(Self-Refinement)机制的区域感知图像编辑方法 SR-Edit,核心创新在于无需外部区域标注的前提下,通过模型自身的迭代自精炼过程自动推断编辑区域与非编辑区域的边界,并对非编辑区域施加一致性约束。相较于现有自动区域推断方法,该方法在精准修改目标区域的同时,对非目标区域的保真度保持更为严格,解决了外部区域标注难以获取与编辑溢出之间的核心矛盾。
- Blending Concepts: Benchmarking Visual Metaphor Generation in Text-to-Image Models
- 赛道归属: 文生图 / 创意生成 / 评测基准
- 核心创新点: 提出首个专门评估文生图模型视觉隐喻生成能力的基准 VMetaphor-Bench,填补了该领域评测空白。核心创新在于将视觉隐喻这一高阶创意认知任务形式化为可量化的评测问题——即模型能否通过融合两个不同语义域的元素来传达抽象概念。基准包含1500个来自真实创意图像的视觉隐喻样本,系统性地揭示了当前T2I模型在抽象概念组合与跨域语义融合方面的能力边界。
- Domain shift-robust object detection with GenAI image editing
- 赛道归属: 图像编辑 / 目标检测 / 数据增强
- 核心创新点: 将扩散模型驱动的生成式图像编辑引入目标检测的域偏移鲁棒性问题,核心创新在于利用生成式编辑技术在低数据场景下合成覆盖光照、天气、遮挡等多种域变化的训练样本,从而缓解检测器对训练分布视觉捷径的过度依赖。该方法无需大规模真实世界跨域数据采集,通过可控的图像编辑定向扩充训练分布,为专业化小样本场景下的域泛化提供了一条数据驱动的新路径。
GitHub
- [2026-09-07] pydantic/pydantic-ai ⭐19756
- [2026-09-07] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13378
- [2026-09-07] Osmantic/ODS ⭐6212
- [2026-09-07] franksong2702/dsh-codex-connect ⭐89
- [2026-09-07] piexian/astrbot_plugin_gemini_image_generation ⭐51 🆕NEW
视频生成/编辑
arXiv
- ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation
- 赛道归属: 视频生成(角色一致性文生视频)
- 核心创新点: 提出 ContextAnyone 框架,核心突破在于将参考图像从传统的"条件信号"升级为"上下文令牌",通过上下文感知扩散机制,将参考图像的外观信息以独立上下文序列的形式注入去噪过程,避免了参考特征与噪声视频令牌直接交互导致的细粒度外观信息衰减问题,从而在角色经历大幅度姿态变化、运动变化和场景切换时,仍能保持单参考图像中角色的整体外观一致性。
- CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation
- 赛道归属: 文生视频 / 评测基准
- 核心创新点: 提出首个专门评估文生视频模型文化理解能力的综合基准 CultureVidBench,突破现有基准仅关注感知质量、物理合理性和文本对齐的局限,系统性地引入文化特定对象、动作、仪式、可见文字及音频线索等多维度文化评估指标,填补了T2V模型跨文化表征能力评测的空白。
- TokenDial: Continuous Attribute Control for Text-to-Video Generation in Visual Dial Space 🆕NEW
- 赛道归属: 视频生成 / 可控视频生成
- 核心创新点: 提出"视觉拨盘空间(Visual Dial Space V+)"这一新型语义控制空间,利用视频扩散Transformer中视觉patch token的通道维度作为连续属性控制的语义空间。核心突破在于:通过向token流广播可加性方向向量,实现对外观(如年龄)和运动(如速度)属性的滑块式连续控制,无需修改模型结构或引入额外条件网络,仅在token特征空间内完成细粒度属性调节。
- ReaDiT Guidance: Control for Image and Video Generation using Diffusion Transformer Features 🆕NEW
- 赛道归属: 图像生成 / 视频生成 / 可控生成(ControlNet类)
- 核心创新点: 提出ReaDiT Guidance框架,利用扩散Transformer(DiT)单个block的内部特征表示,在推理时实现对深度图、姿态图、边缘图等空间条件的轻量级控制,无需训练额外的控制网络。核心突破在于:直接读取DiT内部特征并将其作为引导信号,以极低的计算开销实现测试时的空间条件控制,并天然扩展至文生视频模型(因其同样基于DiT骨干),统一了图像与视频的可控生成范式。
- DSAQuant: Denoising-Stage-Aligned Quantization-Aware Training for Video Generation
- 赛道归属: 视频生成 / 推理优化(量化感知训练)
- 核心创新点: 针对视频扩散模型(VDMs)在量化感知训练(QAT)中存在的独特问题——量化模型虽能保留语义和全局布局,但在细节纹理和时序一致性上出现退化——提出了"去噪阶段对齐量化感知训练"方法(DSAQuant)。其核心突破在于:识别并利用扩散模型不同去噪阶段对量化误差敏感度不同的特性,将QAT过程与去噪阶段显式对齐,针对不同阶段分配差异化的量化策略或训练目标,从而在压缩模型的同时精准修复细粒度视觉质量和时序连贯性的损失,实现了推理阶段零额外开销的高效视频生成部署。
- Encore: Infinite Audio-Video Generation with Adaptive Signal Routing 🆕NEW
- 赛道归属: 视频生成 / 音视频联合生成 / 长视频生成
- 核心创新点: 提出Encore框架,首次实现无限时长的音视频联合生成。核心突破在于引入"自适应信号路由(Adaptive Signal Routing)"机制,针对视频时序连贯性、音频时序连贯性和跨模态同步三类条件信号的不同传播路径,设计差异化的路由策略,在分块迭代合成过程中同时维持三类一致性约束,解决了长音视频联合生成中多路条件信号相互干扰、难以协同的核心难题。
- EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders
- 赛道归属: 视频生成 / 模型安全与概念消除
- 核心创新点: 提出基于稀疏自编码器(Sparse Autoencoder, SAE)的文生视频扩散模型概念精准消除方法 EraseSAE。现有概念消除方法以粗粒度方式操作,与概念在模型内部以细粒度、分布式方式存在的本质不匹配,导致过度遗忘或消除不彻底。EraseSAE 的核心突破在于:利用 SAE 将扩散模型的内部表征分解为可解释的稀疏特征,精准定位与目标概念对应的特征维度,并实施"外科手术式"的定向消除,在彻底移除目标语义的同时最大程度保留无关概念的生成能力,从机制层面解决了概念表征的细粒度对齐问题。
- The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation
- 赛道归属: 视频生成(脚本驱动音视频联合生成)
- 核心创新点: 针对现有联合音视频生成模型在精确时序控制上的缺失,提出"时序上下文路由"(Temporal Context Routing)机制,核心突破在于在共享时间轴的基础上引入专用的时序路由模块,显式建模镜头转换时刻与对话发生时刻的精确对齐关系,使模型能够依据脚本中的时序标注精准控制画面切换和语音起止点,解决了现有方法时序误差导致叙事连贯性破坏的问题,为脚本驱动的内容创作提供了细粒度时序可控能力。
- MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video Generation
- 赛道归属: 视频生成 / 相机控制视频生成
- 核心创新点: 针对现有相机控制视频生成中几何感知位置编码在真实度量相机轨迹下存在的尺度依赖失效问题(齐次投影编码导致注意力logits和特征范数随物理平移基线无界增长),提出MeRoPE(度量旋转位置编码)。其核心突破在于设计了一种范数保持的相对相机编码方式,将相机外参和每个token的视线方向以旋转不变的相对形式嵌入注意力机制,从根本上消除了绝对度量尺度对注意力计算的数值不稳定影响,使模型能够泛化到任意物理尺度的相机运动轨迹。
- Physically Plausible Video Generation via Visual-Semantic Chain-of-Events Conditioning
- 赛道归属: 视频生成 / 物理合理性视频生成
- 核心创新点: 针对物理合理视频生成中自然语言条件描述不足(仅整体描述物理现象、忽略中间状态和过渡动态)的核心问题,将物理合理视频生成任务重新建模为以"事件链"为中心的生成范式。提出Visual-Semantic Chain-of-Events(视觉语义事件链)条件机制,将物理演化过程显式分解为一系列具有中间状态和转变动态的离散事件节点,并以此作为生成条件。相比传统CoT仅在语义层面增强提示词,该方法同时引入视觉与语义双层事件链约束,有效弥合了语言描述与物理动态过程之间的语义鸿沟。
GitHub
- [2026-09-07] hao-ai-lab/FastVideo ⭐4342
- [2026-09-07] ZeroLu/awesome-seedance ⭐2382
- [2026-09-07] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1955
- [2026-09-07] szczyglis-dev/py-gpt ⭐1901 🆕NEW
- [2026-09-06] guaardvark/guaardvark ⭐204
HuggingFace Models
HuggingFace Spaces
音频生成
arXiv
- FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
- 赛道归属: 文本转语音(TTS)/ 语音合成
- 核心创新点: 提出 FNH-TTS 系统,在基于 VITS 的端到端语音合成框架中引入混合专家(Mixture-of-Experts, MoE)时长建模机制。核心突破在于通过多个专家子网络动态捕捉不同语言上下文和说话人风格下的时长分布差异,解决了传统单一时长预测器难以建模韵律节奏多样性的问题,从而在保持端到端训练优势的同时,显著提升了合成语音的韵律自然度与鲁棒性。
- GEPARD - Generative, Prosody-aware, Autoregressive text-to-speech model for Realtime Dialogue 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 实时流式语音生成
- 核心创新点: GEPARD 的核心创新在于将 TTS 系统与标准 LLM 推理引擎(vLLM)深度融合:采用单一 decoder-only 模型联合训练文本与音频 embedding,实现真正的自回归语音生成;结合基于 FSQ(Finite Scalar Quantization)的神经编解码器,支持文本流入时逐块流式解码音频,从而在保证韵律感知(prosody-aware)的前提下,实现超低延迟的实时对话语音合成。其突破点在于无需专用推理基础设施,直接复用 LLM serving 生态(vLLM)即可部署生产级实时 TTS。
- PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation 🆕NEW
- 赛道归属: 音视频生成评测 / 多模态生成基准
- 核心创新点: PRISM-Bench 是首个以音频为中心的文本到音视频(T2AV)生成诊断基准,核心创新在于重新定义评测维度:现有基准将音频视为视频质量的附属项或孤立评估,PRISM-Bench 通过构建 900 条人工验证的精标数据集,系统性地从音频生成质量与音画对齐两个维度进行联合诊断评估,填补了当前 T2AV 评测体系中音频模态被严重低估的空白,为精准定位现有系统在音频生成上的能力边界提供了标准化工具。
- Hearing the Whispers: Black-Box Membership Inference Attacks on Finetuned TTS Models
- 赛道归属: 文本转语音(TTS)安全 / 成员推断攻击
- 核心创新点: 针对微调TTS模型提出首个黑盒成员推断攻击框架。核心突破在于解决TTS场景下的双重条件查询生成问题(同时依赖合成文本与参考语音),以及面向语音模态的表征工程方法。通过专门设计的查询构造策略和音频表征分析手段,在无需访问模型内部参数的前提下,有效推断目标语音样本是否参与了模型微调训练,揭示了个性化TTS模型在生物特征隐私方面的潜在安全威胁。
- Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation
- 赛道归属: 文本转语音(TTS)/ LLM对齐优化
- 核心创新点: 将LLM生成TTS友好文本的问题重新定义为偏好对齐任务,而非依赖下游改写模块。核心方法是构建两个偏好数据集(SPA),通过直接偏好优化(DPO)等对齐技术,使LLM在生成阶段即输出适合口语化朗读的文本(如避免缩写、歧义停顿、书面化表达等),从源头解决TTS输入质量问题,而非事后修补。
- Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech
- 赛道归属: 文本转语音(TTS)/ 多语言与代码切换语音合成
- 核心创新点: 提出短语级语言对比引导(LCG),一种无需训练的推理时框架,专门解决代码切换场景下外语短语被主语言口音"污染"的问题。核心突破在于将原本作用于整句的单一语言引导信号,替换为分段式、短语定位的对比引导——对代码切换短语单独施加其母语的语言引导,从而在不重新训练模型的前提下,精准恢复该短语的原生口音,实现细粒度的口音控制。
- Vagdhenu: A Vrutta (Meter) Aware Shloka-to-Chant (TTS) System for Sanskrit
- 赛道归属: 文本转语音(TTS)/ 梵语吟诵合成
- 核心创新点: 针对梵语颂诗(Shloka)的吟诵合成任务,提出了一套专用前端处理流水线,核心突破在于:①通过卡纳达语正字法路由规避了梵文天城体(Devanagari)在印地语TTS模型中常见的"schwa删除"问题,从而保留梵语发音的完整性;②引入韵律(Vrutta/Meter)感知机制,使合成语音能够忠实还原传统吟诵(Parayana)的节律特征。整体方案以现成的流匹配(Flow-Matching)TTS骨干网络和大规模神经声码器为基础,重点贡献在于领域适配的前端工程设计,而非新架构提出。
- Backdoor Attacks on Speech Emotion Recognition via TTS-Generated Poisoning
- 赛道归属: 语音情感识别(SER)安全 / 后门攻击
- 核心创新点: 首次系统性研究基于投毒的后门攻击在语音情感识别任务中的威胁,核心创新在于利用TTS生成音频作为投毒数据源,并设计了一种低能量、人耳难以察觉的隐蔽声学触发器。该触发器可无缝嵌入自然语音与合成语音中,实现可扩展且难以检测的后门植入,对依赖自监督声学表征的SER系统构成实质性威胁,填补了该领域训练时攻击研究的空白。
- Joycent: Multi-Accent TTS via Disentangled Accent Modeling and Layer-Specific Conditioning
- 赛道归属: 语音合成(TTS)/ 多口音语音生成
- 核心创新点: 提出 Joycent,一个基于扩散模型的多口音 TTS 框架,核心突破在于双层解耦策略:在表示学习阶段将口音特征与说话人身份特征显式分离,并在 TTS 条件注入阶段采用层级特定条件化(Layer-Specific Conditioning)机制,将两类解耦因子分别注入扩散模型的不同层,从而在保留说话人音色的同时实现精准的目标口音迁移,解决了传统方法中口音与说话人特征相互纠缠导致生成质量下降的问题。
- Self-EmoQ: Plutchik-Guided Value-based Planning to Drive Streaming Emotional TTS
- 赛道归属: 情感语音合成(Emotional TTS)/ 对话式AI / 强化学习
- 核心创新点: 提出Self-EmoQ框架,首次引入情绪先验规划机制,使系统在文本生成之前即自主决定情绪状态,从而驱动下游流式情感TTS合成。核心创新包括:以Plutchik情绪轮为理论基础构建情绪价值空间,通过强化学习(RL)训练即插即用的LLM情绪规划模块,打破了传统情感TTS依赖外部情绪标注或事后情绪注入的范式,实现了情绪感知与语音生成的端到端流式协同。
GitHub
- [2026-09-07] huggingface/diffusers ⭐34452
- [2026-09-02] Stability-AI/stable-audio-tools ⭐3855
- [2026-09-05] raphaelsalaja/audio ⭐565 🆕NEW
- [2026-09-04] vizart-vj/ComfyUI-MiniMax-H3-LongMedia ⭐211 🆕NEW
- [2026-09-06] MAz-Codes/Fragmenta ⭐61 🆕NEW
HuggingFace Models
- MiniMaxAI/MiniMax-H3 🆕NEW
语言大模型
arXiv
- Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning
- 赛道归属: 推理优化 / 链式思维控制
- 核心创新点: 将推理过程的引导建模为马尔可夫决策过程(MDP),提出 ACTS 框架,通过一个控制器智能体在推理过程中自适应地选择推理策略(如快速跳过、深度展开等),使推理行为在推理时可显式控制,而非依赖隐式的长度压缩或早停机制,实现了效率与可控性的统一。
- Triggering Chain-of-Thought via Latent Feature Interventions in Large Language Models
- 赛道归属: 推理机制可解释性 / 链式思维触发机制
- 核心创新点: 利用稀疏自编码器(SAE)捕获 LLM 内部表示中的稀疏特征,系统性地识别出与链式思维(CoT)推理行为因果相关的少量潜在特征,并通过定向激活干预验证其因果性,首次从内部表示层面揭示了触发 CoT 行为的神经机制,为推理行为的可解释性与可干预性提供了新路径。
- Typological Feature Prediction with Large Language Models: An In-Context Learning Approach
- 赛道归属: 多语言NLP / 语言类型学特征预测
- 核心创新点: 将大语言模型的上下文学习(In-Context Learning)能力引入语言类型学特征预测任务,突破了传统方法缺乏可解释性的局限。通过构建少样本提示范式,利用LLM的元语言推理能力不仅预测缺失的类型学特征值,还能生成可解释的预测依据,并系统性地评估了不同资源水平和特征类型下的预测性能差异。
- When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models
- 赛道归属: 推理优化 / 测试时计算扩展(Test-Time Scaling)综述
- 核心创新点: 将测试时计算扩展(TTS)统一抽象为"推理即搜索"的框架,系统梳理了从 CoT 单轨迹解码到树搜索(如 MCTS、Beam Search)等多种推理范式,构建了覆盖搜索空间定义、状态评估、搜索策略的统一分类体系,为该领域提供了系统性的理论视角和研究路线图。
- Detecting Hidden Chain-of-Thought in Large Language Models with Linguistic, Behavioral, and Mechanistic Indicators
- 赛道归属: 推理机制可解释性 / 隐式链式思维检测
- 核心创新点: 提出隐式 CoT 检测分数(HCDS),通过对比中性提示下模型行为与显式 CoT / 显式无 CoT 提示下行为的语言学、行为学及机制层面的对齐程度,构建了一套无需直接观测内部推理过程即可判断模型是否进行隐式推理的量化框架,填补了隐式推理检测方法论的空白。
- Improving LLM Interpretability with User-Centric Chain-of-Thought Reasoning
- 赛道归属: LLM可解释性 / 推理链优化
- 核心创新点: 提出以用户为中心的思维链(Chain-of-Thought)设计范式,核心突破在于将推理轨迹的优化目标从"提升模型性能"转向"提升人类可读性与可检验性"。通过基于自我一致性(self-consistency)的结构化推理轨迹设计,使中间推理步骤更符合人类认知习惯,从而在保持模型能力的同时增强人机协作中的可信度与透明度。
- Not All LLM Reasoning is Visible in the Chain-of-Thought 🆕NEW
- 赛道归属: 推理可解释性 / AI安全
- 核心创新点: 揭示了前沿语言模型存在"隐性推理"的具体失效模式——模型可以利用语义无关的填充词(filler tokens)在链式思维(CoT)输出之外隐式完成推理,从而提升任务表现。通过对13个前沿模型、三类合成推理任务的系统评测,证明填充词可带来最高13个百分点的精度提升,表明模型的实际推理过程并不完全体现在可见的输出token中,对CoT可解释性和AI安全监督机制提出了根本性挑战。
- Large Language Models for HVAC Operations in Building Energy Systems: A Critical Review of Methods, Applications, and Deployment Readiness 🆕NEW
- 赛道归属: 垂直领域应用 / 建筑能源系统
- 核心创新点: 对2023年至2026年3月间66篇关于LLM应用于HVAC(暖通空调)运维的同行评审研究进行系统性综述,首次构建了覆盖五类应用场景与三类LLM方法族的分类编码框架,并引入"证据真实性"与"部署就绪度"双维度评估体系,系统性地识别了异构传感器命名、元数据缺失、文档碎片化等核心落地障碍,为LLM在建筑能源系统中的工程化部署提供了方法论路线图。
- Can Large Language Models Anticipate Behavioral Responses to Social Policies? A Case of Pension Enrollment Prediction among China's Flexible Workers 🆕NEW
- 赛道归属: 垂直领域应用 / 社会政策评估
- 核心创新点: 提出将通用LLM适配为社会政策影响评估工具的新范式,构建了首个面向中国灵活就业人员养老金参保预测的领域专用模型FlexPension-LLM,将政策影响评估形式化为层次化参保行为预测任务。相较于传统计量经济学方法在假设情景下外推不可靠、实地试点成本高昂的痛点,该方法通过LLM模拟个体行为响应,为政策制定者提供了低成本、可扩展的预测性评估新路径。
- Large Language Models with At Most One Spike per Neuron 🆕NEW
- 赛道归属: 推理优化 / 脉冲神经网络(SNN)高效推理
- 核心创新点: 针对时间首次脉冲(TTFS)编码的脉冲神经网络难以适配LLM中层归一化、矩阵乘法等关键模块的结构性瓶颈,提出了一种突破传统TTFS架构限制的新型编码与网络设计方案,实现了每神经元至多一次脉冲的极低发放率,将SNN固有的稀疏事件驱动计算优势延伸至大语言模型场景,为构建超低能耗LLM推理系统提供了新的技术路径。
GitHub
- [2026-09-07] sgl-project/sglang ⭐35552
- [2026-09-07] NVIDIA-NeMo/Speech ⭐18399 🆕NEW
- [2026-09-07] NVIDIA/TensorRT-LLM ⭐14560
- [2026-09-07] AnotiaWang/deep-research-web-ui ⭐2206 🆕NEW
- [2026-09-07] xxynet/KiraAI ⭐73 🆕NEW
HuggingFace Models
多模态大模型
arXiv
- VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models
- 赛道归属: 多模态理解 / 长视频理解
- 核心创新点: 提出递归套索自改进(Recursive Harness Self-Improvement, RSI)框架,在冻结视觉语言模型参数的前提下,专注于优化视频上下文构建过程本身。核心突破在于将上下文构建程序(context-construction harness)作为独立优化目标,通过递归自改进机制迭代提升可执行上下文的质量,从而在不修改底层模型权重的情况下显著提升长视频理解性能。这一方法将上下文构建与模型能力解耦,揭示了仅通过改进推理时的信息组织策略所能带来的性能上限。
- Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models
- 赛道归属: 多模态安全 / 多模态大模型安全对齐
- 核心创新点: 提出"跨模态安全漂移"概念,系统性研究视觉模态如何使原本良性的文本查询携带有害意图而绕过安全机制。核心方法是设计"安全意识迁移"机制,将文本模态中已有的安全感知能力迁移至视觉-语言联合理解场景,从而弥补多模态模型在跨模态语境下安全响应率显著低于纯文本场景的缺陷。
- Detecting Object Hallucinations in Large Vision-Language Models via Cross-Modal Attention Drifts and Mask-Based Verification
- 赛道归属: 多模态理解 / 视觉语言模型幻觉检测
- 核心创新点: 提出CADMP框架,创新性地利用相邻层间跨模态注意力漂移(而非单一层注意力)来刻画视觉定位的动态演化过程,结合目标区域遮蔽的预测敏感性验证,实现轻量级的对象幻觉检测。相比现有方法仅分析单层注意力的局限,CADMP通过跨层注意力变化趋势与掩码扰动响应的双重信号提升幻觉判断的准确性。
- SpanCalib-VLM: Calibrated Hallucination Span Detection in Vision-Language Models
- 赛道归属: 多模态理解 / 幻觉检测与校准
- 核心创新点: 提出 SpanCalib-VLM 混合双系统框架,专门用于视觉语言模型(VLM)中幻觉文本片段的检测与置信度校准。核心创新在于将生成式 VLM(擅长幻觉片段定位但存在过度自信和高推理延迟问题)与判别式序列标注器(具备确定性速度和更优校准性但召回率偏低)进行互补融合,通过双系统协同弥补各自短板,同时实现精准的 span 级幻觉定位与良好校准的置信度输出,在 SHROOM-Visions 共享任务上验证了该方案的有效性。
- StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models
- 赛道归属: 多模态理解 / 流式视频理解
- 核心创新点: 提出StreamEMS机制,在传统流式视频记忆框架"读/写"操作之外,引入"自进化记忆"模块,通过对记忆本身的表征能力进行持续优化(而非仅优化数据注入和检索流程),使历史记忆能够随时间自适应地提炼和增强,从而提升视觉语言模型在长时流式视频理解中的信息利用效率。
- GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
- 赛道归属: 多模态理解 / 交通视频分析
- 核心创新点: 提出GHR-VLM框架,将视觉定位(Grounding)与混合推理(Hybrid Reasoning)结合,实现对公交车载长视频的零样本分析。核心突破在于融合监督视频模型的时序感知能力与VLM的语义推理能力,通过视觉锚定机制将VLM的推理范围约束在关键片段上,规避直接对长视频进行端到端推理带来的高成本和低可靠性问题。
- Think-Verify-Revise: Neuro-Symbolic Visual Reasoning with Vision-Language Models and Dynamic Logic Tensor Networks 🆕NEW
- 赛道归属: 多模态理解 / 神经符号视觉推理
- 核心创新点: 提出了一种神经符号(NeSy)闭环框架,将视觉语言模型(VLM)与动态逻辑张量网络(D-LTN)紧密耦合。核心突破在于:VLM负责自动归纳一阶逻辑(FOL)规则,D-LTN负责对这些规则进行可微分验证,两者通过"思考-验证-修正"的迭代反馈机制协同工作,实现了纯神经方法与纯符号方法均无法单独完成的形式化关系约束推理,弥合了感知与逻辑推理之间的鸿沟。
- MM-IFEval-Pro: A Multilingual and Attack-Resistant Benchmark for Instruction-Following in Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 评测基准
- 核心创新点: 构建了一个多语言、抗攻击的视觉语言模型指令遵循评测基准MM-IFEval-Pro。核心创新在于同时解决了现有基准的两大缺陷:一是扩展了语言覆盖范围以支持真实多语言场景评测;二是引入了对抗性安全场景设计,使基准具备抗攻击鲁棒性,从而能够更全面地评估VLM在真实世界多语言及安全敏感场景下的指令执行可靠性。
- Where to Look Matters: Learning Influential Views for VLM-based 3D Visual Grounding 🆕NEW
- 赛道归属: 多模态理解 / 3D视觉定位
- 核心创新点: 提出IVSGround框架,核心突破在于以可学习的方式替代了传统启发式规则进行相机视角选择。通过训练一个轻量级视角选择器,从"与定位任务相关性"而非单纯"目标可见性"的角度动态选取最具影响力的视角提供给VLM,从而在零样本3D视觉定位任务中显著提升了VLM对三维场景中目标物体的定位准确性。
- FailSAE: Towards Interpretable Failure Prediction for Vision-Language Models via Sparse Autoencoders 🆕NEW
- 赛道归属: 多模态理解 / 模型可解释性与失败预测
- 核心创新点: 提出FailSAE方法,将稀疏自编码器(Sparse Autoencoder)引入VLM失败预测任务,核心突破在于可解释性层面:不同于依赖置信度分数或辅助分类器的黑盒方法,FailSAE通过稀疏自编码器对VLM(如CLIP)共享嵌入空间中的表征进行分解,揭示导致模型失败的可解释特征维度,在实现失败预测的同时提供了人类可理解的失败归因,为高风险场景下的风险感知部署提供了理论支撑。
GitHub
- [2026-09-07] Blaizzy/mlx-vlm ⭐5477
- [2026-09-07] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1846
- [2026-09-02] emcf/thepipe ⭐1524
- [2026-09-04] YuyangSunshine/Awesome-Continual-learning-of-Vision-Language-Models ⭐216
- [2026-09-03] NVIDIA-Omniverse/usd-content-agents ⭐195 🆕NEW
强化学习
arXiv
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning
- 赛道归属: 强化学习 / LLM智能体训练
- 核心创新点: 提出ARISE-RL全周期自进化框架,核心突破在于将评分标准(Rubric)的生成与策略优化解耦并迭代耦合:首先由模型自动生成可验证的评分标准以解决开放任务缺乏金标答案的问题,再通过基于标准的奖励信号驱动GRPO策略更新;针对长时域任务中奖励稀疏导致的rollout对比度弱问题,引入组内对比增强机制,从而在能力边界附近提供更细粒度的优化信号,实现模型自我进化的闭环。
- RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training 🆕NEW
- 赛道归属: 具身智能 / VLA模型强化学习训练框架
- 核心创新点: 针对VLA模型训练中同步RL框架与实际需求不匹配的问题,提出了一种灵活异步的RL训练框架RL-VLA³。核心突破在于打破传统LLM训练中"数据采集-策略优化"严格交替的同步范式,将完整rollout拆解为可独立处理的单元,支持数据采集与策略优化的异步并行执行,从而更好地适配VLA训练中动作执行延迟长、环境交互频率低等独特特性,显著提升训练效率与灵活性。
- Iterative GRPO: Batch-Online Policy Iteration for Multi-Turn RL via Single-Turn RLHF
- 赛道归属: 强化学习 / 多轮对话LLM训练
- 核心创新点: 提出Iterative GRPO方法,将多轮对话RL训练转化为单轮RLHF问题的批量在线策略迭代。核心突破在于:通过将多轮交互轨迹"展平"为单轮形式,使得无需实时外部环境(真实用户)参与训练循环,利用离线或模拟的对话历史构造批次,以单轮RLHF的GRPO算法迭代更新策略,从而绕开多轮RL中环境响应依赖的工程瓶颈,同时保持策略的近似在线性。
- Unifying ICL, SFT, KL-Regularized RL Through a Bayesian Lens 🆕NEW
- 赛道归属: 大语言模型 / 训练范式统一理论
- 核心创新点: 从贝叶斯推断视角出发,将ICL、SFT、KL正则化RL(RLHF/RLVR)、在线策略蒸馏(OPD)及测试时推理搜索等看似独立的训练与推理范式统一在同一理论框架下。核心突破在于揭示上述方法本质上均是对同一后验分布的不同近似或推断方式,从而解释了"少样本提示对RL调优推理模型效果参差不齐"等经验现象背后的理论根源,为跨范式方法的比较与组合提供了统一的分析工具。
- Reinforcement Learning for Sequential Solar PV Policy Design under Uncertainty: An Agent-Based Approach 🆕NEW
- 赛道归属: 强化学习应用 / 能源政策优化(太阳能光伏)
- 核心创新点: 将太阳能光伏补贴政策设计建模为序列决策问题,创新性地将RL与随机Agent-Based Model(ABM)深度耦合。核心突破在于:RL策略制定者智能体在ABM模拟的异质性居民决策环境中动态选择年度激励组合(资本补贴、补贴等),ABM负责模拟不确定性下的逐年光伏采纳行为,两者形成闭环,使RL能够在兼顾财政可持续性的前提下优化政策序列,解决了传统静态政策设计无法应对不确定性与异质性的根本缺陷。
- CoSkill: Joint Reinforcement Learning of Reasoning and Meta-Skill Agents for Hierarchical Skill Evolution 🆕NEW
- 赛道归属: LLM智能体 / 层次化技能强化学习
- 核心创新点: 提出CoSkill框架,解决现有技能库范式中技能演化与策略优化解耦、元技能固化为静态工作流的结构性缺陷。核心突破在于引入推理智能体与元技能智能体的联合强化学习机制:两类智能体在同一RL过程中协同优化,技能不再是被动管理的静态对象,而是随推理策略动态共演化,实现了技能库的层次化自适应进化,显著提升LLM智能体在复杂任务中的样本效率与泛化能力。
- Reinforcement Learning for improving Large Language Models' Catalan text simplification capabilities 🆕NEW
- 赛道归属: 自然语言处理 / 低资源语言文本简化
- 核心创新点: 针对加泰罗尼亚语等低资源语言的自动文本简化(ATS)任务,提出将RL(具体采用GRPO算法)引入LLM后训练流程,并设计了一种面向目标简化风格的新型奖励函数。核心突破在于:该奖励函数能够精细引导模型向特定简化风格靠拢,而非依赖传统的参考文本相似度指标,从而在低资源场景下有效弥补监督数据不足的瓶颈,为小语种ATS提供了可迁移的RL优化范式。
- What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents 🆕NEW
- 赛道归属: 代码智能体 / 多执行框架强化学习
- 核心创新点: 聚焦多执行框架(Multi-Harness)RL训练中的信用分配与策略可迁移性问题,在仓库级代码任务上系统隔离"多框架混合"与"框架内相对优势比较"两种设计选择的独立效果。核心突破在于通过冻结任务-框架记录的受控重放实验,精确量化了跨框架相对优势分组对策略泛化能力的贡献,揭示了多框架RL中信用分配机制对编码智能体跨框架迁移性能的决定性影响,为多框架RL配方的设计提供了实证基础。
- VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models 🆕NEW
- 赛道归属: 具身智能 / VLA模型真实世界在线强化学习
- 核心创新点: 针对大型VLA模型在真实世界在线RL后训练中面临的价值信号不可靠导致策略漂移、模型体量大导致吞吐量受限两大瓶颈,提出VLA-Precision框架。核心突破在于非对称协同自举(Asymmetric Co-Bootstrapping)机制:通过轻量级与大型VLA模型的非对称协作,轻量模型辅助生成更稳定的价值估计以抑制策略漂移,同时优化推理吞吐,实现了在真实物理环境中高效、稳定地通过试错自主提升精细操作任务的成功率。
- Two-Stage Reinforcement Learning for Sound and Adversarial Test Generation in Code LLMs
- 赛道归属: 代码生成 / 测试用例生成 / 强化学习
- 核心创新点: 提出两阶段强化学习框架,专门用于代码LLM中高质量测试用例的自动生成。核心突破在于将测试用例生成建模为对抗性RL问题:第一阶段通过RL训练模型生成"健全"(sound)的测试用例(即能正确区分正确与错误代码的用例);第二阶段引入对抗性机制,驱动模型生成能区分功能相近但存在细微差异的代码实现的判别性测试用例。两阶段协同优化,同时满足测试用例的正确性与判别力两个竞争性目标。
GitHub
- [2026-09-07] huggingface/trl ⭐19236
- [2026-09-07] radixark/miles ⭐2647
- [2026-09-06] learnsyslab/gym-pybullet-drones ⭐2121 🆕NEW
- [2026-09-07] nvidia-cosmos/cosmos-rl ⭐468
- [2026-09-07] raamonp/rl-gym-orchestrator ⭐55
HuggingFace Datasets
- [2026-09-03] junchaoh-cs/SolarWM-Data 🆕NEW
- [2026-09-04] zouhar/last-translation-benchmark 🆕NEW
- [2026-09-02] hamzabagirsakci/turkish-court-decisions
世界动作模型
arXiv
- Spatially Aware World Action Model via Geometric Latent Diffusion
- 赛道归属: 世界动作模型 / 机器人策略学习 / 3D空间感知视频生成
- 核心创新点: 提出空间感知世界动作模型(SA-WAM),核心突破在于将几何信息(深度图等3D结构)以几何潜在扩散的方式融入原本仅依赖RGB观测的视频扩散框架中。通过复用预训练视频扩散模型并引入几何潜在空间,使模型在预测未来视觉观测的同时能够感知和利用三维空间结构,从而为机器人策略学习提供更丰富的物理先验,弥补了现有WAM缺乏3D空间理解的关键缺陷。
- World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action Models
- 赛道归属: 世界动作模型 / 机器人策略学习 / 测试时规划与推理优化
- 核心创新点: 提出世界一致性解码(World-Coherent Decoding, WCD)框架,核心突破在于将WAM的多次前向采样结果视为"可证伪的未来-动作假设",并利用模型自身的内部生成信号(无需外部奖励或额外监督)对候选轨迹进行自我验证与排序。该方法在推理阶段(测试时)通过多候选采样+内生一致性评分机制,有效过滤低质量的随机生成结果,解决了WAM输出对采样结果高度敏感的问题,实现了无需重新训练模型的测试时规划增强。
- Making Latent Evolution Explicit: Operator-Structured Transitions for World Action Models
- 赛道归属: 世界动作模型 / 机器人策略学习 / 潜空间动态建模
- 核心创新点: 针对现有基于Transformer的潜空间状态转移预测器存在的结构性缺陷(其归纳偏置聚焦于token间交互而非时序演化),提出了一种算子结构化的潜空间转移机制(Operator-Structured Transitions)。核心突破在于将潜空间中的状态转移过程显式化——通过引入具有明确时序演化归纳偏置的算子结构,替代通用Transformer预测器,使潜在状态的演化路径在结构层面得到显式约束与表达,从而提升世界动作模型在任务相关场景状态预测上的精度与可控性。
- ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training
- 赛道归属: 具身智能 / 世界动作模型 / 机器人操控预训练
- 核心创新点: ZimaBlue 的核心创新在于提出了一种可扩展的无动作标注视频预训练范式,用于构建可泛化的世界动作模型。其方法论突破体现在以下几点:①将大规模第一人称(Egocentric)视频作为替代机器人轨迹数据的预训练来源,绕开了动作标注数据稀缺且多样性不足的瓶颈;②设计了将"无动作"视频经验有效转化为可用于机器人操控的动作先验的训练机制,使模型能从丰富的物体交互、接触动力学和工具使用视频中学习物理世界的通用规律;③通过规模化预训练提升模型的跨场景泛化能力,使其在下游机器人任务上无需大量动作标注数据即可实现有效迁移。该工作的本质是将视频生成/理解领域的扩展规律引入具身智能,以互联网级视频数据驱动世界动作模型的通用化。
- GameWAM: A World Action Model for Video Games
- 赛道归属: 世界动作模型 / 游戏智能体 / 视频游戏动态建模
- 核心创新点: 首次将世界动作模型(WAM)框架系统性地拓展至视频游戏领域,提出GameWAM。其核心创新在于统一了两类此前相互割裂的研究范式——"视觉-动作直接映射的游戏智能体"与"基于动作输入预测视觉未来的交互式游戏世界模型"——在单一模型中同时实现任务策略执行与世界动态建模。针对视频游戏特有的挑战(第一人称感知、快速视觉变化、持久世界状态、异构原生控制接口),设计了适配该场景的WAM架构,填补了WAM在开放式、高动态交互环境下应用的空白。
- SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
- 赛道归属: 自动驾驶 / 世界动作模型(World Action Model)/ 端到端驾驶推理优化
- 核心创新点: SimWAM 的核心突破在于将未来视频预测从推理时计算负担转化为训练时监督信号,彻底消除了现有WAM在测试阶段进行未来想象所带来的高昂计算开销。具体方法上,SimWAM 联合训练一个预训练视频专家模型与一个轻量级动作专家模型,采用联合流匹配(joint flow matching)框架统一两者的训练目标;同时设计了隔离注意力掩码(isolated attention mask)机制,使动作预测分支在前向推理时完全独立于未来帧信息,从而在保留视频动态先验迁移收益的同时,实现推理阶段的高效轻量化部署。
GitHub
- [2026-09-06] OpenMOSS/Awesome-WAM ⭐1383
- [2026-09-06] DravenALG/awesome-vla-wam ⭐1008
- [2026-09-06] OpenMOSS/EasyWAM ⭐145
由 Research Daily 自动生成 生成时间: 2026-09-07 05:31:34