AI 每日进展速报 - 2026-09-01
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- The Plan, Not the Decoder: Diagnosing and Repairing Compositional Failure in Reasoning-Augmented Text-to-Image Generation
- 赛道归属: 文生图 / 组合式生成 / 推理增强生成诊断与修复
- 核心创新点: 该工作针对推理增强型文生图模型(如 GoT-R1)的组合生成失败问题,提出了一种故障定位与修复框架,核心创新在于将生成失败的根因分离为两个独立环节:规划阶段(文本计划/布局生成) 与 解码阶段(图像渲染忠实度)。由于模型在生成图像前会输出包含对象名称、属性和边界框的结构化文本计划,该计划具有机器可读性,可在解码前被独立检查和编辑。研究者通过交换边界框等干预实验验证了计划与解码的可分离性,从而精确诊断出组合失败究竟源于"规划错误"还是"解码不忠实",并在此基础上提出针对性的修复策略。这一方法论突破为推理增强型生成模型的可解释性分析和定向优化提供了新范式。
- RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing
- 赛道归属: 图像生成/编辑 · 奖励模型与对齐
- 核心创新点: 提出 RubricRM,一种基于动态评分标准(Rubric)的生成式奖励建模框架。与现有视觉奖励模型依赖单一标量分数或固定评估维度不同,RubricRM 能够根据不同的输入指令动态生成评估维度(Rubric),再基于这些维度进行成对比较打分。这一设计使奖励模型同时具备可解释性和任务自适应性,能够针对文生图和指令驱动图像编辑等不同任务的差异化需求灵活调整评估标准,突破了固定准则在多样化任务场景下泛化能力不足的瓶颈。
- Exploring the Performance Frontier of Compact Unified Image Generation Models
- 赛道归属: 文生图 / 图像编辑(统一生成与编辑)
- 核心创新点: Swift-Image 提出了一个紧凑型统一图像生成与编辑模型,核心突破在于:在有限计算预算下,通过系统性训练工程探索小参数量模型的性能上限。采用高效的 6B 参数单流 DiT 架构,并设计了渐进式训练流水线——从宽泛语义覆盖逐步演进至更高分辨率、更强视觉质量,同时统一支持文生图、单图编辑和多图编辑三类任务,在参数效率与任务统一性之间取得显著平衡。
- ContextBias: Controlled Evaluation of Bias Persistence Under Context Shift in Text-to-Image Models 🆕NEW
- 赛道归属: 文生图 / 偏见评估与公平性分析
- 核心创新点: 提出 ContextBias 评估框架及配套基准 ContextBench,专门用于量化文生图模型在上下文迁移(Context Shift)条件下的偏见持久性问题。核心方法论突破在于:通过受控实验设计,系统性地将职业角色的视觉表征置于不同提示上下文中,精确测量模型内部学习到的职业-视觉属性关联(如性别、肤色等刻板印象)是否随上下文变化而消解或持续存在,从而区分"表面可调节的偏见"与"深层稳定的偏见",为偏见溯源与模型去偏提供更细粒度的诊断工具。
- NumBench: Diagnosing Counting Failures in Text-to-Image Models
- 赛道归属: 文生图 / 评测基准
- 核心创新点: 提出 NumBench,一个专门用于诊断文生图模型数量生成失败的大规模基准。核心创新在于:(1)构建了包含 64 万条提示词、覆盖 1600 个类别、数量范围 1~100 的超大规模评测集,规模远超现有基准;(2)采用析因设计(factorial design),系统性地控制对象组合、空间引导和外观条件等变量,同时对数量和类别曝光进行均衡处理,避免混淆因素干扰;(3)提出一个过程模型,将数量生成失败建模为"有限可解析槽位的竞争机制",从机制层面解释模型为何产生数量错误,而非仅停留在现象描述层面,为后续改进提供理论依据。
- Zero-Shot Video Restoration and Enhancement with Text-to-Image Latent Diffusion Models and Multi-Modal References
- 赛道归属: 视频修复与增强 · 零样本推理优化
- 核心创新点: 提出一种利用文生图(T2I)潜扩散模型实现零样本视频修复与增强的框架,核心创新在于双提示调优反演与采样(Dual Prompt Tuning Inversion and Sampling)机制。该机制在无需针对视频任务重新训练的前提下,通过多模态参考信息引导推理过程,有效解决了将图像修复扩散模型直接迁移至视频时产生严重时序闪烁(temporal flickering)的核心难题,在保持帧间时序一致性的同时显著降低推理时间,实现了T2I扩散模型向视频域的零样本泛化。
- Efficient Training with Foresight: Multi-Token Auxiliary Supervision for Autoregressive Image Generation
- 赛道归属: 自回归图像生成 / 推理优化与训练效率
- 核心创新点: 提出多令牌自回归(MTAR)统一训练框架,核心突破在于引入"多令牌辅助监督"机制——在训练阶段让模型同时预测未来多个token(前瞻性监督),而非传统的单步next-token prediction。这一设计从三个维度解决了传统AR训练的痛点:①通过多步前瞻缓解监督稀疏与短视问题;②通过辅助预测目标增强表征判别性;③通过稀疏化计算策略降低全序列密集计算带来的训练开销,在不改变推理架构的前提下显著提升训练效率与生成质量。
- Scalable Question-Centric Text-to-Image Evaluation: Reliable Ranking, Fine-Grained Diagnosis, and Cost-Aware Routing
- 赛道归属: 文生图评估与基准测试
- 核心创新点: 提出以"问题为中心"(Question-Centric)的文生图评估框架 QC-T2I-Bench,核心突破在于三个层面:①将开放式提示词分解为细粒度可归因的问题单元,实现更精准的失败诊断,而非简单回归到提示词级别的总分;②区分基础需求与组合需求的评分,揭示模型在简单属性绑定与复杂组合推理上的差异化表现;③引入成本感知路由机制,在评估精度与计算开销之间实现动态权衡,支持可扩展的大规模评估场景。整体框架将模型排名可靠性、细粒度诊断能力与评估效率统一在同一体系下,解决了现有基准评估归因模糊、复杂度忽视和成本不可控的三大痛点。
- OccluRank: Controllable Occlusion-Aware Layout-to-Image Generation by Adding Just an Ordinal Rank
- 赛道归属: 文生图 / 布局可控图像生成(Layout-to-Image Generation)
- 核心创新点: 针对边界框布局生成中无法表达实例遮挡顺序的问题,提出 OccluRank 框架,其核心创新在于仅引入一个轻量级的序数排名(Ordinal Rank)信号作为遮挡条件,即可在不依赖额外几何条件(如深度图、分割掩码)或复杂推理流程的前提下,实现对实例间遮挡关系的显式建模与可控生成。相比现有方法独立构建各实例表示后简单聚合的范式,OccluRank 通过排名信息驱动实例间遮挡依赖交互,以极低的条件复杂度实现了遮挡感知的布局到图像生成。
- From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation
- 赛道归属: 文生图 / 通用图像生成 / 数据工程与能力协同
- 核心创新点: 提出以"能力为中心"的数据基础设施设计范式,核心创新在于打破传统各任务数据集孤立优化的惯例,转而对生成能力之间的依赖关系进行显式建模,并据此构建能力协同演化的数据组织体系。具体而言,该框架将异构监督信号按能力依赖图进行结构化耦合,使不同生成能力(如构图、细节、语义对齐等)在数据层面相互增强而非相互干扰,从数据工程角度为通用图像生成模型提供了系统性的能力协同提升路径。
GitHub
- [2026-09-01] pydantic/pydantic-ai ⭐19627
- [2026-09-01] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13326 🆕NEW
- [2026-09-01] Osmantic/ODS ⭐5620
- [2026-09-01] alfredxw/denova ⭐678 🆕NEW
- [2026-09-01] franksong2702/dsh-codex-connect ⭐70
HuggingFace Datasets
- [2026-08-25] inclusionAI/ConceptEdit-12M
视频生成/编辑
arXiv
- Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair
- 赛道归属: 视频生成(身份保持文生视频)
- 核心创新点: 针对闭源商业视频生成模型无法通过参数优化改进的局限性,提出了一种基于智能体增强(Agentic Enhancement)与语义修复(Semantic Repair)的免训练框架。核心方法论突破在于:将视频生成过程拆解为多智能体协作流水线,通过语义层面的自动检测与修复机制,在不访问模型权重的前提下,解决身份漂移(identity drift)、指令跟随不完整以及复杂提示下视觉细节缺失等问题,实现对黑盒生成模型的外部增强与质量提升。
- CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation
- 赛道归属: 文生视频 / 评测基准
- 核心创新点: 提出首个专门评估文生视频模型文化理解能力的综合基准 CultureVidBench,突破现有基准仅关注感知质量、物理合理性和文本对齐的局限,系统性地引入文化特定对象、动作、仪式、可见文字及音频线索等多维度文化评估指标,填补了T2V模型跨文化表征能力评测的空白。
- EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing
- 赛道归属: 视频生成与编辑(统一框架)
- 核心创新点: EditStream 提出了一个基于 DiT(Diffusion Transformer)的统一自回归框架,将文生视频(T2V)、图生视频(I2V)、视频转视频(V2V)等多种视频创作与编辑任务整合进单一模型。其核心方法突破在于:①通过灵活的任务特定条件机制(task-specific conditioning)实现多任务统一建模,无需为每类任务维护独立模型;②将扩散模型转化为少步自回归流式推理模型(few-step autoregressive streaming),大幅提升生成效率,支持交互式实时视频流式输出,兼顾生成质量与推理速度。
- DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution 🆕NEW
- 赛道归属: 视频生成(原生音视频联合生成)
- 核心创新点: 提出了一种原生音视频联合生成框架 DreamX-Creator 1.0,核心突破在于摒弃了传统"先生成视频、再后处理音频"的两阶段流水线范式,转而在单一 7B 参数生成器内同步对音频流与视频流进行联合去噪。网络架构上采用"前半段独立处理、后半段门控耦合"的设计策略:两路模态专属流在网络前半部分各自独立建模,在后半部分通过门控注意力机制实现跨模态交互,从而在保留各模态独立表征能力的同时,捕捉视觉动态与声学事件之间的因果关联。此外,系统支持以首帧图像与文本提示为条件的 2K 分辨率生成,在紧凑模型规模下实现了高分辨率原生音视频的端到端合成。
- LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation
- 赛道归属: 视频生成(长视频生成 / 自回归扩散模型记忆机制)
- 核心创新点: 针对自回归视频扩散模型在长视频生成中的长程一致性问题,提出了一种状态感知的记忆路由机制 LayerRecall。其核心突破在于:通过分析视频 DiT 各层对"当前帧、近期帧、远期帧"上下文的差异化偏好,设计了一个以层状态为条件的动态路由器,使不同层能够自适应地从历史记忆中检索与自身语义需求最匹配的上下文信息。相较于传统的基于时间近邻的缓存策略(仅保留最近片段),该方法在历史信息被驱逐后仍能有效召回远期关键线索(如重复出现的人物、场景、属性),从而在不扩大滑动窗口的前提下显著提升跨片段的长程语义一致性。
- TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models
- 赛道归属: 视频生成 / 安全攻防
- 核心创新点: 针对图生视频(I2V)模型提出"时序越狱攻击"(TempJail)新范式,揭示了视频生成模型在时间维度上独有的安全漏洞——有害内容可以不出现在单帧中,而是通过跨帧时序演化隐蔽地涌现。研究构建了三种攻击场景,突破了现有安全研究仅聚焦单帧违规的局限,将攻击面从空间域扩展至时间域。
- RECAP-Forcing: Retaining Content Appearances for Long Video Generation
- 赛道归属: 视频生成 / 长视频生成
- 核心创新点: 提出 RECAP-Forcing 方法,颠覆了长视频自回归生成中以"时间顺序"组织记忆的传统范式,改为以"外观新颖性"为核心组织记忆。通过识别并优先保留视频中出现的新主体、对象和场景的关键帧,而非简单保留最近帧,从而在有限注意力窗口内更有效地维持长视频中内容外观的一致性。
- Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation
- 赛道归属: 多模态音视频生成 / 安全评测基准
- 核心创新点: 提出 Multi2AV-Safety 基准,专门针对多模态条件(文本、图像、音频、视频联合输入)驱动的音视频生成场景的安全评估。核心创新在于识别并量化"跨模态交互涌现风险"——有害内容可能不存在于任何单一输入模态中,而是由多个看似无害的条件跨模态、跨时间协同作用后涌现,突破了现有以单一提示词为中心的安全评测框架。
- StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation
- 赛道归属: 流式音视频生成 / 评测基准
- 核心创新点: 提出首个专为流式音视频生成设计的综合评测基准 StreamAV-Bench,填补了现有基准仅能评估完整序列、无法捕捉流式生成特性的空白。创新性地构建统一评估框架,涵盖渐进式生成轨道(指令跟随的持续生成)和实时交互轨道,从延迟、一致性、实时响应等流式特有维度对模型进行系统评估。
- Surgical Video Generation From Diffusion to World Models: A Survey
- 赛道归属: 视频生成 / 医疗手术场景 / 综述
- 核心创新点: 系统梳理手术视频生成领域从扩散模型到世界模型的技术演进脉络,提出清晰的概念框架以整合该领域快速发展但缺乏统一认知的研究成果。核心价值在于将手术视频生成定位为解决临床数据稀缺、隐私限制和类别不平衡问题的变革性方法,并系统归纳其在手术仿真、培训和机器人策略学习中的应用路径,为领域研究提供结构化参考。
GitHub
- [2026-09-01] hao-ai-lab/FastVideo ⭐4249
- [2026-09-01] ZeroLu/awesome-seedance ⭐2359
- [2026-09-01] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1934 🆕NEW
- [2026-09-01] tetherto/qvac ⭐570
- [2026-09-01] guaardvark/guaardvark ⭐197
HuggingFace Models
HuggingFace Spaces
音频生成
arXiv
- EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis
- 赛道归属: 情感语音合成(Emotional Text-to-Speech)
- 核心创新点: 针对现有情感TTS系统仅支持单一静态情感标签/嵌入的局限性,提出EmoTra-TTS框架,核心突破在于实现句内(Intra-Utterance)连续情感动态过渡。该方法摒弃了传统"一句一情感"的离散建模范式,转而在单条语音合成过程中对情感状态进行时序连续建模,使情感能够在毫秒级时间尺度上自然地上升、衰减与转变,从而与心理学研究中情感作为连续动态过程的本质规律对齐,同时保持对情感轨迹的显式可控性——这一点也弥补了LLM-based TTS系统虽能隐式变化韵律但缺乏精确情感控制的不足。
- Vagdhenu: A Vrutta (Meter) Aware Shloka-to-Chant (TTS) System for Sanskrit
- 赛道归属: 文本转语音(TTS)/ 梵语吟诵合成
- 核心创新点: 针对梵语颂诗(Shloka)的吟诵合成任务,提出了一套专用前端处理流水线,核心突破在于:①通过卡纳达语正字法路由规避了梵文天城体(Devanagari)在印地语TTS模型中常见的"schwa删除"问题,从而保留梵语发音的完整性;②引入韵律(Vrutta/Meter)感知机制,使合成语音能够忠实还原传统吟诵(Parayana)的节律特征。整体方案以现成的流匹配(Flow-Matching)TTS骨干网络和大规模神经声码器为基础,重点贡献在于领域适配的前端工程设计,而非新架构提出。
- Poly-InstructTTS: Learning In-the-Wild Expressive Speech Synthesis from Open-Ended Instructions
- 赛道归属: 文本转语音(TTS)/ 可控表达语音合成
- 核心创新点: 提出了一套基于开放式自然语言指令控制语音表达的端到端框架。核心突破在于:①构建了一个可扩展的多模态数据流水线,从野外视听数据中自动标注生成覆盖1000+细粒度情感与风格的千小时指令语料库;②设计了无需提示词的GPT模型,结合基于属性的链式思维(attribute-based thinking)机制,将开放式自然语言指令解析为结构化的语音属性控制信号,从而实现对细粒度表达的精准可控合成,突破了传统TTS在指令跟随能力上的瓶颈。
- CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents
- 赛道归属: 文本转语音(TTS)/ 零样本语音合成
- 核心创新点: CuteTTS 提出了一种基于连续潜变量自回归建模的高效高质量语音合成框架。核心突破在于:设计了一种紧凑的低码率连续潜变量序列表示,在保留充分声学细节的同时降低自回归预测的序列长度;同时针对扩散采样和无分类器引导在每个自回归步骤中带来的高推理开销问题,提出了优化方案,在流式低延迟场景下实现了保真度与推理效率的平衡,适用于交互式助手、个性化媒体等实时应用场景。
- Joycent: Multi-Accent TTS via Disentangled Accent Modeling and Layer-Specific Conditioning 🆕NEW
- 赛道归属: 语音合成(TTS)/ 多口音语音生成
- 核心创新点: 提出 Joycent,一个基于扩散模型的多口音 TTS 框架,核心突破在于双层解耦策略:在表示学习阶段将口音特征与说话人身份特征显式分离,并在 TTS 条件注入阶段采用层级特定条件化(Layer-Specific Conditioning)机制,将两类解耦因子分别注入扩散模型的不同层,从而在保留说话人音色的同时实现精准的目标口音迁移,解决了传统方法中口音与说话人特征相互纠缠导致生成质量下降的问题。
- Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS
- 赛道归属: 文本转语音(TTS)/ 流式零样本语音合成
- 核心创新点: 提出了一种将预训练自回归TTS解码器迁移为块扩散(Block Diffusion)解码器的高效微调方案,实现块内并行token生成与块间流式输出的兼顾。核心技术突破在于:针对离散语音token长尾分布导致并行位置选择偏向高频token、从而引发质量退化的问题,提出了先验校准(Prior Calibration)机制,在不依赖额外架构改动的前提下修正采样偏差,显著提升了块扩散解码在零样本TTS场景下的生成质量,同时保持了低延迟流式推理能力。
- Sequential Trajectories and Simultaneous Blending: Multi-Emotion Modeling for Instruction-Following TTS 🆕NEW
- 赛道归属: 语音合成(TTS)/ 情感可控语音生成
- 核心创新点: 针对多情感 TTS 中的两类任务——情感轨迹(有序多阶段情感序列)和情感混合(多情感共存于同一话语)——提出了一套统一建模框架。核心创新在于识别并解决了监督微调(SFT)与多情感生成目标之间的监督不匹配问题:SFT 无法显式评估情感过渡的合理性,因此引入强化学习(RL)机制对情感轨迹的连贯性和混合情感的共存质量进行显式奖励优化,使模型能够遵循自然语言指令完成复杂的多情感控制。
- TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models 🆕NEW
- 赛道归属: 音频语言模型(Audio-Language Model)/ 时序感知音频理解
- 核心创新点: 提出 TEMPO,首个统一处理音频、语音和音乐时间戳定位任务的大型音频语言模型。核心创新在于构建了一套监督微调(SFT)策略,将时间戳预测能力以多任务方式注入现有 LALM,使模型从仅能进行片段级描述升级为能够对识别到的事件、说话人和声音赋予精确时间锚点,填补了现有 LALM 在时序定位能力上的关键空白,对语音识别、密集音频字幕等下游任务具有直接价值。
- PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation 🆕NEW
- 赛道归属: 空间音频生成(Spatial Audio Generation)/ 文本驱动音频合成
- 核心创新点: 提出 PhysWave,一个物理引导的潜在扩散模型用于文本到一阶 Ambisonics(FOA)空间音频生成。核心突破有两点:①将声学物理约束(声源方向与距离的声学关系)嵌入扩散生成过程,避免纯数据驱动方法产生违反物理规律的空间音频;②将描述性文本控制与参数化空间控制统一在同一框架内,用户无需在易用性与精确性之间取舍,实现了对空间属性的精细可控生成。
- Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction 🆕NEW
- 赛道归属: 语音合成(TTS)/ 质量自动修正与闭环生成
- 核心创新点: 提出 LoopTTS,一个基于 AudioLLM 的闭环 TTS 纠错框架,突破了传统 TTS 系统"单次开环生成"的范式。框架由三个模块构成:Filter(过滤)→ Judge(诊断)→ Refiner(精炼),其中 AudioLLM 作为 Judge 对初始生成语音进行局部韵律缺陷的细粒度诊断(如重音错位、不自然停顿、语调平坦),并生成结构化的缺陷描述,再驱动 Refiner 针对性地修正低质量输出。核心创新在于将 AudioLLM 的感知能力引入 TTS 质量控制回路,解决了话语级指标无法暴露局部韵律问题的评估盲区。
GitHub
- [2026-09-01] huggingface/diffusers ⭐34416 🆕NEW
- [2026-08-27] SamurAIGPT/Generative-Media-Skills ⭐4196
- [2026-08-31] OpenMOSS/MOVA ⭐1106
- [2026-08-31] BinWang28/audio-ai-hub ⭐950
- [2026-08-28] xiaomi-research/controlfoley ⭐149 🆕NEW
HuggingFace Models
语言大模型
arXiv
- Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning 🆕NEW
- 赛道归属: 推理优化 / 链式思维控制
- 核心创新点: 将推理过程的引导建模为马尔可夫决策过程(MDP),提出 ACTS 框架,通过一个控制器智能体在推理过程中自适应地选择推理策略(如快速跳过、深度展开等),使推理行为在推理时可显式控制,而非依赖隐式的长度压缩或早停机制,实现了效率与可控性的统一。
- Triggering Chain-of-Thought via Latent Feature Interventions in Large Language Models 🆕NEW
- 赛道归属: 推理机制可解释性 / 链式思维触发机制
- 核心创新点: 利用稀疏自编码器(SAE)捕获 LLM 内部表示中的稀疏特征,系统性地识别出与链式思维(CoT)推理行为因果相关的少量潜在特征,并通过定向激活干预验证其因果性,首次从内部表示层面揭示了触发 CoT 行为的神经机制,为推理行为的可解释性与可干预性提供了新路径。
- When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models 🆕NEW
- 赛道归属: 推理优化 / 测试时计算扩展(Test-Time Scaling)综述
- 核心创新点: 将测试时计算扩展(TTS)统一抽象为"推理即搜索"的框架,系统梳理了从 CoT 单轨迹解码到树搜索(如 MCTS、Beam Search)等多种推理范式,构建了覆盖搜索空间定义、状态评估、搜索策略的统一分类体系,为该领域提供了系统性的理论视角和研究路线图。
- Detecting Hidden Chain-of-Thought in Large Language Models with Linguistic, Behavioral, and Mechanistic Indicators 🆕NEW
- 赛道归属: 推理机制可解释性 / 隐式链式思维检测
- 核心创新点: 提出隐式 CoT 检测分数(HCDS),通过对比中性提示下模型行为与显式 CoT / 显式无 CoT 提示下行为的语言学、行为学及机制层面的对齐程度,构建了一套无需直接观测内部推理过程即可判断模型是否进行隐式推理的量化框架,填补了隐式推理检测方法论的空白。
- Improving LLM Interpretability with User-Centric Chain-of-Thought Reasoning
- 赛道归属: LLM可解释性 / 推理链优化
- 核心创新点: 提出以用户为中心的思维链(Chain-of-Thought)设计范式,核心突破在于将推理轨迹的优化目标从"提升模型性能"转向"提升人类可读性与可检验性"。通过基于自我一致性(self-consistency)的结构化推理轨迹设计,使中间推理步骤更符合人类认知习惯,从而在保持模型能力的同时增强人机协作中的可信度与透明度。
- S3C-LLM: Skill-Code Guided Agentic Language Models for Spectrum-to-Structure Elucidation 🆕NEW
- 赛道归属: 科学智能 / LLM 智能体应用(分子结构解析)
- 核心创新点: 提出 S3C-LLM,将光谱到结构的解析任务从端到端的"谱图→SMILES"直接生成范式,重构为模拟真实光谱学家分析工作流的技能引导、代码驱动的智能体框架,显式建模诊断峰解读、碎片推理、分子式约束和化学一致性校验等分析步骤,大幅提升了结构解析的可解释性与准确性。
- You Shouldn't Have Asked: A Pragmatics-Inspired Taxonomy for Evaluating LLM Refusals 🆕NEW
- 赛道归属: LLM 安全对齐 / 拒绝行为评估
- 核心创新点: 借鉴语用学中"面子威胁行为"理论,首次为 LLM 拒绝行为构建了系统性的语用学分类体系(Taxonomy),将拒绝评估从单一的安全合规维度扩展至交互适当性维度,提供了一套可跨场景评估 LLM 是否以恰当方式拒绝请求的多维评价框架。
- Error-Type-Aware Loss Reweighting for Robust Named Entity Recognition with Noisy LLM Labels 🆕NEW
- 赛道归属: 信息抽取 / 噪声标签学习(命名实体识别)
- 核心创新点: 针对 LLM 自动标注数据用于 NER 训练时引入的噪声问题,提出错误类型感知的损失重加权方法,系统分析了序列标注任务中 LLM 标注噪声的特有模式(与分类任务不同),并设计了与噪声类型相匹配的差异化损失权重策略,解决了现有噪声鲁棒损失函数不可直接迁移至序列标注任务的核心问题。
- Likelihood-Constrained Acoustic Reranking for Training-Free Hallucination Mitigation in LLM-Based ASR 🆕NEW
- 赛道归属: 语音识别 / LLM-ASR 幻觉抑制
- 核心创新点: 提出无需训练的解码方法 LCAR(似然约束声学重排序),通过在束搜索解码阶段引入声学似然约束对候选序列进行重排序,抑制 LLM 语言先验过度主导声学证据所导致的幻觉现象(如意外翻译、指令执行、重复或灾难性删除),在不修改模型参数的前提下显著提升了复杂条件下的 ASR 鲁棒性。
- E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation 🆕NEW
- 赛道归属: LLM 智能体评测 / 长时域自主任务基准
- 核心创新点: 提出首个开源的长时域电商业务运营基准 E-Commerce Bench,将评测周期扩展至模拟 365 天的连续运营场景,同时集成多轮对手谈判与动态突发事件,要求智能体在数千步交互中持续探索、从经验中学习并动态调整策略,突破了现有基准仅评测短时链式任务的局限,系统性考察了 LLM 智能体的长程依赖处理与自适应决策能力。
GitHub
- [2026-09-01] sgl-project/sglang ⭐33009 🆕NEW
- [2026-09-01] NVIDIA/TensorRT-LLM ⭐14516
- [2026-09-01] openJiuwen-ai/jiuwenswarm ⭐6321
- [2026-09-01] flagos-ai/FlagGems ⭐1086
- [2026-09-01] basellm/llm-metadata ⭐140 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-08-20] openbmb/Ultra-FineWeb-L1
多模态大模型
arXiv
- SpanCalib-VLM: Calibrated Hallucination Span Detection in Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 幻觉检测与校准
- 核心创新点: 提出 SpanCalib-VLM 混合双系统框架,专门用于视觉语言模型(VLM)中幻觉文本片段的检测与置信度校准。核心创新在于将生成式 VLM(擅长幻觉片段定位但存在过度自信和高推理延迟问题)与判别式序列标注器(具备确定性速度和更优校准性但召回率偏低)进行互补融合,通过双系统协同弥补各自短板,同时实现精准的 span 级幻觉定位与良好校准的置信度输出,在 SHROOM-Visions 共享任务上验证了该方案的有效性。
- StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models
- 赛道归属: 多模态理解 / 流式视频理解
- 核心创新点: 提出StreamEMS机制,在传统流式视频记忆框架"读/写"操作之外,引入"自进化记忆"模块,通过对记忆本身的表征能力进行持续优化(而非仅优化数据注入和检索流程),使历史记忆能够随时间自适应地提炼和增强,从而提升视觉语言模型在长时流式视频理解中的信息利用效率。
- VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models
- 赛道归属: 多模态理解 / 长视频理解
- 核心创新点: 提出递归套索自改进(Recursive Harness Self-Improvement, RSI)框架,在冻结视觉语言模型参数的前提下,专注于优化视频上下文构建过程本身。核心突破在于将上下文构建程序(context-construction harness)作为独立优化目标,通过递归自改进机制迭代提升可执行上下文的质量,从而在不修改底层模型权重的情况下显著提升长视频理解性能。这一方法将上下文构建与模型能力解耦,揭示了仅通过改进推理时的信息组织策略所能带来的性能上限。
- GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
- 赛道归属: 多模态理解 / 交通视频分析
- 核心创新点: 提出GHR-VLM框架,将视觉定位(Grounding)与混合推理(Hybrid Reasoning)结合,实现对公交车载长视频的零样本分析。核心突破在于融合监督视频模型的时序感知能力与VLM的语义推理能力,通过视觉锚定机制将VLM的推理范围约束在关键片段上,规避直接对长视频进行端到端推理带来的高成本和低可靠性问题。
- AIM: Anchor Identity Features, Then Match for Multimodal Large Language Model Unlearning
- 赛道归属: 多模态理解 / 模型遗忘与隐私保护
- 核心创新点: 针对多模态大语言模型(MLLM)中身份信息遗忘问题,提出AIM方法,在无需保留图像(retain images)的现实约束下实现精准身份遗忘。核心创新在于发现身份相关特征与视觉感知特征在表征空间中占据不同区域,并以此为依据设计"锚定身份特征后匹配删除"策略,在不损害模型通用视觉感知能力的前提下,精确擦除目标身份信息。
- Dynamic Alignment Compensation for Hallucination Mitigation in Large Vision-Language Models
- 赛道归属: 多模态理解 / 幻觉抑制
- 核心创新点: 提出动态对齐补偿(DAC)机制,从模型内部表征动态角度切入幻觉问题。核心发现是:在自回归生成过程中,跨模态表征会随解码层加深和生成步骤推进而发生"漂移"和"退化",导致视觉信息逐渐失效。DAC在推理阶段动态检测并补偿这种跨模态表征偏差,无需外部监督或额外训练,从内部表征层面抑制幻觉生成。
- Training-Free Temporal Abstraction for General Video Understanding
- 赛道归属: 多模态理解 / 视频时序理解(训练无关方法)
- 核心创新点: 提出一种无需训练的通用视频时序抽象框架,利用预训练视频-文本模型内在的时序结构,统一支持动作变化检测、自然语言时序定位、关键帧选取等多个下游任务。核心突破在于证明预训练模型已隐式编码足够的时序语义信息,通过设计通用的时序抽象接口即可跨任务复用,无需针对每个任务单独收集标注数据或设计专用架构。
- Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding
- 赛道归属: 多模态理解 / 长视频理解与推理
- 核心创新点: 提出"时序思维树"(Temporal Tree of Thought)框架,模拟人类回答长视频问题时"先定位全局片段、再聚焦局部细节"的分层推理过程。核心创新在于将推理过程结构化为树状搜索:以推理链引导视觉线索的分层检索,克服均匀采样遗漏关键帧和帧独立评估忽略时序组织的双重缺陷,从而在有限上下文长度约束下实现对长视频的高效精准理解。
- CODE: Cross-Modal Calibration and Dynamic Suppression for Open World Object Detection
- 赛道归属: 多模态理解 / 开放世界目标检测
- 核心创新点: 针对开放世界目标检测(OWOD)中多模态基础模型存在的两大核心问题——单向文本到视觉匹配导致的语义歧义,以及刚性异常值惩罚对未知类目标的过度抑制——提出 CODE 框架。该框架在推理阶段引入三个互补模块:①跨模态联合置信度校准,通过注入全局视觉原型来修正文本驱动的置信度偏差,实现视觉与语言特征的双向对齐;②动态抑制机制,自适应调整已知类决策边界附近未知目标的抑制强度,避免对潜在未知类的误压制;③两者协同构成统一的推理时框架,无需重新训练即可部署于现有多模态检测模型之上。其方法论突破在于将跨模态校准与动态边界抑制解耦并联合优化,在不修改模型权重的前提下同时提升已知类检测精度与未知类召回能力。
- Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces
- 赛道归属: 多模态理解 / 生成设计界面评估
- 核心创新点: 针对生成设计界面中语义控制的一致性问题,提出对6个主流VLM进行系统性审计的方法框架。核心创新在于引入"感性工学(Kansei)"形容词对作为评估维度,通过对无纹理3D物体的情感属性排序任务,量化不同VLM在产品形态情感表征上的跨模型一致性差异,揭示当前VLM在主观语义概念(如"优雅""简约")编码上的分歧程度,为生成设计界面的语义控制可靠性提供实证依据。
GitHub
- [2026-09-01] Blaizzy/mlx-vlm ⭐5450 🆕NEW
- [2026-09-01] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1837
- [2026-08-30] emcf/thepipe ⭐1524
- [2026-08-30] InternScience/SciEvalKit ⭐86
- [2026-08-31] freeai-org/Scalpel ⭐51 🆕NEW
强化学习
arXiv
- MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning
- 赛道归属: 多模态理解 / 检索增强生成(RAG)
- 核心创新点: 提出 MCite-RL 框架,将强化学习引入多模态 RAG 的视觉引用生成任务。核心突破在于通过"引用增强的智能体强化学习"机制,将引用准确性与答案生成质量联合优化,解决了传统 SFT 方法中视觉引用与生成内容解耦、跨模态推理不稳定的问题,实现了引用与答案之间更强的一致性与可追溯性。
- Small Language Models as Judges for Rubric-Based Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习 / 奖励模型优化
- 核心创新点: 针对基于评分标准的强化学习(Rubric-based RL)中奖励计算成本高昂的痛点,提出使用小型语言模型(Small Language Models)替代大型专有API或7B+参数本地模型担任评判者。核心突破在于:构建了专用评测基准 PointRubric 以量化小模型作为评判者的可靠性,并系统验证了小模型在实例特定评分标准下的判断能力,从而在保持奖励信号质量的前提下大幅降低训练阶段的计算开销,使 Rubric-based RL 的规模化训练更具实用性。
- HARTS: Efficient Agentic Reinforcement Learning for Hybrid-Attention Models over Arbitrary Rollout Trees
- 赛道归属: 强化学习系统优化 / 智能体训练基础设施
- 核心创新点: 针对智能体RL训练中不规则Rollout树结构导致共享前缀重复计算的痛点,提出HARTS系统。核心突破在于:联合规划微批次(microbatch)、数据并行副本分配与调度,实现对混合注意力(Hybrid-Attention)模型的高效支持;同时提供与激活重计算(activation recomputation)兼容的稠密可微分混合注意力执行路径,填补了现有系统仅针对全注意力模型的空白,显著降低了树状轨迹训练中的冗余计算开销。
- WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning
- 赛道归属: GUI智能体 / 强化学习与世界模型融合
- 核心创新点: 提出WM-R1框架,首次将世界模型(World Model)引入移动端GUI智能体的强化学习训练流程,以世界模型替代真实环境作为状态转移来源。核心创新在于:彻底摆脱对高成本、高不稳定性真实环境交互的依赖,利用世界模型模拟GUI状态转换,使智能体能够在虚拟环境中高效学习推理与操作策略,从而大幅降低资源消耗并提升训练稳定性。
- A Survey on Rubric-Guided Reinforcement Learning for Language Models
- 赛道归属: 大语言模型对齐 / 强化学习奖励设计
- 核心创新点: 系统性综述了以"评分标准(Rubric)"为导向的强化学习范式,针对传统RLHF依赖标量奖励信号导致可解释性差、无法捕捉响应质量多维特性的根本缺陷,提出以结构化、可解释的评估准则(Rubric)作为奖励设计、反馈生成和策略优化的核心骨架。核心方法论突破在于:将非结构化的人类偏好信号转化为多维度、可分解的评估框架,为LLM对齐提供更精细、更透明的监督信号体系。
- Reinforcement Learning-Based Control of CAV Platoon Joining Maneuvers in Mixed Traffic
- 赛道归属: 强化学习 / 自动驾驶与交通控制
- 核心创新点: 提出了一套针对混合交通场景下CAV(网联自动驾驶车辆)车队汇入机动的通用建模与仿真框架。核心创新在于将强化学习引入车队汇入控制问题,同时系统性地解决了实际部署中的安全约束与学习效率两大瓶颈——通过构建异构驾驶行为的仿真环境,使RL智能体能够在不确定性和多样化交通参与者共存的真实场景中完成安全、高效的车队汇入决策。
- Simple Actors and Deep Critics for Scalable Reinforcement Learning
- 赛道归属: 强化学习 / 离线强化学习与策略优化
- 核心创新点: 重新审视离线Actor-Critic方法中模型容量的分配策略,提出"简单Actor + 深度Critic"的非对称架构范式。核心突破在于:摒弃扩散模型、流匹配等计算代价高昂的生成式Actor,转而将大容量集中投入Critic网络——由于Critic仅在训练阶段使用,这一设计在不牺牲策略表达能力的前提下,大幅降低了推理部署时的计算开销,实现了离线RL的高效可扩展性。
- Active Curriculum Refinement for Reinforcement Learning
- 赛道归属: 强化学习 / 课程学习与训练效率优化
- 核心创新点: 提出PATH框架,将课程学习与主动学习相结合,显式建模环境间的先决条件关系为有向无环图(DAG)。核心创新体现在两个层面:一是通过采样多样化课程路径主动扩展覆盖范围,避免训练陷入局部子图;二是基于智能体当前学习状态对课程图进行动态精化,优先选择最具信息增益的训练环境节点,从而在结构化课程空间中实现更高效、更系统的强化学习训练。
- Simulating Cognitive Smart Freight Corridors with Agent-Based Models and Reinforcement Learning
- 赛道归属: 多智能体强化学习 / 智能交通仿真
- 核心创新点: 提出了一个将物理基础设施层、V2X连接层与决策层深度耦合的智能货运走廊仿真框架。核心突破在于将强化学习(RL)与多智能体强化学习(MARL)嵌入基于智能体的建模(ABM)系统中,使每个货运智能体能够自适应地学习驾驶与协调策略,突破了传统方法依赖预定义控制策略、无法捕捉动态自适应行为的局限,为CAV在货运场景中的大规模部署提供了低成本的认知仿真实验平台。
- Towards Reliable, Generalizable, and Specific In-Context Knowledge Editing via Multi-Objective Reinforcement Learning
- 赛道归属: 大语言模型后训练 / 知识编辑
- 核心创新点: 针对上下文知识编辑(In-Context Knowledge Editing)中可靠性、泛化性与特异性难以同时满足的三难困境,提出基于多目标强化学习(Multi-Objective RL)的提示构建优化方法。核心创新在于将知识编辑的三项关键指标(可靠性、泛化性、特异性)统一建模为多目标奖励信号,通过RL动态优化检索与提示组装策略,取代固定检索规则,使黑盒LLM在无需参数更新的前提下实现更精准、更鲁棒的知识注入。
GitHub
- [2026-09-01] huggingface/trl ⭐19191
- [2026-09-01] facebookresearch/ReAgent ⭐3712 🆕NEW
- [2026-09-01] kubernetes-sigs/agent-sandbox ⭐3697
- [2026-09-01] radixark/miles ⭐2300 🆕NEW
- [2026-09-01] lubludrova/rl-handbook ⭐184
HuggingFace Datasets
- [2026-08-23] hamzabagirsakci/turkish-court-decisions
世界动作模型
arXiv
- Making Latent Evolution Explicit: Operator-Structured Transitions for World Action Models
- 赛道归属: 世界动作模型 / 机器人策略学习 / 潜空间动态建模
- 核心创新点: 针对现有基于Transformer的潜空间状态转移预测器存在的结构性缺陷(其归纳偏置聚焦于token间交互而非时序演化),提出了一种算子结构化的潜空间转移机制(Operator-Structured Transitions)。核心突破在于将潜空间中的状态转移过程显式化——通过引入具有明确时序演化归纳偏置的算子结构,替代通用Transformer预测器,使潜在状态的演化路径在结构层面得到显式约束与表达,从而提升世界动作模型在任务相关场景状态预测上的精度与可控性。
- 4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting
- 赛道归属: 世界动作模型 / 4D场景表示与预测
- 核心创新点: 提出基于4D高斯散射(4DGS)的以物体为中心的世界动作模型(WAM),核心突破在于将动态物体与静态背景解耦建模,摒弃传统WAM在2D视觉数据上操作的范式。通过显式4DGS表示在三维空间中对场景进行结构化建模,避免了对冗余背景内容的重复处理,同时解决了点云在多视角对齐与累积上的困难。该方法将过去的观测与未来的预测通过统一的4D时空表示桥接,赋予模型对单个物体的显式空间结构感知能力,从而在保持高视觉质量的同时提升了场景理解的几何精确性与可操控性。
- GeoWAM: Visual Geometry World Action Models for Autonomous Driving
- 赛道归属: 自动驾驶 / 世界动作模型(World Action Model)/ 几何感知视频生成与轨迹预测
- 核心创新点: GeoWAM 的核心突破在于将世界动作模型的建模空间从像素域迁移至视觉几何域。传统WAM在像素空间学习场景动态,导致几何、运动与外观、纹理、光照相互耦合,表征效率低下。GeoWAM 提出以几何结构(如深度图、点云或几何特征)作为场景演化的主要建模对象,将未来帧预测与自车轨迹预测统一在几何表示空间中,从而实现对场景动态更直接、更紧凑的建模,降低了外观变化对运动与几何推理的干扰,提升了动作预测的精度与泛化能力。
- ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation
- 赛道归属: 具身智能 / 视觉-语言-动作模型(VLA)/ 机器人操控
- 核心创新点: 提出 ForeTime-VLA 框架,核心突破在于因果未来Token蒸馏机制:以冻结的 Fast-WAM 衍生教师模型为知识源,将其未来感知的动作等价表征蒸馏进轻量级 pi0.5 策略网络,使学生策略在推理阶段无需显式生成未来帧或运行视频级教师模型,即可具备对接触事件的预判能力。该方法专门针对传送带上运动物体操控场景,解决了传统 VLA 仅依赖当前观测、缺乏前瞻性动态建模的痛点,同时规避了 WAM 在部署时的高计算开销。
- RISE: Adaptive Imagination for World Action Models
- 赛道归属: 具身智能 / 世界动作模型(WAM)/ 自适应规划推理优化
- 核心创新点: 提出 RISE(基于选择性展开的自适应想象)框架,核心突破在于动态想象预算分配机制:针对现有 WAM 对所有场景均分配固定想象步数的低效问题,引入一个轻量级潜空间评估器(Latent Evaluator),在每个规划步骤实时估计继续展开的预期收益(风险-收益权衡),并做出 Roll/Stop 的二元决策,从而实现按需、自适应地终止或延续想象过程。该方法将想象计算资源集中分配给真正需要长程预测的复杂场景,在保持规划质量的同时显著降低系统级推理开销。
- GameWAM: A World Action Model for Video Games
- 赛道归属: 世界动作模型 / 游戏智能体 / 视频游戏动态建模
- 核心创新点: 首次将世界动作模型(WAM)框架系统性地拓展至视频游戏领域,提出GameWAM。其核心创新在于统一了两类此前相互割裂的研究范式——"视觉-动作直接映射的游戏智能体"与"基于动作输入预测视觉未来的交互式游戏世界模型"——在单一模型中同时实现任务策略执行与世界动态建模。针对视频游戏特有的挑战(第一人称感知、快速视觉变化、持久世界状态、异构原生控制接口),设计了适配该场景的WAM架构,填补了WAM在开放式、高动态交互环境下应用的空白。
- SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
- 赛道归属: 自动驾驶 / 世界动作模型(World Action Model)/ 端到端驾驶推理优化
- 核心创新点: SimWAM 的核心突破在于将未来视频预测从推理时计算负担转化为训练时监督信号,彻底消除了现有WAM在测试阶段进行未来想象所带来的高昂计算开销。具体方法上,SimWAM 联合训练一个预训练视频专家模型与一个轻量级动作专家模型,采用联合流匹配(joint flow matching)框架统一两者的训练目标;同时设计了隔离注意力掩码(isolated attention mask)机制,使动作预测分支在前向推理时完全独立于未来帧信息,从而在保留视频动态先验迁移收益的同时,实现推理阶段的高效轻量化部署。
GitHub
- [2026-08-31] OpenMOSS/Awesome-WAM ⭐1358 🆕NEW
- [2026-08-30] DravenALG/awesome-vla-wam ⭐992
- [2026-08-30] robbyant-research/Zero-WAM ⭐204
- [2026-08-27] H-EmbodVis/SimWAM ⭐163 🆕NEW
- [2026-08-31] hustvl/FasterWAM ⭐52 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-09-01 05:31:18