AI 每日进展速报 - 2026-09-02
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- SpatialGuard: Harness-Guided Verifiable Spatial Reasoning for Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图 / 空间推理增强
- 核心创新点: 提出 SpatialGuard 框架,在文本到图像生成流程中引入可优化、可验证的结构化空间中间表示("harness"),作为语言描述与视觉采样之间的几何桥梁。核心突破在于将3D空间关系(遮挡、可见性、相机约束等)显式编码为可校验的布局约束,从而在多轮生成中防止空间几何信息的退化,解决了现有提示驱动或布局条件方法缺乏可验证空间中间体的根本缺陷。
- The Plan, Not the Decoder: Diagnosing and Repairing Compositional Failure in Reasoning-Augmented Text-to-Image Generation
- 赛道归属: 文生图 / 组合式生成 / 推理增强生成诊断与修复
- 核心创新点: 该工作针对推理增强型文生图模型(如 GoT-R1)的组合生成失败问题,提出了一种故障定位与修复框架,核心创新在于将生成失败的根因分离为两个独立环节:规划阶段(文本计划/布局生成) 与 解码阶段(图像渲染忠实度)。由于模型在生成图像前会输出包含对象名称、属性和边界框的结构化文本计划,该计划具有机器可读性,可在解码前被独立检查和编辑。研究者通过交换边界框等干预实验验证了计划与解码的可分离性,从而精确诊断出组合失败究竟源于"规划错误"还是"解码不忠实",并在此基础上提出针对性的修复策略。这一方法论突破为推理增强型生成模型的可解释性分析和定向优化提供了新范式。
- RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing
- 赛道归属: 图像生成/编辑 · 奖励模型与对齐
- 核心创新点: 提出 RubricRM,一种基于动态评分标准(Rubric)的生成式奖励建模框架。与现有视觉奖励模型依赖单一标量分数或固定评估维度不同,RubricRM 能够根据不同的输入指令动态生成评估维度(Rubric),再基于这些维度进行成对比较打分。这一设计使奖励模型同时具备可解释性和任务自适应性,能够针对文生图和指令驱动图像编辑等不同任务的差异化需求灵活调整评估标准,突破了固定准则在多样化任务场景下泛化能力不足的瓶颈。
- CameraEditor: Camera-Controlled Image Editing via Video-Prior Sequential Modeling 🆕NEW
- 赛道归属: 图像编辑 / 相机视角控制
- 核心创新点: 提出 CameraEditor,将相机参数控制的图像编辑问题转化为视频先验序列建模任务。核心创新在于借助视频生成模型所蕴含的时序几何先验,将"视角变换前后的两帧图像"建模为视频序列中的起止帧,从而在大幅透视变换场景下同时避免结构撕裂和几何指令被忽略的双重困境,实现了显式相机参数驱动的高质量图像编辑。
- Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate 🆕NEW
- 赛道归属: 文生图 / 安全对抗(Jailbreak攻击)
- 核心创新点: 针对现有文生图模型多层异构安全防护栈(文本过滤器、图像分类器、跨模态检测器组合),提出基于多智能体辩论(Multi-Agent Debate)的越狱攻击框架。核心突破在于将不同安全层的约束冲突显式建模,通过多智能体协作识别当前激活的约束层并针对性地绕过,解决了现有方法无法区分多层过滤器、难以适应异构安全栈的核心瓶颈。
- Training-Free Inpainting Across Domains with a Frozen Text-to-Image Diffusion Model 🆕NEW
- 赛道归属: 图像修复(Inpainting)/ 训练无关方法
- 核心创新点: 提出 Step-PI,在完全冻结的通用文生图扩散模型上实现跨域图像修复,无需任何修复专用权重训练或数据集适配。核心创新包含三项机制的组合:已知区域投影增强边界-内部潜变量反馈、持久化PI状态维持跨步一致性、以及预定义四域释放调度对控制器信号进行逐步调制,从而在单一固定控制器配置下跨多个自然图像域实现高质量条件修复。
- GenScale: A Benchmark for Relative Object Scale in Image Generation and Editing 🆕NEW
- 赛道归属: 文生图 / 图像编辑 / 评测基准
- 核心创新点: 提出 GenScale,首个专门针对图像生成与编辑中相对物体尺度合理性的评测基准。核心贡献在于系统性地量化了现有模型在真实世界相对尺度渲染上的失效模式,构建了包含900条图像级条目和1643组锚点-目标尺度关系的评测协议,覆盖通用物体生成、带度量尺寸的人-产品生成等多个子任务,填补了现有评测体系对几何尺度感知能力考察的空白。
- ContextBias: Controlled Evaluation of Bias Persistence Under Context Shift in Text-to-Image Models
- 赛道归属: 文生图 / 偏见评估与公平性分析
- 核心创新点: 提出 ContextBias 评估框架及配套基准 ContextBench,专门用于量化文生图模型在上下文迁移(Context Shift)条件下的偏见持久性问题。核心方法论突破在于:通过受控实验设计,系统性地将职业角色的视觉表征置于不同提示上下文中,精确测量模型内部学习到的职业-视觉属性关联(如性别、肤色等刻板印象)是否随上下文变化而消解或持续存在,从而区分"表面可调节的偏见"与"深层稳定的偏见",为偏见溯源与模型去偏提供更细粒度的诊断工具。
- NumBench: Diagnosing Counting Failures in Text-to-Image Models
- 赛道归属: 文生图 / 评测基准
- 核心创新点: 提出 NumBench,一个专门用于诊断文生图模型数量生成失败的大规模基准。核心创新在于:(1)构建了包含 64 万条提示词、覆盖 1600 个类别、数量范围 1~100 的超大规模评测集,规模远超现有基准;(2)采用析因设计(factorial design),系统性地控制对象组合、空间引导和外观条件等变量,同时对数量和类别曝光进行均衡处理,避免混淆因素干扰;(3)提出一个过程模型,将数量生成失败建模为"有限可解析槽位的竞争机制",从机制层面解释模型为何产生数量错误,而非仅停留在现象描述层面,为后续改进提供理论依据。
- Zero-Shot Video Restoration and Enhancement with Text-to-Image Latent Diffusion Models and Multi-Modal References
- 赛道归属: 视频修复与增强 · 零样本推理优化
- 核心创新点: 提出一种利用文生图(T2I)潜扩散模型实现零样本视频修复与增强的框架,核心创新在于双提示调优反演与采样(Dual Prompt Tuning Inversion and Sampling)机制。该机制在无需针对视频任务重新训练的前提下,通过多模态参考信息引导推理过程,有效解决了将图像修复扩散模型直接迁移至视频时产生严重时序闪烁(temporal flickering)的核心难题,在保持帧间时序一致性的同时显著降低推理时间,实现了T2I扩散模型向视频域的零样本泛化。
GitHub
- [2026-09-02] pydantic/pydantic-ai ⭐19651 🆕NEW
- [2026-09-02] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13342
- [2026-09-02] Osmantic/ODS ⭐5828
- [2026-09-02] franksong2702/dsh-codex-connect ⭐73
- [2026-09-02] TGYD-helige/pi ⭐54
视频生成/编辑
arXiv
- CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation
- 赛道归属: 文生视频 / 评测基准
- 核心创新点: 提出首个专门评估文生视频模型文化理解能力的综合基准 CultureVidBench,突破现有基准仅关注感知质量、物理合理性和文本对齐的局限,系统性地引入文化特定对象、动作、仪式、可见文字及音频线索等多维度文化评估指标,填补了T2V模型跨文化表征能力评测的空白。
- EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing
- 赛道归属: 视频生成与编辑(统一框架)
- 核心创新点: EditStream 提出了一个基于 DiT(Diffusion Transformer)的统一自回归框架,将文生视频(T2V)、图生视频(I2V)、视频转视频(V2V)等多种视频创作与编辑任务整合进单一模型。其核心方法突破在于:①通过灵活的任务特定条件机制(task-specific conditioning)实现多任务统一建模,无需为每类任务维护独立模型;②将扩散模型转化为少步自回归流式推理模型(few-step autoregressive streaming),大幅提升生成效率,支持交互式实时视频流式输出,兼顾生成质量与推理速度。
- MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video Generation 🆕NEW
- 赛道归属: 视频生成 / 相机控制视频生成
- 核心创新点: 针对现有相机控制视频生成中几何感知位置编码在真实度量相机轨迹下存在的尺度依赖失效问题(齐次投影编码导致注意力logits和特征范数随物理平移基线无界增长),提出MeRoPE(度量旋转位置编码)。其核心突破在于设计了一种范数保持的相对相机编码方式,将相机外参和每个token的视线方向以旋转不变的相对形式嵌入注意力机制,从根本上消除了绝对度量尺度对注意力计算的数值不稳定影响,使模型能够泛化到任意物理尺度的相机运动轨迹。
- Physically Plausible Video Generation via Visual-Semantic Chain-of-Events Conditioning 🆕NEW
- 赛道归属: 视频生成 / 物理合理性视频生成
- 核心创新点: 针对物理合理视频生成中自然语言条件描述不足(仅整体描述物理现象、忽略中间状态和过渡动态)的核心问题,将物理合理视频生成任务重新建模为以"事件链"为中心的生成范式。提出Visual-Semantic Chain-of-Events(视觉语义事件链)条件机制,将物理演化过程显式分解为一系列具有中间状态和转变动态的离散事件节点,并以此作为生成条件。相比传统CoT仅在语义层面增强提示词,该方法同时引入视觉与语义双层事件链约束,有效弥合了语言描述与物理动态过程之间的语义鸿沟。
- Streaming4D: Accelerate 4D World Models via Block-wise Video Generation and Incremental Reconstruction 🆕NEW
- 赛道归属: 4D生成 / 动态场景重建
- 核心创新点: 针对现有4D生成范式中视频生成与3D重建串行解耦导致高交互延迟的瓶颈问题,提出Streaming4D流式同步框架。核心创新在于将分块自回归视频生成(block-wise autoregressive generation)与增量式3D重建(incremental 3D reconstruction)紧密耦合为同步流水线:视频以块为单位逐步生成的同时,即时触发对应块的几何重建,彻底打破"先完整生成视频、再整体重建"的串行依赖,大幅降低端到端延迟,使4D世界模型具备面向实时交互场景的可行性。
- DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
- 赛道归属: 视频生成(原生音视频联合生成)
- 核心创新点: 提出了一种原生音视频联合生成框架 DreamX-Creator 1.0,核心突破在于摒弃了传统"先生成视频、再后处理音频"的两阶段流水线范式,转而在单一 7B 参数生成器内同步对音频流与视频流进行联合去噪。网络架构上采用"前半段独立处理、后半段门控耦合"的设计策略:两路模态专属流在网络前半部分各自独立建模,在后半部分通过门控注意力机制实现跨模态交互,从而在保留各模态独立表征能力的同时,捕捉视觉动态与声学事件之间的因果关联。此外,系统支持以首帧图像与文本提示为条件的 2K 分辨率生成,在紧凑模型规模下实现了高分辨率原生音视频的端到端合成。
- LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation
- 赛道归属: 视频生成(长视频生成 / 自回归扩散模型记忆机制)
- 核心创新点: 针对自回归视频扩散模型在长视频生成中的长程一致性问题,提出了一种状态感知的记忆路由机制 LayerRecall。其核心突破在于:通过分析视频 DiT 各层对"当前帧、近期帧、远期帧"上下文的差异化偏好,设计了一个以层状态为条件的动态路由器,使不同层能够自适应地从历史记忆中检索与自身语义需求最匹配的上下文信息。相较于传统的基于时间近邻的缓存策略(仅保留最近片段),该方法在历史信息被驱逐后仍能有效召回远期关键线索(如重复出现的人物、场景、属性),从而在不扩大滑动窗口的前提下显著提升跨片段的长程语义一致性。
- TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models
- 赛道归属: 视频生成 / 安全攻防
- 核心创新点: 针对图生视频(I2V)模型提出"时序越狱攻击"(TempJail)新范式,揭示了视频生成模型在时间维度上独有的安全漏洞——有害内容可以不出现在单帧中,而是通过跨帧时序演化隐蔽地涌现。研究构建了三种攻击场景,突破了现有安全研究仅聚焦单帧违规的局限,将攻击面从空间域扩展至时间域。
- RECAP-Forcing: Retaining Content Appearances for Long Video Generation
- 赛道归属: 视频生成 / 长视频生成
- 核心创新点: 提出 RECAP-Forcing 方法,颠覆了长视频自回归生成中以"时间顺序"组织记忆的传统范式,改为以"外观新颖性"为核心组织记忆。通过识别并优先保留视频中出现的新主体、对象和场景的关键帧,而非简单保留最近帧,从而在有限注意力窗口内更有效地维持长视频中内容外观的一致性。
- Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation
- 赛道归属: 多模态音视频生成 / 安全评测基准
- 核心创新点: 提出 Multi2AV-Safety 基准,专门针对多模态条件(文本、图像、音频、视频联合输入)驱动的音视频生成场景的安全评估。核心创新在于识别并量化"跨模态交互涌现风险"——有害内容可能不存在于任何单一输入模态中,而是由多个看似无害的条件跨模态、跨时间协同作用后涌现,突破了现有以单一提示词为中心的安全评测框架。
GitHub
- [2026-09-02] hao-ai-lab/FastVideo ⭐4279
- [2026-09-02] ZeroLu/awesome-seedance ⭐2363
- [2026-09-02] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1941
- [2026-09-02] tetherto/qvac ⭐576
- [2026-09-02] guaardvark/guaardvark ⭐198
HuggingFace Models
HuggingFace Spaces
音频生成
arXiv
- EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis
- 赛道归属: 情感语音合成(Emotional Text-to-Speech)
- 核心创新点: 针对现有情感TTS系统仅支持单一静态情感标签/嵌入的局限性,提出EmoTra-TTS框架,核心突破在于实现句内(Intra-Utterance)连续情感动态过渡。该方法摒弃了传统"一句一情感"的离散建模范式,转而在单条语音合成过程中对情感状态进行时序连续建模,使情感能够在毫秒级时间尺度上自然地上升、衰减与转变,从而与心理学研究中情感作为连续动态过程的本质规律对齐,同时保持对情感轨迹的显式可控性——这一点也弥补了LLM-based TTS系统虽能隐式变化韵律但缺乏精确情感控制的不足。
- Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation 🆕NEW
- 赛道归属: 文本转语音(TTS)/ LLM对齐优化
- 核心创新点: 将LLM生成TTS友好文本的问题重新定义为偏好对齐任务,而非依赖下游改写模块。核心方法是构建两个偏好数据集(SPA),通过直接偏好优化(DPO)等对齐技术,使LLM在生成阶段即输出适合口语化朗读的文本(如避免缩写、歧义停顿、书面化表达等),从源头解决TTS输入质量问题,而非事后修补。
- Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 多语言与代码切换语音合成
- 核心创新点: 提出短语级语言对比引导(LCG),一种无需训练的推理时框架,专门解决代码切换场景下外语短语被主语言口音"污染"的问题。核心突破在于将原本作用于整句的单一语言引导信号,替换为分段式、短语定位的对比引导——对代码切换短语单独施加其母语的语言引导,从而在不重新训练模型的前提下,精准恢复该短语的原生口音,实现细粒度的口音控制。
- Vagdhenu: A Vrutta (Meter) Aware Shloka-to-Chant (TTS) System for Sanskrit
- 赛道归属: 文本转语音(TTS)/ 梵语吟诵合成
- 核心创新点: 针对梵语颂诗(Shloka)的吟诵合成任务,提出了一套专用前端处理流水线,核心突破在于:①通过卡纳达语正字法路由规避了梵文天城体(Devanagari)在印地语TTS模型中常见的"schwa删除"问题,从而保留梵语发音的完整性;②引入韵律(Vrutta/Meter)感知机制,使合成语音能够忠实还原传统吟诵(Parayana)的节律特征。整体方案以现成的流匹配(Flow-Matching)TTS骨干网络和大规模神经声码器为基础,重点贡献在于领域适配的前端工程设计,而非新架构提出。
- CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents
- 赛道归属: 文本转语音(TTS)/ 零样本语音合成
- 核心创新点: CuteTTS 提出了一种基于连续潜变量自回归建模的高效高质量语音合成框架。核心突破在于:设计了一种紧凑的低码率连续潜变量序列表示,在保留充分声学细节的同时降低自回归预测的序列长度;同时针对扩散采样和无分类器引导在每个自回归步骤中带来的高推理开销问题,提出了优化方案,在流式低延迟场景下实现了保真度与推理效率的平衡,适用于交互式助手、个性化媒体等实时应用场景。
- Joycent: Multi-Accent TTS via Disentangled Accent Modeling and Layer-Specific Conditioning
- 赛道归属: 语音合成(TTS)/ 多口音语音生成
- 核心创新点: 提出 Joycent,一个基于扩散模型的多口音 TTS 框架,核心突破在于双层解耦策略:在表示学习阶段将口音特征与说话人身份特征显式分离,并在 TTS 条件注入阶段采用层级特定条件化(Layer-Specific Conditioning)机制,将两类解耦因子分别注入扩散模型的不同层,从而在保留说话人音色的同时实现精准的目标口音迁移,解决了传统方法中口音与说话人特征相互纠缠导致生成质量下降的问题。
- Self-EmoQ: Plutchik-Guided Value-based Planning to Drive Streaming Emotional TTS 🆕NEW
- 赛道归属: 情感语音合成(Emotional TTS)/ 对话式AI / 强化学习
- 核心创新点: 提出Self-EmoQ框架,首次引入情绪先验规划机制,使系统在文本生成之前即自主决定情绪状态,从而驱动下游流式情感TTS合成。核心创新包括:以Plutchik情绪轮为理论基础构建情绪价值空间,通过强化学习(RL)训练即插即用的LLM情绪规划模块,打破了传统情感TTS依赖外部情绪标注或事后情绪注入的范式,实现了情绪感知与语音生成的端到端流式协同。
- Sequential Trajectories and Simultaneous Blending: Multi-Emotion Modeling for Instruction-Following TTS
- 赛道归属: 语音合成(TTS)/ 情感可控语音生成
- 核心创新点: 针对多情感 TTS 中的两类任务——情感轨迹(有序多阶段情感序列)和情感混合(多情感共存于同一话语)——提出了一套统一建模框架。核心创新在于识别并解决了监督微调(SFT)与多情感生成目标之间的监督不匹配问题:SFT 无法显式评估情感过渡的合理性,因此引入强化学习(RL)机制对情感轨迹的连贯性和混合情感的共存质量进行显式奖励优化,使模型能够遵循自然语言指令完成复杂的多情感控制。
- TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models
- 赛道归属: 音频语言模型(Audio-Language Model)/ 时序感知音频理解
- 核心创新点: 提出 TEMPO,首个统一处理音频、语音和音乐时间戳定位任务的大型音频语言模型。核心创新在于构建了一套监督微调(SFT)策略,将时间戳预测能力以多任务方式注入现有 LALM,使模型从仅能进行片段级描述升级为能够对识别到的事件、说话人和声音赋予精确时间锚点,填补了现有 LALM 在时序定位能力上的关键空白,对语音识别、密集音频字幕等下游任务具有直接价值。
- PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation
- 赛道归属: 空间音频生成(Spatial Audio Generation)/ 文本驱动音频合成
- 核心创新点: 提出 PhysWave,一个物理引导的潜在扩散模型用于文本到一阶 Ambisonics(FOA)空间音频生成。核心突破有两点:①将声学物理约束(声源方向与距离的声学关系)嵌入扩散生成过程,避免纯数据驱动方法产生违反物理规律的空间音频;②将描述性文本控制与参数化空间控制统一在同一框架内,用户无需在易用性与精确性之间取舍,实现了对空间属性的精细可控生成。
GitHub
- [2026-09-02] huggingface/diffusers ⭐34419
- [2026-08-27] SamurAIGPT/Generative-Media-Skills ⭐4204
- [2026-08-29] gemelo-ai/vocos ⭐1156
- [2026-08-31] BinWang28/audio-ai-hub ⭐951
- [2026-08-28] xiaomi-research/controlfoley ⭐149
HuggingFace Models
HuggingFace Spaces
语言大模型
arXiv
- Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning
- 赛道归属: 推理优化 / 链式思维控制
- 核心创新点: 将推理过程的引导建模为马尔可夫决策过程(MDP),提出 ACTS 框架,通过一个控制器智能体在推理过程中自适应地选择推理策略(如快速跳过、深度展开等),使推理行为在推理时可显式控制,而非依赖隐式的长度压缩或早停机制,实现了效率与可控性的统一。
- Triggering Chain-of-Thought via Latent Feature Interventions in Large Language Models
- 赛道归属: 推理机制可解释性 / 链式思维触发机制
- 核心创新点: 利用稀疏自编码器(SAE)捕获 LLM 内部表示中的稀疏特征,系统性地识别出与链式思维(CoT)推理行为因果相关的少量潜在特征,并通过定向激活干预验证其因果性,首次从内部表示层面揭示了触发 CoT 行为的神经机制,为推理行为的可解释性与可干预性提供了新路径。
- When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models
- 赛道归属: 推理优化 / 测试时计算扩展(Test-Time Scaling)综述
- 核心创新点: 将测试时计算扩展(TTS)统一抽象为"推理即搜索"的框架,系统梳理了从 CoT 单轨迹解码到树搜索(如 MCTS、Beam Search)等多种推理范式,构建了覆盖搜索空间定义、状态评估、搜索策略的统一分类体系,为该领域提供了系统性的理论视角和研究路线图。
- Detecting Hidden Chain-of-Thought in Large Language Models with Linguistic, Behavioral, and Mechanistic Indicators
- 赛道归属: 推理机制可解释性 / 隐式链式思维检测
- 核心创新点: 提出隐式 CoT 检测分数(HCDS),通过对比中性提示下模型行为与显式 CoT / 显式无 CoT 提示下行为的语言学、行为学及机制层面的对齐程度,构建了一套无需直接观测内部推理过程即可判断模型是否进行隐式推理的量化框架,填补了隐式推理检测方法论的空白。
- Improving LLM Interpretability with User-Centric Chain-of-Thought Reasoning
- 赛道归属: LLM可解释性 / 推理链优化
- 核心创新点: 提出以用户为中心的思维链(Chain-of-Thought)设计范式,核心突破在于将推理轨迹的优化目标从"提升模型性能"转向"提升人类可读性与可检验性"。通过基于自我一致性(self-consistency)的结构化推理轨迹设计,使中间推理步骤更符合人类认知习惯,从而在保持模型能力的同时增强人机协作中的可信度与透明度。
- EDGE: Error Dependency Graph-Guided Multi-Error Attribution in Multi-Agent LLM Systems 🆕NEW
- 赛道归属: 多智能体LLM系统 / 错误归因与调试
- 核心创新点: 提出EDGE框架,通过构建错误依赖图(Error Dependency Graph)对多智能体LLM系统中的多错误进行结构化建模,显式捕捉错误间的因果依赖关系;并引入反事实回滚(counterfactual rollout)机制验证可靠的因果子集,突破了现有方法仅能定位单一责任主体、无法建模错误间依赖关系的局限。
- mzCache: On-Device LLM Memory Management under Multitasking 🆕NEW
- 赛道归属: 端侧LLM推理 / 内存管理与系统优化
- 核心创新点: 提出mzCache框架,专门针对移动端多任务切换场景下LLM内存被操作系统强制驱逐的问题,设计了一套设备端LLM内存管理机制,通过智能调度模型权重与KV Cache的驱逐与恢复策略,避免慢速存储读取或KV Cache全量重计算,显著降低多任务切换带来的推理延迟。
- Embedded Conditional Independence Tests for Large Language Model Generated Text with an Application to German Parliament Speeches 🆕NEW
- 赛道归属: LLM输出分析 / 统计检验与可解释性
- 核心创新点: 提出嵌入式条件独立性检验(Embedded CIT)方法,将高维文本数据映射至嵌入空间后执行条件独立性测试,解决了传统CIT方法难以处理文本等高维多模态数据的瓶颈;具体应用于检验LLM生成文本是否在源文本之外额外携带特定属性信息,为LLM输出的信息泄露与偏差分析提供了严格的统计工具。
- Compile, Don't Memorize: A Context Compilation Architecture (CCA) for In-Context Learning 🆕NEW
- 赛道归属: 上下文学习(In-Context Learning)/ LLM推理架构
- 核心创新点: 提出上下文编译架构(Context Compilation Architecture, CCA),将传统"读取-推理"范式转变为"编译-执行"范式——预先将长上下文中的规则、知识和输出模式编译为结构化中间表示,再由模型基于编译结果生成答案,从根本上解决了模型在复杂规则密集型ICL任务中因单次前向推理负担过重导致的规则遗漏问题,在相关基准上将通过率从12-16%大幅提升。
- SOVER: Formal Certification of Optimization Reformulations via LLM-Assisted SMT Verification 🆕NEW
- 赛道归属: LLM辅助数学优化 / 形式化验证
- 核心创新点: 提出SOVER框架,将LLM的优化问题建模与转换能力和SMT(可满足性模理论)形式化验证相结合,通过将语义映射与形式化正确性证明解耦,克服了仅依赖求解器实验验证时因局部最优、数值误差和语义偏差导致的不可靠性,实现了对优化问题重构变换的可证明正确性认证,是首个将形式化方法引入LLM驱动的优化建模验证流程的工作。
GitHub
- [2026-09-02] sgl-project/sglang ⭐33078
- [2026-09-02] NVIDIA/TensorRT-LLM ⭐14527 🆕NEW
- [2026-09-02] openJiuwen-ai/jiuwenswarm ⭐6738
- [2026-09-02] google-ai-edge/LiteRT-LM ⭐6348
- [2026-09-02] flagos-ai/FlagGems ⭐1087
HuggingFace Models
HuggingFace Datasets
- [2026-08-20] openbmb/Ultra-FineWeb-L1
多模态大模型
arXiv
- SpanCalib-VLM: Calibrated Hallucination Span Detection in Vision-Language Models
- 赛道归属: 多模态理解 / 幻觉检测与校准
- 核心创新点: 提出 SpanCalib-VLM 混合双系统框架,专门用于视觉语言模型(VLM)中幻觉文本片段的检测与置信度校准。核心创新在于将生成式 VLM(擅长幻觉片段定位但存在过度自信和高推理延迟问题)与判别式序列标注器(具备确定性速度和更优校准性但召回率偏低)进行互补融合,通过双系统协同弥补各自短板,同时实现精准的 span 级幻觉定位与良好校准的置信度输出,在 SHROOM-Visions 共享任务上验证了该方案的有效性。
- StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models
- 赛道归属: 多模态理解 / 流式视频理解
- 核心创新点: 提出StreamEMS机制,在传统流式视频记忆框架"读/写"操作之外,引入"自进化记忆"模块,通过对记忆本身的表征能力进行持续优化(而非仅优化数据注入和检索流程),使历史记忆能够随时间自适应地提炼和增强,从而提升视觉语言模型在长时流式视频理解中的信息利用效率。
- VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models
- 赛道归属: 多模态理解 / 长视频理解
- 核心创新点: 提出递归套索自改进(Recursive Harness Self-Improvement, RSI)框架,在冻结视觉语言模型参数的前提下,专注于优化视频上下文构建过程本身。核心突破在于将上下文构建程序(context-construction harness)作为独立优化目标,通过递归自改进机制迭代提升可执行上下文的质量,从而在不修改底层模型权重的情况下显著提升长视频理解性能。这一方法将上下文构建与模型能力解耦,揭示了仅通过改进推理时的信息组织策略所能带来的性能上限。
- GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
- 赛道归属: 多模态理解 / 交通视频分析
- 核心创新点: 提出GHR-VLM框架,将视觉定位(Grounding)与混合推理(Hybrid Reasoning)结合,实现对公交车载长视频的零样本分析。核心突破在于融合监督视频模型的时序感知能力与VLM的语义推理能力,通过视觉锚定机制将VLM的推理范围约束在关键片段上,规避直接对长视频进行端到端推理带来的高成本和低可靠性问题。
- Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers 🆕NEW
- 赛道归属: 多模态理解 / 具身智能与自主决策
- 核心创新点: 提出 SAGE(基于熵的选择性智能体引导)框架,核心创新在于通过策略熵来衡量学习者的不确定性,仅在学习者置信度低时才选择性地查询 VLM 教师,而非每步都调用。这一机制将昂贵的 VLM 推理成本大幅降低,同时通过在线交互持续优化轻量级自主策略。相比直接蒸馏或全程依赖 VLM 的方案,SAGE 能有效规避 VLM 系统性错误的传播——当 VLM 给出低质量指导时,熵过滤机制可减少其负面影响,从而从"不完美教师"中提炼出更鲁棒的自主决策策略。
- AIM: Anchor Identity Features, Then Match for Multimodal Large Language Model Unlearning
- 赛道归属: 多模态理解 / 模型遗忘与隐私保护
- 核心创新点: 针对多模态大语言模型(MLLM)中身份信息遗忘问题,提出AIM方法,在无需保留图像(retain images)的现实约束下实现精准身份遗忘。核心创新在于发现身份相关特征与视觉感知特征在表征空间中占据不同区域,并以此为依据设计"锚定身份特征后匹配删除"策略,在不损害模型通用视觉感知能力的前提下,精确擦除目标身份信息。
- Dynamic Alignment Compensation for Hallucination Mitigation in Large Vision-Language Models
- 赛道归属: 多模态理解 / 幻觉抑制
- 核心创新点: 提出动态对齐补偿(DAC)机制,从模型内部表征动态角度切入幻觉问题。核心发现是:在自回归生成过程中,跨模态表征会随解码层加深和生成步骤推进而发生"漂移"和"退化",导致视觉信息逐渐失效。DAC在推理阶段动态检测并补偿这种跨模态表征偏差,无需外部监督或额外训练,从内部表征层面抑制幻觉生成。
- Training-Free Temporal Abstraction for General Video Understanding
- 赛道归属: 多模态理解 / 视频时序理解(训练无关方法)
- 核心创新点: 提出一种无需训练的通用视频时序抽象框架,利用预训练视频-文本模型内在的时序结构,统一支持动作变化检测、自然语言时序定位、关键帧选取等多个下游任务。核心突破在于证明预训练模型已隐式编码足够的时序语义信息,通过设计通用的时序抽象接口即可跨任务复用,无需针对每个任务单独收集标注数据或设计专用架构。
- Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding
- 赛道归属: 多模态理解 / 长视频理解与推理
- 核心创新点: 提出"时序思维树"(Temporal Tree of Thought)框架,模拟人类回答长视频问题时"先定位全局片段、再聚焦局部细节"的分层推理过程。核心创新在于将推理过程结构化为树状搜索:以推理链引导视觉线索的分层检索,克服均匀采样遗漏关键帧和帧独立评估忽略时序组织的双重缺陷,从而在有限上下文长度约束下实现对长视频的高效精准理解。
- CODE: Cross-Modal Calibration and Dynamic Suppression for Open World Object Detection
- 赛道归属: 多模态理解 / 开放世界目标检测
- 核心创新点: 针对开放世界目标检测(OWOD)中多模态基础模型存在的两大核心问题——单向文本到视觉匹配导致的语义歧义,以及刚性异常值惩罚对未知类目标的过度抑制——提出 CODE 框架。该框架在推理阶段引入三个互补模块:①跨模态联合置信度校准,通过注入全局视觉原型来修正文本驱动的置信度偏差,实现视觉与语言特征的双向对齐;②动态抑制机制,自适应调整已知类决策边界附近未知目标的抑制强度,避免对潜在未知类的误压制;③两者协同构成统一的推理时框架,无需重新训练即可部署于现有多模态检测模型之上。其方法论突破在于将跨模态校准与动态边界抑制解耦并联合优化,在不修改模型权重的前提下同时提升已知类检测精度与未知类召回能力。
GitHub
- [2026-09-02] Blaizzy/mlx-vlm ⭐5460
- [2026-09-02] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1838
- [2026-08-30] emcf/thepipe ⭐1524
- [2026-09-01] liudaizong/Awesome-LVLM-Attack ⭐575 🆕NEW
- [2026-09-02] freeai-org/Scalpel ⭐60
强化学习
arXiv
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习 / LLM智能体训练
- 核心创新点: 提出ARISE-RL全周期自进化框架,核心突破在于将评分标准(Rubric)的生成与策略优化解耦并迭代耦合:首先由模型自动生成可验证的评分标准以解决开放任务缺乏金标答案的问题,再通过基于标准的奖励信号驱动GRPO策略更新;针对长时域任务中奖励稀疏导致的rollout对比度弱问题,引入组内对比增强机制,从而在能力边界附近提供更细粒度的优化信号,实现模型自我进化的闭环。
- MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning
- 赛道归属: 多模态理解 / 检索增强生成(RAG)
- 核心创新点: 提出 MCite-RL 框架,将强化学习引入多模态 RAG 的视觉引用生成任务。核心突破在于通过"引用增强的智能体强化学习"机制,将引用准确性与答案生成质量联合优化,解决了传统 SFT 方法中视觉引用与生成内容解耦、跨模态推理不稳定的问题,实现了引用与答案之间更强的一致性与可追溯性。
- Iterative GRPO: Batch-Online Policy Iteration for Multi-Turn RL via Single-Turn RLHF 🆕NEW
- 赛道归属: 强化学习 / 多轮对话LLM训练
- 核心创新点: 提出Iterative GRPO方法,将多轮对话RL训练转化为单轮RLHF问题的批量在线策略迭代。核心突破在于:通过将多轮交互轨迹"展平"为单轮形式,使得无需实时外部环境(真实用户)参与训练循环,利用离线或模拟的对话历史构造批次,以单轮RLHF的GRPO算法迭代更新策略,从而绕开多轮RL中环境响应依赖的工程瓶颈,同时保持策略的近似在线性。
- Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs 🆕NEW
- 赛道归属: 强化学习 / LLM后训练资源分配
- 核心创新点: 首次将SFT与RL标注预算分配问题形式化为"近最优性"框架,而非寻找单一最优比例。核心创新在于:通过跨模型规模的系统性实验,发现最优SFT-RL分配比例存在可迁移的规律性,并提出基于小模型实验结果预测大模型最优分配策略的方法,为固定预算下的后训练资源调度提供了可操作的理论依据,填补了该问题缺乏原则性框架的空白。
- From Base Rollouts to RL Reasoning: A Budgeted Search Perspective 🆕NEW
- 赛道归属: 强化学习 / LLM推理能力分析
- 核心创新点: 提出统一解码框架(UDF),将token级采样、束搜索、树搜索和序列级重采样统一表达为可执行策略,从推理时计算预算视角重新审视RLVR的增益来源。核心发现是:RL的推理提升在很大程度上可被解释为对基础模型已有但低概率轨迹的分布重加权,而非创造全新推理能力;由此揭示了RL训练与推理时搜索之间的等价性边界,为理解RLVR的本质机制提供了行为层面的统一解释。
- Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents 🆕NEW
- 赛道归属: 强化学习 / LLM长时域智能体训练
- 核心创新点: 挑战"小模型结果导向RL存在天花板"的主流观点,将瓶颈归因于两类具体失效:信号饥饿(稀疏奖励下组相对RL对比度不足)和策略漂移(长时域探索中策略偏离有效区域)。核心创新在于提出针对性修复方案:通过自适应探索扩大有效rollout覆盖范围,同时引入漂移抑制机制约束策略更新幅度,证明在不依赖密集奖励、SFT先验或多智能体编排的条件下,纯结果导向RL即可在长时域交互任务上取得显著效果。
- Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPC 🆕NEW
- 赛道归属: 强化学习 / 模型预测控制(MPC)加速
- 核心创新点: 针对权重可变MPC场景下RL训练收敛慢的问题,提出利用MPC求解器梯度(Solver-Gradient)直接引导RL策略参数更新的加速框架。核心突破在于:通过对MPC数值解关于代价函数权重的隐式微分,将求解器内部的优化结构信息转化为策略梯度的引导信号,在偏差-方差权衡中兼顾RL的闭环优化性与MPC梯度的低方差指向性,从而显著加速在线自适应权重策略的学习收敛速度。
- Small Language Models as Judges for Rubric-Based Reinforcement Learning
- 赛道归属: 强化学习 / 奖励模型优化
- 核心创新点: 针对基于评分标准的强化学习(Rubric-based RL)中奖励计算成本高昂的痛点,提出使用小型语言模型(Small Language Models)替代大型专有API或7B+参数本地模型担任评判者。核心突破在于:构建了专用评测基准 PointRubric 以量化小模型作为评判者的可靠性,并系统验证了小模型在实例特定评分标准下的判断能力,从而在保持奖励信号质量的前提下大幅降低训练阶段的计算开销,使 Rubric-based RL 的规模化训练更具实用性。
- HARTS: Efficient Agentic Reinforcement Learning for Hybrid-Attention Models over Arbitrary Rollout Trees
- 赛道归属: 强化学习系统优化 / 智能体训练基础设施
- 核心创新点: 针对智能体RL训练中不规则Rollout树结构导致共享前缀重复计算的痛点,提出HARTS系统。核心突破在于:联合规划微批次(microbatch)、数据并行副本分配与调度,实现对混合注意力(Hybrid-Attention)模型的高效支持;同时提供与激活重计算(activation recomputation)兼容的稠密可微分混合注意力执行路径,填补了现有系统仅针对全注意力模型的空白,显著降低了树状轨迹训练中的冗余计算开销。
- WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning
- 赛道归属: GUI智能体 / 强化学习与世界模型融合
- 核心创新点: 提出WM-R1框架,首次将世界模型(World Model)引入移动端GUI智能体的强化学习训练流程,以世界模型替代真实环境作为状态转移来源。核心创新在于:彻底摆脱对高成本、高不稳定性真实环境交互的依赖,利用世界模型模拟GUI状态转换,使智能体能够在虚拟环境中高效学习推理与操作策略,从而大幅降低资源消耗并提升训练稳定性。
GitHub
- [2026-09-02] huggingface/trl ⭐19196 🆕NEW
- [2026-09-02] OpenPipe/ART ⭐10687
- [2026-09-02] radixark/miles ⭐2304
- [2026-09-02] THU-BPM/RLCSD ⭐98 🆕NEW
- [2026-09-02] raamonp/rl-gym-orchestrator ⭐55
HuggingFace Datasets
- [2026-08-23] hamzabagirsakci/turkish-court-decisions
世界动作模型
arXiv
- Making Latent Evolution Explicit: Operator-Structured Transitions for World Action Models
- 赛道归属: 世界动作模型 / 机器人策略学习 / 潜空间动态建模
- 核心创新点: 针对现有基于Transformer的潜空间状态转移预测器存在的结构性缺陷(其归纳偏置聚焦于token间交互而非时序演化),提出了一种算子结构化的潜空间转移机制(Operator-Structured Transitions)。核心突破在于将潜空间中的状态转移过程显式化——通过引入具有明确时序演化归纳偏置的算子结构,替代通用Transformer预测器,使潜在状态的演化路径在结构层面得到显式约束与表达,从而提升世界动作模型在任务相关场景状态预测上的精度与可控性。
- 4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting
- 赛道归属: 世界动作模型 / 4D场景表示与预测
- 核心创新点: 提出基于4D高斯散射(4DGS)的以物体为中心的世界动作模型(WAM),核心突破在于将动态物体与静态背景解耦建模,摒弃传统WAM在2D视觉数据上操作的范式。通过显式4DGS表示在三维空间中对场景进行结构化建模,避免了对冗余背景内容的重复处理,同时解决了点云在多视角对齐与累积上的困难。该方法将过去的观测与未来的预测通过统一的4D时空表示桥接,赋予模型对单个物体的显式空间结构感知能力,从而在保持高视觉质量的同时提升了场景理解的几何精确性与可操控性。
- GeoWAM: Visual Geometry World Action Models for Autonomous Driving
- 赛道归属: 自动驾驶 / 世界动作模型(World Action Model)/ 几何感知视频生成与轨迹预测
- 核心创新点: GeoWAM 的核心突破在于将世界动作模型的建模空间从像素域迁移至视觉几何域。传统WAM在像素空间学习场景动态,导致几何、运动与外观、纹理、光照相互耦合,表征效率低下。GeoWAM 提出以几何结构(如深度图、点云或几何特征)作为场景演化的主要建模对象,将未来帧预测与自车轨迹预测统一在几何表示空间中,从而实现对场景动态更直接、更紧凑的建模,降低了外观变化对运动与几何推理的干扰,提升了动作预测的精度与泛化能力。
- ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training 🆕NEW
- 赛道归属: 具身智能 / 世界动作模型 / 机器人操控预训练
- 核心创新点: ZimaBlue 的核心创新在于提出了一种可扩展的无动作标注视频预训练范式,用于构建可泛化的世界动作模型。其方法论突破体现在以下几点:①将大规模第一人称(Egocentric)视频作为替代机器人轨迹数据的预训练来源,绕开了动作标注数据稀缺且多样性不足的瓶颈;②设计了将"无动作"视频经验有效转化为可用于机器人操控的动作先验的训练机制,使模型能从丰富的物体交互、接触动力学和工具使用视频中学习物理世界的通用规律;③通过规模化预训练提升模型的跨场景泛化能力,使其在下游机器人任务上无需大量动作标注数据即可实现有效迁移。该工作的本质是将视频生成/理解领域的扩展规律引入具身智能,以互联网级视频数据驱动世界动作模型的通用化。
- GameWAM: A World Action Model for Video Games
- 赛道归属: 世界动作模型 / 游戏智能体 / 视频游戏动态建模
- 核心创新点: 首次将世界动作模型(WAM)框架系统性地拓展至视频游戏领域,提出GameWAM。其核心创新在于统一了两类此前相互割裂的研究范式——"视觉-动作直接映射的游戏智能体"与"基于动作输入预测视觉未来的交互式游戏世界模型"——在单一模型中同时实现任务策略执行与世界动态建模。针对视频游戏特有的挑战(第一人称感知、快速视觉变化、持久世界状态、异构原生控制接口),设计了适配该场景的WAM架构,填补了WAM在开放式、高动态交互环境下应用的空白。
- SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
- 赛道归属: 自动驾驶 / 世界动作模型(World Action Model)/ 端到端驾驶推理优化
- 核心创新点: SimWAM 的核心突破在于将未来视频预测从推理时计算负担转化为训练时监督信号,彻底消除了现有WAM在测试阶段进行未来想象所带来的高昂计算开销。具体方法上,SimWAM 联合训练一个预训练视频专家模型与一个轻量级动作专家模型,采用联合流匹配(joint flow matching)框架统一两者的训练目标;同时设计了隔离注意力掩码(isolated attention mask)机制,使动作预测分支在前向推理时完全独立于未来帧信息,从而在保留视频动态先验迁移收益的同时,实现推理阶段的高效轻量化部署。
GitHub
- [2026-09-01] OpenMOSS/Awesome-WAM ⭐1360
- [2026-09-01] DravenALG/awesome-vla-wam ⭐997
- [2026-08-30] robbyant-research/Zero-WAM ⭐234
- [2026-08-27] H-EmbodVis/SimWAM ⭐163
- [2026-08-31] hustvl/FasterWAM ⭐54
由 Research Daily 自动生成 生成时间: 2026-09-02 05:31:39