AI 每日进展速报 - 2026-08-28
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- The Plan, Not the Decoder: Diagnosing and Repairing Compositional Failure in Reasoning-Augmented Text-to-Image Generation
- 赛道归属: 文生图 / 组合式生成 / 推理增强生成诊断与修复
- 核心创新点: 该工作针对推理增强型文生图模型(如 GoT-R1)的组合生成失败问题,提出了一种故障定位与修复框架,核心创新在于将生成失败的根因分离为两个独立环节:规划阶段(文本计划/布局生成) 与 解码阶段(图像渲染忠实度)。由于模型在生成图像前会输出包含对象名称、属性和边界框的结构化文本计划,该计划具有机器可读性,可在解码前被独立检查和编辑。研究者通过交换边界框等干预实验验证了计划与解码的可分离性,从而精确诊断出组合失败究竟源于"规划错误"还是"解码不忠实",并在此基础上提出针对性的修复策略。这一方法论突破为推理增强型生成模型的可解释性分析和定向优化提供了新范式。
- RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing 🆕NEW
- 赛道归属: 图像生成/编辑 · 奖励模型与对齐
- 核心创新点: 提出 RubricRM,一种基于动态评分标准(Rubric)的生成式奖励建模框架。与现有视觉奖励模型依赖单一标量分数或固定评估维度不同,RubricRM 能够根据不同的输入指令动态生成评估维度(Rubric),再基于这些维度进行成对比较打分。这一设计使奖励模型同时具备可解释性和任务自适应性,能够针对文生图和指令驱动图像编辑等不同任务的差异化需求灵活调整评估标准,突破了固定准则在多样化任务场景下泛化能力不足的瓶颈。
- Swift-Image: Exploring the Performance Frontier of Compact Unified Image Generation Models
- 赛道归属: 文生图 / 图像编辑(统一生成与编辑)
- 核心创新点: Swift-Image 提出了一个紧凑型统一图像生成与编辑模型,核心突破在于:在有限计算预算下,通过系统性训练工程探索小参数量模型的性能上限。采用高效的 6B 参数单流 DiT 架构,并设计了渐进式训练流水线——从宽泛语义覆盖逐步演进至更高分辨率、更强视觉质量,同时统一支持文生图、单图编辑和多图编辑三类任务,在参数效率与任务统一性之间取得显著平衡。
- Zero-Shot Video Restoration and Enhancement with Text-to-Image Latent Diffusion Models and Multi-Modal References 🆕NEW
- 赛道归属: 视频修复与增强 · 零样本推理优化
- 核心创新点: 提出一种利用文生图(T2I)潜扩散模型实现零样本视频修复与增强的框架,核心创新在于双提示调优反演与采样(Dual Prompt Tuning Inversion and Sampling)机制。该机制在无需针对视频任务重新训练的前提下,通过多模态参考信息引导推理过程,有效解决了将图像修复扩散模型直接迁移至视频时产生严重时序闪烁(temporal flickering)的核心难题,在保持帧间时序一致性的同时显著降低推理时间,实现了T2I扩散模型向视频域的零样本泛化。
- Efficient Training with Foresight: Multi-Token Auxiliary Supervision for Autoregressive Image Generation
- 赛道归属: 自回归图像生成 / 推理优化与训练效率
- 核心创新点: 提出多令牌自回归(MTAR)统一训练框架,核心突破在于引入"多令牌辅助监督"机制——在训练阶段让模型同时预测未来多个token(前瞻性监督),而非传统的单步next-token prediction。这一设计从三个维度解决了传统AR训练的痛点:①通过多步前瞻缓解监督稀疏与短视问题;②通过辅助预测目标增强表征判别性;③通过稀疏化计算策略降低全序列密集计算带来的训练开销,在不改变推理架构的前提下显著提升训练效率与生成质量。
- Scalable Question-Centric Text-to-Image Evaluation: Reliable Ranking, Fine-Grained Diagnosis, and Cost-Aware Routing
- 赛道归属: 文生图评估与基准测试
- 核心创新点: 提出以"问题为中心"(Question-Centric)的文生图评估框架 QC-T2I-Bench,核心突破在于三个层面:①将开放式提示词分解为细粒度可归因的问题单元,实现更精准的失败诊断,而非简单回归到提示词级别的总分;②区分基础需求与组合需求的评分,揭示模型在简单属性绑定与复杂组合推理上的差异化表现;③引入成本感知路由机制,在评估精度与计算开销之间实现动态权衡,支持可扩展的大规模评估场景。整体框架将模型排名可靠性、细粒度诊断能力与评估效率统一在同一体系下,解决了现有基准评估归因模糊、复杂度忽视和成本不可控的三大痛点。
- OccluRank: Controllable Occlusion-Aware Layout-to-Image Generation by Adding Just an Ordinal Rank
- 赛道归属: 文生图 / 布局可控图像生成(Layout-to-Image Generation)
- 核心创新点: 针对边界框布局生成中无法表达实例遮挡顺序的问题,提出 OccluRank 框架,其核心创新在于仅引入一个轻量级的序数排名(Ordinal Rank)信号作为遮挡条件,即可在不依赖额外几何条件(如深度图、分割掩码)或复杂推理流程的前提下,实现对实例间遮挡关系的显式建模与可控生成。相比现有方法独立构建各实例表示后简单聚合的范式,OccluRank 通过排名信息驱动实例间遮挡依赖交互,以极低的条件复杂度实现了遮挡感知的布局到图像生成。
- WithEveryone: Unified Planning and Identity Grounding for Group Image Generation
- 赛道归属: 文生图 / 身份保持多人图像生成
- 核心创新点: WithEveryone 针对多人(最多10人)身份保持图像生成这一高难度场景,提出了统一的规划与身份定位框架。核心创新在于:将每个参考身份编码为独立的寻址令牌(addressed token),从而在生成过程中精确建立"参考身份→场景中特定人物→空间位置"的三元对应关系;同时针对多人场景下训练时多个噪声预测人脸之间难以建立对应关系的问题,设计了专门的身份损失对齐机制,有效解决了传统方法在人数增多时身份混淆与绑定失效的核心痛点。
- From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation
- 赛道归属: 文生图 / 通用图像生成 / 数据工程与能力协同
- 核心创新点: 提出以"能力为中心"的数据基础设施设计范式,核心创新在于打破传统各任务数据集孤立优化的惯例,转而对生成能力之间的依赖关系进行显式建模,并据此构建能力协同演化的数据组织体系。具体而言,该框架将异构监督信号按能力依赖图进行结构化耦合,使不同生成能力(如构图、细节、语义对齐等)在数据层面相互增强而非相互干扰,从数据工程角度为通用图像生成模型提供了系统性的能力协同提升路径。
- Instruction-Based Video Editing by Repurposing an Image Editing Model
- 赛道归属: 视频编辑 / 指令驱动视频编辑
- 核心创新点: 提出一种无需视频扩散主干的视频编辑新范式,核心创新在于将图像编辑模型(Qwen-Image-Edit)直接复用于视频编辑任务。关键技术突破是将视频VAE潜空间中的多帧latent以"瓦片拼接"方式排列为一张大型虚拟图像,从而将时序视频编辑问题转化为单张大图的图像编辑问题,完全绕开了对视频扩散Transformer进行高成本适配微调的需求。该方法以极低的迁移代价实现了跨模态能力复用,为图像编辑模型赋能视频编辑提供了简洁高效的技术路径。
GitHub
- [2026-08-28] pydantic/pydantic-ai ⭐19543
- [2026-08-28] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13296
- [2026-08-28] alfredxw/denova ⭐659
- [2026-08-28] yuji-hatakeyama/opencode-gpt-imagegen ⭐73
- [2026-08-28] franksong2702/dsh-codex-connect ⭐60 🆕NEW
HuggingFace Datasets
- [2026-08-25] inclusionAI/ConceptEdit-12M 🆕NEW
视频生成/编辑
arXiv
- Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair
- 赛道归属: 视频生成(身份保持文生视频)
- 核心创新点: 针对闭源商业视频生成模型无法通过参数优化改进的局限性,提出了一种基于智能体增强(Agentic Enhancement)与语义修复(Semantic Repair)的免训练框架。核心方法论突破在于:将视频生成过程拆解为多智能体协作流水线,通过语义层面的自动检测与修复机制,在不访问模型权重的前提下,解决身份漂移(identity drift)、指令跟随不完整以及复杂提示下视觉细节缺失等问题,实现对黑盒生成模型的外部增强与质量提升。
- CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation 🆕NEW
- 赛道归属: 文生视频 / 评测基准
- 核心创新点: 提出首个专门评估文生视频模型文化理解能力的综合基准 CultureVidBench,突破现有基准仅关注感知质量、物理合理性和文本对齐的局限,系统性地引入文化特定对象、动作、仪式、可见文字及音频线索等多维度文化评估指标,填补了T2V模型跨文化表征能力评测的空白。
- EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing
- 赛道归属: 视频生成与编辑(统一框架)
- 核心创新点: EditStream 提出了一个基于 DiT(Diffusion Transformer)的统一自回归框架,将文生视频(T2V)、图生视频(I2V)、视频转视频(V2V)等多种视频创作与编辑任务整合进单一模型。其核心方法突破在于:①通过灵活的任务特定条件机制(task-specific conditioning)实现多任务统一建模,无需为每类任务维护独立模型;②将扩散模型转化为少步自回归流式推理模型(few-step autoregressive streaming),大幅提升生成效率,支持交互式实时视频流式输出,兼顾生成质量与推理速度。
- TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models 🆕NEW
- 赛道归属: 视频生成 / 安全攻防
- 核心创新点: 针对图生视频(I2V)模型提出"时序越狱攻击"(TempJail)新范式,揭示了视频生成模型在时间维度上独有的安全漏洞——有害内容可以不出现在单帧中,而是通过跨帧时序演化隐蔽地涌现。研究构建了三种攻击场景,突破了现有安全研究仅聚焦单帧违规的局限,将攻击面从空间域扩展至时间域。
- RECAP-Forcing: Retaining Content Appearances for Long Video Generation 🆕NEW
- 赛道归属: 视频生成 / 长视频生成
- 核心创新点: 提出 RECAP-Forcing 方法,颠覆了长视频自回归生成中以"时间顺序"组织记忆的传统范式,改为以"外观新颖性"为核心组织记忆。通过识别并优先保留视频中出现的新主体、对象和场景的关键帧,而非简单保留最近帧,从而在有限注意力窗口内更有效地维持长视频中内容外观的一致性。
- Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation 🆕NEW
- 赛道归属: 多模态音视频生成 / 安全评测基准
- 核心创新点: 提出 Multi2AV-Safety 基准,专门针对多模态条件(文本、图像、音频、视频联合输入)驱动的音视频生成场景的安全评估。核心创新在于识别并量化"跨模态交互涌现风险"——有害内容可能不存在于任何单一输入模态中,而是由多个看似无害的条件跨模态、跨时间协同作用后涌现,突破了现有以单一提示词为中心的安全评测框架。
- StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation 🆕NEW
- 赛道归属: 流式音视频生成 / 评测基准
- 核心创新点: 提出首个专为流式音视频生成设计的综合评测基准 StreamAV-Bench,填补了现有基准仅能评估完整序列、无法捕捉流式生成特性的空白。创新性地构建统一评估框架,涵盖渐进式生成轨道(指令跟随的持续生成)和实时交互轨道,从延迟、一致性、实时响应等流式特有维度对模型进行系统评估。
- Surgical Video Generation From Diffusion to World Models: A Survey 🆕NEW
- 赛道归属: 视频生成 / 医疗手术场景 / 综述
- 核心创新点: 系统梳理手术视频生成领域从扩散模型到世界模型的技术演进脉络,提出清晰的概念框架以整合该领域快速发展但缺乏统一认知的研究成果。核心价值在于将手术视频生成定位为解决临床数据稀缺、隐私限制和类别不平衡问题的变革性方法,并系统归纳其在手术仿真、培训和机器人策略学习中的应用路径,为领域研究提供结构化参考。
- TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation
- 赛道归属: 视频生成(文本到视频+音频联合生成 / 推理加速)
- 核心创新点: 针对大规模(19B参数)文本到视频-音频(T2VA)联合生成模型的推理加速问题,提出TurboT2VA蒸馏与推理框架。核心技术突破在于:通过评分正则化一致性蒸馏(Score-Regularized Consistency Distillation)解决大规模多模态联合模型蒸馏中的三大挑战——视频与音频模态间优化不平衡、大规模连续时间一致性训练困难、以及蒸馏后生成质量下降问题,从而在显著减少采样步骤的同时保持视频与音频的高质量同步生成。
- VGI-BENCH: Probing Visual Intelligence in Video Generation Models
- 赛道归属: 视频生成 / 评测基准
- 核心创新点: 提出 VGI-Bench 评测框架,专门用于探测视频生成模型中的视觉智能能力。核心创新在于针对现有评测体系的三大缺陷进行系统性修正:①输入设计与当前视频模型的视觉先验对齐,避免分布偏移导致的评测失真;②要求模型生成合理的动态演化过程而非仅输出可信的最终帧,从而真正考察时序推理能力;③通过难度校准确保任务既具挑战性又部分可解,避免天花板/地板效应。基准涵盖 27 个任务、810 个实例,构建了一套系统化的零样本视觉推理评测体系,为衡量视频生成模型的视觉智能边界提供了可靠的量化工具。
GitHub
- [2026-08-28] hao-ai-lab/FastVideo ⭐4088
- [2026-08-28] ZeroLu/awesome-seedance ⭐2343
- [2026-08-28] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1907
- [2026-08-28] thu-ml/Causal-Forcing ⭐937
- [2026-08-28] Winn1y/Awesome-Human-Motion-Video-Generation ⭐342
HuggingFace Spaces
音频生成
arXiv
- EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis
- 赛道归属: 情感语音合成(Emotional Text-to-Speech)
- 核心创新点: 针对现有情感TTS系统仅支持单一静态情感标签/嵌入的局限性,提出EmoTra-TTS框架,核心突破在于实现句内(Intra-Utterance)连续情感动态过渡。该方法摒弃了传统"一句一情感"的离散建模范式,转而在单条语音合成过程中对情感状态进行时序连续建模,使情感能够在毫秒级时间尺度上自然地上升、衰减与转变,从而与心理学研究中情感作为连续动态过程的本质规律对齐,同时保持对情感轨迹的显式可控性——这一点也弥补了LLM-based TTS系统虽能隐式变化韵律但缺乏精确情感控制的不足。
- X2Streaming-TTS: Causal Token-Level Text-to-Speech from Streaming Text with Speech-State Inheritance
- 赛道归属: 文本转语音(TTS)/ 流式语音合成
- 核心创新点: 提出了真正意义上的token级流式TTS框架X2Streaming-TTS,核心突破在于:(1)引入语音状态继承(Speech-State Inheritance)机制,通过跨片段传递隐状态,在有界上下文窗口内维持无界流式生成的感知连续性,解决了传统方法因上下文截断导致的语音断裂问题;(2)采用因果架构,无需访问未来输入即可对异步到达的文本token实时生成语音,从根本上区别于等待句子级完整文本的"伪流式"方案,显著降低端到端延迟。
- Vagdhenu: A Vrutta (Meter) Aware Shloka-to-Chant (TTS) System for Sanskrit 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 梵语吟诵合成
- 核心创新点: 针对梵语颂诗(Shloka)的吟诵合成任务,提出了一套专用前端处理流水线,核心突破在于:①通过卡纳达语正字法路由规避了梵文天城体(Devanagari)在印地语TTS模型中常见的"schwa删除"问题,从而保留梵语发音的完整性;②引入韵律(Vrutta/Meter)感知机制,使合成语音能够忠实还原传统吟诵(Parayana)的节律特征。整体方案以现成的流匹配(Flow-Matching)TTS骨干网络和大规模神经声码器为基础,重点贡献在于领域适配的前端工程设计,而非新架构提出。
- Poly-InstructTTS: Learning In-the-Wild Expressive Speech Synthesis from Open-Ended Instructions
- 赛道归属: 文本转语音(TTS)/ 可控表达语音合成
- 核心创新点: 提出了一套基于开放式自然语言指令控制语音表达的端到端框架。核心突破在于:①构建了一个可扩展的多模态数据流水线,从野外视听数据中自动标注生成覆盖1000+细粒度情感与风格的千小时指令语料库;②设计了无需提示词的GPT模型,结合基于属性的链式思维(attribute-based thinking)机制,将开放式自然语言指令解析为结构化的语音属性控制信号,从而实现对细粒度表达的精准可控合成,突破了传统TTS在指令跟随能力上的瓶颈。
- CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents
- 赛道归属: 文本转语音(TTS)/ 零样本语音合成
- 核心创新点: CuteTTS 提出了一种基于连续潜变量自回归建模的高效高质量语音合成框架。核心突破在于:设计了一种紧凑的低码率连续潜变量序列表示,在保留充分声学细节的同时降低自回归预测的序列长度;同时针对扩散采样和无分类器引导在每个自回归步骤中带来的高推理开销问题,提出了优化方案,在流式低延迟场景下实现了保真度与推理效率的平衡,适用于交互式助手、个性化媒体等实时应用场景。
- Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS
- 赛道归属: 文本转语音(TTS)/ 流式零样本语音合成
- 核心创新点: 提出了一种将预训练自回归TTS解码器迁移为块扩散(Block Diffusion)解码器的高效微调方案,实现块内并行token生成与块间流式输出的兼顾。核心技术突破在于:针对离散语音token长尾分布导致并行位置选择偏向高频token、从而引发质量退化的问题,提出了先验校准(Prior Calibration)机制,在不依赖额外架构改动的前提下修正采样偏差,显著提升了块扩散解码在零样本TTS场景下的生成质量,同时保持了低延迟流式推理能力。
- MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech
- 赛道归属: 文本转语音(TTS)评测基准 / 多语言语音生成
- 核心创新点: 提出 MINT-Bench,一个面向指令跟随型 TTS 的多语言综合评测基准。核心创新在于构建了分层多轴分类体系(hierarchical multi-axis taxonomy),将语音控制能力细化为多个可独立评估的维度,并配套设计了可扩展的多阶段数据构建流水线,从根本上解决了现有 TTS 评测中覆盖范围有限、诊断粒度粗糙、多语言支持不足三大核心缺陷,为指令跟随型语音生成模型提供了系统性、高诊断价值的评估框架。
- Scaling phoneme-based TTS augmentation for ASR: A unified pipeline and controlled study 🆕NEW
- 赛道归属: 语音合成(TTS)增强自动语音识别(ASR)/ 数据增强
- 核心创新点: 提出了一套统一的基于音素的TTS-to-ASR数据增强流水线,核心创新体现在以下几点:①从零训练了一个以F5-TTS架构为骨干、支持语言ID条件控制的多语言TTS模型,实现跨语言统一建模;②系统性地整合了语言特定的字素转音素(G2P)转换、参考语音过滤、候选文本选择及合成数据量控制等关键环节,形成端到端可控的增强流程;③通过受控实验定量分析了参考语音质量、文本选择策略及合成数据规模对ASR性能提升的独立影响,为TTS增强ASR的最佳实践提供了系统性实证依据。
- TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation
- 赛道归属: 视频生成(文本到视频+音频联合生成 / 推理加速)
- 核心创新点: 针对大规模(19B参数)文本到视频-音频(T2VA)联合生成模型的推理加速问题,提出TurboT2VA蒸馏与推理框架。核心技术突破在于:通过评分正则化一致性蒸馏(Score-Regularized Consistency Distillation)解决大规模多模态联合模型蒸馏中的三大挑战——视频与音频模态间优化不平衡、大规模连续时间一致性训练困难、以及蒸馏后生成质量下降问题,从而在显著减少采样步骤的同时保持视频与音频的高质量同步生成。
- MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models
- 赛道归属: 音频理解与评测 / 大型音频语言模型基准测试
- 核心创新点: 提出MRMAD基准,专门针对大型音频语言模型(LALMs)在音频质量退化感知方面的评估能力进行系统性测量。现有基准主要聚焦语义理解和事件识别,忽视了模型对音频信号退化(如噪声、压缩失真、混响等)的推理能力。MRMAD通过多轮对话、多音频对比的设计范式,构建了一套专门考察模型能否识别和推理音频质量差异的评测体系,填补了该领域的评估空白。
GitHub
- [2026-08-28] huggingface/diffusers ⭐34395
- [2026-08-27] SamurAIGPT/Generative-Media-Skills ⭐4175
- [2026-08-27] OpenMOSS/MOVA ⭐1105
- [2026-08-28] xiaomi-research/controlfoley ⭐147
- [2026-08-28] dgrauet/ltx-2-mlx ⭐104
HuggingFace Models
- Lightricks/LTX-2.5 🆕NEW
HuggingFace Datasets
- [2026-08-01] saidutta69/fable-5-premium
语言大模型
arXiv
- LLM as Detector: An In-context Learning Approach for Tabular Anomaly Detection
- 赛道归属: 表格数据异常检测 / LLM上下文学习应用
- 核心创新点: 提出LLM-Detector框架,突破性地将LLM的上下文学习(In-Context Learning)能力引入表格异常检测任务。与以往依赖几何距离、重建误差或需要微调LLM的方法不同,该框架通过结构化的提示条件化评分合成(prompt-conditioned scoring synthesis),无需微调即可利用LLM对跨特征依赖关系的理解来识别异常,从根本上解决了表格异常往往源于特征间关联违反而非单一特征边际偏差的核心难题。
- Improving LLM Interpretability with User-Centric Chain-of-Thought Reasoning 🆕NEW
- 赛道归属: LLM可解释性 / 推理链优化
- 核心创新点: 提出以用户为中心的思维链(Chain-of-Thought)设计范式,核心突破在于将推理轨迹的优化目标从"提升模型性能"转向"提升人类可读性与可检验性"。通过基于自我一致性(self-consistency)的结构化推理轨迹设计,使中间推理步骤更符合人类认知习惯,从而在保持模型能力的同时增强人机协作中的可信度与透明度。
- Investigating the Interplay between Contextual and Parametric Chain-of-Thought Faithfulness under Optimization
- 赛道归属: 推理可解释性 / 思维链(CoT)忠实性优化
- 核心创新点: 提出FaithMATE统一偏好对齐框架,首次将"上下文忠实性"(通过扰动输入或CoT轨迹衡量)与"参数忠实性"(通过干预模型参数知识衡量)这两种长期割裂的CoT忠实性评估范式纳入同一优化界面,实现联合建模与分析。核心突破在于从描述性比较升级为可优化的统一接口,系统性地揭示两类忠实性指标在优化过程中的相互作用与内在权衡关系。
- Persona-Execution Separation: An Architecture Pattern for Evolving LLM Agents under Execution Audit 🆕NEW
- 赛道归属: LLM Agent架构设计 / 企业级AI治理
- 核心创新点: 提出"人格-执行分离"(Persona-Execution Separation, PES)架构模式,核心创新在于将LLM Agent的"人格层"(指令、语气、自我呈现)与"执行层"(有状态、可审计的操作)置于不同信任域中,通过受治理的契约桥接(governed contract bridge)连接两者。该架构允许人格层自由演化而不影响执行层的可追溯性,解决了受监管组织中Agent灵活性与合规审计之间的根本矛盾。
- DSA: Evidence-Aware LLM-Agent Orchestration for Multi-Market Stock Research 🆕NEW
- 赛道归属: LLM Agent应用 / 金融智能分析
- 核心创新点: 提出DSA证据感知编排框架,核心创新在于将多市场股票研究工作流分解为"证据获取→结构化上下文构建→模型路由分析→可选精炼"的流水线,并引入证据可用性感知机制(显式暴露数据缺失与模型能力边界),以及模型路由策略(根据任务类型动态分配不同LLM),有效控制生成观点对最终报告的影响权重,提升金融研究报告的可靠性与可控性。
- JudgeStealer: Extracting LLM Judging Capabilities across Evaluation Protocols 🆕NEW
- 赛道归属: LLM安全 / 模型窃取攻击
- 核心创新点: 提出首个专门针对LLM裁判(LLM-as-Judge)能力的模型提取攻击框架JudgeStealer,核心突破在于:(1)针对评判任务的特殊性设计查询高效策略,在受限查询预算下最大化提取效果;(2)支持多种评估协议(如点式评分、成对比较等)的统一提取,填补了现有模型提取方法不针对评判场景的空白,揭示了LLM裁判作为知识产权面临的安全威胁。
- Evaluating human and LLM screening workflows in a conceptually complex scoping review: Recall--workload trade-offs and run-to-run consistency 🆕NEW
- 赛道归属: LLM应用评估 / 文献综述自动化
- 核心创新点: 在一项预注册的对照研究中,系统比较了人工与LLM在概念复杂型范围综述中的标题摘要筛选工作流,核心贡献在于量化分析了"召回率-工作量权衡"与"多次运行一致性"两个关键维度。通过七次完整LLM筛选运行与人工多层级筛选的对比,揭示了LLM在假阴性风险和运行间一致性方面的实际表现,为证据综合场景下LLM辅助筛选的可靠性提供了实证基准。
- PLCBench: Can Autonomous LLM Agents Turn PLC Access into Sustained Physical Impact? 🆕NEW
- 赛道归属: LLM安全 / 工业控制系统攻击评估
- 核心创新点: 提出PLCBench基准,首次系统评估自主LLM Agent将PLC(可编程逻辑控制器)网络访问权限转化为"持续物理影响"的能力。核心创新在于将评估终点从传统的"软件漏洞利用成功"延伸至"持续物理后果",构建了覆盖完整攻击链(网络访问→PLC操控→物理影响维持)的评测体系,填补了现有评估仅关注数字任务或单一攻击阶段的空白。
- AI Control Scientist: LLM-driven Agentic System for Automated Control Design 🆕NEW
- 赛道归属: LLM Agent应用 / 自动化控制系统设计
- 核心创新点: 提出AI Control Scientist(AICS),首个由LLM驱动的自动化控制器设计Agent,核心突破在于将自然语言设计需求直接映射为优化后的控制器参数,取代传统依赖专家知识和手动参数调优的工作流。通过LLM Agent协调控制理论知识、仿真环境交互与迭代优化,实现从需求描述到可部署控制器的端到端自动化,显著提升工业控制设计的效率与可扩展性。
- Benchmarking Clinical Decision Pathway Adherence in Large Language Models 🆕NEW
- 赛道归属: 医疗LLM评估 / 临床决策支持
- 核心创新点: 提出MEGA-CDP基准,核心创新在于将医疗LLM的评估维度从"最终答案准确性"扩展至"临床决策路径(CDP)的指南遵循度"。通过要求模型以提供的临床实践指南为参考生成完整决策路径,并对路径中每一步骤的指南符合性进行细粒度评估,填补了现有医疗基准无法衡量模型是否遵循规范化诊疗流程的关键空白,对高风险医疗AI应用的安全性评估具有重要意义。
GitHub
- [2026-08-28] sgl-project/sglang ⭐32594
- [2026-08-28] NVIDIA/TensorRT-LLM ⭐14490
- [2026-08-28] google-ai-edge/LiteRT-LM ⭐6303 🆕NEW
- [2026-08-28] thu-pacman/chitu ⭐2997 🆕NEW
- [2026-08-28] flagos-ai/FlagGems ⭐1084 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-08-20] openbmb/Ultra-FineWeb-L1
多模态大模型
arXiv
- VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models
- 赛道归属: 多模态理解 / 长视频理解
- 核心创新点: 提出递归套索自改进(Recursive Harness Self-Improvement, RSI)框架,在冻结视觉语言模型参数的前提下,专注于优化视频上下文构建过程本身。核心突破在于将上下文构建程序(context-construction harness)作为独立优化目标,通过递归自改进机制迭代提升可执行上下文的质量,从而在不修改底层模型权重的情况下显著提升长视频理解性能。这一方法将上下文构建与模型能力解耦,揭示了仅通过改进推理时的信息组织策略所能带来的性能上限。
- CODE: Cross-Modal Calibration and Dynamic Suppression for Open World Object Detection 🆕NEW
- 赛道归属: 多模态理解 / 开放世界目标检测
- 核心创新点: 针对开放世界目标检测(OWOD)中多模态基础模型存在的两大核心问题——单向文本到视觉匹配导致的语义歧义,以及刚性异常值惩罚对未知类目标的过度抑制——提出 CODE 框架。该框架在推理阶段引入三个互补模块:①跨模态联合置信度校准,通过注入全局视觉原型来修正文本驱动的置信度偏差,实现视觉与语言特征的双向对齐;②动态抑制机制,自适应调整已知类决策边界附近未知目标的抑制强度,避免对潜在未知类的误压制;③两者协同构成统一的推理时框架,无需重新训练即可部署于现有多模态检测模型之上。其方法论突破在于将跨模态校准与动态边界抑制解耦并联合优化,在不修改模型权重的前提下同时提升已知类检测精度与未知类召回能力。
- Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces
- 赛道归属: 多模态理解 / 生成设计界面评估
- 核心创新点: 针对生成设计界面中语义控制的一致性问题,提出对6个主流VLM进行系统性审计的方法框架。核心创新在于引入"感性工学(Kansei)"形容词对作为评估维度,通过对无纹理3D物体的情感属性排序任务,量化不同VLM在产品形态情感表征上的跨模型一致性差异,揭示当前VLM在主观语义概念(如"优雅""简约")编码上的分歧程度,为生成设计界面的语义控制可靠性提供实证依据。
- Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
- 赛道归属: 多模态理解 / 视频指令跟随评测
- 核心创新点: 提出Video-IFBench评测基准,专门针对多模态大语言模型在视频理解场景下的指令遵循能力进行系统评估。核心创新在于将评测维度从传统的"任务准确率"扩展至"指令adherence",构建包含多样化用户自定义约束的评测集,填补了现有视频理解基准忽视指令遵循能力评估的空白,为衡量MLLM在真实复杂指令下的视频理解能力提供了新的标准化评测框架。
- Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding
- 赛道归属: 多模态理解 / 长视频理解
- 核心创新点: 针对长视频理解中无关时序内容干扰问题,提出基于在策略自蒸馏(On-Policy Self-Distillation)的视觉输入聚焦方法。核心创新在于:通过实证发现将视觉输入聚焦于包含关键证据的短时间片段可显著提升问答性能,进而设计自蒸馏训练机制,使模型在无需人工标注线索区间的情况下,自主学习"应该关注哪里"的能力,从而在推理阶段动态定位关键时序片段,有效缓解长视频中冗余内容对模型注意力的干扰。
- PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control
- 赛道归属: 具身智能 / 机器人控制 / 多模态推理
- 核心创新点: 提出PonderPounce框架,创新性地将预训练多模态大语言模型(MLLM)的原生因果上下文窗口直接复用为机器人的情节记忆(episode memory),而非为机器人策略专门设计历史记忆机制。其中"Ponder"模块作为System 2慢思考引擎,在执行过程中持续积累视觉历史并进行推理;"Pounce"模块则基于Ponder输出的语义摘要执行快速动作决策。核心突破在于无需额外设计记忆模块,直接利用MLLM天然具备的长上下文整合与少样本推理能力来处理部分可观测环境下的机器人控制问题,实现了预训练语言模型上下文能力向机器人领域的零改造迁移。
- SAVER: Selective Auditing of Verbal Evidence for Error Recovery in VLM Change Reasoning
- 赛道归属: 多模态理解 / 视觉变化推理
- 核心创新点: 提出SAVER方法,核心洞察在于:正确的VLM输出通常包含支持其结论的显式语言证据(如物体名称、颜色、空间位置),而错误输出往往缺乏此类证据。基于此,SAVER设计了一套轻量级、基于规则的后处理机制,通过解析VLM响应中的语言证据来判断输出可信度,并在检测到证据缺失时触发错误恢复流程,无需重新训练模型即可提升视觉变化推理的准确性。
- Vision-Language Models for Occupational Physical Exposure Assessment: Estimating External Hand Forces in Manual Material Handling Tasks from RGB Video
- 赛道归属: 多模态理解 / 视觉语言模型垂直应用(职业健康)
- 核心创新点: 将VLM应用于职业生物力学分析领域,构建了一套从普通RGB视频估计双手三轴动态外力的流水线。核心创新在于将任务特定的文本提示、视觉表征与已知物体质量信息融合,绕过了传统方法依赖传感器仪器的限制,实现了非侵入式、连续的手部受力估计,为职业伤害风险评估提供了低成本的视觉化解决方案。
- Text-Anchored Semantic Perturbations for Transferable Jailbreak Attacks on Multimodal Large Language Models
- 赛道归属: 多模态大模型安全 / 对抗攻击(越狱攻击)
- 核心创新点: 提出TA-SPA(文本锚定语义扰动攻击)框架,针对MLLM安全对齐在跨模态融合表征层面的薄弱环节。核心创新在于以文本语义空间为锚点,优化图像侧的对抗扰动,使其在跨模态融合后能够有效绕过安全对齐机制。该方法以黑盒方式运行,生成的扰动具备较强的跨模型迁移性,揭示了"文本空间安全对齐无法可靠迁移至多模态融合表征"这一根本性安全漏洞。
- Learning to Look Again: Loss-Gap Supervision for Free-form Crop Routing in Vision-Language Models
- 赛道归属: 多模态理解 / 视觉语言模型推理效率优化
- 核心创新点: 提出GapSight框架,模拟人类"二次审视"的阅读行为,实现自适应的视觉细节感知。核心创新在于引入"Loss-Gap监督"机制:VLM先进行低分辨率全局浏览,再根据全局视图与精细视图之间的损失差距(loss gap)作为监督信号,学习将有限的高分辨率视觉Token动态路由至最需要细节的图像区域,而非均匀分配计算资源,从而在不牺牲全局上下文理解的前提下,高效解决细节敏感型问题(如OCR、文档理解)。
GitHub
- [2026-08-27] Blaizzy/mlx-vlm ⭐5431
- [2026-08-28] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1828
- [2026-08-27] mala-lab/Awesome-Anomaly-Detection-Foundation-Models ⭐212
- [2026-08-27] hustvl/InfiniteVL ⭐113 🆕NEW
- [2026-08-23] filliptm/Video-Caption-Suite ⭐82
强化学习
arXiv
- MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning
- 赛道归属: 多模态理解 / 检索增强生成(RAG)
- 核心创新点: 提出 MCite-RL 框架,将强化学习引入多模态 RAG 的视觉引用生成任务。核心突破在于通过"引用增强的智能体强化学习"机制,将引用准确性与答案生成质量联合优化,解决了传统 SFT 方法中视觉引用与生成内容解耦、跨模态推理不稳定的问题,实现了引用与答案之间更强的一致性与可追溯性。
- rl-triton: High-Performance Triton GPU Kernels for Reinforcement Learning Credit Assignment
- 赛道归属: 强化学习基础设施 / GPU内核优化
- 核心创新点: 提出统一的关联扫描(Associative Scan)框架,将GAE、V-Trace、Retrace(λ)、TD(λ)等七种主流RL信用分配算法统一抽象为一阶线性递推问题,并通过Triton实现O(log T)并行复杂度的GPU内核。核心突破在于以单一算法框架替代七种独立实现,同时利用GPU并行扫描原语大幅提升时序序列计算效率,为RL训练中的回报估计环节提供高性能开源基础设施。
- Reinforcement Learning-Based Control of CAV Platoon Joining Maneuvers in Mixed Traffic 🆕NEW
- 赛道归属: 强化学习 / 自动驾驶与交通控制
- 核心创新点: 提出了一套针对混合交通场景下CAV(网联自动驾驶车辆)车队汇入机动的通用建模与仿真框架。核心创新在于将强化学习引入车队汇入控制问题,同时系统性地解决了实际部署中的安全约束与学习效率两大瓶颈——通过构建异构驾驶行为的仿真环境,使RL智能体能够在不确定性和多样化交通参与者共存的真实场景中完成安全、高效的车队汇入决策。
- Simple Actors and Deep Critics for Scalable Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习 / 离线强化学习与策略优化
- 核心创新点: 重新审视离线Actor-Critic方法中模型容量的分配策略,提出"简单Actor + 深度Critic"的非对称架构范式。核心突破在于:摒弃扩散模型、流匹配等计算代价高昂的生成式Actor,转而将大容量集中投入Critic网络——由于Critic仅在训练阶段使用,这一设计在不牺牲策略表达能力的前提下,大幅降低了推理部署时的计算开销,实现了离线RL的高效可扩展性。
- Active Curriculum Refinement for Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习 / 课程学习与训练效率优化
- 核心创新点: 提出PATH框架,将课程学习与主动学习相结合,显式建模环境间的先决条件关系为有向无环图(DAG)。核心创新体现在两个层面:一是通过采样多样化课程路径主动扩展覆盖范围,避免训练陷入局部子图;二是基于智能体当前学习状态对课程图进行动态精化,优先选择最具信息增益的训练环境节点,从而在结构化课程空间中实现更高效、更系统的强化学习训练。
- Simulating Cognitive Smart Freight Corridors with Agent-Based Models and Reinforcement Learning
- 赛道归属: 多智能体强化学习 / 智能交通仿真
- 核心创新点: 提出了一个将物理基础设施层、V2X连接层与决策层深度耦合的智能货运走廊仿真框架。核心突破在于将强化学习(RL)与多智能体强化学习(MARL)嵌入基于智能体的建模(ABM)系统中,使每个货运智能体能够自适应地学习驾驶与协调策略,突破了传统方法依赖预定义控制策略、无法捕捉动态自适应行为的局限,为CAV在货运场景中的大规模部署提供了低成本的认知仿真实验平台。
- Towards Reliable, Generalizable, and Specific In-Context Knowledge Editing via Multi-Objective Reinforcement Learning
- 赛道归属: 大语言模型后训练 / 知识编辑
- 核心创新点: 针对上下文知识编辑(In-Context Knowledge Editing)中可靠性、泛化性与特异性难以同时满足的三难困境,提出基于多目标强化学习(Multi-Objective RL)的提示构建优化方法。核心创新在于将知识编辑的三项关键指标(可靠性、泛化性、特异性)统一建模为多目标奖励信号,通过RL动态优化检索与提示组装策略,取代固定检索规则,使黑盒LLM在无需参数更新的前提下实现更精准、更鲁棒的知识注入。
- Demystifying Reinforcement Learning Post-Training of Language Models
- 赛道归属: 大语言模型后训练 / 推理优化
- 核心创新点: 系统性地拆解并揭示了RL后训练(尤其是基于可验证奖励的RLVR)作用于LLM的内在机制,打破"黑盒"认知。核心贡献在于通过逐步隔离RL流程中各组件(奖励设计、策略更新、采样机制等)进行消融分析,厘清了哪些模块真正驱动了数学推理、代码生成等能力的提升,为研究者提供了可复现、可解释的RL后训练原理性框架,对后续算法设计具有重要指导价值。
- SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents
- 赛道归属: 强化学习 / LLM智能体 / 技能学习与知识复用
- 核心创新点: 提出SkillForge框架,突破了现有技能库"只增不减"的局限。核心创新在于引入技能验证与进化机制:通过可验证的方式持续评估技能库中已有技能的有效性,淘汰失效技能并动态更新,使技能库能够跨episode积累、精炼和复用高质量可验证技能,而非简单地追加原始轨迹提取的技能片段。
- WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation
- 赛道归属: 强化学习 / 离策略RL / 大规模并行仿真训练
- 核心创新点: 针对大规模并行仿真带来的高吞吐量数据环境,系统性地重新审视了离策略RL中各类稳定化组件(参数归一化、Clipped Double-Q、经验回放加权策略等)的适用边界。核心发现是这些稳定器具有"数据制度依赖性"——在数据充足的高并发场景下,原本为数据稀缺设计的稳定机制反而会限制值函数拟合能力。在此基础上提出WarpSAC,通过自适应地放宽或调整这些组件,实现了可扩展离策略RL在大规模仿真环境下的性能突破。
GitHub
- [2026-08-27] huggingface/trl ⭐19163
- [2026-08-27] OpenPipe/ART ⭐10671
- [2026-08-28] kubernetes-sigs/agent-sandbox ⭐3664
- [2026-08-28] radixark/miles ⭐2272
- [2026-08-28] Amey-Thakur/OPTIMIZING-STOCK-TRADING-STRATEGY-WITH-REINFORCEMENT-LEARNING ⭐57 🆕NEW
HuggingFace Datasets
- [2026-08-23] hamzabagirsakci/turkish-court-decisions
世界动作模型
arXiv
- Making Latent Evolution Explicit: Operator-Structured Transitions for World Action Models 🆕NEW
- 赛道归属: 世界动作模型 / 机器人策略学习 / 潜空间动态建模
- 核心创新点: 针对现有基于Transformer的潜空间状态转移预测器存在的结构性缺陷(其归纳偏置聚焦于token间交互而非时序演化),提出了一种算子结构化的潜空间转移机制(Operator-Structured Transitions)。核心突破在于将潜空间中的状态转移过程显式化——通过引入具有明确时序演化归纳偏置的算子结构,替代通用Transformer预测器,使潜在状态的演化路径在结构层面得到显式约束与表达,从而提升世界动作模型在任务相关场景状态预测上的精度与可控性。
- 4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting
- 赛道归属: 世界动作模型 / 4D场景表示与预测
- 核心创新点: 提出基于4D高斯散射(4DGS)的以物体为中心的世界动作模型(WAM),核心突破在于将动态物体与静态背景解耦建模,摒弃传统WAM在2D视觉数据上操作的范式。通过显式4DGS表示在三维空间中对场景进行结构化建模,避免了对冗余背景内容的重复处理,同时解决了点云在多视角对齐与累积上的困难。该方法将过去的观测与未来的预测通过统一的4D时空表示桥接,赋予模型对单个物体的显式空间结构感知能力,从而在保持高视觉质量的同时提升了场景理解的几何精确性与可操控性。
- GeoWAM: Visual Geometry World Action Models for Autonomous Driving
- 赛道归属: 自动驾驶 / 世界动作模型(World Action Model)/ 几何感知视频生成与轨迹预测
- 核心创新点: GeoWAM 的核心突破在于将世界动作模型的建模空间从像素域迁移至视觉几何域。传统WAM在像素空间学习场景动态,导致几何、运动与外观、纹理、光照相互耦合,表征效率低下。GeoWAM 提出以几何结构(如深度图、点云或几何特征)作为场景演化的主要建模对象,将未来帧预测与自车轨迹预测统一在几何表示空间中,从而实现对场景动态更直接、更紧凑的建模,降低了外观变化对运动与几何推理的干扰,提升了动作预测的精度与泛化能力。
- ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation
- 赛道归属: 具身智能 / 视觉-语言-动作模型(VLA)/ 机器人操控
- 核心创新点: 提出 ForeTime-VLA 框架,核心突破在于因果未来Token蒸馏机制:以冻结的 Fast-WAM 衍生教师模型为知识源,将其未来感知的动作等价表征蒸馏进轻量级 pi0.5 策略网络,使学生策略在推理阶段无需显式生成未来帧或运行视频级教师模型,即可具备对接触事件的预判能力。该方法专门针对传送带上运动物体操控场景,解决了传统 VLA 仅依赖当前观测、缺乏前瞻性动态建模的痛点,同时规避了 WAM 在部署时的高计算开销。
- RISE: Adaptive Imagination for World Action Models
- 赛道归属: 具身智能 / 世界动作模型(WAM)/ 自适应规划推理优化
- 核心创新点: 提出 RISE(基于选择性展开的自适应想象)框架,核心突破在于动态想象预算分配机制:针对现有 WAM 对所有场景均分配固定想象步数的低效问题,引入一个轻量级潜空间评估器(Latent Evaluator),在每个规划步骤实时估计继续展开的预期收益(风险-收益权衡),并做出 Roll/Stop 的二元决策,从而实现按需、自适应地终止或延续想象过程。该方法将想象计算资源集中分配给真正需要长程预测的复杂场景,在保持规划质量的同时显著降低系统级推理开销。
- GameWAM: A World Action Model for Video Games 🆕NEW
- 赛道归属: 世界动作模型 / 游戏智能体 / 视频游戏动态建模
- 核心创新点: 首次将世界动作模型(WAM)框架系统性地拓展至视频游戏领域,提出GameWAM。其核心创新在于统一了两类此前相互割裂的研究范式——"视觉-动作直接映射的游戏智能体"与"基于动作输入预测视觉未来的交互式游戏世界模型"——在单一模型中同时实现任务策略执行与世界动态建模。针对视频游戏特有的挑战(第一人称感知、快速视觉变化、持久世界状态、异构原生控制接口),设计了适配该场景的WAM架构,填补了WAM在开放式、高动态交互环境下应用的空白。
- SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
- 赛道归属: 自动驾驶 / 世界动作模型(World Action Model)/ 端到端驾驶推理优化
- 核心创新点: SimWAM 的核心突破在于将未来视频预测从推理时计算负担转化为训练时监督信号,彻底消除了现有WAM在测试阶段进行未来想象所带来的高昂计算开销。具体方法上,SimWAM 联合训练一个预训练视频专家模型与一个轻量级动作专家模型,采用联合流匹配(joint flow matching)框架统一两者的训练目标;同时设计了隔离注意力掩码(isolated attention mask)机制,使动作预测分支在前向推理时完全独立于未来帧信息,从而在保留视频动态先验迁移收益的同时,实现推理阶段的高效轻量化部署。
- BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving
- 赛道归属: 自动驾驶 / 世界动作模型 / 端到端规划
- 核心创新点: 针对现有端到端驾驶方法要么侧重语义推理(VLA模型)、要么侧重预测动态(世界动作模型)的单一性缺陷,BrainWAM 提出了一种在动作空间层面协同融合语义先验与预测动态的统一规划框架。其核心突破在于:不在特征空间或输出空间进行简单融合,而是在动作空间中实现 VLM 语义约束与生成式世界模型预测能力的协调对齐,从而同时获得语义合理性与未来感知能力,解决了两类方法难以兼容的根本矛盾。
GitHub
- [2026-08-26] OpenMOSS/Awesome-WAM ⭐1342
- [2026-08-24] world-action-models/awesome-world-action-models ⭐315
- [2026-08-23] geyan21/flex-pi ⭐162
- [2026-08-27] H-EmbodVis/SimWAM ⭐160
- [2026-08-27] robbyant-research/Zero-WAM ⭐103 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-08-28 05:31:57