AI 每日进展速报 - 2026-08-18
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- Nexus: Structured Synergy for Efficient Text-to-Image Generation using Rectified Flow Model 🆕NEW
- 赛道归属: 文生图 / 推理优化
- 核心创新点: 提出 Nexus 框架,将三种正交优化技术协同整合到整流流(Rectified Flow)文生图模型中:① 混合专家(MoE)前馈层降低计算冗余;② 门控 DeltaNet 线性复杂度注意力机制替代传统二次复杂度自注意力;③ 基于专家粒度的低比特量化训练。三者联合优化而非独立叠加,实现了计算量、内存占用与生成质量的协同提升,尤其面向高分辨率合成与边缘端部署场景。
- Concept Guidance: Precise, Training-Free Latent Control for Text-to-Image Generation
- 赛道归属: 文生图 / 推理优化(无训练潜空间控制)
- 核心创新点: 提出"概念互信息"(concept-wise mutual information)这一新颖度量,用于在无需额外训练的前提下,在扩散模型的潜空间中定位与特定概念(如美学质量、手部结构、文字渲染)高度相关的方向。通过该方向实现连续、精细的概念级引导,突破了传统文生图模型缺乏内在概念控制机制的局限,同时提升了局部高一致性任务(如生成文字、人手)的可靠性。
- On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation
- 赛道归属: 文生图 / 多语言评测与跨语言一致性分析
- 核心创新点: 提出 LingT2I 基准测试集,覆盖 10 种主流语言、33K 条提示词,系统性地评估多语言文生图模型在内容生成与文字渲染两个维度上的跨语言一致性差异。核心突破在于首次将跨语言效应(cross-lingual effects)作为独立研究维度引入文生图评测体系,填补了现有研究过度聚焦英语场景的空白,为揭示语言特异性偏差提供了标准化分析框架。
- In-Loop Model Adaptation with Coupled Latent-Noise Guidance for High-Fidelity Subject-Driven Text-to-Image Generation
- 赛道归属: 文生图 / 主体驱动个性化生成(Subject-Driven Text-to-Image Generation)
- 核心创新点: 提出"循环内模型自适应"(In-Loop Model Adaptation)机制,结合"耦合潜变量-噪声引导"(Coupled Latent-Noise Guidance)策略,使扩散模型在推理阶段即可针对不同参考图像的主体外观进行动态适配,无需为每个主体单独微调模型。核心突破在于将参考图像的视觉信息通过潜变量与噪声的联合引导注入生成过程,从而在保持文本语义灵活性的同时,实现对主体身份的高保真一致性维护。
- Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation
- 赛道归属: 文生图(艺术风格控制与生成)
- 核心创新点: 提出 Atelier 框架,核心突破在于识别并规避图像生成模型对艺术家名称的"捷径依赖"问题(如模型倾向于复现艺术家的标志性符号、通用色调而非用户真实意图)。框架将模糊的艺术意图显式分解为独立的"控制状态",将艺术家风格属性(构图、笔触、色彩等)与场景语义解耦,从而实现更忠实于用户意图的艺术家风格引导生成,而非简单的风格标签映射。
- Introspective Attention Modulation for Safe Text-to-Image Generation
- 赛道归属: 文生图 / 安全内容生成与推理时干预
- 核心创新点: 提出基于推理时内省式注意力调制(Introspective Attention Modulation)的安全生成方法,通过在推理阶段动态监控并干预模型内部注意力动态来抑制不安全内容生成,而非依赖概念擦除、提示过滤或分类器门控等易被绕过的外部防护手段。核心突破在于将安全机制内化至模型的注意力机制层面,使其对参数高效微调(PEFT)等常见绕过攻击具备更强的鲁棒性,实现了无需修改模型权重的原则性安全控制范式。
- MathGen: Revealing the Illusion of Mathematical Competence through Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图 / 多模态理解与评估
- 核心创新点: 提出 MathGen 基准,专门评估文生图模型在数学可视化场景下的能力。核心洞察在于:将数学解题能力从"文本输出"迁移到"视觉渲染输出"时,模型面临精确几何构造、符号布局和图表正确性等全新挑战。通过系统性测试揭示了当前生成模型在数学视觉表达上存在的能力幻觉,为该方向提供了标准化评测框架。
- Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision 🆕NEW
- 赛道归属: 图像编辑
- 核心创新点: 针对图像编辑训练范式中两大固有缺陷进行突破:① 构建包含超过 1,000 个细粒度编辑概念的层级化分类体系,解决现有方法对编辑概念粒度关注不足的问题;② 构建大规模数据集 ConceptEdit-12M,通过密集监督信号替代稀疏监督,从根本上提升训练效率。该方法将概念粒度控制与数据密度优化同步引入编辑训练流程,形成系统性改进。
- GenRouter: Unified Workflow Routing for Agentic Image Generation 🆕NEW
- 赛道归属: 文生图 / 智能体工作流 / 推理优化
- 核心创新点: 提出 GenRouter,首个面向智能体图像生成的统一工作流路由框架。核心创新在于打破现有智能体工作流"孤岛式、固定拓扑"的局限,通过动态路由机制根据用户请求的复杂程度自适应选择最合适的工作流(如知识检索、迭代推理等),避免对简单任务过度调用重型流程,从而在满足复杂需求的同时显著降低计算开销。
- PoseAdapter: Dual-Stream 2.5D Controllable Image Generation for Complex Multi-Object Scenes 🆕NEW
- 赛道归属: 可控图像生成 / 多目标场景
- 核心创新点: 提出 PoseAdapter 双流 2.5D 可控生成框架,核心创新在于以轻量级 2.5D 表示(而非昂贵的密集 3D 点云/深度图)精确编码多目标场景中每个物体的空间位置与朝向信息。双流架构将姿态控制信号与外观语义信号解耦处理,有效解决了多目标场景中属性泄漏(attribute leakage)和"剪切粘贴"伪影两大顽固问题,在控制精度与计算代价之间取得更优平衡。
GitHub
- [2026-08-18] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13223
- [2026-08-18] Hunyuan-PromptEnhancer/PromptEnhancer ⭐3754 🆕NEW
- [2026-08-18] alfredxw/denova ⭐625
- [2026-08-18] renoir1220/esse ⭐101 🆕NEW
- [2026-08-18] yuji-hatakeyama/opencode-gpt-imagegen ⭐70
HuggingFace Models
视频生成/编辑
arXiv
- MLLM-Guided Semantic Correction for Text-to-Video Generation 🆕NEW
- 赛道归属: 视频生成 / 语义纠错
- 核心创新点: 提出一种训练无关的语义纠错框架,在视频扩散模型的采样过程中引入多模态大语言模型(MLLM)作为语义监督器,在去噪中间步骤动态检测语义偏差(如缺失对象、属性错误、动作不匹配),并通过梯度引导或注意力调制在生成过程中实时纠正,填补了"生成中"语义修正的研究空白,区别于已有的采样前优化或采样后精修方案。
- Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization
- 赛道归属: 视频生成(空间可控文生视频)
- 核心创新点: 针对扩散Transformer文生视频模型中空间可控生成依赖梯度优化导致计算开销巨大的问题,提出一种推理阶段无梯度优化方法。核心突破在于完全绕开反向传播,通过无梯度策略在推理时实现对象空间位置的精确控制,在保持生成质量的同时大幅降低计算成本,尤其适配现代大规模架构。
- Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation 🆕NEW
- 赛道归属: 视频生成 / 实时交互式长视频生成
- 核心创新点: 提出首个支持实时交互的长视频生成系统,核心创新在于:(1)用户可在生成过程中随时切换文本提示并即时生效,实现真正的交互式控制;(2)设计有界多尺度记忆机制(bounded multi-scale memory),跨分块保持主体、场景和风格的一致性,支持小时级超长视频滚动生成而无明显质量退化;(3)同时支持文生视频、图生视频及视频续写多种模态,并兼容多语言提示。
- PersonaShot: Benchmarking Person-Centric Narrative Continuity in Multi-Shot Video Generation 🆕NEW
- 赛道归属: 视频生成 / 多镜头叙事评测基准
- 核心创新点: 构建首个专注于"以人物为中心的叙事连贯性"的多镜头视频生成评测基准 PersonaShot,核心创新在于:(1)将评测维度细化为跨镜头的物理状态连贯性、面部动态一致性和电影镜头关系三个独立维度,而非笼统的外观相似度;(2)为每个维度设计专属的自动化评估方法,解决现有基准无法区分维度的问题;(3)系统揭示当前多镜头生成模型在叙事连续性上的具体短板,为后续研究提供精细化评测标准。
- SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation 🆕NEW
- 赛道归属: 视频生成 / 推理加速与注意力蒸馏
- 核心创新点: 针对视频扩散Transformer中自注意力的二次方计算瓶颈,提出SQuad亚二次注意力蒸馏方法,核心创新在于:(1)以预训练的全精度Softmax注意力为教师,通过知识蒸馏将线性或低秩注意力代理训练至与教师输出高度对齐,弥补现有线性注意力在视频生成质量上的显著差距;(2)蒸馏过程无需重新训练整个视频生成模型,仅针对注意力模块进行替换,具有良好的即插即用性;(3)在保持生成质量的同时将注意力计算复杂度从 O(n²) 降至 O(n) 或 O(nk),显著提升长视频和高分辨率视频的生成效率。
- KeyID: Decoupled Drafting and Keyframe Editing for Identity-Preserving Video Generation 🆕NEW
- 赛道归属: 视频生成 / 身份保持视频生成
- 核心创新点: 提出KeyID训练无关的身份保持视频生成框架,核心创新在于将"视频动态合成"与"身份注入"解耦为两个独立阶段:(1)草稿阶段:先生成忽略身份约束的动态草稿视频,专注于动作和时序连贯性;(2)关键帧编辑阶段:仅对关键帧进行身份特征注入与精修,再通过插帧传播至全序列。这种解耦设计避免了身份约束与运动生成之间的相互干扰,在复杂长序列动作下实现更严格的身份一致性,同时无需任何微调或额外训练成本。
- FlowDance: Music-Driven Dance Video Generation with Parallel Pose and RGB Streams 🆕NEW
- 赛道归属: 视频生成 / 音乐驱动舞蹈视频合成
- 核心创新点: 提出FlowDance框架,核心创新在于采用并行双流架构同时处理姿态流(Pose Stream)和RGB视觉流(RGB Stream):(1)姿态流负责从音乐信号中学习音乐-动作对应关系,生成显式的骨骼/姿态序列,提供精确的运动先验;(2)RGB流以参考人物图像为条件进行身份保持的视觉合成,并以姿态流输出为结构引导;(3)两流并行设计使音乐驱动的运动建模与外观保持的视频渲染相互解耦又协同优化,同时解决音乐-动作对齐、身份一致性、时序连贯性和视觉真实感四大挑战。
- Equilibrium Forcing: Adaptive Video Generation Without Noise Conditioning 🆕NEW
- 赛道归属: 视频生成 / 扩散模型训练与采样框架
- 核心创新点: 提出均衡强迫(Equilibrium Forcing, EqF)框架,彻底去除扩散/流匹配模型对噪声水平条件化的依赖,核心创新在于:(1)将去噪场的学习与采样调度完全解耦,模型训练时无需感知当前噪声级别,实现模块化的训练与推理设计;(2)推理时采样过程可自适应地根据数据特性动态调整,不再受固定噪声调度表的约束,提升生成灵活性;(3)为自回归视频生成提供了一种更简洁的理论框架,简化了标准扩散模型的训练目标设计,同时保持或提升生成质量。
- Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation
- 赛道归属: 视频生成
- 核心创新点: 针对现有视频生成方法将多模态大语言模型(MLLM)仅作为冻结特征编码器的局限性,系统性地研究了MLLM与扩散Transformer(DiT)的融合架构设计。核心突破在于将MLLM从被动的文本条件提供者升级为主动的语义规划生成器,通过系统性消融实验探索不同融合策略(如特征注入方式、交互深度、语义对齐机制等),揭示了MLLM在视频生成中承担高层语义规划角色的有效路径,填补了混合架构在视频生成领域的研究空白。
- SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense
- 赛道归属: 视频生成安全防御 / 文生视频对抗攻击防护
- 核心创新点: 针对文生视频模型的越狱攻击防御问题,提出了一种基于交叉注意力特征空间的轻量级防御机制 SafeCA。核心创新在于:系统性地分析并揭示了正常样本与越狱样本在交叉注意力特征空间中的本质差异,据此设计了精准的跨注意力定位与调控策略,在无需对输入进行过滤或重建的前提下直接在模型内部特征层面实施干预,从而在大幅降低计算延迟的同时有效避免了语义失真问题,实现了高效且语义保真的越狱防御。
GitHub
- [2026-08-18] Anil-matcha/Open-Generative-AI ⭐26584 🆕NEW
- [2026-08-18] ZeroLu/awesome-seedance ⭐2298 🆕NEW
- [2026-08-18] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1862
- [2026-08-17] tetherto/qvac ⭐423 🆕NEW
- [2026-08-18] Rimagination/h3lite ⭐219 🆕NEW
音频生成
arXiv
- Iterative Self-Learning for Expressive Text-to-Speech Synthesis 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 表达性语音合成
- 核心创新点: 提出了一种迭代自学习(Iterative Self-Learning)半监督框架,专门解决表达性TTS中显式条件标签(如情感、风格标签)难以大规模获取的瓶颈问题。核心方法是利用少量已标注数据训练初始模型,再通过模型自身对大量无标注语音数据进行伪标签预测,并将高置信度的伪标签样本迭代地纳入训练集,循环优化模型。与现有半监督TTS方法不同,该工作不针对语音-文本配对数据稀缺问题,而是首次专门针对表达性属性标签稀缺这一特定瓶颈设计半监督方案,在保持标签可解释性和直接控制能力的同时,大幅降低了人工标注成本。
- ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
- 赛道归属: 视频生成配音 / 视频转音频生成(Video-to-Audio Generation)
- 核心创新点: ControlFoley 提出了一个统一的多模态视频转音频生成框架,核心突破在于跨模态冲突处理机制:当视觉内容与文本描述存在语义冲突时,通过专门设计的冲突感知模块实现鲁棒的文本可控性,而非简单地让视觉信号主导生成。此外,针对参考音频中时序信息与音色信息相互纠缠导致风格控制不精准的问题,提出了解耦时序与音色表征的方法,实现细粒度的风格化控制。同时,该工作还构建了标准化评测基准,填补了该领域系统性评估体系的空白。
- VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents
- 赛道归属: 语音合成 / 实时对话语音生成(TTS for Interactive Agents)
- 核心创新点: 提出 VoiceChat-TTS,一种面向交互式对话场景的低延迟连续语音合成模型。其核心突破在于将传统多阶段流水线(ASR → 语言模型 → TTS)整合为统一的流式合成框架,在保持高保真语音质量的同时,支持实时用户打断(barge-in)等双工交互能力,解决了现有语音语言模型在延迟、中断处理与合成质量三者之间难以兼顾的核心矛盾。
- VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching
- 赛道归属: 文本生成音频 / 声音合成(Text-to-Audio Generation / Vocalized Audio Synthesis)
- 核心创新点: VoxAudio 针对"语音嵌入环境音景"这一复合音频合成任务,提出了基于因果自回归流匹配(Causal Autoregressive Flow Matching)的统一生成框架,核心突破在于:摒弃了传统"TTS独立生成后混音"的两阶段流水线,将可理解语音与环境声在同一模型内联合生成,从而天然保留了语音出现时机与场景声学交互的一致性。进一步引入多奖励训练机制,通过多维度奖励信号(如语音可懂度、音景真实性等)对自回归生成过程进行强化优化,解决了单一目标训练下语音清晰度与环境声质量难以兼顾的核心矛盾。
- Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder
- 赛道归属: 语音合成(Text-to-Speech / 跨语言零样本语音克隆)
- 核心创新点: 提出无需参考音频转录文本(Transcript-Free)的跨语言零样本TTS系统。核心突破在于引入可学习的说话人编码器(Learnable Speaker Encoder),使系统能够直接从未标注的野生参考音频中提取说话人特征,彻底消除推理阶段对音频文本对齐的依赖。这一设计使得跨语言语音克隆(如用中文参考音频合成英文语音)成为可能,同时支持14种语言的多语言场景,显著拓宽了零样本TTS在真实世界中的适用边界。
- Luna-TTS Family Technical Report
- 赛道归属: 语音合成(Text-to-Speech / 扩散语言模型语音生成)
- 核心创新点: 针对主流自回归(AR)Codec语言模型在TTS中存在的延迟随句长增长、前缀误差累积、RVQ token网格生成顺序不自然等固有缺陷,提出基于扩散语言模型(Diffusion Language Model)的TTS系统家族Luna-TTS。核心方法突破在于以扩散过程替代自回归解码,实现对RVQ token的非顺序并行生成,从根本上解耦生成顺序与语音时序的绑定关系。系统在中、英、日、韩四语言共100万小时语音数据上预训练,并通过渐进式构建策略形成模型家族,在保持高质量合成的同时大幅降低推理延迟。
- ASR-Roundtrip Evaluation Can Mask Context- and Convention-Dependent Reading Errors in Chinese News TTS
- 赛道归属: 文本转语音(TTS)评估方法
- 核心创新点: 该工作揭示了ASR往返评估(ASR-Roundtrip Evaluation)在中文新闻TTS场景下存在系统性盲区——当TTS模型对依赖上下文或领域惯例的文本(如体育比分、机型编号、技术单位、会员名称等)产生语义错误的发音时,ASR系统仍能将错误音频反向转录为"表面正确"的文本,从而掩盖真实的朗读错误,导致评估指标虚高。核心方法突破在于:系统性地构建了一套上下文依赖型和惯例依赖型的中文TTS测试用例集,通过对比Raw TTS输出与目标读音,量化揭示ASR往返评估的假阴性率,并提出以人工感知评估或针对性规则校正作为补充手段,从而为TTS可懂度评估体系的可靠性提供了重要的方法论警示与修正方向。
- Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions
- 赛道归属: 文本转语音(TTS)评估 / 语音质量评测
- 核心创新点: 将TTS评估中笼统的"自然度"概念解构为10个具有语言学依据的感知维度(如韵律、发音、流畅度等),并基于此构建了首个维度级TTS元评估基准。核心突破在于系统性地揭示了现有MOS预测器和Audio-LLM评判器在细粒度感知维度上的能力边界与盲区,为TTS评估方法的改进提供了可量化的诊断框架。
- MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation
- 赛道归属: 文本生成音乐(Text-to-Music Generation)/ 可控音乐生成
- 核心创新点: 提出MusicLayout,一种显式的音乐结构中间表示,将音乐生成过程解耦为"结构规划"与"音频生成"两阶段。MusicLayout以时间对齐的方式描述段落、音色、重复和变奏等结构元素,使得音乐的宏观组织在音频生成前即可被检查、修改和精确控制。核心突破在于将隐式的全局文本提示转化为可解释、可编辑的显式结构布局,填补了文生音乐领域结构级可控性的空白。
- CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents
- 赛道归属: 文本转语音(TTS)/ 零样本语音合成 / 流式推理优化
- 核心创新点: 提出CuteTTS,通过对连续潜变量进行自回归建模实现高效高质量语音合成。核心创新在于:设计了低码率且保留足够声学细节的连续潜空间序列,并针对流式场景优化推理效率,避免了扩散模型多步迭代采样和无分类器引导带来的高延迟问题,在紧凑流式系统与高保真合成之间取得平衡。
GitHub
- [2026-08-18] huggingface/diffusers ⭐34331
- [2026-08-15] SamurAIGPT/Generative-Media-Skills ⭐4083
- [2026-08-14] OpenMOSS/MOVA ⭐1097
- [2026-08-17] BinWang28/audio-ai-hub ⭐950
- [2026-08-17] dgrauet/ltx-2-mlx ⭐97
HuggingFace Models
HuggingFace Datasets
- [2026-08-01] saidutta69/fable-5-premium 🆕NEW
语言大模型
arXiv
- Large language models reorganize representational geometry during in-context learning
- 赛道归属: 大语言模型机制解释 / 上下文学习(In-Context Learning)
- 核心创新点: 提出利用LLM预训练表征几何结构来预测上下文学习(ICL)效果的新视角。核心发现是:LLM在ICL过程中会主动重组内部表征几何,将任务相关类别的表征从预训练空间中分离并重新排列,且这种重组程度与ICL性能高度相关。该工作首次将"表征几何可重组性"作为衡量任务是否可被有效上下文学习的预测指标,为理解ICL的内在机制提供了新的几何学解释框架。
- When Chain-of-Thought Helps and When It Hurts: An Empirical Investigation of the Serial-Depth Bottleneck in LLM Reasoning
- 赛道归属: 推理优化 / Chain-of-Thought 机制分析
- 核心创新点: 通过"串行深度瓶颈"(Serial-Depth Bottleneck)理论框架,系统性地揭示了CoT并非对所有任务普遍有益的规律。核心突破在于将H_dp带宽界限理论与实证实验相结合,识别出CoT在哪类任务(需要超出Transformer单次前向传播计算深度的串行推理)中有效,而在哪类任务(可在单次前向传播内完成的并行/浅层推理)中反而有害,从架构层面给出了CoT适用边界的解释性框架。
- Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
- 赛道归属: 多模态理解 / OCR与场景文字识别
- 核心创新点: 提出了一种无需外部OCR引擎、无需推理时提供OCR文本或边界框的多语言OCR感知后训练框架。核心突破在于通过视觉-文本联合微调与提示引导的思维链(Chain-of-Thought)推理机制,将OCR能力内化到通用多模态大语言模型中,使模型在处理小字、退化文本、复杂排版及手写体等真实场景时具备更强的视觉文本定位能力,实现了端到端的多语言场景文字理解,避免了传统级联管道的误差累积问题。
- Listwise Cross-Encoder Fine-Tuning vs. Agentic Instruction Tuning for LLM Rerankers: A Systematic Study in Medical Procedure Reranking
- 赛道归属: 信息检索 / LLM重排序(Reranking)/ 医疗领域NLP
- 核心创新点: 针对医疗保险场景下患者语言与临床术语之间存在巨大词汇鸿沟的问题,系统性对比了两种重排序范式:(1)基于列表式学习排序目标(Listwise LTR)对小型交叉编码器进行微调,并探索不同层冻结配置;(2)以Qwen3-Reranker-4B为代表的指令微调大模型重排序器。该研究的创新在于将列表式交叉编码器微调与智能体式指令调优在真实生产任务中进行受控对比,揭示了两种范式在领域适配效率、计算成本与排序质量之间的权衡关系。
- The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes
- 赛道归属: 推理优化 / LLM推理综述与分类体系
- 核心创新点: 提出"LLM推理元素周期表"这一结构化分类框架,对300余篇论文按推理范式、方法机制、评估设置和失败模式四个维度进行系统组织。核心贡献在于构建了一套统一的分类体系,将CoT、数学推理、多跳问答、代码生成、RAG、工具使用、多模态决策等异构推理方向纳入同一结构化视图,并显式归纳了各类推理方法的失败模式,为该领域提供了系统性的知识图谱。
- Cached LLM Probability Retrieval for Speech Recognition 🆕NEW
- 赛道归属: 语音识别(ASR)与大语言模型融合优化
- 核心创新点: 提出"缓存LLM概率检索"机制,将LLM对ASR相关上下文-目标词对的下一词概率预测过程从在线推理阶段剥离,改为离线预计算并存储至本地缓存。在实际识别时通过缓存查找、回退策略及可选评分融合来替代实时LLM调用,从而在保留LLM语言先验优势的同时,大幅降低N-best假设重打分的计算开销,实现推理效率与识别精度的双重优化。
- Handover of In-Context Learning State Across Session Boundaries
- 赛道归属: 大模型上下文管理 / 多会话状态传递
- 核心创新点: 将跨会话任务延续问题形式化为"任务相对的上下文学习(ICL)状态迁移"框架,系统性地研究了在模型输入长度受限、应用重启或多智能体切换等场景下,如何从旧会话中提取并传递关键信息。核心突破在于将"会话交接"从工程实践问题提升为具有方法论基础的理论问题,明确区分了不同类型的ICL状态及其传递策略,为多会话LLM应用的连续性保障提供了系统化分析框架。
- Whose doctor does the AI recommend? An algorithm audit of reputation and demographic signals in large language model-assisted physician choice
- 赛道归属: LLM社会影响与算法审计 / 医疗推荐公平性
- 核心创新点: 采用预注册随机算法审计方法,对7个主流LLM(含开源与闭源模型)在医生推荐场景中的行为进行因果分析。核心创新在于将LLM定位为"算法中介"(AI infomediary),通过控制变量实验系统量化了声誉信号与人口统计学属性(如性别、种族)对推荐结果的因果影响,揭示了LLM在医疗选择场景中潜在的系统性偏见与可见性分配不均问题,为LLM公平性审计提供了可复现的实验范式。
- ATLAS: Discovering Agent Strategies through LLM-Guided Abstraction and Automata Learning
- 赛道归属: LLM智能体行为分析 / 自动机学习与策略发现
- 核心创新点: 提出ATLAS框架,将自动机学习(Automata Learning)与LLM引导的抽象机制相结合,从智能体执行轨迹中自动发现和提炼可解释的策略模型。核心突破在于突破了现有评估仅依赖任务成功率和执行日志的局限,通过构建有限状态自动机来表征智能体的决策策略,使软件测试、网络安全评估等复杂任务中LLM智能体的行为具备可解释性和可分析性。
- Rethinking Automated Program Repair: The Impact of Bug Complexity, Fault Localization, and LLM Cost-efficiency
- 赛道归属: 自动化程序修复(APR) / LLM代码能力评估
- 核心创新点: 对基于LLM的自动程序修复(APR)进行系统性实证分析,重点填补了现有研究忽视的四个维度:Bug复杂度对修复效果的影响、故障定位精度的作用、推理模式设置的差异以及修复的成本效益比。核心创新在于引入多维度交叉分析视角,量化了LLM推理成本与修复质量之间的权衡关系,为工业界选择LLM-APR方案提供了成本效率导向的决策依据。
GitHub
- [2026-08-18] sgl-project/sglang ⭐31988
- [2026-08-18] NVIDIA/TensorRT-LLM ⭐14400
- [2026-08-18] PaddlePaddle/PaddleFormers ⭐12988
- [2026-08-18] liruiw/GenSim ⭐354 🆕NEW
- [2026-08-18] Jacobinwwey/obsidian-NotEMD ⭐296
HuggingFace Models
HuggingFace Datasets
- [2025-07-11] HuggingFaceFW/fineweb
- [2026-08-17] HuggingFaceCode/stack-v3-train
多模态大模型
arXiv
- DataComp-VLM: Improved Open Datasets for Vision-Language Models
- 赛道归属: 多模态训练数据工程 / 视觉语言模型数据集构建
- 核心创新点: 提出 DataComp-VLM(DCVLM)基准框架,系统性地整合了涵盖图文对、多模态交错文档、纯文本及指令微调数据四种类型、共计160个数据集(规模达6T token级别)的超大规模语料库,并建立了以数据为中心的受控实验基准,填补了社区在VLM训练数据筛选策略系统性评估方面的空白,为数据配比、质量过滤等数据工程决策提供了可复现的对比框架。
- jina-vlm: Small Multilingual Vision Language Model 🆕NEW
- 赛道归属: 多模态理解 / 视觉语言模型(小型多语言VLM)
- 核心创新点: 提出2.4B参数的多语言视觉语言模型jina-vlm,核心技术创新在于:①将SigLIP2视觉编码器与Qwen3语言解码器耦合,采用图像分块(image tiling)与注意力池化(attention-pooling)实现任意分辨率图像的token高效处理;②通过系统性的"留一法"数据混合消融实验,定量分析不同训练数据类别对多语言VQA性能的贡献,为小规模VLM的数据配比优化提供了方法论参考。
- AlloEgo-VLM: Disambiguating Allocentric and Egocentric Reference Frames in Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 空间推理与具身AI感知
- 核心创新点: 针对VLM在空间语义理解中存在的参考系歧义问题(自我中心视角 vs. 异我中心视角),构建了专门的训练数据集与评测框架AlloEgo-VLM,核心突破在于:显式区分并建模自然语言空间描述中隐含的参考系类型,通过针对性的数据增强与微调策略,显著提升VLM在无明确参考系标注场景下的空间关系理解准确性,为具身机器人导航与操作提供更可靠的语言-空间对齐能力。
- PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models
- 赛道归属: 多模态理解 / 视觉语言模型评测与推理能力分析
- 核心创新点: 提出 PragMatch 对比评测框架,核心创新在于将"语用不一致性(pragmatic incongruity)"与"跨模态表面不匹配(cross-modal mismatch)"解耦,揭示现有大型视觉语言模型在多模态讽刺检测中依赖浅层关联(shortcut learning)而非真正理解语用关系的本质缺陷,为评估VLM深层跨模态推理能力提供了更精细的诊断工具。
- FZ-VLM: A Two Stage Florence-Zephyr Vision Language Model Framework for Pulmonary Nodule Characterization and Clinical Decision Making 🆕NEW
- 赛道归属: 多模态理解 / 医学影像分析与临床决策支持
- 核心创新点: 提出FZ-VLM两阶段框架,将Florence(视觉基础模型)与Zephyr(语言模型)级联用于肺结节特征描述与临床决策,核心创新在于:①两阶段解耦设计——第一阶段由Florence完成结节的视觉特征提取与定位,第二阶段由Zephyr将视觉特征转化为结构化临床报告;②针对CT影像的专科化适配,解决了通用VLM在放射科后检测工作流中对结节位置、边缘特征、衰减类型等多维属性联合描述能力不足的问题,有效降低观察者间差异。
- AnchorScore: A CLIP-Based Diagnostic of MLLM Annotation Difficulty 🆕NEW
- 赛道归属: 多模态理解 / MLLM评估与标注质量诊断
- 核心创新点: 提出AnchorScore,一种基于冻结CLIP模型的低成本诊断指标,用于在无需实际运行MLLM的前提下预测其在各类别上的标注难度。核心突破在于:利用CLIP的类内特征分散度与类间相似度构建难度代理信号,将原本需要14小时的MLLM评估压缩至约3分钟的CLIP前向推理,实现了对MLLM标注准确率的先验排序,为大规模自动化标注流程的质量控制提供了高效的预筛选机制。
- Remote-Sensing City Layout Extraction with MLLM 🆕NEW
- 赛道归属: 多模态理解 / 遥感图像解析与城市布局提取
- 核心创新点: 提出Code-as-City范式,将单张俯视遥感图像的城市布局提取重新定义为约束代码生成任务。核心创新在于:①以可执行代码而非检测框/语义掩码作为输出表示,使提取结果天然保留对象身份、类型化关系、拓扑结构与再生成规则;②采用MLLM作为代码生成器,由图像模型先提取视觉原语,再由语言模型将其组织为结构化城市布局代码,突破了传统遥感解析输出缺乏语义可操作性的局限。
- FloodReasonBench: Benchmarking VLM Reasoning Segmentation for Embodied Flood Response at the Edge 🆕NEW
- 赛道归属: 多模态理解 / 推理分割(Reasoning Segmentation)与具身边缘计算
- 核心创新点: 提出FloodReasonBench,首个面向洪灾响应场景的VLM推理分割基准,核心贡献在于:①聚焦边缘部署约束(计算资源受限)与灾害域特殊性(水体遮挡、非常规场景),填补了通用推理分割基准在安全关键领域的空白;②将任务语言请求到像素级视觉定位的端到端推理分割能力与具身智能体的实际响应需求相结合,为评估VLM在资源受限、高风险环境下的感知-推理联合能力提供了标准化测试床。
- VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding 🆕NEW
- 赛道归属: 多模态理解 / 视频理解基准与智能体评测
- 核心创新点: 提出VideoGAIA,一个面向通用人工智能助手的智能体式视频理解基准,核心创新在于:①针对Video-MME等现有基准已趋近饱和(顶级模型准确率约90%)的问题,引入多轮交互、工具调用等智能体任务范式,将评测维度从单轮视频问答扩展至需要规划、推理与外部工具协作的复杂视频理解任务;②通过设计需要跨时序推理、细粒度事件定位与多步决策的题目,有效拉开先进MLLM之间的能力差距,为下一代视频智能体的研发提供更具区分度的评测框架。
- On the Robustness of Temporal Vision-Language Models for Surgical Endoscopy Videos
- 赛道归属: 多模态理解 / 医疗视频鲁棒性评估
- 核心创新点: 系统性研究了时序视觉-语言模型(TVLM)在手术内窥镜视频场景下面对临床真实采集噪声(散焦、雾化、运动模糊、噪声、电刀烟雾、丢包等)时的鲁棒性。核心贡献在于构建了一套针对内窥镜视频的结构化分布偏移评估体系,量化了各类退化因素对视频-文本对齐能力的影响程度,填补了TVLM在医疗场景下鲁棒性系统评估的空白。
GitHub
- [2026-08-17] Blaizzy/mlx-vlm ⭐5355
- [2026-08-18] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1805
- [2026-08-18] mala-lab/Awesome-Anomaly-Detection-Foundation-Models ⭐212 🆕NEW
- [2026-08-17] ydyhello/Awesome-VLM-Streaming-Video ⭐194
- [2026-08-17] WJ-CV/VGGDrive ⭐104 🆕NEW
强化学习
arXiv
- IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents
- 赛道归属: 强化学习 / 战略对话智能体
- 核心创新点: 提出"孤立双边强化学习"(IB-RL)框架,核心突破在于将对话双方(智能体与对手)的策略训练过程相互隔离,分别独立优化,而非在动态交互中联合训练。这一设计有效解决了战略对话中因对手策略随智能体策略同步变化而导致的非平稳环境问题,使奖励信号更加稳定可靠,从而将传统RL在固定规则环境中的优势迁移至双边博弈场景。
- RL-Index: Reinforcement Learning for Retrieval Index Reasoning
- 赛道归属: 检索增强生成 / 知识检索优化
- 核心创新点: 将检索索引推理建模为强化学习问题,突破了传统方法仅在查询侧做推理的局限。RL-Index 在索引构建阶段引入 RL 机制,让知识语料库侧也具备推理语义表达能力,从而在不增加在线推理延迟的前提下,通过离线索引优化提升隐式推理场景(如共享定理、代码逻辑)下的检索精度。
- Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness
- 赛道归属: 强化学习理论 / 鲁棒性与安全性
- 核心创新点: 提出基于Infra-Bayesian框架的RL智能体,核心突破在于将传统贝叶斯RL对"固定环境"的假设替换为对抗性最坏情况假设,使智能体能够在模型类无法完整描述真实世界(non-realizable setting)的情况下仍保持鲁棒性。该方法通过对环境行为的"下确界"(infimum)进行推断而非期望推断,在与预测器、人类、其他AI智能体等自适应实体交互时,相比经典RL在最坏情况性能上取得显著优势,对AI安全场景具有直接意义。
- Scheduling Mixed RL Rollouts Beyond Prefix Locality
- 赛道归属: LLM强化学习后训练 / 推理系统调度优化
- 核心创新点: 针对LLM RL后训练中多类型rollout(RLVR、RLHF、Agentic)混合共存时KV-cache竞争导致效率低下的问题,提出超越前缀局部性(Prefix Locality)的混合调度策略。核心创新在于引入感知KV-cache容量压力的异构rollout会话调度机制,在保留前缀感知路由优势的同时,通过全局容量视角协调不同反馈范式的rollout负载,从系统层面提升整体训练吞吐量。
- Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View
- 赛道归属: 扩散模型对齐 / RL Post-Training
- 核心创新点: 提出统一的路径空间(Path-Space)视角,从理论上证明现有扩散模型 RL 算法中看似对立的两类方法——基于反向轨迹的离散化似然比方法与基于前向匹配的奖励标注噪声样本方法——本质上均源自同一路径空间正则化目标的不同近似形式。该统一框架不仅消除了算法碎片化问题,还为设计新型扩散模型 RL 对齐算法提供了系统性的理论指导原则。
- Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL
- 赛道归属: 智能体强化学习 / 训练环境自动生成
- 核心创新点: 提出 Envs-FORGE,一种将验证器奖励信号转化为逐种子环境合成动作的自适应提示策略。与 few-shot、Self-Instruct、Evol-Instruct 等对所有种子使用固定提示策略不同,Envs-FORGE 动态估计每个种子的当前策略通过率,并据此为每个种子定制化地生成难度适配(更难、更易或多样化)的可执行训练环境,实现了以前沿优化(Frontier-Optimized)为导向的课程式环境合成。
- Removing Temporal Note Redundancy Improves Multimodal Reinforcement Learning for Medicine
- 赛道归属: 医疗决策强化学习 / 多模态临床 RL
- 核心创新点: 针对机械通气序列决策任务,提出通过去除纵向临床文本笔记中的时序冗余信息来优化多模态 RL 状态空间的方法。核心创新在于识别并消除临床笔记在时间维度上的重复内容,使自由文本信息能够高效融入 RL 状态表示,在不引入过长上下文噪声的前提下补充结构化 EHR 数据所缺失的关键临床语境,从而提升 RL 策略在动态医疗场景下的决策质量。
- Reinforcement Learning-Based Production Scheduling in an Industry-Based Coating Scenario Using the Digital Model Playground
- 赛道归属: 工业生产调度 / 强化学习落地应用
- 核心创新点: 将 RL 调度方法从简化基准流程迁移至具有工业真实性的涂层生产场景,核心贡献在于引入"数字模型游乐场"(Digital Model Playground)作为仿真训练环境,同时处理序列相关换型时间、随机扰动和交货期约束三类工业级复杂约束的耦合问题,验证了 RL 在接近真实工业条件下的调度可行性与有效性,填补了学术研究与工业部署之间的落地鸿沟。
- RoutePack: Expert Placement and Attention-Aware Data Packing for MoE Reinforcement Learning
- 赛道归属: 强化学习系统优化 / MoE模型训练效率
- 核心创新点: RoutePack 针对混合专家(MoE)模型在强化学习训练中同时存在的两个负载均衡问题(序列组合决定的密集注意力计算 vs. Token路由决定的稀疏专家计算)提出了一套层次化联合优化框架。其核心突破在于:利用 RL rollout 阶段的"路由回放"机制,在训练步骤前预先获取每个样本的序列长度和逐层专家需求信息,从而将数据打包(Data Packing)与专家放置(Expert Placement)解耦为可预知的优化问题。具体而言,RoutePack 通过注意力感知的数据打包策略最小化跨 microbatch 的注意力计算不均衡,同时通过专家放置算法优化专家并行维度上的 token 分发均衡,实现两个瓶颈的协同消除,而非单独优化其中一个而将瓶颈转移至另一个。
- Learning Loco-Manipulation From SMPC Demonstrations With Sparse Offline-to-Online RL
- 赛道归属: 机器人强化学习 / 运动操作(Loco-Manipulation)
- 核心创新点: 提出了一种"稀疏离线到在线强化学习"框架,核心突破在于完全绕开了繁琐的密集奖励设计难题。具体方法是:以仿真环境中的基于采样的模型预测控制(SMPC)作为自动化专家,批量生成大规模离线演示数据集,从根本上解决了复杂任务中的探索瓶颈问题;随后利用该数据训练离线策略RL智能体,再通过在线微调完成策略迁移。相比传统方法,该方案将专家数据生成与奖励设计的人工成本大幅降低,实现了运动与操作一体化任务的高效扩展。
GitHub
- [2026-08-18] radixark/miles ⭐2021
- [2026-08-18] Tencent-Hunyuan/UniRL ⭐903
- [2026-08-18] TorchTrade/torchtrade ⭐415
- [2026-08-18] sony/nnabla-rl ⭐131 🆕NEW
- [2026-08-18] verl-project/verl-vla ⭐54 🆕NEW
HuggingFace Datasets
- [2023-05-26] Anthropic/hh-rlhf
- [2026-08-11] nvidia/Nemotron-RL-Agentic-Terminal-Pivot-v1
世界动作模型
arXiv
- Foresight Without Seeing: Latent Futures for World Action Models
- 赛道归属: 世界动作模型 / 机器人策略学习 / 视频预测与动作生成
- 核心创新点: 提出了一种"隐式未来"(Latent Future)范式,在显式未来WAM(需要迭代视频去噪,推理成本高)与直接策略WAM(无未来预测,缺乏场景演化建模)之间寻找中间路径。核心方法是将未来视觉预测压缩为紧凑的潜在表示,直接注入动作生成路径,从而在保留未来场景演化信息的同时,彻底规避了迭代视频去噪带来的高延迟问题。该方法实现了"无需显式看见未来帧"即可获得预见能力的推理效率与预测能力的双重兼顾。
- Keep the Future, Drop the Rollout: RIFT for World Action Models
- 赛道归属: 世界动作模型 / 机器人策略学习 / 推理加速与部署优化
- 核心创新点: 针对WAM在闭环部署中因迭代视频rollout导致高延迟的痛点,提出RIFT(Rollout-Independent Future Transfer)方法。通过系统性的闭环干预实验(在4个WAM模型、40个LIBERO任务上)验证了动作生成对未来缓存值(future-cache values)及其位置分配均存在显著敏感性,从而证明rollout轨迹的"内容"而非"生成过程"才是关键。RIFT的核心创新在于:将未来表示从完整rollout轨迹中解耦,仅保留未来表示而丢弃逐步展开的rollout过程,在不损失策略性能的前提下大幅降低部署延迟。
- Decoupling Intention from Trajectory: A Representational Deduction Framework for World Action Models
- 赛道归属: 世界动作模型 / 具身智能 / 运动规划
- 核心创新点: 提出了一种表征解耦框架(Representational Deduction Framework),将高层意图(Intention)与低层轨迹(Trajectory)在表征空间中显式分离。核心突破在于:现有视觉分支仅预测静态视觉观测,忽略了运动交互下世界状态演变的过渡信息,导致物理条件演化与动作轨迹生成之间产生表征纠缠。该框架通过解耦这两类信息,使视觉分支能够捕捉世界状态的动态转变过程,从而为动作规划提供更具语义层次的表征基础,实现意图理解与轨迹生成的协同优化。
- From World Models to World Action Models: A Concise Tutorial for Robotics
- 赛道归属: 世界模型 / 机器人学习 / 综述教程
- 核心创新点: 本文并非全面综述,而是以教程形式构建了一套统一的概念框架,明确区分"世界模型"与"世界动作模型"的定义边界及其在机器人AI系统中的角色定位。核心贡献在于提出了一个统一的比较视角,将 World Labs 空间智能模型、Yann LeCun 的 JEPA 等代表性方法纳入同一分析框架,帮助研究者系统性地理解不同范式之间的本质联系与差异,为该领域的概念标准化提供了基础性参考。
- SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
- 赛道归属: 世界动作模型 / 自动驾驶 / 端到端规划
- 核心创新点: 提出SimWAM,核心创新在于将视频生成能力仅作为训练信号而非推理时的必要组件,从而彻底消除推理阶段昂贵的未来帧生成开销。具体方法上:采用联合流匹配(Joint Flow Matching)协同训练预训练视频专家与轻量动作专家;引入隔离注意力掩码(Isolated Attention Mask)机制,使动作预测在结构上独立于未来帧,推理时可直接丢弃视频分支。该设计实现了"训练时借力视频动态先验、推理时轻量高效执行"的解耦范式,在保留视频预训练知识迁移优势的同时,大幅降低了部署成本。
- Diagnosing and Mitigating Perception-Decision Misalignment in Omni-LLMs via Modality Subspace Activation 🆕NEW
- 赛道归属: 多模态理解 / 自主智能体推理对齐
- 核心创新点: 该工作针对全模态大语言模型(Omni-LLMs)中普遍存在但被忽视的感知-决策错位(PDM)问题展开系统性研究。核心方法论突破体现在三个层面:①提出因果模态敏感性(CMS)形式化框架,从宏观行为层面的答案保留率(ARR)与微观表示层面的Logit角度差异(LAD)双视角量化感知与决策之间的不一致程度;②通过双镜头诊断框架揭示模型在多模态输入下决策路径对感知信号不忠实的根本机制;③提出模态子空间激活(Modality Subspace Activation)方法,通过在推理过程中显式激活与特定模态对应的表示子空间,从内部表示层面缓解跨模态信息在决策阶段的失真与丢失,而非依赖外部监督信号进行后处理修正。该方法对世界动作模型和自主智能体等需要高保真多模态推理的应用场景具有直接价值。
- BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving
- 赛道归属: 自动驾驶 / 世界动作模型 / 端到端规划
- 核心创新点: 针对现有端到端驾驶方法要么侧重语义推理(VLA模型)、要么侧重预测动态(世界动作模型)的单一性缺陷,BrainWAM 提出了一种在动作空间层面协同融合语义先验与预测动态的统一规划框架。其核心突破在于:不在特征空间或输出空间进行简单融合,而是在动作空间中实现 VLM 语义约束与生成式世界模型预测能力的协调对齐,从而同时获得语义合理性与未来感知能力,解决了两类方法难以兼容的根本矛盾。
GitHub
- [2026-08-14] OpenMOSS/Awesome-WAM ⭐1285
- [2026-08-15] Bariona/FACT ⭐77
- [2026-08-14] teee000/LiLa-WAM ⭐77
由 Research Daily 自动生成 生成时间: 2026-08-18 05:31:58