AI 每日进展速报 - 2026-08-10
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation
- 赛道归属: 文生图 / 扩散模型推理优化
- 核心创新点: 针对多模态扩散Transformer(MMDiT,如SD3、SD3.5、FLUX.1)中存在的"提示遗忘"现象(prompt forgetting)提出系统性分析与解决方案。研究发现,文本分支中的语义信息随网络深度增加而逐渐消退。为此,提出"提示重注入"(Prompt Reinjection)机制,在扩散Transformer的深层重新引入原始文本提示的语义表示,从而在不修改模型权重的前提下,有效缓解文本语义在去噪过程中的衰减问题,提升生成图像与文本描述的语义一致性。
- Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation 🆕NEW
- 赛道归属: 文生图(艺术风格控制与生成)
- 核心创新点: 提出 Atelier 框架,核心突破在于识别并规避图像生成模型对艺术家名称的"捷径依赖"问题(如模型倾向于复现艺术家的标志性符号、通用色调而非用户真实意图)。框架将模糊的艺术意图显式分解为独立的"控制状态",将艺术家风格属性(构图、笔触、色彩等)与场景语义解耦,从而实现更忠实于用户意图的艺术家风格引导生成,而非简单的风格标签映射。
- Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time
- 赛道归属: 文生图 / 推理优化
- 核心创新点: 提出在推理阶段同时对初始噪声和注意力机制进行双重干预的无训练方法。通过"锚定"(Anchoring)策略优化初始噪声采样,使其更贴近目标语义分布;通过"引导"(Steering)策略在去噪过程中动态调整交叉注意力,强化文本与图像区域的对齐。两者协同作用,在不修改模型权重的前提下显著提升复杂组合提示下的文本-图像语义忠实度。
- OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation
- 赛道归属: 文生图(物理常识评测与提示/生成优化)
- 核心创新点: 提出以知识图谱驱动的物理常识基准体系,将“物理常识”从粗粒度描述细化为可诊断、可定位的物理原则/关系维度,实现对模型在具体物理规律掌握程度的结构化评测;同时针对文生图生成的高随机性导致的提示优化“梯度幻觉”(优化器被偶发伪影误导)问题,引入更偏向群体/集体的优化与稳健评估机制,通过跨样本/跨随机种子的聚合信号抑制瞬时伪影干扰,从而更可靠地发现系统性物理缺陷并进行针对性改进。
- Evaluation-Verification Reward for Consistent Multi-Reference Image Editing
- 赛道归属: 图像编辑 / 多参考图像编辑 / 强化学习对齐
- 核心创新点: 针对多参考图像编辑任务中缺乏合适奖励模型的核心瓶颈,提出"评估-验证奖励"(Evaluation-Verification Reward)框架。该方法设计了能够捕捉多图像关系约束的奖励信号,解决了将强化学习直接应用于多参考编辑时因奖励模型不适配而导致的视觉一致性差和整体和谐性不足的问题。通过将多模态大模型的评估能力与验证机制相结合,构建出适用于多参考场景的RL训练信号,显著提升跨参考图像的视觉一致性与编辑质量。
- HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models 🆕NEW
- 赛道归属: 文生图(无训练高分辨率生成)
- 核心创新点: 针对现有无训练高分辨率生成研究主要集中于 U-Net 架构、而对 DiT 架构适配不足的问题,系统性地揭示了将现成 DiT 模型直接应用于高分辨率生成时的两大关键障碍,并提出 HRDiT 框架加以解决。其方法论突破在于无需任何额外训练,通过对 DiT 注意力机制和位置编码的针对性改造,使预训练 DiT 模型具备超出其原始训练分辨率的生成能力。
- EmoScene: A Dual-space Dataset for Controllable Affective Image Generation
- 赛道归属: 文生图 / 情感可控图像生成
- 核心创新点: 提出 EmoScene 大规模双空间数据集(120万图像),核心突破在于将情感表达从单一离散标签扩展至"双空间"标注体系——同时覆盖语义情感空间(高层情绪类别)与视觉感知空间(色彩、光照、构图等底层视觉属性),弥补了现有数据集在细粒度情感控制信号上的缺失,为文本驱动的情感图像生成提供了更丰富的监督信号。
- MaskFlow: Precise, Consistent and Seamless Regional Image Editing 🆕NEW
- 赛道归属: 图像编辑(区域精确编辑)
- 核心创新点: 提出 MaskFlow 训练框架,同时解决区域图像编辑中三个相互制约的核心难题:编辑区域的精确定位、非编辑背景的一致性保留以及编辑边界的无缝融合。其方法论创新在于将掩码引导的流匹配机制与区域感知训练策略相结合,在统一框架内协同优化局部语义对齐与全局上下文连贯性,避免了传统方法中局部编辑与背景保护之间的权衡取舍。
- MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing
- 赛道归属: 图像编辑 / 多源图像编辑评估
- 核心创新点: 提出 MIEScore 评估框架,专门针对多源图像编辑(MIE)任务设计人类对齐的质量评估方法。核心突破在于将评估维度从传统单图编辑场景扩展至多源输入场景(如跨图对象合成、人物-背景合成、跨图风格融合),通过构建与人类感知高度对齐的评分机制,填补了现有基准在多源编辑任务评估上的空白,为 GPT-Image-2 等新兴多模态编辑模型提供了系统性的能力衡量标准。
- Investigating Social Bias in Narrative Image Generation 🆕NEW
- 赛道归属: 文生图(社会偏见分析与评估)
- 核心创新点: 将 T2I 模型社会偏见研究从传统的单张照片生成场景拓展至叙事性视觉格式(故事板、漫画等),填补了现有评估体系的空白。核心方法论贡献在于构建了针对叙事图像生成场景的偏见评估框架,系统考察偏见在多帧连续叙事、角色一致性呈现等复杂视觉语境下的表现形式与传播机制,揭示了叙事格式特有的偏见放大或转化规律。
GitHub
- [2026-08-10] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13173
- [2026-08-10] kadevin/ilab-conjure ⭐672
- [2026-08-10] AceDataCloud/Nexior ⭐389
- [2026-08-10] Sateezg/codex-bridge ⭐352 🆕NEW
- [2026-08-09] GautamVhavle/CatGPT-Gateway ⭐232 🆕NEW
视频生成/编辑
arXiv
- CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation
- 赛道归属: 文生视频 / 文化理解评测基准
- 核心创新点: 提出首个专门针对文生视频模型文化理解能力的综合评测基准 CultureVidBench。其核心创新在于将文化理解拆解为文化特定物体、动作、仪式、可见文字及音频线索等多维度评估指标,填补了现有基准仅关注感知质量、物理合理性和文本-视频对齐而忽视文化多样性表征能力的空白,为跨文化场景下的 T2V 模型能力评估提供了系统性框架。
- Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation
- 赛道归属: 视频生成(实时交互式长视频生成)
- 核心创新点: 提出了一种支持实时交互的长视频生成"Live Model"架构。核心突破在于:①用户可在生成过程中随时切换提示词并即时生效,实现真正的交互式生成;②设计了有界多尺度记忆机制(bounded multi-scale memory),跨分块保持主体、场景和风格的一致性,支持小时级别的超长视频滚动生成而不出现明显质量退化;③同时兼容文生视频、图生视频和视频续写多种模式,并支持多语言提示词。
- CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling
- 赛道归属: 视频生成(多镜头长视频生成 / 电影级叙事视频生成)
- 核心创新点: 提出无需训练(training-free)的统一框架,同时解决多镜头生成、角色/场景细粒度可控性和长时序一致性三大挑战。核心方法基于对现有文生视频扩散模型的键值注意力(key-value attention)机制的重新利用,通过参考帧可控的跨镜头注意力传播,在不进行任何微调或定制化训练的前提下,实现角色外观和场景风格在多个镜头间的一致性保持,为电影级叙事视频生成提供了轻量化的统一解决方案。
- GimbalDiffusion: Gravity-Aware Camera Control for Video Generation
- 赛道归属: 视频生成 / 相机运动控制
- 核心创新点: 提出 GimbalDiffusion 框架,核心突破在于引入重力感知(Gravity-Aware)的相机表示方式,以绝对而非相对/模糊的几何表征来编码相机轨迹,从而支持大角度旋转(如180度转向、垂直俯仰)等极端相机运动的精确控制。相比现有方法依赖相对或歧义性相机表示导致大旋转支持不足的局限,该方法在几何层面实现了更精确、更鲁棒的相机运动建模。
- EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation
- 赛道归属: 视频生成 / 音频驱动视频生成 / 推理加速
- 核心创新点: 提出 EchoCache,一种面向音频驱动视频生成(A2V)的能量引导跨模态缓存加速方法。核心创新在于识别并解决了 A2V 场景中现有缓存方法的两层错位问题:现有方法仅利用视觉特征的时序冗余,而忽视了音频驱动视觉生成时跨模态对齐的高度非均匀时序重要性。EchoCache 通过音频能量信号动态指导缓存策略,在跨模态对齐感知下选择性复用特征,在保持音视频对齐质量的同时显著降低扩散模型迭代去噪的推理开销。
- UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation
- 赛道归属: 视频生成 / 人体视频生成 / 运动与相机联合控制
- 核心创新点: 提出 UniMoCa 框架,核心创新在于将人体运动控制与相机运动控制统一为同质化的视觉代理(Visual Proxies)表示,打破了现有方法中运动控制依赖骨架图/姿态图等视觉序列、相机控制依赖相机嵌入向量这一异构控制接口的范式。通过统一表示消除了模型需同时对齐像素级运动信号与抽象相机嵌入的矛盾,尤其在多人场景、大幅度肢体运动、遮挡及动态相机等复杂条件下,实现了更忠实、更一致的人体视频生成。
- MoRoute: Dynamic Routing for In-Context Multimodal Video Generation
- 赛道归属: 视频生成与编辑(多模态条件视频生成)
- 核心创新点: 提出 MoRoute 动态路由机制,用于解决多模态视频生成中如何高效融合视觉语言模型(VLM)层级化多模态表征与视频扩散 Transformer 的核心挑战。其方法论突破在于:摒弃传统静态、固定的跨模态特征注入方式,转而设计动态路由策略,根据不同输入条件组合(文本、图像、视频的任意组合)自适应地选择和分配 VLM 各层级表征到扩散模型的对应模块,从而在单一统一模型框架下同时支持多种视频生成与编辑任务,实现多任务间互补数据与生成先验的共享,提升了模型对多样化条件输入的理解与生成能力。
- FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring
- 赛道归属: 视频生成(自回归长视频生成 / 推理稳定性优化)
- 核心创新点: 从频域视角重新诠释自回归视频扩散模型的误差累积问题,发现长程生成中的颜色漂移、运动停滞等退化现象本质上表现为低频能量的系统性偏移。在此基础上提出"频谱自锚定"(Spectral Self-Anchoring)方法——FreqForcing:在自回归推理过程中,利用历史帧的低频谱统计信息对当前生成帧进行频域约束,抑制低频能量漂移,从而在无需额外训练的情况下显著缓解长视频生成的视觉崩溃问题。同时深入分析了注意力汇聚(attention sink)在频域中的作用机制。
- Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory
- 赛道归属: 视频生成(实时流式音视频联合生成)
- 核心创新点: 提出Ripple系统,核心创新在于跨模态循环记忆机制(cross-modal recurrent memory):将音频与视频的历史上下文以循环状态的形式压缩存储,实现音视频两个模态之间的长程依赖建模,同时大幅降低流式推理的计算开销。相比已有流式音视频生成方法,Ripple在保持实时性的同时支持长时序生成,并通过跨模态记忆保证音视频的时序同步与语义一致性,填补了高质量、低延迟、长时序音视频联合生成的空白。
- TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models
- 赛道归属: 视频生成(文生视频 / 时序语义控制)
- 核心创新点: 识别并定义了文生视频扩散模型中一种新的失败模式——"时序先验抑制"(Temporal Prior Suppression, TPS):当提示词描述一个持续背景场景叠加一个后发事件时(如"海浪冲垮沙堡"),早期场景的强先验会主导交叉注意力,导致后段事件无法在对应帧中正确呈现。针对此问题提出时序先验解耦(Temporal Prior Decoupling, TPD)方法,通过在扩散去噪过程中对不同时间段的文本条件进行显式解耦与分段注意力调制,使早期先验与后发事件的语义信号各自作用于对应的时间帧,从而实现复杂时序叙事提示词的精准视频生成。
GitHub
- [2026-08-10] Vchitect/Latte ⭐1948 🆕NEW
- [2026-08-10] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1811
- [2026-08-10] WeChatCV/Stand-In ⭐780 🆕NEW
- [2026-08-10] nkxx188/ComfyUI-MiniMaxH3-Easy ⭐248 🆕NEW
- [2026-08-10] wordghost1234/agnes-ai-storyboard-studio ⭐156
HuggingFace Models
音频生成
arXiv
- DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis
- 赛道归属: 文本转语音(TTS)/ 离散扩散语言模型
- 核心创新点: 提出将TTS任务建模为条件块离散扩散过程,基于X-Codec2神经音频编解码器Token,将序列分解为块(Block)并施加掩码扩散。该方法突破了自回归模型顺序解码慢、非自回归模型语言准确性差的两难困境,通过块级并行扩散在保持高可懂度的同时显著提升推理速度,无需大规模训练数据即可实现高质量语音合成。
- Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model
- 赛道归属: 人脸驱动语音合成(Face-to-Speech)/ 零样本语音生成
- 核心创新点: 提出了一种无需参考音频的人脸到语音(F2S)合成框架,核心突破在于通过轻量级 Face Adapter 模块结合人脸编码器高层块的软调优(soft-tuning),将人脸识别特征对齐到冻结的 StyleTTS 扩散模型的风格隐空间(style latent space)中。该方法无需修改预训练 TTS 主干网络,仅通过隐空间适配实现跨模态(视觉→声学)的零样本迁移,从而从单张静态人脸图像预测出与人物外貌相符的合理语音风格,有效解决了历史人物、虚拟角色等无参考音频场景下的语音合成难题。
- MMAG: A Multi-Control Mixed Audio Generation Benchmark 🆕NEW
- 赛道归属: 音频生成评测基准(Audio Generation Benchmark)
- 核心创新点: 提出首个面向多控制条件混合音频生成的综合评测基准 MMAG,核心突破在于将语音、音乐、音效三类声学元素的联合生成纳入统一评测框架,同时设计了涵盖语义保真度、说话人一致性和时序控制等多维度的细粒度评估指标,填补了现有基准仅聚焦单一模态或粗粒度描述的空白。
- Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study
- 赛道归属: 文本转语音(TTS)/ 系统评测与基准
- 核心创新点: 构建了一套可复现的多指标TTS基准评测框架,联合评估感知质量、说话人相似度与声学保真度三个维度,重点覆盖低资源语言和欠代表性语言场景。其创新在于系统性地填补了跨语言、跨领域TTS评测方法论的空白,提供标准化、可复现的多维度联合评估流程,而非依赖单一指标或特定高资源语言。
- Beyond One-Size-Fits-All: Personalized and Culturally Adaptive Emotional TTS via Interactive Optimization of Individual Emotion Perception Spaces
- 赛道归属: 文本转语音(TTS)/ 情感语音合成 / 个性化与文化适应
- 核心创新点: 针对情感感知因人而异、因文化而异导致的情感TTS失配问题,提出了个性化且文化自适应的情感TTS框架。核心创新在于引入个体情感感知空间的交互式优化机制,在Russell唤醒-效价(A-V)维度表示基础上,通过用户交互反馈动态校准个体与文化层面的情感感知差异,实现超越"一刀切"标签的细粒度、个性化情感控制。
- Experience-Calibrated Contrastive Decoding for Mitigating Hallucinations in LM-Based Text-to-Speech
- 赛道归属: 文本转语音(TTS)/ 幻觉抑制 / 解码策略优化
- 核心创新点: 从条件信息视角重新审视语言模型TTS中的语音幻觉问题,将条件信息分解为文本对齐信息与声学上下文/经验信息两类。提出"经验校准对比解码"方法,在解码阶段通过对比两类信息的预测分布来抑制由过度依赖经验信息引发的幻觉,无需修改模型架构或额外训练,是首个专注于解码时控制来缓解LM-TTS幻觉的方法论突破。
- SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
- 赛道归属: 语音与音频生成 / 多说话人 / 统一生成框架
- 核心创新点: 提出SwanTale统一框架,在单一系统内同时支持多说话人语音与音频的指令驱动(Instruct)和零样本(Zero-Shot)两类生成任务。核心创新在于将自然语言风格控制、无参考录音的声音设计、声学场景与音效融合、以及跨任务声音复用等能力统一建模,打破了现有系统在指令控制与零样本泛化之间相互割裂的局限,面向动画配音、音频剧、广告等实际生产场景提供端到端解决方案。
- Exploring Efficient Waveform Diffusion Models for Foley Sound Generation
- 赛道归属: 音频生成 / Foley音效生成 / 波形扩散模型
- 核心创新点: 针对现有波形扩散模型计算开销大、模型体量庞大的问题,系统性地探索了轻量化波形扩散架构在Foley音效生成任务中的可行性。核心贡献在于对时域与频域架构进行了效率导向的对比分析与设计优化,填补了紧凑型波形扩散模型在该领域研究不足的空白,为低资源场景下的高保真音效生成提供了可行路径。
- AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis 🆕NEW
- 赛道归属: 对话语音合成 / 情感语音生成(Conversational Speech Synthesis)
- 核心创新点: 提出 AuEmoChat 框架,核心创新体现在两个层面:一是突破传统预定义离散情感标签空间(如七类情感)的局限,转而采用更细粒度的真实情感建模方式以实现更自然的情感渲染;二是针对多轮对话历史中冗余多模态 Token 干扰上下文理解的问题,设计了高效的上下文压缩与理解机制,从而在保持对话一致性的同时显著提升情感表达的真实性。
- BeatEdit: Symbolic Music Generation as Explicit Editing
- 赛道归属: 音乐生成 / 符号音乐编辑 / 生成式音乐创作
- 核心创新点: 将符号音乐生成范式从"从零生成完整序列"转变为"显式编辑"模式,以更贴近真实音乐创作中迭代修改的工作流。核心突破在于表示层面的重新设计——指出传统事件型音乐编码缺乏支持显式编辑所需的结构性属性,并提出了新的编码方案以赋予模型对局部片段进行选择性修改的能力,将文本领域成熟的编辑范式迁移至符号音乐领域,填补了该方向的研究空白。
GitHub
- [2026-08-10] huggingface/diffusers ⭐34277
- [2026-08-08] SamurAIGPT/Generative-Media-Skills ⭐4019
- [2026-08-09] Stability-AI/stable-audio-tools ⭐3840
- [2026-08-10] BinWang28/audio-ai-hub ⭐948
- [2026-08-09] apocas/restai ⭐513
HuggingFace Models
语言大模型
arXiv
- Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents
- 赛道归属: 教育AI / LLM评估与标注
- 核心创新点: 将传统ICAP认知参与框架扩展为7级细粒度量表,系统对比了人工标注、ICL(上下文学习)和反思型LLM智能体三种方法在协作对话认知参与度自动编码任务上的表现,首次引入"反思型LLM智能体"范式用于教育话语分析,揭示了不同自动化标注策略在细粒度认知分类任务中的能力边界。
- How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories
- 赛道归属: 推理优化 / LLM可解释性
- 核心创新点: 提出步骤感知推理能量(SARE)框架,利用Centered Kernel Alignment(CKA)对CoT推理轨迹中每个独立步骤的隐层表示Gram矩阵进行几何度量,将推理计算努力从轨迹级标量细化至步骤级粒度,首次实现对链式思维中逐步计算深度的可量化解析,为推理过程的精细化理解提供了新工具。
- GPrune-LLM: Generalization-Aware Structured Pruning for Large Language Models
- 赛道归属: 模型压缩 / 结构化剪枝
- 核心创新点: 提出了一种泛化感知的结构化剪枝框架 GPrune-LLM,核心突破在于识别神经元对校准数据集的"分布敏感性"异质性——将神经元分为稳定型(跨数据集排名一致)和敏感型(排名波动大)两类,并针对性地设计差异化重要性估计策略。对稳定型神经元直接使用单一校准集统计量,对敏感型神经元则引入多校准集聚合机制以消除校准偏差,从而在不增加显著计算开销的前提下提升剪枝后模型的跨任务泛化能力。
- Progressive Multimodal Alignment for Continual Instruction Tuning
- 赛道归属: 多模态持续学习 / 多模态大语言模型对齐
- 核心创新点: 针对多模态持续指令微调(MCIT)中被忽视的"投影器级遗忘"问题,提出渐进式多模态对齐框架(PMA)。核心突破在于:不再仅关注LLM主干的遗忘,而是专门设计机制约束视觉-语言投影器在视觉分布偏移和指令语义演变时的漂移,从而在持续学习过程中维持跨模态对齐的稳定性。
- Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing 🆕NEW
- 赛道归属: LLM智能体 / 科学推理与假设检验
- 核心创新点: 针对LLM智能体在统计假设检验中频繁出现的推理错误问题,提出Fisher-R1训练框架。核心突破在于:构建了专门评估推理正确性(而非仅代码执行正确性)的基准测试,并通过强化学习训练LLM智能体,使其能够在统计推断层面做出可靠决策,而非仅停留于正确执行分析代码却得出错误结论的表面正确性。
- GPTKB 2.0: Browsing, Querying, and Auditing a Disambiguated LLM-Derived Knowledge Base 🆕NEW
- 赛道归属: 知识图谱构建 / LLM知识提取与管理
- 核心创新点: 提出GPTKB 2.0,一个从LLM中物化的大规模消歧知识库系统。核心创新在于:在递归知识库构建过程中引入上下文引导的实体消歧机制,能够自动分离同音异义词并合并同义提及,突破了以往LLM衍生知识库仅依赖表面字符串标识实体的局限,最终构建出含3840万三元组、160万规范实体的高质量知识库,并提供浏览、查询与审计的完整Web交互界面。
- Does Splitting a Triage Decision Across Agents Hide Bias or Help Catch It? A Multi-Agent Simulation Study of LLM-Based Resource Allocation Under Audit Capacity Constraints 🆕NEW
- 赛道归属: LLM多智能体系统 / AI公平性与偏见审计
- 核心创新点: 通过多智能体仿真实验,系统研究了将单一LLM决策拆分为多角色流水线(评估、分配、独立审计)后对人口统计偏见的影响。核心发现在于:揭示了多智能体流水线在审计容量受限条件下对偏见的隐藏与放大机制,证明角色分化的流水线设计并不必然减少偏见,为LLM资源分配系统的公平性评估提供了新的方法论视角。
- LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers 🆕NEW
- 赛道归属: LLM推理优化 / 模型路由与部署
- 核心创新点: 提出LLMRouter统一框架,将LLM路由问题形式化为包含五个组件(上下文编码器、模型编码器、评分函数、决策规则、学习信号)的序列决策过程。核心突破在于:通过统一的形式化定义覆盖单轮与多轮场景,解决了现有路由方案因实现各异导致无法公平比较和扩展的问题,为LLM路由算法的开发、评估与部署提供了标准化基础设施。
- Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution 🆕NEW
- 赛道归属: LLM智能体 / 软件工程自动化(代码修复)
- 核心创新点: 针对软件Issue修复中长轨迹(数十至数百步)任务的挑战,提出将规划与情节记忆(Episodic Memory)耦合的LLM智能体架构。核心创新在于:同时强化智能体的动态规划能力与跨阶段观测记忆能力,解决了现有仓库级智能体孤立增强单一能力导致长轨迹中出现陈旧证据和重复探索的问题,使智能体在探索、假设、实现、验证全流程中保持连贯的状态追踪。
- Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors 🆕NEW
- 赛道归属: LLM推理优化 / 能耗与延迟预测建模
- 核心创新点: 提出HYMELL(混合能耗与延迟建模)三层混合框架,将解析建模与机器学习预测器相结合,用于估算LLM推理的延迟与能耗。核心突破在于:通过多层次混合建模策略,在无需实际部署硬件的条件下实现高精度的推理成本预估,为可持续AI部署和硬件感知设计提供了实用的预测工具,弥补了纯解析模型精度不足与纯数据驱动模型泛化性差的双重缺陷。
GitHub
- [2026-08-10] sgl-project/sglang ⭐31609
- [2026-08-10] openJiuwen-ai/jiuwenswarm ⭐2631
- [2026-08-10] Jacobinwwey/obsidian-NotEMD ⭐292 🆕NEW
- [2026-08-10] yaolinli/MLLM-Token-Compression ⭐214 🆕NEW
- [2026-08-10] LGDiMaggio/predictive-maintenance-mcp ⭐70 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2025-07-11] HuggingFaceFW/fineweb
- [2026-08-09] HuggingFaceCode/stack-v3-train
多模态大模型
arXiv
- HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models
- 赛道归属: 多模态理解 / 视觉感知增强
- 核心创新点: 从频谱分析视角揭示了VLM视觉编码器存在"频谱响应刚性"问题——预训练视觉编码器的逐层频谱响应模式在下游微调中几乎不发生变化,导致模型无法根据任务需求自适应地提取不同频率的视觉特征。基于此诊断,提出HAFI-VLM框架,通过引入频率自适应机制,使视觉编码器能够根据文本查询动态调整频谱提取策略,从而增强细粒度视觉感知能力。
- STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision
- 赛道归属: 多模态理解 / 自动驾驶时空推理
- 核心创新点: 提出利用车载毫米波雷达作为监督信号来增强VLM时空推理能力的新范式,无需复杂预处理流程或昂贵人工标注。通过雷达数据提供的运动与速度真值,构建时空定位监督信号,使VLM获得对目标运动状态的强感知能力,有效弥合了现有方法在真实场景运动估计上的性能缺口,同时规避了合成数据带来的sim-to-real差距。
- AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models 🆕NEW
- 赛道归属: 多模态大模型 / 模型合并与能力修复
- 核心创新点: 提出 AgentPatch 框架,专门针对 Agentic MLLM 合并场景中的"弱任务修复"问题。核心方法论突破在于:将模型合并后的能力退化问题形式化为"弱任务识别与修复"任务,采用由粗到细(Coarse-to-Fine)的修复策略——先在粗粒度层面定位合并后性能下降的弱任务,再在细粒度层面对特定参数进行针对性的补丁式修复(Patch),从而在不重新训练整体模型的前提下,解决多个专用 Agentic MLLM 合并时因交互复杂度不对称导致的能力保留不均衡问题,实现单一通用 Agentic MLLM 的高质量整合。
- Two Sides of the Same Coin: Co-Evolving Search for Cross-Task Attacks on Vision-Language Models
- 赛道归属: 多模态安全 / 对抗攻击
- 核心创新点: 提出基于进化计算的跨模态对抗攻击框架,突破了现有攻击方法依赖单轨迹梯度优化和任务特定目标的局限。核心创新在于同时对文本空间和视觉空间进行协同进化搜索——文本侧进化生成硬提示,视觉侧自适应扰动图像,两侧相互协同,大幅扩展了搜索空间,显著提升了对统一VLM的跨任务迁移攻击成功率。
- RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?
- 赛道归属: 多模态理解 / 遥感视频理解
- 核心创新点: 针对遥感视频理解领域缺乏统一评测标准的空白,构建了RSVideo基准,专门评估VLM在连续遥感视频上的理解能力,覆盖目标属性变化、短时活动识别和场景演变等任务维度。该基准填补了现有评测体系仅关注单张遥感图像或长时离散观测的不足,为遥感视频VLM研究提供了系统性评估框架。
- CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models
- 赛道归属: 视频理解 / 视觉Token压缩
- 核心创新点: 提出CRAFT递归自适应融合压缩方法,解决视频VLM中视觉Token数量庞大导致预填充阶段计算开销剧增的问题。核心创新在于递归式自适应融合机制——通过多轮自适应合并时空冗余Token,在保留关键细节的同时实现高压缩比,克服了现有方法在高压缩率下关键信息丢失的缺陷,且无需引入额外模块或大规模重训练。
- Coverage-Driven Adaptive Keyframe Selection for Video Understanding
- 赛道归属: 视频理解 / 关键帧选择
- 核心创新点: 提出覆盖率驱动的自适应关键帧选择方法,针对不同查询相关帧分布差异大的问题,引入覆盖率指标来衡量所选关键帧对查询相关内容的覆盖程度。相比现有逐帧打分再筛选的方式,该方法能够自适应地确定关键帧数量与分布,在大幅减少LVLM推理计算开销的同时,避免因固定采样策略导致的关键信息遗漏。
- Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations
- 赛道归属: 多模态可解释性 / 表征分析
- 核心创新点: 提出LENS(局部邻域子空间解释)方法,突破了现有VLM可解释性研究依赖全局线性方向分析的局限。核心创新在于将VLM激活分解为局部低秩高斯邻域,捕捉"全局高维但局部低维"的表征结构,从而揭示图像Patch与文本Token在共享残差流中的局部几何交互机制,为理解跨模态表征融合提供了更精细的分析工具。
- Attention-Steered Vision-Language Models for Sign Language Translation
- 赛道归属: 多模态理解 / 手语翻译
- 核心创新点: 针对VLM在手语翻译中存在的时空视觉定位失效问题,提出注意力引导机制。发现标准下一Token交叉熵损失无法为模型提供"何时何处关注"的监督信号,导致模型忽视手语相关区域和帧。创新性地引入注意力引导训练目标,显式监督模型将注意力集中于手语动作的关键空间区域和时间帧,从而提升手语视频的细粒度时空理解与翻译精度。
- QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models
- 赛道归属: 多模态安全与对抗攻击(红外视觉-语言模型)
- 核心创新点: 提出QR结构化热触发器(QR-STT)框架,利用QR码的功能性区域结构作为热扰动载体,在无需训练、黑盒条件下实现对红外视觉-语言模型的定向语义操控。核心突破在于将QR码的视觉结构与热成像扰动相结合,在保持QR码可扫描功能的同时,隐蔽地干扰跨模态语义对齐,揭示了IR-VLM在结构化热扰动下的安全脆弱性。
GitHub
- [2026-08-09] Blaizzy/mlx-vlm ⭐5311
- [2026-08-10] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1789
- [2026-08-08] gokayfem/ComfyUI_VLM_nodes ⭐582
- [2026-08-10] liudaizong/Awesome-LVLM-Attack ⭐570 🆕NEW
- [2026-08-05] Roots-Automation/GutenOCR ⭐190 🆕NEW
强化学习
arXiv
- IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents 🆕NEW
- 赛道归属: 强化学习 / 战略对话智能体
- 核心创新点: 提出"孤立双边强化学习"(IB-RL)框架,核心突破在于将对话双方(智能体与对手)的策略训练过程相互隔离,分别独立优化,而非在动态交互中联合训练。这一设计有效解决了战略对话中因对手策略随智能体策略同步变化而导致的非平稳环境问题,使奖励信号更加稳定可靠,从而将传统RL在固定规则环境中的优势迁移至双边博弈场景。
- IACM-RL: Intent-Aware Context Management and Reinforcement Learning for Complex Tool Invocation under Dynamic Intent Fluctuations
- 赛道归属: 智能体工具调用 / LLM强化学习后训练
- 核心创新点: 提出IACM-RL框架,专门应对长时序工具调用中的动态用户意图噪声问题。核心突破在于:引入意图感知的上下文管理机制(IACM),通过动态过滤和压缩历史上下文中的过时约束,防止模型注意力被稀释;结合强化学习策略优化,有效规避意图偏移和无限API循环等灾难性失败模式,在复杂真实环境下显著提升工具调用的鲁棒性。
- TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models 🆕NEW
- 赛道归属: 具身智能 / 视觉-语言-动作模型强化学习后训练
- 核心创新点: 提出TEMPO框架,核心创新在于将VLA模型的语义理解模块与动作执行模块解耦,采用"双时间尺度"差异化更新策略:冻结预训练视觉-语言骨干网络,仅对动作头进行高频RL更新,同时以更低频率对语义层进行微调。这一设计打破了现有RL后训练对所有模块一视同仁的惯例,在保留预训练语义泛化能力的同时,显著提升了下游操作任务的策略优化效率。
- Momba: Network Modernization Improves Multi-Objective Reinforcement Learning 🆕NEW
- 赛道归属: 多目标强化学习 / 神经网络架构优化
- 核心创新点: 提出Momba框架,核心创新在于将现代深度学习网络架构(如残差连接、归一化层等近年主流设计)系统性地引入多目标强化学习(MORL)领域。现有MORL研究长期聚焦于算法层面的创新而忽视架构设计,Momba通过实证证明网络现代化本身即可在不改变底层MORL算法的前提下,显著提升样本效率和帕累托前沿的覆盖质量,为MORL性能提升提供了一条正交于算法创新的新路径。
- Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control 🆕NEW
- 赛道归属: 连续控制 / 强化学习系统设计与组件协同
- 核心创新点: 突破以往孤立评估单一RL组件(如探索策略、价值估计、经验回放等)的研究范式,系统性地研究多个算法组件之间的交互协同效应。通过大规模消融实验揭示组件间存在显著的"协同增益"或"相互干扰"现象,并据此提出组件组合的优化原则,在连续控制任务上以更高样本效率实现性能提升,为RL系统的整体性设计提供了方法论指导。
- Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning
- 赛道归属: 离线强化学习 / 策略优化
- 核心创新点: 提出行为优势修正策略评估(BAC-PE)方法,利用行为策略的Q函数对学习策略的Q函数进行校正,从双向同时抑制悲观保守性和过估计偏差,解决离线RL中分布偏移导致Q值估计失真的根本问题。进一步将扩散模型(Diffusion Policy)引入离线RL策略表示,结合BAC-PE实现更精准的策略优化方向,在高维连续动作空间中展现出更强的表达能力与稳定性。
- Instruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-Distillation
- 赛道归属: LLM强化学习后训练 / 探索策略
- 核心创新点: 提出指令条件探索(ICE)方法,针对LLM动作空间结构与经典RL的本质差异,设计了一种利用预训练LLM广泛知识主动生成多样化训练经验的探索机制。核心创新在于通过非对称强化学习(Asymmetric RL)与自蒸馏(Self-Distillation)相结合,在训练时以指令为条件引导策略有意识地探索多样轨迹,同时通过自蒸馏防止探索过度偏离基础模型能力,有效缓解LLM后训练中探索不足的问题。
- LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation
- 赛道归属: 代码生成强化学习 / GPU内核生成
- 核心创新点: 提出LEAP框架,专门解决将GRPO等无评论家范式应用于CUDA内核生成时面临的奖励稀疏性问题。核心突破在于:设计自适应剪枝机制(Adaptive Pruning),从GPU执行环境反馈中提取精细化的中间奖励信号,突破二元pass/fail奖励的信息瓶颈;通过精简环境反馈(Lean Environment-Feedback)降低RL训练中沙箱验证的计算开销,使LLM在低级系统编程任务上的RL后训练变得可行且高效。
- Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning
- 赛道归属: LLM强化学习后训练 / 灾难性遗忘缓解
- 核心创新点: 针对标准全策略KL正则化在LLM后训练中过度限制探索和目标任务学习的缺陷,提出保塑性KL正则化(Plasticity-Preserving KL Regularization)方法。核心创新在于区分策略分布中与能力保留相关和无关的部分,对不同响应区域施加非均匀的KL约束强度,在防止已有能力退化(能力保留)的同时,为新目标任务的学习保留足够的策略可塑性,实现遗忘抑制与探索能力之间的精细平衡。
- RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning
- 赛道归属: Web智能体 / 强化学习训练
- 核心创新点: 提出RMSWeb框架,系统性解决紧凑型Web智能体在SFT后RL训练阶段的三大痛点:①引入反思机制(Reflection)从低效轨迹中提炼高质量训练信号;②通过失败模式挖掘(Failure-Mode Mining)主动识别并针对性强化智能体的薄弱决策环节;③设计Salvage-DS数据策略,对被拒绝的动作组进行补救性数据构造,解决组相对RL中因动作级奖励设计不当导致的弱更新或误导性更新问题,显著提升小参数量Web智能体的训练效率与任务成功率。
GitHub
- [2026-08-10] huggingface/trl ⭐19034
- [2026-08-10] RLinf/RLinf ⭐4497
- [2026-08-10] radixark/miles ⭐1944
- [2026-08-10] TorchTrade/torchtrade ⭐413 🆕NEW
- [2026-08-10] rai-opensource/exploy ⭐97 🆕NEW
HuggingFace Datasets
- [2023-05-26] Anthropic/hh-rlhf 🆕NEW
世界动作模型
arXiv
- Decoupling Intention from Trajectory: A Representational Deduction Framework for World Action Models 🆕NEW
- 赛道归属: 世界动作模型 / 具身智能 / 运动规划
- 核心创新点: 提出了一种表征解耦框架(Representational Deduction Framework),将高层意图(Intention)与低层轨迹(Trajectory)在表征空间中显式分离。核心突破在于:现有视觉分支仅预测静态视觉观测,忽略了运动交互下世界状态演变的过渡信息,导致物理条件演化与动作轨迹生成之间产生表征纠缠。该框架通过解耦这两类信息,使视觉分支能够捕捉世界状态的动态转变过程,从而为动作规划提供更具语义层次的表征基础,实现意图理解与轨迹生成的协同优化。
- Faster-WAM: Do World Action Models Need Deep Action Modules?
- 赛道归属: 世界动作模型 / 机器人策略推理优化
- 核心创新点: 提出"Dock of Transformer (DoT)"设计原则,将预训练视频Transformer作为表征中枢,通过轻量级外挂模块(而非深度耦合的动作模块)完成动作预测。核心突破在于打破了现有WAM中动作模块深度与视频骨干深度强绑定的设计惯例,实现了在保持预测性能的同时大幅降低计算开销和推理延迟,验证了深度动作模块对WAM并非必要条件。
- ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
- 赛道归属: 机器人操控 / 世界动作模型(World Action Model)
- 核心创新点: 该工作针对现有世界动作模型(WAM)在视觉分布偏移场景下鲁棒性不足的问题,提出了 ST-WAM(语义-时序世界动作模型)。核心创新在于识别并定义了"训练分布幻觉"(Training-Distribution Hallucination)现象——即当输入观测存在视觉域偏移时,基于像素生成的未来预测会幻化出训练域内容,导致动作预测失效。为此,ST-WAM 将未来预测从像素空间解耦,转向语义-时序表征空间,通过建模动作相关的状态转移语义特征而非任务无关的视觉细节,从根本上切断了视觉外观变化对动作推理的干扰,从而在视觉分布偏移条件下实现更鲁棒的机器人操控。
- SimWAM: A Simple World Action Model for End-to-End Autonomous Driving 🆕NEW
- 赛道归属: 世界动作模型 / 自动驾驶 / 端到端规划
- 核心创新点: 提出SimWAM,核心创新在于将视频生成能力仅作为训练信号而非推理时的必要组件,从而彻底消除推理阶段昂贵的未来帧生成开销。具体方法上:采用联合流匹配(Joint Flow Matching)协同训练预训练视频专家与轻量动作专家;引入隔离注意力掩码(Isolated Attention Mask)机制,使动作预测在结构上独立于未来帧,推理时可直接丢弃视频分支。该设计实现了"训练时借力视频动态先验、推理时轻量高效执行"的解耦范式,在保留视频预训练知识迁移优势的同时,大幅降低了部署成本。
- CoWAM: Coordination Contracts for Selective Policy Intervention with WAMs
- 赛道归属: 世界动作模型 / 双臂机器人协调控制
- 核心创新点: 提出CoWAM选择性干预框架,将WAM生成的未来预测与实际策略执行之间的决策桥接问题形式化为"协调契约"。创新性地引入类型化可接受性检验、事件条件验证和校准干预门控三重机制,将同步约束、角色兼容性和碰撞收敛等双臂协调语义显式编码为可验证合约,仅在契约违反时触发干预,从而在保留原始策略名义行为的前提下有选择性地修正动作,解决了"合理预测未来≠应当改变当前动作"的核心矛盾。
- SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space
- 赛道归属: 世界动作模型 / 几何感知策略空间建模
- 核心创新点: 提出SG-WAM,构建一个同时满足"动作对齐"与"几何感知"双重要求的自引导世界建模框架。核心突破在于设计了一个联合结构化的策略空间,既避免了观测空间目标的感知冗余负担,又克服了现有辅助潜空间缺乏几何结构的缺陷,通过自引导机制使未来状态预测与动作生成在几何意义上协同对齐,从而更精准地捕捉动作对场景的空间变化影响。
GitHub
- [2026-08-10] OpenMOSS/Awesome-WAM ⭐1250
- [2026-08-08] DravenALG/awesome-vla-wam ⭐950
- [2026-08-06] neoteai/N0-TWAM ⭐98
- [2026-08-04] wdrink/RepWAM ⭐62
- [2026-08-09] teee000/LiLa-WAM ⭐52 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-08-10 09:47:42