AI 每日进展速报 - 2026-08-05
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation
- 赛道归属: 文生图(Prompt优化/提示词自动改写与对齐)
- 核心创新点: 提出一种“图像落地”的提示词精炼框架,通过让模型在生成图像后基于图像内容进行自诊断与自奖励(self-rewarding),把“提示词是否有效”从纯文本层面的启发式改写,转为由生成结果驱动的闭环优化;同时强调可学习、可复用的提示词优化策略(而非一次性prompt扩写),使优化过程能够沉淀为通用的prompt refinement policy,提升对不同提示与场景的泛化能力与稳定性。
- Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation
- 赛道归属: 文生图 / 扩散模型推理优化
- 核心创新点: 针对多模态扩散Transformer(MMDiT,如SD3、SD3.5、FLUX.1)中存在的"提示遗忘"现象(prompt forgetting)提出系统性分析与解决方案。研究发现,文本分支中的语义信息随网络深度增加而逐渐消退。为此,提出"提示重注入"(Prompt Reinjection)机制,在扩散Transformer的深层重新引入原始文本提示的语义表示,从而在不修改模型权重的前提下,有效缓解文本语义在去噪过程中的衰减问题,提升生成图像与文本描述的语义一致性。
- MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation
- 赛道归属: 文生图(可控生成/区域级控制与组合生成)
- 核心创新点: 提出面向SDXL的区域级可控生成机制,通过“Mask Attention”在注意力计算中显式引入空间掩码约束,实现按区域绑定文本条件,从而降低多对象场景中属性串扰与对象混淆;在保持U-Net扩散骨干高效性的前提下增强跨区域/全局协调能力,避免直接切换到高成本的Transformer扩散架构,以较低额外计算实现更可靠的组合式生成与可控布局。
- Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time
- 赛道归属: 文生图 / 推理优化
- 核心创新点: 提出在推理阶段同时对初始噪声和注意力机制进行双重干预的无训练方法。通过"锚定"(Anchoring)策略优化初始噪声采样,使其更贴近目标语义分布;通过"引导"(Steering)策略在去噪过程中动态调整交叉注意力,强化文本与图像区域的对齐。两者协同作用,在不修改模型权重的前提下显著提升复杂组合提示下的文本-图像语义忠实度。
- OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation
- 赛道归属: 文生图(物理常识评测与提示/生成优化)
- 核心创新点: 提出以知识图谱驱动的物理常识基准体系,将“物理常识”从粗粒度描述细化为可诊断、可定位的物理原则/关系维度,实现对模型在具体物理规律掌握程度的结构化评测;同时针对文生图生成的高随机性导致的提示优化“梯度幻觉”(优化器被偶发伪影误导)问题,引入更偏向群体/集体的优化与稳健评估机制,通过跨样本/跨随机种子的聚合信号抑制瞬时伪影干扰,从而更可靠地发现系统性物理缺陷并进行针对性改进。
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- 赛道归属: 文生图(少步生成/扩散蒸馏与推理加速)
- 核心创新点: 提出IB-Flow,用信息瓶颈(Information Bottleneck)原则指导对CFG(Classifier-Free Guidance)轨迹的蒸馏,在少步生成场景下不再采用“全局静态指导强度”的粗粒度注入方式,而是通过信息约束/选择性保留与文本对齐相关的关键信息、抑制与生成无关或冗余的引导成分,实现更细粒度、动态的CFG蒸馏与引导分配;从而在极少采样步数下兼顾语义对齐与画质稳定性,降低推理延迟并缓解少步蒸馏常见的失真与不稳定问题。
- Evaluation-Verification Reward for Consistent Multi-Reference Image Editing
- 赛道归属: 图像编辑 / 多参考图像编辑 / 强化学习对齐
- 核心创新点: 针对多参考图像编辑任务中缺乏合适奖励模型的核心瓶颈,提出"评估-验证奖励"(Evaluation-Verification Reward)框架。该方法设计了能够捕捉多图像关系约束的奖励信号,解决了将强化学习直接应用于多参考编辑时因奖励模型不适配而导致的视觉一致性差和整体和谐性不足的问题。通过将多模态大模型的评估能力与验证机制相结合,构建出适用于多参考场景的RL训练信号,显著提升跨参考图像的视觉一致性与编辑质量。
- SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion
- 赛道归属: 文生图 / 基础模型训练
- 核心创新点: 提出"语义优先扩散"(Semantic-First Diffusion)新范式,将语义信息显式注入潜在扩散建模的早期阶段,引导模型优先学习高层语义结构再细化视觉细节。基于此范式构建了 SeFi-Image 文生图基础模型,实验覆盖多个模型规模,验证了该范式在大分辨率、大规模模型上的有效性,并证明语义引导可显著加速训练收敛,降低训练资源消耗。
- EmoScene: A Dual-space Dataset for Controllable Affective Image Generation 🆕NEW
- 赛道归属: 文生图 / 情感可控图像生成
- 核心创新点: 提出 EmoScene 大规模双空间数据集(120万图像),核心突破在于将情感表达从单一离散标签扩展至"双空间"标注体系——同时覆盖语义情感空间(高层情绪类别)与视觉感知空间(色彩、光照、构图等底层视觉属性),弥补了现有数据集在细粒度情感控制信号上的缺失,为文本驱动的情感图像生成提供了更丰富的监督信号。
- MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing 🆕NEW
- 赛道归属: 图像编辑 / 多源图像编辑评估
- 核心创新点: 提出 MIEScore 评估框架,专门针对多源图像编辑(MIE)任务设计人类对齐的质量评估方法。核心突破在于将评估维度从传统单图编辑场景扩展至多源输入场景(如跨图对象合成、人物-背景合成、跨图风格融合),通过构建与人类感知高度对齐的评分机制,填补了现有基准在多源编辑任务评估上的空白,为 GPT-Image-2 等新兴多模态编辑模型提供了系统性的能力衡量标准。
GitHub
- [2026-08-05] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13059
- [2026-08-04] AceDataCloud/Nexior ⭐386
- [2026-08-04] etkecc/baibot ⭐238
- [2026-08-04] hackclub/ai ⭐126 🆕NEW
- [2026-08-05] linux4life1/front-porch-AI ⭐57
HuggingFace Models
HuggingFace Datasets
- [2026-07-30] unstonio/pixelgpt-24x24-20k
视频生成/编辑
arXiv
- CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation 🆕NEW
- 赛道归属: 文生视频 / 文化理解评测基准
- 核心创新点: 提出首个专门针对文生视频模型文化理解能力的综合评测基准 CultureVidBench。其核心创新在于将文化理解拆解为文化特定物体、动作、仪式、可见文字及音频线索等多维度评估指标,填补了现有基准仅关注感知质量、物理合理性和文本-视频对齐而忽视文化多样性表征能力的空白,为跨文化场景下的 T2V 模型能力评估提供了系统性框架。
- Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation
- 赛道归属: 视频生成(实时交互式长视频生成)
- 核心创新点: 提出了一种支持实时交互的长视频生成"Live Model"架构。核心突破在于:①用户可在生成过程中随时切换提示词并即时生效,实现真正的交互式生成;②设计了有界多尺度记忆机制(bounded multi-scale memory),跨分块保持主体、场景和风格的一致性,支持小时级别的超长视频滚动生成而不出现明显质量退化;③同时兼容文生视频、图生视频和视频续写多种模式,并支持多语言提示词。
- CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling
- 赛道归属: 视频生成(多镜头长视频生成 / 电影级叙事视频生成)
- 核心创新点: 提出无需训练(training-free)的统一框架,同时解决多镜头生成、角色/场景细粒度可控性和长时序一致性三大挑战。核心方法基于对现有文生视频扩散模型的键值注意力(key-value attention)机制的重新利用,通过参考帧可控的跨镜头注意力传播,在不进行任何微调或定制化训练的前提下,实现角色外观和场景风格在多个镜头间的一致性保持,为电影级叙事视频生成提供了轻量化的统一解决方案。
- GimbalDiffusion: Gravity-Aware Camera Control for Video Generation 🆕NEW
- 赛道归属: 视频生成 / 相机运动控制
- 核心创新点: 提出 GimbalDiffusion 框架,核心突破在于引入重力感知(Gravity-Aware)的相机表示方式,以绝对而非相对/模糊的几何表征来编码相机轨迹,从而支持大角度旋转(如180度转向、垂直俯仰)等极端相机运动的精确控制。相比现有方法依赖相对或歧义性相机表示导致大旋转支持不足的局限,该方法在几何层面实现了更精确、更鲁棒的相机运动建模。
- EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation 🆕NEW
- 赛道归属: 视频生成 / 音频驱动视频生成 / 推理加速
- 核心创新点: 提出 EchoCache,一种面向音频驱动视频生成(A2V)的能量引导跨模态缓存加速方法。核心创新在于识别并解决了 A2V 场景中现有缓存方法的两层错位问题:现有方法仅利用视觉特征的时序冗余,而忽视了音频驱动视觉生成时跨模态对齐的高度非均匀时序重要性。EchoCache 通过音频能量信号动态指导缓存策略,在跨模态对齐感知下选择性复用特征,在保持音视频对齐质量的同时显著降低扩散模型迭代去噪的推理开销。
- UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation 🆕NEW
- 赛道归属: 视频生成 / 人体视频生成 / 运动与相机联合控制
- 核心创新点: 提出 UniMoCa 框架,核心创新在于将人体运动控制与相机运动控制统一为同质化的视觉代理(Visual Proxies)表示,打破了现有方法中运动控制依赖骨架图/姿态图等视觉序列、相机控制依赖相机嵌入向量这一异构控制接口的范式。通过统一表示消除了模型需同时对齐像素级运动信号与抽象相机嵌入的矛盾,尤其在多人场景、大幅度肢体运动、遮挡及动态相机等复杂条件下,实现了更忠实、更一致的人体视频生成。
- MoRoute: Dynamic Routing for In-Context Multimodal Video Generation
- 赛道归属: 视频生成与编辑(多模态条件视频生成)
- 核心创新点: 提出 MoRoute 动态路由机制,用于解决多模态视频生成中如何高效融合视觉语言模型(VLM)层级化多模态表征与视频扩散 Transformer 的核心挑战。其方法论突破在于:摒弃传统静态、固定的跨模态特征注入方式,转而设计动态路由策略,根据不同输入条件组合(文本、图像、视频的任意组合)自适应地选择和分配 VLM 各层级表征到扩散模型的对应模块,从而在单一统一模型框架下同时支持多种视频生成与编辑任务,实现多任务间互补数据与生成先验的共享,提升了模型对多样化条件输入的理解与生成能力。
- FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring
- 赛道归属: 视频生成(自回归长视频生成 / 推理稳定性优化)
- 核心创新点: 从频域视角重新诠释自回归视频扩散模型的误差累积问题,发现长程生成中的颜色漂移、运动停滞等退化现象本质上表现为低频能量的系统性偏移。在此基础上提出"频谱自锚定"(Spectral Self-Anchoring)方法——FreqForcing:在自回归推理过程中,利用历史帧的低频谱统计信息对当前生成帧进行频域约束,抑制低频能量漂移,从而在无需额外训练的情况下显著缓解长视频生成的视觉崩溃问题。同时深入分析了注意力汇聚(attention sink)在频域中的作用机制。
- Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory
- 赛道归属: 视频生成(实时流式音视频联合生成)
- 核心创新点: 提出Ripple系统,核心创新在于跨模态循环记忆机制(cross-modal recurrent memory):将音频与视频的历史上下文以循环状态的形式压缩存储,实现音视频两个模态之间的长程依赖建模,同时大幅降低流式推理的计算开销。相比已有流式音视频生成方法,Ripple在保持实时性的同时支持长时序生成,并通过跨模态记忆保证音视频的时序同步与语义一致性,填补了高质量、低延迟、长时序音视频联合生成的空白。
- TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models
- 赛道归属: 视频生成(文生视频 / 时序语义控制)
- 核心创新点: 识别并定义了文生视频扩散模型中一种新的失败模式——"时序先验抑制"(Temporal Prior Suppression, TPS):当提示词描述一个持续背景场景叠加一个后发事件时(如"海浪冲垮沙堡"),早期场景的强先验会主导交叉注意力,导致后段事件无法在对应帧中正确呈现。针对此问题提出时序先验解耦(Temporal Prior Decoupling, TPD)方法,通过在扩散去噪过程中对不同时间段的文本条件进行显式解耦与分段注意力调制,使早期先验与后发事件的语义信号各自作用于对应的时间帧,从而实现复杂时序叙事提示词的精准视频生成。
GitHub
- [2026-08-04] hao-ai-lab/FastVideo ⭐3918
- [2026-08-04] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1772
- [2026-08-04] soraw-ai/Awesome-Text-to-Video-Generation ⭐255 🆕NEW
- [2026-08-04] Anil-matcha/awesome-ai-video-models ⭐179
- [2026-08-05] wordghost1234/agnes-ai-storyboard-studio ⭐156
音频生成
arXiv
- DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 离散扩散语言模型
- 核心创新点: 提出将TTS任务建模为条件块离散扩散过程,基于X-Codec2神经音频编解码器Token,将序列分解为块(Block)并施加掩码扩散。该方法突破了自回归模型顺序解码慢、非自回归模型语言准确性差的两难困境,通过块级并行扩散在保持高可懂度的同时显著提升推理速度,无需大规模训练数据即可实现高质量语音合成。
- Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model
- 赛道归属: 人脸驱动语音合成(Face-to-Speech)/ 零样本语音生成
- 核心创新点: 提出了一种无需参考音频的人脸到语音(F2S)合成框架,核心突破在于通过轻量级 Face Adapter 模块结合人脸编码器高层块的软调优(soft-tuning),将人脸识别特征对齐到冻结的 StyleTTS 扩散模型的风格隐空间(style latent space)中。该方法无需修改预训练 TTS 主干网络,仅通过隐空间适配实现跨模态(视觉→声学)的零样本迁移,从而从单张静态人脸图像预测出与人物外貌相符的合理语音风格,有效解决了历史人物、虚拟角色等无参考音频场景下的语音合成难题。
- Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm
- 赛道归属: 语音生成(TTS)/ 可控语音合成 / 低延迟语音建模
- 核心创新点: 提出面向生产的多阶段协同训练范式,将语言模型(LM)的内容建模与Flow-Matching(FM)的声学生成进行五阶段渐进式联合优化,以同时提升内容一致性、音色相似度、韵律自然度与鲁棒性;引入约12.5Hz低帧率语音tokenizer,在尽量保持音质与可懂度的前提下显著降低序列长度,从而减少推理延迟并提升效率;整体上通过“低帧率离散表征 + 分阶段对齐LM与生成器目标”的系统化设计,实现更强可控性与多语覆盖下的稳定合成。
- Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 系统评测与基准
- 核心创新点: 构建了一套可复现的多指标TTS基准评测框架,联合评估感知质量、说话人相似度与声学保真度三个维度,重点覆盖低资源语言和欠代表性语言场景。其创新在于系统性地填补了跨语言、跨领域TTS评测方法论的空白,提供标准化、可复现的多维度联合评估流程,而非依赖单一指标或特定高资源语言。
- Beyond One-Size-Fits-All: Personalized and Culturally Adaptive Emotional TTS via Interactive Optimization of Individual Emotion Perception Spaces 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 情感语音合成 / 个性化与文化适应
- 核心创新点: 针对情感感知因人而异、因文化而异导致的情感TTS失配问题,提出了个性化且文化自适应的情感TTS框架。核心创新在于引入个体情感感知空间的交互式优化机制,在Russell唤醒-效价(A-V)维度表示基础上,通过用户交互反馈动态校准个体与文化层面的情感感知差异,实现超越"一刀切"标签的细粒度、个性化情感控制。
- Experience-Calibrated Contrastive Decoding for Mitigating Hallucinations in LM-Based Text-to-Speech 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 幻觉抑制 / 解码策略优化
- 核心创新点: 从条件信息视角重新审视语言模型TTS中的语音幻觉问题,将条件信息分解为文本对齐信息与声学上下文/经验信息两类。提出"经验校准对比解码"方法,在解码阶段通过对比两类信息的预测分布来抑制由过度依赖经验信息引发的幻觉,无需修改模型架构或额外训练,是首个专注于解码时控制来缓解LM-TTS幻觉的方法论突破。
- Singlish, Can or Not? Fine-Tuning and Evaluating Zero-Shot TTS for Singapore English
- 赛道归属: 语音生成(TTS)/ 口音与方言适配 / Zero-shot TTS微调与评测
- 核心创新点: 针对零样本TTS在区域口音(Singlish)上“保音色但口音被拉回通用英语”的系统性缺陷,提出以小规模、目标口音多说话人数据对现成ZS-TTS进行定向微调的实证路线,并在两类SOTA模型(Chatterbox、CosyVoice 3)上验证其对口音保真度的提升;方法论突破在于将“口音迁移失败”明确分解为可通过领域/口音分布再对齐来修复的问题,并配套建立面向新加坡英语的评测框架与对比基线,使口音适配从主观现象转为可量化、可复现的微调与评估流程。
- SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks 🆕NEW
- 赛道归属: 语音与音频生成 / 多说话人 / 统一生成框架
- 核心创新点: 提出SwanTale统一框架,在单一系统内同时支持多说话人语音与音频的指令驱动(Instruct)和零样本(Zero-Shot)两类生成任务。核心创新在于将自然语言风格控制、无参考录音的声音设计、声学场景与音效融合、以及跨任务声音复用等能力统一建模,打破了现有系统在指令控制与零样本泛化之间相互割裂的局限,面向动画配音、音频剧、广告等实际生产场景提供端到端解决方案。
- Exploring Efficient Waveform Diffusion Models for Foley Sound Generation
- 赛道归属: 音频生成 / Foley音效生成 / 波形扩散模型
- 核心创新点: 针对现有波形扩散模型计算开销大、模型体量庞大的问题,系统性地探索了轻量化波形扩散架构在Foley音效生成任务中的可行性。核心贡献在于对时域与频域架构进行了效率导向的对比分析与设计优化,填补了紧凑型波形扩散模型在该领域研究不足的空白,为低资源场景下的高保真音效生成提供了可行路径。
- Extracting Voice Styles from Frozen TTS Models via Gradient-Based Inverse Optimization
- 赛道归属: 语音生成(TTS风格/音色克隆与风格迁移)
- 核心创新点: 提出一种针对“冻结的商用/发布版TTS模型缺失参考编码器”场景的风格向量反演方法:在不改动任何模型权重的前提下,将风格向量视为可优化输入,通过梯度下降直接求解能匹配目标说话人风格的style embedding。为避免对齐与时序建模带来的困难,使用对单段录音提取的WavLM特征做时间池化统计作为优化目标(丢弃时间轴),从而把“从音频到风格向量”的问题转化为稳定的逆优化/输入空间搜索,实现对封闭管线的风格提取与个性化合成。
GitHub
- [2026-08-05] huggingface/diffusers ⭐34231
- [2026-08-04] SamurAIGPT/Generative-Media-Skills ⭐3977 🆕NEW
- [2026-07-31] OpenMOSS/MOVA ⭐1090
- [2026-08-03] BinWang28/audio-ai-hub ⭐948
- [2026-08-04] apocas/restai ⭐513
HuggingFace Models
HuggingFace Datasets
- [2026-07-18] Manusagents/GPT-5.5-Gemini-3.1-Pro-Grok-4-Claude-Fable-5-Mythos-5-Qwen-3.7-Max-and-more-Distillation-Dataset
语言大模型
arXiv
- Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents
- 赛道归属: 教育AI / LLM评估与标注
- 核心创新点: 将传统ICAP认知参与框架扩展为7级细粒度量表,系统对比了人工标注、ICL(上下文学习)和反思型LLM智能体三种方法在协作对话认知参与度自动编码任务上的表现,首次引入"反思型LLM智能体"范式用于教育话语分析,揭示了不同自动化标注策略在细粒度认知分类任务中的能力边界。
- Developing and Validating the Spanish Version of the Large Language Models Dependency Scale (LLM-D12-SP)
- 赛道归属: LLM应用评测与心理测量(人机交互/安全治理)
- 核心创新点: 将“对LLM的心理依赖”从概念层面落到可量化的心理测量工具上,完成LLM依赖量表在西语人群中的跨文化适配与信效度验证;通过系统的心理计量学流程(条目筛选、结构效度/聚合与区分效度、信度与测量等价性等)构建可复用的评估框架,使组织/工作场景中LLM使用带来的依赖风险能够被标准化监测与比较,为后续干预与治理提供可操作的量化指标。
- How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories
- 赛道归属: 推理优化 / LLM可解释性
- 核心创新点: 提出步骤感知推理能量(SARE)框架,利用Centered Kernel Alignment(CKA)对CoT推理轨迹中每个独立步骤的隐层表示Gram矩阵进行几何度量,将推理计算努力从轨迹级标量细化至步骤级粒度,首次实现对链式思维中逐步计算深度的可量化解析,为推理过程的精细化理解提供了新工具。
- GPrune-LLM: Generalization-Aware Structured Pruning for Large Language Models 🆕NEW
- 赛道归属: 模型压缩 / 结构化剪枝
- 核心创新点: 提出了一种泛化感知的结构化剪枝框架 GPrune-LLM,核心突破在于识别神经元对校准数据集的"分布敏感性"异质性——将神经元分为稳定型(跨数据集排名一致)和敏感型(排名波动大)两类,并针对性地设计差异化重要性估计策略。对稳定型神经元直接使用单一校准集统计量,对敏感型神经元则引入多校准集聚合机制以消除校准偏差,从而在不增加显著计算开销的前提下提升剪枝后模型的跨任务泛化能力。
- Progressive Multimodal Alignment for Continual Instruction Tuning
- 赛道归属: 多模态持续学习 / 多模态大语言模型对齐
- 核心创新点: 针对多模态持续指令微调(MCIT)中被忽视的"投影器级遗忘"问题,提出渐进式多模态对齐框架(PMA)。核心突破在于:不再仅关注LLM主干的遗忘,而是专门设计机制约束视觉-语言投影器在视觉分布偏移和指令语义演变时的漂移,从而在持续学习过程中维持跨模态对齐的稳定性。
- Not All LLM Reasoning is Visible in the Chain-of-Thought
- 赛道归属: 可解释性与AI安全(链式思维/隐式推理评估)
- 核心创新点: 揭示“链式思维并不等于模型全部推理”的具体失效模式:在合成推理任务中向输出中插入语义无关的填充token(filler tokens)可显著提升多款前沿模型的正确率(最高提升约13个百分点),表明模型可能在不可见的内部表征/隐式轨迹中完成关键推理,而表面CoT仅是部分或事后合理化的文本外显;并通过跨13个模型、三类任务的系统评测,将“不可见推理”从概念讨论落到可复现实证与可量化对比,为安全审计与可解释性评估提出新的对抗/探针范式(用无关token作为干预变量检测推理外显性)。
- Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks 🆕NEW
- 赛道归属: LLM 推理评估 / 科学推理基准
- 核心创新点: 提出并系统定义了"Solution Hacking"这一新型失效模式——LLM 通过数值搜索、枚举、猜测或答案反向验证等无效捷径得到正确答案,但并未完成目标任务所要求的有效推导过程。该工作的方法论突破在于将评估维度从"最终答案正确性"扩展到"推理路径有效性",揭示了当前以最终答案准确率为核心指标的前沿科学基准存在系统性高估LLM推理能力的问题,并提出了针对推理过程合法性的检测与分析框架。
- Why Large Language Models Fail at Tabular Prediction 🆕NEW
- 赛道归属: LLM 表格数据预测 / 基础模型能力分析
- 核心创新点: 系统性地诊断了通用LLM在表格预测任务上失败的根本原因,而非仅描述现象。研究在纯推理模式(单次生成、全训练数据置于上下文)下对前沿LLM进行受控实验,从特征编码方式、上下文长度利用、数值处理能力、分布外泛化等多个维度定位失败的具体机制,为表格基础模型领域提供了明确的方法论指引,填补了"为何失败"这一核心理论空白。
- Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training 🆕NEW
- 赛道归属: LLM Agent 后训练 / 资源受限优化
- 核心创新点: 针对工具调用型LLM Agent产生的长多轮轨迹导致梯度训练显存开销极大的问题,提出基于协同协进化(Cooperative Coevolution)的无反向传播全参数后训练方法。核心创新在于将高维参数空间分解为多个子空间,通过协同进化策略并行优化各子空间,大幅降低进化策略(ES)在少量GPU环境下的训练时长,使其在资源受限场景下的训练效率可与梯度强化学习(RL)相媲美,同时保留ES无需存储激活值的显存优势。
- Learning-Based Collaborative MEC for LLM Inference with Soft-Deadline Awareness via Transformer-Enhanced PPO 🆕NEW
- 赛道归属: LLM 推理部署 / 移动边缘计算(MEC)调度优化
- 核心创新点: 针对移动边缘计算环境中LLM推理任务的软截止期约束问题,提出了一种结合Transformer增强型PPO(近端策略优化)的协作MEC调度框架。核心创新在于:①设计了带有弹性容忍度的"扩展截止期机制",避免单个子任务超时引发整体请求级联失败;②将Transformer引入PPO的策略网络,利用其序列建模能力捕捉多服务器间任务依赖关系与动态负载状态,从而在保障服务质量(QoS)的同时实现更优的资源调度决策。
GitHub
- [2026-08-05] sgl-project/sglang ⭐31288
- [2026-08-05] NVIDIA/TensorRT-LLM ⭐14298
- [2026-08-05] UKGovernmentBEIS/inspect_ai ⭐2472
- [2026-08-05] huhusmang/Awesome-LLMs-for-Vulnerability-Detection ⭐1207
- [2026-08-05] Emo-gml/Awesome-Mental-Health-LLMs ⭐108 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-08-04] HuggingFaceCode/stack-v3-train
- [2025-07-11] HuggingFaceFW/fineweb 🆕NEW
多模态大模型
arXiv
- HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 视觉感知增强
- 核心创新点: 从频谱分析视角揭示了VLM视觉编码器存在"频谱响应刚性"问题——预训练视觉编码器的逐层频谱响应模式在下游微调中几乎不发生变化,导致模型无法根据任务需求自适应地提取不同频率的视觉特征。基于此诊断,提出HAFI-VLM框架,通过引入频率自适应机制,使视觉编码器能够根据文本查询动态调整频谱提取策略,从而增强细粒度视觉感知能力。
- STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision 🆕NEW
- 赛道归属: 多模态理解 / 自动驾驶时空推理
- 核心创新点: 提出利用车载毫米波雷达作为监督信号来增强VLM时空推理能力的新范式,无需复杂预处理流程或昂贵人工标注。通过雷达数据提供的运动与速度真值,构建时空定位监督信号,使VLM获得对目标运动状态的强感知能力,有效弥合了现有方法在真实场景运动估计上的性能缺口,同时规避了合成数据带来的sim-to-real差距。
- Two Sides of the Same Coin: Co-Evolving Search for Cross-Task Attacks on Vision-Language Models 🆕NEW
- 赛道归属: 多模态安全 / 对抗攻击
- 核心创新点: 提出基于进化计算的跨模态对抗攻击框架,突破了现有攻击方法依赖单轨迹梯度优化和任务特定目标的局限。核心创新在于同时对文本空间和视觉空间进行协同进化搜索——文本侧进化生成硬提示,视觉侧自适应扰动图像,两侧相互协同,大幅扩展了搜索空间,显著提升了对统一VLM的跨任务迁移攻击成功率。
- RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos? 🆕NEW
- 赛道归属: 多模态理解 / 遥感视频理解
- 核心创新点: 针对遥感视频理解领域缺乏统一评测标准的空白,构建了RSVideo基准,专门评估VLM在连续遥感视频上的理解能力,覆盖目标属性变化、短时活动识别和场景演变等任务维度。该基准填补了现有评测体系仅关注单张遥感图像或长时离散观测的不足,为遥感视频VLM研究提供了系统性评估框架。
- CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models 🆕NEW
- 赛道归属: 视频理解 / 视觉Token压缩
- 核心创新点: 提出CRAFT递归自适应融合压缩方法,解决视频VLM中视觉Token数量庞大导致预填充阶段计算开销剧增的问题。核心创新在于递归式自适应融合机制——通过多轮自适应合并时空冗余Token,在保留关键细节的同时实现高压缩比,克服了现有方法在高压缩率下关键信息丢失的缺陷,且无需引入额外模块或大规模重训练。
- Coverage-Driven Adaptive Keyframe Selection for Video Understanding 🆕NEW
- 赛道归属: 视频理解 / 关键帧选择
- 核心创新点: 提出覆盖率驱动的自适应关键帧选择方法,针对不同查询相关帧分布差异大的问题,引入覆盖率指标来衡量所选关键帧对查询相关内容的覆盖程度。相比现有逐帧打分再筛选的方式,该方法能够自适应地确定关键帧数量与分布,在大幅减少LVLM推理计算开销的同时,避免因固定采样策略导致的关键信息遗漏。
- Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations 🆕NEW
- 赛道归属: 多模态可解释性 / 表征分析
- 核心创新点: 提出LENS(局部邻域子空间解释)方法,突破了现有VLM可解释性研究依赖全局线性方向分析的局限。核心创新在于将VLM激活分解为局部低秩高斯邻域,捕捉"全局高维但局部低维"的表征结构,从而揭示图像Patch与文本Token在共享残差流中的局部几何交互机制,为理解跨模态表征融合提供了更精细的分析工具。
- Attention-Steered Vision-Language Models for Sign Language Translation 🆕NEW
- 赛道归属: 多模态理解 / 手语翻译
- 核心创新点: 针对VLM在手语翻译中存在的时空视觉定位失效问题,提出注意力引导机制。发现标准下一Token交叉熵损失无法为模型提供"何时何处关注"的监督信号,导致模型忽视手语相关区域和帧。创新性地引入注意力引导训练目标,显式监督模型将注意力集中于手语动作的关键空间区域和时间帧,从而提升手语视频的细粒度时空理解与翻译精度。
- QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models
- 赛道归属: 多模态安全与对抗攻击(红外视觉-语言模型)
- 核心创新点: 提出QR结构化热触发器(QR-STT)框架,利用QR码的功能性区域结构作为热扰动载体,在无需训练、黑盒条件下实现对红外视觉-语言模型的定向语义操控。核心突破在于将QR码的视觉结构与热成像扰动相结合,在保持QR码可扫描功能的同时,隐蔽地干扰跨模态语义对齐,揭示了IR-VLM在结构化热扰动下的安全脆弱性。
- MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models 🆕NEW
- 赛道归属: 多模态理解 / 鲁棒性评测
- 核心创新点: 提出MMOOC基准,专门评估多模态大模型在上下文偏移场景下的鲁棒性。核心创新在于区分两类不同性质的上下文偏移:真正的"脱离上下文(OOC)"问题(主体级别偏移,模型应拒绝回答)与"偏移但仍在上下文内(Shifted IC)"问题(非主体上下文偏移,模型应正常作答),填补了现有基准混淆两类场景、忽视可回答偏移案例的评测盲区,为衡量MLLM的情境感知与拒答能力提供了更精细的评测维度。
GitHub
- [2026-08-05] Blaizzy/mlx-vlm ⭐5298
- [2026-08-05] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1772
- [2026-08-03] waybarrios/vllm-mlx ⭐1488
- [2026-08-03] ZhaochongAn/GFS-VL ⭐65
- [2026-08-02] THUSI-Lab/GameVerse ⭐51
强化学习
arXiv
- LA-RL: Label-Aware Self-Reflection for Reinforcement Learning in Information Extraction
- 赛道归属: 多模态/LLM信息抽取的强化学习对齐(结构化IE、反思式RL)
- 核心创新点: 提出LA-RL(Label-Aware Reflective RL)将“自我反思”从自由文本纠错对齐到结构化抽取空间:用结果监督把错误细分为缺失span、标签错误、边界不匹配、关系类型非法、论元顺序颠倒等可操作的失败类型,并据此生成面向标签/结构约束的反思与修正信号;通过将反思过程显式绑定到结构化输出的可验证属性,提升纠错的可定位性与可学习性,避免仅“指出有错但无法精确修复”的反思失配问题。
- IACM-RL: Intent-Aware Context Management and Reinforcement Learning for Complex Tool Invocation under Dynamic Intent Fluctuations 🆕NEW
- 赛道归属: 智能体工具调用 / LLM强化学习后训练
- 核心创新点: 提出IACM-RL框架,专门应对长时序工具调用中的动态用户意图噪声问题。核心突破在于:引入意图感知的上下文管理机制(IACM),通过动态过滤和压缩历史上下文中的过时约束,防止模型注意力被稀释;结合强化学习策略优化,有效规避意图偏移和无限API循环等灾难性失败模式,在复杂真实环境下显著提升工具调用的鲁棒性。
- Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning 🆕NEW
- 赛道归属: 离线强化学习 / 策略优化
- 核心创新点: 提出行为优势修正策略评估(BAC-PE)方法,利用行为策略的Q函数对学习策略的Q函数进行校正,从双向同时抑制悲观保守性和过估计偏差,解决离线RL中分布偏移导致Q值估计失真的根本问题。进一步将扩散模型(Diffusion Policy)引入离线RL策略表示,结合BAC-PE实现更精准的策略优化方向,在高维连续动作空间中展现出更强的表达能力与稳定性。
- Instruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-Distillation 🆕NEW
- 赛道归属: LLM强化学习后训练 / 探索策略
- 核心创新点: 提出指令条件探索(ICE)方法,针对LLM动作空间结构与经典RL的本质差异,设计了一种利用预训练LLM广泛知识主动生成多样化训练经验的探索机制。核心创新在于通过非对称强化学习(Asymmetric RL)与自蒸馏(Self-Distillation)相结合,在训练时以指令为条件引导策略有意识地探索多样轨迹,同时通过自蒸馏防止探索过度偏离基础模型能力,有效缓解LLM后训练中探索不足的问题。
- LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation 🆕NEW
- 赛道归属: 代码生成强化学习 / GPU内核生成
- 核心创新点: 提出LEAP框架,专门解决将GRPO等无评论家范式应用于CUDA内核生成时面临的奖励稀疏性问题。核心突破在于:设计自适应剪枝机制(Adaptive Pruning),从GPU执行环境反馈中提取精细化的中间奖励信号,突破二元pass/fail奖励的信息瓶颈;通过精简环境反馈(Lean Environment-Feedback)降低RL训练中沙箱验证的计算开销,使LLM在低级系统编程任务上的RL后训练变得可行且高效。
- Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning 🆕NEW
- 赛道归属: LLM强化学习后训练 / 灾难性遗忘缓解
- 核心创新点: 针对标准全策略KL正则化在LLM后训练中过度限制探索和目标任务学习的缺陷,提出保塑性KL正则化(Plasticity-Preserving KL Regularization)方法。核心创新在于区分策略分布中与能力保留相关和无关的部分,对不同响应区域施加非均匀的KL约束强度,在防止已有能力退化(能力保留)的同时,为新目标任务的学习保留足够的策略可塑性,实现遗忘抑制与探索能力之间的精细平衡。
- RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning 🆕NEW
- 赛道归属: Web智能体 / 强化学习训练
- 核心创新点: 提出RMSWeb框架,系统性解决紧凑型Web智能体在SFT后RL训练阶段的三大痛点:①引入反思机制(Reflection)从低效轨迹中提炼高质量训练信号;②通过失败模式挖掘(Failure-Mode Mining)主动识别并针对性强化智能体的薄弱决策环节;③设计Salvage-DS数据策略,对被拒绝的动作组进行补救性数据构造,解决组相对RL中因动作级奖励设计不当导致的弱更新或误导性更新问题,显著提升小参数量Web智能体的训练效率与任务成功率。
- Inference-Time Policy Alignment for Fair Reinforcement Learning 🆕NEW
- 赛道归属: 公平强化学习 / 推理时策略对齐
- 核心创新点: 提出推理时策略对齐(Inference-Time Policy Alignment)方法,突破传统公平RL需要在训练前预知偏好约束的局限。核心创新在于无需重新训练已部署的RL智能体,通过在推理阶段动态注入利益相关方偏好(如公平性准则),实时调整策略的决策分布,实现对新性能标准的即时适配。该方法将策略对齐从训练时前置转移至推理时按需执行,大幅降低了已部署智能体适应新公平性要求的成本与刚性。
- WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
- 赛道归属: 机器人控制 / 视觉-语言-动作模型强化学习后训练
- 核心创新点: 提出世界批评模型(WCM),针对VLA模型RL后训练中Critic仅依赖单帧观测的根本性缺陷,设计了一种能高效融合历史观测序列的价值估计器。核心突破在于通过压缩历史帧的高维表示(而非直接拼接),以线性而非指数的复杂度引入时序上下文信息,从而更好地匹配机器人控制中部分可观测的本质,显著提升Critic的价值估计质量。
- LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback
- 赛道归属: 多目标强化学习 / 大模型对齐与偏好学习
- 核心创新点: 提出LEMUR框架,将多目标强化学习(MORL)与人类偏好反馈相结合,解决了现实场景中多个竞争性目标(如性能与效率)的奖励函数难以精确指定的问题。核心创新在于无需预先定义每个目标的标量奖励函数,而是直接从偏好反馈中学习多维度奖励向量,并在Pareto前沿上进行策略优化,实现了对多目标权衡的灵活、数据驱动式建模。
GitHub
- [2026-08-04] Farama-Foundation/Gymnasium ⭐12279
- [2026-08-05] rllm-org/rllm ⭐5759
- [2026-08-05] google-deepmind/dm_control ⭐4658 🆕NEW
- [2026-08-05] RLinf/RLinf ⭐4424
- [2026-08-05] radixark/miles ⭐1879
HuggingFace Datasets
- [2026-07-31] Qyrou/reasoning-corpus-4K-5M-v1
HuggingFace Spaces
世界动作模型
arXiv
- Faster-WAM: Do World Action Models Need Deep Action Modules? 🆕NEW
- 赛道归属: 世界动作模型 / 机器人策略推理优化
- 核心创新点: 提出"Dock of Transformer (DoT)"设计原则,将预训练视频Transformer作为表征中枢,通过轻量级外挂模块(而非深度耦合的动作模块)完成动作预测。核心突破在于打破了现有WAM中动作模块深度与视频骨干深度强绑定的设计惯例,实现了在保持预测性能的同时大幅降低计算开销和推理延迟,验证了深度动作模块对WAM并非必要条件。
- ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
- 赛道归属: 机器人操控 / 世界动作模型(World Action Model)
- 核心创新点: 该工作针对现有世界动作模型(WAM)在视觉分布偏移场景下鲁棒性不足的问题,提出了 ST-WAM(语义-时序世界动作模型)。核心创新在于识别并定义了"训练分布幻觉"(Training-Distribution Hallucination)现象——即当输入观测存在视觉域偏移时,基于像素生成的未来预测会幻化出训练域内容,导致动作预测失效。为此,ST-WAM 将未来预测从像素空间解耦,转向语义-时序表征空间,通过建模动作相关的状态转移语义特征而非任务无关的视觉细节,从根本上切断了视觉外观变化对动作推理的干扰,从而在视觉分布偏移条件下实现更鲁棒的机器人操控。
- From World Models to World Action Models: A Concise Tutorial for Robotics
- 赛道归属: 机器人世界模型/世界动作模型(World Action Model)综述与统一框架(多模态表征学习 + 模型式强化学习/规划)
- 核心创新点: 以“教程+统一视角”而非传统综述的方式,系统澄清机器人语境下“world”的构成要素,并给出世界模型(World Model)与世界动作模型(World Action Model)的明确定义与边界;进一步提出一个可对齐比较的统一分析框架,用同一套维度刻画不同路线(如空间智能模型、JEPA 等)在表征形态、预测目标(状态/潜变量/能量或一致性目标)、动作条件化方式、以及在机器人系统中承担的功能位置(感知表征、预测、规划/控制接口)上的差异,从而把分散的研究范式映射到可复用的设计空间,帮助研究者更直接地定位“从世界模型到可执行动作的世界动作模型”所需的关键模块与接口设计。
- CoWAM: Coordination Contracts for Selective Policy Intervention with WAMs 🆕NEW
- 赛道归属: 世界动作模型 / 双臂机器人协调控制
- 核心创新点: 提出CoWAM选择性干预框架,将WAM生成的未来预测与实际策略执行之间的决策桥接问题形式化为"协调契约"。创新性地引入类型化可接受性检验、事件条件验证和校准干预门控三重机制,将同步约束、角色兼容性和碰撞收敛等双臂协调语义显式编码为可验证合约,仅在契约违反时触发干预,从而在保留原始策略名义行为的前提下有选择性地修正动作,解决了"合理预测未来≠应当改变当前动作"的核心矛盾。
- SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space 🆕NEW
- 赛道归属: 世界动作模型 / 几何感知策略空间建模
- 核心创新点: 提出SG-WAM,构建一个同时满足"动作对齐"与"几何感知"双重要求的自引导世界建模框架。核心突破在于设计了一个联合结构化的策略空间,既避免了观测空间目标的感知冗余负担,又克服了现有辅助潜空间缺乏几何结构的缺陷,通过自引导机制使未来状态预测与动作生成在几何意义上协同对齐,从而更精准地捕捉动作对场景的空间变化影响。
GitHub
- [2026-08-04] OpenMOSS/Awesome-WAM ⭐1221
- [2026-08-04] DravenALG/awesome-vla-wam ⭐927
- [2026-08-03] shaohua-pan/StarWAM ⭐203
- [2026-08-04] wdrink/RepWAM ⭐60
- [2026-07-31] neoteai/N0-TWAM ⭐53 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-08-05 01:47:31