AI 每日进展速报 - 2026-08-04
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation
- 赛道归属: 文生图(Prompt优化/提示词自动改写与对齐)
- 核心创新点: 提出一种“图像落地”的提示词精炼框架,通过让模型在生成图像后基于图像内容进行自诊断与自奖励(self-rewarding),把“提示词是否有效”从纯文本层面的启发式改写,转为由生成结果驱动的闭环优化;同时强调可学习、可复用的提示词优化策略(而非一次性prompt扩写),使优化过程能够沉淀为通用的prompt refinement policy,提升对不同提示与场景的泛化能力与稳定性。
- Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图 / 扩散模型推理优化
- 核心创新点: 针对多模态扩散Transformer(MMDiT,如SD3、SD3.5、FLUX.1)中存在的"提示遗忘"现象(prompt forgetting)提出系统性分析与解决方案。研究发现,文本分支中的语义信息随网络深度增加而逐渐消退。为此,提出"提示重注入"(Prompt Reinjection)机制,在扩散Transformer的深层重新引入原始文本提示的语义表示,从而在不修改模型权重的前提下,有效缓解文本语义在去噪过程中的衰减问题,提升生成图像与文本描述的语义一致性。
- MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation
- 赛道归属: 文生图(可控生成/区域级控制与组合生成)
- 核心创新点: 提出面向SDXL的区域级可控生成机制,通过“Mask Attention”在注意力计算中显式引入空间掩码约束,实现按区域绑定文本条件,从而降低多对象场景中属性串扰与对象混淆;在保持U-Net扩散骨干高效性的前提下增强跨区域/全局协调能力,避免直接切换到高成本的Transformer扩散架构,以较低额外计算实现更可靠的组合式生成与可控布局。
- Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time
- 赛道归属: 文生图 / 推理优化
- 核心创新点: 提出在推理阶段同时对初始噪声和注意力机制进行双重干预的无训练方法。通过"锚定"(Anchoring)策略优化初始噪声采样,使其更贴近目标语义分布;通过"引导"(Steering)策略在去噪过程中动态调整交叉注意力,强化文本与图像区域的对齐。两者协同作用,在不修改模型权重的前提下显著提升复杂组合提示下的文本-图像语义忠实度。
- OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation
- 赛道归属: 文生图(物理常识评测与提示/生成优化)
- 核心创新点: 提出以知识图谱驱动的物理常识基准体系,将“物理常识”从粗粒度描述细化为可诊断、可定位的物理原则/关系维度,实现对模型在具体物理规律掌握程度的结构化评测;同时针对文生图生成的高随机性导致的提示优化“梯度幻觉”(优化器被偶发伪影误导)问题,引入更偏向群体/集体的优化与稳健评估机制,通过跨样本/跨随机种子的聚合信号抑制瞬时伪影干扰,从而更可靠地发现系统性物理缺陷并进行针对性改进。
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- 赛道归属: 文生图(少步生成/扩散蒸馏与推理加速)
- 核心创新点: 提出IB-Flow,用信息瓶颈(Information Bottleneck)原则指导对CFG(Classifier-Free Guidance)轨迹的蒸馏,在少步生成场景下不再采用“全局静态指导强度”的粗粒度注入方式,而是通过信息约束/选择性保留与文本对齐相关的关键信息、抑制与生成无关或冗余的引导成分,实现更细粒度、动态的CFG蒸馏与引导分配;从而在极少采样步数下兼顾语义对齐与画质稳定性,降低推理延迟并缓解少步蒸馏常见的失真与不稳定问题。
- Evaluation-Verification Reward for Consistent Multi-Reference Image Editing 🆕NEW
- 赛道归属: 图像编辑 / 多参考图像编辑 / 强化学习对齐
- 核心创新点: 针对多参考图像编辑任务中缺乏合适奖励模型的核心瓶颈,提出"评估-验证奖励"(Evaluation-Verification Reward)框架。该方法设计了能够捕捉多图像关系约束的奖励信号,解决了将强化学习直接应用于多参考编辑时因奖励模型不适配而导致的视觉一致性差和整体和谐性不足的问题。通过将多模态大模型的评估能力与验证机制相结合,构建出适用于多参考场景的RL训练信号,显著提升跨参考图像的视觉一致性与编辑质量。
- SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion
- 赛道归属: 文生图 / 基础模型训练
- 核心创新点: 提出"语义优先扩散"(Semantic-First Diffusion)新范式,将语义信息显式注入潜在扩散建模的早期阶段,引导模型优先学习高层语义结构再细化视觉细节。基于此范式构建了 SeFi-Image 文生图基础模型,实验覆盖多个模型规模,验证了该范式在大分辨率、大规模模型上的有效性,并证明语义引导可显著加速训练收敛,降低训练资源消耗。
- SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation 🆕NEW
- 赛道归属: 图像编辑 / 遥感卫星图像编辑 / 数据构建
- 核心创新点: 针对卫星图像编辑领域缺乏大规模标注数据的痛点,提出SatEdit框架,实现从无标注遥感图像中自动构建训练监督数据。核心创新在于:利用分割基础模型自动生成对象掩码,再借助视觉语言模型(VLM)对分割区域进行语义标注,从而在无需人工标注的情况下构建掩码条件化的编辑训练对。该方法将分割基础模型与VLM的能力有机结合,突破了遥感图像编辑数据稀缺的瓶颈,实现了对卫星图像中目标对象的空间精确、语义可控的编辑。
- Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives
- 赛道归属: 文生图 / 图像反演(Image Inversion)
- 核心创新点: 提出"双重反演"(Dual Inversion)框架,同时从提示(Prompt)和噪声(Noise)两个维度对目标图像进行反向工程。针对现有方法的缺陷,设计了稳定可解释的提示优化路径,并引入噪声空间的协同校正机制,使二者互补——提示端保证语义可读性与可编辑性,噪声端弥补提示表达能力不足导致的视觉细节损失,从而在无需大量提示工程的情况下实现高保真图像重建与编辑。
GitHub
- [2026-08-04] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13052
- [2026-08-03] ArthurHub/HTML-Renderer ⭐1389
- [2026-08-03] kadevin/ilab-conjure ⭐661
- [2026-08-03] shinpr/mcp-image ⭐145 🆕NEW
- [2026-08-04] yuji-hatakeyama/opencode-gpt-imagegen ⭐67
HuggingFace Models
HuggingFace Datasets
- [2026-07-30] unstonio/pixelgpt-24x24-20k
视频生成/编辑
arXiv
- Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation
- 赛道归属: 视频生成(实时交互式长视频生成)
- 核心创新点: 提出了一种支持实时交互的长视频生成"Live Model"架构。核心突破在于:①用户可在生成过程中随时切换提示词并即时生效,实现真正的交互式生成;②设计了有界多尺度记忆机制(bounded multi-scale memory),跨分块保持主体、场景和风格的一致性,支持小时级别的超长视频滚动生成而不出现明显质量退化;③同时兼容文生视频、图生视频和视频续写多种模式,并支持多语言提示词。
- CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling
- 赛道归属: 视频生成(多镜头长视频生成 / 电影级叙事视频生成)
- 核心创新点: 提出无需训练(training-free)的统一框架,同时解决多镜头生成、角色/场景细粒度可控性和长时序一致性三大挑战。核心方法基于对现有文生视频扩散模型的键值注意力(key-value attention)机制的重新利用,通过参考帧可控的跨镜头注意力传播,在不进行任何微调或定制化训练的前提下,实现角色外观和场景风格在多个镜头间的一致性保持,为电影级叙事视频生成提供了轻量化的统一解决方案。
- MoRoute: Dynamic Routing for In-Context Multimodal Video Generation 🆕NEW
- 赛道归属: 视频生成与编辑(多模态条件视频生成)
- 核心创新点: 提出 MoRoute 动态路由机制,用于解决多模态视频生成中如何高效融合视觉语言模型(VLM)层级化多模态表征与视频扩散 Transformer 的核心挑战。其方法论突破在于:摒弃传统静态、固定的跨模态特征注入方式,转而设计动态路由策略,根据不同输入条件组合(文本、图像、视频的任意组合)自适应地选择和分配 VLM 各层级表征到扩散模型的对应模块,从而在单一统一模型框架下同时支持多种视频生成与编辑任务,实现多任务间互补数据与生成先验的共享,提升了模型对多样化条件输入的理解与生成能力。
- FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring
- 赛道归属: 视频生成(自回归长视频生成 / 推理稳定性优化)
- 核心创新点: 从频域视角重新诠释自回归视频扩散模型的误差累积问题,发现长程生成中的颜色漂移、运动停滞等退化现象本质上表现为低频能量的系统性偏移。在此基础上提出"频谱自锚定"(Spectral Self-Anchoring)方法——FreqForcing:在自回归推理过程中,利用历史帧的低频谱统计信息对当前生成帧进行频域约束,抑制低频能量漂移,从而在无需额外训练的情况下显著缓解长视频生成的视觉崩溃问题。同时深入分析了注意力汇聚(attention sink)在频域中的作用机制。
- Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory
- 赛道归属: 视频生成(实时流式音视频联合生成)
- 核心创新点: 提出Ripple系统,核心创新在于跨模态循环记忆机制(cross-modal recurrent memory):将音频与视频的历史上下文以循环状态的形式压缩存储,实现音视频两个模态之间的长程依赖建模,同时大幅降低流式推理的计算开销。相比已有流式音视频生成方法,Ripple在保持实时性的同时支持长时序生成,并通过跨模态记忆保证音视频的时序同步与语义一致性,填补了高质量、低延迟、长时序音视频联合生成的空白。
- TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models
- 赛道归属: 视频生成(文生视频 / 时序语义控制)
- 核心创新点: 识别并定义了文生视频扩散模型中一种新的失败模式——"时序先验抑制"(Temporal Prior Suppression, TPS):当提示词描述一个持续背景场景叠加一个后发事件时(如"海浪冲垮沙堡"),早期场景的强先验会主导交叉注意力,导致后段事件无法在对应帧中正确呈现。针对此问题提出时序先验解耦(Temporal Prior Decoupling, TPD)方法,通过在扩散去噪过程中对不同时间段的文本条件进行显式解耦与分段注意力调制,使早期先验与后发事件的语义信号各自作用于对应的时间帧,从而实现复杂时序叙事提示词的精准视频生成。
- Parallel Decoding Distillation for Fast Image and Video Generation
- 赛道归属: 视频生成(扩散/流模型加速与蒸馏)
- 核心创新点: 提出一种面向图像/视频扩散或流模型的“并行解码蒸馏”(Parallel Decoding Distillation)加速框架,核心在于用并行化的解码/采样路径来训练少步数生成器,从而绕开现有加速蒸馏中常用但难优化的VSD与对抗损失;通过更稳定的蒸馏目标与训练机制,缓解对抗训练带来的模式崩塌问题,在显著减少采样步数与计算开销的同时,尽量保持视频生成的多样性与运动一致性(减少“缺乏运动/多样性下降”的退化)。
- FilmBench: A Film-Grade Benchmark for Cinematic Video Generation
- 赛道归属: 视频生成评测基准 / Benchmark(电影级生成质量评估)
- 核心创新点: 构建面向“电影工业标准”的视频生成评测体系,核心突破在于将评估维度从通用基准常用的粗粒度指标(整体画质、文本一致性、时序平滑等)升级为更贴近专业影视制作与审美判断的“Cinematic Language”评价框架;同时针对现有基准依赖网页提示词/LLM模板与通用多模态打分器的问题,引入更贴合电影语境的任务设计与评价流程,旨在更真实地区分模型在镜头语言、叙事表达与专业制作质感等方面的能力差异,从而提升评测的可解释性与行业相关性。
- Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
- 赛道归属: 视频生成推理优化 / 加速(扩散Transformer注意力稀疏化)
- 核心创新点: 提出训练无关(training-free)的“在线注意力稀疏化”推理加速框架,在不改动/不重训生成模型的前提下,动态选择性计算注意力中的部分K-V块以降低长序列注意力开销;相较固定比例Top-k块选择的刚性预算与高路由成本,该方法强调“按需、按内容”的自适应稀疏策略与更轻量的路由机制,在保证生成质量(注意力近似精度)与时序一致性的同时,提高稀疏选择的稳定性与可预测性,从而更有效地缓解视频扩散Transformer推理瓶颈。
- VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation
- 赛道归属: 视频生成(物理可控/物理一致性)/ 条件控制
- 核心创新点: 提出“视觉上下文物理推理(Visual In-Context Physics Reasoning)”范式,用视频示例而非仅文本/单图来提供连续、关系型的物理条件(材质响应、接触交互、形变、运动轨迹等),突破传统条件输入在物理行为表达上的“条件瓶颈”;通过将物理规律与交互模式以可演示的视觉上下文注入生成过程,使模型能够在生成时进行更贴近真实世界的物理行为对齐与可控合成,提升视频在接触、动力学与形变等方面的物理可信度与可操控性。
GitHub
- [2026-08-03] Anil-matcha/Open-Generative-AI ⭐25502
- [2026-08-04] hao-ai-lab/FastVideo ⭐3913
- [2026-08-03] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1766
- [2026-08-03] AceDataCloud/Nexior ⭐386
- [2026-08-03] wordghost1234/agnes-ai-storyboard-studio ⭐156 🆕NEW
音频生成
arXiv
- Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model
- 赛道归属: 人脸驱动语音合成(Face-to-Speech)/ 零样本语音生成
- 核心创新点: 提出了一种无需参考音频的人脸到语音(F2S)合成框架,核心突破在于通过轻量级 Face Adapter 模块结合人脸编码器高层块的软调优(soft-tuning),将人脸识别特征对齐到冻结的 StyleTTS 扩散模型的风格隐空间(style latent space)中。该方法无需修改预训练 TTS 主干网络,仅通过隐空间适配实现跨模态(视觉→声学)的零样本迁移,从而从单张静态人脸图像预测出与人物外貌相符的合理语音风格,有效解决了历史人物、虚拟角色等无参考音频场景下的语音合成难题。
- Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm
- 赛道归属: 语音生成(TTS)/ 可控语音合成 / 低延迟语音建模
- 核心创新点: 提出面向生产的多阶段协同训练范式,将语言模型(LM)的内容建模与Flow-Matching(FM)的声学生成进行五阶段渐进式联合优化,以同时提升内容一致性、音色相似度、韵律自然度与鲁棒性;引入约12.5Hz低帧率语音tokenizer,在尽量保持音质与可懂度的前提下显著降低序列长度,从而减少推理延迟并提升效率;整体上通过“低帧率离散表征 + 分阶段对齐LM与生成器目标”的系统化设计,实现更强可控性与多语覆盖下的稳定合成。
- Singlish, Can or Not? Fine-Tuning and Evaluating Zero-Shot TTS for Singapore English
- 赛道归属: 语音生成(TTS)/ 口音与方言适配 / Zero-shot TTS微调与评测
- 核心创新点: 针对零样本TTS在区域口音(Singlish)上“保音色但口音被拉回通用英语”的系统性缺陷,提出以小规模、目标口音多说话人数据对现成ZS-TTS进行定向微调的实证路线,并在两类SOTA模型(Chatterbox、CosyVoice 3)上验证其对口音保真度的提升;方法论突破在于将“口音迁移失败”明确分解为可通过领域/口音分布再对齐来修复的问题,并配套建立面向新加坡英语的评测框架与对比基线,使口音适配从主观现象转为可量化、可复现的微调与评估流程。
- Exploring Efficient Waveform Diffusion Models for Foley Sound Generation 🆕NEW
- 赛道归属: 音频生成 / Foley音效生成 / 波形扩散模型
- 核心创新点: 针对现有波形扩散模型计算开销大、模型体量庞大的问题,系统性地探索了轻量化波形扩散架构在Foley音效生成任务中的可行性。核心贡献在于对时域与频域架构进行了效率导向的对比分析与设计优化,填补了紧凑型波形扩散模型在该领域研究不足的空白,为低资源场景下的高保真音效生成提供了可行路径。
- Extracting Voice Styles from Frozen TTS Models via Gradient-Based Inverse Optimization
- 赛道归属: 语音生成(TTS风格/音色克隆与风格迁移)
- 核心创新点: 提出一种针对“冻结的商用/发布版TTS模型缺失参考编码器”场景的风格向量反演方法:在不改动任何模型权重的前提下,将风格向量视为可优化输入,通过梯度下降直接求解能匹配目标说话人风格的style embedding。为避免对齐与时序建模带来的困难,使用对单段录音提取的WavLM特征做时间池化统计作为优化目标(丢弃时间轴),从而把“从音频到风格向量”的问题转化为稳定的逆优化/输入空间搜索,实现对封闭管线的风格提取与个性化合成。
- Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis
- 赛道归属: 多模态语音生成(视觉驱动/辅助TTS)/ 情感与对话式语音合成
- 核心创新点: 将面部表情作为关键情感线索显式引入对话式语音合成,面向“同一句话在不同表情/情绪下应生成不同韵律与表达”的问题,提出更细粒度的面部表情建模以驱动/约束语音生成,从而提升同理性与表达自然度;同时针对缺乏大规模自然对话的语音-视觉配对数据这一瓶颈,强调构建/利用包含语音与视觉模态的对话数据与训练策略,使模型能够学习表情到韵律、语气与情感强度的映射,弥补传统仅用文本/音频条件导致的情感信息缺失。
- Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers
- 赛道归属: 音频生成 / 语音合成(TTS)/ 端侧推理优化
- 核心创新点: 提出了一种解耦时序深度扩散Transformer(Decoupled Temporal Depth Diffusion Transformers)架构,用于在苹果AMX协处理器的严格算力与内存预算下实现高保真音频合成。核心创新在于将语义音频Token到波形的转换过程(Detokenizer)进行内存高效化设计:通过在时序维度与深度维度上解耦扩散Transformer的计算路径,显著降低峰值内存占用,同时维持生成质量。该方案直接驱动Apple Siri Expressive Voices的完全端侧实时语音合成能力,实现了大模型语音系统在移动端AMX硬件上的实际部署落地,是工业级端侧TTS推理优化的重要工程与算法突破。
- AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis
- 赛道归属: 对话式语音合成(Conversational Speech Synthesis, CSS)/ 情感语音生成与对话上下文建模
- 核心创新点: 提出 AuEmoChat 框架,针对 CSS 中“情感表达不真实”和“多轮上下文冗余干扰理解”两大瓶颈:一方面突破固定小规模情感标签空间的限制,强调更细粒度/更真实的情感理解与渲染机制以提升情感自然度与一致性;另一方面通过抑制/过滤多模态对话历史中的冗余 token来减少上下文噪声,增强对话语境建模能力,从而在多轮人机交互场景中实现更连贯、更可信的情感语音合成。
- Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models 🆕NEW
- 赛道归属: 音频生成 / 文本到音频生成 / 指令跟随优化
- 核心创新点: 针对文本到音频模型在多音效事件及时序关系指令跟随上的薄弱环节,提出了一套基于音频感知大语言模型(ALLM)的细粒度反馈框架。创新性地将ALLM作为"细粒度评判器",对目标音效事件的存在性与时序关系进行显式验证,从而构建指令级别的训练监督信号,突破了现有方法仅依赖全局相似度或感知质量评估的局限,实现了更精准的指令对齐训练。
- BeatEdit: Symbolic Music Generation as Explicit Editing 🆕NEW
- 赛道归属: 音乐生成 / 符号音乐编辑 / 生成式音乐创作
- 核心创新点: 将符号音乐生成范式从"从零生成完整序列"转变为"显式编辑"模式,以更贴近真实音乐创作中迭代修改的工作流。核心突破在于表示层面的重新设计——指出传统事件型音乐编码缺乏支持显式编辑所需的结构性属性,并提出了新的编码方案以赋予模型对局部片段进行选择性修改的能力,将文本领域成熟的编辑范式迁移至符号音乐领域,填补了该方向的研究空白。
GitHub
- [2026-08-03] huggingface/diffusers ⭐34227
- [2026-08-03] SamurAIGPT/Generative-Media-Skills ⭐3970
- [2026-07-31] OpenMOSS/MOVA ⭐1089
- [2026-08-03] BinWang28/audio-ai-hub ⭐948 🆕NEW
- [2026-08-03] apocas/restai ⭐513
HuggingFace Models
- MiniMaxAI/MiniMax-H3 🆕NEW
HuggingFace Datasets
- [2026-07-18] Manusagents/GPT-5.5-Gemini-3.1-Pro-Grok-4-Claude-Fable-5-Mythos-5-Qwen-3.7-Max-and-more-Distillation-Dataset
语言大模型
arXiv
- Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents 🆕NEW
- 赛道归属: 教育AI / LLM评估与标注
- 核心创新点: 将传统ICAP认知参与框架扩展为7级细粒度量表,系统对比了人工标注、ICL(上下文学习)和反思型LLM智能体三种方法在协作对话认知参与度自动编码任务上的表现,首次引入"反思型LLM智能体"范式用于教育话语分析,揭示了不同自动化标注策略在细粒度认知分类任务中的能力边界。
- Developing and Validating the Spanish Version of the Large Language Models Dependency Scale (LLM-D12-SP)
- 赛道归属: LLM应用评测与心理测量(人机交互/安全治理)
- 核心创新点: 将“对LLM的心理依赖”从概念层面落到可量化的心理测量工具上,完成LLM依赖量表在西语人群中的跨文化适配与信效度验证;通过系统的心理计量学流程(条目筛选、结构效度/聚合与区分效度、信度与测量等价性等)构建可复用的评估框架,使组织/工作场景中LLM使用带来的依赖风险能够被标准化监测与比较,为后续干预与治理提供可操作的量化指标。
- How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories 🆕NEW
- 赛道归属: 推理优化 / LLM可解释性
- 核心创新点: 提出步骤感知推理能量(SARE)框架,利用Centered Kernel Alignment(CKA)对CoT推理轨迹中每个独立步骤的隐层表示Gram矩阵进行几何度量,将推理计算努力从轨迹级标量细化至步骤级粒度,首次实现对链式思维中逐步计算深度的可量化解析,为推理过程的精细化理解提供了新工具。
- Progressive Multimodal Alignment for Continual Instruction Tuning
- 赛道归属: 多模态持续学习 / 多模态大语言模型对齐
- 核心创新点: 针对多模态持续指令微调(MCIT)中被忽视的"投影器级遗忘"问题,提出渐进式多模态对齐框架(PMA)。核心突破在于:不再仅关注LLM主干的遗忘,而是专门设计机制约束视觉-语言投影器在视觉分布偏移和指令语义演变时的漂移,从而在持续学习过程中维持跨模态对齐的稳定性。
- Not All LLM Reasoning is Visible in the Chain-of-Thought
- 赛道归属: 可解释性与AI安全(链式思维/隐式推理评估)
- 核心创新点: 揭示“链式思维并不等于模型全部推理”的具体失效模式:在合成推理任务中向输出中插入语义无关的填充token(filler tokens)可显著提升多款前沿模型的正确率(最高提升约13个百分点),表明模型可能在不可见的内部表征/隐式轨迹中完成关键推理,而表面CoT仅是部分或事后合理化的文本外显;并通过跨13个模型、三类任务的系统评测,将“不可见推理”从概念讨论落到可复现实证与可量化对比,为安全审计与可解释性评估提出新的对抗/探针范式(用无关token作为干预变量检测推理外显性)。
- MOT-SR: Multi-Objective Tool-Augmented Scientific Equation Discovery with Large Language Models 🆕NEW
- 赛道归属: 科学发现 / LLM工具增强推理
- 核心创新点: 提出MOT-SR框架,将多目标优化与工具增强机制引入LLM驱动的符号回归任务:一方面引入数据分析工具模块以自动挖掘变量依赖关系,提升方程搜索效率;另一方面突破单一拟合误差评估的局限,同时将结构复杂度和泛化能力纳入多目标评估体系,使发现的方程在精度与可解释性之间取得更优平衡。
- Know It, Act on It: Investigating Memory Utilization in LLM Personalization 🆕NEW
- 赛道归属: LLM个性化 / 记忆利用
- 核心创新点: 精确区分并量化LLM个性化失败的两类根本原因——"记忆缺失"与"记忆存在但未被利用",构建了专门的诊断基准以隔离知识利用问题(Knowledge Utilization Problem),揭示即使用户偏好完整存在于上下文中,模型仍可能无法将其转化为行动,从方法论上为个性化能力评估提供了更细粒度的分析框架。
- PTP: Previous-Token Prediction based LLM Inversion for Near-Exact Prompt Reconstruction 🆕NEW
- 赛道归属: LLM安全 / 提示词逆向重建
- 核心创新点: 提出PTP(Previous-Token Prediction)方法,通过预测前序token而非后续token的方式重新建模提示词逆向推断任务,绕开了"提示→响应"多对多映射的歧义性难题;无需访问模型权重或logits,也无需大规模外部数据集微调,实现了接近精确的提示词重建,在方法范式上从语义重构转向结构性逆向预测。
- Memory Provenance Laundering in LLM Agents: A Non-Amplification Firewall for Persistent Memory 🆕NEW
- 赛道归属: LLM智能体安全 / 记忆安全
- 核心创新点: 首次定义并形式化"记忆来源洗白"(Memory Provenance Laundering)攻击:外部不可信观察在LLM记忆整合过程中被重写为高可信度的用户历史或工作流支持,从而绕过现有的提示过滤和内容审查机制。针对此威胁提出"非放大防火墙"机制,确保记忆整合操作不会提升原始观察的信任权限,从信息论角度为持久化记忆系统提供安全保障。
- TransMem: Transforming Hidden States into Memory for Large Language Models 🆕NEW
- 赛道归属: LLM长上下文推理 / 推理时记忆增强
- 核心创新点: 提出TransMem,一种轻量级推理时参数化记忆模块,在不修改冻结LLM权重的前提下,将历史交互中稀疏的隐层状态转化为可检索的结构化记忆,并在后续生成阶段动态注入任务相关的历史表示。其核心突破在于直接操作隐状态空间而非文本层面,实现了对长交互历史中分散证据的高效利用,且具备即插即用的推理时部署特性。
GitHub
- [2026-08-04] sgl-project/sglang ⭐31199
- [2026-08-04] yamadashy/repomix ⭐27612 🆕NEW
- [2026-08-04] openJiuwen-ai/jiuwenswarm ⭐2077
- [2026-08-04] huhusmang/Awesome-LLMs-for-Vulnerability-Detection ⭐1204
- [2026-08-04] flagos-ai/FlagGems ⭐1061 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-08-03] HuggingFaceCode/stack-v3-train
- [2026-08-01] moonshotai/PerceptionBench
- [2026-06-29] Glint-Research/Fable-5-traces
- [2026-07-16] ianncity/GLM-5.2-Conversation
- [2026-07-22] r0b0tlab/qwen3.8-max-distillation-50k
多模态大模型
arXiv
- QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models 🆕NEW
- 赛道归属: 多模态安全与对抗攻击(红外视觉-语言模型)
- 核心创新点: 提出QR结构化热触发器(QR-STT)框架,利用QR码的功能性区域结构作为热扰动载体,在无需训练、黑盒条件下实现对红外视觉-语言模型的定向语义操控。核心突破在于将QR码的视觉结构与热成像扰动相结合,在保持QR码可扫描功能的同时,隐蔽地干扰跨模态语义对齐,揭示了IR-VLM在结构化热扰动下的安全脆弱性。
- HumanCLAW: Can Vision-Language Models Act Through a Body?
- 赛道归属: 多模态理解 / 具身智能评估
- 核心创新点: 提出 HumanCLAW 评估框架,核心创新在于将视觉语言模型(VLM)的高层动作决策与底层运动控制执行解耦。传统具身评估中,任务失败难以区分是模型决策失误还是运动控制执行失败所致。该框架通过约束执行层(harness机制),使评估结果能够纯粹反映 VLM 的感知推理与决策能力,而非被电机控制误差所干扰,从而为衡量 VLM 在物理实体中的行动能力提供了更公平、可解释的基准测试方法。
- SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models
- 赛道归属: 多模态大模型推理优化(视觉token剪枝/加速)
- 核心创新点: 提出基于“模态分隔符(separator token)”的视觉token剪枝框架SepPrune。关键观察是:无论来自视觉还是文本的注意力分数,都会在模态分隔符位置出现峰值,分隔符可作为跨模态信息汇聚的稳定“锚点”。据此在不依赖昂贵的跨模态注意力全量计算、也不需要高开销多样性估计的前提下,构建可更早介入推理流程的剪枝策略(更接近prefill前/早期阶段决策),在高分辨率输入产生大量vision tokens的场景中显著降低计算与延迟,同时尽量保持跨模态对齐与任务性能。
- Forensic Reproducibility Audit of a Radiology Vision-Language Model Benchmark: From Intended Protocol to Released Artifact
- 赛道归属: 多模态评测与可复现性(基准审计/Benchmark治理)
- 核心创新点: 提出“取证式可复现性审计(forensic reproducibility audit)”范式,针对放射影像VLM基准从“意图协议”到“发布产物”的全链路一致性进行追溯验证。在不重新调用模型、不新增标注的约束下,通过系统追踪与比对提示词绑定(prompt bindings)、DICOM渲染与元数据、模型输出完整性、自动标签生成流程、统计代码与仓库发布版本等关键环节,定位基准实现与论文/协议之间的偏差来源,揭示多组件基准中常被默认成立但未被检验的隐含假设,并给出可操作的审计路径以提升医疗多模态评测的可信度与可复现性。
- FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding
- 赛道归属: 长视频多模态理解(训练无关的推理期帧选择/检索)
- 核心创新点: 提出FORGE(Frame Orthogonality in Relevance Geometry),在不训练的前提下,于推理时从长视频中选择更“查询相关”的帧子集以抑制无关内容对MLLM准确率的负面影响。方法核心是将帧的相关性建模为几何空间中的“相关性方向/表示”,通过强调所选帧在相关性空间中的“正交性”(减少冗余、覆盖更多互补信息)来最大化有效信息密度;相较于仅按相关性打分或均匀采样,FORGE在固定上下文窗口内更有效地平衡“相关性强度”和“信息多样性”,提升长序列视频问答/理解的鲁棒性。
- Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding
- 赛道归属: 长视频多模态理解(训练无关的时间粒度自适应关键帧选择/记忆式推理)
- 核心创新点: 提出ReMem(Reasoning with Memory),面向上下文窗口受限的MLLM长视频理解,设计“时间粒度自适应”的关键帧选择框架以匹配不同问题的时间尺度需求。区别于均匀采样或静态的query-guided选择,ReMem引入记忆式推理机制:根据查询所需的时间粒度动态调整采样/聚合策略,在粗粒度问题上保留全局脉络、在细粒度问题上聚焦关键局部片段,从而减少关键时序上下文被遗漏的风险;全流程无需额外训练即可在推理阶段提升长视频任务的覆盖性与回答准确性。
- CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding
- 赛道归属: 长视频多模态理解与工具增强推理(自适应推理/证据检索)
- 核心创新点: 提出训练无关(training-free)的置信度感知动态证据推理框架:先基于模型输出置信度/不确定性对问题难度进行判别,再自适应地决定是否触发以及如何分配工具调用与时序证据检索粒度;对困难样例引入更细粒度的时间证据定位与迭代式证据聚合,提升长视频问答的可控性与可靠性,同时避免对简单样例的过度工具开销,实现“按需推理”的推理路径调度。
- MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning
- 赛道归属: 垂直领域视频多模态理解(海洋事件理解)与视觉工具推理
- 核心创新点: 面向海洋视频的事件中心(event-centric)理解范式,引入“视觉工具推理”以弥补通用VLM在视频时序建模与领域知识上的不足:通过工具化的视觉分析模块(如事件候选定位、关键帧/片段检索、属性与行为线索抽取等)为VLM提供可验证的中间证据,并围绕事件结构进行组织与推理,从而在标注稀缺、领域专业性强的场景下提升事件识别/描述的准确性与可解释性。
- Development of Vision-Language Model-based GNSS Spoofing Detection for Autonomous Vehicle Navigation
- 赛道归属: 多模态安全与鲁棒感知(自动驾驶GNSS欺骗检测)/跨模态传感器融合
- 核心创新点: 首次将视觉-语言模型用于GNSS欺骗检测的多模态融合框架:将前视摄像头视觉线索与车载动态传感器读数(速度、加速度、横摆角速度等)进行语义化对齐,并与GNSS推导的车辆机动/轨迹一致性进行对比推理;通过VLM的跨模态一致性判断与解释能力,把“视觉可见的运动/场景变化”与“GNSS报告的运动状态”之间的不一致显式化,从而实现对隐蔽重定向类攻击的检测与可解释告警。
- GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model 🆕NEW
- 赛道归属: 多模态理解与具身智能(视觉机器人导航)
- 核心创新点: 提出GemNav框架,颠覆了传统视觉导航策略依赖专用视觉编码器和定制动作头的设计范式。核心创新在于冻结多模态大语言模型(MLLM)的视觉塔,仅对语言塔施加LoRA微调,并将连续动作空间离散化为Token序列,使MLLM以纯语言生成方式输出导航路径点。该方法以极低的参数更新量实现短中程视觉导航,证明了通用MLLM在无需大规模跨实体数据集训练的前提下可直接迁移至机器人导航任务。
GitHub
- [2026-08-04] Blaizzy/mlx-vlm ⭐5291
- [2026-08-04] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1770
- [2026-08-03] waybarrios/vllm-mlx ⭐1485
- [2026-08-03] ZhaochongAn/GFS-VL ⭐65 🆕NEW
- [2026-08-02] THUSI-Lab/GameVerse ⭐51
强化学习
arXiv
- LA-RL: Label-Aware Self-Reflection for Reinforcement Learning in Information Extraction
- 赛道归属: 多模态/LLM信息抽取的强化学习对齐(结构化IE、反思式RL)
- 核心创新点: 提出LA-RL(Label-Aware Reflective RL)将“自我反思”从自由文本纠错对齐到结构化抽取空间:用结果监督把错误细分为缺失span、标签错误、边界不匹配、关系类型非法、论元顺序颠倒等可操作的失败类型,并据此生成面向标签/结构约束的反思与修正信号;通过将反思过程显式绑定到结构化输出的可验证属性,提升纠错的可定位性与可学习性,避免仅“指出有错但无法精确修复”的反思失配问题。
- WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning 🆕NEW
- 赛道归属: 机器人控制 / 视觉-语言-动作模型强化学习后训练
- 核心创新点: 提出世界批评模型(WCM),针对VLA模型RL后训练中Critic仅依赖单帧观测的根本性缺陷,设计了一种能高效融合历史观测序列的价值估计器。核心突破在于通过压缩历史帧的高维表示(而非直接拼接),以线性而非指数的复杂度引入时序上下文信息,从而更好地匹配机器人控制中部分可观测的本质,显著提升Critic的价值估计质量。
- LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback 🆕NEW
- 赛道归属: 多目标强化学习 / 大模型对齐与偏好学习
- 核心创新点: 提出LEMUR框架,将多目标强化学习(MORL)与人类偏好反馈相结合,解决了现实场景中多个竞争性目标(如性能与效率)的奖励函数难以精确指定的问题。核心创新在于无需预先定义每个目标的标量奖励函数,而是直接从偏好反馈中学习多维度奖励向量,并在Pareto前沿上进行策略优化,实现了对多目标权衡的灵活、数据驱动式建模。
- Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL 🆕NEW
- 赛道归属: 大语言模型对齐 / 多奖励强化学习策略优化
- 核心创新点: 提出"混合策略而非混合奖励"的全新范式,针对多奖励RL中不同优化目标相互冲突导致对齐税(alignment tax)加剧的问题,将多奖励优化问题分解为多个独立的单奖励子策略,再通过策略组合(Policy Decomposition & Composition)实现协同优化。相比直接对多个奖励加权求和的传统做法,该方法从根本上规避了梯度冲突,在保持各维度性能的同时降低了整体对齐代价。
- Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity 🆕NEW
- 赛道归属: 双层强化学习 / 元学习与层次化任务优化
- 核心创新点: 提出基于超梯度(Hypergradient)的双层RL算法,同时解决了现有方法的两大瓶颈:基于Hessian的超梯度方法计算不可扩展,以及基于惩罚近似方法样本复杂度过高的问题。核心突破在于设计了一种无需计算完整Hessian矩阵的高效超梯度估计方案,在理论上证明了更优的样本复杂度上界,使双层RL框架在元学习、层次任务分解及RLHF等应用场景中具备更强的实用性与可扩展性。
- Distilling Knowledge from Large Language Models into Lightweight Reinforcement Learning Agents for Autonomous Cyber Operations 🆕NEW
- 赛道归属: 自主网络安全运营 / 知识蒸馏增强强化学习
- 核心创新点: 提出将大语言模型(LLM)的领域知识蒸馏到轻量级RL智能体中,用于自主网络防御任务。核心创新在于以LLM作为"教师"为RL智能体的早期探索阶段提供先验动作指导,解决了RL智能体在网络安全环境中冷启动阶段探索效率低、初期决策质量差的固有问题,同时蒸馏后的轻量级智能体在推理阶段无需依赖LLM,兼顾了部署效率与决策性能。
- Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?
- 赛道归属: 强化学习 / 离线预训练与在线微调
- 核心创新点: 系统性地研究了在线RL微调时是否必须预训练Q函数这一核心问题。通过大量实验揭示:随机初始化Q函数配合在线RL微调,在多数场景下可达到与预训练Q函数相当甚至更优的性能,打破了"必须预训练Q函数"的传统认知。核心方法论突破在于通过对比分析,明确了Q函数预训练的必要性边界条件,为实践中简化预训练流程提供了理论依据。
- Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models
- 赛道归属: 推理优化 / RL与SFT训练机制对比分析
- 核心创新点: 从表征质量角度深入剖析RL训练模型在数学推理任务上优于SFT模型的内在机制。创新性地采用逐层线性探针分析隐藏状态表征,提供了两条收敛性证据链:一是RL模型在中间层形成了更高质量、更具判别性的数学概念表征;二是这种表征优势与最终推理性能高度相关。该工作首次从机制层面(而非仅从结果层面)解释了RL训练范式的优越性,为后续模型训练策略设计提供了可解释性基础。
- Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback
- 赛道归属: 大语言模型对齐 / RLHF奖励建模
- 核心创新点: 针对RLHF中静态、任务无关奖励模型导致学习信号稀疏、对齐效果欠佳的痛点,提出MeRLa框架。核心创新在于引入元学习机制,在RLHF训练前跨辅助任务元学习一个任务感知的奖励塑形函数Φ(x,y;φ),将其与原始奖励组合形成复合奖励信号。相比传统固定奖励模型,该方法能够动态适配不同任务特性,有效缓解奖励稀疏问题,从方法论上将元学习与奖励塑形理论系统性地融入RLHF流程。
- Evaluating Fuzz Testing for Reinforcement Learning Agents
- 赛道归属: 强化学习安全与鲁棒性评测(RL智能体Fuzz测试/测试基准)
- 核心创新点: 聚焦“RL fuzzing如何被公平、可复现地评估”的方法学缺口,系统化梳理并统一不同RL模糊测试方法在实验设置、基线选择与指标定义上的差异,构建可对齐的评测框架/协议以减少结论不可比问题;强调以覆盖/失效发现能力、触发条件多样性、崩溃/违规复现性等更贴近安全部署的指标来评价fuzzing有效性,从而把“提出新fuzzer”推进到“可验证、可对比的安全测试科学”。
GitHub
- [2026-08-03] huggingface/trl ⭐18992
- [2026-08-04] MathFoundationRL/Book-Mathematical-Foundation-of-Reinforcement-Learning ⭐17341 🆕NEW
- [2026-08-04] natolambert/rlhf-book ⭐2244 🆕NEW
- [2026-08-04] radixark/miles ⭐1862
- [2026-08-03] ZJU-REAL/SDAR ⭐318 🆕NEW
HuggingFace Datasets
- [2026-07-31] Qyrou/reasoning-corpus-4K-5M-v1
HuggingFace Spaces
世界动作模型
arXiv
- ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts 🆕NEW
- 赛道归属: 机器人操控 / 世界动作模型(World Action Model)
- 核心创新点: 该工作针对现有世界动作模型(WAM)在视觉分布偏移场景下鲁棒性不足的问题,提出了 ST-WAM(语义-时序世界动作模型)。核心创新在于识别并定义了"训练分布幻觉"(Training-Distribution Hallucination)现象——即当输入观测存在视觉域偏移时,基于像素生成的未来预测会幻化出训练域内容,导致动作预测失效。为此,ST-WAM 将未来预测从像素空间解耦,转向语义-时序表征空间,通过建模动作相关的状态转移语义特征而非任务无关的视觉细节,从根本上切断了视觉外观变化对动作推理的干扰,从而在视觉分布偏移条件下实现更鲁棒的机器人操控。
- From World Models to World Action Models: A Concise Tutorial for Robotics
- 赛道归属: 机器人世界模型/世界动作模型(World Action Model)综述与统一框架(多模态表征学习 + 模型式强化学习/规划)
- 核心创新点: 以“教程+统一视角”而非传统综述的方式,系统澄清机器人语境下“world”的构成要素,并给出世界模型(World Model)与世界动作模型(World Action Model)的明确定义与边界;进一步提出一个可对齐比较的统一分析框架,用同一套维度刻画不同路线(如空间智能模型、JEPA 等)在表征形态、预测目标(状态/潜变量/能量或一致性目标)、动作条件化方式、以及在机器人系统中承担的功能位置(感知表征、预测、规划/控制接口)上的差异,从而把分散的研究范式映射到可复用的设计空间,帮助研究者更直接地定位“从世界模型到可执行动作的世界动作模型”所需的关键模块与接口设计。
GitHub
- [2026-08-03] OpenMOSS/Awesome-WAM ⭐1214
- [2026-08-03] DravenALG/awesome-vla-wam ⭐921
- [2026-08-03] shaohua-pan/StarWAM ⭐198
- [2026-07-30] yuyangalin/ImageWAM ⭐146
- [2026-08-03] wdrink/RepWAM ⭐60 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-08-04 01:46:47