AI 每日进展速报 - 2026-08-11
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation
- 赛道归属: 文生图 / 扩散模型推理优化
- 核心创新点: 针对多模态扩散Transformer(MMDiT,如SD3、SD3.5、FLUX.1)中存在的"提示遗忘"现象(prompt forgetting)提出系统性分析与解决方案。研究发现,文本分支中的语义信息随网络深度增加而逐渐消退。为此,提出"提示重注入"(Prompt Reinjection)机制,在扩散Transformer的深层重新引入原始文本提示的语义表示,从而在不修改模型权重的前提下,有效缓解文本语义在去噪过程中的衰减问题,提升生成图像与文本描述的语义一致性。
- In-Loop Model Adaptation with Coupled Latent-Noise Guidance for High-Fidelity Subject-Driven Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图 / 主体驱动个性化生成(Subject-Driven Text-to-Image Generation)
- 核心创新点: 提出"循环内模型自适应"(In-Loop Model Adaptation)机制,结合"耦合潜变量-噪声引导"(Coupled Latent-Noise Guidance)策略,使扩散模型在推理阶段即可针对不同参考图像的主体外观进行动态适配,无需为每个主体单独微调模型。核心突破在于将参考图像的视觉信息通过潜变量与噪声的联合引导注入生成过程,从而在保持文本语义灵活性的同时,实现对主体身份的高保真一致性维护。
- Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation
- 赛道归属: 文生图(艺术风格控制与生成)
- 核心创新点: 提出 Atelier 框架,核心突破在于识别并规避图像生成模型对艺术家名称的"捷径依赖"问题(如模型倾向于复现艺术家的标志性符号、通用色调而非用户真实意图)。框架将模糊的艺术意图显式分解为独立的"控制状态",将艺术家风格属性(构图、笔触、色彩等)与场景语义解耦,从而实现更忠实于用户意图的艺术家风格引导生成,而非简单的风格标签映射。
- Evaluation-Verification Reward for Consistent Multi-Reference Image Editing
- 赛道归属: 图像编辑 / 多参考图像编辑 / 强化学习对齐
- 核心创新点: 针对多参考图像编辑任务中缺乏合适奖励模型的核心瓶颈,提出"评估-验证奖励"(Evaluation-Verification Reward)框架。该方法设计了能够捕捉多图像关系约束的奖励信号,解决了将强化学习直接应用于多参考编辑时因奖励模型不适配而导致的视觉一致性差和整体和谐性不足的问题。通过将多模态大模型的评估能力与验证机制相结合,构建出适用于多参考场景的RL训练信号,显著提升跨参考图像的视觉一致性与编辑质量。
- RL-Native Distillation: Exploiting Scored Trajectories for Few-Step Image Generation 🆕NEW
- 赛道归属: 文生图 / 扩散模型加速蒸馏与强化学习对齐(Few-Step Distillation & RL Reward Alignment)
- 核心创新点: 提出"RL原生蒸馏"(RL-Native Distillation)范式,打破传统"先RL对齐、再蒸馏压缩"的串行流程。核心创新在于直接复用RL训练过程中已带奖励评分的有限步轨迹(scored trajectories),将其中间状态作为蒸馏监督信号,使奖励对齐与少步蒸馏在同一训练过程中协同完成,避免了两阶段流程中奖励增益在压缩时丢失的问题,同时降低了整体训练成本。
- HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models
- 赛道归属: 文生图(无训练高分辨率生成)
- 核心创新点: 针对现有无训练高分辨率生成研究主要集中于 U-Net 架构、而对 DiT 架构适配不足的问题,系统性地揭示了将现成 DiT 模型直接应用于高分辨率生成时的两大关键障碍,并提出 HRDiT 框架加以解决。其方法论突破在于无需任何额外训练,通过对 DiT 注意力机制和位置编码的针对性改造,使预训练 DiT 模型具备超出其原始训练分辨率的生成能力。
- EmoScene: A Dual-space Dataset for Controllable Affective Image Generation
- 赛道归属: 文生图 / 情感可控图像生成
- 核心创新点: 提出 EmoScene 大规模双空间数据集(120万图像),核心突破在于将情感表达从单一离散标签扩展至"双空间"标注体系——同时覆盖语义情感空间(高层情绪类别)与视觉感知空间(色彩、光照、构图等底层视觉属性),弥补了现有数据集在细粒度情感控制信号上的缺失,为文本驱动的情感图像生成提供了更丰富的监督信号。
- Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework 🆕NEW
- 赛道归属: 跨模态生成 / 音频到图像生成(Audio-to-Image Generation)
- 核心创新点: 针对音频到图像(A2I)生成领域数据集质量低、跨模态对齐精度不足的瓶颈,构建了一个统一的高保真多模态数据集,并提出配套的合成框架。核心突破在于通过精细的跨模态对齐标注体系,将音频的语义与情感特征更准确地映射至视觉内容,从根本上改善了现有方法因数据质量受限而导致的生成表达力不足与语义不忠实问题。
- Diffusion Image Editing via Asynchronous Token Decoding 🆕NEW
- 赛道归属: 图像编辑 / 基于文本引导的扩散模型图像编辑(Text-Guided Diffusion Image Editing)
- 核心创新点: 提出异步Token解码编辑框架(ATDEdit),将扩散采样的每一步视为并行的Token级解码过程,针对不同语义区域(编辑区域与保留区域)实施异步的去噪节奏控制。核心突破在于从Token交互动力学角度解释并抑制"全局漂移"现象——通过解耦编辑Token与非编辑Token的更新时序,阻断语义变化跨Token传播,在无需额外训练的推理时框架下实现编辑区域精准修改与背景/布局高保真保留的平衡。
- SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision 🆕NEW
- 赛道归属: 图像编辑 / 草图指令引导的局部精细图像编辑(Sketch-Instruction Guided Local Image Editing)
- 核心创新点: 针对草图引导图像编辑中像素级精度不足的问题,从数据与方法两个层面同步突破:一方面构建了SI-Data高质量基准数据集,首次将几何约束(草图)与语义指令联合标注;另一方面提出SI-Edit框架,实现草图与自然语言指令的协同引导,支持细粒度局部形变的像素级精确编辑,填补了现有方法在几何精度与语义可控性之间的鸿沟。
GitHub
- [2026-08-11] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13182
- [2026-08-10] Osmantic/ODS ⭐4098 🆕NEW
- [2026-08-11] VigoZhao/AI-Visual-Prompt-Cookbook ⭐546
- [2026-08-11] AceDataCloud/Nexior ⭐389
- [2026-08-11] Z1rconium/gpt-image-panel ⭐93 🆕NEW
视频生成/编辑
arXiv
- CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation
- 赛道归属: 文生视频 / 文化理解评测基准
- 核心创新点: 提出首个专门针对文生视频模型文化理解能力的综合评测基准 CultureVidBench。其核心创新在于将文化理解拆解为文化特定物体、动作、仪式、可见文字及音频线索等多维度评估指标,填补了现有基准仅关注感知质量、物理合理性和文本-视频对齐而忽视文化多样性表征能力的空白,为跨文化场景下的 T2V 模型能力评估提供了系统性框架。
- GimbalDiffusion: Gravity-Aware Camera Control for Video Generation
- 赛道归属: 视频生成 / 相机运动控制
- 核心创新点: 提出 GimbalDiffusion 框架,核心突破在于引入重力感知(Gravity-Aware)的相机表示方式,以绝对而非相对/模糊的几何表征来编码相机轨迹,从而支持大角度旋转(如180度转向、垂直俯仰)等极端相机运动的精确控制。相比现有方法依赖相对或歧义性相机表示导致大旋转支持不足的局限,该方法在几何层面实现了更精确、更鲁棒的相机运动建模。
- Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains 🆕NEW
- 赛道归属: 视频生成评测基准
- 核心创新点: 提出首个面向科学领域的知识密集型与推理密集型视频生成评测基准 Sci-VBench,覆盖自然科学、医疗健康、人文社科和工程学四大学科共60个子领域、1253个专家标注样本。其核心突破在于将评测维度从"视觉合理性"提升至"科学推理正确性与知识一致性",要求模型生成具备时序逻辑和科学知识支撑的视频,填补了现有基准在科学领域深度评估上的空白。
- DUET: A Diversity-Quality Duet of Distillation Experts for Two-Step Video Generation 🆕NEW
- 赛道归属: 视频生成(扩散模型加速/蒸馏)
- 核心创新点: 提出 DUET 框架,通过"双专家协同蒸馏"策略同时解决两步视频生成中质量与多样性的固有权衡问题。核心方法是将轨迹级蒸馏(如 sCM,擅长多样性)与分布级蒸馏(如 DMD,擅长质量)两种范式的专家模型进行互补融合,在仅两步采样的极端加速条件下实现质量与多样性的双重提升,突破了单一蒸馏范式难以兼顾两者的瓶颈。
- EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation
- 赛道归属: 视频生成 / 音频驱动视频生成 / 推理加速
- 核心创新点: 提出 EchoCache,一种面向音频驱动视频生成(A2V)的能量引导跨模态缓存加速方法。核心创新在于识别并解决了 A2V 场景中现有缓存方法的两层错位问题:现有方法仅利用视觉特征的时序冗余,而忽视了音频驱动视觉生成时跨模态对齐的高度非均匀时序重要性。EchoCache 通过音频能量信号动态指导缓存策略,在跨模态对齐感知下选择性复用特征,在保持音视频对齐质量的同时显著降低扩散模型迭代去噪的推理开销。
- UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation
- 赛道归属: 视频生成 / 人体视频生成 / 运动与相机联合控制
- 核心创新点: 提出 UniMoCa 框架,核心创新在于将人体运动控制与相机运动控制统一为同质化的视觉代理(Visual Proxies)表示,打破了现有方法中运动控制依赖骨架图/姿态图等视觉序列、相机控制依赖相机嵌入向量这一异构控制接口的范式。通过统一表示消除了模型需同时对齐像素级运动信号与抽象相机嵌入的矛盾,尤其在多人场景、大幅度肢体运动、遮挡及动态相机等复杂条件下,实现了更忠实、更一致的人体视频生成。
- MoRoute: Dynamic Routing for In-Context Multimodal Video Generation
- 赛道归属: 视频生成与编辑(多模态条件视频生成)
- 核心创新点: 提出 MoRoute 动态路由机制,用于解决多模态视频生成中如何高效融合视觉语言模型(VLM)层级化多模态表征与视频扩散 Transformer 的核心挑战。其方法论突破在于:摒弃传统静态、固定的跨模态特征注入方式,转而设计动态路由策略,根据不同输入条件组合(文本、图像、视频的任意组合)自适应地选择和分配 VLM 各层级表征到扩散模型的对应模块,从而在单一统一模型框架下同时支持多种视频生成与编辑任务,实现多任务间互补数据与生成先验的共享,提升了模型对多样化条件输入的理解与生成能力。
- VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System 🆕NEW
- 赛道归属: 视频生成(物理一致性/智能体系统)
- 核心创新点: 提出 VideoCoCo 系统,以"代码作为思维链(Code-as-CoT)"替代传统文本或视觉状态中间表示,通过可执行代码精确描述场景的完整时空演化过程。系统采用双引擎智能体架构(Agentic Dual-Engine),将物理规律编码为可运行的程序逻辑,从而在文生视频中实现可控、可验证的物理一致性动态生成,根本性地解决了文本提示对时序物理过程描述能力不足的问题。
- FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring
- 赛道归属: 视频生成(自回归长视频生成 / 推理稳定性优化)
- 核心创新点: 从频域视角重新诠释自回归视频扩散模型的误差累积问题,发现长程生成中的颜色漂移、运动停滞等退化现象本质上表现为低频能量的系统性偏移。在此基础上提出"频谱自锚定"(Spectral Self-Anchoring)方法——FreqForcing:在自回归推理过程中,利用历史帧的低频谱统计信息对当前生成帧进行频域约束,抑制低频能量漂移,从而在无需额外训练的情况下显著缓解长视频生成的视觉崩溃问题。同时深入分析了注意力汇聚(attention sink)在频域中的作用机制。
- Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation 🆕NEW
- 赛道归属: 视频生成安全与内容保护
- 核心创新点: 提出 Anti-Prompt 方法,针对文本引导的图像转视频(I2V)生成场景,通过向原始图像注入人眼不可感知的对抗性扰动,使 I2V 模型产生明显的视觉不一致和结构性生成失败,从而保护图像版权与隐私。其核心洞察在于发现文本引导信号与图像特征之间存在可利用的耦合脆弱性——通过干扰文本-图像交互机制而非单纯攻击图像编码,实现更高效的保护效果。
GitHub
- [2026-08-11] ZeroLu/awesome-seedance ⭐2281
- [2026-08-11] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1819
- [2026-08-11] princepainter/ComfyUI-PainterNodes ⭐174 🆕NEW
- [2026-08-11] wordghost1234/agnes-ai-storyboard-studio ⭐156
- [2026-08-11] Vchitect/Evaluation-Agent ⭐129 🆕NEW
HuggingFace Models
音频生成
arXiv
- DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis
- 赛道归属: 文本转语音(TTS)/ 离散扩散语言模型
- 核心创新点: 提出将TTS任务建模为条件块离散扩散过程,基于X-Codec2神经音频编解码器Token,将序列分解为块(Block)并施加掩码扩散。该方法突破了自回归模型顺序解码慢、非自回归模型语言准确性差的两难困境,通过块级并行扩散在保持高可懂度的同时显著提升推理速度,无需大规模训练数据即可实现高质量语音合成。
- Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions 🆕NEW
- 赛道归属: 文本转语音(TTS)评估 / 语音质量评测
- 核心创新点: 将TTS评估中笼统的"自然度"概念解构为10个具有语言学依据的感知维度(如韵律、发音、流畅度等),并基于此构建了首个维度级TTS元评估基准。核心突破在于系统性地揭示了现有MOS预测器和Audio-LLM评判器在细粒度感知维度上的能力边界与盲区,为TTS评估方法的改进提供了可量化的诊断框架。
- MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation 🆕NEW
- 赛道归属: 文本生成音乐(Text-to-Music Generation)/ 可控音乐生成
- 核心创新点: 提出MusicLayout,一种显式的音乐结构中间表示,将音乐生成过程解耦为"结构规划"与"音频生成"两阶段。MusicLayout以时间对齐的方式描述段落、音色、重复和变奏等结构元素,使得音乐的宏观组织在音频生成前即可被检查、修改和精确控制。核心突破在于将隐式的全局文本提示转化为可解释、可编辑的显式结构布局,填补了文生音乐领域结构级可控性的空白。
- CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 零样本语音合成 / 流式推理优化
- 核心创新点: 提出CuteTTS,通过对连续潜变量进行自回归建模实现高效高质量语音合成。核心创新在于:设计了低码率且保留足够声学细节的连续潜空间序列,并针对流式场景优化推理效率,避免了扩散模型多步迭代采样和无分类器引导带来的高延迟问题,在紧凑流式系统与高保真合成之间取得平衡。
- CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 表达性语音合成 / 细粒度韵律控制
- 核心创新点: 提出CtrlSpeech,基于DiTAR架构实现从粗到细的表达性语音控制框架。核心突破在于将全局说话人条件与音素级对齐的音高、响度、时长信号相结合,支持词级或音素级的局部韵律精细控制,同时保持目标说话人音色的一致性,解决了现有TTS系统在细粒度表达控制上的不足。
- MMAG: A Multi-Control Mixed Audio Generation Benchmark
- 赛道归属: 音频生成评测基准(Audio Generation Benchmark)
- 核心创新点: 提出首个面向多控制条件混合音频生成的综合评测基准 MMAG,核心突破在于将语音、音乐、音效三类声学元素的联合生成纳入统一评测框架,同时设计了涵盖语义保真度、说话人一致性和时序控制等多维度的细粒度评估指标,填补了现有基准仅聚焦单一模态或粗粒度描述的空白。
- Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study
- 赛道归属: 文本转语音(TTS)/ 系统评测与基准
- 核心创新点: 构建了一套可复现的多指标TTS基准评测框架,联合评估感知质量、说话人相似度与声学保真度三个维度,重点覆盖低资源语言和欠代表性语言场景。其创新在于系统性地填补了跨语言、跨领域TTS评测方法论的空白,提供标准化、可复现的多维度联合评估流程,而非依赖单一指标或特定高资源语言。
- Beyond One-Size-Fits-All: Personalized and Culturally Adaptive Emotional TTS via Interactive Optimization of Individual Emotion Perception Spaces
- 赛道归属: 文本转语音(TTS)/ 情感语音合成 / 个性化与文化适应
- 核心创新点: 针对情感感知因人而异、因文化而异导致的情感TTS失配问题,提出了个性化且文化自适应的情感TTS框架。核心创新在于引入个体情感感知空间的交互式优化机制,在Russell唤醒-效价(A-V)维度表示基础上,通过用户交互反馈动态校准个体与文化层面的情感感知差异,实现超越"一刀切"标签的细粒度、个性化情感控制。
- Experience-Calibrated Contrastive Decoding for Mitigating Hallucinations in LM-Based Text-to-Speech
- 赛道归属: 文本转语音(TTS)/ 幻觉抑制 / 解码策略优化
- 核心创新点: 从条件信息视角重新审视语言模型TTS中的语音幻觉问题,将条件信息分解为文本对齐信息与声学上下文/经验信息两类。提出"经验校准对比解码"方法,在解码阶段通过对比两类信息的预测分布来抑制由过度依赖经验信息引发的幻觉,无需修改模型架构或额外训练,是首个专注于解码时控制来缓解LM-TTS幻觉的方法论突破。
- dots.tts Technical Report 🆕NEW
- 赛道归属: 文本转语音(TTS)/ 连续自回归语音合成 / 基础模型
- 核心创新点: 提出dots.tts,一个20亿参数的连续自回归TTS基础模型,在连续潜空间中建模语音。三项关键创新:①训练具有多目标的AudioVAE,构建语义结构化且易于预测的连续语音空间;②在流匹配解码头中引入全历史条件机制,保持长程一致性并抑制漂移;③通过系统性架构设计在连续自回归范式下同时实现高保真度与长程稳定性,相较现有连续自回归模型有显著提升。
GitHub
- [2026-08-10] huggingface/diffusers ⭐34282
- [2026-08-08] SamurAIGPT/Generative-Media-Skills ⭐4024
- [2026-08-09] Stability-AI/stable-audio-tools ⭐3840 🆕NEW
- [2026-08-10] BinWang28/audio-ai-hub ⭐948
- [2026-08-09] apocas/restai ⭐513
HuggingFace Models
语言大模型
arXiv
- Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents
- 赛道归属: 教育AI / LLM评估与标注
- 核心创新点: 将传统ICAP认知参与框架扩展为7级细粒度量表,系统对比了人工标注、ICL(上下文学习)和反思型LLM智能体三种方法在协作对话认知参与度自动编码任务上的表现,首次引入"反思型LLM智能体"范式用于教育话语分析,揭示了不同自动化标注策略在细粒度认知分类任务中的能力边界。
- Large language models reorganize representational geometry during in-context learning 🆕NEW
- 赛道归属: 大语言模型机制解释 / 上下文学习(In-Context Learning)
- 核心创新点: 提出利用LLM预训练表征几何结构来预测上下文学习(ICL)效果的新视角。核心发现是:LLM在ICL过程中会主动重组内部表征几何,将任务相关类别的表征从预训练空间中分离并重新排列,且这种重组程度与ICL性能高度相关。该工作首次将"表征几何可重组性"作为衡量任务是否可被有效上下文学习的预测指标,为理解ICL的内在机制提供了新的几何学解释框架。
- How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories
- 赛道归属: 推理优化 / LLM可解释性
- 核心创新点: 提出步骤感知推理能量(SARE)框架,利用Centered Kernel Alignment(CKA)对CoT推理轨迹中每个独立步骤的隐层表示Gram矩阵进行几何度量,将推理计算努力从轨迹级标量细化至步骤级粒度,首次实现对链式思维中逐步计算深度的可量化解析,为推理过程的精细化理解提供了新工具。
- GPrune-LLM: Generalization-Aware Structured Pruning for Large Language Models
- 赛道归属: 模型压缩 / 结构化剪枝
- 核心创新点: 提出了一种泛化感知的结构化剪枝框架 GPrune-LLM,核心突破在于识别神经元对校准数据集的"分布敏感性"异质性——将神经元分为稳定型(跨数据集排名一致)和敏感型(排名波动大)两类,并针对性地设计差异化重要性估计策略。对稳定型神经元直接使用单一校准集统计量,对敏感型神经元则引入多校准集聚合机制以消除校准偏差,从而在不增加显著计算开销的前提下提升剪枝后模型的跨任务泛化能力。
- Listwise Cross-Encoder Fine-Tuning vs. Agentic Instruction Tuning for LLM Rerankers: A Systematic Study in Medical Procedure Reranking 🆕NEW
- 赛道归属: 信息检索 / LLM重排序(Reranking)/ 医疗领域NLP
- 核心创新点: 针对医疗保险场景下患者语言与临床术语之间存在巨大词汇鸿沟的问题,系统性对比了两种重排序范式:(1)基于列表式学习排序目标(Listwise LTR)对小型交叉编码器进行微调,并探索不同层冻结配置;(2)以Qwen3-Reranker-4B为代表的指令微调大模型重排序器。该研究的创新在于将列表式交叉编码器微调与智能体式指令调优在真实生产任务中进行受控对比,揭示了两种范式在领域适配效率、计算成本与排序质量之间的权衡关系。
- Progressive Multimodal Alignment for Continual Instruction Tuning
- 赛道归属: 多模态持续学习 / 多模态大语言模型对齐
- 核心创新点: 针对多模态持续指令微调(MCIT)中被忽视的"投影器级遗忘"问题,提出渐进式多模态对齐框架(PMA)。核心突破在于:不再仅关注LLM主干的遗忘,而是专门设计机制约束视觉-语言投影器在视觉分布偏移和指令语义演变时的漂移,从而在持续学习过程中维持跨模态对齐的稳定性。
- DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning 🆕NEW
- 赛道归属: 多模态大语言模型 / 分布式联邦学习 / 指令微调
- 核心创新点: 提出DistMoE框架,解决多模态LLM在数据分散于私有/权限受限客户端场景下的分布式视觉指令微调问题。核心创新在于:在语言解码器每层中引入混合专家(MoE)模块扩充原有前馈网络,并设计了无需访问私有数据的免排练路由机制(Rehearsal-free Routing),使各客户端的领域专家能够在不共享原始数据的前提下协同训练,有效缓解了分布式场景下的灾难性遗忘与数据隐私问题。
- SHE: Trajectory-driven Safety Harness Evolution for LLM Agents 🆕NEW
- 赛道归属: LLM智能体安全 / 安全对齐
- 核心创新点: 提出SHE(Safety Harness Evolution)框架,将LLM智能体安全的关注点从模型权重扩展至智能体运行框架(Harness)本身。核心创新在于:以轨迹数据驱动的方式对Harness进行持续演化,将上下文管理、内存、工具调用、权限控制等组件的安全职责解耦,实现对新兴风险的局部化、可归因的安全更新,突破了将Harness视为固定部署产物的传统局限。
- How Do Large Language Models Judge Social Attraction? Evidence from Theory-Grounded Persona Ratings Across Multiple LLMs and Humans 🆕NEW
- 赛道归属: LLM社会评估能力 / 人机对齐研究
- 核心创新点: 构建了基于十种心理学与关系学理论构件的分层人物画像(Persona)评估体系,系统检验多个LLM对社会吸引力的判断能力,并与人类评分进行对比。创新点在于将社会心理学理论框架引入LLM主观评估能力的验证研究,通过理论驱动的受控实验设计(三级吸引力梯度画像)量化LLM作为社会判断代理的有效性与局限性,为LLM替代人类进行主观评估的可靠性提供了实证依据。
- Pragmatic Attack Surface: Vulnerabilities of Implicit Context in Large Language Models 🆕NEW
- 赛道归属: LLM安全攻防 / 对抗攻击 / 越狱(Jailbreak)
- 核心创新点: 提出"语用攻击面"(Pragmatic Attack Surface)概念,揭示了一类区别于传统显式提示攻击的新型漏洞:攻击者利用语言的语用学特性(隐含语境、会话含义、预设等隐性语言线索)绕过LLM安全对齐机制。核心创新在于将语言学语用学理论引入LLM安全研究,系统性定义并分析了隐式上下文攻击向量,指出现有安全对齐算法对显式攻击有效但对语用层面的隐性操控存在系统性盲区,为构建更鲁棒的安全防御机制提供了新的理论视角。
GitHub
- [2026-08-11] sgl-project/sglang ⭐31657
- [2026-08-11] yamadashy/repomix ⭐27752
- [2026-08-11] NVIDIA/TensorRT-LLM ⭐14356
- [2026-08-11] openJiuwen-ai/jiuwenswarm ⭐2666 🆕NEW
- [2026-08-11] flagos-ai/FlagGems ⭐1068
HuggingFace Models
HuggingFace Datasets
- [2025-07-11] HuggingFaceFW/fineweb
- [2026-08-09] HuggingFaceCode/stack-v3-train 🆕NEW
多模态大模型
arXiv
- DataComp-VLM: Improved Open Datasets for Vision-Language Models 🆕NEW
- 赛道归属: 多模态训练数据工程 / 视觉语言模型数据集构建
- 核心创新点: 提出 DataComp-VLM(DCVLM)基准框架,系统性地整合了涵盖图文对、多模态交错文档、纯文本及指令微调数据四种类型、共计160个数据集(规模达6T token级别)的超大规模语料库,并建立了以数据为中心的受控实验基准,填补了社区在VLM训练数据筛选策略系统性评估方面的空白,为数据配比、质量过滤等数据工程决策提供了可复现的对比框架。
- PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 视觉语言模型评测与推理能力分析
- 核心创新点: 提出 PragMatch 对比评测框架,核心创新在于将"语用不一致性(pragmatic incongruity)"与"跨模态表面不匹配(cross-modal mismatch)"解耦,揭示现有大型视觉语言模型在多模态讽刺检测中依赖浅层关联(shortcut learning)而非真正理解语用关系的本质缺陷,为评估VLM深层跨模态推理能力提供了更精细的诊断工具。
- HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models
- 赛道归属: 多模态理解 / 视觉感知增强
- 核心创新点: 从频谱分析视角揭示了VLM视觉编码器存在"频谱响应刚性"问题——预训练视觉编码器的逐层频谱响应模式在下游微调中几乎不发生变化,导致模型无法根据任务需求自适应地提取不同频率的视觉特征。基于此诊断,提出HAFI-VLM框架,通过引入频率自适应机制,使视觉编码器能够根据文本查询动态调整频谱提取策略,从而增强细粒度视觉感知能力。
- STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision
- 赛道归属: 多模态理解 / 自动驾驶时空推理
- 核心创新点: 提出利用车载毫米波雷达作为监督信号来增强VLM时空推理能力的新范式,无需复杂预处理流程或昂贵人工标注。通过雷达数据提供的运动与速度真值,构建时空定位监督信号,使VLM获得对目标运动状态的强感知能力,有效弥合了现有方法在真实场景运动估计上的性能缺口,同时规避了合成数据带来的sim-to-real差距。
- Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation 🆕NEW
- 赛道归属: 医疗多模态理解 / 手术场景语义分割
- 核心创新点: 提出首个基于视觉语言模型的宫腔镜手术场景分割框架,通过引导式自举(bootstrapping)机制将VLM的语义理解能力迁移至高难度手术场景,针对宫腔镜特有的镜面反射、运动模糊、液体遮挡等伪影以及不同病变形态高度相似的挑战,实现了语言先验知识对分割模型的有效增强。
- From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability 🆕NEW
- 赛道归属: 视觉语言动作模型(VLA)/ 空间理解能力分析
- 核心创新点: 通过逐层探针(layer-wise probing)方法,系统分析动作后训练(action post-training)过程对VLM空间几何理解能力(以深度感知为代表性基元)的影响,发现VLA在所有层均存在持续性深度解码能力下降("floor效应"),且退化模式非均匀分布——基础VLM中后期层的深度可解码性峰值在VLA中消失,揭示了动作后训练对视觉空间表征的系统性损耗机制。
- VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use 🆕NEW
- 赛道归属: 垂直领域多模态模型 / 网络安全视觉语言模型
- 核心创新点: 构建首个面向西班牙语/拉丁美洲地区网络安全场景的亚20亿参数VLM,核心创新在于将冻结的SigLIP-so400m视觉编码器与西班牙语安全领域解码器通过MLP适配器耦合,并原生集成结构化推理(
<|think|>token)与工具调用(Model Context Protocol)能力,同时支持导出至llama.cpp的LLaVA格式,实现了专业安全工具界面(IDA、Ghidra、Wireshark等)的视觉理解与本地化部署。
- An evolutionary model of animats with VLM-based subjective evaluation 🆕NEW
- 赛道归属: 进化计算 / 多模态模型辅助智能体评估
- 核心创新点: 将视觉语言模型的主观评估能力引入遗传算法的适应度评价与选择过程,以虚拟软体机器人的运动演化为实验对象,通过VLM对两个个体运动序列图像进行成对比较并依据"可爱地""奇异地"等主观语义标准进行选择,突破了传统进化算法依赖手工设计量化适应度函数的局限,探索了以语言驱动的主观偏好替代客观指标指导演化方向的新范式。
- AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models
- 赛道归属: 多模态大模型 / 模型合并与能力修复
- 核心创新点: 提出 AgentPatch 框架,专门针对 Agentic MLLM 合并场景中的"弱任务修复"问题。核心方法论突破在于:将模型合并后的能力退化问题形式化为"弱任务识别与修复"任务,采用由粗到细(Coarse-to-Fine)的修复策略——先在粗粒度层面定位合并后性能下降的弱任务,再在细粒度层面对特定参数进行针对性的补丁式修复(Patch),从而在不重新训练整体模型的前提下,解决多个专用 Agentic MLLM 合并时因交互复杂度不对称导致的能力保留不均衡问题,实现单一通用 Agentic MLLM 的高质量整合。
- Two Sides of the Same Coin: Co-Evolving Search for Cross-Task Attacks on Vision-Language Models
- 赛道归属: 多模态安全 / 对抗攻击
- 核心创新点: 提出基于进化计算的跨模态对抗攻击框架,突破了现有攻击方法依赖单轨迹梯度优化和任务特定目标的局限。核心创新在于同时对文本空间和视觉空间进行协同进化搜索——文本侧进化生成硬提示,视觉侧自适应扰动图像,两侧相互协同,大幅扩展了搜索空间,显著提升了对统一VLM的跨任务迁移攻击成功率。
GitHub
- [2026-08-11] Blaizzy/mlx-vlm ⭐5318
- [2026-08-11] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1790 🆕NEW
- [2026-08-08] gokayfem/ComfyUI_VLM_nodes ⭐582
- [2026-08-10] liudaizong/Awesome-LVLM-Attack ⭐570
- [2026-08-05] Roots-Automation/GutenOCR ⭐190
强化学习
arXiv
- IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents
- 赛道归属: 强化学习 / 战略对话智能体
- 核心创新点: 提出"孤立双边强化学习"(IB-RL)框架,核心突破在于将对话双方(智能体与对手)的策略训练过程相互隔离,分别独立优化,而非在动态交互中联合训练。这一设计有效解决了战略对话中因对手策略随智能体策略同步变化而导致的非平稳环境问题,使奖励信号更加稳定可靠,从而将传统RL在固定规则环境中的优势迁移至双边博弈场景。
- IACM-RL: Intent-Aware Context Management and Reinforcement Learning for Complex Tool Invocation under Dynamic Intent Fluctuations
- 赛道归属: 智能体工具调用 / LLM强化学习后训练
- 核心创新点: 提出IACM-RL框架,专门应对长时序工具调用中的动态用户意图噪声问题。核心突破在于:引入意图感知的上下文管理机制(IACM),通过动态过滤和压缩历史上下文中的过时约束,防止模型注意力被稀释;结合强化学习策略优化,有效规避意图偏移和无限API循环等灾难性失败模式,在复杂真实环境下显著提升工具调用的鲁棒性。
- AudioMap: Cloze-and-Choice Reinforcement Learning for Time-Aware Dense Audio Captioning 🆕NEW
- 赛道归属: 音频理解与描述生成(Audio Captioning / 多模态强化学习)
- 核心创新点: 针对时间感知密集音频描述(TDAC)任务,提出"完形填空+选择题"双模式强化学习框架AudioMap。核心突破在于设计了两类细粒度奖励机制:(1) 完形填空式奖励,通过遮蔽关键属性词并让模型填充来评估多事件、多属性描述的精准度;(2) 选择题式奖励,通过构造干扰选项来评估多关系描述的正确性。相比传统监督微调和粗粒度RL奖励,该方法能够对复杂音频描述中的细粒度语义和时间边界提供更精确的训练信号。
- RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation 🆕NEW
- 赛道归属: 具身智能 / 无人机视觉语言导航(UAV-VLN)
- 核心创新点: 提出RecoverFly框架,专门针对UAV视觉语言行动(VLA)策略在闭环执行中的失败恢复问题。核心创新在于引入"失败感知"的强化学习后训练机制:通过显式识别导航过程中的失败状态并构建针对性的纠错监督信号,弥补行为克隆目标在交互式闭环场景下缺乏纠正性反馈的缺陷。相比纯行为克隆的端到端VLA策略,该框架使智能体能够从失败经验中主动学习恢复策略,显著提升复杂环境下的导航鲁棒性。
- Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning 🆕NEW
- 赛道归属: 智能体强化学习 / 信用分配(Agentic RL / Credit Assignment)
- 核心创新点: 针对智能体RL中稀疏延迟奖励下的信用分配难题,提出跨多时间尺度的环境反馈学习框架。核心创新在于充分利用智能体与环境交互过程中自然产生的过程信息(如交互历史),将其作为中间决策的额外监督来源,实现轨迹级奖励向多粒度、多时间尺度的细粒度信用分解。与现有信用分配方法忽略过程信息不同,该方法将交互历史显式建模为跨时间尺度的信用传播依据,为中间步骤提供更丰富的学习信号,有效缓解长程任务中的稀疏奖励问题。
- TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models
- 赛道归属: 具身智能 / 视觉-语言-动作模型强化学习后训练
- 核心创新点: 提出TEMPO框架,核心创新在于将VLA模型的语义理解模块与动作执行模块解耦,采用"双时间尺度"差异化更新策略:冻结预训练视觉-语言骨干网络,仅对动作头进行高频RL更新,同时以更低频率对语义层进行微调。这一设计打破了现有RL后训练对所有模块一视同仁的惯例,在保留预训练语义泛化能力的同时,显著提升了下游操作任务的策略优化效率。
- Momba: Network Modernization Improves Multi-Objective Reinforcement Learning
- 赛道归属: 多目标强化学习 / 神经网络架构优化
- 核心创新点: 提出Momba框架,核心创新在于将现代深度学习网络架构(如残差连接、归一化层等近年主流设计)系统性地引入多目标强化学习(MORL)领域。现有MORL研究长期聚焦于算法层面的创新而忽视架构设计,Momba通过实证证明网络现代化本身即可在不改变底层MORL算法的前提下,显著提升样本效率和帕累托前沿的覆盖质量,为MORL性能提升提供了一条正交于算法创新的新路径。
- Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control
- 赛道归属: 连续控制 / 强化学习系统设计与组件协同
- 核心创新点: 突破以往孤立评估单一RL组件(如探索策略、价值估计、经验回放等)的研究范式,系统性地研究多个算法组件之间的交互协同效应。通过大规模消融实验揭示组件间存在显著的"协同增益"或"相互干扰"现象,并据此提出组件组合的优化原则,在连续控制任务上以更高样本效率实现性能提升,为RL系统的整体性设计提供了方法论指导。
- Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning
- 赛道归属: 离线强化学习 / 策略优化
- 核心创新点: 提出行为优势修正策略评估(BAC-PE)方法,利用行为策略的Q函数对学习策略的Q函数进行校正,从双向同时抑制悲观保守性和过估计偏差,解决离线RL中分布偏移导致Q值估计失真的根本问题。进一步将扩散模型(Diffusion Policy)引入离线RL策略表示,结合BAC-PE实现更精准的策略优化方向,在高维连续动作空间中展现出更强的表达能力与稳定性。
- Instruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-Distillation
- 赛道归属: LLM强化学习后训练 / 探索策略
- 核心创新点: 提出指令条件探索(ICE)方法,针对LLM动作空间结构与经典RL的本质差异,设计了一种利用预训练LLM广泛知识主动生成多样化训练经验的探索机制。核心创新在于通过非对称强化学习(Asymmetric RL)与自蒸馏(Self-Distillation)相结合,在训练时以指令为条件引导策略有意识地探索多样轨迹,同时通过自蒸馏防止探索过度偏离基础模型能力,有效缓解LLM后训练中探索不足的问题。
GitHub
- [2026-08-11] RLinf/RLinf ⭐4504
- [2026-08-10] pytorch/rl ⭐3515 🆕NEW
- [2026-08-11] radixark/miles ⭐1952
- [2026-08-11] X-GenGroup/Flow-Factory ⭐652 🆕NEW
- [2026-08-10] Amey-Thakur/OPTIMIZING-STOCK-TRADING-STRATEGY-WITH-REINFORCEMENT-LEARNING ⭐57 🆕NEW
HuggingFace Datasets
- [2023-05-26] Anthropic/hh-rlhf
世界动作模型
arXiv
- Decoupling Intention from Trajectory: A Representational Deduction Framework for World Action Models
- 赛道归属: 世界动作模型 / 具身智能 / 运动规划
- 核心创新点: 提出了一种表征解耦框架(Representational Deduction Framework),将高层意图(Intention)与低层轨迹(Trajectory)在表征空间中显式分离。核心突破在于:现有视觉分支仅预测静态视觉观测,忽略了运动交互下世界状态演变的过渡信息,导致物理条件演化与动作轨迹生成之间产生表征纠缠。该框架通过解耦这两类信息,使视觉分支能够捕捉世界状态的动态转变过程,从而为动作规划提供更具语义层次的表征基础,实现意图理解与轨迹生成的协同优化。
- Faster-WAM: Do World Action Models Need Deep Action Modules?
- 赛道归属: 世界动作模型 / 机器人策略推理优化
- 核心创新点: 提出"Dock of Transformer (DoT)"设计原则,将预训练视频Transformer作为表征中枢,通过轻量级外挂模块(而非深度耦合的动作模块)完成动作预测。核心突破在于打破了现有WAM中动作模块深度与视频骨干深度强绑定的设计惯例,实现了在保持预测性能的同时大幅降低计算开销和推理延迟,验证了深度动作模块对WAM并非必要条件。
- ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
- 赛道归属: 机器人操控 / 世界动作模型(World Action Model)
- 核心创新点: 该工作针对现有世界动作模型(WAM)在视觉分布偏移场景下鲁棒性不足的问题,提出了 ST-WAM(语义-时序世界动作模型)。核心创新在于识别并定义了"训练分布幻觉"(Training-Distribution Hallucination)现象——即当输入观测存在视觉域偏移时,基于像素生成的未来预测会幻化出训练域内容,导致动作预测失效。为此,ST-WAM 将未来预测从像素空间解耦,转向语义-时序表征空间,通过建模动作相关的状态转移语义特征而非任务无关的视觉细节,从根本上切断了视觉外观变化对动作推理的干扰,从而在视觉分布偏移条件下实现更鲁棒的机器人操控。
- SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
- 赛道归属: 世界动作模型 / 自动驾驶 / 端到端规划
- 核心创新点: 提出SimWAM,核心创新在于将视频生成能力仅作为训练信号而非推理时的必要组件,从而彻底消除推理阶段昂贵的未来帧生成开销。具体方法上:采用联合流匹配(Joint Flow Matching)协同训练预训练视频专家与轻量动作专家;引入隔离注意力掩码(Isolated Attention Mask)机制,使动作预测在结构上独立于未来帧,推理时可直接丢弃视频分支。该设计实现了"训练时借力视频动态先验、推理时轻量高效执行"的解耦范式,在保留视频预训练知识迁移优势的同时,大幅降低了部署成本。
- CoWAM: Coordination Contracts for Selective Policy Intervention with WAMs
- 赛道归属: 世界动作模型 / 双臂机器人协调控制
- 核心创新点: 提出CoWAM选择性干预框架,将WAM生成的未来预测与实际策略执行之间的决策桥接问题形式化为"协调契约"。创新性地引入类型化可接受性检验、事件条件验证和校准干预门控三重机制,将同步约束、角色兼容性和碰撞收敛等双臂协调语义显式编码为可验证合约,仅在契约违反时触发干预,从而在保留原始策略名义行为的前提下有选择性地修正动作,解决了"合理预测未来≠应当改变当前动作"的核心矛盾。
- SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space
- 赛道归属: 世界动作模型 / 几何感知策略空间建模
- 核心创新点: 提出SG-WAM,构建一个同时满足"动作对齐"与"几何感知"双重要求的自引导世界建模框架。核心突破在于设计了一个联合结构化的策略空间,既避免了观测空间目标的感知冗余负担,又克服了现有辅助潜空间缺乏几何结构的缺陷,通过自引导机制使未来状态预测与动作生成在几何意义上协同对齐,从而更精准地捕捉动作对场景的空间变化影响。
GitHub
- [2026-08-10] OpenMOSS/Awesome-WAM ⭐1256
- [2026-08-08] DravenALG/awesome-vla-wam ⭐953
- [2026-08-06] neoteai/N0-TWAM ⭐135
- [2026-08-09] teee000/LiLa-WAM ⭐52
由 Research Daily 自动生成 生成时间: 2026-08-11 05:32:18