AI 每日进展速报 - 2026-06-10
图像生成/编辑
arXiv
- BLM-SGAN: Bidirectional Language Modeling for Semantic-Spatial Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图(GAN-based Text-to-Image,语义-空间一致性建模)
- 核心创新点:
- 中文:提出“双向语言建模”驱动的GAN式文生图框架,将文本从前向与后向两个方向进行语义建模,用于更完整地捕获描述中的全局语义与局部细节依赖,缓解传统单向编码导致的语义遗漏与细节不稳。进一步面向“语义-空间”一致性问题,引入对文本中对象/属性/关系的空间约束建模与对齐机制,使生成过程同时受语义正确性与空间布局合理性约束,从而提升复杂描述下的可控性与一致性。
- TrioPose: Native Triple-Stream Diffusion Transformers for Pose-Guided Text-to-Image Generation
- 赛道归属: 姿态引导文生图 / 多模态扩散Transformer
- 核心创新点: 提出原生“三流” 的扩散Transformer结构,将文本、图像潜变量与姿态条件以更结构化的方式解耦建模,避免在MM-DiT中直接拼接条件信号导致的预训练潜空间分布被破坏;通过为姿态引导建立独立且可控的信息注入路径,增强长程空间依赖建模能力,显著缓解多人复杂姿态下的肢体扭曲与特征串扰问题,并在SD3.5M架构上实现更稳定的姿态对齐与细节一致性。
- WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation
- 赛道归属: 文生图评测基准 / 语义与世界知识对齐评估
- 核心创新点: 提出面向文生图的“世界知识驱动语义评测”基准WISE,将评估重点从传统的画质与浅层文本-图像匹配,提升到对复杂语义理解、隐含常识/事实知识、关系与组合推理等能力的系统化测量;通过构造需要外部世界知识才能判定对错的提示与判别维度,提供更能暴露模型“看似对齐但语义错误”的评测框架,从而推动T2I模型在知识一致性与深层语义对齐上的改进。
- Safeguarding Text-to-Image Generation via Inference-Time Prompt-Noise Optimization
- 赛道归属: 文生图安全对齐 / 推理时安全防护
- 核心创新点: 提出一种仅在推理阶段生效的安全防护机制,通过对输入提示词注入并优化“提示噪声” 来抑制不安全内容的生成;其关键突破在于把安全约束转化为可优化的推理时变量,无需重新训练/微调模型即可动态调整生成轨迹,从而提升对绕过式提示与对抗攻击的鲁棒性,并在尽量保持画质与文本一致性的前提下实现更稳定的安全过滤。
- Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图(Prompt Rewriting/Prompt Optimization,视觉锚点对齐)
- 核心创新点:
- 中文:提出FaithRewriter,将“提示词改写”从纯语言润色升级为“视觉锚点对齐”的改写范式:在改写过程中引入可视觉化的锚点(如关键对象、属性、场景要素等)作为约束信号,强制改写结果与可生成的视觉要素一致,减少传统改写因过度脑补细节而造成的intent-generation gap。方法上强调把用户意图拆解为可落地的视觉约束,并在改写目标中显式惩罚偏离锚点的扩写,从而在提升可生成性/细节明确性的同时保持对原始意图的忠实。
- Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation
- 赛道归属: 文生图多样性提升 / 表征调制
- 核心创新点: 从“同质化输出”的根因出发,分析Transformer中间表征(尤其是潜变量/中间特征的收缩与聚集现象)对采样多样性的限制,提出基于表征调制的多样性增强策略:在不引入昂贵的多次采样、额外优化或外部搜索的前提下,通过对中间特征分布/通道响应进行可控扰动或重标定,打破固定prompt下的表示锁定,以较低推理开销提升样本多样性,同时尽量保持文本对齐与画质。
- MemoGen: Can Past Experience Improve Future Text-to-Image Generation?
- 赛道归属: 文生图生成增强 / 记忆与检索增强生成
- 核心创新点: 提出MemoGen,将“单次请求的检索/代理式增强”扩展为“跨任务可积累的经验记忆”机制:把历史生成中的成功/失败案例、隐含约束满足策略、有效提示改写或参考证据进行结构化存储,并在新请求到来时进行检索与复用,以提升对隐式视觉约束、关系推理与外部知识需求场景的可靠性;核心突破在于把T2I生成从一次性优化转为可持续学习的闭环(记录—检索—迁移),减少重复犯错并提高长期一致性。
- KG-FairDiff: Knowledge Graph-Guided Prompt Refinement for Demographically Fair Text-to-Image Generation
- 赛道归属: 文生图(公平性/去偏见)、提示词优化
- 核心创新点: 提出以知识图谱为约束与检索支撑的提示词自动精炼框架,在不重训/不改动闭源T2I主干模型的前提下,通过对人口统计属性与职业/场景等语义关系的显式建模,系统性地补全或重写提示词中的敏感与相关属性表达,从而在生成阶段实现更均衡的人群呈现;方法重点在“结构化知识→可控prompt变换”的映射,降低仅靠启发式词替换带来的语义漂移,并兼顾公平性提升与文本意图保持。
- RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation
- 赛道归属: 文生图(可控生成)、训练免空间控制/条件注入
- 核心创新点: 提出一种同时具备“结构+外观”双重约束的训练免空间控制方案,通过改进特征注入/融合机制,在扩散采样过程中更稳定地对齐条件图像的几何结构并保留外观细节;针对训练免注入常见的结构错位、条件泄漏(把条件图像纹理/噪声直接拷入结果)与伪影问题,引入更精细的分层/分步控制与抑制策略,使结构遵循与外观一致性可以解耦调节,从而在无需LoRA/微调的情况下获得更可靠的空间可控生成。
- Unified Safe In-context Image Generation in Multimodal Diffusion Transformers via Restricting Unsafe Information Flows
- 赛道归属: 安全文生图与安全图像编辑 / DiT多模态注意力安全对齐
- 核心创新点: 面向带多模态注意力的扩散Transformer,提出统一的“限制不安全信息流” 安全框架,解决现有安全机制偏向T2I或U-Net、难以覆盖I2I编辑的问题;核心在于在DiT的跨模态/上下文注入链路中识别并抑制不安全语义从条件端(文本、参考图、上下文示例等)向生成端传播的关键通道,实现in-context生成与编辑场景下的一体化安全控制,在尽量不牺牲正常内容生成能力的同时降低有害内容泄露与绕过风险。
GitHub
- [2026-06-10] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐12449
- [2026-06-09] AceDataCloud/Nexior ⭐373
- [2026-06-09] etkecc/baibot ⭐229
- [2026-06-09] techjarves/Local-AI-Image-Generator ⭐162
- [2026-06-09] ferranpons/Llamatik ⭐145
HuggingFace Models
视频生成/编辑
arXiv
- Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation
- 赛道归属: 身份保持文本到视频生成
- 核心创新点: 提出ST-DRC框架,将参考身份条件在空间与时间维度解耦注入视频扩散/生成过程:用空间侧的细粒度特征强化单帧身份细节(如脸部结构、纹理一致性),用时间侧的机制约束跨帧身份稳定与时序一致,从而在“文本语义可控性”和“低层身份保真度”之间实现更好的平衡;框架层面强调晚期/分阶段的条件融合以减少文本驱动对身份特征的干扰并提升长序列稳定性。
- SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation
- 赛道归属: 视频生成安全评测
- 核心创新点: 提出SafeGen-Bench,面向图像条件引导的文本到视频生成系统化评测其安全风险,补齐现有安全基准主要聚焦纯文本模式的缺口;通过覆盖非法/政治敏感/伦理风险等多类场景与触发方式,构建更贴近真实使用链路的测试集与评测协议,用于量化模型在“给定初始图像+文本”条件下的越界生成倾向与防护能力,从而推动安全对齐在I2V/T2V条件生成中的可比、可复现评估。
- MAVEN A Multi-Agent Framework for Multicultural Text-to-Video Generation
- 赛道归属: 文生视频 / 提示词工程与多智能体协同
- 核心创新点: 提出多智能体提示词精炼框架MAVEN,面向“多文化一致性/文化保真度”这一以往T2V较少系统覆盖的目标进行优化;方法上将文本提示分解为“人物-动作-地点”三维语义槽位,由具备专长的代理分别并行或串行地改写与约束,从而在单一文化与跨文化组合提示中减少文化符号混淆与刻板化偏差;同时构建支持系统评测的多文化/跨文化基准与流程,使文化保真度从主观描述转为可对比的评估闭环。
- Knowledge-Intensive Video Generation
- 赛道归属: 知识密集型文本到视频生成评测
- 核心创新点: 定义“知识密集型视频生成”任务:针对解释、流程、演示类信息检索式短提示,要求生成视频不仅好看还要事实正确且有用;构建KIVI-Bench(1080条提示)并提出面向事实性与帮助性的自动评测指标,且通过人工评测验证指标相关性,从评测体系上把T2V从感知质量扩展到“知识/实用性”维度,为后续引入检索增强、工具使用或知识对齐的T2V方法提供可量化目标。
- Consistency-Preserving Diverse Video Generation
- 赛道归属: 视频生成(多样性采样/一致性保持,Flow-Matching)
- 核心创新点: 提出面向Flow-Matching视频生成器的联合采样框架,在“每个提示词只能生成少量样本”的低采样场景下,显式提升跨视频(batch内)多样性同时保持单个视频内部的时序一致性。相较将图像多样性技巧直接迁移到视频而导致时间一致性下降的方法,该框架避免或减少对视频解码器进行昂贵的反向传播优化,从采样层面实现“多样性-一致性”兼顾。
- CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation 🆕NEW
- 赛道归属: 视频生成 / 文本-音频-视频联合生成数据集
- 核心创新点: 提出面向“多镜头、长篇幅、电影化叙事”的开源大规模T2AV训练数据集 CineDance-1M,重点补齐开放社区在高质量电影级音画联合生成数据上的缺口;数据设计强调多镜头结构与长时序叙事组织,使模型可学习跨镜头的语义连贯性、镜头语言与音画同步关系,从数据层面提升长视频生成的结构多样性与可控性。
- Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions 🆕NEW
- 赛道归属: 视频生成 / 实时流式高分辨率生成 / 推理加速
- 核心创新点: 提出级联式的流式生成框架 Ultra Flash,将“实时流式生成”扩展到高分辨率场景;通过分阶段/分尺度的生成与调度,在单GPU上实现约30FPS@1K、18FPS@2K的吞吐,核心突破在于把高分辨率生成拆解为可流式执行的级联管线,从而在延迟、显存与画质之间实现可扩展的工程化平衡。
- BioVid: Autoregressive Video Generation with Biological Behavior Semantic Comprehension 🆕NEW
- 赛道归属: 视频生成 / 自回归生成 / 行为时长建模(生物行为)
- 核心创新点: 提出 BioVid:以“行为数据自身统计结构”驱动的视频自回归生成框架,针对生物行为中动作时长天然可变的问题,不再把序列长度当作外部固定超参(固定帧数/仅由文本指定),而是引入对行为语义与时长分布的联合建模,使生成的起止边界与真实行为的时序统计更一致,从而提升行为类视频的真实性与可泛化性。
- VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation 🆕NEW
- 赛道归属: 视频生成 / Agentic工作流与评测基准 / 长视频生成
- 核心创新点: 提出 VideoWeaver:面向“长视频生成”这一长时程多模态任务的 agent harness 与benchmark,用于系统评估并“演化”代理的技能(如工具调用、流程构建、迭代修正);区别于手工固定流水线的视频代理,VideoWeaver强调让通用agent自行搭建与优化生成工作流,并通过基准化任务与反馈机制刻画其在长程规划、分解、质量控制与一致性维护上的能力边界。
- ViMax: Agentic Video Generation 🆕NEW
- 赛道归属: 视频生成 / 多智能体协作 / 长篇叙事一致性
- 核心创新点: 提出 ViMax:以多智能体协作的方式解决长篇视频生成中的“叙事规划+跨场景一致性”难题;通过将叙事决策、视觉一致性(角色/环境/风格)等职责拆分给专门代理并进行协商与协调,把长视频创作建模为可迭代的规划-生成-校验闭环,从机制上弥补短片段生成方法缺乏全局结构与一致性约束的问题。
GitHub
- [2026-06-09] hao-ai-lab/FastVideo ⭐3699
- [2026-06-09] ZeroLu/awesome-seedance ⭐1904
- [2026-06-09] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1327
- [2026-06-09] bytedance/Bernini ⭐644 🆕NEW
- [2026-06-09] pandayuanyu/NewtonGen ⭐131 🆕NEW
音频生成
arXiv
- HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis 🆕NEW
- 赛道归属: 视频配音 / 文本引导的视频到音频生成
- 核心创新点: 提出“整体式”视频配音框架,将传统仅做对白的配音扩展为同时生成对白、环境声与音效的统一音轨合成;以文本为高层语义控制信号,对复杂声学场景进行分层/多元素的联合建模与同步生成,从而减少人工后期分轨与混音依赖,实现更完整的端到端配音工作流。
- SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation 🆕NEW
- 赛道归属: 视频到音频生成 / 推理时对齐优化
- 核心创新点: 将V2A的视听对齐问题显式建模为“推理时搜索”而非仅依赖训练期目标;针对flow-matching式生成,在采样阶段引入Sequential Monte Carlo(粒子滤波)进行候选轨迹的并行探索与重采样,用对齐度/一致性指标引导生成路径选择,从而在不改动或少改动模型结构的前提下提升时序同步与语义贴合。
- ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment
- 赛道归属: 文本到语音 / 场景化语音生成(语音+环境声融合)
- 核心创新点: 提出环境感知TTS框架,通过多模态扩散Transformer显式建模语音与环境上下文(如场景/视觉/环境音提示)之间的跨模态交互,解决语音与环境声在声学形态与时间动态上的分布差异;并引入面向领域的表征对齐机制,将“语音生成表征”与“环境/场景表征”在统一空间中对齐,从而实现语音与环境声的自然共存与无缝融合(而非后期拼接)。
- Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement
- 赛道归属: 音频生成(复杂音频场景生成 / 多智能体编排与后期精修)
- 核心创新点: 提出多智能体框架,将“复杂音频场景描述→长音频成品”的生成过程拆解为可协作的子任务(如对白/音效/音乐/时间结构/后期处理等),通过代理间的规划、编排与迭代式精修实现长时序结构化生成与可控性提升;重点突破在于用系统级的分工与闭环优化机制,缓解单模型端到端生成在长音频一致性、元素协调与制作级后处理上的困难。
- UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion
- 赛道归属: 统一音频生成与编辑(Text-to-Audio/TTS/音频编辑一体化,多任务扩散)
- 核心创新点: 用单一潜空间扩散模型统一覆盖文本到音频、文本到语音、零样本音色克隆、语音+音效混合生成、场景级音频编辑与时间编排等任务,实现“同权重多能力”;关键方法是层级式深度LLM融合(将LLM多层隐状态注入扩散网络以增强语义与结构控制)以及面向多任务的统一条件接口/训练范式,使生成与编辑在同一潜空间与同一推理管线内闭环完成,减少任务间割裂与模型堆叠。
- End-to-End Training for Discrete Token LLM based TTS System 🆕NEW
- 赛道归属: 文本到语音 / 端到端训练与对齐
- 核心创新点: 打破“tokenizer—AR LLM—FM声码器”各自独立训练的级联范式,提出统一的端到端优化框架,将语音tokenizer、离散token LLM、flow-matching生成器与奖励模型纳入同一训练闭环;通过联合优化缓解离散化误差与模块间目标不一致问题,并用RM提供面向感知质量/可控性的训练信号,实现更一致的全链路TTS生成。
- FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation 🆕NEW
- 赛道归属: 流式文本到语音 / 低延迟推理加速
- 核心创新点: 面向对话式场景的流式TTS,针对两大瓶颈(AR预测慢、FM多步采样慢)提出组合式加速:用MTP(多token并行/多步预测)降低自回归解码时延,并通过X-pred mean flow distillation将多步flow采样蒸馏为更少步数的快速生成;同时强调原生流式输入输出能力,降低端到端首包与持续延迟。
- BareWave: Waveform-Native Flow-Matching Text-to-Speech 🆕NEW
- 赛道归属: 文本到语音 / 波形端到端生成
- 核心创新点: 提出完全“波形原生”的flow-matching TTS,绕开中间声学表征(如mel谱)与单独训练的解码/声码器阶段,实现直接从文本到raw waveform的生成;围绕raw波形建模带来的训练难点(高频细节、长序列、稳定对齐等)设计针对性的训练与建模策略,使端到端波形生成在质量与可训练性上可行。
- TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech 🆕NEW
- 赛道归属: 文本到语音 / Token压缩与高效自回归建模
- 核心创新点: 针对codec离散token序列远长于文本导致的AR计算与KV cache膨胀瓶颈,提出TLDR式音频token压缩机制,在尽量保留语音信息的前提下减少序列长度,从结构上降低每步因果计算与缓存开销;从而在不牺牲(或尽量少牺牲)音质的情况下显著提升推理吞吐与降低显存占用,改善长音频生成效率。
- Audio Imitator: Controlling Timbre and Tempo in Video2Audio Synthesis with Audio Reference
- 赛道归属: 音频生成(Video-to-Audio / 参考音频驱动的风格可控合成)
- 核心创新点: 提出属性感知的Video2Audio框架,将参考音频中的“音色”与“速度/节奏”显式建模为可控属性,而非把参考音频当作整体条件直接注入;通过对风格属性的解耦表示与定向条件化,实现对生成音频风格维度的细粒度控制,同时保持与视频语义和时间对齐的一致性。
GitHub
- [2026-06-09] huggingface/diffusers ⭐33817
- [2026-06-08] BinWang28/audio-ai-hub ⭐931
- [2026-06-05] apocas/restai ⭐510
- [2026-06-08] xiaomi-research/controlfoley ⭐131
- [2026-06-08] dgrauet/ltx-2-mlx ⭐56
HuggingFace Models
语言大模型
arXiv
- Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning
- 赛道归属: 推理优化(可控推理/测试时推理控制)
- 核心创新点: 将“推理过程如何展开”的控制显式化为一个马尔可夫决策过程:引入控制器智能体在推理时按状态自适应决策(如继续思考、切换策略、停止等),以最小化无效token消耗并在不显著牺牲准确率的前提下实现可控的推理长度与推理轨迹;相较仅做截断/早停/压缩的效率方法,ACTS把“思考策略”作为可学习/可调度的动作空间,从而提供更细粒度的推理时控制与效率-性能权衡。
- An Asymptotic Theory of Chain-of-Thought in In-Context Learning
- 赛道归属: 理论分析(In-Context Learning / Chain-of-Thought 机理与尺度律)
- 核心创新点: 在一个可解析的理论模型中刻画CoT深度与泛化性能的尺度行为:将测试时CoT推理形式化为对线性回归中“权重参数估计”的迭代精炼过程,从而推导随推理步数增加时误差/泛化的渐近规律与收益递减条件;该框架把“CoT=迭代算法”的观点落到可证明的渐近理论上,为理解何时加深CoT有效、何时无效提供了可计算的判据。
- Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
- 赛道归属: 多模态推理(MLLM Chain-of-Thought 对齐/微调优化)
- 核心创新点: 通过系统性实证分析指出多模态 CoT 在视觉推理中常“越想越错”,并归因于两类稳定失败模式:过早锁定答案与对直接视觉证据利用不足。在此基础上提出“注意力引导的微调”思路:利用/约束模型注意力分配,使推理步骤更聚焦于与当前推理相关的视觉区域与证据链,从训练层面纠正 CoT 生成时的证据对齐与决策时机问题,从而提升多模态逐步推理的可靠性与可解释性。
- COFT: Counterfactual-Conformal Decoding for Fair Chain-of-Thought Reasoning in Large Language Models
- 赛道归属: 公平性可控解码 / 推理阶段偏见抑制
- 核心创新点: 提出一种无需训练、仅在解码阶段生效的公平性控制方法 COFT,用于抑制链式思维生成中的社会偏见放大。方法上以反事实提示构造 + 共形预测约束为核心:先将提示中的敏感片段替换为中性占位符形成“掩码反事实”输入,以获得相对去偏的参考分布;再在token 级别对原始解码分布施加公平性约束,并通过分布无关的边际有效性保证(在 exchangeability 假设下)为公平控制提供可验证的统计保证,从而实现对任意冻结的因果语言模型在推理时的可控去偏解码。
- Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention
- 赛道归属: 语音大模型推理诊断与对齐(Speech LLM Reasoning / 语音-文本推理鲁棒性)
- 核心创新点: 提出并验证“实体绑定失败”是语音LLM在复杂推理中相对文本LLM性能塌陷的关键、且高度局部化的原因:通过对多种任务分解评测,发现S2T在空间/句法/事实类任务不弱于T2T,但在需要持续实体跟踪的逻辑推理任务上准确率降至随机水平;进一步将退化机制归因于连续语音表征导致的实体-属性/关系绑定不稳,从而把“模态差距”从笼统能力不足细化为可诊断的绑定机制问题,并提出基于Chain-of-Thought的干预思路以强化实体跟踪与绑定过程。
- LLM-XTM: Enhancing Cross-Lingual Topic Models with Large Language Models
- 赛道归属: 跨语言主题建模(NLP 表征学习/主题模型 + LLM增强)
- 核心创新点: 提出LLM-XTM,将LLM用于“主题层面”的跨语言对齐与可解释性提升,同时通过自一致性不确定性估计抑制幻觉并降低对不可获得的token概率(白盒接口)的依赖:用LLM引导的主题精炼替代昂贵且易漂移的文档级改写/标注式增强,并以不确定性驱动的自一致性机制筛选/聚合LLM建议,使跨语言主题更连贯、对齐更稳健,且在资源稀缺的双语条件下仍可工作。
- SmartThinker: Progressive Chain-of-Thought Length Calibration for Efficient Large Language Model Reasoning
- 赛道归属: 推理优化(CoT 长度自适应控制 / 高效推理)
- 核心创新点: 提出 SmartThinker 的“渐进式 CoT 长度校准”框架,针对长推理模型在不同难度问题上普遍存在的冗余与过度思考,突破点在于将“长度控制”从静态奖励(对所有样本一刀切)升级为随题目难度动态调整的策略。方法上通过逐步校准推理链长度,使模型在简单问题上自动收敛到更短、更经济的推理,在困难问题上保留必要的长推理,从而在尽量不损失准确率的前提下显著降低输出冗余与推理成本,并弥补现有 GRPO 静态长度奖励无法自适应难度的缺陷。
- Visual Instruction Tuning Aligns Modalities through Abstraction
- 赛道归属: 多模态理解与视觉指令微调(Vision-Language Instruction Tuning / 跨模态对齐机制)
- 核心创新点: 从“层级抽象”视角系统揭示视觉指令微调如何实现跨模态对齐:通过跨多种视觉-语言架构的层间分析,发现指令微调的主要作用并非让视觉信息逐层经过LLM早期的单模态处理层,而是作为“桥接器”将视觉特征直接注入LLM的中间语义层,在抽象层面完成对齐并绕过早期层;该结论为设计更高效的视觉接入方式(如选择性注入层、减少无效早期融合)提供了机制性依据,而不仅是经验性配方。
- Taiji: Pareto Optimal Policy Optimization with Semantics-IDs Trade-off for Industrial LLM-Enhanced Recommendation
- 赛道归属: LLM增强推荐系统 / 后训练对齐 / 多目标强化学习优化
- 核心创新点: 提出一种面向工业LLM推荐的“语义空间—ID空间”可控对齐框架,通过将语义质量收益与ID推荐效果建模为相互制约的多目标优化问题,学习帕累托最优的策略集合而非单一加权目标,从而显式刻画并可调节两类奖励的权衡;同时针对开放域推荐中CoT质量难以度量与提升的问题,引入可操作的训练信号/优化机制,使策略优化能够在语义推理质量与ID点击/排序指标之间稳定迁移,缓解传统SFT/RL在该场景下的对齐瓶颈。
- Rethinking the Divergence Regularization in LLM RL 🆕NEW
- 赛道归属: 大语言模型后训练— 强化学习优化与信赖域/正则化(PPO/GRPO/DPPO改进)
- 核心创新点: 该工作针对LLM强化学习中常见的离策略(policy staleness、训练-推理分布不一致)导致的优化不稳定问题,重新审视“发散度正则/信赖域约束”的实现方式。指出PPO/GRPO依赖的importance ratio clipping在长尾词表下难以真实刻画分布漂移(ratio对分布差异的代理性不足),从而可能带来错误的信赖域控制。论文的关键突破在于:从“分布偏移度量”的角度重构正则项/约束设计,使其更直接、更可靠地约束新旧策略的行为分布差异(而非仅约束token级ratio),以提升离策略场景下的稳定性与可控性,并与DPPO等近期方法形成对比与统一分析框架。
GitHub
- [2026-06-10] sgl-project/sglang ⭐28896
- [2026-06-10] NVIDIA/TensorRT-LLM ⭐13839
- [2026-06-10] google-ai-edge/LiteRT-LM ⭐5515
- [2026-06-10] chrisliu298/awesome-llm-unlearning ⭐596 🆕NEW
- [2026-06-10] mikexcohen/LLM_course ⭐283 🆕NEW
HuggingFace Datasets
- [2026-05-28] openbmb/UltraData-SFT-2605
UltraData-SFT-2605
📦 UltraData Collection | 🌐 UltraData | 🤗 MiniCPM5 Series
English | 中文
📚 Introduction
Ult...
- [2026-05-01] angrygiraffe/claude-opus-4.6-4.7-reasoning-8.7k
Background
Ended up with some tokens to burn on a Claude Max plan. Assembly began during 4.6 and moved to 4.7. Model is tagged. The develop...
- [2026-06-04] nvidia/Nemotron-Pretraining-Code-v3
Nemotron-Pretraining-Code-v3 Dataset Description:
The Nemotron-Pretraining-Code-v3 dataset is part of the Nemotron Pretr...
- [2026-05-28] openbmb/Ultra-FineWeb-L3
Ultra-FineWeb-L3
📜 Ultra-FineWeb Technical Report | 📦 UltraData Collection | 🌐 UltraData | 🤗 MiniCPM5 Series
English | 中文
...
- [2026-06-03] OpenClaw/clawhub-security-signals
ClawHub Security Signals
🦀 ClawHub | 📝 OpenClaw Blog | 🤗 Hugging Face Blog | 📄 Paper | 📄 Pre-Print ClawHub Security Signals is a saniti...
多模态大模型
arXiv
- MLLM-Microscope: Unlocking Hidden Structure Within Multimodal Large Language Models
- 赛道归属: 多模态理解(MLLM可解释性/表征分析与诊断)
- 核心创新点: 提出一套面向MLLM内部表征的系统化“显微镜”分析框架,沿Transformer层级同时刻画多模态token嵌入的线性度、内在维度与各向异性,并区分主干流与残差流进行对照诊断;在ScienceQA上对LLaVA-NeXT与OmniFusion做跨模型、跨模态的层间结构测量,揭示多模态token在不同流与不同层中呈现高度线性等隐藏结构特征,为后续的可解释性、压缩与对齐机制设计提供可量化的表征指标体系。
- Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness
- 赛道归属: 多模态安全与可信(开放世界异常检测/拒识、VLM鲁棒性)
- 核心创新点: 提出“语义自负”作为开放世界部署中的关键失效模式:VLM会将未知异常强行映射到已知语义并高置信输出。方法上以“生成式语义抗体”为核心机制,为模型显式注入“负知识/反语义”以形成可拒识的决策边界,从而在不破坏原有零样本语义对齐能力的前提下提升开放世界可信性与异常处理能力。
- mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models 🆕NEW
- 赛道归属: 多模态可解释性(Text-Audio MLLM 归因解释 / Shapley Value)
- 核心创新点: 提出开源框架将 Shapley Value 归因从纯文本 LLM 扩展到文本-音频多模态场景,关键方法突破在于:1)模态感知的 coalition masking,针对离散文本 token 与稠密音频编码帧的交织处理,设计可控的遮蔽与组合策略,使 SV 估计在跨模态输入上可计算且语义一致;2)面向多轮对话的归因机制,将上下文轮次与当前输入共同纳入贡献分解,支持分析跨轮次、跨模态的因果贡献;3)以工程化平台形式提供统一接口与流程,降低多模态 SV 解释在不同 MLLM/音频前端上的复用门槛。
- Cross-modal linkage risk in clinical vision-language models
- 赛道归属: 多模态安全与隐私(视觉-语言模型的链接攻击/成员关联风险评估)
- 核心创新点: 将临床VLM的隐私问题形式化为跨模态重链接风险:即模型学习到的共享嵌入空间可能保留实例级对应关系,使攻击者仅凭余弦相似度检索即可把去标识化影像重新关联到原始放射学报告;提出相应的威胁模型与评测设定,用以量化在“影像与报告被刻意分离共享/访问控制”的真实流程下,嵌入对齐带来的可重识别性,从而把“表征对齐能力”转化为可度量的隐私攻击面。
- Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation
- 赛道归属: 多模态理解(VLM幻觉抑制、跨模态融合/注意力机制改进)
- 核心创新点: 从“视觉注意力汇聚/沉没”角度解释幻觉:并非简单的“语言先验过强”,而是视觉注意力被任务无关区域吸走导致视觉证据未被有效融合。提出利用“注视转移”信号来指导跨模态融合增强:通过建模视线在关键区域间的动态转移,重分配视觉-文本对齐时的注意力与融合权重,避免仅按原始注意力分数做放大而加剧偏置,从机制上降低不可证实内容生成。
- Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model Enhancement
- 赛道归属: 多模态模型压缩与端侧部署(知识蒸馏/对齐增强)
- 核心创新点: 提出 Align-KD,将“大模型的跨模态对齐能力”作为可蒸馏的核心知识而非仅蒸馏输出分布/特征;通过显式对齐约束与跨模态一致性信号,把教师VLM在图文对齐、语义绑定等能力迁移到轻量学生模型,从而在移动端/边缘设备的参数与算力受限条件下,尽量减少模型缩小带来的对齐与理解能力退化。
- VLM-GLoc: Vision-Language Model Enhanced Monte Carlo Localization for Robust Semantic Global Localization in Cluttered Quasi-Static Environments
- 赛道归属: 具身智能与机器人定位(语义全局定位、VLM+概率滤波/Monte Carlo Localization)
- 核心创新点: 将VLM的开放词汇语义理解引入Monte Carlo Localization框架,面向“几何与语义都高度混淆”的准静态室内环境(如货架平行通道、重复家具)提升全局定位鲁棒性。核心在于用VLM生成/评估与场景观测一致的语义证据,并将其作为观测模型或粒子权重更新信号,与传统几何/外观特征互补,从而在几何别名严重、语义长尾且遮挡杂乱的场景中实现更稳定的语义级全局定位。
- ES-Merging: Biological MLLM Merging via Embedding Space Signals
- 赛道归属: 多模态模型融合(模型合并/参数高效跨模态统一,生物科学MLLM)
- 核心创新点: 提出ES-Merging,用嵌入空间信号来指导生物领域MLLM的合并:不再依赖输入无关的参数空间启发式,而是利用各模型在嵌入空间中体现的模态专长与对齐特征来决定合并策略/权重,从而更忠实地保留不同单模态模型的能力并实现跨模态统一;该思路把“模态专门化”从难以观测的参数差异,转化为可直接度量与可优化的表征信号,提高合并后的跨模态任务适配性。
- SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM 🆕NEW
- 赛道归属: 多模态视频理解(视频时刻检索 / Temporal Moment Retrieval)
- 核心创新点: 提出 Shot-Aware 的视频时刻检索框架,核心在于将镜头级结构化时间建模与音频增强的 MLLM结合:1)用镜头边界/shot 作为中层时间单元,替代粗粒度时间切片,实现更精确的时序定位与跨镜头语义对齐;2)引入音频信息增强检索,在复杂视频中利用语音/环境声等线索补足纯视觉的歧义,提升对事件边界与语义触发点的辨识;3)以 MLLM 作为跨模态语义对齐与推理核心,将文本查询与视听证据融合以输出更可靠的时间段定位。
- OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics 🆕NEW
- 赛道归属: 多模态智能体评测(VLM 游戏智能体基准 / 交互式环境 Benchmark)
- 核心创新点: 构建统一的 UE5 实时游戏基准以评测 VLM 游戏智能体,并在评测方法上做出关键改进:1)提出统一协议,在同一套任务与度量下公平比较商业闭源 VLM、开源权重 VLM 与专用游戏策略;2)从“单次首尝试得分”扩展为改进动态评估,显式衡量智能体在多次尝试/反馈下的学习与适应轨迹,而非静态能力点;3)覆盖多款新建 UE5 游戏并支持实时交互,强化对感知-决策-执行闭环、长时序任务与泛化能力的系统性压力测试。
GitHub
- [2026-06-09] Blaizzy/mlx-vlm ⭐4995
- [2026-06-08] NVlabs/Eagle ⭐2313
- [2026-06-09] waybarrios/vllm-mlx ⭐1313
- [2026-06-08] Roots-Automation/GutenOCR ⭐189 🆕NEW
- [2026-06-09] ZJU-REAL/SpatialLadder ⭐96 🆕NEW
强化学习
arXiv
- ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning 🆕NEW
- 赛道归属: 大语言模型推理强化学习
- 核心创新点: 在传统RLVR稀疏二值可验证奖励之外,引入基于模型log-prob的token级置信度信号,将“模型内部不确定性”显式纳入策略优化;在Group Relative Policy Optimization等相对优势类目标上进行置信度感知的加权/整形,使训练不仅追求通过验证的最终答案,还能在生成过程中更稳定地强化高置信推理路径、抑制低置信步骤,从而提升推理可控性与样本效率。
- CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts
- 赛道归属: 多领域LLM强化学习对齐(跨域冲突缓解 / 奖励建模)
- 核心创新点: 提出CARE-RL,将“协议感知”的生成式奖励与“能力感知”的优化联合起来解决多领域RL中的两类关键瓶颈:一是非可验证任务奖励不可靠,二是跨领域能力相互干扰。方法上通过Protocol-Aware Generative Reward Model在提示/协议层面构造更稳健的奖励信号以覆盖不可验证场景,并在优化阶段引入能力维度的约束/加权机制,使更新更聚焦于目标能力、减少对其他领域能力的负迁移,从而系统性缓解cross-domain conflicts。
- Survival Reinforcement Learning: Toward Scalable Self-Supervised RL
- 赛道归属: 自监督强化学习 / 目标条件长时序规划
- 核心创新点: 提出Survival Reinforcement Learning作为对比式自监督RL的替代范式,用在线分类式目标判别取代对比损失,规避对比学习在长时序规划中“uniformity–tolerance”两难导致的表征退化/目标区分不足问题;将“survival value learning”扩展为通过最大化到达目标后的驻留时间来学习可用于长视野目标条件控制的价值信号,从而在深网络可扩展性与长时序可规划性之间取得更稳健的折中。
- A Lecture Note on Offline RL and IRL, Part II: Foundations of Inverse Reinforcement Learning and Dynamic Discrete Choice Models
- 赛道归属: 逆强化学习理论 / 离线RL与结构计量经济学统一视角
- 核心创新点: 以讲义形式系统梳理IRL的基础,并将熵正则IRL与结构计量中的动态离散选择模型在数学结构上进行对齐:从“由专家离线数据反推奖励/偏好”的角度,统一讨论可辨识性、似然/最大熵目标、价值函数与策略的对应关系,以及由此带来的估计与推断框架;其方法论价值在于提供跨社区的同构映射与推导路径,便于将DDC的统计推断工具与IRL的优化视角互相迁移。
- RL-ACRGNet: Reinforcement Learning-Based Chest Radiology Report Generation Network
- 赛道归属: 医学影像多模态生成(胸部影像报告生成)/ 强化学习用于文本生成
- 核心创新点: 提出RL-ACRGNet,将强化学习引入胸部放射学报告生成的训练框架,以缓解纯监督学习在“疾病识别准确性”和“报告表述质量/一致性”上的不足。方法层面通过将临床相关的序列级目标(如报告整体质量、关键病灶描述覆盖等)显式作为RL优化信号,直接优化生成报告的全局指标而非仅做token级似然拟合,从而提升对细粒度病灶信息的捕获与报告生成的临床可用性与一致性。
- StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning
- 赛道归属: LLM智能体强化学习 / 策略优化算法
- 核心创新点: 提出StepPO,针对现有LLM-RL普遍采用token为基本优化粒度而与智能体“按步骤(observation-action循环)决策”的粒度不匹配问题,改为以“步骤”作为对齐与优化的核心单位。方法突破在于将信用分配与策略更新从token层提升到step层,使奖励/优势估计与环境交互的决策边界一致,从而更贴合agentic行为结构,减少由token级噪声与粒度错配带来的优化偏差,提升多步任务中的决策稳定性与学习效率。
- Rethinking the Divergence Regularization in LLM RL 🆕NEW
- 赛道归属: 大语言模型后训练— 强化学习优化与信赖域/正则化(PPO/GRPO/DPPO改进)
- 核心创新点: 该工作针对LLM强化学习中常见的离策略(policy staleness、训练-推理分布不一致)导致的优化不稳定问题,重新审视“发散度正则/信赖域约束”的实现方式。指出PPO/GRPO依赖的importance ratio clipping在长尾词表下难以真实刻画分布漂移(ratio对分布差异的代理性不足),从而可能带来错误的信赖域控制。论文的关键突破在于:从“分布偏移度量”的角度重构正则项/约束设计,使其更直接、更可靠地约束新旧策略的行为分布差异(而非仅约束token级ratio),以提升离策略场景下的稳定性与可控性,并与DPPO等近期方法形成对比与统一分析框架。
- Self-Paced Curriculum Reinforcement Learning for Autonomous Superbike Racing in Simulation 🆕NEW
- 赛道归属: 机器人/自动驾驶控制强化学习(两轮车竞速与平衡控制、仿真到控制策略学习)
- 核心创新点: 面向超级摩托车竞速这一高动态、强耦合控制任务(平衡/倾角/转向/油门联动),提出自步式课程强化学习框架:根据智能体当前能力自动调节任务难度与训练分布(如速度、赛道段、扰动/初始状态等),逐步从易到难覆盖极限工况;在物理精确的Unity仿真器中实现可扩展训练流程,使策略能同时学到稳定性(不摔车)与竞速性能(圈速/超车)之间的权衡。
- Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning 🆕NEW
- 赛道归属: LLM智能体强化学习工程化(Agentic RL数据中间件/数据闭环)
- 核心创新点: 将关注点从“优化算法本身”前移到“交互数据全生命周期”,提出面向Agentic RL的step级数据中间件:以环境交互的每一步为最小数据单元,统一采集、结构化、索引、回放与消费(训练)接口,支持在线/离线混合、可追溯的轨迹管理与数据质量控制;通过标准化step级schema与管道化处理,降低不同环境/框架间的数据耦合成本,提升大规模代理训练的可复现性与迭代效率。
- A Unifying Lens on Reward Uncertainty in RLHF 🆕NEW
- 赛道归属: RLHF奖励建模与不确定性(分布式奖励模型/悲观优化/抗reward hacking)
- 核心创新点: 提出用“分布式奖励模型” (p) 作为统一刻画RLHF中奖励不确定性的正确对象,而非仅输出标量分数的RM;在贝叶斯或集成等实现下,将不确定性与“悲观化”策略优化联系起来:在RM高不确定区域对奖励进行下调/风险敏感处理,从理论上统一不同不确定性估计与惩罚形式,系统性缓解reward hacking(策略利用RM误差刷分)并提升对真实质量的对齐鲁棒性。
GitHub
- [2026-06-09] PufferAI/PufferLib ⭐5880
- [2026-06-10] rllm-org/rllm ⭐5604
- [2026-06-09] facebookresearch/ReAgent ⭐3702 🆕NEW
- [2026-06-09] facebookresearch/Pearl ⭐3008
- [2026-06-10] radixark/miles ⭐1527
HuggingFace Models
HuggingFace Datasets
-
[2026-06-04] stanford-vision-lab/gpic
GPIC: A Giant Permissive Image Corpus for Visual Generation
Keshigeyan Chandrasegaran1, Kyle Sargent1, Suchi...
-
[2026-06-05] nvidia/Nemotron-Personas-El-Salvador
Nemotron-Personas-El-SalvadorUn enfoque de IA compuesta para personas en español salvadoreño ancladas en distribuciones del...
-
[2026-06-05] nvidia/Nemotron-Personas-Vietnam
Nemotron-Personas-VietnamHệ thống AI kết hợp để tạo personas tổng hợp dựa trên phân bố thực tế của Việt Nam A compound ...
世界动作模型
arXiv
- C$^3$ache: Accelerating World Action Models with Cross Inference Chunk Cache 🆕NEW
- 赛道归属: 推理优化(面向扩散式世界动作模型/WAM 的加速与缓存)
- 核心创新点: 提出 Cross Inference Chunk Cache用于多 chunk 推理的跨段缓存复用:针对 WAM 在完成任务时需要连续运行多个 inference chunk、且每段都要进行昂贵去噪的特点,将可复用的中间计算(如去噪过程中的特征/状态)以“跨 chunk”方式缓存并在后续段落对齐复用,从而减少重复去噪计算与端到端推理时延,同时尽量保持生成/控制质量不显著下降。
- Light-WAM: Efficient World Action Models with State-Fusion Action Decoding 🆕NEW
- 赛道归属: 机器人策略学习/世界动作模型(高效架构与动作解码)
- 核心创新点: 提出 Light-WAM,通过“State-Fusion Action Decoding(状态融合动作解码)”将未来预测得到的时序状态表征与当前观测/隐状态进行融合,再进行动作解码;以更轻量的生成式/预测式骨干替代重型 WAM 架构,在保留 WAM 通过未来预测学习任务相关时序结构这一优势的同时,显著降低训练成本与闭环推理延迟,使其更适合实时机器人操作部署。
- WALL-WM: Carving World Action Modeling at the Event Joints
- 赛道归属: 世界动作模型 / 视觉-语言-动作预训练 / 视频动作建模
- 核心创新点:
- 中文:提出从“固定长度动作块”转向“语义事件”的世界动作建模范式,将语义连贯的动作事件作为最小学习单元,在事件连接点处刻画动作的自然边界与状态转移,从而缓解 chunk 粒度与真实动作结构不匹配带来的学习偏差。方法上以事件为锚点进行视觉-语言-动作联合预训练,使模型学习到更符合人类语义分段的动作表征与跨事件的因果/时序衔接能力,相比直接对当前观测+指令做 chunk 级预测,更强调事件级结构化监督与可组合性。
- Unified Video-Action Joint Denoising for Dexterous Action and Data Generation
- 赛道归属: 机器人世界模型 / 视频-动作联合生成
- 核心创新点: 从分布建模角度重构“视频先验→动作策略”的对齐方式:不再将视频基础模型的动态先验压缩为“给定观测的未来动作策略分布”,而是直接在交互视频与可执行手部轨迹的联合空间上进行建模与去噪生成;通过支持多种条件化机制/条件模式来保持更“宽”的联合分布,从而在同一框架内同时服务于灵巧动作生成与数据生成(视频与动作的协同合成),提升视频-动作一致性与可控性。
GitHub
- [2026-06-08] DravenALG/awesome-vla-wam ⭐721
由 Research Daily 自动生成 生成时间: 2026-06-10 01:02:38