AI 每日进展速报 - 2026-05-27
图像生成/编辑
arXiv
- MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation
- 赛道归属: 文生图(区域级可控生成 / 组合式生成)
- 核心创新点: 在SDXL的U-Net扩散框架中引入“Mask Attention”式的区域级注意力控制机制,用显式区域/掩码约束将文本条件与空间区域绑定,从而提升多目标场景下的全局协调与属性不串扰(减少对象间属性混淆),在保持U-Net高效性的同时增强跨区域的可控组合生成能力。
- PixelPonder: Dynamic Patch Adaptation for Enhanced Multi-Conditional Text-to-Image Generation
- 赛道归属: 多条件文生图(扩散模型可控生成 / ControlNet增强)
- 核心创新点: 提出一种“动态Patch自适应”的多条件融合机制,在扩散去噪过程中按空间区域动态分配与调整不同控制信号的影响权重/注入方式,替代传统ControlNet为每种条件建立独立分支的静态融合范式;通过缓解多源异构条件之间的指导冲突,实现更强的组合式条件遵循(结构与语义同时对齐)并减少结构扭曲,在保持高画质的同时提升多条件一致性与可控性。
- DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图 / 偏好对齐与奖励建模
- 核心创新点: 提出动态、准则感知的奖励建模框架 DyCoRM,使奖励模型不再依赖固定的通用评分维度,而是能根据用户当前关注的评价准则(如美学、文本一致性、细节、风格等)动态调整评估与打分机制;通过将“评价准则”显式纳入奖励学习与推断过程,实现对多样化、个性化偏好的更精细建模,从而为文生图生成提供更可控、更贴合需求的优化信号,提升对齐效果与泛化到不同偏好场景的能力。
- Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation
- 赛道归属: 文生图(强化学习对齐 / 训练策略与采样优化)
- 核心创新点: 面向基于GRPO的T2I强化学习训练,提出“课程式组策略优化”自适应采样:根据模型当前能力动态调整样本难度分布,避免统一采样带来的难度失配与低效更新,从而以更高样本效率释放RL在文生图对齐/偏好优化中的收益。
- CogBlender: Towards Continuous Cognitive Intervention in Text-to-Image Generation
- 赛道归属: 文生图(审美/心理属性可控生成 / 连续属性编辑)
- 核心创新点: 将“认知属性”(如情绪效价、可记忆性等)作为可控维度引入T2I生成,提出支持连续干预的CogBlender:在不只对齐语义的前提下,提供可连续调节的控制接口/机制,使生成结果能按用户心理意图在认知指标上平滑可控,而非仅靠离散风格词或后验筛选。
- Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation
- 赛道归属: 多模态统一建模(视觉理解 + 文生图的对比-生成统一训练)
- 核心创新点: 提出DREAM统一框架,将图文对比学习与掩码生成式建模端到端融合;关键在于“Masking Warmup”掩码课程调度,逐步移动掩码比例分布中心,使低掩码(利于对比对齐)与高掩码(利于生成建模)在同一训练过程中兼容,从而缓解两类目标对“可见token比例”相互冲突的问题。
- TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation
- 赛道归属: 个性化文生图(Text-to-Image Personalization / Diffusion 微调)
- 核心创新点: 提出一-shot 个性化方案,仅选择性微调文本编码器而非扩散模型主体/UNet,从而显著降低存储开销与训练成本并加快收敛;为避免个性化导致的语义漂移,引入“因果性保持” 机制/约束,在注入新概念表征的同时尽量维持原有文本语义结构与可组合性,实现更稳健的个性化生成与更好的泛化。
- PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset
- 赛道归属: 超高分辨率文生图(Ultra-High-Resolution T2I / 原生 UHR 生成)
- 核心创新点: 面向原生超高分辨率(最高 100MP)生成的关键瓶颈(数据稀缺与内容复杂),构建并开源大规模高质量 UHR 数据集 PixVerve-95K,通过系统化的数据筛选/清洗与质量控制提升训练信号密度;以数据为核心驱动推进“原生 UHR”生成能力(而非仅依赖后处理放大),为训练与评测超高像素级 T2I 模型提供可复用的数据基础与基准。
- Generation Navigator: A State-Aware Agentic Framework for Image Generation
- 赛道归属: 文生图(智能体生成 / 闭环生成控制与自动提示优化)
- 核心创新点: 将图像生成重构为“状态条件动作决策”问题,提出Generation Navigator多轮智能体框架:不再依赖手工规则或单次prompt改写,而是基于生成过程的状态反馈学习选择下一步动作(如改写提示、调整条件/参数等),实现对生成轨迹的自适应闭环导航,减少人工试错成本并提升意图达成率。
- RSEdit: Text-Guided Image Editing for Remote Sensing
- 赛道归属: 图像编辑(遥感领域 / 文本指令编辑)
- 核心创新点: 面向遥感图像提出RSEdit体系化方案:从U-Net到DiT构建一组可复现的文本引导编辑模型,并首次对“由现成文生图模型改造为编辑模型”的条件注入/conditioning策略进行全面对比研究;在提升指令遵循度的同时强调地理空间结构保持(道路/地物布局等),解决遥感编辑中“改得对且不破坏地理一致性”的关键矛盾。
GitHub
- [2026-05-27] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐12210 🆕NEW
- [2026-05-26] Light-Heart-Labs/DreamServer ⭐1789
- [2026-05-26] vibheksoni/free-ai ⭐501 🆕NEW
- [2026-05-26] VigoZhao/AI-Visual-Prompt-Cookbook ⭐143
- [2026-05-26] Z1rconium/gpt-image-linux ⭐71
视频生成/编辑
arXiv
- MAVEN A Multi-Agent Framework for Multicultural Text-to-Video Generation
- 赛道归属: 视频生成(文生视频 / 多智能体提示工程)
- 核心创新点: 提出多智能体提示精炼框架 MAVEN,面向“多文化/跨文化”文生视频的文化保真度问题,将文本提示分解为人物、动作、地点等可控维度,并由专门代理并行/串行协作改写与补全文化关键信息;通过结构化分解降低单一提示对文化细节的丢失与歧义,提升同文化与跨文化场景下生成内容的文化一致性与可评测性。
- World-R1: Reinforcing 3D Constraints for Text-to-Video Generation
- 赛道归属: 文生视频 / 3D一致性对齐(强化学习)
- 核心创新点: 通过强化学习而非结构改造来注入3D约束:将“几何一致性/世界约束”显式构造成奖励信号,对视频生成模型进行对齐优化,从而在不显著增加推理开销、保持可扩展性的前提下缓解几何不一致问题;同时构建面向“世界模拟”的纯文本数据集,用于更系统地覆盖可被3D约束检验的描述分布,提升对齐训练的有效性与泛化。
- Paris 2.0: A Decentralized Diffusion Model for Video Generation 🆕NEW
- 赛道归属: 视频生成(去中心化训练 / 分布式扩散模型)
- 核心创新点: 提出首个通过去中心化计算预训练的视频扩散生成模型,将原本在图像上验证的去中心化扩散训练范式扩展到需要强时序一致性的文本生成视频任务;核心突破在于给出去中心化场景下实现时序连贯训练的配方与机制,使得无需单体GPU集群也能完成低分辨率T2V预训练,并在去中心化通信与优化约束下维持跨帧一致性与可训练性。
- Where Concept Erasure Should Occur: Concept-Layer Alignment in Text-to-Video Diffusion Models 🆕NEW
- 赛道归属: 视频编辑(概念擦除 / 安全对齐 / 模型可控性)
- 核心创新点: 发现并形式化“概念-层拓扑对齐”现象:T2V扩散Transformer在不同深度对语义的编码不均匀,目标概念在特定层具有更高可分性,其他层则与非目标信号强纠缠;据此将概念擦除从“选定某层做抑制”的经验问题,重构为“先定位概念最可分的瓶颈层,再在对齐层实施擦除/编辑”的层选择与对齐问题,从而提升擦除有效性并减少对非目标语义与生成质量的副作用。
- PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution 🆕NEW
- 赛道归属: 视频生成(超高分辨率 / 高效训练与推理 / 分层建模)
- 核心创新点: 针对超大空间分辨率下token序列爆炸带来的两类耦合问题——优化不稳定(偏向局部纹理、全局结构崩塌)与计算成本/延迟不可承受——提出PixelWizard分层解耦框架:将“全局结构建模”与“细节纹理合成”在层级上拆分,先稳定学习全局一致的布局/运动/结构,再在受控条件下补全高频细节,从而在降低训练与推理开销的同时提升超高分辨率视频的全局连贯性与保真度。
- StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration 🆕NEW
- 赛道归属: 视频生成(实时流式音视频生成 / 角色驱动 / 低延迟推理)
- 核心创新点: 面向长时程、实时播放预算约束下的角色音视频流式生成,提出“解耦式编排”框架:将转录文本→语音对齐、跨chunk身份一致性维持、以及低步数蒸馏带来的质量退化等矛盾目标拆分为可协同的子模块/控制环;通过编排机制在chunk级生成中抑制音频-文本累积错位与视觉漂移,并在低延迟条件下尽量保留空间多样性与时序质量,实现可持续长时生成与稳定角色一致性。
- DeltaCam: Differential Intrinsic Camera Modeling for Video Generation 🆕NEW
- 赛道归属: 视频生成(相机可控生成 / 摄影成像建模 / 物理先验)
- 核心创新点: 提出DeltaCam,用“差分内参建模”将相机内参(如焦距、主点、畸变/成像特性等)显式纳入视频生成控制维度,补足以往主要控制外参(位姿/运动)而将内参视为隐式或固定的缺口;针对缺乏大规模、准确且随时间变化的内参标注数据这一瓶颈,采用学习“相对/差分”的内参变化而非绝对值的建模策略,使模型能够在弱/无精确元数据条件下学习可泛化的内参可控性,从而实现对成像过程与视觉外观的更可解释、更细粒度控制。
- Geo-Align: Video Generation Alignment via Metric Geometry Reward
- 赛道归属: 可控视频生成(相机/视角控制)/ 对齐学习(几何度量奖励)
- 核心创新点: 用“度量几何”构造奖励来做视频生成对齐:针对真实世界多视角同步数据稀缺、SFT依赖合成数据导致OOD泛化差的问题,将物理尺度与相机运动一致性转化为可优化的几何度量奖励信号,推动模型在缺少成对监督的情况下更好遵循相机轨迹与尺度约束,从而提升对真实视频重渲染/相机可控生成的鲁棒性。
- EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation
- 赛道归属: 多镜头视频生成 / 一致性与效率优化(训练免)
- 核心创新点: 提出训练免的“实体中心记忆”替代全帧记忆:将跨镜头需要保持一致的主体信息解耦为“实体索引的潜变量patch库”,避免把短时场景上下文一并写入记忆导致的信息泄漏;在生成时按实体检索与复用对应latent patch,实现跨镜头主体外观一致性,同时显著降低存储与计算开销,提升多镜头长程生成的效率与稳定性。
- One-Forcing: Towards Stable One-Step Autoregressive Video Generation
- 赛道归属: 自回归视频生成 / 一步采样加速与稳定性
- 核心创新点: 面向“一步自回归生成”的稳定训练/推断范式:针对少步AR模型在进一步降步(尤其1步)时质量崩塌的问题,提出One-Forcing以缓解训练-推断轨迹不匹配与误差累积,使模型在极少步甚至单步生成时仍能保持稳定的时序一致性与画质,从而显著降低交互式部署延迟。
GitHub
- [2026-05-26] Anil-matcha/Open-Generative-AI ⭐17031 🆕NEW
- [2026-05-26] showlab/Awesome-Video-Diffusion ⭐5667 🆕NEW
- [2026-05-27] hao-ai-lab/FastVideo ⭐3515 🆕NEW
- [2026-05-26] ZeroLu/awesome-seedance ⭐1810 🆕NEW
- [2026-05-26] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1207 🆕NEW
HuggingFace Models
音频生成
arXiv
- TED-TTS: Training-Free Intra-Utterance Emotion and Duration Control for Text-to-Speech Synthesis
- 赛道归属: 文本转语音 / 可控语音合成(零样本、细粒度韵律与情感控制)
- 核心创新点: 提出一种“免训练”的可控框架,直接作用于预训练零样本TTS,实现句内级别的情感与时长控制;通过分段感知的情感条件注入将情感控制从整句提升到片段级,避免依赖私有情感数据或多阶段再训练;同时将时长/节奏控制与情感表达解耦到可操作的句内控制接口,使同一句话内部可实现不同情绪与语速/停连的组合表达。
- FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations 🆕NEW
- 赛道归属: 音频生成|零样本文本转语音|可控生成(风格/音色解耦控制)
- 核心创新点: 通过解耦语音表征将语音分解为可解释属性(如内容、韵律/风格、音色等),并在零样本TTS中实现来自不同参考音频的分离式条件控制:用一段参考提供说话人音色、另一段参考提供说话风格/韵律,从而突破以往“单一参考同时绑定音色与风格”的耦合限制;方法上强调在表示学习与条件注入机制上实现属性独立性,使模型在保持高保真克隆的同时获得可组合、可编辑的控制能力。
- SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis
- 赛道归属: 文本转语音 / 连续表示自回归语音生成
- 核心创新点: 针对连续自回归TTS中“语义-韵律建模”与“重建驱动的连续声学表示”之间的根本错配,提出语义感知的连续自回归合成框架;核心在于强化高层语义一致性与可控韵律的建模优先级,抑制模型过度追逐低层纹理细节导致的自回归误差累积;通过在生成过程中显式引入语义约束/对齐机制,使连续表示既能保持高保真重建,又能提升长程语义连贯与表达稳定性。
- CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS 🆕NEW
- 赛道归属: 音频生成|语音编辑|零样本TTS|强化学习对齐
- 核心创新点: 面向“语音编辑”对局部一致性要求更高的特点,提出以语音编辑为目标的强化学习优化框架,用比SFT更细粒度、更贴近编辑任务的奖励信号,缓解配对编辑数据不完美带来的上限;核心突破在于将零样本TTS的生成能力通过RL进行“编辑对齐”,重点优化被编辑片段与上下文未编辑语音的声学连续性/一致性(如音色、韵律、能量、边界过渡),从而在零样本场景下获得更可靠的编辑质量与鲁棒性。
- Toward Natural Emotional Text-To-Speech System with Fine-Grained Non-Verbal Expression Control 🆕NEW
- 赛道归属: 音频生成|情感TTS|可控生成(细粒度非言语表达控制)
- 核心创新点: 将情感表达从“仅控制言语韵律”扩展到更真实的人类情绪关键成分——非言语发声(如笑、叹气、抽泣、哼声等),并提出细粒度NV控制的合成方法;通过构建/整理带有更高质量、细粒度标注的NV相关数据与控制标签,使模型能够在文本与情感条件之外,进一步在时间位置、类型、强度等维度对NV进行可控生成,从方法论上提升情感TTS的自然度与可表达性上限。
- Natural Yet Challenging to Detect: Robust In-the-Wild TTS through EMA and Dual-Scoring Prompt Selection -- Submission for WildSpoof 2026 TTS Track
- 赛道归属: 文本到语音 / 语音反欺骗鲁棒生成
- 核心创新点: 在F5-TTS架构上提出F5-TTS-DPS,将EMA(指数滑动平均)引入监督微调以稳定训练轨迹、降低野外数据分布噪声带来的过拟合,从而提升跨场景泛化与鲁棒性;同时提出双评分提示词/参考音频选择,利用LLM与音频大模型对候选参考/提示进行双路质量评估与过滤,在不改动主干生成机制的前提下提高合成保真度与自然度,并面向“更自然且更难检测”的对抗性目标优化生成质量。
- Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech
- 赛道归属: 文本到语音/开源数据与可复现训练
- 核心创新点: 提出“模型+数据”一体化的开源TTS方案:一方面发布可与闭源数据SOTA竞争的Raon-OpenTTS模型;另一方面构建超大规模可复现训练数据池Raon-OpenTTS-Pool(由公开英文语音聚合而成,规模达数十万小时级),系统性验证“大规模开放数据”在提升TTS鲁棒性与质量中的关键作用,并降低TTS研究对私有数据的依赖、提升可复现实验基线的可获得性。
- AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech
- 赛道归属: 文本转语音 / 指令可控语音合成(复合指令、Agent框架、闭环控制)
- 核心创新点: 提出多智能体闭环框架,将“离散文本意图”到“连续声学实现”的结构性鸿沟拆解为可协作的子任务;通过对抗式解耦智能体降低说话人特征、内容与风格控制之间的纠缠,提升复合指令(如情绪+语速+强调+停顿等)的可组合性与可控性;引入闭环评估/反馈机制(由智能体对生成语音的意图一致性进行判别并迭代修正),实现更“意图忠实”的表达控制,而非一次性前向生成。
- RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models 🆕NEW
- 赛道归属: 音频生成|零样本TTS/声音克隆|评测基准(鲁棒性Benchmark)
- 核心创新点: 提出面向现代声音克隆系统的鲁棒性评测基准,系统覆盖真实应用中的关键扰动源:参考音频噪声与失真、文本提示不完备/错误、多语种与长音频生成、后处理链路影响、对抗扰动等;方法论贡献在于将“相似度/自然度”之外的维度标准化为可复现的测试协议与指标集合,用于对比不同范式模型(如基于codec token的语言模型等)在复杂条件下的稳定性与退化模式,从而推动可部署级语音克隆的可靠性研究。
- Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models
- 赛道归属: 情感可控文本转语音 / 自回归语音生成的控制与引导优化
- 核心创新点: 提出跨模态一致性引导的Classifier-Free Guidance,针对“文本语义隐含情绪”与“显式目标情绪指令”冲突时导致的表现力与音质退化问题,引入基于不一致程度的动态引导尺度,按冲突强弱自适应调节情绪控制强度以提升鲁棒性;同时将CFG中的dropout无条件分支替换为“文本情绪”条件,使引导信号显式对齐文本侧情绪信息,从而在保持语音自然度/质量的同时增强情绪可控性;并通过蒸馏将CCG-CFG的推理期引导收益压缩进单模型(减少推理开销),实现更高效的情绪控制生成。
GitHub
- [2026-05-26] huggingface/diffusers ⭐33705 🆕NEW
- [2026-05-25] denizsafak/abogen ⭐4598
- [2026-05-26] Stability-AI/stable-audio-tools ⭐3742
- [2026-05-24] apocas/restai ⭐506 🆕NEW
- [2026-05-26] facebookresearch/WavFlow ⭐105
HuggingFace Models
HuggingFace Spaces
语言大模型
arXiv
- EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models
- 赛道归属: 对齐评测(道德/价值观对齐、LLM-as-Judge评估)
- 核心创新点:
- 提出一个可解释的链式思维评测框架EvalMORAAL,将道德对齐评估从“黑箱打分”推进到“可追溯推理+量化评分”的透明流程。
- 设计双评分通道:基于模型输出的log-probabilities与直接主观评分并行,降低单一指标偏置并增强稳健性。
- 引入LLM-as-Judge 的同侪评审机制,用于对模型推理与结论进行二次审阅,提升评测一致性与可审计性。
- 将评测基准落到跨文化大规模社会调查数据(WVS/PEW,多国家多议题),把“道德对齐”具体化为与真实人群价值分布的相关性度量(如Pearson相关),形成更具外部效度的对齐评估范式。
- ACIL: Auto Chain of Thoughts for In-Context Learning
- 赛道归属: 提示学习与推理增强(In-Context Learning / Chain-of-Thought 自动化)
- 核心创新点: 提出一种面向ICL的“自动链式思维”构造机制:不再只提供输入-输出示例,而是自动为示例补全/生成可复用的多步推理轨迹,并将其组织成更适配目标任务的演示模板,从而在不更新参数的前提下显式注入推理过程,提升ICL在多步推理任务上的稳定性与泛化能力。
- Step-TP: A Grounded, Step-Level Dataset with Chain-of-Thought Reasoning for LLM-Guided Tensor Program Optimization 🆕NEW
- 赛道归属: LLM辅助编译优化 / 张量程序优化数据集(程序优化 + 推理链监督)
- 核心创新点: 提出Step-TP,一个“可落地到具体变换”的逐步级数据集,用于将张量程序优化建模为可组合的序列决策过程;相较仅提供端到端优化前后程序对的既有数据,Step-TP提供可验证的中间变换步骤与对应的Chain-of-Thought推理监督,使每一步优化决策具备可解释性与可检查性,并避免token低效的表示方式,从而更适配LLM在迭代优化中的训练与评测(如逐步决策正确性、可组合性与可回放验证)。
- Can Large Language Models Imitate Human Speech for Clinical Assessment? LLM-Driven Data Augmentation for Cognitive Score Prediction
- 赛道归属: 医疗语音理解与临床评估(LLM数据增强/认知评分预测)
- 核心创新点: 利用“同一临床提示下的书面回答”作为语义锚点,构建LLM驱动的数据增强框架,将文本层面的语义约束注入到自发口语叙事的生成/改写中,以缓解小样本与类别不均衡问题;通过语义锚定的增强样本提升从语音/转写到认知量表分数的回归/预测鲁棒性与泛化能力。
- Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective
- 赛道归属: 大模型学习机制与归纳偏置分析(Fine-tuning vs In-Context Learning,对比评测方法学)
- 核心创新点: 从形式语言学习视角构建可控、边界精确的任务体系,用严格定义的语言类别与可控字符串分布来统一对比FT与ICL:通过消除以往实验设置不一致带来的混淆,系统刻画两种学习模式在样本效率、泛化边界与归纳偏置上的差异,为“FT与ICL到底学到什么、偏好什么结构”提供可复现实证框架。
- Early Stopping Chain-of-thoughts in Large Language Models
- 赛道归属: 推理优化与高效推断(Chain-of-Thought 早停/自适应计算)
- 核心创新点: 提出ES-CoT推断时方法:在黑盒条件下通过检测“答案收敛”信号来提前终止CoT生成,避免冗长推理带来的高token成本;相较依赖白盒监控或不稳定提示技巧的方法,该方案强调推断阶段可插拔、无需改模型参数,并以收敛判据实现更可靠的自适应推理长度控制。
- GVGAI-LLM: Evaluating Large Language Model Agents with Infinite Games
- 赛道归属: LLM智能体评测与基准(游戏环境推理/规划/交互)
- 核心创新点: 构建GVGAI-LLM无限游戏评测基准:基于GVGAI框架与游戏描述语言(规则+关卡可快速生成),提供多样街机式任务以测试LLM在非传统NLP分布下的推理、规划与问题求解;通过可程序化生成新游戏来降低基准过拟合风险,并支持持续扩展的“无限”评测设置。
- Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
- 赛道归属: 多模态大模型训练与OCR增强(多语言文本理解/视觉文本推理)
- 核心创新点: 提出面向真实场景视觉文本的多语言OCR增强训练框架:结合(1)大规模合成“OCR→翻译/理解”数据生成以覆盖复杂版式与噪声,(2)基于LoRA的OCR-aware监督微调以低成本注入视觉文本能力,(3)结构化的视觉提示与提示引导CoT推理以提升跨语言读图与文本推理的可控性与鲁棒性,系统性缓解MLLM在小字、遮挡、模糊与复杂字体上的失效。
- River-LLM: Large Language Model Seamless Exit Based on KV Share 🆕NEW
- 赛道归属: LLM推理加速 / 早退推理与KV Cache机制优化
- 核心创新点: 提出River-LLM,通过“KV Share(跨层KV共享)”实现decoder-only大模型的无缝早退,针对早退在decoder架构中被“KV Cache缺失(跳过层无法产出后续token所需历史状态)”卡住的关键瓶颈;其方法核心是在允许跳层的同时,仍为后续解码提供一致、可用的KV缓存供给,从而把早退从“理论可跳层”推进到“工程可落地的端到端加速”,在不破坏自回归解码依赖的前提下降低推理时延。
- GILT: An LLM-Free, Tuning-Free Graph Foundational Model for In-Context Learning
- 赛道归属: 图基础模型 / 图领域 In-Context Learning/ 跨图泛化
- 核心创新点: 提出一种不依赖LLM、无需微调的图基础模型框架,用于在极端异构图场景下实现类ICL的快速适配与跨图泛化。其方法论突破在于:针对不同图之间特征空间、标签集合与拓扑结构不一致带来的“任务/空间不对齐”问题,通过构建与具体图域无关的统一表示与对齐机制,使模型能够在不进行参数更新的前提下,仅依靠上下文示例完成对新图/新任务的推断与迁移,从而绕开现有GFM依赖文本化/LLM中介或需要额外调参的限制。
GitHub
- [2026-05-27] sgl-project/sglang ⭐28304 🆕NEW
- [2026-05-26] NVIDIA/TensorRT-LLM ⭐13735
- [2026-05-26] bitsandbytes-foundation/bitsandbytes ⭐8229 🆕NEW
- [2026-05-26] Azure-Samples/azure-search-openai-demo ⭐7667 🆕NEW
- [2026-05-26] runpod-workers/worker-vllm ⭐446 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-05-01] angrygiraffe/claude-opus-4.6-4.7-reasoning-8.7k 🆕NEW
Background
Ended up with some tokens to burn on a Claude Max plan. Assembly began during 4.6 and moved to 4.7. Model is tagged. The develop...
多模态大模型
arXiv
- RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
- 赛道归属: 多模态理解(事件相机+视觉语言模型/鲁棒场景理解)
- 核心创新点: 提出首个事件流-图像双流VLM,将事件相机的高时间分辨率与高动态范围信息作为与RGB互补的输入,通过跨模态对齐与融合机制把事件的运动/边缘变化线索注入语言推理,从而显著提升低照度、HDR、快速运动等恶劣条件下的场景理解与描述鲁棒性。
- GeoWorld-VLM: Geometry from World Models for Vision-Language Models
- 赛道归属: 多模态理解(3D/几何空间关系推理增强、VLM蒸馏)
- 核心创新点: 提出一种“从世界模型蒸馏几何能力到VLM视觉端”的框架,针对VLM在视觉特征提取阶段丢失3D结构线索导致的空间关系脆弱性,在语言推理开始前就补齐可用于空间判断的几何表征;通过VLM侧蒸馏将世界模型中隐含的几何/结构知识注入视觉编码器,使下游语言模型接收到更保真的空间结构特征,从而提升left/right、behind、between等基础空间关系的鲁棒性与可泛化性。
- A Cross-Modal Prompt Injection Attack against Large Vision-Language Models with Image-Only Perturbation
- 赛道归属: 多模态安全(LVLM 对抗攻击 / Prompt Injection)
- 核心创新点: 提出一种“跨模态”提示注入攻击范式:仅对图像输入施加微小扰动,即可在不改动文本提示的情况下,把攻击指令注入并迁移到模型对另一模态(文本/指令)的解释与执行中,从而突破以往“单模态注入只影响该模态”或“多模态但无法实现跨模态扰动”的限制;方法层面强调通过优化图像扰动来实现对模型跨模态对齐/融合表征的定向操控,使模型在后续语言生成阶段遵循攻击者意图。
- VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events
- 赛道归属: 多模态理解(自动驾驶视频理解/安全关键事件检测、VLM后训练)
- 核心创新点: 提出面向安全关键驾驶事件的模块化后训练框架,专门解决通用VLM在驾驶领域的“领域不对齐”和“时间不对齐”(短暂、稀有事件难捕捉)问题;通过可插拔的适配流程在不从头训练的前提下对预训练VLM进行领域与时序能力增强,使其更擅长识别碰撞/近碰等瞬时高风险事件,并提升在真实行车长视频中的可靠性与可部署性。
- Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models
- 赛道归属: 多模态理解(人类注视/社会注视预测评测基准)
- 核心创新点: 构建并系统评测VLM在“注视跟随”与“社会注视预测”上的能力边界,强调该任务需要同时理解几何/物理场景与交互语境;通过基准化任务设定与指标,揭示现有VLM在注视相关推理中的可靠性缺口与典型失败模式,为后续面向注意力与行为理解的训练/对齐提供可复现的评测框架。
- Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment
- 赛道归属: 多模态安全与隐私(VLM成员推断攻击、黑盒攻击)
- 核心创新点: 提出单样本、黑盒条件下的VLM成员推断攻击方法,绕开现有方法对内部logits/梯度等灰盒信息的依赖;核心利用“跨模态语义对齐”信号构造可查询的攻击统计量,在仅能访问模型输出的现实API场景中判断某图文样本是否被训练集记忆,从而更贴近真实威胁模型并揭示VLM训练数据泄露风险。
- Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models 🆕NEW
- 赛道归属: 多模态鲁棒性 / 对抗防御
- 核心创新点: 提出“闭环双向提示”的鲁棒适配框架,将对抗鲁棒性建模为跨模态一致性的闭环优化:在视觉→文本与文本→视觉两个方向上进行互补约束与迭代校正,而非传统单向或静态防御;通过实例级自适应的双向提示更新/选择机制,在对抗扰动下动态强化跨模态语义对齐,从而提升VLM在不同样本与攻击强度下的稳健性。
- Rethinking VLM Representation for VLA Initialization 🆕NEW
- 赛道归属: 具身智能 / 视觉-语言-动作模型初始化与表征设计
- 核心创新点: 将“用VLM初始化VLA策略”重新表述为可控的表征设计问题,并沿三条关键轴系统拆解:具身VQA级别的能力监督、参数更新策略(哪些层/模块更新)、以及机器人数据预训练;通过对比实验揭示并量化“原始预训练VLM表征”在VLA初始化中的关键作用,给出更可复现的初始化选择与训练配方,明确哪些监督与更新方式真正带来可迁移的动作策略收益。
- CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning 🆕NEW
- 赛道归属: 多域持续学习 / 任务增量学习+ 参数高效提示学习
- 核心创新点: 提出CMAP,面向“多域任务增量且推理时无任务ID”的设定,突破以往仅用视觉特征做路由/置信度/适配的范式:显式引入并利用CLIP的文本嵌入空间进行跨模态任务判别与自适应提示调度;通过跨模态信号联合驱动任务路由与编码器轻量适配,在冻结VLM骨干的前提下缓解遗忘并提升跨域泛化,尤其适用于视觉域差异大、任务身份不可用的场景。
- MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models 🆕NEW
- 赛道归属: 多模态模型参数高效微调 / 跨模态耦合模块设计
- 核心创新点: 提出MAIL++,作为可插拔的双向“代理层”在视觉与语言分支间建立更强的内生耦合:在不依赖外部辅助网络/额外监督的前提下,通过双向信息交互机制增强跨模态对齐与特征融合;相较传统prompt/adapter的单分支或弱耦合设计,MAIL++以轻量参数实现更有效的下游适配,兼顾低数据场景的泛化与避免全量微调的计算/过拟合问题。
GitHub
- [2026-05-26] Blaizzy/mlx-vlm ⭐4779 🆕NEW
- [2026-05-26] liudaizong/Awesome-LVLM-Attack ⭐547 🆕NEW
- [2026-05-26] Roots-Automation/GutenOCR ⭐188
- [2026-05-26] ydyhello/Awesome-VLM-Streaming-Video ⭐162 🆕NEW
- [2026-05-26] opendatalab/mineru-vl-utils ⭐124
HuggingFace Models
强化学习
arXiv
- ARC-RL: A Reinforcement Learning Playground Inspired by ARC Raiders
- 赛道归属: 强化学习基准与仿真环境(MuJoCo连续控制/游戏风格NPC运动控制)
- 核心创新点: 提出ARC-RL作为面向“游戏NPC风格约束”的连续控制基准套件:在MuJoCo中构建4个受游戏生物图鉴启发的非真实机器人形态环境,刻意脱离传统仿真到真实常见的商业硬件形态假设,从而把研究焦点从“真实可落地的腿式机器人”扩展到“无现实对应形态但有强风格/表现约束的角色运动”。其方法论价值在于用系统化的形态多样性与任务设定,推动奖励设计、控制策略与泛化能力在“非工程硬件先验”下的评测与对比。
- LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning
- 赛道归属: LLM后训练对齐 / 连续潜空间强化学习 / 推理增强
- 核心创新点: 将RL的优化空间从离散token序列迁移到连续潜变量中的“推理轨迹”层面,用潜空间策略探索更语义化、全局性的决策,从而缓解token级优化导致的推理结构错配;引入基于潜扩散推理的训练机制以稳定探索分布,重点解决连续潜空间RL中常见的熵塌缩问题,使策略在高层推理表征上保持多样性与可探索性。
- Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness
- 赛道归属: 鲁棒强化学习 / 非可实现环境下的安全RL(对抗/策略依赖环境建模)
- 核心创新点: 提出并实证验证“Infra-Bayesian(下层贝叶斯)”RL智能体,用一种比经典贝叶斯/频率派RL更保守的信念更新与决策准则来应对模型失配与环境对策略的反应(policy-dependent / 预判型对手)。方法上关键在于:不再假设存在真实环境落在模型类中,而是以更弱的可实现性前提构造可学习的决策规则,使策略在最坏情形下具有更强鲁棒性,从而在涉及人类/预测器/其他智能体的安全场景中优于经典RL的脆弱性表现。
- ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison
- 赛道归属: 多模态理解(图像长文本描述对齐 / 细粒度奖励建模的强化学习)
- 核心创新点: 提出以“视觉主张”为单位的细粒度强化学习框架:不再用整段caption的单一标量奖励,而是将描述拆解为可对齐到图像证据的原子主张,并通过“主张级视觉对比/验证”来产生更密集、更可归因的训练信号;从而显式区分并优化“事实性(减少幻觉)”与“信息覆盖(不遗漏细节)”之间的权衡,缓解长文本caption中序列级奖励过度压缩导致的信用分配与训练不稳定问题。
- FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
- 赛道归属: 推理对齐(大模型RLHF/RLVR训练算法优化:在线采样-更新闭环)
- 核心创新点: 提出“反馈驱动的双目标协同强化学习”训练范式:针对GRPO类方法中“采样阶段产生的高质量rollout决定了更新方向但梯度目标并不显式”的痛点,引入由反馈信号驱动的双目标优化机制,将(1)提升rollout质量/可用性与(2)稳定有效的策略更新方向联合建模,并通过协同约束/耦合更新减少采样噪声与梯度方向漂移;本质上是在rollout生成与参数更新之间建立更强的闭环,使训练更稳、更高效地对齐推理能力。
- CayleyPy RL: Pathfinding and Reinforcement Learning on Cayley Graphs
- 赛道归属: 超大规模图路径规划 / 图强化学习 / 群论结构图搜索
- 核心创新点: 面向极大规模(可达$10^{70}$节点)Cayley图的路径规划,将强化学习与更直接的扩散距离方法进行组合:用扩散距离提供结构化的几何/谱信息以引导搜索,用RL学习在该结构先验下的策略,从而在传统RL难以覆盖的巨大状态空间中提升可达性与样本效率;并以开源CayleyPy作为可复现实验与基准平台,系统评测该混合范式在数学结构图上的性能。
- GeoSVG-RL: Geometry-Aware Reinforcement Learning for Layout-Constrained Text-to-SVG Diagram Generation 🆕NEW
- 赛道归属: 文生矢量图 / 结构化图表生成 / 强化学习约束生成
- 核心创新点: 提出几何感知的强化学习框架,将SVG图表生成中的“可用性”问题显式建模为布局与几何约束优化:通过对连接线端点对齐、文本与边界/元素的非重叠、画布边界约束等几何规则进行可微或可评估的约束度量,构造面向结构有效性的奖励信号;在生成过程中用RL对策略进行优化以减少结构脆弱错误(如漂移、错连、越界),从而提升可编辑、可落地的专业级SVG图表输出稳定性。
- GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero
- 赛道归属: 大语言模型后训练、开放式环境泛化强化学习
- 核心创新点: 提出GRLO,面向“从零开始”的开放式环境RL后训练,目标是在无特定领域人类偏好数据的前提下获得可迁移、可泛化的策略更新范式;方法上强调在开放式任务分布中构建更通用的奖励/验证驱动训练流程,以缓解RLHF对目标域偏好信号的依赖,并提升跨环境的泛化能力。
- Reinforcement Learning for LLM Post-Training: A Survey
- 赛道归属: LLM后训练综述 / RLHF与RLVR方法体系化梳理 / 对齐与推理能力提升
- 核心创新点: 对LLM后训练中的RL范式进行系统化归纳与对比:覆盖偏好优化(如DPO等)与可验证奖励驱动的在线RL(如PPO、GRPO等)两大路线,梳理其目标函数、训练流程、数据与奖励来源、稳定性与可扩展性差异;总结在安全对齐、数学/代码推理等任务上的适用边界与常见失败模式,并提炼未来研究方向(如奖励建模、验证器设计、在线探索与离线偏好学习的融合等)。
- Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习理论 / 连续控制策略优化 / 最优传输几何与熵正则RL
- 核心创新点: 针对熵正则强化学习目标,系统分析Wasserstein Policy Gradient的全局收敛性:将每个状态条件策略的更新刻画为沿soft Q函数动作梯度的最优传输流,并叠加Langevin型扩散以对应熵正则项;在此几何-随机动力系统视角下,建立可证明的全局收敛结论(相较以往主要依赖标准Langevin分析但难以直接适配WPG的情形),从理论上澄清WPG在连续动作分布优化中的稳定性与收敛机制。
GitHub
- [2026-05-26] PufferAI/PufferLib ⭐5769
- [2026-05-26] rllm-org/rllm ⭐5567 🆕NEW
- [2026-05-27] pytorch/rl ⭐3446
- [2026-05-26] natolambert/rlhf-book ⭐1921
- [2026-05-26] radixark/miles ⭐1430
HuggingFace Datasets
- [2026-05-13] TuringEnterprises/Open-MM-RL
Dataset Summary
Open-MM-RL is a multimodal STEM reasoning dataset covering Physics, Mathematics, Biology, and Chemistry. It is designed for...
- [2026-05-24] zhifeixie/Voices-in-the-Wild-2M
Voices in the Wild
Project Page | Paper | GitHub Voices in the Wild (Voices-in-the-Wild-2M) is a large-scale automatic speech recognition (...
- [2026-05-22] PsiBotAI/SynData
SynData
中文说明
Demo
If the video cannot be displayed in your environment, open it directly: assets/syndata-demo.mp4
...
- [2026-05-14] AlienKevin/SWE-ZERO-12M-trajectories
SWE-ZERO 12M Trajectories
The largest agentic-coding trace dataset to date: 112 B tokens of execution-free agentic trajectories covering 12...
世界动作模型
arXiv
- WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
- 赛道归属: 视觉-语言导航 / 世界动作模型 / 自回归策略建模
- 核心创新点: 提出面向航拍VLN的首个自回归世界动作模型,将任务从“直接学策略”重构为“预测驱动的世界-动作联合建模”:在闭环导航中显式预测潜在世界状态的演化及动作后果,并以自回归方式逐步生成后续决策,从而避免依赖全序列视频生成式世界模型的高成本与冗余建模,强化对长时序指令跟随与环境动态的可控推演能力。
- OASIS: Observation-Action Space Alignment via SE(3) Trajectory Prediction for Robotic Manipulation 🆕NEW
- 赛道归属: 机器人操作、动作空间建模与对齐、SE(3)轨迹预测
- 核心创新点: 提出OASIS,通过在中间表征中显式引入并对齐动作空间的刚体几何结构,缓解以往WAM/VLA主要停留在观测空间表征、导致动作解码器需“隐式恢复”SE(3)几何的问题;核心做法是将中间表示与SE(3)轨迹预测绑定,使策略在表示层面具备与动作同构的刚体运动先验,从而实现观测-动作空间对齐,降低动作解码难度并提升机器人操作的可学习性与泛化。
GitHub
- [2026-05-24] OpenMOSS/Awesome-WAM ⭐563
由 Research Daily 自动生成 生成时间: 2026-05-27 01:02:04