AI 每日进展速报 - 2026-05-20
图像生成/编辑
arXiv
- Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards
- 赛道归属: 文生图(偏好对齐/后训练强化学习)
- 核心创新点: 提出 SOLACE 后训练框架,用“模型内生自信度”替代外部奖励模型/人工偏好监督:将模型自身生成结果重新加噪,并以其对注入噪声的恢复准确性作为自信度奖励信号,从而在不依赖额外标注或奖励网络的情况下进行偏好对齐式优化,提升生成的可靠性与审美一致性。
- MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation 🆕NEW
- 赛道归属: 文生图(区域级可控生成 / 组合式生成)
- 核心创新点: 在SDXL的U-Net扩散框架中引入“Mask Attention”式的区域级注意力控制机制,用显式区域/掩码约束将文本条件与空间区域绑定,从而提升多目标场景下的全局协调与属性不串扰(减少对象间属性混淆),在保持U-Net高效性的同时增强跨区域的可控组合生成能力。
- Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图(强化学习对齐 / 训练策略与采样优化)
- 核心创新点: 面向基于GRPO的T2I强化学习训练,提出“课程式组策略优化”自适应采样:根据模型当前能力动态调整样本难度分布,避免统一采样带来的难度失配与低效更新,从而以更高样本效率释放RL在文生图对齐/偏好优化中的收益。
- Skill-Aligned Annotation for Reliable Evaluation in Text-to-Image Generation
- 赛道归属: 文生图评测 / 人类标注与评估协议设计
- 核心创新点: 提出“技能对齐标注”评测范式:不再用统一的Likert/BQA覆盖所有评测维度,而是先将T2I评测拆解为异质“技能”(如语义一致性、属性绑定、空间关系、文本可读性、审美/真实感等),再为不同技能匹配更合适的标注接口、问题形式与聚合方式,从而降低标注噪声与维度混淆;强调在模型差距缩小时,通过对齐技能本质来提升评测的可靠性、可复现性与区分度。
- EPIC: Efficient Predicate-Guided Inference-Time Control for Compositional Text-to-Image Generation
- 赛道归属: 文生图(推理时可控生成/组合式生成)
- 核心创新点: 提出 EPIC 的训练无关推理时控制:将复杂提示词一次性解析为包含对象变量与类型化谓词(数量、属性、关系等)的“视觉程序”,并把生成改写为谓词引导的搜索/精炼过程,在不改动模型参数的前提下,通过对违反谓词的部分进行定向修正来提升组合一致性与可控性,同时强调推理效率。
- CogBlender: Towards Continuous Cognitive Intervention in Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图(审美/心理属性可控生成 / 连续属性编辑)
- 核心创新点: 将“认知属性”(如情绪效价、可记忆性等)作为可控维度引入T2I生成,提出支持连续干预的CogBlender:在不只对齐语义的前提下,提供可连续调节的控制接口/机制,使生成结果能按用户心理意图在认知指标上平滑可控,而非仅靠离散风格词或后验筛选。
- Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation 🆕NEW
- 赛道归属: 多模态统一建模(视觉理解 + 文生图的对比-生成统一训练)
- 核心创新点: 提出DREAM统一框架,将图文对比学习与掩码生成式建模端到端融合;关键在于“Masking Warmup”掩码课程调度,逐步移动掩码比例分布中心,使低掩码(利于对比对齐)与高掩码(利于生成建模)在同一训练过程中兼容,从而缓解两类目标对“可见token比例”相互冲突的问题。
- SPOT: Selective Prompt Projection via Total Variation for Inference-Only Safe Text-to-Image Generation
- 赛道归属: 文生图安全对齐 / 推理期安全控制
- 核心创新点: 提出SPOT:在冻结扩散生成器的前提下,仅在推理期对文本提示进行“选择性投影”以抑制不安全生成,同时尽量保持对良性提示的行为不变;用总变差距离将“相对原始提示条件分布的偏移”与“风险期望变化”建立可控上界关系,把安全约束转化为对提示投影强度/选择策略的可优化目标,实现无需再训练的安全-保真折中控制。
- Generation Navigator: A State-Aware Agentic Framework for Image Generation 🆕NEW
- 赛道归属: 文生图(智能体生成 / 闭环生成控制与自动提示优化)
- 核心创新点: 将图像生成重构为“状态条件动作决策”问题,提出Generation Navigator多轮智能体框架:不再依赖手工规则或单次prompt改写,而是基于生成过程的状态反馈学习选择下一步动作(如改写提示、调整条件/参数等),实现对生成轨迹的自适应闭环导航,减少人工试错成本并提升意图达成率。
- RSEdit: Text-Guided Image Editing for Remote Sensing 🆕NEW
- 赛道归属: 图像编辑(遥感领域 / 文本指令编辑)
- 核心创新点: 面向遥感图像提出RSEdit体系化方案:从U-Net到DiT构建一组可复现的文本引导编辑模型,并首次对“由现成文生图模型改造为编辑模型”的条件注入/conditioning策略进行全面对比研究;在提升指令遵循度的同时强调地理空间结构保持(道路/地物布局等),解决遥感编辑中“改得对且不破坏地理一致性”的关键矛盾。
GitHub
- [2026-05-20] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐12110
- [2026-05-19] Light-Heart-Labs/DreamServer ⭐1533
- [2026-05-19] vibheksoni/free-ai ⭐470
- [2026-05-19] jegly/Box ⭐448
- [2026-05-20] Azornes/Comfyui-Resolution-Master ⭐263
HuggingFace Models
视频生成/编辑
arXiv
- MAVEN A Multi-Agent Framework for Multicultural Text-to-Video Generation 🆕NEW
- 赛道归属: 视频生成(文生视频 / 多智能体提示工程)
- 核心创新点: 提出多智能体提示精炼框架 MAVEN,面向“多文化/跨文化”文生视频的文化保真度问题,将文本提示分解为人物、动作、地点等可控维度,并由专门代理并行/串行协作改写与补全文化关键信息;通过结构化分解降低单一提示对文化细节的丢失与歧义,提升同文化与跨文化场景下生成内容的文化一致性与可评测性。
- LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation 🆕NEW
- 赛道归属: 推理优化/训练系统(长视频生成基础设施,AR+扩散/视频模型并行)
- 核心创新点: 提出 LongLive-2.0 的 NVFP4 并行训练与推理基础设施,针对长视频生成的显存与吞吐瓶颈做端到端系统级共设计;核心是序列并行的自回归训练方案 Balanced SP,通过将“干净历史”与“噪声目标”时间块在各 rank 上配对,形成天然 teacher-forcing mask,并与 SP 执行及分块 VAE 编码/解码协同,提升长序列训练/推理的速度与内存效率。
- Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory 🆕NEW
- 赛道归属: 视频生成(长叙事一致性 / 训练免改的记忆机制)
- 核心创新点: 提出训练免改的身份感知记忆机制,用于自回归长视频叙事生成中的长期一致性与“记忆退化”问题;针对提示随时间演化、实体指代变化导致的身份漂移/角色重复/属性丢失,方法引入显式的 identity-aware 记忆读写与检索策略(相较仅压缩历史或用粗粒度注意力选关键帧),在不重新训练模型的前提下更稳健地维持角色身份与属性连续性。
- NEWTON: Agentic Planning for Physically Grounded Video Generation 🆕NEW
- 赛道归属: 视频生成(物理一致性/可控生成,智能体规划)
- 核心创新点: 提出 NEWTON 的 agentic planning 框架,针对视频生成普遍违反物理常识的根因“规格瓶颈”——文本提示无法充分描述决定动力学的关键物理参数;方法通过规划式的条件构造/补全,将物理条件从“缺失”变为“充分、可控、可组合”的显式约束(而非单纯扩模型规模),以提升物理落地的视频生成可靠性与可评测性。
- GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation 🆕NEW
- 赛道归属: 视频生成(几何一致性/相机运动鲁棒性,奖励约束)
- 核心创新点: 提出 GeoFlow,通过“几何一致性奖励”显式约束生成视频的隐式几何一致性,缓解相机运动下的物体形变、纹理漂移与背景非刚性等问题;区别于把一致性当副产物、仅适用于静态场景或需要重对齐整个潜空间的方案,GeoFlow直接度量并优化视频运动是否满足几何一致的条件,从而以更轻量的方式提升跨帧结构稳定性。
- Temporal Aware Pruning for Efficient Diffusion-based Video Generation 🆕NEW
- 赛道归属: 推理优化(扩散式视频生成加速,时序感知剪枝)
- 核心创新点: 提出 Temporal Aware Pruning,将 token pruning 从“逐帧、仅基于注意力”的静态策略扩展为面向视频生成的时序一致性剪枝:在长时空序列注意力计算中,剪枝决策显式考虑跨帧依赖与时间连贯性,避免简单按帧裁剪导致的时序抖动与一致性破坏,从而在降低计算量的同时尽量保持视频质量与连贯性。
- Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation 🆕NEW
- 赛道归属: 多模态生成(音视频联合生成 / 身份定制)
- 核心创新点: 提出 Omni-Customizer 端到端多模态定制框架,解决多主体交互场景下“视觉身份(人脸/外观)”与“声音音色”的同时绑定与一致保持;核心在于将多模态身份信息进行精确绑定与融合,支持在联合音视频生成中对多个角色的视觉与声纹进行一致、可控的个性化定制,而非分别微调或松散对齐。
- Evaluating Design Video Generation: Metrics for Compositional Fidelity
- 赛道归属: 视频生成评测 / 视频生成指标
- 核心创新点: 提出面向“设计类动画视频生成”的全自动评测框架,针对该领域区别于自然视频的强结构约束(组件级运动类型/方向/速度/时序可控、非运动区域稳定、整体版式与布局保持)进行指标体系化拆解;将评测组织为多维度(以布局/结构一致性与组件级运动符合性为核心)并实现自动化计算,从而能定量衡量生成视频的“组合保真度”,弥补现有通用视频生成指标难以覆盖版式保持与局部受控运动的缺口。
- Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation 🆕NEW
- 赛道归属: 视频生成(交互式自回归生成 / 控制与稳定性权衡)
- 核心创新点: 提出 Delta Forcing,用“信赖域引导”的方式对交互式自回归视频生成进行可控转向:在事件条件动态变化时,通过限制每步更新/偏移在可控的“delta”范围内,实现对新事件的快速响应同时抑制长期漂移,缓解现有流式微调/蒸馏式 AR 适配在稳定性与一致性上的折中问题。
- Pyramid Forcing: Head-Aware Pyramid KV Cache Policy for High-Quality Long Video Generation
- 赛道归属: 长视频生成(自回归视频生成 / KV Cache与注意力记忆策略优化)
- 核心创新点: 该工作针对自回归长视频生成中“误差累积导致长期退化”的关键瓶颈,提出Head-Aware 的金字塔式 KV Cache 保留策略:不再对所有注意力头采用统一的历史帧保留,而是基于对“历史帧注意力模式”的实证分析,将注意力头划分为Anchor(需要广域长程上下文)、Wave(周期性时序依赖)等不同类型,并据此为不同头分配差异化的历史信息保留/压缩方案(呈金字塔式的时间尺度覆盖)。核心突破在于把“长程记忆管理”从全局统一策略提升为按头建模的结构化策略,在不牺牲流式生成特性的前提下,更有效抑制长视频的质量漂移与语义/运动一致性退化。
GitHub
- [2026-05-19] Anil-matcha/Open-Generative-AI ⭐16058
- [2026-05-19] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1131
- [2026-05-19] AceDataCloud/Nexior ⭐371
- [2026-05-19] Winn1y/Awesome-Human-Motion-Video-Generation ⭐327
- [2026-05-19] Anil-matcha/Awesome-Gemini-Omni-API-Prompts ⭐292 🆕NEW
HuggingFace Models
音频生成
arXiv
- TED-TTS: Training-Free Intra-Utterance Emotion and Duration Control for Text-to-Speech Synthesis 🆕NEW
- 赛道归属: 文本转语音 / 可控语音合成(零样本、细粒度韵律与情感控制)
- 核心创新点: 提出一种“免训练”的可控框架,直接作用于预训练零样本TTS,实现句内级别的情感与时长控制;通过分段感知的情感条件注入将情感控制从整句提升到片段级,避免依赖私有情感数据或多阶段再训练;同时将时长/节奏控制与情感表达解耦到可操作的句内控制接口,使同一句话内部可实现不同情绪与语速/停连的组合表达。
- SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis 🆕NEW
- 赛道归属: 文本转语音 / 连续表示自回归语音生成
- 核心创新点: 针对连续自回归TTS中“语义-韵律建模”与“重建驱动的连续声学表示”之间的根本错配,提出语义感知的连续自回归合成框架;核心在于强化高层语义一致性与可控韵律的建模优先级,抑制模型过度追逐低层纹理细节导致的自回归误差累积;通过在生成过程中显式引入语义约束/对齐机制,使连续表示既能保持高保真重建,又能提升长程语义连贯与表达稳定性。
- AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech 🆕NEW
- 赛道归属: 文本转语音 / 指令可控语音合成(复合指令、Agent框架、闭环控制)
- 核心创新点: 提出多智能体闭环框架,将“离散文本意图”到“连续声学实现”的结构性鸿沟拆解为可协作的子任务;通过对抗式解耦智能体降低说话人特征、内容与风格控制之间的纠缠,提升复合指令(如情绪+语速+强调+停顿等)的可组合性与可控性;引入闭环评估/反馈机制(由智能体对生成语音的意图一致性进行判别并迭代修正),实现更“意图忠实”的表达控制,而非一次性前向生成。
- WavFlow: Audio Generation in Waveform Space 🆕NEW
- 赛道归属: 音频生成 / 波形域生成(非潜空间压缩、扩散/流模型方向)
- 核心创新点: 反其道而行之,提出直接在原始波形空间生成高保真音频的框架,避免潜空间压缩带来的信息损失与系统复杂度;通过waveform patchify将一维波形重排为二维token网格,降低超高维序列建模难度并提升并行建模效率;提出amplitude lifting等信号能量重标定策略,缓解波形“低能量/高动态范围”导致的训练与生成不稳定,使流式/生成模型能在波形域实现可用的密度建模与高质量合成。
- Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation
- 赛道归属: 音频生成(音乐生成)/ 音频Tokenizer与表示学习
- 核心创新点: 提出面向生成的2D Mel谱Tokenizer,将音乐建模为“时-频图像”,用单一共享码本在每个时间帧上按Mel频带产生2D token网格,避免残差多码本量化在序列展平后引入的强层级依赖与误差累积;该设计更贴合自回归语言建模的依赖结构,在保持可重建性的同时提升生成建模的可学习性与稳定性。
- Adapting a Text-to-Audio Model for Room Impulse Response Generation
- 赛道归属: 音频生成 / 声学建模(RIR 房间脉冲响应生成)
- 核心创新点: 将预训练的文生音频大模型作为“生成先验”迁移到RIR这一强物理约束、数据稀缺的声学对象上,通过适配策略把通用音频生成能力对齐到RIR的时域结构与混响特征分布,实现无需从零训练即可生成高质量RIR;关键突破在于证明大规模生成式音频先验可有效覆盖并可控地生成RIR这类非语音/非音乐的声学响应信号,从而缓解真实RIR采集成本高与训练数据不足的问题。
- TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling
- 赛道归属: 音频-文本数据集构建 / 音频语言模型指令微调
- 核心创新点: 提出面向区域方言与韵律(台湾语境)的高质量音频-文本指令数据集构建范式:通过 Verify-Generate-Critique流程先“验证再扩增”,用双ASR交叉校验对52.2万原始音频进行一致性过滤以提升转写可靠性,再借助教师模型生成并批判式筛选,扩展为58万高保真指令对;该“验证引导的数据策展”显著降低方言场景的噪声标注与语音-文本错配,为后续Tai-LALM等区域化音频语言建模提供可复用的数据生产管线。
- The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models
- 赛道归属: 多模态理解(音频-语言)/ 空间音频理解
- 核心创新点: 将“空间音频-语言理解”从零散问题提升为统一的任务接口,提出音频场景分析的三层级形式化:从原子级感知(事件与方位/距离等空间属性)到对象级绑定(语义与空间属性的归属一致性、多对象分离与排列),再到场景级物理一致性判断(答案是否符合空间声学常识)。核心突破在于把“听到什么”扩展为“在哪里、谁对应谁、整体是否合理”的可评测框架,为大音频语言模型引入可系统训练/评估的空间推理目标。
- PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation 🆕NEW
- 赛道归属: 文本到音频视频生成 / 基准评测(物理一致性与音频物理可解释性)
- 核心创新点: 提出首个系统评估“音频-物理规律敏感性”的T2AV基准,弥补现有评测过度关注音画同步、忽视物理可置信声音生成的问题;通过构造对物理因素敏感的任务与标注(如材料、碰撞方式、距离/遮挡、能量与衰减等),将评测从“对齐”提升到“物理落地”;提供可量化指标与挑战集,推动模型在世界建模场景中学习/验证声音与物理因果的一致性,而不仅是生成听起来合理的纹理。
- Aliasing-Free Neural Audio Synthesis
- 赛道归属: 神经音频合成 / 声码器与神经编解码器(抗混叠高保真生成)
- 核心创新点: 针对神经声码器/编解码器在音乐与歌声高频段常见的混叠失真,系统性指出其主要来源于非线性激活与上采样结构引入的频谱折叠,并提出“从架构层面消除混叠”的神经合成方案:通过在非线性与上采样路径中引入可控带宽/抗混叠约束(而非仅靠后处理滤波),在生成过程中抑制不可逆的折叠伪影,从而提升高频细节、瞬态与谐波结构的保真度,面向高保真音乐/歌声合成更稳健。
GitHub
- [2026-05-19] huggingface/diffusers ⭐33669
- [2026-05-17] AudioKit/AudioKit ⭐11355
- [2026-05-19] Stability-AI/stable-audio-tools ⭐3703
- [2026-05-19] SamurAIGPT/Generative-Media-Skills ⭐3296
- [2026-05-19] apocas/restai ⭐506
HuggingFace Models
HuggingFace Spaces
语言大模型
arXiv
- ACIL: Auto Chain of Thoughts for In-Context Learning 🆕NEW
- 赛道归属: 提示学习与推理增强(In-Context Learning / Chain-of-Thought 自动化)
- 核心创新点: 提出一种面向ICL的“自动链式思维”构造机制:不再只提供输入-输出示例,而是自动为示例补全/生成可复用的多步推理轨迹,并将其组织成更适配目标任务的演示模板,从而在不更新参数的前提下显式注入推理过程,提升ICL在多步推理任务上的稳定性与泛化能力。
- Can Large Language Models Imitate Human Speech for Clinical Assessment? LLM-Driven Data Augmentation for Cognitive Score Prediction
- 赛道归属: 医疗语音理解与临床评估(LLM数据增强/认知评分预测)
- 核心创新点: 利用“同一临床提示下的书面回答”作为语义锚点,构建LLM驱动的数据增强框架,将文本层面的语义约束注入到自发口语叙事的生成/改写中,以缓解小样本与类别不均衡问题;通过语义锚定的增强样本提升从语音/转写到认知量表分数的回归/预测鲁棒性与泛化能力。
- Large Language Models for Sequential Decision-Making: Improving In-Context Learning via Supervised Fine-Tuning
- 赛道归属: LLM+强化学习/序列决策(离线RL、MDP/POMDP上的In-Context Learning与微调)
- 核心创新点: 通过对“离线、oracle标注的轨迹”进行监督微调,把LLM的少样本ICL能力显式迁移到序列决策任务中,使模型能够在MDP、POMDP及更具不确定性的APOMDP设定下,直接从上下文轨迹中进行few-shot决策;方法上将“轨迹作为上下文提示”的ICL与“用高质量轨迹进行SFT”的训练范式结合,系统化提升LLM在长期依赖与部分可观测场景中的决策稳健性。
- Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective 🆕NEW
- 赛道归属: 大模型学习机制与归纳偏置分析(Fine-tuning vs In-Context Learning,对比评测方法学)
- 核心创新点: 从形式语言学习视角构建可控、边界精确的任务体系,用严格定义的语言类别与可控字符串分布来统一对比FT与ICL:通过消除以往实验设置不一致带来的混淆,系统刻画两种学习模式在样本效率、泛化边界与归纳偏置上的差异,为“FT与ICL到底学到什么、偏好什么结构”提供可复现实证框架。
- Early Stopping Chain-of-thoughts in Large Language Models 🆕NEW
- 赛道归属: 推理优化与高效推断(Chain-of-Thought 早停/自适应计算)
- 核心创新点: 提出ES-CoT推断时方法:在黑盒条件下通过检测“答案收敛”信号来提前终止CoT生成,避免冗长推理带来的高token成本;相较依赖白盒监控或不稳定提示技巧的方法,该方案强调推断阶段可插拔、无需改模型参数,并以收敛判据实现更可靠的自适应推理长度控制。
- GVGAI-LLM: Evaluating Large Language Model Agents with Infinite Games 🆕NEW
- 赛道归属: LLM智能体评测与基准(游戏环境推理/规划/交互)
- 核心创新点: 构建GVGAI-LLM无限游戏评测基准:基于GVGAI框架与游戏描述语言(规则+关卡可快速生成),提供多样街机式任务以测试LLM在非传统NLP分布下的推理、规划与问题求解;通过可程序化生成新游戏来降低基准过拟合风险,并支持持续扩展的“无限”评测设置。
- Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models 🆕NEW
- 赛道归属: 多模态大模型训练与OCR增强(多语言文本理解/视觉文本推理)
- 核心创新点: 提出面向真实场景视觉文本的多语言OCR增强训练框架:结合(1)大规模合成“OCR→翻译/理解”数据生成以覆盖复杂版式与噪声,(2)基于LoRA的OCR-aware监督微调以低成本注入视觉文本能力,(3)结构化的视觉提示与提示引导CoT推理以提升跨语言读图与文本推理的可控性与鲁棒性,系统性缓解MLLM在小字、遮挡、模糊与复杂字体上的失效。
- RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
- 赛道归属: 对齐训练 / 偏好优化(DPO改进、逻辑一致性对齐)
- 核心创新点: 提出Hybrid-DPO的自动化偏好构建与优化框架,用“逻辑正确性信号 + 流畅性偏好信号”的混合偏好来替代单一偏好监督,针对DPO在知识密集生成中被“冗长/流畅偏置”误导的问题进行校正;通过引入基于NLI/逻辑判别器(如DeBERTa类模型)的可验证逻辑一致性评估,与LLM评审/人类偏好形成互补,从而在不牺牲可读性的前提下缩小“逻辑对齐缺口”,提升生成的可证正确性与事实/推理一致性。
- Many-Shot CoT-ICL: Making In-Context Learning Truly Learn
- 赛道归属: 提示学习 / In-Context Learning(长上下文Many-shot CoT推理)
- 核心创新点: 系统研究many-shot链式思维ICL在推理任务上的缩放规律,指出将非推理任务的many-shot经验法则直接迁移会失效;围绕“示例数量、示例组织方式、CoT展示形式与任务泛化”的相互作用给出新的可操作策略,使长上下文下的ICL不仅是“检索相似示例”,而更像在提示内进行可学习的推理程序归纳,从而在无需参数更新的情况下稳定提升推理性能并逼近微调效果。
- An Agentic AI Framework with Large Language Models and Chain-of-Thought for UAV-Assisted Logistics Scheduling with Mobile Edge Computing
- 赛道归属: LLM智能体 / 工业调度优化(UAV物流 + 边缘计算MEC的联合调度)
- 核心创新点: 构建面向UAV辅助云制造的Agentic AI框架,将LLM的Chain-of-Thought用于把“物理物流路径/取送决策”与“计算任务卸载/边缘执行/资源分配”耦合建模与分步求解;通过智能体式规划-执行流程,把复杂混合调度问题分解为可解释的决策链,并在动态环境约束(站点任务到达、UAV算力/电量、时延约束等)下实现联合优化,相比传统启发式/单域优化更易扩展到多约束、多目标的实际工业场景。
GitHub
- [2026-05-20] sgl-project/sglang ⭐28023
- [2026-05-20] NVIDIA/TensorRT-LLM ⭐13679
- [2026-05-20] stanford-crfm/helm ⭐2794
- [2026-05-19] UKGovernmentBEIS/inspect_ai ⭐2092
- [2026-05-19] nick7nlp/Awesome-LLM-On-Policy-Distillation ⭐62 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-05-01] angrygiraffe/claude-opus-4.6-4.7-reasoning-8.7k
Background
Ended up with some tokens to burn on a Claude Max plan. Assembly began during 4.6 and moved to 4.7. Model is tagged. The develop...
- [2026-05-13] alibaba-multimodal-industrial-ai/IndustryBench 🆕NEW
IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs
💻Github | 📝Paper IndustryBench is a multi-lingual benchmark for evaluati...
多模态大模型
arXiv
- GeoWorld-VLM: Geometry from World Models for Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解(3D/几何空间关系推理增强、VLM蒸馏)
- 核心创新点: 提出一种“从世界模型蒸馏几何能力到VLM视觉端”的框架,针对VLM在视觉特征提取阶段丢失3D结构线索导致的空间关系脆弱性,在语言推理开始前就补齐可用于空间判断的几何表征;通过VLM侧蒸馏将世界模型中隐含的几何/结构知识注入视觉编码器,使下游语言模型接收到更保真的空间结构特征,从而提升left/right、behind、between等基础空间关系的鲁棒性与可泛化性。
- A Cross-Modal Prompt Injection Attack against Large Vision-Language Models with Image-Only Perturbation
- 赛道归属: 多模态安全(LVLM 对抗攻击 / Prompt Injection)
- 核心创新点: 提出一种“跨模态”提示注入攻击范式:仅对图像输入施加微小扰动,即可在不改动文本提示的情况下,把攻击指令注入并迁移到模型对另一模态(文本/指令)的解释与执行中,从而突破以往“单模态注入只影响该模态”或“多模态但无法实现跨模态扰动”的限制;方法层面强调通过优化图像扰动来实现对模型跨模态对齐/融合表征的定向操控,使模型在后续语言生成阶段遵循攻击者意图。
- VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events 🆕NEW
- 赛道归属: 多模态理解(自动驾驶视频理解/安全关键事件检测、VLM后训练)
- 核心创新点: 提出面向安全关键驾驶事件的模块化后训练框架,专门解决通用VLM在驾驶领域的“领域不对齐”和“时间不对齐”(短暂、稀有事件难捕捉)问题;通过可插拔的适配流程在不从头训练的前提下对预训练VLM进行领域与时序能力增强,使其更擅长识别碰撞/近碰等瞬时高风险事件,并提升在真实行车长视频中的可靠性与可部署性。
- Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment 🆕NEW
- 赛道归属: 多模态安全与隐私(VLM成员推断攻击、黑盒攻击)
- 核心创新点: 提出单样本、黑盒条件下的VLM成员推断攻击方法,绕开现有方法对内部logits/梯度等灰盒信息的依赖;核心利用“跨模态语义对齐”信号构造可查询的攻击统计量,在仅能访问模型输出的现实API场景中判断某图文样本是否被训练集记忆,从而更贴近真实威胁模型并揭示VLM训练数据泄露风险。
- GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
- 赛道归属: 多模态模型推理优化 / 视觉Token剪枝与模型压缩
- 核心创新点: 将VLM视觉token剪枝从常见的连续梯度松弛视角,转向更贴合本质的离散组合优化建模;提出“组相对重要性”的剪枝框架,通过在组内/组间进行相对重要性比较来稳定地选择保留token,缓解连续近似在激进压缩下易陷入次优局部最小的问题,从而在显著降低视觉token计算开销的同时尽量保持多模态性能。
- PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models
- 赛道归属: 多模态安全与隐私 / 机器遗忘(VLM个性化部分遗忘评测)
- 核心创新点: 提出PPU-Bench,一个面向真实世界“个性化部分遗忘”的VLM基准:不依赖合成知识注入、也不做整类/整主体删除,而是覆盖更贴近用户请求的细粒度跨模态事实删除需求;同时强调fine-tuning-free的评测设定,用统一任务与数据规模(约24K多模态样本)系统衡量模型对敏感记忆的可控删除能力与残留风险。
- Seeing Together:Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models 🆕NEW
- 赛道归属: 多模态理解(多智能体/多机器人协同、第一视角视频时空推理)
- 核心创新点: 将多视角协同空间推理系统化为“多机器人同步第一视角视频”的联合推理问题,要求模型在空间、时间、可见性与协同决策层面进行融合推断;构建对应任务与数据基准,推动MLLM从单体具身理解走向多体协作场景,并强调跨机器人视角对齐、信息互补与协调推理的建模需求。
- AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents 🆕NEW
- 赛道归属: 多模态智能体(记忆增强强化学习、视觉技能记忆、无教师自进化)
- 核心创新点: 提出自进化的“视觉技能记忆”机制,替代以文本为主的记忆存储与依赖专有教师模型的总结/提炼流程;通过更视觉化、可落地到空间决策的记忆表征与更新策略,在无教师条件下让VLM智能体持续积累与复用视觉技能,减少几何/空间先验在语言压缩中的信息损失,并用更密集的视觉反馈支撑长时程任务学习。
- Test-Time Hinting for Black-Box Vision-Language Models 🆕NEW
- 赛道归属: 推理优化(VLM测试时增强、黑盒TTS/提示策略)
- 核心创新点: 提出面向黑盒VLM的测试时Hinting方法,在无需开源权重/内部访问、且避免昂贵多次采样的前提下,通过单次调用的“提示注入/引导”机制提升VLM在通用视觉理解任务上的表现;相较以往主要面向多模态数理推理、依赖开放模型或重复采样的TTS方案,该方法更贴近真实API使用形态并强调低成本可扩展的测试时性能增益。
- MAgSeg: Segmentation of Agricultural Landscapes in High-Resolution Satellite Imagery using Multimodal Large Language Models
- 赛道归属: 遥感视觉理解(高分卫星图像语义分割 / MLLM 分割)
- 核心创新点: 提出 MAgSeg:一种面向高分辨率农业景观的、decoder-free 的 MLLM 分割框架,针对两大痛点做方法突破——(1) 通过设计更高效的多模态表示/交互方式缓解长上下文瓶颈,使大幅面高分影像的分割不再强依赖超长 token 序列;(2) 通过面向遥感域特征的对齐策略缩小“通用 MLLM—卫星影像”域差,提升对地物纹理、尺度变化与碎片化地块的理解与分割鲁棒性,尤其适配标注稀缺场景。
GitHub
- [2026-05-19] Blaizzy/mlx-vlm ⭐4748
- [2026-05-17] waybarrios/vllm-mlx ⭐1210
- [2026-05-16] zli12321/Vision-Language-Models-Overview ⭐589
- [2026-05-18] mala-lab/Awesome-Anomaly-Detection-Foundation-Models ⭐189
- [2026-05-19] opendatalab/mineru-vl-utils ⭐121 🆕NEW
强化学习
arXiv
- MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning
- 赛道归属: 自动驾驶强化学习(多模态感知-控制融合、可解释决策)
- 核心创新点: 提出以“3D可供性”作为感知与控制之间的中间表征,用多模态Transformer从RGB等输入预测结构化、可解释的3D可供性,再由强化学习在该表征空间上进行策略学习;相较端到端直接回归动作,减少感知-控制脆弱接口带来的误差传播,同时提升在城市密集交互场景下的鲁棒性与可解释性。
- LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning 🆕NEW
- 赛道归属: LLM后训练对齐 / 连续潜空间强化学习 / 推理增强
- 核心创新点: 将RL的优化空间从离散token序列迁移到连续潜变量中的“推理轨迹”层面,用潜空间策略探索更语义化、全局性的决策,从而缓解token级优化导致的推理结构错配;引入基于潜扩散推理的训练机制以稳定探索分布,重点解决连续潜空间RL中常见的熵塌缩问题,使策略在高层推理表征上保持多样性与可探索性。
- CayleyPy RL: Pathfinding and Reinforcement Learning on Cayley Graphs 🆕NEW
- 赛道归属: 超大规模图路径规划 / 图强化学习 / 群论结构图搜索
- 核心创新点: 面向极大规模(可达$10^{70}$节点)Cayley图的路径规划,将强化学习与更直接的扩散距离方法进行组合:用扩散距离提供结构化的几何/谱信息以引导搜索,用RL学习在该结构先验下的策略,从而在传统RL难以覆盖的巨大状态空间中提升可达性与样本效率;并以开源CayleyPy作为可复现实验与基准平台,系统评测该混合范式在数学结构图上的性能。
- GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero
- 赛道归属: 大语言模型后训练、开放式环境泛化强化学习
- 核心创新点: 提出GRLO,面向“从零开始”的开放式环境RL后训练,目标是在无特定领域人类偏好数据的前提下获得可迁移、可泛化的策略更新范式;方法上强调在开放式任务分布中构建更通用的奖励/验证驱动训练流程,以缓解RLHF对目标域偏好信号的依赖,并提升跨环境的泛化能力。
- How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment
- 赛道归属: 大模型对齐与推理优化(RL后训练、KV Cache压缩/显存优化)
- 核心创新点: 提出“Shadow Mask Distillation”用于RL在线rollout阶段的KV cache压缩:通过蒸馏得到可学习的掩码/稀疏策略,在尽量不破坏对齐与长上下文推理质量的前提下,显著降低轨迹生成时KV缓存的显存占用,从而缓解长上下文RL后训练的“memory wall”,提升可扩展性与吞吐。
- A Unified Pair-GRPO Family: From Implicit to Explicit Preference Constraints for Stable and General RL Alignment
- 赛道归属: 大语言模型对齐 / 偏好强化学习优化
- 核心创新点: 提出一个以 Pair-GRPO 为核心的统一偏好优化理论框架,将主流成对偏好学习中“隐式约束”的做法系统化为一族方法,并给出两种紧耦合变体:Soft-Pair-GRPO(以软方式施加偏好约束)与 Hard-Pair-GRPO(以显式/硬约束形式刻画偏好约束)。该框架旨在从方法层面同时缓解 RLHF 中常见的策略更新不稳定、梯度方向不明确、可解释性差与梯度方差高等问题:通过把偏好信号转化为可控、可解释的约束形式,统一了从隐式到显式约束的优化路径,从而提升训练稳定性与泛化对齐效果。
- Reinforcement Learning for LLM Post-Training: A Survey 🆕NEW
- 赛道归属: LLM后训练综述 / RLHF与RLVR方法体系化梳理 / 对齐与推理能力提升
- 核心创新点: 对LLM后训练中的RL范式进行系统化归纳与对比:覆盖偏好优化(如DPO等)与可验证奖励驱动的在线RL(如PPO、GRPO等)两大路线,梳理其目标函数、训练流程、数据与奖励来源、稳定性与可扩展性差异;总结在安全对齐、数学/代码推理等任务上的适用边界与常见失败模式,并提炼未来研究方向(如奖励建模、验证器设计、在线探索与离线偏好学习的融合等)。
- General Preference Reinforcement Learning 🆕NEW
- 赛道归属: LLM偏好对齐 / 偏好强化学习 / 开放式质量评估与在线探索融合
- 核心创新点: 试图打通“可验证奖励的在线RL”(擅长数学/代码等可判定任务)与“偏好优化”(擅长开放式生成但缺少在线探索)两条割裂路线:提出面向开放式任务的偏好强化学习框架,用“偏好/比较”信号替代单一标量奖励模型作为训练驱动,避免标量RM在开放域质量评估上的表达瓶颈;在方法上强调保留在线RL的持续探索能力,同时以更一般的偏好反馈充当“开放式验证器”,实现对开放域生成质量的可优化学习信号。
- EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL 🆕NEW
- 赛道归属: 工具使用智能体 / Agentic RL / 可执行环境合成与鲁棒强化学习
- 核心创新点: 针对Agentic RL训练的两大瓶颈(可扩展的可执行环境缺失、真实隐式推理数据稀缺),提出“可执行环境合成+ 鲁棒RL”的一体化方案:通过自动构建可运行、可交互的训练环境来替代昂贵真实API或易幻觉的LLM模拟器,并生成更贴近真实工具调用的多步轨迹;同时在训练上引入鲁棒性机制以应对合成轨迹过度规定、分布偏差与执行噪声,使策略在不同环境实例与扰动下仍能稳定学会工具使用与规划。
- Privacy Preserving Reinforcement Learning with One-Sided Feedback 🆕NEW
- 赛道归属: 隐私保护强化学习 / 连续状态-动作空间 / 单侧反馈
- 核心创新点: 在连续多维状态-动作空间下研究“单侧反馈”RL:智能体仅能部分观测状态,且每步只对状态-动作空间的一个子集获得奖励信息,导致学习效率与隐私风险同时上升;提出POOL算法,将隐私保护机制与在部分反馈下的策略/价值学习耦合设计,在信息受限条件下仍能有效估计回报并更新策略;并通过理论分析给出隐私与学习性能(如收敛/样本复杂度或遗憾界)之间的权衡刻画,辅以实验验证其实用性。
GitHub
- [2026-05-20] rllm-org/rllm ⭐5544
- [2026-05-19] facebookresearch/ReAgent ⭐3702
- [2026-05-19] pytorch/rl ⭐3434
- [2026-05-20] radixark/miles ⭐1359
- [2026-05-19] proroklab/VectorizedMultiAgentSimulator ⭐567 🆕NEW
HuggingFace Datasets
- [2026-05-19] PsiBotAI/SynData
SynData
中文说明
Demo
If the video cannot be displayed in your environment, open it directly: assets/syndata-demo.mp4
...
- [2026-05-14] AlienKevin/SWE-ZERO-12M-trajectories
SWE-ZERO 12M Trajectories
The largest agentic-coding trace dataset to date: 112 B tokens of execution-free agentic trajectories covering 12...
- [2026-05-13] TuringEnterprises/Open-MM-RL
Dataset Summary
Open-MM-RL is a multimodal STEM reasoning dataset covering Physics, Mathematics, Biology, and Chemistry. It is designed for...
- [2026-05-08] Qwen/WebWorldData
WebWorldData 🌐 Overview
WebWorldData is a large-scale dataset of 1.06M web interaction trajectories collect...
世界动作模型
arXiv
- WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
- 赛道归属: 视觉-语言导航 / 世界动作模型 / 自回归策略建模
- 核心创新点: 提出面向航拍VLN的首个自回归世界动作模型,将任务从“直接学策略”重构为“预测驱动的世界-动作联合建模”:在闭环导航中显式预测潜在世界状态的演化及动作后果,并以自回归方式逐步生成后续决策,从而避免依赖全序列视频生成式世界模型的高成本与冗余建模,强化对长时序指令跟随与环境动态的可控推演能力。
- World Action Models: The Next Frontier in Embodied AI
- 赛道归属: 具身智能 / 视觉-语言-动作+ 世界模型融合的策略学习(World Action Model范式)
- 核心创新点: 中文:提出并系统化“世界动作模型”这一新范式:将环境动力学的显式预测(世界模型)纳入动作生成/策略学习管线,突破传统VLA仅做“观测→动作”的反应式映射,转向“可干预的未来演化建模 + 基于预测的动作决策”的统一框架,从而为具身基础模型提供更强的可规划性、可推演性与对物理演化的建模能力。
- Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models
- 赛道归属: 世界模型评测与可靠性诊断(World Action Model / 动态一致性评估)
- 核心创新点: 提出并系统化“动作-状态一致性”作为世界动作模型可靠性的关键评估维度,用于区分“视觉上合理的未来”与“在动力学上与给定动作序列相容的未来”。该工作从诊断角度构建评测/分析框架,专门检验模型预测的状态转移是否真正由其声称的动作所诱发,从而补齐以往主要关注感知逼真度但忽略控制可用性的评估缺口。
- When to Trust Imagination: Adaptive Action Execution for World Action Models
- 赛道归属: 机器人操控(World Action Model / 视觉-动作联合预测)与闭环控制策略(自适应动作执行)
- 核心创新点: 将WAM的“固定步长开环执行”问题重构为未来-现实一致性验证:在执行过程中持续对比模型想象的未来观测与真实环境rollout的一致性,并据此自适应决定每次推理后应连续执行的动作步数(何时继续信任想象、何时提前中止并重新推理)。该方法在不改变WAM本体预测机制的前提下,引入面向执行阶段的验证与决策模块,实现从开环到更稳健的闭环执行,降低因预测漂移导致的失配与失败风险。
- The DAWN of World-Action Interactive Models
- 赛道归属: 自动驾驶 / 世界模型驱动的交互式规划与动作生成
- 核心创新点: 中文:提出“世界-动作交互模型”以刻画世界预测与动作选择的互依关系,指出现有WAM常见的并行分支或“先预测再规划”的刚性流水线难以体现“动作影响场景演化、场景演化反过来约束动作”的闭环耦合;并在自动驾驶中实例化为DAWN,通过在生成过程中联合/交替地对动作与世界演化进行一致性建模(以去噪式生成视角实现动作与未来场景的协同推断),实现更符合交互逻辑的场景-动作联合生成与规划。
GitHub
- [2026-05-18] DravenALG/awesome-vla-wam ⭐441
- [2026-05-15] OpenMOSS/Awesome-WAM ⭐381
由 Research Daily 自动生成 生成时间: 2026-05-20 01:02:46