AI 每日进展速报 - 2026-05-13
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping 🆕NEW
- 赛道归属: 文生图(扩散模型)/ 强化学习后训练
- 核心创新点: 指出GRPO类后训练中“归一化”会导致优势/奖励失配,从而诱发reward hacking;提出“超线性优势塑形” 的后训练策略,通过对优势函数进行非线性重标定来放大高质量样本的学习信号、抑制利用奖励偏置的投机解,并避免直接移除prompt相关项带来的校准问题,从机制上提升对齐增益的真实性与稳定性。
- Masked Generative Transformer Is What You Need for Image Editing 🆕NEW
- 赛道归属: 图像编辑(基于生成式Transformer的局部编辑)
- 核心创新点: 用Masked Generative Transformer替代扩散模型做编辑,利用“掩码token预测”的局部生成范式天然实现编辑区域的空间隔离,避免扩散全局去噪导致的改动外溢;提出EditMGT框架,将编辑建模为受mask约束的token重生成,并配套多阶段/多粒度的训练与推理策略以兼顾局部可控性与全局一致性,实现“只改该改的地方”。
- Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models 🆕NEW
- 赛道归属: 文生图(扩散/Flow-Matching)/ 强化学习后训练(可扩展对齐)
- 核心创新点: 提出Reinforce Adjoint Matching,将RL后训练改写为与扩散/flow-matching预训练同构的“回归式”目标:通过伴随匹配把奖励信号注入到可解析/可回归的训练靶中,避免昂贵的SDE rollout、显式reward梯度或不稳定的替代损失;从而在保持原有可扩展训练结构的同时,实现大规模偏好对齐与可控提升。
- Qwen-Image-2.0 Technical Report 🆕NEW
- 赛道归属: 统一文生图与图像编辑(基础模型/多模态系统工程)
- 核心创新点: 提出单框架统一“高保真生成+精确编辑”的全能图像基础模型,通过将强视觉语言理解/指令跟随能力与生成模型耦合,强化复杂构图、文本密集场景下的可控生成与编辑一致性;面向超长文本渲染、多语言排版与高分辨率写实等痛点,给出系统级训练配方与部署优化,使模型在可用性(指令遵循、编辑精度)与工程效率(推理/部署)上同时提升。
- LimeCross: Context-Conditioned Layered Image Editing with Structural Consistency 🆕NEW
- 赛道归属: 图像编辑(分层/Layered资产编辑与结构一致性)
- 核心创新点: 面向真实创作流程中的分层图像资产,提出LimeCross:在“上下文条件化”的分层表示上进行编辑,显式建模层间结构关系与接触/遮挡/光照一致性;通过跨层约束与结构一致性机制,避免传统“先压平再编辑再分解”导致的层间不一致与重组伪影,实现可重组、非破坏式的可控分层编辑。
- Empty SPACE: Cross-Attention Sparsity for Concept Erasure in Diffusion Models 🆕NEW
- 赛道归属: 文生图安全(概念擦除/模型去偏)/ 扩散模型机制改造
- 核心创新点: 提出Empty SPACE:利用“跨注意力稀疏化”实现闭式(无需反传)概念擦除,在SDXL等大模型上保持擦除强度;核心在于定位并稀疏化与目标概念强相关的cross-attention通路,使概念触发在注意力层面被系统性削弱,同时尽量保持非目标概念与整体生成质量,解决闭式擦除在大架构上失效的问题。
- What Concepts Lie Within? Detecting and Suppressing Risky Content in Diffusion Transformers 🆕NEW
- 赛道归属: 文生图安全(风险概念检测与抑制)/ DiT架构防护
- 核心创新点: 针对Diffusion Transformer而非U-Net,提出“模型内”风险概念的可解释检测与抑制框架:先探测模型表征/注意力中隐含的风险概念通路或子空间,再在生成过程中对这些通路进行定向抑制(而非仅靠外部过滤器);从而把安全机制迁移到DiT主流架构上,并提升对性/暴力/版权等风险内容的覆盖与可控性。
- A Real-Calibrated Synthetic-First Data Engine 🆕NEW
- 赛道归属: 数据引擎/合成数据生成与校准
- 核心创新点: 提出Real-Calibrated Synthetic-First数据引擎:以可控扩散生成作为“合成优先”数据来源,但引入真实数据校准与闭环反馈,解决纯合成增强带来的数据集级质量漂移与收益不稳定;通过模块化管线对合成数据分布、质量与任务指标进行对齐,实现可持续迭代的数据生成-筛选-评估闭环,提高数据稀缺场景下的稳定增益。
- When Few Steps Are Enough: Training-Free Acceleration of Identity-Preserved Generation 🆕NEW
- 赛道归属: 个性化/身份保持生成(推理加速与部署优化)
- 核心创新点: 提出训练无关的身份保持加速:证明身份适配器InfuseNet可从多步FLUX骨干直接迁移到蒸馏的schnell骨干而无需重训;通过“替换骨干路径+关闭CFG”两处极简改动,在保持/提升身份一致性的同时显著减少采样步数与延迟(5.9×),揭示身份条件在蒸馏模型上的可迁移性与低成本部署路径。
- Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs 🆕NEW
- 赛道归属: 文生图对齐(离线偏好优化)/ Rectified Flow
- 核心创新点: 提出面向Rectified Flow的离线偏好优化:构建“噪声可追踪的成对样本”,在数据中显式保存与赢家/输家对应的同一先验噪声索引,使偏好学习与RF近直线的真实反向轨迹一致;避免扩散DPO常用的独立前向加噪来估计轨迹所带来的动力学失配与偏差,从而更稳定、有效地对RF模型进行离线对齐。
GitHub
- [2026-05-13] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐11956
- [2026-05-13] Light-Heart-Labs/DreamServer ⭐523 🆕NEW
- [2026-05-13] vibheksoni/free-ai ⭐423
- [2026-05-12] etkecc/baibot ⭐224
- [2026-05-12] facebookresearch/wmar ⭐63 🆕NEW
HuggingFace Models
视频生成/编辑
arXiv
- PhyGround: Benchmarking Physical Reasoning in Generative World Models 🆕NEW
- 赛道归属: 视频生成评测 / 物理推理基准
- 核心创新点: 提出面向“生成式世界模型物理一致性”的细粒度评测基准,将物理规律遵循从粗粒度主观打分拆解为可定位的“定律级失败”检测;通过更结构化的评估协议降低人评的响应偏差与疲劳带来的噪声,使模型在不同物理规则维度(如碰撞、支撑、运动连续性等)的失真可被系统性暴露与对比。
- AllocMV: Optimal Resource Allocation for Music Video Generation via Structured Persistent State 🆕NEW
- 赛道归属: 视频生成 / 长视频生成效率优化(资源分配与一致性)
- 核心创新点: 将长时程音乐视频生成建模为多选背包问题的最优资源分配:先由全局规划器生成“结构化持久状态”(角色实体、场景先验、共享图)作为跨镜头一致性的紧凑载体,再基于对片段饱和度/收益的估计动态分配算力与生成配置,在计算预算受限下最大化整体质量并维持跨shot一致性。
- TIE: Time Interval Encoding for Video Generation over Events 🆕NEW
- 赛道归属: 视频生成 / 时序建模(多事件时间对齐)
- 核心创新点: 针对“并发/重叠事件”的生成需求,提出时间区间编码,用区间而非离散时间点来表示事件的起止与重叠关系,缓解DiT等点位位置编码在多事件并行时的表达瓶颈;使模型能在同一时间轴上对多个事件进行可控的时序落位与持续时间建模,从而支持导演式多事件提示与交互式代理场景。
- Improving Human Image Animation via Semantic Representation Alignment 🆕NEW
- 赛道归属: 图生视频 / 人体动画(语义条件对齐)
- 核心创新点: 提出“语义表征对齐”框架来提升人体图像动画的稳定性:在引入dense pose、ID等人体语义条件的同时,通过对齐机制缓解语义条件与生成表征之间的分布/尺度不匹配,减少长视频与大幅动作下的肢体扭曲、面部畸变;并试图降低强条件带来的可生成性/灵活性损失,实现更稳与更自由的折中。
- WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors 🆕NEW
- 赛道归属: 视频生成评测 / 世界状态预测与因果推理基准
- 核心创新点: 将视频生成评估重构为“未来世界状态预测”:给定初始状态与动作,要求生成的视频在状态演化上与人类预期对齐;通过压力测试式任务设计直接检验模型对动作后果、时序因果与状态一致性的推理能力,而非仅评估画质或文本对齐,从而更贴近“世界模拟器”能力的核心指标。
- SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation 🆕NEW
- 赛道归属: 视频生成 / 可控多人物交互(训练免控制)
- 核心创新点: 提出训练免的多人物社交交互控制方法,将“谁在何时对谁做什么”的交互结构显式注入生成过程,解决多人物生成中常见的角色错配与动作归因错误;通过对交互关系与时序的可控编排,实现对对话、手势、协同行为等社会互动的细粒度导演式控制,而无需重新训练基础视频模型。
- Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models 🆕NEW
- 赛道归属: 推理优化 / 自回归视频扩散的KV缓存压缩
- 核心创新点: 面向流式自回归视频扩散的注意力冗余问题,提出混合式KV Cache压缩:利用历史帧KV高度重复的结构,对不同时间尺度/重要性采用差异化压缩策略,在尽量保持生成质量的前提下显著降低显存占用与注意力计算复杂度,从而提升长视频AR扩散的可扩展性与实时性。
- SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation 🆕NEW
- 赛道归属: 推理优化 / 流式长视频生成的自适应记忆管理
- 核心创新点: 提出SWIFT的“提示词自适应记忆”:针对交互式长视频中频繁语义切换,设计能随prompt更新而重组/选择性保留的记忆机制,避免在提示边界反复重建缓存或受限于固定记忆预算造成的冗余计算与适配迟滞;在保持视觉连续性的同时提升语义切换响应效率。
- EduStory: A Unified Framework for Pedagogically-Consistent Multi-Shot STEM Instructional Video Generation 🆕NEW
- 赛道归属: 视频生成 / 多镜头脚本化生成(教育内容一致性)
- 核心创新点: 提出面向STEM教学的多镜头生成统一框架:引入“教学状态建模”跟踪跨镜头的持久知识与概念依赖,并用脚本引导的结构化控制组织叙事与镜头编排,解决长视频中知识一致性、讲解连贯性与多镜头衔接问题;将“内容正确性/教学一致性”作为生成过程的核心约束而非事后筛选。
- CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models 🆕NEW
- 赛道归属: 多模态推理 / 结合视频生成的协同推理框架
- 核心创新点: 提出VLM+视频生成模型的协同推理:用VLM承担显式规划、校验与纠错,将VGM生成的短时“Chain-of-Frames”作为可视化推理草稿;通过迭代式的生成—评估—修正闭环,缓解长任务的时序漂移与中段模拟错误累积,把视频生成从单纯输出器提升为可被语言推理约束与修正的“可视化思维工具”。
GitHub
- [2026-05-12] Anil-matcha/Open-Generative-AI ⭐13018
- [2026-05-13] hao-ai-lab/FastVideo ⭐3469
- [2026-05-12] ModelTC/LightX2V ⭐2258
- [2026-05-12] ZeroLu/awesome-seedance ⭐1717
- [2026-05-12] YouMind-OpenLab/awesome-seedance-2-prompts ⭐998
HuggingFace Models
音频生成
arXiv
- Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation 🆕NEW
- 赛道归属: 人物中心音视频生成(Audio-Video Generation,多模态联合生成:动作-语音-音效)
- 核心创新点: 提出统一框架在生成阶段显式约束“动作-语音-环境音效”三模态的时序一致性与语义协同,针对三者异质时间尺度与对齐难题,通过跨模态协同建模/对齐机制减少常见的口型-语音、动作-音效错配,实现更连贯的人物中心音视频联合生成。
- [2026-05-07] Optimal Transport Audio Distance with Learned Riemannian Ground Metrics
- 赛道归属: 音频生成评测 / 最优传输距离度量
- 核心创新点: 提出OTAD以替代/修正FAD的两大结构性缺陷:在“代价项”上学习残差黎曼地面度量适配器以避免冻结嵌入的不变性掩盖伪影;在“耦合项”上用离散OT(带熵正则)替代高斯拟合近似,提升对局部污染与细粒度失真的敏感性,从而得到更可信的生成音频距离度量。
- [2026-05-06] Stage-adaptive audio diffusion modeling
- 赛道归属: 音频生成(扩散模型训练优化 / 自适应训练策略)
- 核心创新点: 提出“阶段自适应”的音频扩散模型训练框架,针对扩散训练中不同阶段(如噪声水平/时间步、不同条件信号)的学习难度与贡献随训练进程变化这一现象,不再采用固定不变的优化配方,而是动态调整训练信号的重要性与采样/加权策略,使模型在训练早期与后期分别聚焦更关键的学习目标,从而在不改变生成范式的前提下提升训练效率与最终生成/复原质量。
GitHub
- [2026-05-12] huggingface/diffusers ⭐33602
- [2026-05-11] Lightricks/LTX-2 ⭐6617
- [2026-05-12] apocas/restai ⭐504
- [2026-05-07] Saganaki22/ComfyUI-Woosh ⭐98
语言大模型
arXiv
- ELF: Embedded Language Flows 🆕NEW
- 赛道归属: 语言生成建模(连续空间扩散/流模型用于文本)
- 核心创新点: 将语言建模从离散token扩散迁移到连续嵌入空间的“语言流/扩散”框架:在嵌入空间进行连续生成与去噪/流匹配,再通过最小化对离散域的适配(如嵌入-词表映射与训练目标设计)实现有效的连续DLM;关键突破在于证明连续生成范式在文本上可行,并用嵌入空间的动力学建模缓解离散扩散的结构性限制。
- Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning 🆕NEW
- 赛道归属: Agentic RL(技能库/工具使用的生命周期管理与策略学习)
- 核心创新点: 提出“技能生命周期管理”视角:不再假设外部技能只会单调累积或最终被完全内化为零技能推理,而是根据参数容量受限与技能边际贡献不均衡,动态决定技能的引入、保留、淘汰与再利用;方法上强调以任务收益/贡献为依据的技能管理机制,使agent在长期学习中维持可控的技能集合并避免无效技能膨胀或过早遗忘。
- WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation 🆕NEW
- 赛道归属: 智能体评测基准(真实环境/长时程/多模态CLI代理)
- 核心创新点: 构建原生运行时的长时程代理基准:以真实CLI环境而非合成沙盒/模拟API为载体,提供人类编写的双语、多模态任务,并强调过程执行与最终产物的真实可验证性;方法论突破在于把评测从“短回合+最终答案”提升到“真实工具链+长链路工作流”的端到端能力测量。
- Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers 🆕NEW
- 赛道归属: LLM安全与对齐(Guardrail分类器的形式化验证)
- 核心创新点: 将“有害行为”验证从离散输入空间转移到分类器的预激活连续空间,在该空间中定义可验证的鲁棒性/安全属性并给出形式化保证;突破点在于绕开离散token空间中缺乏语义一致的ε-邻域定义问题,使guardrail分类器的安全性从经验红队测试提升到可证明的保证框架。
- Grounded or Guessing? LVLM Confidence Estimation via Blind-Image Contrastive Ranking 🆕NEW
- 赛道归属: 多模态理解(LVLM置信度/视觉扎根性评估)
- 核心创新点: 提出BICR用于检测“视觉不扎根”的高置信回答:通过对比正常图像与“盲图像/去视觉信息”条件下的模型输出差异,以对比排序方式估计预测是否真正由图像驱动;方法上模型无关、无需改动主模型,通过构造反事实视觉输入来分离语言先验与视觉证据贡献。
- Count Anything at Any Granularity 🆕NEW
- 赛道归属: 视觉计数与开放词汇理解(多粒度目标计数)
- 核心创新点: 将开放世界计数重新定义为“多粒度计数”问题:显式建模用户意图的计数粒度(身份/属性/实例类型/类别/抽象概念等),而非把“要数什么”简化为单一类别匹配;核心突破在于引入粒度可控的表示与推断/匹配机制,使模型能在不同语义层级上稳定对齐计数目标。
- LoKA: Low-precision Kernel Applications for Recommendation Models At Scale 🆕NEW
- 赛道归属: 训练系统与推理优化(推荐模型FP8/低精度训练加速)
- 核心创新点: 面向大规模推荐模型提出低精度内核应用框架:针对LRM“小GEMM+归一化+数值敏感+通信密集”的特性,设计更稳健的FP8/低精度算子与训练策略,避免直接FP8导致的精度下降与训练变慢;突破在于把LLM中成熟的低精度收益迁移到LRM并解决其数值与系统瓶颈。
- Compute Where it Counts: Self Optimizing Language Models 🆕NEW
- 赛道归属: 推理优化(自适应计算/动态解码预算分配)
- 核心创新点: 提出“自优化语言模型”用于逐token动态分配计算量:不再对每个解码步使用固定计算预算,而是让单一模型学习判断token难度并自适应选择计算强度(如更深计算、更高精度或更多路径),在保证质量的同时减少易token的冗余计算;方法论突破在于把“预算分配策略”内生化到模型解码过程中,实现按需计算。
- BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD 🆕NEW
- 赛道归属: 多模态代码生成与评测(程序化CAD生成基准)
- 核心创新点: 提供面向工业标准的程序化CAD综合评测:不仅评估外形相似度,还强调3D结构理解、工程参数反推与CAD操作序列的可制造性/可执行性,推动MLLM从“看图说形”走向“生成可运行的参数化建模程序”;方法论突破在于以工业工作流为导向定义任务与指标,检验模型的真实工程建模能力。
- DGPO: Beyond Pairwise Preferences with Directional Consistent Groupwise Optimization 🆕NEW
- 赛道归属: 对齐训练(偏好优化/RLHF替代:组级多候选优化)
- 核心创新点: 提出DGPO:从成对偏好扩展到组级多候选比较,聚合组内监督信号并显式建模“方向一致性”(正向/反向问答组织)以兼顾对齐与推理多样性;突破点在于用方向感知的组级目标缓解pairwise方法在一致性与多样性之间的张力,并以轻量框架提升偏好学习效率与稳定性。
GitHub
- [2026-05-13] sgl-project/sglang ⭐27721
- [2026-05-13] NVIDIA-NeMo/NeMo ⭐17199
- [2026-05-13] stanford-crfm/helm ⭐2786 🆕NEW
- [2026-05-13] flagos-ai/FlagGems ⭐996
- [2026-05-13] NVIDIA-NeMo/Skills ⭐950
HuggingFace Datasets
- [2026-05-03] iletisim/dezenformasyon-bultenleri
İletişim Başkanlığı Dezenformasyon Bültenleri
Kaynak API: llm.iletisim.gov.trKaynak Bültenler: iletisim.gov.tr/turkce/dezenformasyon-bulten...
HuggingFace Spaces
多模态大模型
arXiv
- WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation 🆕NEW
- 赛道归属: 智能体评测基准(真实环境/长时程/多模态CLI代理)
- 核心创新点: 构建原生运行时的长时程代理基准:以真实CLI环境而非合成沙盒/模拟API为载体,提供人类编写的双语、多模态任务,并强调过程执行与最终产物的真实可验证性;方法论突破在于把评测从“短回合+最终答案”提升到“真实工具链+长链路工作流”的端到端能力测量。
- Grounded or Guessing? LVLM Confidence Estimation via Blind-Image Contrastive Ranking 🆕NEW
- 赛道归属: 多模态理解(LVLM置信度/视觉扎根性评估)
- 核心创新点: 提出BICR用于检测“视觉不扎根”的高置信回答:通过对比正常图像与“盲图像/去视觉信息”条件下的模型输出差异,以对比排序方式估计预测是否真正由图像驱动;方法上模型无关、无需改动主模型,通过构造反事实视觉输入来分离语言先验与视觉证据贡献。
- Count Anything at Any Granularity 🆕NEW
- 赛道归属: 视觉计数与开放词汇理解(多粒度目标计数)
- 核心创新点: 将开放世界计数重新定义为“多粒度计数”问题:显式建模用户意图的计数粒度(身份/属性/实例类型/类别/抽象概念等),而非把“要数什么”简化为单一类别匹配;核心突破在于引入粒度可控的表示与推断/匹配机制,使模型能在不同语义层级上稳定对齐计数目标。
- Learning More from Less: Exploiting Counterfactuals for Data-Efficient Chart Understanding 🆕NEW
- 赛道归属: 图表理解 / 多模态理解数据效率提升
- 核心创新点: 利用“图表可程序化生成”的特性,引入反事实样本构造:通过对生成代码做微小可控改动,制造视觉变化小但语义/答案变化大的样本对,迫使VLM学习对关键语义因素的敏感性与判别能力;相较单纯扩增SFT数据规模,该方法以更少数据获得更强的语义鲁棒性与泛化,核心在于把“反事实敏感性”作为训练信号显式注入。
- MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection 🆕NEW
- 赛道归属: 工业场景视频多模态理解 / 工业异常检测数据集与基准
- 核心创新点: 提出面向真实连续巡检流程的多视角、多任务工业异常视频数据集与评测基准:用“连续视频 + 多视角”覆盖静态图像/稀疏视角数据难以表达的时序线索与跨视角一致性问题,并以多任务设置统一评估异常检测与理解能力(如定位/分类/描述等任务组合),推动模型从单点缺陷识别走向面向流程的时空理解。
- Break the Brake, Not the Wheel: Untargeted Jailbreak via Entropy Maximization 🆕NEW
- 赛道归属: 多模态安全 / VLM越狱攻击与鲁棒性评估
- 核心创新点: 在严格“非定向”威胁模型下重审跨模型可迁移的图像越狱:提出以“熵最大化”为目标的通用扰动生成思路,基于观察到拒答行为在自回归解码中集中于高熵token区域,通过提升解码不确定性来打破安全拒答机制,而不依赖固定前缀或特定输出模式,从而提升通用越狱在不同VLM间的迁移潜力。
- GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs 🆕NEW
- 赛道归属: 长视频多模态理解 / 测试时自适应计算与帧选择
- 核心创新点: 提出GridProbe:通过“后验探测”在测试时自适应分配计算量,避免对上千帧做一次性高成本前向;不同于依赖对比预训练相似度的训练无关帧选择,GridProbe直接利用模型对候选帧网格/片段的输出后验信号来评估其对当前问题(尤其是否定、计数、跨帧推理、整体总结等推理型查询)的贡献,并据此动态扩展/收缩计算与选帧范围,实现更强推理相关性与更低总体开销。
- TINS: Test-time ID-prototype-separated Negative Semantics Learning for OOD Detection 🆕NEW
- 赛道归属: 多模态OOD检测 / 测试时学习
- 核心创新点: 提出TINS:在测试时扩展“负语义”以覆盖不断变化的OOD概念,同时通过“ID原型分离”机制抑制从潜在OOD样本学习时引入的ID污染;核心在于将ID语义用原型/锚点显式建模并与负语义学习解耦,使得负标签集合可在推理阶段安全扩展,从而提升开放环境下的OOD检出能力与稳定性。
- C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving 🆕NEW
- 赛道归属: 自动驾驶多模态决策 / 安全推理与因果反思
- 核心创新点: 提出C-CoT(反事实链式思维):在交叉口等高风险场景中,引入“反事实生成—风险归因—决策修正”的推理流程,让VLM不仅描述当前观测,还能构造关键参与者/事件的反事实变化并评估其对风险与可行动作的因果影响;通过将反事实推理嵌入CoT,增强对罕见危险情形的反思能力与安全裕度,提升规划决策的可靠性与可解释性。
- LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models 🆕NEW
- 赛道归属: 视觉语言模型压缩 / 知识蒸馏与高效部署
- 核心创新点: 提出自底向上的级联知识蒸馏:针对Teacher-Student容量差距过大导致蒸馏困难的问题,采用分阶段/级联的蒸馏路径,从底层表征到高层对齐逐步迁移知识,缓解一次性对齐带来的优化不稳定与信息丢失;在保持VQA等多任务能力的同时显著降低学生模型的显存与计算需求,提升可部署性。
GitHub
- [2026-05-12] Blaizzy/mlx-vlm ⭐4706
- [2026-05-11] waybarrios/vllm-mlx ⭐1153
- [2026-05-08] zhengli97/Awesome-Prompt-Adapter-Learning-for-VLMs-CLIP ⭐772
- [2026-05-10] dongyangli-del/EEG_Image_decode ⭐203
- [2026-05-12] ydyhello/Awesome-VLM-Streaming-Video ⭐155
强化学习
arXiv
- Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping 🆕NEW
- 赛道归属: 文生图(扩散模型)/ 强化学习后训练
- 核心创新点: 指出GRPO类后训练中“归一化”会导致优势/奖励失配,从而诱发reward hacking;提出“超线性优势塑形” 的后训练策略,通过对优势函数进行非线性重标定来放大高质量样本的学习信号、抑制利用奖励偏置的投机解,并避免直接移除prompt相关项带来的校准问题,从机制上提升对齐增益的真实性与稳定性。
- Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning 🆕NEW
- 赛道归属: Agentic RL(技能库/工具使用的生命周期管理与策略学习)
- 核心创新点: 提出“技能生命周期管理”视角:不再假设外部技能只会单调累积或最终被完全内化为零技能推理,而是根据参数容量受限与技能边际贡献不均衡,动态决定技能的引入、保留、淘汰与再利用;方法上强调以任务收益/贡献为依据的技能管理机制,使agent在长期学习中维持可控的技能集合并避免无效技能膨胀或过早遗忘。
- Equivariant Reinforcement Learning for Clifford Quantum Circuit Synthesis 🆕NEW
- 赛道归属: 强化学习 + 量子电路综合(对称/等变表示学习)
- 核心创新点: 将Clifford量子电路综合表述为RL序列决策:智能体通过选择基本Clifford门,将Clifford电路的辛矩阵表示逐步化简到单位阵;提出基于“从单位阵出发的随机游走”的课程学习生成训练分布,稳定覆盖不同难度实例;引入利用问题结构对称性的等变神经网络架构,使策略/价值网络对相关群作用保持等变,从而提升泛化与样本效率,减少对特定表示/排列的过拟合。
- RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards 🆕NEW
- 赛道归属: 强化学习 + Meta-RL(面向LLM研究代理的非可验证奖励/规则驱动学习)
- 核心创新点: 面向“深度研究代理”这类缺乏标准答案、轨迹长且工具调用复杂的场景,提出用“Rubric(评分量规/评价维度)”不仅做终局打分,而是作为共享接口来分解策略:将整体策略拆成与不同rubric维度对齐的子策略/技能,并在元学习框架下实现跨任务复用;通过rubric引导的经验抽取与重用,把历史尝试转化为可迁移的训练信号,突破仅依赖可验证奖励或单次偏好反馈的后训练范式。
- Policy Gradient Methods for Non-Markovian Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习理论 + 非马尔可夫决策过程+ 策略梯度
- 核心创新点: 针对观测与奖励依赖完整历史的NMDP,提出“以奖励为中心”的联合优化框架:智能体通过递归更新的内部状态对历史进行压缩表征,同时不将该状态动力学固定或仅用预测目标学习,而是与策略一起直接围绕回报目标端到端优化;由此推导适用于非马尔可夫环境的策略梯度方法,使“记忆/状态更新机制”成为可优化的决策组成部分,系统性处理长程依赖下的梯度估计与学习。
- Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models 🆕NEW
- 赛道归属: 文生图(扩散/Flow-Matching)/ 强化学习后训练(可扩展对齐)
- 核心创新点: 提出Reinforce Adjoint Matching,将RL后训练改写为与扩散/flow-matching预训练同构的“回归式”目标:通过伴随匹配把奖励信号注入到可解析/可回归的训练靶中,避免昂贵的SDE rollout、显式reward梯度或不稳定的替代损失;从而在保持原有可扩展训练结构的同时,实现大规模偏好对齐与可控提升。
- XQCfD: Accelerating Fast Actor-Critic Algorithms with Prior Data and Prior Policies 🆕NEW
- 赛道归属: 强化学习算法 + 样本效率优化(离线数据/示范/先验策略融合的Actor-Critic加速)
- 核心创新点: 提出XQCfD框架以加速“快速Actor-Critic”类算法在真实机器人等高成本探索场景下的学习:同时利用先验数据(如专家示范/历史回放)与先验策略(已有控制器/旧策略)进行初始化与训练信号增强;指出现有做法在“如何使用先验数据与先验策略”上存在设计缺陷,导致未能达到可实现的样本效率上限,并通过更紧耦合的利用方式(如更有效的行为约束/目标构造/更新机制)提升稀疏奖励与困难探索任务的收敛速度与稳定性。
- Natural Policy Gradient as Doubly Smoothed Policy Iteration: A Bellman-Operator Framework 🆕NEW
- 赛道归属: 强化学习理论 + 自然策略梯度+ Bellman算子/策略迭代统一框架
- 核心创新点: 将自然策略梯度给出一个“精确等价”的Bellman算子视角:提出双重平滑策略迭代,其中新策略通过对“过去Q函数的加权平均”做正则化贪婪得到;该框架把传统策略迭代、dual-averaged策略迭代与NPG统一为同一类算子迭代的特例,揭示NPG可解释为“平滑 + 平均”的策略改进过程,为算法设计(不同平滑/权重/正则选择)与收敛分析提供可组合的理论模板。
- Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents 🆕NEW
- 赛道归属: 强化学习 + LLM智能体自进化/经验蒸馏(端到端优化的经验驱动适应)
- 核心创新点: 针对“经验驱动自进化智能体”常停留在系统工程层(经验如何存储/检索/管理),提出端到端优化范式:把从交互中提炼可复用经验、并在部署时适应新任务的能力,作为可训练目标直接反向优化基础模型/代理组件;强调提升模型在抽象、泛化与in-context学习上的内生能力,使经验蒸馏不只是外部记忆机制,而是形成可持续自我改进的学习闭环(交互→提炼→再利用→能力提升)。
- Controllability in preference-conditioned multi-objective reinforcement learning 🆕NEW
- 赛道归属: 多目标强化学习+ 评测指标/可控性分析
- 核心创新点: 提出“可控性”作为偏好条件多目标RL的关键性质与评测维度:指出现有MORL指标可能在性能上看似优秀,但策略对偏好输入不敏感,导致用户无法通过改变偏好可靠地改变行为;围绕“偏好变化是否引起预期的行为/回报权衡变化”构建可评估的度量与分析框架,用于诊断与比较不同偏好条件化方法,并推动训练目标/正则化朝提升偏好响应性与可操控性方向改进。
GitHub
- [2026-05-12] huggingface/trl ⭐18353
- [2026-05-12] rllm-org/rllm ⭐5497
- [2026-05-12] google-deepmind/open_spiel ⭐5211 🆕NEW
- [2026-05-13] radixark/miles ⭐1322
- [2026-05-12] pettingllms-ai/PettingLLMs ⭐167 🆕NEW
HuggingFace Datasets
- [2026-05-03] ADSKAILab/Zero-To-CAD-1m
Zero-to-CAD 1M
One million executable, interpretable CAD construction sequences synthesized entirely without real-world data.
...
- [2026-05-12] TuringEnterprises/Open-MM-RL 🆕NEW
Dataset Summary
Open-MM-RL is a multimodal STEM reasoning dataset covering Physics, Mathematics, Biology, and Chemistry. It is designed for...
-
[2026-04-23] nvidia/Nemotron-Personas-Korea
Nemotron-Personas-Korea우리나라 실제 분포에 기반한 합성 페르소나를 위한 복합 AI 시스템 A compound AI approach to personas grounded in real-world dist...
世界动作模型
arXiv
- [2026-05-08] Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models
- 赛道归属: 世界模型评测与可靠性诊断(World Action Model / 动态一致性)
- 核心创新点: 提出并系统化定义WAM可靠性的关键缺失维度——动作-状态一致性,用于检验“模型生成的未来”是否与其声称的动作序列在动力学上相容,而不仅是视觉上合理;围绕该一致性构建诊断框架/评测思路,将WAM的失效从“看起来对”细化为“动力学不兼容”的可检测问题,从而为后续训练目标、校准与安全执行提供可操作的评价轴。
- [2026-05-07] When to Trust Imagination: Adaptive Action Execution for World Action Models
- 赛道归属: 世界模型驱动的机器人控制(自适应执行 / 想象-现实一致性验证)
- 核心创新点: 将WAM的执行策略从“每次推理固定执行N步”提升为自适应动作执行:把是否继续执行想象动作序列建模为未来-现实验证问题;核心方法论是在执行过程中持续对比模型想象的未来与真实滚动的偏差/一致性,并据此动态决定执行更长的开环段还是提前重规划,从机制上缓解因想象漂移导致的失控与累积误差,实现“何时信任想象”的可决策化。
GitHub
- [2026-05-12] DravenALG/awesome-vla-wam ⭐373
- [2026-05-12] jiangranlv/DyWA ⭐81 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-05-13 01:02:49