AI 每日进展速报 - 2026-05-19
图像生成/编辑
arXiv
- Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards
- 赛道归属: 文生图(偏好对齐/后训练强化学习)
- 核心创新点: 提出 SOLACE 后训练框架,用“模型内生自信度”替代外部奖励模型/人工偏好监督:将模型自身生成结果重新加噪,并以其对注入噪声的恢复准确性作为自信度奖励信号,从而在不依赖额外标注或奖励网络的情况下进行偏好对齐式优化,提升生成的可靠性与审美一致性。
- Skill-Aligned Annotation for Reliable Evaluation in Text-to-Image Generation
- 赛道归属: 文生图评测 / 人类标注与评估协议设计
- 核心创新点: 提出“技能对齐标注”评测范式:不再用统一的Likert/BQA覆盖所有评测维度,而是先将T2I评测拆解为异质“技能”(如语义一致性、属性绑定、空间关系、文本可读性、审美/真实感等),再为不同技能匹配更合适的标注接口、问题形式与聚合方式,从而降低标注噪声与维度混淆;强调在模型差距缩小时,通过对齐技能本质来提升评测的可靠性、可复现性与区分度。
- EPIC: Efficient Predicate-Guided Inference-Time Control for Compositional Text-to-Image Generation
- 赛道归属: 文生图(推理时可控生成/组合式生成)
- 核心创新点: 提出 EPIC 的训练无关推理时控制:将复杂提示词一次性解析为包含对象变量与类型化谓词(数量、属性、关系等)的“视觉程序”,并把生成改写为谓词引导的搜索/精炼过程,在不改动模型参数的前提下,通过对违反谓词的部分进行定向修正来提升组合一致性与可控性,同时强调推理效率。
- SPOT: Selective Prompt Projection via Total Variation for Inference-Only Safe Text-to-Image Generation
- 赛道归属: 文生图安全对齐 / 推理期安全控制
- 核心创新点: 提出SPOT:在冻结扩散生成器的前提下,仅在推理期对文本提示进行“选择性投影”以抑制不安全生成,同时尽量保持对良性提示的行为不变;用总变差距离将“相对原始提示条件分布的偏移”与“风险期望变化”建立可控上界关系,把安全约束转化为对提示投影强度/选择策略的可优化目标,实现无需再训练的安全-保真折中控制。
- ElasticDiT: Efficient Diffusion Transformers via Elastic Architecture and Sparse Attention for High-Resolution Image Generation on Mobile Devices 🆕NEW
- 赛道归属: 文生图(高分辨率扩散Transformer推理优化/移动端部署)
- 核心创新点: 提出面向移动端的高效DiT框架,通过“弹性架构”在单一模型内支持按设备预算动态调整网络宽度/深度/计算路径,实现一模型多档位推理;同时引入稀疏注意力以降低高分辨率下自注意力的二次复杂度与显存占用,在不依赖静态剪枝的前提下兼顾生成质量与延迟/能耗约束,提升DiT在资源受限端侧的可部署性。
- Drag within Prior Distribution: Text-Conditioned Point-Based Image Editing within Distribution Constraints
- 赛道归属: 图像编辑 / 扩散模型点控编辑
- 核心创新点: 提出“分布内约束”的文本条件点编辑框架:针对传统handle/target点对带来的轨迹歧义与远距离拖拽导致的非必要改动,引入“保持在先验分布内”的约束思想,在编辑优化过程中显式限制生成状态偏离模型先验流形;同时用文本条件辅助消歧与稳定语义,使点级位移更可控、对无关区域扰动更小,并提升大位移/复杂场景下的编辑一致性。
- Does Engram Do Memory Retrieval in Autoregressive Image Generation?
- 赛道归属: 自回归图像生成 / 记忆增强Transformer机理分析
- 核心创新点: 将Engram(哈希键控、O(1)联想记忆)模块适配到视觉AR生成(2D空间n-gram哈希),并围绕“是否真的在做记忆检索”这一解释进行机制层面的实证检验;通过对比与探针分析区分性能增益来源(内容寻址检索 vs. 其他正则化/表示效应),从而澄清记忆模块在AR图像生成中的作用边界与适用条件,为后续设计更有效的视觉记忆结构提供依据。
- Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation
- 赛道归属: 多模态理解 / 指代表达分割与编辑模型语义指向能力挖掘
- 核心创新点: 发现并系统验证指令式图像编辑模型在编辑前期就形成语言条件的语义指向信号;提出利用“早期语义落地”将编辑模型转化为零样本RIS:从模型早期层/早期扩散阶段提取与指代表达对齐的空间响应,并映射为像素级掩码,避免依赖专门分割训练数据;核心突破在于把“编辑所需的隐式定位能力”显式化为可用的分割输出。
- Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
- 赛道归属: 图像编辑评测基准 / 奖励模型评测
- 核心创新点: 提出统一基准Edit-Compass与EditReward-Compass:面向前沿编辑模型,设计更高难度、更贴近人类偏好的任务集合与细粒度评测协议,缓解现有基准“题目过易+打分粗糙”导致的饱和与失真;同时将“编辑质量评测”与“用于RL优化的奖励模型评测”打通,在同一任务空间中评估reward对人类判断的一致性与可泛化性,推动可用、可对比的编辑RL闭环。
- Inline Critic Steers Image Editing
- 赛道归属: 图像编辑 / 推理期引导与自我纠错
- 核心创新点: 提出Inline Critic:在不等待整张图生成或完整去噪步结束的情况下,把“批评/纠错信号”注入到一次前向过程内部,实现更早、更局部的难点区域分配式修正;通过探测冻结编辑模型,发现早期表征已包含可用于判断编辑偏差的信号,据此训练/构建可内联工作的critic,在生成进行中对中间状态施加引导,从而提升复杂指令与局部区域编辑的稳定性与成功率。
GitHub
- [2026-05-19] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐12063
- [2026-05-18] Light-Heart-Labs/DreamServer ⭐1472
- [2026-05-18] jegly/Box ⭐442
- [2026-05-18] shinpr/mcp-image ⭐110 🆕NEW
- [2026-05-18] guyyariv/AudioToken ⭐88 🆕NEW
HuggingFace Models
视频生成/编辑
arXiv
- Evaluating Design Video Generation: Metrics for Compositional Fidelity 🆕NEW
- 赛道归属: 视频生成评测 / 视频生成指标
- 核心创新点: 提出面向“设计类动画视频生成”的全自动评测框架,针对该领域区别于自然视频的强结构约束(组件级运动类型/方向/速度/时序可控、非运动区域稳定、整体版式与布局保持)进行指标体系化拆解;将评测组织为多维度(以布局/结构一致性与组件级运动符合性为核心)并实现自动化计算,从而能定量衡量生成视频的“组合保真度”,弥补现有通用视频生成指标难以覆盖版式保持与局部受控运动的缺口。
- Pyramid Forcing: Head-Aware Pyramid KV Cache Policy for High-Quality Long Video Generation
- 赛道归属: 长视频生成(自回归视频生成 / KV Cache与注意力记忆策略优化)
- 核心创新点: 该工作针对自回归长视频生成中“误差累积导致长期退化”的关键瓶颈,提出Head-Aware 的金字塔式 KV Cache 保留策略:不再对所有注意力头采用统一的历史帧保留,而是基于对“历史帧注意力模式”的实证分析,将注意力头划分为Anchor(需要广域长程上下文)、Wave(周期性时序依赖)等不同类型,并据此为不同头分配差异化的历史信息保留/压缩方案(呈金字塔式的时间尺度覆盖)。核心突破在于把“长程记忆管理”从全局统一策略提升为按头建模的结构化策略,在不牺牲流式生成特性的前提下,更有效抑制长视频的质量漂移与语义/运动一致性退化。
- CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation
- 赛道归属: 可控视频生成(相机运动/镜头控制条件的视频生成 / 位置编码与几何表征)
- 核心创新点: 该工作面向“相机条件视频生成”中位置编码在不同镜头模型下失效的问题,提出Curved Ray Expectation Positional Encoding,以适配统一相机模型下的广角/鱼眼等非针孔成像。相较于仅注入光线方向或依赖针孔几何的编码方式,CRePE通过曲线光线期望来构造更稳健的注意力级位置编码,使模型在相机运动、镜头参数变化以及场景结构变化时仍能获得一致、可泛化的相机几何信号。核心突破在于将相机控制信号从“针孔假设下的显式几何”扩展为“统一相机模型下可微、可泛化的曲线光线统计表征”,从而实现更通用的相机可控视频生成。
- OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation
- 赛道归属: 音视频联合生成(多模态生成)
- 核心创新点: 提出面向“联合音频-视频生成”的模态分治式强化学习框架,将扩散生成中的优化目标拆解为“单模态保真度 + 跨模态对齐 + 细粒度时序同步”等多目标,并通过针对多模态/多目标RL训练不稳定性的机制化处理(如优势信号冲突与尺度不一致等问题的分析与改造)实现可训练、可控的联合优化,从而在不牺牲单模态质量的前提下提升音画一致性与同步精度。
- OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation
- 赛道归属: 视频生成(跨具身/跨形体动作迁移,Embodiment-aware Generation)
- 核心创新点: 提出流式的跨具身视频生成框架,将“可迁移的运动动力学”与“具身特定的外观/形态”进行解耦建模,并通过无需成对数据的适配机制把模型快速迁移到新的人形载体(如人→机器人、机器人→机器人)。方法层面强调在生成过程中持续接收运动条件并稳定输出视频序列,同时用无配对适配降低对每个目标具身的标注/配对采集成本,提升可扩展性。
- SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation
- 赛道归属: 视频生成 / 可控多人物交互(训练免控制)
- 核心创新点: 提出训练免的多人物社交交互控制方法,将“谁在何时对谁做什么”的交互结构显式注入生成过程,解决多人物生成中常见的角色错配与动作归因错误;通过对交互关系与时序的可控编排,实现对对话、手势、协同行为等社会互动的细粒度导演式控制,而无需重新训练基础视频模型。
- SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation
- 赛道归属: 推理优化 / 流式长视频生成的自适应记忆管理
- 核心创新点: 提出SWIFT的“提示词自适应记忆”:针对交互式长视频中频繁语义切换,设计能随prompt更新而重组/选择性保留的记忆机制,避免在提示边界反复重建缓存或受限于固定记忆预算造成的冗余计算与适配迟滞;在保持视觉连续性的同时提升语义切换响应效率。
- EduStory: A Unified Framework for Pedagogically-Consistent Multi-Shot STEM Instructional Video Generation
- 赛道归属: 视频生成 / 多镜头脚本化生成(教育内容一致性)
- 核心创新点: 提出面向STEM教学的多镜头生成统一框架:引入“教学状态建模”跟踪跨镜头的持久知识与概念依赖,并用脚本引导的结构化控制组织叙事与镜头编排,解决长视频中知识一致性、讲解连贯性与多镜头衔接问题;将“内容正确性/教学一致性”作为生成过程的核心约束而非事后筛选。
- CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models
- 赛道归属: 多模态推理 / 结合视频生成的协同推理框架
- 核心创新点: 提出VLM+视频生成模型的协同推理:用VLM承担显式规划、校验与纠错,将VGM生成的短时“Chain-of-Frames”作为可视化推理草稿;通过迭代式的生成—评估—修正闭环,缓解长任务的时序漂移与中段模拟错误累积,把视频生成从单纯输出器提升为可被语言推理约束与修正的“可视化思维工具”。
- Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
- 赛道归属: 人物中心音视频生成(Audio-Video Generation,多模态联合生成:动作-语音-音效)
- 核心创新点: 提出统一框架在生成阶段显式约束“动作-语音-环境音效”三模态的时序一致性与语义协同,针对三者异质时间尺度与对齐难题,通过跨模态协同建模/对齐机制减少常见的口型-语音、动作-音效错配,实现更连贯的人物中心音视频联合生成。
GitHub
- [2026-05-19] NVlabs/LongLive ⭐1221 🆕NEW
- [2026-05-18] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1117
- [2026-05-18] AceDataCloud/Nexior ⭐371
- [2026-05-19] james-see/ltx-video-mac ⭐267 🆕NEW
- [2026-05-18] guyyariv/TempoTokens ⭐128 🆕NEW
HuggingFace Models
音频生成
arXiv
- Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation 🆕NEW
- 赛道归属: 音频生成(音乐生成)/ 音频Tokenizer与表示学习
- 核心创新点: 提出面向生成的2D Mel谱Tokenizer,将音乐建模为“时-频图像”,用单一共享码本在每个时间帧上按Mel频带产生2D token网格,避免残差多码本量化在序列展平后引入的强层级依赖与误差累积;该设计更贴合自回归语言建模的依赖结构,在保持可重建性的同时提升生成建模的可学习性与稳定性。
- Adapting a Text-to-Audio Model for Room Impulse Response Generation
- 赛道归属: 音频生成 / 声学建模(RIR 房间脉冲响应生成)
- 核心创新点: 将预训练的文生音频大模型作为“生成先验”迁移到RIR这一强物理约束、数据稀缺的声学对象上,通过适配策略把通用音频生成能力对齐到RIR的时域结构与混响特征分布,实现无需从零训练即可生成高质量RIR;关键突破在于证明大规模生成式音频先验可有效覆盖并可控地生成RIR这类非语音/非音乐的声学响应信号,从而缓解真实RIR采集成本高与训练数据不足的问题。
- TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling
- 赛道归属: 音频-文本数据集构建 / 音频语言模型指令微调
- 核心创新点: 提出面向区域方言与韵律(台湾语境)的高质量音频-文本指令数据集构建范式:通过 Verify-Generate-Critique流程先“验证再扩增”,用双ASR交叉校验对52.2万原始音频进行一致性过滤以提升转写可靠性,再借助教师模型生成并批判式筛选,扩展为58万高保真指令对;该“验证引导的数据策展”显著降低方言场景的噪声标注与语音-文本错配,为后续Tai-LALM等区域化音频语言建模提供可复用的数据生产管线。
- The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models
- 赛道归属: 多模态理解(音频-语言)/ 空间音频理解
- 核心创新点: 将“空间音频-语言理解”从零散问题提升为统一的任务接口,提出音频场景分析的三层级形式化:从原子级感知(事件与方位/距离等空间属性)到对象级绑定(语义与空间属性的归属一致性、多对象分离与排列),再到场景级物理一致性判断(答案是否符合空间声学常识)。核心突破在于把“听到什么”扩展为“在哪里、谁对应谁、整体是否合理”的可评测框架,为大音频语言模型引入可系统训练/评估的空间推理目标。
- Aliasing-Free Neural Audio Synthesis
- 赛道归属: 神经音频合成 / 声码器与神经编解码器(抗混叠高保真生成)
- 核心创新点: 针对神经声码器/编解码器在音乐与歌声高频段常见的混叠失真,系统性指出其主要来源于非线性激活与上采样结构引入的频谱折叠,并提出“从架构层面消除混叠”的神经合成方案:通过在非线性与上采样路径中引入可控带宽/抗混叠约束(而非仅靠后处理滤波),在生成过程中抑制不可逆的折叠伪影,从而提升高频细节、瞬态与谐波结构的保真度,面向高保真音乐/歌声合成更稳健。
- Kinetic-Optimal Scheduling with Moment Correction for Metric-Induced Discrete Flow Matching in Zero-Shot Text-to-Speech
- 赛道归属: 语音生成(零样本文本转语音)/ 离散流匹配推理优化(MI-DFM 调度与校正)
- 核心创新点: 针对MI-DFM在离散生成中的两大瓶颈提出成体系的推理改进:其一,从概率路径的标量参数化出发推导“动力学最优”调度器,给出无需训练、免超参搜索的数值调度方案以替代经验式scheduler;其二,针对一阶CTMC求解带来的有限步路径跟踪误差,引入矩校正以在有限步数下更准确匹配目标路径分布。方法论突破在于把“怎么排步长/怎么减误差”从启发式工程变为可推导的最优调度与可控校正,从而提升零样本TTS的稳定性与质量/效率权衡。
- OLaPh: Optimal Language Phonemizer
- 赛道归属: 语音合成前端 / 文本到音素
- 核心创新点: 提出混合式音素化框架:融合大规模多语种词典与现代NLP建模,并引入统计子词切分来处理OOV与跨语言形态变化;通过“词典强约束 + 神经/统计泛化”的组合,在覆盖率与泛化能力之间取得更优折中,提升多语种音素化鲁棒性。
- JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching 🆕NEW
- 赛道归属: 多模态生成(音频-动作联合生成)/ 说话人脸与语音同步合成
- 核心创新点: 提出JAM-Flow统一框架,将语音与面部运动从“两个任务”重构为“同一生成过程中的联合变量”,用Flow Matching进行联合生成与条件控制;设计Multi-Modal Diffusion Transformer,通过专门的Motion-DiT与Audio-DiT模块并在架构层进行耦合,实现跨模态对齐与互相条件化,从而提升口型-语音时序一致性与联合可控性。
- ARIA: A Diagnostic Framework for Music Training Data Attribution 🆕NEW
- 赛道归属: 音频生成安全与版权(训练数据归因/可解释性)/ 音乐训练数据影响分析
- 核心创新点: 提出ARIA诊断框架,将音乐生成的训练数据归因从“单一标量影响力”扩展为“按音乐属性分解的多维归因”,分别针对符号音乐与音频定义若干可解释的音乐方面并进行分解归因;该分解能回答“哪些训练歌曲影响了输出”以及“影响主要体现在哪些音乐维度”,更贴近版权分析所需的可解释证据链。
- Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment 🆕NEW
- 赛道归属: 多模态智能体 / 测试时扩展与Critic排序建模
- 核心创新点: 将GUI Critic从二分类重构为“连续语义对齐”问题,指出二分类训练会导致有效动作与“看似合理但无效”的干扰项在打分上纠缠、难以细粒度排序;通过连续化的对齐/评分目标提升critic的可分辨性,从而增强Test-Time Scaling中“采样-排序”范式的排名质量与决策鲁棒性。
GitHub
- [2026-05-18] huggingface/diffusers ⭐33656
- [2026-05-18] Stability-AI/stable-audio-tools ⭐3700 🆕NEW
- [2026-05-18] SamurAIGPT/Generative-Media-Skills ⭐3290
- [2026-05-18] apocas/restai ⭐505
- [2026-05-13] Blaizzy/mlx-video ⭐228
HuggingFace Models
HuggingFace Spaces
语言大模型
arXiv
- Can Large Language Models Imitate Human Speech for Clinical Assessment? LLM-Driven Data Augmentation for Cognitive Score Prediction 🆕NEW
- 赛道归属: 医疗语音理解与临床评估(LLM数据增强/认知评分预测)
- 核心创新点: 利用“同一临床提示下的书面回答”作为语义锚点,构建LLM驱动的数据增强框架,将文本层面的语义约束注入到自发口语叙事的生成/改写中,以缓解小样本与类别不均衡问题;通过语义锚定的增强样本提升从语音/转写到认知量表分数的回归/预测鲁棒性与泛化能力。
- Large Language Models for Sequential Decision-Making: Improving In-Context Learning via Supervised Fine-Tuning
- 赛道归属: LLM+强化学习/序列决策(离线RL、MDP/POMDP上的In-Context Learning与微调)
- 核心创新点: 通过对“离线、oracle标注的轨迹”进行监督微调,把LLM的少样本ICL能力显式迁移到序列决策任务中,使模型能够在MDP、POMDP及更具不确定性的APOMDP设定下,直接从上下文轨迹中进行few-shot决策;方法上将“轨迹作为上下文提示”的ICL与“用高质量轨迹进行SFT”的训练范式结合,系统化提升LLM在长期依赖与部分可观测场景中的决策稳健性。
- RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
- 赛道归属: 对齐训练 / 偏好优化(DPO改进、逻辑一致性对齐)
- 核心创新点: 提出Hybrid-DPO的自动化偏好构建与优化框架,用“逻辑正确性信号 + 流畅性偏好信号”的混合偏好来替代单一偏好监督,针对DPO在知识密集生成中被“冗长/流畅偏置”误导的问题进行校正;通过引入基于NLI/逻辑判别器(如DeBERTa类模型)的可验证逻辑一致性评估,与LLM评审/人类偏好形成互补,从而在不牺牲可读性的前提下缩小“逻辑对齐缺口”,提升生成的可证正确性与事实/推理一致性。
- Many-Shot CoT-ICL: Making In-Context Learning Truly Learn
- 赛道归属: 提示学习 / In-Context Learning(长上下文Many-shot CoT推理)
- 核心创新点: 系统研究many-shot链式思维ICL在推理任务上的缩放规律,指出将非推理任务的many-shot经验法则直接迁移会失效;围绕“示例数量、示例组织方式、CoT展示形式与任务泛化”的相互作用给出新的可操作策略,使长上下文下的ICL不仅是“检索相似示例”,而更像在提示内进行可学习的推理程序归纳,从而在无需参数更新的情况下稳定提升推理性能并逼近微调效果。
- An Agentic AI Framework with Large Language Models and Chain-of-Thought for UAV-Assisted Logistics Scheduling with Mobile Edge Computing
- 赛道归属: LLM智能体 / 工业调度优化(UAV物流 + 边缘计算MEC的联合调度)
- 核心创新点: 构建面向UAV辅助云制造的Agentic AI框架,将LLM的Chain-of-Thought用于把“物理物流路径/取送决策”与“计算任务卸载/边缘执行/资源分配”耦合建模与分步求解;通过智能体式规划-执行流程,把复杂混合调度问题分解为可解释的决策链,并在动态环境约束(站点任务到达、UAV算力/电量、时延约束等)下实现联合优化,相比传统启发式/单域优化更易扩展到多约束、多目标的实际工业场景。
- U-STS-LLM A Unified Spatio-Temporal Steered Large Language Model for Traffic Prediction and Imputation
- 赛道归属: 时空序列建模与预测(通信/网络流量预测与缺失值插补的LLM化)
- 核心创新点: 提出统一的时空“预测+插补”框架,将原本分离的两类任务在同一模型内联合建模;通过“时空引导/steering”的LLM结构,把交通/流量数据的空间关联与时间动态以可控方式注入语言模型,实现对未来负载预测与缺失数据修复的共享表示与协同优化,从而减少任务割裂带来的误差传播并提升跨场景泛化。
- Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning
- 赛道归属: 推理与规划分析(CoT可解释性/行为刻画)
- 核心创新点: 提出从LLM推理轨迹中“抽取搜索树”的方法学,用结构化量化替代仅看最终答案/文本:在四子棋环境中将CoT中的分支、回溯与前瞻显式拟合为搜索树并度量其深度、分支因子与局部性,从而揭示推理模型存在“短视规划”等行为特征,并将性能与搜索结构属性建立可检验关联。
- One Prompt, Many Sounds: Modeling Listener Variability in LLM-Based Equalization
- 赛道归属: 音频生成/音频控制(文本到均衡器EQ参数的LLM交互式音频调音)
- 核心创新点: 将“自然语言提示→EQ设置”建模为LLM驱动的可对话控制问题,并显式建模听众差异:利用受控听音实验数据,让模型在ICL与个性化建模的结合下,同一提示可输出符合不同听众偏好的多样化均衡曲线;方法突破在于把主观偏好分布作为学习目标的一部分,而非学习单一“平均”EQ映射。
- LLM-EDT: Large Language Model Enhanced Cross-domain Sequential Recommendation with Dual-phase Training 🆕NEW
- 赛道归属: 推荐系统(跨域序列推荐/LLM增强表示学习与训练策略)
- 核心创新点: 提出LLM-EDT的双阶段训练范式,将LLM的语义/知识能力引入跨域序列推荐以同时缓解“域交互不平衡”(主域行为淹没次域特征)与“跨域迁移/转移建模困难”(用户跨域兴趣演化难捕捉)两类核心痛点;通过分阶段目标与训练调度,在域内表征与跨域对齐/迁移之间解耦优化,从而更稳定地学习域特定特征并提升跨域序列预测效果。
- Prospective multi-pathogen disease forecasting using autonomous LLM-guided tree search 🆕NEW
- 赛道归属: 科学智能与自动化建模(LLM代理/树搜索/可执行代码生成的疾病预测)
- 核心创新点: 构建自治式LLM引导树搜索系统,将“生成—评估—优化”的闭环搜索用于自动合成可执行的传染病预测软件;以树搜索在候选建模方案空间中迭代扩展与选择,通过自动评测信号驱动模型结构、特征与超参的程序级改写,减少对专家手工建模策划的依赖,并支持多病原体、细粒度地域与新发病原体的可扩展前瞻性概率预测。
GitHub
- [2026-05-19] sgl-project/sglang ⭐27980
- [2026-05-19] NVIDIA/TensorRT-LLM ⭐13671
- [2026-05-18] UKGovernmentBEIS/inspect_ai ⭐2076
- [2026-05-18] flagos-ai/FlagGems ⭐997
- [2026-05-18] chrisliu298/awesome-on-policy-distillation ⭐112 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-05-01] angrygiraffe/claude-opus-4.6-4.7-reasoning-8.7k
Background
Ended up with some tokens to burn on a Claude Max plan. Assembly began during 4.6 and moved to 4.7. Model is tagged. The develop...
多模态大模型
arXiv
- A Cross-Modal Prompt Injection Attack against Large Vision-Language Models with Image-Only Perturbation 🆕NEW
- 赛道归属: 多模态安全(LVLM 对抗攻击 / Prompt Injection)
- 核心创新点: 提出一种“跨模态”提示注入攻击范式:仅对图像输入施加微小扰动,即可在不改动文本提示的情况下,把攻击指令注入并迁移到模型对另一模态(文本/指令)的解释与执行中,从而突破以往“单模态注入只影响该模态”或“多模态但无法实现跨模态扰动”的限制;方法层面强调通过优化图像扰动来实现对模型跨模态对齐/融合表征的定向操控,使模型在后续语言生成阶段遵循攻击者意图。
- GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
- 赛道归属: 多模态模型推理优化 / 视觉Token剪枝与模型压缩
- 核心创新点: 将VLM视觉token剪枝从常见的连续梯度松弛视角,转向更贴合本质的离散组合优化建模;提出“组相对重要性”的剪枝框架,通过在组内/组间进行相对重要性比较来稳定地选择保留token,缓解连续近似在激进压缩下易陷入次优局部最小的问题,从而在显著降低视觉token计算开销的同时尽量保持多模态性能。
- PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models
- 赛道归属: 多模态安全与隐私 / 机器遗忘(VLM个性化部分遗忘评测)
- 核心创新点: 提出PPU-Bench,一个面向真实世界“个性化部分遗忘”的VLM基准:不依赖合成知识注入、也不做整类/整主体删除,而是覆盖更贴近用户请求的细粒度跨模态事实删除需求;同时强调fine-tuning-free的评测设定,用统一任务与数据规模(约24K多模态样本)系统衡量模型对敏感记忆的可控删除能力与残留风险。
- MAgSeg: Segmentation of Agricultural Landscapes in High-Resolution Satellite Imagery using Multimodal Large Language Models 🆕NEW
- 赛道归属: 遥感视觉理解(高分卫星图像语义分割 / MLLM 分割)
- 核心创新点: 提出 MAgSeg:一种面向高分辨率农业景观的、decoder-free 的 MLLM 分割框架,针对两大痛点做方法突破——(1) 通过设计更高效的多模态表示/交互方式缓解长上下文瓶颈,使大幅面高分影像的分割不再强依赖超长 token 序列;(2) 通过面向遥感域特征的对齐策略缩小“通用 MLLM—卫星影像”域差,提升对地物纹理、尺度变化与碎片化地块的理解与分割鲁棒性,尤其适配标注稀缺场景。
- VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation 🆕NEW
- 赛道归属: 视频多模态理解(实例级时空定位 / Agentic 工具调用)
- 核心创新点: 提出 VideoSeeker:将视频理解从“纯文本提示交互”推进到“原生代理式工具调用”的框架,用可调用的视觉工具/操作来提供精确的空间与时间指代,从而激励并实现实例级时空理解与定位;方法上把视觉感知与语言推理更紧密地闭环耦合(而非松散解耦),让模型在推理过程中主动发起检索、定位、跟踪等工具调用,以获得可验证的中间证据并提升细粒度定位与交互体验。
- ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models 🆕NEW
- 赛道归属: 多模态模型安全与隐私(机器遗忘 / Unlearning)
- 核心创新点: 提出 ASRU,将激活引导与强化学习式遗忘结合,构建可控的多模态遗忘框架:不仅追求“遗忘后输出偏离”这一传统指标,还显式把生成质量/可用性纳入优化,缓解遗忘后常见的幻觉、僵硬或过度拒答;方法层面通过在表征/激活层面对敏感跨模态记忆进行定向抑制与行为层面的 RL 目标协同,实现更稳定的遗忘-保真权衡与可控性。
- DistractMIA: Black-Box Membership Inference on Vision-Language Models via Semantic Distraction
- 赛道归属: 多模态安全与隐私 / VLM成员推断攻击(黑盒审计)
- 核心创新点: 面向仅能观察文本输出的部署型VLM黑盒场景,提出基于“语义干扰”的成员推断方法:通过构造会诱导模型在语义层面产生分心/偏移的查询与对照,放大训练集成员样本与非成员样本在生成响应上的可分性;规避对logits/概率等不可得信号的依赖,相比依赖掩码预测等任务的既有方法,更适配真实API审计条件并提升攻击有效性。
- Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
- 赛道归属: 多模态推理(视觉潜变量/latent reasoning 对齐与训练范式)
- 核心创新点: 提出GAP以稳定提升视觉潜变量推理:指出现有“output-as-input”视觉latent范式不稳定的关键原因在于特征空间不匹配——常见做法在pre-norm MLLM中直接复用decoder隐藏态作为下一步latent输入,导致预测latent与期望视觉特征分布错位;GAP通过更细粒度的对齐机制/训练约束来缓解该mismatch,从而让连续视觉证据token的生成与消费更一致、收益更稳定。
- 20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone
- 赛道归属: 视觉语言预训练 / 数据工程(仅数据策划提升VLM)
- 核心创新点: 系统验证“只靠数据策划即可显著提升VLM”的上限:在架构、训练配方与算力固定的前提下,仅改变训练数据,通过一套数据筛选/清洗/重配比的策划流水线作用于MAmmoTH-VL单图子集,在20个公开VLM基准(覆盖grounding、VQA等)上平均提升+11.7pp;方法论贡献在于把性能增益明确归因到数据分布与质量控制,并给出可复用的数据策划处方来移动质量-算力前沿。
- SoccerLens: Grounded Soccer Video Understanding Beyond Accuracy
- 赛道归属: 视频多模态理解评测(体育视频理解 + 可解释/可落地grounding)
- 核心创新点: 提出SoccerLens评测框架,将足球视频理解从“只看分类准确率”推进到“是否基于真实视觉证据”的检验:针对视角变化大、镜头切换快、场景拥挤等足球视频特性,新增/强化视觉grounding与证据一致性评估,旨在识别VLM是否依赖伪相关与捷径学习;核心突破在于把“超越准确率”的可视化证据对齐与鲁棒性诊断纳入标准化基准。
GitHub
- [2026-05-16] Blaizzy/mlx-vlm ⭐4741
- [2026-05-17] waybarrios/vllm-mlx ⭐1196
- [2026-05-16] zli12321/Vision-Language-Models-Overview ⭐589
- [2026-05-18] mala-lab/Awesome-Anomaly-Detection-Foundation-Models ⭐189 🆕NEW
- [2026-05-15] ocy1/TRIO ⭐108
强化学习
arXiv
- MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning
- 赛道归属: 自动驾驶强化学习(多模态感知-控制融合、可解释决策)
- 核心创新点: 提出以“3D可供性”作为感知与控制之间的中间表征,用多模态Transformer从RGB等输入预测结构化、可解释的3D可供性,再由强化学习在该表征空间上进行策略学习;相较端到端直接回归动作,减少感知-控制脆弱接口带来的误差传播,同时提升在城市密集交互场景下的鲁棒性与可解释性。
- GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero 🆕NEW
- 赛道归属: 大语言模型后训练、开放式环境泛化强化学习
- 核心创新点: 提出GRLO,面向“从零开始”的开放式环境RL后训练,目标是在无特定领域人类偏好数据的前提下获得可迁移、可泛化的策略更新范式;方法上强调在开放式任务分布中构建更通用的奖励/验证驱动训练流程,以缓解RLHF对目标域偏好信号的依赖,并提升跨环境的泛化能力。
- How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment
- 赛道归属: 大模型对齐与推理优化(RL后训练、KV Cache压缩/显存优化)
- 核心创新点: 提出“Shadow Mask Distillation”用于RL在线rollout阶段的KV cache压缩:通过蒸馏得到可学习的掩码/稀疏策略,在尽量不破坏对齐与长上下文推理质量的前提下,显著降低轨迹生成时KV缓存的显存占用,从而缓解长上下文RL后训练的“memory wall”,提升可扩展性与吞吐。
- A Unified Pair-GRPO Family: From Implicit to Explicit Preference Constraints for Stable and General RL Alignment
- 赛道归属: 大语言模型对齐 / 偏好强化学习优化
- 核心创新点: 提出一个以 Pair-GRPO 为核心的统一偏好优化理论框架,将主流成对偏好学习中“隐式约束”的做法系统化为一族方法,并给出两种紧耦合变体:Soft-Pair-GRPO(以软方式施加偏好约束)与 Hard-Pair-GRPO(以显式/硬约束形式刻画偏好约束)。该框架旨在从方法层面同时缓解 RLHF 中常见的策略更新不稳定、梯度方向不明确、可解释性差与梯度方差高等问题:通过把偏好信号转化为可控、可解释的约束形式,统一了从隐式到显式约束的优化路径,从而提升训练稳定性与泛化对齐效果。
- Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking 🆕NEW
- 赛道归属: 具身智能强化学习加速、训练效率优化
- 核心创新点: 发现GRPO式VLA强化学习的主要瓶颈在反向传播梯度计算而非rollout采集,并提出“概率分块掩码”:在序列/轨迹层面学习或采样应重点更新的片段,聚焦“结果开始分歧”的关键区间以减少无效梯度计算;在尽量保持策略改进信号的同时显著降低每步训练开销,实现更高效的VLA后训练。
- Offline Reinforcement Learning with Universal Horizon Models 🆕NEW
- 赛道归属: 离线强化学习、模型式强化学习(世界模型/长期预测)
- 核心创新点: 提出通用地平线模型,用于在离线RL中进行基于想象轨迹的价值学习,同时缓解传统模型滚动预测带来的误差累积;相较GHM对“折扣无限期未来”的直接预测仍难刻画远期状态的问题,UHM通过更通用的地平线建模机制提升对远期未来的可预测性与稳定性,从而提高离线场景下的价值估计与策略学习质量。
- AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs 🆕NEW
- 赛道归属: 强化学习系统与工程(Agentic LLM训练系统)、分布式/弹性计算调度
- 核心创新点: 提出AstraFlow,以“数据流”为中心抽象来组织Agentic LLM的RL训练,将多策略协同训练、复杂工具调用/交互式rollout、以及异构/跨地域弹性算力的编排统一到可组合的数据流执行模型中;核心突破在于用通用的数据流化接口降低系统扩展成本,使新增训练范式/组件不再需要大量定制系统工程,同时提升资源利用率与可扩展性。
- Residual Reinforcement Learning for Robot Teleoperation under Stochastic Delays 🆕NEW
- 赛道归属: 机器人遥操作强化学习、时延鲁棒控制
- 核心创新点: 针对随机通信时延导致的观测不对齐与控制抖振(高频chattering),提出“时延鲁棒残差RL”混合框架:用LSTM状态估计器对延迟/缺失的观测进行时序重建与滤波,再由残差RL在基线控制器之上学习补偿项;通过“估计+残差”的结构化分解提升在随机时延下的稳定性与性能,相比直接RL更能抑制抖振并增强可控性。
- Self-Supervised On-Policy Reinforcement Learning via Contrastive Proximal Policy Optimisation
- 赛道归属: 自监督强化学习(对比学习 + On-policy策略优化,离散/连续动作通用)
- 核心创新点: 将对比式强化学习的表征学习目标与PPO式on-policy优化深度耦合,提出“Contrastive Proximal Policy Optimisation”框架:在不依赖手工奖励的前提下,通过对比目标学习目标条件价值/表征,同时用近端策略更新保证on-policy训练稳定性与样本效率;突破既有CRL几乎都依赖off-policy且偏连续动作的限制,使其更贴近主流on-policy算法并可扩展到离散环境。
- HLS-Seek: QoR-Aware Code Generation for High-Level Synthesis via Proxy Comparative Reward Reinforcement Learning
- 赛道归属: 强化学习用于代码生成/编译优化(面向高层综合HLS的QoR优化)
- 核心创新点: 提出“代理比较奖励”的RL范式:不依赖昂贵且噪声大的绝对综合QoR数值,而以候选pragma/代码变体之间的相对优劣比较作为奖励信号来驱动策略学习,从而显著降低综合评估成本并更直接对齐QoR(时延/资源)目标;将LLM生成与QoR感知的RL闭环结合,使训练目标从“功能正确”扩展到“可综合且高QoR”的可控搜索与生成。
GitHub
- [2026-05-18] OpenPipe/ART ⭐9471 🆕NEW
- [2026-05-18] PufferAI/PufferLib ⭐5694
- [2026-05-18] rllm-org/rllm ⭐5537
- [2026-05-18] pytorch/rl ⭐3431
- [2026-05-19] radixark/miles ⭐1352
HuggingFace Datasets
- [2026-05-14] PsiBotAI/SynData
SynData
中文说明
Demo
If the video cannot be displayed in your environment, open it directly: assets/syndata-demo.mp4
...
- [2026-05-13] TuringEnterprises/Open-MM-RL
Dataset Summary
Open-MM-RL is a multimodal STEM reasoning dataset covering Physics, Mathematics, Biology, and Chemistry. It is designed for...
- [2026-05-14] AlienKevin/SWE-ZERO-12M-trajectories
SWE-ZERO 12M Trajectories
The largest agentic-coding trace dataset to date: 112 B tokens of execution-free agentic trajectories covering 12...
- [2026-05-03] ADSKAILab/Zero-To-CAD-1m
Zero-to-CAD 1M
One million executable, interpretable CAD construction sequences synthesized entirely without real-world data.
...
- [2026-05-08] Qwen/WebWorldData
WebWorldData 🌐 Overview
WebWorldData is a large-scale dataset of 1.06M web interaction trajectories collect...
世界动作模型
arXiv
- WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation 🆕NEW
- 赛道归属: 视觉-语言导航 / 世界动作模型 / 自回归策略建模
- 核心创新点: 提出面向航拍VLN的首个自回归世界动作模型,将任务从“直接学策略”重构为“预测驱动的世界-动作联合建模”:在闭环导航中显式预测潜在世界状态的演化及动作后果,并以自回归方式逐步生成后续决策,从而避免依赖全序列视频生成式世界模型的高成本与冗余建模,强化对长时序指令跟随与环境动态的可控推演能力。
- World Action Models: The Next Frontier in Embodied AI
- 赛道归属: 具身智能 / 视觉-语言-动作+ 世界模型融合的策略学习(World Action Model范式)
- 核心创新点: 中文:提出并系统化“世界动作模型”这一新范式:将环境动力学的显式预测(世界模型)纳入动作生成/策略学习管线,突破传统VLA仅做“观测→动作”的反应式映射,转向“可干预的未来演化建模 + 基于预测的动作决策”的统一框架,从而为具身基础模型提供更强的可规划性、可推演性与对物理演化的建模能力。
- Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models
- 赛道归属: 世界模型评测与可靠性诊断(World Action Model / 动态一致性评估)
- 核心创新点: 提出并系统化“动作-状态一致性”作为世界动作模型可靠性的关键评估维度,用于区分“视觉上合理的未来”与“在动力学上与给定动作序列相容的未来”。该工作从诊断角度构建评测/分析框架,专门检验模型预测的状态转移是否真正由其声称的动作所诱发,从而补齐以往主要关注感知逼真度但忽略控制可用性的评估缺口。
- When to Trust Imagination: Adaptive Action Execution for World Action Models
- 赛道归属: 机器人操控(World Action Model / 视觉-动作联合预测)与闭环控制策略(自适应动作执行)
- 核心创新点: 将WAM的“固定步长开环执行”问题重构为未来-现实一致性验证:在执行过程中持续对比模型想象的未来观测与真实环境rollout的一致性,并据此自适应决定每次推理后应连续执行的动作步数(何时继续信任想象、何时提前中止并重新推理)。该方法在不改变WAM本体预测机制的前提下,引入面向执行阶段的验证与决策模块,实现从开环到更稳健的闭环执行,降低因预测漂移导致的失配与失败风险。
- The DAWN of World-Action Interactive Models
- 赛道归属: 自动驾驶 / 世界模型驱动的交互式规划与动作生成
- 核心创新点: 中文:提出“世界-动作交互模型”以刻画世界预测与动作选择的互依关系,指出现有WAM常见的并行分支或“先预测再规划”的刚性流水线难以体现“动作影响场景演化、场景演化反过来约束动作”的闭环耦合;并在自动驾驶中实例化为DAWN,通过在生成过程中联合/交替地对动作与世界演化进行一致性建模(以去噪式生成视角实现动作与未来场景的协同推断),实现更符合交互逻辑的场景-动作联合生成与规划。
GitHub
- [2026-05-18] DravenALG/awesome-vla-wam ⭐433
- [2026-05-15] OpenMOSS/Awesome-WAM ⭐350
由 Research Daily 自动生成 生成时间: 2026-05-19 01:02:10