AI 每日进展速报 - 2026-05-15
图像生成/编辑
arXiv
- Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards
- 赛道归属: 文生图(偏好对齐/后训练强化学习)
- 核心创新点: 提出 SOLACE 后训练框架,用“模型内生自信度”替代外部奖励模型/人工偏好监督:将模型自身生成结果重新加噪,并以其对注入噪声的恢复准确性作为自信度奖励信号,从而在不依赖额外标注或奖励网络的情况下进行偏好对齐式优化,提升生成的可靠性与审美一致性。
- Skill-Aligned Annotation for Reliable Evaluation in Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图评测 / 人类标注与评估协议设计
- 核心创新点: 提出“技能对齐标注”评测范式:不再用统一的Likert/BQA覆盖所有评测维度,而是先将T2I评测拆解为异质“技能”(如语义一致性、属性绑定、空间关系、文本可读性、审美/真实感等),再为不同技能匹配更合适的标注接口、问题形式与聚合方式,从而降低标注噪声与维度混淆;强调在模型差距缩小时,通过对齐技能本质来提升评测的可靠性、可复现性与区分度。
- EPIC: Efficient Predicate-Guided Inference-Time Control for Compositional Text-to-Image Generation
- 赛道归属: 文生图(推理时可控生成/组合式生成)
- 核心创新点: 提出 EPIC 的训练无关推理时控制:将复杂提示词一次性解析为包含对象变量与类型化谓词(数量、属性、关系等)的“视觉程序”,并把生成改写为谓词引导的搜索/精炼过程,在不改动模型参数的前提下,通过对违反谓词的部分进行定向修正来提升组合一致性与可控性,同时强调推理效率。
- SPOT: Selective Prompt Projection via Total Variation for Inference-Only Safe Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图安全对齐 / 推理期安全控制
- 核心创新点: 提出SPOT:在冻结扩散生成器的前提下,仅在推理期对文本提示进行“选择性投影”以抑制不安全生成,同时尽量保持对良性提示的行为不变;用总变差距离将“相对原始提示条件分布的偏移”与“风险期望变化”建立可控上界关系,把安全约束转化为对提示投影强度/选择策略的可优化目标,实现无需再训练的安全-保真折中控制。
- Drag within Prior Distribution: Text-Conditioned Point-Based Image Editing within Distribution Constraints 🆕NEW
- 赛道归属: 图像编辑 / 扩散模型点控编辑
- 核心创新点: 提出“分布内约束”的文本条件点编辑框架:针对传统handle/target点对带来的轨迹歧义与远距离拖拽导致的非必要改动,引入“保持在先验分布内”的约束思想,在编辑优化过程中显式限制生成状态偏离模型先验流形;同时用文本条件辅助消歧与稳定语义,使点级位移更可控、对无关区域扰动更小,并提升大位移/复杂场景下的编辑一致性。
- Does Engram Do Memory Retrieval in Autoregressive Image Generation? 🆕NEW
- 赛道归属: 自回归图像生成 / 记忆增强Transformer机理分析
- 核心创新点: 将Engram(哈希键控、O(1)联想记忆)模块适配到视觉AR生成(2D空间n-gram哈希),并围绕“是否真的在做记忆检索”这一解释进行机制层面的实证检验;通过对比与探针分析区分性能增益来源(内容寻址检索 vs. 其他正则化/表示效应),从而澄清记忆模块在AR图像生成中的作用边界与适用条件,为后续设计更有效的视觉记忆结构提供依据。
- Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation 🆕NEW
- 赛道归属: 多模态理解 / 指代表达分割与编辑模型语义指向能力挖掘
- 核心创新点: 发现并系统验证指令式图像编辑模型在编辑前期就形成语言条件的语义指向信号;提出利用“早期语义落地”将编辑模型转化为零样本RIS:从模型早期层/早期扩散阶段提取与指代表达对齐的空间响应,并映射为像素级掩码,避免依赖专门分割训练数据;核心突破在于把“编辑所需的隐式定位能力”显式化为可用的分割输出。
- Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling 🆕NEW
- 赛道归属: 图像编辑评测基准 / 奖励模型评测
- 核心创新点: 提出统一基准Edit-Compass与EditReward-Compass:面向前沿编辑模型,设计更高难度、更贴近人类偏好的任务集合与细粒度评测协议,缓解现有基准“题目过易+打分粗糙”导致的饱和与失真;同时将“编辑质量评测”与“用于RL优化的奖励模型评测”打通,在同一任务空间中评估reward对人类判断的一致性与可泛化性,推动可用、可对比的编辑RL闭环。
- Inline Critic Steers Image Editing 🆕NEW
- 赛道归属: 图像编辑 / 推理期引导与自我纠错
- 核心创新点: 提出Inline Critic:在不等待整张图生成或完整去噪步结束的情况下,把“批评/纠错信号”注入到一次前向过程内部,实现更早、更局部的难点区域分配式修正;通过探测冻结编辑模型,发现早期表征已包含可用于判断编辑偏差的信号,据此训练/构建可内联工作的critic,在生成进行中对中间状态施加引导,从而提升复杂指令与局部区域编辑的稳定性与成功率。
- MULTI: Disentangling Camera Lens, Sensor, View, and Domain for Novel Image Generation
- 赛道归属: 文生图(可控生成/成像因素解耦)
- 核心创新点: 将控制维度从“内容”扩展到“成像链路”,提出对镜头、传感器、视角与场景域等成像因素的解耦建模与组合生成任务:通过显式分离并可组合这些因素,减少文本歧义带来的控制不确定性,实现更精细的风格/设备/视角级别可控的新图像生成。
GitHub
- [2026-05-15] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐11984
- [2026-05-14] Light-Heart-Labs/DreamServer ⭐522
- [2026-05-14] vibheksoni/free-ai ⭐441
- [2026-05-15] etkecc/baibot ⭐225
- [2026-05-14] ferranpons/Llamatik ⭐120 🆕NEW
HuggingFace Models
视频生成/编辑
arXiv
- Pyramid Forcing: Head-Aware Pyramid KV Cache Policy for High-Quality Long Video Generation 🆕NEW
- 赛道归属: 长视频生成(自回归视频生成 / KV Cache与注意力记忆策略优化)
- 核心创新点: 该工作针对自回归长视频生成中“误差累积导致长期退化”的关键瓶颈,提出Head-Aware 的金字塔式 KV Cache 保留策略:不再对所有注意力头采用统一的历史帧保留,而是基于对“历史帧注意力模式”的实证分析,将注意力头划分为Anchor(需要广域长程上下文)、Wave(周期性时序依赖)等不同类型,并据此为不同头分配差异化的历史信息保留/压缩方案(呈金字塔式的时间尺度覆盖)。核心突破在于把“长程记忆管理”从全局统一策略提升为按头建模的结构化策略,在不牺牲流式生成特性的前提下,更有效抑制长视频的质量漂移与语义/运动一致性退化。
- CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation 🆕NEW
- 赛道归属: 可控视频生成(相机运动/镜头控制条件的视频生成 / 位置编码与几何表征)
- 核心创新点: 该工作面向“相机条件视频生成”中位置编码在不同镜头模型下失效的问题,提出Curved Ray Expectation Positional Encoding,以适配统一相机模型下的广角/鱼眼等非针孔成像。相较于仅注入光线方向或依赖针孔几何的编码方式,CRePE通过曲线光线期望来构造更稳健的注意力级位置编码,使模型在相机运动、镜头参数变化以及场景结构变化时仍能获得一致、可泛化的相机几何信号。核心突破在于将相机控制信号从“针孔假设下的显式几何”扩展为“统一相机模型下可微、可泛化的曲线光线统计表征”,从而实现更通用的相机可控视频生成。
- OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation
- 赛道归属: 音视频联合生成(多模态生成)
- 核心创新点: 提出面向“联合音频-视频生成”的模态分治式强化学习框架,将扩散生成中的优化目标拆解为“单模态保真度 + 跨模态对齐 + 细粒度时序同步”等多目标,并通过针对多模态/多目标RL训练不稳定性的机制化处理(如优势信号冲突与尺度不一致等问题的分析与改造)实现可训练、可控的联合优化,从而在不牺牲单模态质量的前提下提升音画一致性与同步精度。
- OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation
- 赛道归属: 视频生成(跨具身/跨形体动作迁移,Embodiment-aware Generation)
- 核心创新点: 提出流式的跨具身视频生成框架,将“可迁移的运动动力学”与“具身特定的外观/形态”进行解耦建模,并通过无需成对数据的适配机制把模型快速迁移到新的人形载体(如人→机器人、机器人→机器人)。方法层面强调在生成过程中持续接收运动条件并稳定输出视频序列,同时用无配对适配降低对每个目标具身的标注/配对采集成本,提升可扩展性。
- SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation
- 赛道归属: 视频生成 / 可控多人物交互(训练免控制)
- 核心创新点: 提出训练免的多人物社交交互控制方法,将“谁在何时对谁做什么”的交互结构显式注入生成过程,解决多人物生成中常见的角色错配与动作归因错误;通过对交互关系与时序的可控编排,实现对对话、手势、协同行为等社会互动的细粒度导演式控制,而无需重新训练基础视频模型。
- SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation
- 赛道归属: 推理优化 / 流式长视频生成的自适应记忆管理
- 核心创新点: 提出SWIFT的“提示词自适应记忆”:针对交互式长视频中频繁语义切换,设计能随prompt更新而重组/选择性保留的记忆机制,避免在提示边界反复重建缓存或受限于固定记忆预算造成的冗余计算与适配迟滞;在保持视觉连续性的同时提升语义切换响应效率。
- EduStory: A Unified Framework for Pedagogically-Consistent Multi-Shot STEM Instructional Video Generation
- 赛道归属: 视频生成 / 多镜头脚本化生成(教育内容一致性)
- 核心创新点: 提出面向STEM教学的多镜头生成统一框架:引入“教学状态建模”跟踪跨镜头的持久知识与概念依赖,并用脚本引导的结构化控制组织叙事与镜头编排,解决长视频中知识一致性、讲解连贯性与多镜头衔接问题;将“内容正确性/教学一致性”作为生成过程的核心约束而非事后筛选。
- CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models
- 赛道归属: 多模态推理 / 结合视频生成的协同推理框架
- 核心创新点: 提出VLM+视频生成模型的协同推理:用VLM承担显式规划、校验与纠错,将VGM生成的短时“Chain-of-Frames”作为可视化推理草稿;通过迭代式的生成—评估—修正闭环,缓解长任务的时序漂移与中段模拟错误累积,把视频生成从单纯输出器提升为可被语言推理约束与修正的“可视化思维工具”。
- Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
- 赛道归属: 人物中心音视频生成(Audio-Video Generation,多模态联合生成:动作-语音-音效)
- 核心创新点: 提出统一框架在生成阶段显式约束“动作-语音-环境音效”三模态的时序一致性与语义协同,针对三者异质时间尺度与对齐难题,通过跨模态协同建模/对齐机制减少常见的口型-语音、动作-音效错配,实现更连贯的人物中心音视频联合生成。
- From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation
- 赛道归属: 视频生成(动作条件/机器人手术视频生成,Controllable Video Generation)
- 核心创新点: 提出“运动学到视觉”的提升范式,把低维的关节/器械运动学控制量转换为五种统一的、图像对齐的控制模态,从而把难以直接驱动像素演化的控制信号变成可被生成模型有效利用的视觉条件;在此基础上设计分层路由的视觉控制机制,按层/按区域选择性注入不同控制模态,实现对手术场景中复杂、局部且时序敏感的变化进行更精细的动作约束与可控生成。
GitHub
- [2026-05-15] hao-ai-lab/FastVideo ⭐3477
- [2026-05-14] ModelTC/LightX2V ⭐2262
- [2026-05-14] ZeroLu/awesome-seedance ⭐1733
- [2026-05-14] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1018
- [2026-05-14] OpenLoaf/OpenLoaf ⭐58
HuggingFace Models
音频生成
arXiv
- Adapting a Text-to-Audio Model for Room Impulse Response Generation
- 赛道归属: 音频生成 / 声学建模(RIR 房间脉冲响应生成)
- 核心创新点: 将预训练的文生音频大模型作为“生成先验”迁移到RIR这一强物理约束、数据稀缺的声学对象上,通过适配策略把通用音频生成能力对齐到RIR的时域结构与混响特征分布,实现无需从零训练即可生成高质量RIR;关键突破在于证明大规模生成式音频先验可有效覆盖并可控地生成RIR这类非语音/非音乐的声学响应信号,从而缓解真实RIR采集成本高与训练数据不足的问题。
- TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling 🆕NEW
- 赛道归属: 音频-文本数据集构建 / 音频语言模型指令微调
- 核心创新点: 提出面向区域方言与韵律(台湾语境)的高质量音频-文本指令数据集构建范式:通过 Verify-Generate-Critique流程先“验证再扩增”,用双ASR交叉校验对52.2万原始音频进行一致性过滤以提升转写可靠性,再借助教师模型生成并批判式筛选,扩展为58万高保真指令对;该“验证引导的数据策展”显著降低方言场景的噪声标注与语音-文本错配,为后续Tai-LALM等区域化音频语言建模提供可复用的数据生产管线。
- The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models
- 赛道归属: 多模态理解(音频-语言)/ 空间音频理解
- 核心创新点: 将“空间音频-语言理解”从零散问题提升为统一的任务接口,提出音频场景分析的三层级形式化:从原子级感知(事件与方位/距离等空间属性)到对象级绑定(语义与空间属性的归属一致性、多对象分离与排列),再到场景级物理一致性判断(答案是否符合空间声学常识)。核心突破在于把“听到什么”扩展为“在哪里、谁对应谁、整体是否合理”的可评测框架,为大音频语言模型引入可系统训练/评估的空间推理目标。
- Aliasing-Free Neural Audio Synthesis 🆕NEW
- 赛道归属: 神经音频合成 / 声码器与神经编解码器(抗混叠高保真生成)
- 核心创新点: 针对神经声码器/编解码器在音乐与歌声高频段常见的混叠失真,系统性指出其主要来源于非线性激活与上采样结构引入的频谱折叠,并提出“从架构层面消除混叠”的神经合成方案:通过在非线性与上采样路径中引入可控带宽/抗混叠约束(而非仅靠后处理滤波),在生成过程中抑制不可逆的折叠伪影,从而提升高频细节、瞬态与谐波结构的保真度,面向高保真音乐/歌声合成更稳健。
- Kinetic-Optimal Scheduling with Moment Correction for Metric-Induced Discrete Flow Matching in Zero-Shot Text-to-Speech
- 赛道归属: 语音生成(零样本文本转语音)/ 离散流匹配推理优化(MI-DFM 调度与校正)
- 核心创新点: 针对MI-DFM在离散生成中的两大瓶颈提出成体系的推理改进:其一,从概率路径的标量参数化出发推导“动力学最优”调度器,给出无需训练、免超参搜索的数值调度方案以替代经验式scheduler;其二,针对一阶CTMC求解带来的有限步路径跟踪误差,引入矩校正以在有限步数下更准确匹配目标路径分布。方法论突破在于把“怎么排步长/怎么减误差”从启发式工程变为可推导的最优调度与可控校正,从而提升零样本TTS的稳定性与质量/效率权衡。
- [2026-05-07] LiVeAction: a Lightweight, Versatile, and Asymmetric Neural Codec Design for Real-time Operation
- 赛道归属: 神经编解码 / 端侧实时压缩与机器感知友好编码
- 核心创新点: 提出轻量、通用且非对称的神经编解码设计:以更强的解码端能力换取编码端低算力/低功耗,面向实时与带宽受限设备;同时强调对“机器感知任务与非传统模态”(如空间音频阵列等)的适配,而非仅优化人类感知指标,从体系结构上兼顾码率-质量-端侧可部署性。
- [2026-05-07] BitCal-TTS: Bit-Calibrated Test-Time Scaling for Quantized Reasoning Models
- 赛道归属: 推理优化 / 量化推理模型校准
- 核心创新点: 针对后训练量化导致的置信度/停止信号失真,提出“比特校准”的测试时缩放方法:在固定生成token预算下,校准量化模型的在线不确定性与早停/算力分配控制信号,缓解“看似合理但推理未收敛”的过早停止问题,使自适应推理深度在量化条件下更稳定可靠。
- OLaPh: Optimal Language Phonemizer
- 赛道归属: 语音合成前端 / 文本到音素
- 核心创新点: 提出混合式音素化框架:融合大规模多语种词典与现代NLP建模,并引入统计子词切分来处理OOV与跨语言形态变化;通过“词典强约束 + 神经/统计泛化”的组合,在覆盖率与泛化能力之间取得更优折中,提升多语种音素化鲁棒性。
- Text2Score: Generating Sheet Music From Textual Prompts 🆕NEW
- 赛道归属: 文本到符号音乐生成 / 乐谱生成
- 核心创新点: 提出面向“文本→五线谱”而非仅MIDI的两阶段生成框架Text2Score:先在规划阶段从自然语言提示中生成结构化的音乐蓝图(如段落/节奏/动机等可执行约束),再在执行阶段将计划落地为可渲染的乐谱表示;同时通过“直接从乐谱/排版与符号结构中提取监督信号”的方式构建训练对齐,减少对不可靠自动字幕/描述管线的依赖,从数据稀缺场景下提升文本-乐谱对齐与可控生成能力。
- SF-Flow: Sound field magnitude estimation via flow matching guided by sparse measurements
- 赛道归属: 空间音频重建 / 声场估计(稀疏测量引导的生成式建模)
- 核心创新点: 将Flow Matching引入3D声场重建这一典型病态逆问题,聚焦于声学传递函数幅度的生成式估计,并通过“稀疏麦克风测量引导”把条件约束注入流匹配过程,实现从少量观测到完整声场幅度分布的重建。核心突破在于把原本用于语音/音乐生成的FM范式改造成可处理空间声学条件约束的生成式求解器,用生成先验补足欠定测量带来的信息缺失,从而提升声场/房间特性恢复的可行性与精度。
GitHub
- [2026-05-15] huggingface/diffusers ⭐33617
- [2026-05-14] SamurAIGPT/Generative-Media-Skills ⭐3232
- [2026-05-15] Ameobea/web-synth ⭐554
- [2026-05-14] apocas/restai ⭐504
- [2026-05-13] Blaizzy/mlx-video ⭐223
HuggingFace Models
HuggingFace Spaces
语言大模型
arXiv
- Large Language Models for Sequential Decision-Making: Improving In-Context Learning via Supervised Fine-Tuning
- 赛道归属: LLM+强化学习/序列决策(离线RL、MDP/POMDP上的In-Context Learning与微调)
- 核心创新点: 通过对“离线、oracle标注的轨迹”进行监督微调,把LLM的少样本ICL能力显式迁移到序列决策任务中,使模型能够在MDP、POMDP及更具不确定性的APOMDP设定下,直接从上下文轨迹中进行few-shot决策;方法上将“轨迹作为上下文提示”的ICL与“用高质量轨迹进行SFT”的训练范式结合,系统化提升LLM在长期依赖与部分可观测场景中的决策稳健性。
- [2026-05-07] LCC-LLM: Leveraging Code-Centric Large Language Models for Malware Attribution
- 赛道归属: 代码安全与恶意软件分析(LLM+静态分析/归因)
- 核心创新点: 构建面向“代码证据”的恶意软件归因基准与框架:提出代码中心的LCCD数据集(约34K PE样本)并配套证据落地的归因流程,强调从二进制/反汇编等静态线索中定位“恶意/脆弱代码片段”的可验证证据链,弥补以往LLM归因依赖不受支持指标、缺乏代码级grounding的问题,实现归因与多任务静态分析的统一评测与训练范式。
- RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization 🆕NEW
- 赛道归属: 对齐训练 / 偏好优化(DPO改进、逻辑一致性对齐)
- 核心创新点: 提出Hybrid-DPO的自动化偏好构建与优化框架,用“逻辑正确性信号 + 流畅性偏好信号”的混合偏好来替代单一偏好监督,针对DPO在知识密集生成中被“冗长/流畅偏置”误导的问题进行校正;通过引入基于NLI/逻辑判别器(如DeBERTa类模型)的可验证逻辑一致性评估,与LLM评审/人类偏好形成互补,从而在不牺牲可读性的前提下缩小“逻辑对齐缺口”,提升生成的可证正确性与事实/推理一致性。
- Many-Shot CoT-ICL: Making In-Context Learning Truly Learn 🆕NEW
- 赛道归属: 提示学习 / In-Context Learning(长上下文Many-shot CoT推理)
- 核心创新点: 系统研究many-shot链式思维ICL在推理任务上的缩放规律,指出将非推理任务的many-shot经验法则直接迁移会失效;围绕“示例数量、示例组织方式、CoT展示形式与任务泛化”的相互作用给出新的可操作策略,使长上下文下的ICL不仅是“检索相似示例”,而更像在提示内进行可学习的推理程序归纳,从而在无需参数更新的情况下稳定提升推理性能并逼近微调效果。
- An Agentic AI Framework with Large Language Models and Chain-of-Thought for UAV-Assisted Logistics Scheduling with Mobile Edge Computing 🆕NEW
- 赛道归属: LLM智能体 / 工业调度优化(UAV物流 + 边缘计算MEC的联合调度)
- 核心创新点: 构建面向UAV辅助云制造的Agentic AI框架,将LLM的Chain-of-Thought用于把“物理物流路径/取送决策”与“计算任务卸载/边缘执行/资源分配”耦合建模与分步求解;通过智能体式规划-执行流程,把复杂混合调度问题分解为可解释的决策链,并在动态环境约束(站点任务到达、UAV算力/电量、时延约束等)下实现联合优化,相比传统启发式/单域优化更易扩展到多约束、多目标的实际工业场景。
- U-STS-LLM A Unified Spatio-Temporal Steered Large Language Model for Traffic Prediction and Imputation
- 赛道归属: 时空序列建模与预测(通信/网络流量预测与缺失值插补的LLM化)
- 核心创新点: 提出统一的时空“预测+插补”框架,将原本分离的两类任务在同一模型内联合建模;通过“时空引导/steering”的LLM结构,把交通/流量数据的空间关联与时间动态以可控方式注入语言模型,实现对未来负载预测与缺失数据修复的共享表示与协同优化,从而减少任务割裂带来的误差传播并提升跨场景泛化。
- Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning
- 赛道归属: 推理与规划分析(CoT可解释性/行为刻画)
- 核心创新点: 提出从LLM推理轨迹中“抽取搜索树”的方法学,用结构化量化替代仅看最终答案/文本:在四子棋环境中将CoT中的分支、回溯与前瞻显式拟合为搜索树并度量其深度、分支因子与局部性,从而揭示推理模型存在“短视规划”等行为特征,并将性能与搜索结构属性建立可检验关联。
- One Prompt, Many Sounds: Modeling Listener Variability in LLM-Based Equalization
- 赛道归属: 音频生成/音频控制(文本到均衡器EQ参数的LLM交互式音频调音)
- 核心创新点: 将“自然语言提示→EQ设置”建模为LLM驱动的可对话控制问题,并显式建模听众差异:利用受控听音实验数据,让模型在ICL与个性化建模的结合下,同一提示可输出符合不同听众偏好的多样化均衡曲线;方法突破在于把主观偏好分布作为学习目标的一部分,而非学习单一“平均”EQ映射。
- MARLIN: Multi-Agent Game-Theoretic Reinforcement Learning for Sustainable LLM Inference in Cloud Datacenters 🆕NEW
- 赛道归属: 推理优化 / 绿色AI(数据中心LLM推理的能耗与碳水足迹优化)
- 核心创新点: 提出MARLIN的多智能体博弈论强化学习框架,把云数据中心的LLM推理服务建模为多主体决策问题,在满足SLA/吞吐/时延的同时联合优化能耗、碳排与用水等可持续性指标;通过博弈论机制刻画不同调度/资源管理主体(如集群、机架、作业/请求层)的策略交互,学习在时空变化的电网碳强度与负载波动下的自适应推理调度与资源分配策略,实现比静态规则或单智能体RL更稳健的可持续推理服务。
- The Readability Spectrum: Patterns, Issues, and Prompt Effects in LLM-Generated Code 🆕NEW
- 赛道归属: 代码生成质量评估 / 可读性与提示工程(LLM生成代码的非功能属性)
- 核心创新点: 提出“可读性谱系”的系统化分析框架,超越功能正确性,从模式、缺陷与提示影响三个维度刻画LLM生成代码的可读性分布;通过对比人类代码与模型代码,识别典型可读性问题(如命名、结构、注释、复杂度、风格一致性等)及其与提示设计的因果关联,进而给出可操作的提示干预方法,使提示不仅控制“能跑”,还能可控地提升“易读、易审、易维护”的代码质量。
GitHub
- [2026-05-15] sgl-project/sglang ⭐27816
- [2026-05-15] NVIDIA/TensorRT-LLM ⭐13642
- [2026-05-15] UKGovernmentBEIS/inspect_ai ⭐2058 🆕NEW
- [2026-05-14] jxzhangjhu/Awesome-LLM-RAG ⭐1328 🆕NEW
- [2026-05-15] NiuTrans/NLPBook ⭐617 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-05-01] angrygiraffe/claude-opus-4.6-4.7-reasoning-8.7k
Background
Ended up with some tokens to burn on a Claude Max plan. Assembly began during 4.6 and moved to 4.7. Model is tagged. The develop...
- [2026-02-10] Modotte/CodeX-2M-Thinking 🆕NEW
Modotte
Note: This dataset is part of the lineup CodeX by Modotte. You can get lots of datasets in this same lineup, with the main ...
HuggingFace Spaces
多模态大模型
arXiv
- GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models 🆕NEW
- 赛道归属: 多模态模型推理优化 / 视觉Token剪枝与模型压缩
- 核心创新点: 将VLM视觉token剪枝从常见的连续梯度松弛视角,转向更贴合本质的离散组合优化建模;提出“组相对重要性”的剪枝框架,通过在组内/组间进行相对重要性比较来稳定地选择保留token,缓解连续近似在激进压缩下易陷入次优局部最小的问题,从而在显著降低视觉token计算开销的同时尽量保持多模态性能。
- PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models
- 赛道归属: 多模态安全与隐私 / 机器遗忘(VLM个性化部分遗忘评测)
- 核心创新点: 提出PPU-Bench,一个面向真实世界“个性化部分遗忘”的VLM基准:不依赖合成知识注入、也不做整类/整主体删除,而是覆盖更贴近用户请求的细粒度跨模态事实删除需求;同时强调fine-tuning-free的评测设定,用统一任务与数据规模(约24K多模态样本)系统衡量模型对敏感记忆的可控删除能力与残留风险。
- DistractMIA: Black-Box Membership Inference on Vision-Language Models via Semantic Distraction 🆕NEW
- 赛道归属: 多模态安全与隐私 / VLM成员推断攻击(黑盒审计)
- 核心创新点: 面向仅能观察文本输出的部署型VLM黑盒场景,提出基于“语义干扰”的成员推断方法:通过构造会诱导模型在语义层面产生分心/偏移的查询与对照,放大训练集成员样本与非成员样本在生成响应上的可分性;规避对logits/概率等不可得信号的依赖,相比依赖掩码预测等任务的既有方法,更适配真实API审计条件并提升攻击有效性。
- Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
- 赛道归属: 多模态推理(视觉潜变量/latent reasoning 对齐与训练范式)
- 核心创新点: 提出GAP以稳定提升视觉潜变量推理:指出现有“output-as-input”视觉latent范式不稳定的关键原因在于特征空间不匹配——常见做法在pre-norm MLLM中直接复用decoder隐藏态作为下一步latent输入,导致预测latent与期望视觉特征分布错位;GAP通过更细粒度的对齐机制/训练约束来缓解该mismatch,从而让连续视觉证据token的生成与消费更一致、收益更稳定。
- 20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone
- 赛道归属: 视觉语言预训练 / 数据工程(仅数据策划提升VLM)
- 核心创新点: 系统验证“只靠数据策划即可显著提升VLM”的上限:在架构、训练配方与算力固定的前提下,仅改变训练数据,通过一套数据筛选/清洗/重配比的策划流水线作用于MAmmoTH-VL单图子集,在20个公开VLM基准(覆盖grounding、VQA等)上平均提升+11.7pp;方法论贡献在于把性能增益明确归因到数据分布与质量控制,并给出可复用的数据策划处方来移动质量-算力前沿。
- SoccerLens: Grounded Soccer Video Understanding Beyond Accuracy
- 赛道归属: 视频多模态理解评测(体育视频理解 + 可解释/可落地grounding)
- 核心创新点: 提出SoccerLens评测框架,将足球视频理解从“只看分类准确率”推进到“是否基于真实视觉证据”的检验:针对视角变化大、镜头切换快、场景拥挤等足球视频特性,新增/强化视觉grounding与证据一致性评估,旨在识别VLM是否依赖伪相关与捷径学习;核心突破在于把“超越准确率”的可视化证据对齐与鲁棒性诊断纳入标准化基准。
- Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?
- 赛道归属: 具身智能 / 多模态代理评测(镜像自我识别与自他区分)
- 核心创新点: 构建受控3D基准测试VLM代理的“镜像自我识别”功能:第一人称具身代理需从镜中反射推断自身隐藏身体属性并匹配目标,同时避免把他者误认为自己;通过任务设计将“镜像线索推理能力”与“基于先验/捷径的猜测”区分开,为评估VLM代理的自我表征、视角几何理解与身份归因提供可控实验范式。
- Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models
- 赛道归属: 3D医学多模态理解评测(体数据语义-空间推理VQA)
- 核心创新点: 提出CT-SpatialVQA,用于系统评估3D医学VLM在CT体数据上的“语义-空间”理解:针对现有模型可能依赖语言相关性与数据先验、缺乏空间落地的问题,基准聚焦解剖语义与三维空间关系的联合推理(例如方位、相对位置、跨切片一致性等),从而更精确地区分“真正读懂体数据”与“靠先验答题”。
- Where Reliability Lives in Vision-Language Models: A Mechanistic Study of Attention, Hidden States, and Causal Circuits
- 赛道归属: 多模态可靠性与可解释性 / 机制可解释(VLM内部因果电路分析)
- 核心创新点: 提出统一的机制分析流水线VRP,直接检验“注意力越尖锐越可靠”的Attention-Confidence假设:在LLaVA-1.5、PaliGemma、Qwen2-VL等开源VLM上,联合对比注意力结构、生成动态与隐藏态表征,并通过因果电路视角定位可靠性来源;方法论突破在于把可靠性从表层可视化提升到可干预、可归因的内部状态与因果路径层面。
- [2026-05-08] Fine-tuning a vision-language model for fracture-surface morphology recognition
- 赛道归属: 科学影像理解 / 领域VLM微调(材料断口形貌识别)
- 核心创新点: 基于开源VLM进行材料断口图像的领域适配微调,构建并利用13,168张文献挖掘的断口图像数据集;通过推理型大模型从“图像+文本”联合生成形貌标注,实现低人工成本的可扩展标注管线,从而把通用VLM的视觉表征对齐到材料学形貌判别所需的细粒度纹理/结构知识。
GitHub
- [2026-05-15] Blaizzy/mlx-vlm ⭐4721
- [2026-05-14] waybarrios/vllm-mlx ⭐1164
- [2026-05-10] dongyangli-del/EEG_Image_decode ⭐203
- [2026-05-12] ydyhello/Awesome-VLM-Streaming-Video ⭐156
- [2026-05-14] ocy1/TRIO ⭐108 🆕NEW
强化学习
arXiv
- MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning
- 赛道归属: 自动驾驶强化学习(多模态感知-控制融合、可解释决策)
- 核心创新点: 提出以“3D可供性”作为感知与控制之间的中间表征,用多模态Transformer从RGB等输入预测结构化、可解释的3D可供性,再由强化学习在该表征空间上进行策略学习;相较端到端直接回归动作,减少感知-控制脆弱接口带来的误差传播,同时提升在城市密集交互场景下的鲁棒性与可解释性。
- How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment
- 赛道归属: 大模型对齐与推理优化(RL后训练、KV Cache压缩/显存优化)
- 核心创新点: 提出“Shadow Mask Distillation”用于RL在线rollout阶段的KV cache压缩:通过蒸馏得到可学习的掩码/稀疏策略,在尽量不破坏对齐与长上下文推理质量的前提下,显著降低轨迹生成时KV缓存的显存占用,从而缓解长上下文RL后训练的“memory wall”,提升可扩展性与吞吐。
- [2026-05-07] A Unified Pair-GRPO Family: From Implicit to Explicit Preference Constraints for Stable and General RL Alignment
- 赛道归属: 大模型对齐(偏好学习RL、GRPO/PPO类稳定训练)
- 核心创新点: 构建统一的Pair-GRPO理论框架,将“隐式偏好约束”到“显式偏好约束”纳入同一族方法,并提出Soft-Pair-GRPO与Hard-Pair-GRPO两种紧耦合变体;通过更清晰的约束形式与梯度方向刻画,降低梯度方差、提升更新稳定性与可解释性,并增强跨任务/奖励形态的泛化鲁棒性。
- Self-Supervised On-Policy Reinforcement Learning via Contrastive Proximal Policy Optimisation 🆕NEW
- 赛道归属: 自监督强化学习(对比学习 + On-policy策略优化,离散/连续动作通用)
- 核心创新点: 将对比式强化学习的表征学习目标与PPO式on-policy优化深度耦合,提出“Contrastive Proximal Policy Optimisation”框架:在不依赖手工奖励的前提下,通过对比目标学习目标条件价值/表征,同时用近端策略更新保证on-policy训练稳定性与样本效率;突破既有CRL几乎都依赖off-policy且偏连续动作的限制,使其更贴近主流on-policy算法并可扩展到离散环境。
- HLS-Seek: QoR-Aware Code Generation for High-Level Synthesis via Proxy Comparative Reward Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习用于代码生成/编译优化(面向高层综合HLS的QoR优化)
- 核心创新点: 提出“代理比较奖励”的RL范式:不依赖昂贵且噪声大的绝对综合QoR数值,而以候选pragma/代码变体之间的相对优劣比较作为奖励信号来驱动策略学习,从而显著降低综合评估成本并更直接对齐QoR(时延/资源)目标;将LLM生成与QoR感知的RL闭环结合,使训练目标从“功能正确”扩展到“可综合且高QoR”的可控搜索与生成。
- D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models 🆕NEW
- 赛道归属: 分布式强化学习系统(面向具身智能VLA大模型的高并发异步训练)
- 核心创新点: 面向视觉-语言-动作大模型在具身仿真中的RL训练瓶颈,提出高并发分布式异步框架:通过解耦“仿真执行(CPU/物理引擎)”与“模型训练(GPU/显存带宽)”的资源竞争,采用异步流水与调度机制提升端到端吞吐,缓解因仿真与训练互相阻塞导致的利用率低下;使大规模VLA的RL更可扩展、更接近工程可用的训练效率。
- Active Sensing with Meta-Reinforcement Learning for Emitter Localization from RF Observations 🆕NEW
- 赛道归属: 主动感知与定位(Meta-RL用于RF/GNSS干扰源定位)
- 核心创新点: 将干扰源定位建模为“序贯主动感知”问题:智能体基于RF观测在环境中主动选择下一步采样/移动策略,以最大化定位信息增益并最终推断发射源位置;引入元强化学习以在不同环境/多径条件/场景分布间快速适应,实现“少量交互即可学会有效探测策略”的跨场景泛化,相比被动测量或固定路径扫描更具样本效率与鲁棒性。
- Learning When to Act: Communication-Efficient Reinforcement Learning via Run-Time Assurance 🆕NEW
- 赛道归属: 安全强化学习 + 事件触发控制/通信效率
- 核心创新点: 将“何时行动/通信”作为与“采取何种控制”同等重要的决策变量,提出单一策略联合学习控制输入与触发时机;在点式Lyapunov安全盾约束下,用CARE-LQR备份与Lyapunov证书保证稳定与安全,同时通过学习到的触发机制减少不必要的动作更新/通信开销;把经典Lyapunov-STC的解析安全性与RL的自适应性结合,实现可证明安全前提下的通信高效RL。
- Discrete Flow Matching for Offline-to-Online Reinforcement Learning
- 赛道归属: 离线到在线强化学习(离散动作生成式策略、Flow Matching)
- 核心创新点: 针对离散动作空间提出基于离散Flow Matching的生成式策略在线微调框架:将原本偏连续控制的扩散/flow匹配范式离散化以适配离散动作,并设计在线更新机制,使策略在与环境交互后能持续改进且不“遗忘”离线数据中学到的有效行为,从而缓解offline-to-online迁移中的分布偏移与性能退化。
- On the Importance of Multistability for Horizon Generalization in Reinforcement Learning
- 赛道归属: POMDP长时序强化学习(记忆机制与泛化、RNN动力学)
- 核心创新点: 将长视野(长horizon)POMDP中的泛化困难归因到记忆网络的动力学性质,提出“多稳态”对horizon泛化的重要性:通过分析/构造具有多个稳定吸引子状态的记忆表征,使RNN能在长时间间隔后仍保持关键信息并形成可分离的内部状态,从而提升长时依赖任务的样本效率与跨horizon泛化能力。
GitHub
- [2026-05-15] huggingface/trl ⭐18379
- [2026-05-14] PufferAI/PufferLib ⭐5680
- [2026-05-14] facebookresearch/ReAgent ⭐3701 🆕NEW
- [2026-05-15] facebookresearch/Pearl ⭐2997 🆕NEW
- [2026-05-14] radixark/miles ⭐1333
HuggingFace Datasets
- [2026-05-13] TuringEnterprises/Open-MM-RL
Dataset Summary
Open-MM-RL is a multimodal STEM reasoning dataset covering Physics, Mathematics, Biology, and Chemistry. It is designed for...
- [2026-05-03] ADSKAILab/Zero-To-CAD-1m
Zero-to-CAD 1M
One million executable, interpretable CAD construction sequences synthesized entirely without real-world data.
...
- [2026-05-14] AlienKevin/SWE-ZERO-12M-trajectories 🆕NEW
SWE-ZERO 12M Trajectories
The largest agentic-coding trace dataset to date: 112 B tokens of execution-free agentic trajectories covering 12...
-
[2026-04-23] nvidia/Nemotron-Personas-Korea
Nemotron-Personas-Korea우리나라 실제 분포에 기반한 합성 페르소나를 위한 복합 AI 시스템 A compound AI approach to personas grounded in real-world dist...
- [2026-05-08] Qwen/WebWorldData
WebWorldData 🌐 Overview
WebWorldData is a large-scale dataset of 1.06M web interaction trajectories collect...
世界动作模型
arXiv
- World Action Models: The Next Frontier in Embodied AI
- 赛道归属: 具身智能 / 视觉-语言-动作+ 世界模型融合的策略学习(World Action Model范式)
- 核心创新点: 中文:提出并系统化“世界动作模型”这一新范式:将环境动力学的显式预测(世界模型)纳入动作生成/策略学习管线,突破传统VLA仅做“观测→动作”的反应式映射,转向“可干预的未来演化建模 + 基于预测的动作决策”的统一框架,从而为具身基础模型提供更强的可规划性、可推演性与对物理演化的建模能力。
- [2026-05-08] Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models
- 赛道归属: 世界模型评测与可靠性诊断(World Action Model / 动态一致性)
- 核心创新点: 提出并系统化定义WAM可靠性的关键缺失维度——动作-状态一致性,用于检验“模型生成的未来”是否与其声称的动作序列在动力学上相容,而不仅是视觉上合理;围绕该一致性构建诊断框架/评测思路,将WAM的失效从“看起来对”细化为“动力学不兼容”的可检测问题,从而为后续训练目标、校准与安全执行提供可操作的评价轴。
- [2026-05-07] When to Trust Imagination: Adaptive Action Execution for World Action Models
- 赛道归属: 世界模型驱动的机器人控制(自适应执行 / 想象-现实一致性验证)
- 核心创新点: 将WAM的执行策略从“每次推理固定执行N步”提升为自适应动作执行:把是否继续执行想象动作序列建模为未来-现实验证问题;核心方法论是在执行过程中持续对比模型想象的未来与真实滚动的偏差/一致性,并据此动态决定执行更长的开环段还是提前重规划,从机制上缓解因想象漂移导致的失控与累积误差,实现“何时信任想象”的可决策化。
- The DAWN of World-Action Interactive Models
- 赛道归属: 自动驾驶 / 世界模型驱动的交互式规划与动作生成
- 核心创新点: 中文:提出“世界-动作交互模型”以刻画世界预测与动作选择的互依关系,指出现有WAM常见的并行分支或“先预测再规划”的刚性流水线难以体现“动作影响场景演化、场景演化反过来约束动作”的闭环耦合;并在自动驾驶中实例化为DAWN,通过在生成过程中联合/交替地对动作与世界演化进行一致性建模(以去噪式生成视角实现动作与未来场景的协同推断),实现更符合交互逻辑的场景-动作联合生成与规划。
GitHub
- [2026-05-14] DravenALG/awesome-vla-wam ⭐389
- [2026-05-14] OpenMOSS/Awesome-WAM ⭐217
- [2026-05-12] jiangranlv/DyWA ⭐83
由 Research Daily 自动生成 生成时间: 2026-05-15 01:02:00