AI 每日进展速报 - 2026-05-12
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- Flow-OPD: On-Policy Distillation for Flow Matching Models 🆕NEW
- 赛道归属: 文生图对齐/后训练(RL/蒸馏)
- 核心创新点: 提出 Flow-OPD,将大模型领域的 On-Policy Distillation 引入 Flow Matching 文生图的统一后训练框架:用“在策略采样→基于偏好/奖励信号的更新→蒸馏回学生”的闭环,缓解多任务对齐中的两大痛点——标量奖励导致的稀疏监督与异质目标联合优化带来的梯度干扰,从机制上降低指标“跷跷板效应”和 reward hacking,使多指标对齐更稳定、可控。
- SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation
- 赛道归属: 文生图(复杂意图生成/结构化规划与验证)
- 核心创新点: 提出“语义承诺”及其在生成生命周期中断裂的“概念裂隙”框架,将复杂生成需求从文本理解、图像生成到结果核验进行结构化分解与可追踪表示;通过条件化“技能编排”把不同子能力(如属性绑定、关系约束、计数/布局等)按承诺单元进行调度与闭环校验,减少局部满足但全局失真的失败模式,提升复杂指令的可控一致性。
- HEART: Hyperspherical Embedding Alignment via Kent-Representation Traversal in Diffusion Models 🆕NEW
- 赛道归属: 图像编辑/可控生成(扩散模型的条件空间操控)
- 核心创新点: 提出 HEART,将文本条件嵌入从常见的欧式假设转向超球面几何建模,并通过 Kent 分布表示在球面上进行可控“遍历/插值”,实现对语义与属性变化的更解耦控制。该做法针对“改主体/改属性易牵连背景与细节”的根因(嵌入空间操作不符合真实几何结构),用分布化、方向性更强的球面表示来提升编辑的局部性与一致性,减少副作用与细节畸变。
- Delta-Adapter: Scalable Exemplar-Based Image Editing with Single-Pair Supervision
- 赛道归属: 图像编辑(示例驱动编辑/少样本迁移)
- 核心创新点: 将示例编辑从传统“pair-of-pairs”监督降为“单对样本”监督:从源-目标示例对中显式抽取可迁移的“编辑增量/差分”表征,并以适配器形式注入到生成/编辑模型中,实现编辑语义与内容解耦;从而在无需同语义第二对样本的情况下学习可泛化的编辑操作,显著降低数据构建成本并提升跨编辑类型的可扩展性。
- BRIDGE: Background Routing and Isolated Discrete Gating for Coarse-Mask Local Editing
- 赛道归属: 图像编辑 / 粗掩码局部编辑
- 核心创新点: 提出BRIDGE以解决粗掩码带来的“掩码形状偏置”:将任务形式化为“两区约束”——背景需强稳定、编辑区需遵循指令但不被粗边界牵引;通过Background Routing将背景信息与生成路径隔离、并用Isolated Discrete Gating在编辑区引入离散门控以控制信息流与边界泄漏,从而在粗掩码下实现更稳的背景保持与更自由的目标形状生成。
- [2026-05-08] SIMI: Self-information Mining Network for Low-light Image Enhancement 🆕NEW
- 赛道归属: 图像增强(低照度增强,无监督)
- 核心创新点: 提出 SIMI 无监督低照度增强框架,核心在于利用 位平面分解将低照度图像拆解为多层信息分量,并进行“自信息挖掘”以显式提取低照度图像内部可用的结构/细节线索,而非依赖更复杂的外部监督或先验。通过这种信息分解与重组的学习范式,提升在弱光下的细节恢复与亮度/噪声权衡能力。
- [2026-05-08] ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning
- 赛道归属: 图像编辑(评测/可解释性评价与奖励建模)
- 核心创新点: 面向文本引导图像编辑评测引入强化学习范式:构建可解释的评价信号(不仅是标量分数),并训练能输出“原因链/错误归因”的评估器作为奖励模型;通过RL优化使评估器在识别伪影、非预期改动、审美退化等问题时同时给出可读的解释依据,弥补现有评测缺少解释数据与可训练奖励模型的短板。
- [2026-05-08] EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement
- 赛道归属: 图像编辑(Agentic 精修/人类对齐的局部纠错)
- 核心创新点: 提出面向编辑结果“精修”的代理式框架:通过构建人类反馈驱动的数据集(如细粒度缺陷与修复指令/偏好)对齐模型行为;结合具备更强空间落点能力的诊断-定位-修复流程(而非弱 grounding 的一次性VLM建议或反复重采样),在避免语义漂移的同时实现可靠的局部修补(物体不自然、光照不一致、局部纹理破坏等)。
- [2026-05-08] EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing 🆕NEW
- 赛道归属: 图像编辑(视觉提示/示例对驱动的编辑迁移,扩散/DiT)
- 核心创新点: 提出 EditTransfer++,面向“示例对+视觉提示”驱动的编辑迁移,针对现有 Diffusion Transformer 方法的两类结构性失配:①骨干预训练偏向文本条件,导致对示例编辑的忠实度不足;②采样随机性带来编辑不稳定。其方法通过更贴合任务的条件注入与训练/推理设计,强化对示例变换的可复现学习与稳定执行,在保证效率的同时提升编辑一致性与保真度。
- [2026-05-08] OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing
- 赛道归属: 文生图安全(工具调用代理/越狱与红队测试)
- 核心创新点: 针对“工具调用型”文生图代理提出编排引导的模糊测试越狱框架:不再只优化单轮提示词,而是系统探索多步工具链的组合空间,利用“单步无害、组合有害”的编排漏洞生成攻击序列;通过对代理的规划/调用轨迹进行引导式变异与覆盖驱动搜索,发现传统prompt-only jailbreak难以触达的安全失效模式。
GitHub
- [2026-05-12] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐11932
- [2026-05-11] vibheksoni/free-ai ⭐413
- [2026-05-11] Siddhesh2377/ToolNeuron ⭐393 🆕NEW
- [2026-05-11] AceDataCloud/Nexior ⭐369
- [2026-05-11] etkecc/baibot ⭐223 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-05-07] unh1nge/comfyui-character-composer
AIO Qwen Workflow
The repository now includes:
AIO Comfyui-Character-Composer Qwen Workflow.json
A unified all-in-one Qwen wor...
视频生成/编辑
arXiv
- [2026-05-08] OphEdit: Training-Free Text-Guided Editing of Ophthalmic Surgical Videos 🆕NEW
- 赛道归属: 视频编辑(医疗/手术视频,文本引导、免训练编辑)
- 核心创新点: 提出一种面向眼科手术视频的training-free文本引导编辑框架,在不对扩散模型进行再训练/微调的前提下,将文本指令转化为对视频生成过程的可控约束,实现对手术属性(如器械-组织交互、流程阶段等)的定向修改;方法重点解决手术场景中强解剖一致性与时间连续性带来的编辑难题,通过在扩散采样/注意力或条件注入层面进行约束与引导,尽量在局部语义改变的同时保持器械几何、组织结构与跨帧一致性,面向高保真、低风险的临床视频编辑需求。
- [2026-05-08] Do Joint Audio-Video Generation Models Understand Physics?
- 赛道归属: 多模态评测(音视频联合生成/物理一致性基准)
- 核心创新点: 提出 AV-Phys Bench,用于系统评估音视频联合生成模型是否具备“物理常识一致性”而非仅生成表面合理的声画;基准覆盖稳态、事件转变、环境转变三类场景,并围绕物理因果与跨模态一致性设计测试,从评测维度上把“声画同步”提升到“物理可解释的一致”。
- Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation
- 赛道归属: 视频生成 / DiT 推理加速(异构去噪步数分配)
- 核心创新点: 提出训练免的异构步数分配,打破“所有时空 token 统一 40 步”等固定采样范式:根据 token 的重要性/冗余度(尤其是运动冗余)为不同空间位置与时间片分配不同去噪步数,对低贡献 token 早停或少步更新、对关键 token 保持充分迭代,从而在不改训练的情况下显著降低总体计算量,同时尽量维持视频的时序一致性与细节质量。
- [2026-05-07] FreeSpec: Training-Free Long Video Generation via Singular-Spectrum Reconstruction
- 赛道归属: 长视频生成(训练免/一致性增强)
- 核心创新点: 提出 FreeSpec,通过“奇异谱重建”在训练免设置下延展短视频扩散模型到长视频,缓解内容漂移、时序不一致与动态过平滑;相较于依赖预定义规则拆分外观/运动的全局-局部分支方法,FreeSpec用谱结构重建来更自适应地耦合外观一致性与动作演进,降低错误分配带来的失真。
- [2026-05-07] SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation
- 赛道归属: 图生视频(高分辨率/高效生成)
- 核心创新点: 提出 SwiftI2V 的“条件分段生成”策略,将 2K 级高分辨率 I2V 的生成过程拆分为可控的分段/分块推理,在显著降低显存与时延的同时保持输入图像的细粒度结构;相较于“低清生成+通用超分”的级联方案,该方法在生成阶段就注入输入条件约束,减少细节幻觉与对输入局部结构的漂移。
- [2026-05-07] EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields 🆕NEW
- 赛道归属: 视频生成(机器人世界模型/动作条件视频扩散,动作-视觉对齐)
- 核心创新点: 提出事件感知的生成式世界模型EA-WM,通过结构化的“运动学→视觉”动作场将机器人动作/运动学信号显式映射为对视频扩散生成的空间-时间控制,从而强化“由动作驱动的视频合成”这一逆向问题;相较将视频仅作为策略学习的辅助表征,该方法在生成过程中引入可解释的动作结构与事件感知机制,以更好地保持机器人精确空间几何、运动一致性与物理可预期性,提升动作条件下未来视频生成的可控性与保真度。
- [2026-05-07] RealCam: Real-Time Novel-View Video Generation with Interactive Camera Control
- 赛道归属: 视频编辑/视频到视频(实时新视角生成/交互式相机控制)
- 核心创新点: 提出 RealCam,用面向实时的因果式架构实现单目视频的交互式相机控制新视角生成,突破以往依赖全序列非因果处理与前缀拼接的范式;通过避免双向注意力带来的二次复杂度与高延迟,使模型能够低时延、可流式地响应相机轨迹控制,同时提升在线生成的时序连贯性与可用性。
- [2026-05-06] FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation
- 赛道归属: 文生视频(人脸身份保持/可控生成)
- 核心创新点: 提出 FaithfulFaces 的“姿态共享身份表示”学习框架,在大姿态变化与遮挡场景下强化身份一致性;通过将身份特征与姿态因素解耦并在跨姿态条件下共享/对齐身份表征,减少因姿态迁移导致的身份漂移与面部结构失真,从而提升复杂动态场景中的人脸身份保真度。
- [2026-05-06] Stream-T1: Test-Time Scaling for Streaming Video Generation
- 赛道归属: 视频生成(流式生成/推理时扩展 Test-Time Scaling)
- 核心创新点: 提出 Stream-T1,将 Test-Time Scaling 从传统扩散式“多候选探索”转向更适配的流式视频生成范式;利用分块合成与更少去噪步数的结构优势显著降低 TTS 的候选搜索成本,并引入面向时间维度的指导机制以增强跨块时序一致性,实现更可扩展的推理时质量提升。
- Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering
- 赛道归属: 视频生成 / DiT 推理优化(训练免稀疏注意力)
- 核心创新点: 发现注意力稀疏模式对输入具有稳定性,据此提出“离线稀疏画像 + 在线 QK 协同聚类”的训练免稀疏注意力方案:离线为不同层建立更细粒度的稀疏度剖面以处理层间异质性;在线通过 Query-Key 联合分块/聚类显式建模 QK 耦合关系,避免仅按单侧划分带来的信息断裂,从而在不训练的前提下提升 3D 注意力加速的质量-速度曲线。
GitHub
- [2026-05-11] Anil-matcha/Open-Generative-AI ⭐12838
- [2026-05-11] ZeroLu/awesome-seedance ⭐1710
- [2026-05-11] YouMind-OpenLab/awesome-seedance-2-prompts ⭐986
- [2026-05-11] Guoxu1233/DreamID-Omni ⭐254 🆕NEW
- [2026-05-11] AMAP-ML/MACE-Dance ⭐84 🆕NEW
HuggingFace Models
音频生成
arXiv
- [2026-05-07] Optimal Transport Audio Distance with Learned Riemannian Ground Metrics
- 赛道归属: 音频生成评测 / 最优传输距离度量
- 核心创新点: 提出OTAD以替代/修正FAD的两大结构性缺陷:在“代价项”上学习残差黎曼地面度量适配器以避免冻结嵌入的不变性掩盖伪影;在“耦合项”上用离散OT(带熵正则)替代高斯拟合近似,提升对局部污染与细粒度失真的敏感性,从而得到更可信的生成音频距离度量。
- [2026-05-06] Stage-adaptive audio diffusion modeling 🆕NEW
- 赛道归属: 音频生成(扩散模型训练优化 / 自适应训练策略)
- 核心创新点: 提出“阶段自适应”的音频扩散模型训练框架,针对扩散训练中不同阶段(如噪声水平/时间步、不同条件信号)的学习难度与贡献随训练进程变化这一现象,不再采用固定不变的优化配方,而是动态调整训练信号的重要性与采样/加权策略,使模型在训练早期与后期分别聚焦更关键的学习目标,从而在不改变生成范式的前提下提升训练效率与最终生成/复原质量。
GitHub
- [2026-05-11] huggingface/diffusers ⭐33595
- [2026-05-11] Lightricks/LTX-2 ⭐6574 🆕NEW
- [2026-05-06] OpenMOSS/MOVA ⭐996
- [2026-05-11] apocas/restai ⭐504
- [2026-05-07] Saganaki22/ComfyUI-Woosh ⭐98
语言大模型
arXiv
- LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling
- 赛道归属: 推理优化 / 自动化策略发现
- 核心创新点: 提出环境驱动的AutoTTS:将研究者的设计对象从“具体TTS启发式”提升为“可搜索的环境/接口”,让LLM以代理式探索在测试时如何分配计算与组织推理轨迹;通过自动发现与评估策略,系统性覆盖更大的TTS策略空间,减少手工规则与直觉调参依赖。
- VecCISC: Improving Confidence-Informed Self-Consistency with Reasoning Trace Clustering and Candidate Answer Selection 🆕NEW
- 赛道归属: 推理优化(Inference-time Self-Consistency / 置信度加权投票)
- 核心创新点: 提出 VecCISC,在置信度加权自一致性框架下,引入“推理轨迹聚类 + 候选答案选择”的两阶段机制:先基于多次采样得到的 reasoning traces 做向量化表征并聚类,减少同质化样本对投票的偏置、提升多样性有效利用;再在簇级别聚合置信度并进行候选答案筛选/重加权,从而在保持加权投票优势的同时,缓解噪声置信度与重复轨迹导致的误选问题,提升推理时集成决策的稳健性。
- Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment
- 赛道归属: 3D表征学习 / 面向VLM的高效3D语义对齐
- 核心创新点: 提出Proxy3D,用“语义聚类+跨模态对齐”构建高效3D代理表示,替代传统VLM以像素对齐为主的2D视觉token管线;通过把视觉序列压缩为语义一致的3D代理单元,兼顾空间一致性(缓解隐式对应模型的空间不稳定)与计算效率(缓解显式3D几何先验方法在长序列上的开销),从而提升VLM的3D空间推理能力与可扩展性。
- Flow-OPD: On-Policy Distillation for Flow Matching Models 🆕NEW
- 赛道归属: 文生图对齐/后训练(RL/蒸馏)
- 核心创新点: 提出 Flow-OPD,将大模型领域的 On-Policy Distillation 引入 Flow Matching 文生图的统一后训练框架:用“在策略采样→基于偏好/奖励信号的更新→蒸馏回学生”的闭环,缓解多任务对齐中的两大痛点——标量奖励导致的稀疏监督与异质目标联合优化带来的梯度干扰,从机制上降低指标“跷跷板效应”和 reward hacking,使多指标对齐更稳定、可控。
- Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning
- 赛道归属: 大模型对齐与推理能力提升(LLM-as-a-judge、结构化奖励建模)
- 核心创新点: 提出Rubric-Grounded RL:将奖励分解为可验证的多维标准,由冻结的LLM裁判在辅助“grounding”信息条件下对各维度打分并加权汇总;用“部分得分/分项反馈”替代单一整体分或二元成败信号,提供更密集、更可控的优化梯度,从而提升推理训练的可泛化性与对奖励投机的抑制能力。
- The Memory Curse: How Expanded Recall Erodes Cooperative Intent in LLM Agents 🆕NEW
- 赛道归属: 多智能体对齐与社会行为(Multi-agent cooperation / 长上下文影响分析)
- 核心创新点: 系统性提出并验证“记忆诅咒”:在多智能体社会困境中,扩大可访问历史(更长上下文/更强回忆)反而在多数设置下降低合作水平。方法上通过跨模型、跨博弈的大规模对照实验(多轮交互),并结合对海量推理轨迹的词汇/意图信号分析,定位机制为“前瞻性合作意图随历史扩展而被侵蚀”(更易沉溺于追责、报复或负面归因),从而将长上下文从“能力提升”转化为可被测量、可解释的行为退化现象与分析框架。
- CA-SQL: Complexity-Aware Inference Time Reasoning for Text-to-SQL via Exploration and Compute Budget Allocation 🆕NEW
- 赛道归属: Text-to-SQL 推理优化(推理时搜索与算力预算分配)
- 核心创新点: 提出 CA-SQL,通过“复杂度感知”的推理时策略提升困难样本的 Text-to-SQL 表现:先对问题/数据库/查询难度进行估计,用于指导更充分的解空间探索(生成多样候选 SQL、分支扩展),并将有限推理算力按难度自适应分配到更可能受益的探索与精炼步骤(例如候选筛选、迭代修正)。核心突破在于把 inference-time compute 从固定流程变为“按难度动态调度”的搜索-精炼管线,以覆盖 BIRD 等基准中最难子集所需的更大探索深度。
- Fast Byte Latent Transformer 🆕NEW
- 赛道归属: 推理加速与高效生成(字节级语言模型 / 非自回归或半并行生成)
- 核心创新点: 针对字节级 LM 逐字节自回归生成过慢的问题,在 Byte Latent Transformer中引入 BLT Diffusion:在标准 next-byte 目标之外加入“块级扩散”辅助训练目标,使模型能以块为单位进行更并行/更快的生成与重建,从而显著降低生成时延,同时保持字节级建模不依赖子词词表的泛化优势。方法上的关键在于把字节序列映射到可高效生成的潜在块表示,并用扩散式目标提升块级生成质量与速度。
- Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph 🆕NEW
- 赛道归属: 偏好对齐(DPO 扩展 / 图结构偏好建模)
- 核心创新点: 指出多 rollout/多候选的偏好数据天然形成“偏好图”,而将其坍缩为独立成对样本的传统 DPO 会丢失传递性、引入冗余/冲突监督并导致训练不稳定。该工作的方法论突破在于把对齐目标从“成对比较”提升为“图结构优化”:显式利用同一 prompt 下多候选之间的全局偏好关系(如传递闭包、排序一致性或图上的一致性约束),从而更充分地利用数据结构、减少矛盾梯度信号,并提升对齐训练的稳定性与样本效率。
- Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models
- 赛道归属: 视觉-语言模型遗忘/隐私合规
- 核心创新点: 提出HFRU,针对现有主要微调语言解码器导致“表层遗忘、底层视觉表征未清除”且易引入物体幻觉的问题,改为直接作用于视觉编码器进行深层语义移除;采用两阶段框架:先进行对遗忘目标的强化式优化(以奖励信号驱动“忘得更干净”),再通过稳定化/约束机制抑制遗忘副作用,从而在更彻底移除敏感视觉知识的同时降低幻觉风险。
GitHub
- [2026-05-12] sgl-project/sglang ⭐27664
- [2026-05-11] NVIDIA-NeMo/NeMo ⭐17195 🆕NEW
- [2026-05-12] NVIDIA/TensorRT-LLM ⭐13609 🆕NEW
- [2026-05-11] flagos-ai/FlagGems ⭐995
- [2026-05-12] NVIDIA-NeMo/Skills ⭐949 🆕NEW
HuggingFace Datasets
- [2026-05-03] iletisim/dezenformasyon-bultenleri
İletişim Başkanlığı Dezenformasyon Bültenleri
Kaynak API: llm.iletisim.gov.trKaynak Bültenler: iletisim.gov.tr/turkce/dezenformasyon-bulten...
HuggingFace Spaces
多模态大模型
arXiv
- Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment
- 赛道归属: 3D表征学习 / 面向VLM的高效3D语义对齐
- 核心创新点: 提出Proxy3D,用“语义聚类+跨模态对齐”构建高效3D代理表示,替代传统VLM以像素对齐为主的2D视觉token管线;通过把视觉序列压缩为语义一致的3D代理单元,兼顾空间一致性(缓解隐式对应模型的空间不稳定)与计算效率(缓解显式3D几何先验方法在长序列上的开销),从而提升VLM的3D空间推理能力与可扩展性。
- Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models
- 赛道归属: 视觉-语言模型遗忘/隐私合规
- 核心创新点: 提出HFRU,针对现有主要微调语言解码器导致“表层遗忘、底层视觉表征未清除”且易引入物体幻觉的问题,改为直接作用于视觉编码器进行深层语义移除;采用两阶段框架:先进行对遗忘目标的强化式优化(以奖励信号驱动“忘得更干净”),再通过稳定化/约束机制抑制遗忘副作用,从而在更彻底移除敏感视觉知识的同时降低幻觉风险。
- Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
- 赛道归属: 流式视频理解 / 在线视觉记忆管理与压缩
- 核心创新点: 提出语义感知的自适应视觉记忆机制,将“语义信号”显式纳入流式视频token的保留/压缩决策,而非仅依赖视觉相似度启发式;并把检索与压缩进行协同设计(而不是压缩后再补检索),使记忆在不确定查询到来时仍能保留对潜在问题最有用的语义证据,从而提升长时在线理解的实时性与问答命中率。
- Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
- 赛道归属: 视频理解奖励模型 / 偏好数据与评测基准
- 核心创新点: 提出统一框架覆盖基准设计、偏好数据构建与奖励模型训练,发布VURB:包含2,100组偏好对,并配套长链路推理痕迹以提升监督信号密度与可诊断性;在此基础上训练更高性能的视频奖励模型,为视频生成/视频LLM对齐提供可复现、可量化的评测与训练基础,弥补视频域奖励建模长期缺少高质量基准与数据的问题。
- EyeCue: Driver Cognitive Distraction Detection via Gaze-Empowered Egocentric Video Understanding
- 赛道归属: 具身/车载多模态理解(驾驶员状态监测)/ 注视点增强视频理解
- 核心创新点: 提出EyeCue,将眼动/注视信息作为关键中间表征融入第一视角车载视频理解,用于识别“认知分心”这一难以从外显动作判断的状态;核心洞察是认知分心体现在“注视与驾驶场景交互模式”的变化而非简单视线偏移,通过建模注视线索与场景语义/事件的耦合,提高对隐性分心的可检测性与鲁棒性。
- GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning 🆕NEW
- 赛道归属: 多模态推理(主动视觉/注意力控制)
- 核心创新点: 提出在VLM内部实现“可控注意力”的主动视觉机制,用任务目标驱动的自上而下注意力路由替代被动的全局token堆叠;通过动态聚焦关键局部细节并保持全局上下文的外围感知,提升空间推理能力并降低语言幻觉,形成面向推理的“内生注视/扫视”式视觉信息采样与推理闭环。
- [2026-05-08] Operating Within the Operational Design Domain: Zero-Shot Perception with Vision-Language Models 🆕NEW
- 赛道归属: 多模态感知(自动驾驶/机器人ODD安全约束的零样本感知)
- 核心创新点: 将Operational Design Domain作为安全与合规的核心约束引入VLM零样本感知流程:在无需任务特定训练的前提下,用ODD条件(环境、道路类型、天气/光照、速度范围等)对VLM的感知输出进行约束、筛选与一致性校验,从而把“能看见什么/该相信什么”与运行域绑定,提升部署可用性与安全可解释性。
- [2026-05-08] Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding
- 赛道归属: 流式视频理解 / 主动响应视频LLM与结构化证据对齐
- 核心创新点: 提出Response-G1,用显式场景图把“随时间累积的视频证据”与“查询所需的响应条件”进行结构化对齐,解决以往隐式、与查询无关的证据建模导致的“何时该回答”困难;采用无需微调的三阶段流程:在线的查询引导场景图构建、证据随时间的结构化更新、以及基于场景图的响应触发判定,从而提升流式场景下的及时性与可控性。
- [2026-05-08] PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解(物理感知增强的VLM:偏振成像+语言推理)
- 核心创新点: 提出将偏振成像的物理参数(可消解反射、透明等RGB固有歧义)与开放式语言推理统一到同一VLM框架中:不再局限于固定格式的偏振输出,而是把偏振信息作为可被语言查询与推理的视觉证据源,建立从“物理量→语义→推理”的桥接机制,显著增强对光学歧义场景的可解释理解与问答能力。
- [2026-05-08] Beyond GSD-as-Token: Continuous Scale Conditioning for Remote Sensing VLMs 🆕NEW
- 赛道归属: 多模态理解(遥感VLM尺度建模/条件化微调)
- 核心创新点: 针对遥感中跨数量级GSD导致的强尺度域偏移,提出连续尺度条件化替代“GSD作为离散token”的做法:通过参数高效微调框架在模型内部注入连续尺度变量,使同一模型参数能随GSD平滑调制表征与对齐策略,减少尺度混叠与泛化退化,提升跨分辨率的遥感图文理解与检索/问答一致性。
GitHub
- [2026-05-11] Blaizzy/mlx-vlm ⭐4694
- [2026-05-11] waybarrios/vllm-mlx ⭐1147
- [2026-05-08] zhengli97/Awesome-Prompt-Adapter-Learning-for-VLMs-CLIP ⭐772
- [2026-05-10] dongyangli-del/EEG_Image_decode ⭐203
- [2026-05-08] ydyhello/Awesome-VLM-Streaming-Video ⭐154
强化学习
arXiv
- Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning
- 赛道归属: 大模型对齐与推理能力提升(LLM-as-a-judge、结构化奖励建模)
- 核心创新点: 提出Rubric-Grounded RL:将奖励分解为可验证的多维标准,由冻结的LLM裁判在辅助“grounding”信息条件下对各维度打分并加权汇总;用“部分得分/分项反馈”替代单一整体分或二元成败信号,提供更密集、更可控的优化梯度,从而提升推理训练的可泛化性与对奖励投机的抑制能力。
- Reinforcement Learning for Exponential Utility: Algorithms and Convergence in Discounted MDPs
- 赛道归属: 风险敏感强化学习(指数效用、折扣MDP的价值学习理论)
- 核心创新点: 针对固定风险厌恶下的指数效用目标,推导两类Q值形式的Bellman扩展,并证明相应算子在$L_\infty$与sup-log/Thompson等度量下为压缩映射,从而给出收敛性与不动点刻画;补齐指数效用RL中“可证明收敛的值迭代/Q学习式算法”理论空白,为风险敏感控制提供可实现的价值型方法。
- Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph 🆕NEW
- 赛道归属: 偏好对齐(DPO 扩展 / 图结构偏好建模)
- 核心创新点: 指出多 rollout/多候选的偏好数据天然形成“偏好图”,而将其坍缩为独立成对样本的传统 DPO 会丢失传递性、引入冗余/冲突监督并导致训练不稳定。该工作的方法论突破在于把对齐目标从“成对比较”提升为“图结构优化”:显式利用同一 prompt 下多候选之间的全局偏好关系(如传递闭包、排序一致性或图上的一致性约束),从而更充分地利用数据结构、减少矛盾梯度信号,并提升对齐训练的稳定性与样本效率。
- Learning CLI Agents with Structured Action Credit under Selective Observation 🆕NEW
- 赛道归属: 智能体强化学习(CLI/工具使用代理)、信用分配与部分可观测RL
- 核心创新点: 利用CLI动作天然的结构化属性(如命令-参数-对象等可分解成分)来做更细粒度的动作信用分配,并在“选择性观测/部分可观测”的交互设定下,将可验证的任务反馈与动作结构信号结合,缓解仅靠终局反馈导致的学习稀疏与不稳定问题,从而提升CLI代理在真实文件系统与在线执行反馈中的可学习性与泛化。
- Interpreting Reinforcement Learning Agents with Susceptibilities 🆕NEW
- 赛道归属: 强化学习可解释性、训练动力学分析
- 核心创新点: 将“susceptibilities(易感性)”从监督学习中的损失扰动响应推广到深度强化学习的遗憾/后悔框架,定义并分析策略对目标扰动的响应,用于揭示训练过程中阶段性能力形成与内部表征变化;在具备非平凡发展阶段的gridworld中验证其能定位“模型在学什么/何时学到”的内部特征。
- KL for a KL: On-Policy Distillation with Control Variate Baseline 🆕NEW
- 赛道归属: LLM后训练、方差降低与稳定训练
- 核心创新点: 将OPD严格重写为策略梯度RL问题,指出其单样本蒙特卡洛梯度方差导致不稳定;提出vOPD,通过引入控制变量基线(典型为价值基线形式)来做方差降低,在不改变目标期望的前提下显著稳定训练,并给出与KL/蒸馏目标一致的推导框架。
- [2026-05-08] SOD: Step-wise On-policy Distillation for Small Language Model Agents 🆕NEW
- 赛道归属: 小模型工具使用/代理推理、长时序蒸馏式RL后训练
- 核心创新点: 提出SOD,面向小语言模型在长时序工具交互中的不稳定与容量受限问题,将传统OPD的“整段轨迹token级监督”改为更细的逐步蒸馏与对齐:在每一步工具调用/中间状态上提供更密集、可控的教师信号与训练分解,从而缓解仅有结果级奖励(如GRPO)过稀疏、以及OPD在TIR场景易发散的问题。
- [2026-05-08] Gradient Starvation in Binary-Reward GRPO: Why Group-Mean Centering Fails and Why the Simplest Fix Works 🆕NEW
- 赛道归属: RLVR/GRPO算法分析与改进(可验证奖励、二值奖励)、优化稳定性
- 核心创新点: 揭示二值奖励下GRPO的组均值中心化优势函数会产生“梯度饥饿”:当组内全对或全错时优势恒为0导致无学习信号;从理论上证明真实退化概率因Jensen不等式必然高于独立伯努利假设,并据此解释实践中的停滞;提出“最简单但有效”的修复(核心是避免纯组均值中心化在退化组上抹零信号,改用能在全对/全错时仍保留梯度的优势/基线处理)。
- [2026-05-08] Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning 🆕NEW
- 赛道归属: LLM推理RL后训练机理分析(token级信号)、可解释性/诊断指标
- 核心创新点: 用注意力熵刻画不同token在RL推理训练中的“上下文支撑集中度”,揭示token级学习信号显著异质;提出并验证token级RL目标具有“稀疏可估计性”(随机抽取约20% token即可保留大部分训练信号),为降低计算/方差提供依据;进一步用注意力熵将token分型,解释哪些token更受RL更新驱动、哪些更噪声化,从而为更精细的token采样/加权策略奠基。
- [2026-05-08] Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States 🆕NEW
- 赛道归属: RLVR策略优化(LLM推理)、低成本基线/价值估计(无需独立critic)
- 核心创新点: 提出从actor内部状态直接估计价值基线的策略优化方法:复用策略模型前向计算中已产生的内部表征/信号来预测baseline,实现几乎零额外开销的方差降低;相较PPO避免训练同规模critic,相较GRPO减少对多rollout组均值稳定性的依赖,从而在可验证奖励场景下以更低成本获得稳定更新。
GitHub
- [2026-05-11] Unity-Technologies/ml-agents ⭐19392 🆕NEW
- [2026-05-11] huggingface/trl ⭐18344 🆕NEW
- [2026-05-12] rllm-org/rllm ⭐5490
- [2026-05-12] natolambert/rlhf-book ⭐1904 🆕NEW
- [2026-05-12] radixark/miles ⭐1310 🆕NEW
HuggingFace Datasets
- [2026-05-03] ADSKAILab/Zero-To-CAD-1m
Zero-to-CAD 1M
One million executable, interpretable CAD construction sequences synthesized entirely without real-world data.
...
-
[2026-04-23] nvidia/Nemotron-Personas-Korea
Nemotron-Personas-Korea우리나라 실제 분포에 기반한 합성 페르소나를 위한 복합 AI 시스템 A compound AI approach to personas grounded in real-world dist...
世界动作模型
arXiv
- [2026-05-08] Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models
- 赛道归属: 世界模型评测与可靠性诊断(World Action Model / 动态一致性)
- 核心创新点: 提出并系统化定义WAM可靠性的关键缺失维度——动作-状态一致性,用于检验“模型生成的未来”是否与其声称的动作序列在动力学上相容,而不仅是视觉上合理;围绕该一致性构建诊断框架/评测思路,将WAM的失效从“看起来对”细化为“动力学不兼容”的可检测问题,从而为后续训练目标、校准与安全执行提供可操作的评价轴。
- [2026-05-07] When to Trust Imagination: Adaptive Action Execution for World Action Models
- 赛道归属: 世界模型驱动的机器人控制(自适应执行 / 想象-现实一致性验证)
- 核心创新点: 将WAM的执行策略从“每次推理固定执行N步”提升为自适应动作执行:把是否继续执行想象动作序列建模为未来-现实验证问题;核心方法论是在执行过程中持续对比模型想象的未来与真实滚动的偏差/一致性,并据此动态决定执行更长的开环段还是提前重规划,从机制上缓解因想象漂移导致的失控与累积误差,实现“何时信任想象”的可决策化。
GitHub
- [2026-05-11] DravenALG/awesome-vla-wam ⭐368
由 Research Daily 自动生成 生成时间: 2026-05-12 01:01:46