AI 每日进展速报 - 2026-04-08
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- [2026-04-07] PoM: A Linear-Time Replacement for Attention with the Polynomial Mixer
- 赛道归属: 推理优化 / 注意力替代(面向生成模型的高效序列建模)
- 核心创新点: 提出Polynomial Mixer作为自注意力的线性时间可替换模块:先用可学习的多项式函数将全序列token聚合为紧凑上下文表示,再让每个token从该表示中检索上下文信息,从而把注意力的二次复杂度降为线性;给出满足“contextual mapping property”的理论证明,保证替换后仍具备通用序列到序列逼近能力;在文本生成、图像生成、3D建模等多域验证可在长序列下显著降算力且性能对齐注意力模型。
- [2026-04-07] Leveraging Image Editing Foundation Models for Data-Efficient CT Metal Artifact Reduction
- 赛道归属: 图像编辑 / 医学影像重建(CT金属伪影去除,扩散基础模型适配)
- 核心创新点: 将CT金属伪影去除重构为“in-context推理”的图像编辑问题:用通用视觉-语言扩散基础模型作为先验,通过LoRA进行参数高效域适配,在仅16–128对配准样本下实现强伪影抑制(数据需求降两个数量级);指出不做域适配会产生“把伪影当自然物体”的幻觉,并以此强调适配对抑制幻觉的必要性;提出多参考条件,在输入伪影图之外提供来自其他受试者的干净解剖示例以锚定解剖结构、提升可解释与保真恢复。
- [2026-04-07] Selective Aggregation of Attention Maps Improves Diffusion-Based Visual Interpretation
- 赛道归属: 文生图可解释性 / 注意力分析(扩散模型解释与诊断)
- 核心创新点: 针对扩散T2I中的cross-attention可视化,提出“选择性聚合”而非对所有head平均:先度量各attention head与目标概念的相关性,仅聚合最相关head的注意力图,从而提升概念定位与可解释性;在扩散分割解释任务上相对DAAM获得更高mIoU;进一步用head相关性差异揭示“相关head更捕捉概念特征、无关head更噪声”,并可用于诊断prompt误解读与控制失败来源。
- [2026-04-07] Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models
- 赛道归属: 文生图安全 / 越狱攻击(对齐与防护评测)
- 核心创新点: 提出并形式化“inscriptive jailbreak(铭文式越狱)”:利用T2I强文本渲染能力,在视觉上无害的场景中嵌入有害文字载荷,从而绕过以“图像内容不当”为核心的多级安全过滤;提出黑盒攻击框架Etch,将对抗提示分解为语义伪装、视觉-空间锚定、字体编码三层,降低联合搜索难度,并用零阶迭代+VLM批评器定位失败层并给出定向修订;在7个模型/2个基准上显著提升攻击成功率,暴露现有对齐对“排版/文字载荷”缺乏感知的盲区。
- [2026-04-07] Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion
- 赛道归属: 3D理解与生成 / 单目3D语义场景补全(稀疏体素建模)
- 核心创新点: 面向单目SSC中“>93%空体素+前景长尾”的结构性不平衡,提出VoxSAMNet以显式稀疏感知与前景调制提升效率与泛化:DSFR模块用共享dummy节点为大量空体素提供捷径旁路,避免在空体素上做冗余计算,同时对占用体素用可变形注意力精炼特征;前景调制策略结合Foreground Dropout缓解前景过拟合、并用Text-Guided Image Filter引入语义引导增强类相关特征,从而提升长尾类别补全质量与整体mIoU。
- [2026-04-07] Improving Controllable Generation: Faster Training and Better Performance via $x_0$-Supervision
- 赛道归属: 可控文生图 / 扩散模型训练优化(控制条件学习加速)
- 核心创新点: 从去噪动力学角度重审可控扩散/flow模型的训练目标,指出沿用基础T2I的标准扩散损失会导致控制分支收敛慢;提出对“干净图像”进行直接监督的$x_0$-supervision(或等价的扩散损失重加权),在不改变推理流程的前提下显著加速收敛;引入mAUCC衡量收敛速度,并在多种控制设定下实现最高2×训练收敛加速,同时提升画质与条件遵循度。
- [2026-04-07] Controllable Image Generation with Composed Parallel Token Prediction
- 赛道归属: 可控图像生成 / 离散生成模型(并行token预测与条件组合)
- 核心创新点: 针对离散条件生成难以“多条件可组合”的问题,提出有理论支撑的离散概率生成过程组合公式,并将masked generation纳入统一框架;通过“Composed Parallel Token Prediction”实现对训练分布外的条件数量/组合的精确定义与生成,并支持对单个条件进行加权强调或否定;结合VQ-VAE/VQ-GAN的离散词表实现显著误差率下降与FID提升,同时通过并行预测带来2.3×–12×实时加速,并可迁移到开源预训练离散T2I模型做细粒度控制。
- [2026-04-07] Probing Intrinsic Medical Task Relationships: A Contrastive Learning Perspective
- 赛道归属: 多任务表征学习 / 医学多模态任务关系建模(对比学习分析)
- 核心创新点: 不以单任务SOTA为目标,而是提出用数据驱动方式刻画“医学视觉任务之间的内在关系”:覆盖30类任务、39个跨模态数据集,构建Task-Contrastive Learning将“任务”嵌入到共享表征空间;通过对比学习让不同模态/不同任务在同一空间中可比较,从而分析哪些任务表征可分、哪些会混叠,以及任务的迭代变换如何在嵌入空间中体现,为后续任务选择、迁移学习与通用医学视觉模型设计提供结构性依据。
- [2026-04-07] A Synthetic Eye Movement Dataset for Script Reading Detection: Real Trajectory Replay on a 3D Simulator
- 赛道归属: 数据生成 / 行为视觉数据合成(眼动视频模拟与标注)
- 核心创新点: 面向隐私敏感且稀缺的行为模态数据,提出“真实轨迹回放+3D仿真”的合成数据管线:从真实视频中提取虹膜轨迹,再通过无头浏览器自动化在3D眼动模拟器中重放生成可自动标注的眼动视频;发布用于“脚本阅读检测”的合成数据集(144段、12小时、25fps),并用统计检验(KS距离)验证合成序列保留源数据时序动力学;通过逐帧对比定位仿真器对阅读尺度运动的敏感性边界(缺少头动耦合),为后续更逼真模拟与下游分类器训练提供可复用基础设施。
- [2026-04-06] MIRAGE: Benchmarking and Aligning Multi-Instance Image Editing
- 赛道归属: 图像编辑 / 指令编辑评测与训练免方法(多实例精细编辑)
- 核心创新点: 针对多相同实例+复合指令下的过编辑与空间错位,提出专门评测多实例一致性的基准(MIRA-Bench等)并给出训练免框架MIRAGE:先用VLM将复杂指令解析为区域级子指令/子目标,实现“按实例分配编辑”;在扩散去噪中采用多分支并行去噪,将目标区域的latent注入全局表示以实现局部精确修改,同时通过参考轨迹约束背景与非目标区域,显著提升实例级对齐与背景保持。
GitHub
- [2026-04-08] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐10707
- [2026-04-08] jd-opensource/JoyAI-Image ⭐393
- [2026-04-08] etkecc/baibot ⭐213 🆕NEW
- [2026-04-08] PKU-YuanGroup/WISE ⭐193
- [2026-04-08] shinpr/mcp-image ⭐95
视频生成/编辑
arXiv
- [2026-04-07] Action Images: End-to-End Policy Learning via Multiview Video Generation
- 赛道归属: 机器人策略学习(基于视频生成的世界动作模型 / Multiview Video Generation for Control)
- 核心创新点: 将7-DoF机器人动作从“低维token/独立动作头”改为像素对齐的Action Images(多视角动作视频),把控制信号显式落到2D像素轨迹与机械臂运动上,使预训练视频骨干网络本身即可充当zero-shot策略(无需额外policy head/动作模块);在同一表示下统一支持动作-视频联合生成、动作条件视频生成与动作标注,提升跨视角/环境迁移与生成-控制一体化能力。
- [2026-04-07] SEM-ROVER: Semantic Voxel-Guided Diffusion for Large-Scale Driving Scene Generation
- 赛道归属: 3D场景生成(面向自动驾驶的大规模多视角一致生成 / 体素-扩散)
- 核心创新点: 提出离散3D表示Σ-Voxfield grid(每个占据体素存固定数量的带颜色表面采样),并在该表示上训练语义条件扩散模型,通过局部体素邻域建模+3D位置编码保证几何结构;用渐进式空间外延在重叠区域扩展到大尺度城市场景;再用deferred rendering直接渲染出多传感器/多轨迹下的写实图像,实现无需逐场景优化的大范围、多视角一致3D生成。
- [2026-04-07] OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control
- 赛道归属: 视频生成(可控相机运动 / 多任务条件解耦)
- 核心创新点: 构建统一框架显式解耦“内容动态”与“相机运动”两条控制轴,实现任意内容条件与相机条件的组合式生成;为解决多模态控制冲突与数据稀缺,提出混合数据集OmniCAM(真实+合成配对)与双层课程协同训练:条件层面按难度逐步引入控制模态,数据层面先在合成数据上学精确控制再迁移到真实数据提升写实度,从而实现复杂相机轨迹下的高质量可控生成。
- [2026-04-07] HumANDiff: Articulated Noise Diffusion for Motion-Consistent Human Video Generation
- 赛道归属: 人体视频生成(扩散模型运动一致性 / 噪声建模与物理一致约束)
- 核心创新点: 用关节化噪声替代独立高斯噪声:在统计人体模板的稠密表面流形上采样3D噪声并建立时空相关性,注入人体拓扑先验以提升运动连贯;提出外观-运动联合学习目标,从关节化噪声同时预测像素外观与物理运动以捕捉运动相关细节(如褶皱);在噪声空间定义几何运动一致性损失约束跨帧物理一致。方法以微调方式接入,不改模型结构,推理时在同一框架内实现I2V并获得内生运动控制。
- [2026-04-07] SCMAPR: Self-Correcting Multi-Agent Prompt Refinement for Complex-Scenario Text-to-Video Generation
- 赛道归属: 文生视频(提示词工程/自动化Prompt优化 / 多智能体自纠错)
- 核心创新点: 将复杂场景T2V的失败归因于提示词歧义与欠约束,提出分阶段多智能体Prompt精炼框架:先基于分类体系进行场景路由以选择策略,再由专门agent生成场景感知的改写策略并执行策略条件改写,最后进行结构化语义校验,检测到违例触发条件式回修,实现闭环自纠错;同时构建仅含复杂提示的基准T2V-Complexity用于可重复评测,验证在复杂场景下显著提升对齐与质量。
- [2026-04-06] Preserving Forgery Artifacts: AI-Generated Video Detection at Native Scale
- 赛道归属: AI生成视频检测 / 视频取证
- 核心创新点: 提出“原生尺度”检测范式:基于Qwen2.5-VL的ViT在可变分辨率与可变时长上直接建模,避免固定resize/crop导致的高频伪造痕迹丢失与空间畸变,从而更好捕捉细粒度伪影与时空不一致;同时构建覆盖15种SOTA生成器、14万+视频的大规模数据集与面向超逼真内容的Magic Videos基准,推动检测训练/评测从“过时分布”迁移到“现代生成模型分布”。
- [2026-04-06] Beyond Few-Step Inference: Accelerating Video Diffusion Transformer Model Serving with Inter-Request Caching Reuse
- 赛道归属: 推理优化 / 视频扩散模型服务加速
- 核心创新点: 提出Chorus跨请求缓存复用机制,突破以往仅在单请求扩散步内做冗余跳步的局限;设计三阶段缓存策略:早期对相似请求进行latent特征全量复用,中期对特定latent区域进行局部复用,并通过Token-Guided Attention Amplification增强条件语义对齐,使“全量复用”可延伸到更后期去噪步;在4-step蒸馏工业模型上实现最高45%加速,覆盖以往缓存方法失效的场景。
- [2026-04-06] UENR-600K: A Large-Scale Physically Grounded Dataset for Nighttime Video Deraining
- 赛道归属: 视频复原 / 视频去雨
- 核心创新点: 构建UENR-600K:60万对1080p配对帧的“物理一致”夜间去雨数据集,使用Unreal Engine将雨建模为3D粒子并与人工光照交互,显式覆盖夜雨的颜色折射、局部照明、遮挡与雨幕等物理现象,弥补2D叠加合成数据的域差;方法上将去雨重构为video-to-video生成任务,改造Wan 2.2视频生成模型作为强生成先验的去雨基线,显著缩小sim-to-real泛化差距并建立新SOTA基线。
- [2026-04-05] DriveVA: Video Action Models are Zero-Shot Drivers
- 赛道归属: 自动驾驶世界模型 / 视觉规划
- 核心创新点: 提出DriveVA联合生成式解码:在共享latent生成过程中同时解码未来视频与动作序列(轨迹),用DiT解码器实现“视觉想象—轨迹规划”强耦合,缓解以往松耦合规划带来的视频-轨迹不一致;继承大规模视频生成模型的运动与物理先验以提升跨域泛化与零样本能力,并引入视频续写策略增强长时滚动一致性,在闭环NAVSIM上取得高PDM并显著降低跨数据集误差与碰撞率。
- [2026-04-05] OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models
- 赛道归属: 生成模型后训练 / 强化学习对齐
- 核心创新点: 提出首个面向Flow-Matching模型的Off-Policy GRPO,用可复用的高质量轨迹回放缓冲区提升样本效率;针对off-policy分布偏移,提出序列级重要性采样校正以保持GRPO裁剪机制的稳定性;进一步发现后期去噪步的off-policy ratio病态,提出截断晚期轨迹以稳定训练,在图像与视频生成上以约34.2%训练步数达到/超过on-policy Flow-GRPO效果。
GitHub
- [2026-04-08] ModelTC/LightX2V ⭐2143
- [2026-04-08] PKU-YuanGroup/Helios ⭐1645
- [2026-04-08] YouMind-OpenLab/awesome-seedance-2-prompts ⭐551
- [2026-04-08] thu-ml/Causal-Forcing ⭐541
- [2026-04-08] Winn1y/Awesome-Human-Motion-Video-Generation ⭐317
音频生成
arXiv
- [2026-04-06] OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
- 赛道归属: 音频生成(视频/文本条件的扩散式音频生成;全景声场/多源音频合成)
- 核心创新点: 提出“Universal Holistic Audio Generation ”任务,强调同时生成屏幕内环境声、屏幕外环境声与人声的完整声场;提出基于flow-matching的扩散框架OmniSonic,在DiT中设计TriAttn三路跨注意力分别建模三类条件,并引入MoE门控自适应分配各条件对生成的贡献,从结构上解决“多源条件互相干扰/权重难平衡”的问题;同时构建覆盖典型“屏幕内/外+人声-环境声”组合的新基准UniHAGen-Bench以系统评测该能力。
- [2026-04-02] CoLoRSMamba: Conditional LoRA-Steered Mamba for Supervised Multimodal Violence Detection
- 赛道归属: 多模态理解(音视频暴力检测;高效跨模态融合/状态空间模型)
- 核心创新点: 提出CoLoRSMamba,用“方向性Video→Audio”的条件化LoRA在不使用token级跨注意力的情况下实现跨模态调制:由VideoMamba的CLS token在每层生成通道级调制向量与稳定门控,直接作用于AudioMamba中选择性状态空间参数(Δ、B、C及步长通路)的投影,从而让音频动态对场景语义自适应、并提升噪声/弱相关音频下的鲁棒性;训练上结合二分类与对称AV-InfoNCE对齐clip级嵌入,强化跨模态一致性;并通过从NTU-CCTV与DVD构建“有音频可用”的过滤子集,提升多模态评测的可比性与公平性。
- [2026-04-02] Woosh: A Sound Effects Foundation Model
- 赛道归属: 音频生成(音效基础模型;文本到音频/视频到音频;编解码与对齐)
- 核心创新点: 发布面向“音效”优化的开源基础模型Woosh,将音频生成系统拆解为可复用的模块化栈:高质量音频encoder/decoder、文本-音频对齐模型、以及文本到音频与视频到音频生成模型,形成从表征学习到条件生成的完整开源基座;同时提供蒸馏版T2A/V2A以在低资源与快速推理场景下保持可用性能,强调“可部署性/效率”作为基础模型能力的一部分;并在公私数据上对关键模块与现有开源方案进行对比评测,给出可复现实验与权重代码,降低社区复用门槛。
GitHub
- [2026-04-08] huggingface/diffusers ⭐33282
- [2026-04-02] Lightricks/LTX-2 ⭐5622
- [2026-04-03] FunAudioLLM/ThinkSound ⭐1300
- [2026-04-06] apocas/restai ⭐483
语言大模型
GitHub
- [2026-04-08] abhigyanpatwari/GitNexus ⭐24935
- [2026-04-06] DeusData/codebase-memory-mcp ⭐1305
- [2026-04-08] clice-io/clice ⭐1202
- [2026-04-08] justrach/codedb ⭐600
- [2026-04-07] proxysoul/soulforge ⭐218
多模态大模型
arXiv
- [2026-04-06] StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing 📖2
- 赛道归属: 具身智能 / 视觉-语言-动作模型研发框架与评测基建
- 核心创新点: 提出模块化“backbone–action head”统一抽象,将VLM骨干与world-model骨干、以及多种动作解码范式纳入可插拔架构,实现跨范式可复现对比;沉淀可复用训练策略(跨具身迁移学习、多模态协同训练)并在不同范式下统一适配;通过统一评测接口打通多套主流仿真与真机基准,提供端到端可复现实验配方,在最少数据工程下即可达到/超过既有方法,显著降低VLA研究迭代与复现门槛。
- [2026-04-02] Multi-Agent Video Recommenders: Evolution, Patterns, and Open Challenges 📖1
- 赛道归属: 多智能体推荐系统 / 视频推荐(综述与研究议程)
- 核心创新点: 系统梳理多智能体视频推荐从早期MARL到LLM驱动架构的演进脉络,提出面向视频域的协作模式分类与协调机制分析框架(理解、推理、记忆、反馈等专职代理的分工与协同);对代表性系统(如MMRF、MACRec、Agent4Rec)抽象出可复用的设计模式与权衡;进一步凝练开放挑战(可扩展性、多模态理解、激励对齐等)并提出混合RL-LLM、终身个性化与自我改进推荐等方向,形成面向下一代MAVRS的技术路线图。
- [2026-04-01] JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation 📖1
- 赛道归属: 多模态评测 / VLM评测基准(日语VQA)
- 核心创新点: 通过对7个既有日语VQA基准进行两轮人工系统化精炼,集中修复“问题歧义、标注错误、无需视觉即可作答”等导致评测失真的数据缺陷;构建JAMMEval以提升评测可靠性,并实证其带来更低的重复运行方差、更强的模型区分度与更贴近真实能力的得分表现,同时开源数据与代码以促进日语VLM可复现实证评估。
- [2026-04-07] HaloProbe: Bayesian Detection and Mitigation of Object Hallucinations in Vision-Language Models
- 赛道归属: 多模态理解可靠性 / 视觉语言模型幻觉检测与解码抑制
- 核心创新点: 揭示用注意力权重检测物体幻觉会被“token位置、重复提及”等混杂因素误导,并导致Simpson悖论,使粗粒度统计结论反转;提出HaloProbe贝叶斯分解框架,将外部描述统计(先验)与内部解码信号(似然)因子化,借助平衡训练隔离内部证据并学习外部特征先验,从而估计token级幻觉后验概率;将该后验作为外部打分信号进行非侵入式解码引导,在不改模型内部的前提下更有效降低幻觉且保持流畅度/效用。
- [2026-04-07] Gym-Anything: Turn any Software into an Agent Environment
- 赛道归属: 计算机使用代理 / 环境自动构建与长时序任务基准
- 核心创新点: 将“把任意软件转成可交互环境”的环境构建过程本身建模为多智能体流水线:编码代理自动编写安装/配置脚本、拉取真实数据并生成可验证证据;审计代理基于质量清单独立核验证据,形成可规模化、可控质量的环境生成机制;据此构建覆盖200款软件、超10K长时序任务的CUA-World及>500步的高难CUA-World-Long,并展示用成功轨迹蒸馏可让2B VLM超过更大模型;同时在测试时引入“审计式VLM复核反馈”提升代理完成率,体现训练与评测阶段的可组合监督/反馈范式。
- [2026-04-07] Lightweight Multimodal Adaptation of Vision Language Models for Species Recognition and Habitat Context Interpretation in Drone Thermal Imagery
- 赛道归属: 多模态迁移与轻量适配 / 热红外遥感生态监测理解
- 核心创新点: 针对RGB预训练VLM与热红外成像的表征鸿沟,提出以“多模态投影器对齐”为核心的轻量适配方案,将热辐射输入映射到可复用的视觉语义空间,避免全量重训;在自建无人机热红外数据集上系统评测闭集/开集提示下的物种识别与计数,并验证开集提示与特定模型组合的性能优势;进一步通过热红外+同步RGB的融合输入,让模型从目标识别扩展到栖息地语境生成(地表覆盖、景观要素、人类扰动),体现从“物体级”到“场景生态语义”的能力迁移路径。
- [2026-04-07] CoStream: Codec-Guided Resource-Efficient System for Video Streaming Analytics
- 赛道归属: 多模态推理优化 / 视频流分析系统与端到端加速
- 核心创新点: 利用视频编解码器在压缩过程中天然产生的时空结构元数据,作为低开销在线信号,统一驱动“解码—ViT视觉编码—LLM prefilling”全链路优化,避免离线训练/剖析或昂贵在线冗余检测;提出codec-guided patch pruning在ViT前进行块级裁剪,并在LLM侧进行选择性KV cache刷新以减少prefill计算;同时直接在压缩码流上操作带来传输侧收益,实现吞吐最高3×、GPU计算最高降87%,且精度损失可控。
- [2026-04-07] Is CLIP Cross-Eyed? Revealing and Mitigating Center Bias in the CLIP Family
- 赛道归属: 多模态表征分析与偏置缓解 / CLIP中心偏置
- 核心创新点: 识别并系统刻画CLIP家族持续存在的“中心偏置”失效模式:对图像边缘目标关注不足导致下游细粒度理解受限;从表征分解与注意力可解释性两条线索定位根因——视觉嵌入聚合阶段的信息丢失(尤其依赖pooling)使与偏中心目标相关概念在最终embedding中消失;提出无需训练的缓解策略(视觉提示、注意力重分配)在不改参数的情况下将注意力引导至非中心区域,从而提升对边缘目标的识别鲁棒性。
- [2026-04-07] "I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?
- 赛道归属: 多模态理解评测 / 幽默与跨模态双关推理
- 核心创新点: 构建多模态双关的生成流水线并据此提出MultiPun数据集,覆盖多类型双关并配套对抗性非双关干扰项,从评测设计上强化“真假双关判别”的难度与可诊断性;系统评估发现主流VLM难以区分双关与干扰,暴露跨模态语义对齐与多义/谐音推理短板;提出提示级与模型级增强策略,在统一指标上带来显著F1提升,为“类人幽默理解”提供可复现基准与改进抓手。
- [2026-04-07] AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis
- 赛道归属: 多模态情感理解与生成 / 基准评测与训练无关提示方法
- 核心创新点: 提出AICA-Bench以“感知-推理-生成”一体化视角覆盖三任务:情绪理解、情绪推理、情绪引导内容生成,形成更贴近真实应用的全链路评测;对23个VLM的系统评估揭示两类关键瓶颈:情绪强度标定不准与开放式描述浅层化;提出训练无关的GAT提示框架,将视觉支架与层级推理结合,以结构化方式约束情绪要素与证据链,从而降低强度误差并提升描述深度,作为可复用强基线。
GitHub
- [2026-04-07] Blaizzy/mlx-vlm ⭐4175
- [2026-04-08] zhengli97/Awesome-Prompt-Adapter-Learning-for-VLMs-CLIP ⭐767
- [2026-04-06] Roots-Automation/GutenOCR ⭐180
- [2026-04-08] opendatalab/mineru-vl-utils ⭐109
- [2026-04-07] ydyhello/Awesome-VLM-Streaming-Video ⭐102
强化学习
arXiv
- [2026-04-05] Fine-grained Analysis of Stability and Generalization for Stochastic Bilevel Optimization 📖6
- 赛道归属: 强化学习理论 / 双层优化泛化与稳定性分析
- 核心创新点: 从统计学习理论视角系统刻画随机双层优化一阶方法的泛化机制:建立“on-average argument stability(平均意义参数稳定性)—generalization gap(泛化差距)”的定量联系;分别对单时间尺度SGD与双时间尺度SGD在NC-NC、C-C、SC-SC三类目标设定下推导稳定性上界;相较既有稳定性分析不再要求每次迭代重置内层参数,使理论覆盖更一般的目标函数与更贴近实际训练流程。
- [2026-04-02] MTI: A Behavior-Based Temperament Profiling System for AI Agents 📖1
- 赛道归属: LLM智能体评测与对齐 / 行为测量与表征
- 核心创新点: 提出MTI作为面向AI智能体的“行为式气质量表”,用结构化考试协议在不依赖自我报告的前提下量化四个相互区分的性情轴;通过两阶段设计将“能力”与“倾向”解耦,避免把行为差异简单视为缺陷;进一步实证揭示轴内可分解的facet结构(如Compliance的formal与stance独立、Resilience的cognitive与adversarial对立)以及RLHF对气质的“重塑方式”(不仅改变轴分数,还引入轴内分化),为对齐与安全提供可操作的行为诊断工具。
- [2026-04-01] LangMARL: Natural Language Multi-Agent Reinforcement Learning 📖1
- 赛道归属: 多智能体强化学习 / LLM智能体协作与语言空间优化
- 核心创新点: 将经典协作式MARL中的信用分配与策略梯度演化引入“语言空间”,针对LLM多智能体在稀疏全局回报下难以改进的信用分配瓶颈:提出agent级语言信用分配机制;在语言表示/生成空间中进行“梯度式演化”以更新策略;并通过回放轨迹总结任务相关因果关系,生成更稠密、可解释的反馈信号以提升收敛与样本效率,同时增强跨任务/环境的泛化。
- [2026-04-06] QED-Nano: Teaching a Tiny Model to Prove Hard Theorems 📖2
- 赛道归属: 数学推理与证明生成(小模型RL后训练 / 可验证奖励)
- 核心创新点: 构建4B小模型QED-Nano的可复现训练流水线,以“三阶段后训练”实现奥赛级证明能力:先从强数学模型蒸馏做SFT获得证明文风与基础能力,再用基于评分细则的RL进行可验证偏好优化,最后引入“推理缓存”把长证明拆成迭代的总结-改写循环以增强训练与测试时推理;在显著低推理成本下超过更大开源模型并逼近部分闭源系统,同时开源数据与代码以促进可复现实验。
- [2026-04-02] DEFT: Distribution-guided Efficient Fine-Tuning for Human Alignment 📖2
- 赛道归属: 大语言模型对齐(RLHF高效微调 / 数据选择)
- 核心创新点: 提出DEFT对齐框架,用“差分分布奖励”同时刻画(1)模型输出分布与(2)偏好数据差异分布之间的偏离程度,据此从原始偏好数据中筛出小而高质量的子集,并将该分布引导信号注入现有对齐方法以约束输出分布迁移;在显著降低训练时间的同时,提升对齐效果并缓解对齐导致的泛化能力下降。
- [2026-04-06] Anticipatory Reinforcement Learning: From Generative Path-Laws to Distributional Value Functions 📖1
- 赛道归属: 强化学习理论 / 非马尔可夫与连续时间RL(分布式价值、路径依赖建模)
- 核心创新点: 提出ARL以在“仅单条观测轨迹”约束下处理跳扩散、结构突变等强路径依赖的非马尔可夫过程:通过将状态提升到signature增强流形,把历史作为动态坐标嵌入;引入自洽场维持对未来“路径分布律”的预期代理,从而把原本随机分支的期望回报估计转化为单次线性、确定性评估,显著降低方差与计算复杂度;并给出收缩性质与重尾噪声下稳定泛化的理论保证,强调利用路径空间拓扑特征实现更稳健的前瞻决策与风险管理。
- [2026-04-06] From Curiosity to Caution: Mitigating Reward Hacking for Best-of-N with Pessimism 📖1
- 赛道归属: LLM推理时对齐与安全 / Reward Model鲁棒性与反奖励黑客(BoN采样)
- 核心创新点: 针对Best-of-N推理时按奖励模型选优易随N增大而“过优化/奖励黑客”的问题,引入RL中的“悲观主义”原则提出caution:训练一个仅在典型响应上拟合的误差模型,用其预测误差作为分布不确定性信号,对异常/分布外候选下调奖励估计(相当于对价值取lower confidence bound);该方法以极低额外开销在推理阶段抑制BoN的OOD投机解,并在简化线性设定下给出优于标准BoN的理论论证,同时将“好奇心/预测误差”重新诠释为可迁移的OOD检测信号(好奇心奖励误差,caution惩罚误差)。
- [2026-04-06] One Model for All: Multi-Objective Controllable Language Models 📖1
- 赛道归属: LLM对齐与可控生成 / 多目标RLHF与偏好条件策略(Pareto可控)
- 核心创新点: 提出MOC将多目标优化原则引入RLHF,训练“单一模型”作为偏好条件策略网络,能够在多奖励权衡下直接生成位于Pareto前沿不同区域的响应;关键在于把MOO作用在策略层面以提升训练效率,使得在单卡上即可微调7B模型;并通过超体积等多解质量指标验证其在可控性(随偏好向量调节输出)、解的多样性/质量以及对未见偏好的泛化方面优于传统“固定平均偏好”的RLHF。
- [2026-04-02] Multi-Agent Video Recommenders: Evolution, Patterns, and Open Challenges 📖1
- 赛道归属: 多智能体推荐系统 / 视频推荐(综述与研究议程)
- 核心创新点: 系统梳理多智能体视频推荐从早期MARL到LLM驱动架构的演进脉络,提出面向视频域的协作模式分类与协调机制分析框架(理解、推理、记忆、反馈等专职代理的分工与协同);对代表性系统(如MMRF、MACRec、Agent4Rec)抽象出可复用的设计模式与权衡;进一步凝练开放挑战(可扩展性、多模态理解、激励对齐等)并提出混合RL-LLM、终身个性化与自我改进推荐等方向,形成面向下一代MAVRS的技术路线图。
- [2026-04-02] Learning from the Right Rollouts: Data Attribution for PPO-based LLM Post-Training 📖1
- 赛道归属: LLM强化学习后训练 / PPO优化与数据归因(rollout筛选、训练加速)
- 核心创新点: 提出I-PPO将数据归因引入PPO式LLM后训练:用基于梯度的影响函数近似为每条episode计算influence score,并以“与验证梯度反对齐”为准则过滤掉会带来负迁移的rollouts(如噪声大、不忠实的CoT推理);该“按贡献选数据”的闭环使PPO不再默认全buffer均有益,兼具内生早停效果,提升样本效率与训练速度,并显著降低不忠实推理带来的性能退化。
GitHub
- [2026-04-08] verl-project/verl ⭐20516
- [2026-04-08] pytorch/rl ⭐3378 🆕NEW
- [2026-04-08] leggedrobotics/robotic_world_model ⭐573 🆕NEW
- [2026-04-08] X-GenGroup/Flow-Factory ⭐318
- [2026-04-08] flatland-association/flatland-rl ⭐61 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-04-08 09:43:41