AI 每日进展速报 - 2026-03-31
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- [2026-03-24] PersonalQ: Select, Quantize, and Serve Personalized Diffusion Models for Efficient Inference 📖2 🆕NEW
- 赛道归属: 个性化文生图模型服务 / 推理优化(检索路由 + 量化压缩)
- 核心创新点: 提出统一框架将“个性化checkpoint选择”和“后训练量化”用同一信号——触发词——贯通:1) Check-in 通过意图感知的混合检索 + 基于LLM的上下文重排,在意图仍歧义时才发起最小化澄清问答,并将提示词重写为插入所选checkpoint的规范触发词以降低误路由;2) Trigger-Aware Quantization 在跨注意力中做触发词感知的混合精度,显式保护触发条件下的K/V行及其注意力权重,同时对其余通路激进量化,从而在不破坏脆弱个性化表征的前提下获得更优压缩-画质折中,支撑大规模个性化模型仓库的高效部署。
- [2026-03-30] TGIF2: Extended Text-Guided Inpainting Forgery Dataset & Benchmark 🆕NEW
- 赛道归属: 图像编辑取证 / 伪造定位与检测基准(数据集与评测)
- 核心创新点: 构建面向“文本引导修复伪造”的更新数据集与基准TGIF2,以覆盖新一代生成式修复模型与更贴近真实攻击面:1) 引入FLUX.1生成的修复编辑样本,检验取证方法对新分布的泛化;2) 加入随机非语义mask以揭示模型/方法对“物体区域”的偏置(在FR全再生场景下尤其明显);3) 系统评测IFL(定位)与SID(检测)并纳入“生成式超分辨率”作为后处理攻击,证明常见增强操作会显著抹除取证痕迹;从而把“FR图像可定位性、跨模型泛化、后处理鲁棒性”变成可量化对比的基准问题。
- [2026-03-30] GEditBench v2: A Human-Aligned Benchmark for General Image Editing 🆕NEW
- 赛道归属: 图像编辑评测 / 人类对齐的基准与自动评审模型
- 核心创新点: 提出更贴近真实用户需求的通用图像编辑评测体系:1) GEditBench v2以1200条真实用户指令覆盖23类任务,并加入开放集类别以评估超出预定义任务的泛化编辑能力;2) 提出PVC-Judge作为“视觉一致性(身份/结构/语义连贯)”的开源成对偏好评审模型,核心在于两条“区域解耦”的偏好数据合成管线,使评审更聚焦编辑前后应保持的区域与属性;3) 构建VCReward-Bench专家标注偏好对用于校准评审与人类一致性,从而让编辑评测从传统指标转向可复现、可扩展的人类一致性判别。
- [2026-03-30] EdgeDiT: Hardware-Aware Diffusion Transformers for Efficient On-Device Image Generation 🆕NEW
- 赛道归属: 文生图 / 端侧生成与硬件感知模型加速(DiT优化)
- 核心创新点: 面向移动NPU的硬件感知DiT结构优化:1) 通过硬件感知优化框架定位在移动数据流上代价高的结构冗余,并进行结构级裁剪/精简,而非仅做通用剪枝或算子替换;2) 在保持DiT可扩展性与表达能力的前提下,实现参数、FLOPs与端侧时延的系统性下降,并在FID-时延维度取得更优Pareto前沿;3) 明确以Qualcomm Hexagon/Apple ANE等NPU为目标,使“可离线、低时延”的端侧高保真生成成为可落地的模型族设计范式。
- [2026-03-30] Rethinking Structure Preservation in Text-Guided Image Editing with Visual Autoregressive Models 🆕NEW
- 赛道归属: 图像编辑 / 视觉自回归编辑与结构保持
- 核心创新点: 从VAR中间表征分布出发重构“可编辑区域定位 + 结构保持”的编辑机制:1) 提出由粗到细的token定位策略,逐步收敛可编辑token集合,在编辑强度与背景保真之间实现可控权衡;2) 识别VAR中间层的结构相关特征,并设计特征注入以在生成过程中显式约束结构一致性,而非仅依赖损失或后处理;3) 引入强化学习自适应注入策略,学习不同尺度/层的注入比例,实现对“编辑一致性 vs 编辑遵循度”的自动调参优化,提升局部与全局编辑的结构稳定性。
- [2026-03-30] Integrating Multimodal Large Language Model Knowledge into Amodal Completion 🆕NEW
- 赛道归属: 图像补全 / 遮挡补全 + MLLM知识注入
- 核心创新点: 提出AmodalCG,将多模态大模型的常识/物理知识显式引入遮挡补全生成闭环:1) 先评估遮挡程度,仅在重遮挡时触发MLLM推理,降低不必要的语言先验干扰与成本;2) 让MLLM同时推断“缺失范围”与“缺失内容”并作为条件指导生成,而不是只在分割阶段使用知识;3) 通过视觉生成模型的迭代细化机制对MLLM可能不准的指导进行纠偏与收敛,提高真实场景下对强遮挡目标的补全可靠性。
- [2026-03-30] ObjectMorpher: 3D-Aware Image Editing via Deformable 3DGS Models 🆕NEW
- 赛道归属: 3D感知图像编辑 / 3DGS可变形编辑与交互式操控
- 核心创新点: 用“实例级3D提升 + 可变形3DGS”把2D编辑歧义转化为几何可控操作:1) 将目标实例通过image-to-3D生成提升为可编辑的3D Gaussian Splatting表示,实现快速、身份保持的3D操控;2) 以用户拖拽控制点为交互接口,采用图结构的非刚性形变并结合ARAP约束,保证形状/姿态变化的物理合理性与局部刚性;3) 通过组合式扩散模块做光照/颜色/边界一致性融合,解决3D编辑后回贴到原图的域差与接缝问题,从而在效率与可控性上优于纯2D拖拽与重优化式3D方法。
- [2026-03-30] LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization 🆕NEW
- 赛道归属: 多图故事可视化 / 图像序列生成(逻辑一致性建模)
- 核心创新点: 将“视觉逻辑(角色-动作-场景的感知与因果连贯)”从隐式期望变为显式建模目标:1) 设计多智能体系统分别负责角色设定落地、因果链抽取、以及跨图一致性验证,把结构化故事规划与图像生成解耦并闭环约束;2) 通过一致性校验机制减少动作断裂、叙事碎片化等典型失败模式,提升多图序列的可读性与因果连贯;3) 构建LogicTale基准,提供强调因果推理与可解释标注的评测资源,并配套自动+人工协议以同时衡量逻辑与感知质量。
- [2026-03-30] AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation 🆕NEW
- 赛道归属: 文生图评测 / 学术插图生成的视觉-逻辑一致性基准
- 核心创新点: 用VQA驱动的分层问答评测替代“直接用VLM整体打分”的不稳定方案:1) 构建AIBench,将论文方法部分抽象为逻辑图,并据此设计四个层级的问题体系,从局部组件到全局流程逐级核验插图是否与文本方法一致;2) 以VQA形式把评测拆解为可验证子命题,降低对评审VLM“长文本+复杂图理解”的oracle能力依赖,提高评测细粒度与可诊断性;3) 同时用VLM评估美学质量,揭示逻辑正确性与美学往往难以同时优化,并指出测试时扩展可同时提升两类能力。
- [2026-03-30] MathGen: Revealing the Illusion of Mathematical Competence through Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图评测 / 数学图形与结构化符号的可验证生成
- 核心创新点: 提出MathGen基准以“可执行验证器”客观评估数学视觉生成能力:1) 覆盖7类数学视觉表达(图形、几何构造、符号布局等)共900题,聚焦“视觉构成正确性”而非文本解题;2) 采用Script-as-a-Judge协议,为每题配套可执行判定脚本,实现确定性、可复现的自动评分,避免主观或VLM评审漂移;3) 实证揭示当前T2I在结构化与精确布局任务上存在系统性短板(高端闭源也仅中等准确率),把“数学视觉保真”明确为独立且困难的能力维度。
GitHub
- [2026-03-31] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐10288 🆕NEW
- [2026-03-31] apocas/restai ⭐481 🆕NEW
- [2026-03-30] Light-Heart-Labs/DreamServer ⭐437 🆕NEW
- [2026-03-30] eleiton/ollama-intel-arc ⭐290 🆕NEW
- [2026-03-30] CorentinGS/chess ⭐75 🆕NEW
视频生成/编辑
arXiv
- [2026-03-30] VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning 🆕NEW
- 赛道归属: 视频生成(自动驾驶场景生成 / 多视角可控生成)
- 核心创新点: 将多视角视觉-语言推理注入长时驾驶视频生成器,在中间表征层融合VLM特征以实现对象级细粒度控制(可用3D对象/图像/文本指定实体)且保持长序列时空一致性;提出多视角视觉语言评估器对生成结果进行自动一致性评测,并构建“生成-评估-再生成”的闭环自纠错机制;在闭环中加入对象级精修模块,针对MV-VLM判定不满足的实体进行局部修复并回灌再生成,从而提升长尾目标可控性与长视频一致性。
- [2026-03-30] LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization 🆕NEW
- 赛道归属: 多图故事可视化 / 图像序列生成(逻辑一致性建模)
- 核心创新点: 将“视觉逻辑(角色-动作-场景的感知与因果连贯)”从隐式期望变为显式建模目标:1) 设计多智能体系统分别负责角色设定落地、因果链抽取、以及跨图一致性验证,把结构化故事规划与图像生成解耦并闭环约束;2) 通过一致性校验机制减少动作断裂、叙事碎片化等典型失败模式,提升多图序列的可读性与因果连贯;3) 构建LogicTale基准,提供强调因果推理与可解释标注的评测资源,并配套自动+人工协议以同时衡量逻辑与感知质量。
- [2026-03-30] FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation 🆕NEW
- 赛道归属: 视频生成(手语视频生成 / 高效推理)
- 核心创新点: 提出无姿态手语生成框架,直接从自然语言到视频的扩散建模,避免“文本→姿态→渲染”的中间表示依赖,从而提升灵活性并减少误差传播;设计可训练滑窗分块注意力,利用时空局部性引入“训练期+推理期一致”的可学习稀疏注意力,解决以往training-free稀疏带来的train-test gap,在保持质量的同时显著加速推理(报告3.07×)。
- [2026-03-29] Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning 🆕NEW
- 赛道归属: 视频推理强化 / 生成模型对齐(RL微调与奖励设计)
- 核心创新点: 将GRPO式强化学习适配到流式视频模型以提升迷宫/导航等需要多步规划的“视频推理”能力,并系统揭示多模态奖励模型在该设定下易崩溃;核心突破在于提出可验证奖励:对结构化环境构造多分量轨迹奖励,对机器人导航提出嵌入空间可验证奖励,用客观任务度量替代主观VLM打分,从而显著提升训练稳定性与泛化,并给出奖励设计的系统性实证结论。
- [2026-03-29] TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets 🆕NEW
- 赛道归属: 视频编辑(文生视频的连续属性控制 / 可控生成)
- 核心创新点: 提出TokenDial,在预训练T2V模型的时空patch-token中间空间学习“语义控制方向”,通过对token施加可加性偏移实现类似滑条的连续强度控制(外观与运动均可),并通过调节偏移幅度获得可预测、连贯的变化且尽量不漂移身份/背景/时序一致性;学习offset时不重训主干,而是利用预训练理解信号:外观用语义方向匹配,运动用运动幅度缩放约束,实现轻量、可迁移的控制接口。
- [2026-03-29] KV Cache Quantization for Self-Forcing Video Generation: A 33-Method Empirical Study 🆕NEW
- 赛道归属: 推理优化(长视频生成系统 / KV Cache压缩与量化)
- 核心创新点: 面向self-forcing长时滚动生成的关键瓶颈(KV cache随长度线性膨胀),给出覆盖33种KV量化与缓存策略的系统性实证评测框架,联合度量显存峰值、时延、压缩率、画质与漂移;提出并验证更可部署的“FlowCache式soft-prune + INT4自适配”工作区间,在较小质量代价下实现约5.4×压缩并显著降低峰值显存;同时揭示“名义压缩率≠真实显存收益”的工程根因(注意力/refresh阶段仍保留或重建BF16大buffer),为后续内存集成优化指明方向。
- [2026-03-28] LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model 🆕NEW
- 赛道归属: 视频生成(动作条件生成 / 人-物交互与操控)
- 核心创新点: 提出面向第一人称场景的人-物操控世界模型LOME,支持以输入图像+文本+逐帧人体动作(身体姿态+手势)为条件生成交互视频;方法上通过训练时联合估计空间动作与环境上下文,把强动作约束“注入”到视频生成中,提升动作跟随与接触丰富交互的物理一致性;通过在多样化egocentric交互数据上微调预训练视频生成模型,实现对未见物体/场景的泛化,并能生成如倒水等具有合理后果的交互动态。
- [2026-03-28] TrackMAE: Video Representation Learning via Track Mask and Predict 🆕NEW
- 赛道归属: 视频表征学习(自监督 / Masked Video Modeling)
- 核心创新点: 提出TrackMAE,将MVM从“隐式学运动”推进到以显式运动轨迹为重建目标:用现成点跟踪器生成稀疏轨迹作为运动监督信号;同时用轨迹引导设计运动感知mask策略,改进随机tube masking以更聚焦动态区域;在像素与特征语义重建之外引入轨迹目标作为互补监督,从而学习到更强的运动敏感表征,在多数据集下游任务上稳定超越现有自监督视频预训练方法。
- [2026-03-28] EFlow: Fast Few-Step Video Generator Training from Scratch via Efficient Solution Flow 🆕NEW
- 赛道归属: 视频生成(从零训练 / 少步扩散与高效注意力)
- 核心创新点: 提出EFlow的few-step从零训练框架,基于solution-flow目标学习从噪声状态t直接映射到s以减少采样步数;为在视频尺度可行,提出Gated Local-Global Attention作为可丢token的混合注意力块,在激进随机token-dropping下仍稳定,降低单步注意力计算;训练上用Path-Drop Guided以廉价弱路径替代昂贵guidance目标,并引入Mean-Velocity Additivity正则保证极低步数下的保真度,实现训练吞吐提升与推理时延大幅下降。
- [2026-03-27] Think over Trajectories: Leveraging Video Generation to Reconstruct GPS Trajectories from Cellular Signaling 🆕NEW
- 赛道归属: 视频生成(跨模态应用 / 地图域轨迹生成与强化优化)
- 核心创新点: 将Sig2GPS从坐标回归/多阶段工程重构为图像到视频生成:把蜂窝信令轨迹渲染到地图图像上,让视频生成模型“绘制”连续GPS路径,实现对地图约束的端到端建模;构建配对的“信令→轨迹视频”数据集以微调开源视频模型;引入轨迹感知的强化学习优化,用奖励直接约束路径连续性与贴合度,提升生成保真与可迁移性(含跨城迁移与下一位置预测扩展)。
GitHub
- [2026-03-31] hao-ai-lab/FastVideo ⭐3332 🆕NEW
- [2026-03-30] ModelTC/LightX2V ⭐2121 🆕NEW
- [2026-03-30] YouMind-OpenLab/awesome-seedance-2-prompts ⭐451 🆕NEW
- [2026-03-31] vargHQ/sdk ⭐247 🆕NEW
- [2026-03-31] OpenDriveLab/SparseVideoNav ⭐65 🆕NEW
HuggingFace Models
- Lightricks/LTX-2.3 🆕NEW
音频生成
arXiv
- [2026-03-30] AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation 🆕NEW
- 赛道归属: 视频编辑(广告短视频自动化剪辑)/ 多模态生成与编辑(视频-音频-文本统一表征)
- 核心创新点: 提出端到端广告视频编辑框架,将视频与音频分别编码后通过残差向量量化离散化为统一token,并与文本对齐,构建共享的“视频-音频-文本”token空间;在此基础上通过多模态对齐+监督微调训练面向编辑的多模态大模型,在同一框架内联合完成素材选择与排序、脚本生成、BGM选择等决策,并将预测token序列映射回可部署的长视频输出,从而提升跨模态一致性与可控性、降低制作与迭代成本。
- [2026-03-25] AVControl: Efficient Framework for Training Audio-Visual Controls 🆕NEW
- 赛道归属: 音视频联合生成的可控生成(模块化控制/LoRA适配)/ 视频生成与编辑控制
- 核心创新点: 提出可扩展的音视频控制训练框架AVControl:基于联合音视频基础模型LTX-2,将每一种控制模态(深度、姿态、边缘、相机轨迹与内参、稀疏运动、修复/扩展、音频变换等)独立训练为单独的LoRA模块;通过“并行画布”把参考信号以额外token注入注意力层,实现无需改动主干架构即可添加新控制模态,并解决将图像in-context控制直接扩展到视频时在结构控制上失效的问题;训练上具备数据与算力高效性(小数据、少步数收敛),同时实现对多控制模态的可插拔组合,并给出面向联合音视频生成模型的模块化控制(含音视频控制)的系统化落地。
GitHub
- [2026-03-30] huggingface/diffusers ⭐33214 🆕NEW
- [2026-03-25] FunAudioLLM/ThinkSound ⭐1274 🆕NEW
语言大模型
arXiv
- [2026-03-25] Composer 2 Technical Report 🆕NEW
- 赛道归属: 代码大模型 / Agentic 软件工程(工具使用与长程任务强化学习)
- 核心创新点: 采用“两阶段训练范式”打造面向真实软件工程的专用智能体模型:先通过持续预训练增强领域知识与潜在编码能力,再进行大规模强化学习以提升端到端编码表现,重点强化长程推理、多步执行准确性与长上下文一致性;同时构建与线上部署一致的 Cursor harness 训练基础设施,使训练时的工具链、交互结构与真实使用环境对齐,并使用高度贴近真实问题的环境进行学习;提出源自大型真实代码库的软件工程基准用于分级评估更高难度的长程工程任务能力,从而形成“真实环境对齐训练 + 强化学习优化执行”的可复用专用模型训练流程。
GitHub
- [2026-03-30] abhigyanpatwari/GitNexus ⭐20842 🆕NEW
- [2026-03-31] clice-io/clice ⭐1188 🆕NEW
- [2026-03-29] DeusData/codebase-memory-mcp ⭐1083 🆕NEW
- [2026-03-28] Anandb71/arbor ⭐102 🆕NEW
- [2026-03-30] Cre4T3Tiv3/gitvoyant ⭐72 🆕NEW
多模态大模型
arXiv
- [2026-03-30] AMIGO: Agentic Multi-Image Grounding Oracle Benchmark 🆕NEW
- 赛道归属: 多模态理解 / Agentic评测基准(多轮交互式视觉定位)
- 核心创新点: 提出长时程、多轮“问答式检索目标图”的评测范式:oracle私选目标图,模型需在严格协议下通过一系列属性型Yes/No/Unsure问题逐步缩小候选并最终命中;用Skip惩罚无效动作以约束真实代理行为。基准重点刻画不确定性下的提问策略、跨轮约束一致性维护、细粒度相似图判别,并引入可控oracle噪声以系统评估鲁棒性与证据核验能力,配套提供轨迹级诊断与交互质量指标体系。
- [2026-03-30] Unsafe2Safe: Controllable Image Anonymization for Downstream Utility 🆕NEW
- 赛道归属: 图像编辑 / 隐私保护数据构建(可控匿名化)
- 核心创新点: 提出端到端自动化“检测—改写”匿名化流水线:先用VLM识别隐私风险并生成“私有/公开”双字幕,再由LLM基于公开字幕产出结构化、去身份化的编辑指令;随后用指令驱动扩散编辑仅重写敏感区域,在保持全局结构与任务语义的同时中和身份信息。方法论上将多模态风险审查、双提示约束与扩散局部编辑耦合,并构建统一评测维度(质量/作弊/隐私/效用);同时利用自动生成三元组微调编辑器以进一步提升隐私-保真权衡。
- [2026-03-30] Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering 🆕NEW
- 赛道归属: 多模态理解 / 图表问答鲁棒推理(反欺骗Agent框架)
- 核心创新点: 提出双路径agentic框架以对抗“误导性图表”:将感知与核验解耦——诊断视觉路径通过策略性ROI裁剪捕捉结构异常(如坐标轴反转),OCR数据路径提供数值级落地;再用Agentic Summarizer做跨模态冲突消解与一致性汇总。训练上采用“Oracle-Informed SFT + Deception-Aware GRPO”两阶段对齐:先蒸馏正确怀疑式推理,再用对抗式强化优化惩罚视觉陷阱、强化逻辑一致性,从而让较小开源骨干获得显著鲁棒性提升。
- [2026-03-30] XSPA: Crafting Imperceptible X-Shaped Sparse Adversarial Perturbations for Transferable Attacks on VLMs 🆕NEW
- 赛道归属: 多模态安全 / 对抗攻击(VLM可迁移稀疏扰动)
- 核心创新点: 提出几何先验强约束的稀疏攻击XSPA:将扰动限制在两条对角线交叉形成的“X形”像素集合(极低预算、固定形状),在该稀疏支撑上联合优化分类目标、跨任务语义引导(促使caption/VQA语义漂移)以及幅值与线内平滑正则,实现对共享视觉-文本嵌入空间的可迁移破坏。该方法以更苛刻的攻击约束揭示VLM跨任务共享表征的系统性脆弱性。
- [2026-03-30] Domain-Invariant Prompt Learning for Vision-Language Models 🆕NEW
- 赛道归属: 推理优化 / Prompt学习(CLIP域泛化)
- 核心创新点: 提出DiCoOp,将CoOp软提示学习扩展到域泛化:通过对抗训练引入“域不变性”约束,使学习到的上下文向量在保持类别判别性的同时,抑制对训练域统计特征的依赖,从而提升跨未见域的零样本/少样本识别稳健性。方法关键在于把“prompt参数”作为域对齐对象,用对抗目标显式消除域可分信息。
- [2026-03-30] Hydra: Unifying Document Retrieval and Generation in a Single Vision-Language Model 🆕NEW
- 赛道归属: 多模态检索与生成统一 / 文档理解系统(单模型双头)
- 核心创新点: 提出单一VLM内统一“检索+生成”的Hydra双头机制:用可切换的单个LoRA适配器实现模式切换——开启时输出ColBERT式late-interaction多向量嵌入用于检索,关闭时恢复原模型自回归生成且保证输出字节级一致。并系统总结三项关键工程约束(注意力模式恢复、lm_head保持、KV-cache感知解码)以避免“权重恢复正确但生成悄然退化”的隐性失败;在显著降低峰值显存的同时维持检索性能,并展示向音频/视频检索嵌入的可扩展性。
- [2026-03-30] The Scaffold Effect: How Prompt Framing Drives Apparent Multimodal Gains in Clinical VLM Evaluation 🆕NEW
- 赛道归属: 多模态评测与可靠性 / 临床VLM评估偏差分析(提示脚手架效应)
- 核心创新点: 揭示并量化“脚手架效应”:在影像本身不含个体级诊断信号的设定下,仅在提示中提及“有MRI可用”就能显著抬升小模型指标,且该提升与是否提供影像无关,属于领域特定的模态塌缩/提示诱导伪增益。方法上通过对比置信度分析与专家审阅,系统证明模型会编造影像依据;并指出偏好对齐虽能抑制提及MRI,但会将性能拉回随机水平,强调临床多模态评测需避免表面化prompt framing伪提升。
- [2026-03-30] SEA: Evaluating Sketch Abstraction Efficiency via Element-level Commonsense Visual Question Answering 🆕NEW
- 赛道归属: 多模态评测 / 草图理解与抽象度量(无参考指标与数据集)
- 核心创新点: 提出SEA无参考草图抽象效率指标:以“类别常识定义的关键元素集合”为中间语义单位,调用VQA模型判断草图是否表达这些元素,并以“语义保留/笔画经济性”量化抽象效率,避免依赖参考图或低层特征。同步构建CommonSketch:首个带元素级语义标注的大规模草图数据集(含caption与元素标注),使得对VLM的元素级草图理解与抽象评估可系统化、可对齐人类判断。
- [2026-03-30] Explaining CLIP Zero-shot Predictions Through Concepts 🆕NEW
- 赛道归属: 多模态可解释性 / 零样本识别解释(概念空间投影)
- 核心创新点: 提出EZPC,在不引入额外概念监督的前提下,用“语言学习的概念空间”解释CLIP零样本预测:将CLIP图文联合嵌入投影到可读概念维度,并通过对齐+重构联合目标约束投影既保持CLIP原有语义结构(忠实性),又产生可解释的概念激活(可读性)。核心突破在于把开放词表预测与人类概念对齐起来,同时尽量不牺牲零样本精度。
- [2026-03-30] $AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning 🆕NEW
- 赛道归属: 多模态推理与决策 / 自动驾驶端到端规划(P3链式思维+强化微调)
- 核心创新点: 提出统一的Perception-Prediction-Planning链式思维框架:通过结构化CoT把感知输出作为预测与规划的条件输入,并让预测与感知共同约束最终规划,解决“直接出规划”或“三模块割裂”导致的协同不足。构建P^3-CoT数据集,并提出分层强化微调算法P^3-GRPO,对三阶段提供渐进式监督与奖励分解;同时引入“细致/快速”双思考模式在推理成本与性能间可控切换,实现更安全、可解释的驾驶决策。
GitHub
- [2026-03-30] Blaizzy/mlx-vlm ⭐2564 🆕NEW
- [2026-03-28] TIGER-AI-Lab/VLM2Vec ⭐612 🆕NEW
- [2026-03-27] zli12321/Vision-Language-Models-Overview ⭐550 🆕NEW
- [2026-03-30] shuyansy/Earth-Observation-VLMs ⭐116 🆕NEW
- [2026-03-29] xytian1008/VAPO ⭐99 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-03-31 02:25:33