AI 每日进展速报 - 2026-03-02
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- [2026-02-26] Instruction-based Image Editing with Planning, Reasoning, and Generation 📖2 🆕NEW
- 赛道归属: 指令驱动图像编辑
- 核心创新点: 提出将“规划-推理-生成”一体化的多模态模型,用统一框架打通编辑任务中的场景理解与图像生成,避免以往依赖LLM+分割+编辑模型的串联式流水线带来的模态割裂与误差累积。通过在编辑前显式进行步骤规划与视觉语义推理,提升对复杂指令、对象关系与全局一致性的编辑质量。
- 一句话总结: 用端到端多模态的规划推理机制连接理解与生成,使指令图像编辑更可靠、更一致、可控性更强。
- [2026-02-23] Closing the gap in multimodal medical representation alignment 📖2
- 赛道归属: 多模态医学表征学习(图文对齐/表示对齐)
- 核心创新点: 针对CLIP式对比学习在医学多模态对齐中引发的“模态鸿沟”(潜空间稀疏、语义碎片化)问题,系统分析其非预期优化行为,并提出更贴近真实语义对齐目标的对齐策略以缩小模态间分布差异。方法重点在于纠正对比损失带来的错误几何结构,从而提升跨模态语义一致性。
- 一句话总结: 通过诊断并修复对比学习导致的模态鸿沟,该工作为医学场景的可靠图文共享表征提供了更稳健的对齐路径。
- [2026-02-25] GeoDiv: Framework For Measuring Geographical Diversity In Text-To-Image Models 📖1
- 赛道归属: 文生图评测与公平性(地理多样性/偏见评估)
- 核心创新点: 提出GeoDiv评测框架,利用大语言模型与视觉-语言模型对T2I生成结果进行“地理语义”层面的可解释评估,避免仅依赖人工标注数据集或表层视觉相似度指标。框架将地理多样性、刻板印象与区域表征偏差转化为可量化、可诊断的评测信号。
- 一句话总结: GeoDiv为文生图模型提供了可解释、可扩展的地理多样性与偏见评估工具,帮助系统性发现“世界表征”失真问题。
- [2026-02-24] When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance 📖1
- 赛道归属: 文生图安全对齐(扩散模型安全引导/多类有害冲突消解)
- 核心创新点: 指出现有安全引导将多类有害内容“平均化”成单一避让方向,无法建模不同伤害类别间的冲突与耦合;提出自适应安全引导,在生成过程中按类别动态调节引导强度与方向以解决多类别冲突。方法层面强调“按需分解+自适应融合”的安全梯度/引导策略,而非静态关键词区间。
- 一句话总结: 该工作让扩散模型在面对多类安全约束时能更精细地权衡与避险,提升安全性同时减少对正常生成质量的误伤。
- [2026-02-26] SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation 🆕NEW
- 赛道归属: 3D布局可控文生图 / 遮挡感知生成
- 核心创新点: 针对3D布局条件生成中长期被忽视的“遮挡推理”问题,提出显式建模遮挡关系的SeeThrough3D,通过遮挡感知的3D场景表示与生成机制,约束物体间前后关系与深度一致性,从而生成尺度与几何更合理的部分遮挡物体。相比仅遵循布局但忽略精确遮挡的现有方法,该方案强化了跨物体交互的结构正确性。
- 一句话总结: 通过显式遮挡建模补齐3D可控生成的关键短板,让布局条件下的多物体场景在深度与遮挡关系上更真实可信。
- [2026-02-26] Decomposing Private Image Generation via Coarse-to-Fine Wavelet Modeling
- 赛道归属: 隐私保护图像生成(差分隐私训练/频域建模)
- 核心创新点: 提出基于小波的coarse-to-fine频域差分隐私框架,将生成建模分解到不同频段/尺度,在DP噪声注入时对高频纹理等敏感质量维度进行更精细的结构化处理,缓解DP-SGD“全参数均匀加噪”导致的纹理崩坏。核心突破在于用频谱分解重构DP训练的噪声分配与建模顺序。
- 一句话总结: 通过频域分解实现更“懂画质”的DP训练,该工作在隐私保证与图像质量之间取得更优折中。
- [2026-02-26] PATRA: Pattern-Aware Alignment and Balanced Reasoning for Time Series Question Answering
- 赛道归属: 多模态时间序列问答(时序模式对齐/推理训练)
- 核心创新点: 提出PATRA,通过“模式感知对齐”显式建模趋势、季节性等时序结构,避免将时间序列粗暴当作文本/图像输入;并通过“平衡推理”训练机制抑制简单任务目标的主导效应,促使模型学习更深层的逻辑推理能力。方法突破在于把时序模式表征与训练目标配比共同纳入可控优化。
- 一句话总结: PATRA让LLM在时间序列QA中既看得懂模式又推得动逻辑,提升复杂问题的可靠性。
- [2026-02-26] WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval
- 赛道归属: 组合式图像检索(零样本CIR/训练免适配)
- 核心创新点: 提出WISER训练免的ZS-CIR框架,不再将“参考图+修改文本”强行折叠为单一模态,而是进行更宽的候选搜索与更深的语义推断,并对T2I式与I2I式检索信号进行自适应融合。方法论突破在于以“多路径检索+自适应融合”同时保留细粒度视觉细节与文本修改意图。
- 一句话总结: WISER在无需三元组训练数据的前提下显著增强组合检索的鲁棒性与可用性。
- [2026-02-26] DMAligner: Enhancing Image Alignment via Diffusion Model Based View Synthesis
- 赛道归属: 图像对齐与配准(扩散模型视角合成/对齐增强)
- 核心创新点: 提出DMAligner,用扩散模型进行“面向对齐的视图合成”来替代/补充传统光流扭曲,在遮挡与光照变化下生成更一致的对齐结果。核心突破是将对齐问题转化为条件生成的视图重建,通过生成式先验提升对齐质量与下游稳定性。
- 一句话总结: DMAligner用生成式视图合成绕开光流在复杂场景的脆弱性,提升图像对齐的视觉质量与可靠性。
- [2026-02-26] Where Vision Becomes Text: Locating the OCR Routing Bottleneck in Vision-Language Models
- 赛道归属: 多模态理解与可解释性(VLM OCR信息路由/因果分析)
- 核心创新点: 通过因果干预定位VLM中OCR信息进入语言流的关键瓶颈:对比原图与“文本抹除/修补”图像的激活差异,系统刻画不同架构中OCR路由的主导层/模块位置。方法突破在于用可操作的反事实输入与激活差分,给出架构相关的可解释“路由瓶颈”诊断。
- 一句话总结: 该工作把VLM“读字能力”从黑箱变为可定位的系统瓶颈,为OCR能力增强与失效排查提供了直接抓手。
GitHub
- [2026-03-02] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐8396
- [2026-03-01] Dreamy-rain/gemini-business2api ⭐921
OpenAI-compatible API for Gemini Business with multi-account load balancing and image generation | 将 Gemini Business 转为 OpenAI 兼容接口,支持多账户负载均衡与图像生成、视频生...
- [2026-03-01] etkecc/baibot ⭐192
- [2026-03-02] WP-Autoplugin/wp-banana ⭐83 🆕NEW
- [2026-03-01] erroralex/Latent-Library ⭐63
视频生成/编辑
arXiv
- [2026-02-26] ColoDiff: Integrating Dynamic Consistency With Content Awareness for Colonoscopy Video Generation
- 赛道归属: 医学视频生成(扩散模型/可控生成)
- 核心创新点: 提出基于扩散模型的ColoDiff,将“动态一致性”与“内容感知”的生成目标显式结合,以在复杂肠道形变、病灶多样性与多成像模态下同时保证时序稳定与临床属性可控。通过面向结肠镜场景的结构/内容约束设计,提升生成视频的可诊断信息密度与可控性。
- 一句话总结: 在数据稀缺的临床场景中,ColoDiff以更强的时序一致性与属性控制能力生成高质量结肠镜视频,提升医学数据合成的实用价值。
- [2026-02-26] Uni-Animator: Towards Unified Visual Colorization
- 赛道归属: 图像/视频上色(草图到图像/视频的生成与编辑,DiT)
- 核心创新点: 提出基于Diffusion Transformer的统一框架,同时覆盖图像与视频草图上色,并针对单/多参考的颜色迁移不准与细节丢失,引入“视觉参考增强”以提升参考信息的可用性与高频细节保真。面向视频进一步强化时序一致性,降低大运动场景中的闪烁与运动伪影。
- 一句话总结: Uni-Animator用一个统一的DiT框架把图像与视频草图上色打通,在参考上色精度、细节与时序稳定性上更均衡。
- [2026-02-26] The Trinity of Consistency as a Defining Principle for General World Models
- 赛道归属: 世界模型(视频生成驱动的物理一致性与推理框架)
- 核心创新点: 提出“Consistency Trinity(三位一致性)”作为通用世界模型的定义性原则,用以统一刻画数据驱动视频生成在物理规律学习、可模拟性与可推理性上的关键约束。该工作从原则层面连接视频生成扩展规律与统一多模态模型的架构趋势,为评测与设计世界模型提供可操作的理论坐标系。
- 一句话总结: 该工作用“三位一致性”把世界模型的目标从“能生成”提升到“物理一致、可复现、可推理”的可检验标准。
- [2026-02-26] PackUV: Packed Gaussian UV Maps for 4D Volumetric Video
- 赛道归属: 4D体积视频重建与表示(Gaussian Splatting/视频编码友好)
- 核心创新点: 提出PackUV,用“Packed Gaussian UV Maps”将4D高斯表示映射到可打包的UV空间,在长序列、大运动与遮挡/显隐变化下提升时序一致性与稳定性。关键突破在于让高斯体积视频输出与传统视频编码/传输管线兼容,从表示层面解决存储与流式分发的落地障碍。
- 一句话总结: PackUV把4D高斯体积视频变得更稳定且更“可编码”,推动体积视频从研究走向可规模化存储与传输。
- [2026-02-26] UCM: Unifying Camera Control and Memory with Time-aware Positional Encoding Warping for World Models
- 赛道归属: 世界模型/视频生成(相机控制 + 长时记忆一致性)
- 核心创新点: 提出UCM,通过“时间感知的位置编码扭曲”在生成过程中统一相机控制与记忆机制,使模型在场景被重复访问时保持长期内容一致,并能根据用户输入实现更精确的相机运动控制。相较显式3D重建或直接复用历史帧的方法,该方案在开放场景与细粒度结构上兼顾灵活性与一致性。
- 一句话总结: UCM用时间感知的位置编码变换把“可控相机运动”和“可记忆的世界一致性”统一到同一生成机制中。
- [2026-02-26] SPATIALALIGN: Aligning Dynamic Spatial Relationships in Video Generation
- 赛道归属: 文生视频对齐优化(动态空间关系/偏好优化)
- 核心创新点: 提出SPATIALALIGN作为自我改进框架,面向文本提示中的“动态空间关系”对T2V模型进行对齐增强。方法上采用零阶正则化的DPO进行微调,并设计基于几何的DSR-SCORE作为可优化的反馈信号,从而在不依赖昂贵标注的情况下提升空间关系随时间变化的正确性。
- 一句话总结: SPATIALALIGN用几何评分+偏好优化,让文生视频更可靠地遵守“物体之间如何运动与相对位置如何变化”的文本约束。
- [2026-02-26] Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache
- 赛道归属: 推理优化(扩散模型采样加速/缓存)
- 核心创新点: 提出DPCache,将扩散去噪过程视为“路径规划”,利用对整条去噪轨迹全局结构的建模来决定缓存复用/预测策略,而非仅用固定或局部自适应步长。该方法训练无关,在保持生成质量的同时减少多步采样的计算开销,适用于图像与视频扩散推理加速。
- 一句话总结: DPCache以“全局轨迹视角”改造缓存加速策略,在无需训练的前提下更高效地加速扩散采样。
- [2026-02-26] BetterScene: 3D Scene Synthesis with Representation-Aligned Generative Model
- 赛道归属: 3D场景生成/新视角合成(稀疏输入 + 扩散先验)
- 核心创新点: 提出BetterScene,利用在海量视频上预训练的Stable Video Diffusion作为强先验,在推理阶段对极稀疏、非受控照片输入进行表示对齐的生成式补全,以提升NVS的视角一致细节恢复并抑制伪影。其方法论重点在于将“视频扩散的时空先验”与3D/NVS表示进行对齐,从而在不增加采集成本的情况下增强真实场景泛化。
- 一句话总结: BetterScene把大规模视频扩散模型的先验迁移到稀疏照片的新视角合成中,显著改善真实场景的细节与一致性。
- [2026-02-25] Flow Matching is Adaptive to Manifold Structures
- 赛道归属: 生成建模理论(Flow Matching/连续归一化流)
- 核心创新点: 从理论与机制层面论证Flow Matching对数据“流形结构”具有自适应性:在高维但低维流形集中的数据分布下,学习到的速度场/ODE采样会自然贴合流形几何,从而解释其训练稳定性与经验性能优势。该工作为在图像/视频等流形数据上的流式生成提供更坚实的理论依据与方法选择指导。
- 一句话总结: 该工作解释了为何Flow Matching在流形数据上更“顺着数据几何走”,为替代扩散的生成路线提供理论支撑。
- [2026-02-25] Neu-PiG: Neural Preconditioned Grids for Fast Dynamic Surface Reconstruction on Long Sequences 🆕NEW
- 赛道归属: 动态3D重建 / 长序列点云表面重建
- 核心创新点: 提出一种“神经预条件化网格”的潜在网格编码,将空间特征以网格形式参数化并用于形变优化,从而显著改善长序列动态表面重建中的优化条件数与收敛效率。相较于逐帧增量形变带来的漂移与高耗时,以及依赖类别训练的复杂模型,该方法以更轻量的学习/编码方式实现时间一致性与快速优化,适配超长序列与非结构化点云输入。
- 一句话总结: Neu-PiG通过预条件化的潜在网格编码加速并稳定长序列动态点云的形变优化,实现更快、更不易漂移的时间一致动态表面重建。
GitHub
- [2026-03-01] hao-ai-lab/FastVideo ⭐3112
- [2026-03-01] leofan90/Awesome-World-Models ⭐1264 🆕NEW
- [2026-03-01] alex4727/MotionStream ⭐514 🆕NEW
- [2026-03-01] thu-ml/Causal-Forcing ⭐402 🆕NEW
- [2026-03-01] YouMind-OpenLab/awesome-seedance-2-prompts ⭐188
语言大模型
arXiv
- [2026-02-26] Instruction-based Image Editing with Planning, Reasoning, and Generation 📖2 🆕NEW
- 赛道归属: 指令驱动图像编辑
- 核心创新点: 提出将“规划-推理-生成”一体化的多模态模型,用统一框架打通编辑任务中的场景理解与图像生成,避免以往依赖LLM+分割+编辑模型的串联式流水线带来的模态割裂与误差累积。通过在编辑前显式进行步骤规划与视觉语义推理,提升对复杂指令、对象关系与全局一致性的编辑质量。
- 一句话总结: 用端到端多模态的规划推理机制连接理解与生成,使指令图像编辑更可靠、更一致、可控性更强。
- [2026-02-26] Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization 📖1 🆕NEW
- 赛道归属: LLM智能体强化学习(探索与记忆增强)
- 核心创新点: 提出EMPO²混合强化学习框架,将“记忆驱动探索”与“on-policy + off-policy”联合优化结合:一方面利用外部/内部记忆促进新状态发现,另一方面通过离策略更新提升在无记忆条件下的鲁棒性与泛化。该设计针对“依赖记忆导致脆弱”的常见问题,实现探索能力与稳健性的兼顾。
- 一句话总结: 用记忆增强探索、用混合策略训练保鲁棒,缓解LLM智能体在新环境中“找不到新状态、离开记忆就退化”的核心瓶颈。
- [2026-02-24] An Expert Schema for Evaluating Large Language Model Errors in Scholarly Question-Answering Systems 📖1
- 赛道归属: LLM评测与可靠性(学术问答/错误分析框架)
- 核心创新点: 构建并验证一套面向“学术问答系统”的专家级错误分类与标注schema,强调领域专家在真实科研语境下对错误的判定维度(而非仅依赖自动指标)。该schema将错误类型与可操作的诊断信号对齐,支持更细粒度地定位幻觉、证据使用不当、推断越界等问题。
- 一句话总结: 为学术场景的LLM问答提供了可复用的“专家视角”错误本体,提升可靠性评估的可解释性与可行动性。
- [2026-02-26] MediX-R1: Open Ended Medical Reinforcement Learning 🆕NEW
- 赛道归属: 医疗多模态大模型对齐(开放式回答的强化学习)
- 核心创新点: 提出MediX-R1开放式医疗RL框架,用Group-based RL对视觉-语言骨干进行微调,并设计面向医疗推理的复合奖励:包含LLM裁判的严格YES/NO语义正确性奖励,以及基于医学嵌入的语义相似奖励以覆盖同义改写,从而把训练目标从选择题扩展到临床可用的自由文本回答。
- 一句话总结: 通过“医疗专用复合奖励 + 组式RL”,把医疗MLLM从答题式评测推进到更贴近临床表达的开放式推理与作答。
- [2026-02-26] Utilizing LLMs for Industrial Process Automation 🆕NEW
- 赛道归属: 工业软件工程LLM应用(工业过程自动化/专用语言)
- 核心创新点: 聚焦工业过程自动化领域的专用/私有语言与工程流程,系统化评估与总结LLM在低公开语料、强领域约束场景下的可用性与实践路径(如提示策略、知识注入、验证与安全约束),弥补现有研究过度偏向Python等通用语言的空白。
- 一句话总结: 为“数据稀缺且高度专用”的工业自动化编程场景提供LLM落地方法论与边界认知。
- [2026-02-26] Toward Expert Investment Teams:A Multi-Agent LLM System with Fine-Grained Trading Tasks 🆕NEW
- 赛道归属: 金融交易多智能体系统(任务分解与可解释决策)
- 核心创新点: 提出面向真实投研流程的多智能体LLM框架,将投资分析拆解为细粒度、可执行的交易任务链(而非抽象角色指令),以结构化分工提升推理稳定性与决策透明度,并更贴近投研团队的协作工作流。
- 一句话总结: 用“细粒度任务分解”的多智能体协作替代泛化角色扮演,让LLM交易系统更可控、更可解释、更贴近真实投研。
- [2026-02-26] LLM Novice Uplift on Dual-Use, In Silico Biology Tasks 🆕NEW
- 赛道归属: LLM安全与人类增益评测(生物双用途/生物安全)
- 核心创新点: 通过多模型、多基准的人类受试“uplift”实验,直接测量LLM是否能让生物领域新手在双用途的纯计算任务上超越“仅用互联网资源”的表现,从评测范式上把“模型能力”推进到“对人类能力提升与风险外溢”的因果对比。
- 一句话总结: 用严格的人类对照实验量化LLM对生物双用途任务的“新手增益”,为科学加速与安全风险评估提供关键证据链。
- [2026-02-26] Evaluating Zero-Shot and One-Shot Adaptation of Small Language Models in Leader-Follower Interaction 🆕NEW
- 赛道归属: 小语言模型SLM评测与适配(人机交互/机器人角色识别)
- 核心创新点: 面向资源受限机器人场景,系统评估小语言模型在leader-follower交互中的零样本/一样本适配能力,用以替代高延迟大模型;重点在于对“实时角色分类”这一HRI关键子任务建立可复现的适配与性能基线,明确SLM在低样本条件下的可用边界。
- 一句话总结: 给出SLM在HRI实时角色分配任务上的零/一样本能力画像,为端侧部署提供依据。
- [2026-02-26] ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding 🆕NEW
- 赛道归属: 多模态推理增强(训练外推理/引导式解码)
- 核心创新点: 提出ThinkOmni,通过“Guidance Decoding(引导式解码)”把文本大推理模型的推理能力迁移到全模态场景:在不进行或尽量少进行额外训练的前提下,用解码阶段的引导机制增强omni-modal LLM的复杂推理表现,绕开高质量多模态推理数据与高算力再训练的瓶颈。
- 一句话总结: 以解码期引导替代重训练,把强文本推理能力更低成本地“抬升”到全模态推理。
- [2026-02-26] A Mixture-of-Experts Model for Multimodal Emotion Recognition in Conversations 🆕NEW
- 赛道归属: 多模态对话情感理解(MoE融合与上下文建模)
- 核心创新点: 提出MiSTER-E模块化MoE框架,将对话情感识别中的两大难点解耦:分别用语音/文本专家进行模态内的上下文时序建模,再通过MoE机制实现跨模态融合,从结构上提升多轮对话中的信息对齐与鲁棒融合能力。
- 一句话总结: 用“模态专家 + MoE融合”的解耦设计,更稳健地把语音与文本线索整合到多轮对话情感识别中。
GitHub
- [2026-03-02] sgl-project/sglang ⭐23928
- [2026-03-02] PaddlePaddle/PaddleFormers ⭐12985 🆕NEW
- [2026-03-02] NVIDIA/TensorRT-LLM ⭐12976
- [2026-03-02] johnhuang316/code-index-mcp ⭐794 🆕NEW
- [2026-03-02] testtimescaling/testtimescaling.github.io ⭐88
HuggingFace Datasets
- [2026-02-27] nvidia/Nemotron-Terminal-Corpus 🆕NEW
Terminal-Corpus: Large-Scale SFT Dataset for Terminal Agents
Terminal-Corpus is a large-scale Supervised Fine-Tuning (SFT) dataset designed...
多模态大模型
arXiv
- [2026-02-26] Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning 📖1 🆕NEW
- 赛道归属: 多模态理解(视觉-语言推理数据偏差分析/评测)
- 核心创新点: 该工作将VLM推理不足归因于训练语料中的“报告偏差”(人类描述图像时倾向省略显而易见但对推理监督关键的隐含信息),并系统性分析主流VLM训练数据中这种偏差如何削弱可学习的推理信号。方法上强调从数据生成与标注语用学角度解释“规模化不等于推理提升”,为改进数据构建与评测提供可操作的诊断框架。
- 一句话总结: 通过揭示报告偏差对视觉-语言推理学习信号的系统性抑制,该工作说明仅靠扩大数据与模型规模难以补齐推理能力,关键在于改造数据监督形态。
- [2026-02-25] GeoDiv: Framework For Measuring Geographical Diversity In Text-To-Image Models 📖1
- 赛道归属: 文生图评测与公平性(地理多样性/偏见评估)
- 核心创新点: 提出GeoDiv评测框架,利用大语言模型与视觉-语言模型对T2I生成结果进行“地理语义”层面的可解释评估,避免仅依赖人工标注数据集或表层视觉相似度指标。框架将地理多样性、刻板印象与区域表征偏差转化为可量化、可诊断的评测信号。
- 一句话总结: GeoDiv为文生图模型提供了可解释、可扩展的地理多样性与偏见评估工具,帮助系统性发现“世界表征”失真问题。
- [2026-02-24] Inner Speech as Behavior Guides: Steerable Imitation of Diverse Behaviors for Human-AI coordination 📖1
- 赛道归属: 多模态智能体 / 模仿学习与可控行为生成
- 核心创新点: 将“内在言语”作为显式的行为指导信号,引入到模仿学习中以刻画人类行为的多样性与非马尔可夫(长程依赖)特征。通过在推理时对内在言语进行条件化,实现对同一任务下不同行为风格/策略的可控“转向”。
- 一句话总结: 用可操控的“内在言语”把人类式多样行为注入模仿学习,使人机协作中的策略选择更灵活、可解释、可调控。
- [2026-02-26] MediX-R1: Open Ended Medical Reinforcement Learning 🆕NEW
- 赛道归属: 医疗多模态大模型对齐(开放式回答的强化学习)
- 核心创新点: 提出MediX-R1开放式医疗RL框架,用Group-based RL对视觉-语言骨干进行微调,并设计面向医疗推理的复合奖励:包含LLM裁判的严格YES/NO语义正确性奖励,以及基于医学嵌入的语义相似奖励以覆盖同义改写,从而把训练目标从选择题扩展到临床可用的自由文本回答。
- 一句话总结: 通过“医疗专用复合奖励 + 组式RL”,把医疗MLLM从答题式评测推进到更贴近临床表达的开放式推理与作答。
- [2026-02-26] Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation? 🆕NEW
- 赛道归属: 开放词汇分割/少样本分割
- 核心创新点: 提出“检索+分割”的少样本OVS范式:用少量示例结合检索机制来补足VLM仅有图像级监督带来的像素级监督缺口,并缓解自然语言提示的语义歧义对分割边界与类别对齐的影响。方法上通过示例驱动的语义对齐与检索到的可迁移视觉证据,将开放词汇能力更有效地下沉到像素预测。
- 一句话总结: 该工作表明在开放词汇分割中,引入少量示例并结合检索可显著缩小与全监督分割的差距,是从“纯提示”走向“可控监督补强”的有效路径。
- [2026-02-26] CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays 🆕NEW
- 赛道归属: 医疗多模态智能体(胸片诊断推理)/证据可追溯推理
- 核心创新点: 提出面向胸片的证据落地诊断推理智能体,通过多步推理流程将结论与可核验的视觉证据显式绑定,缓解LVLM“看似合理但不忠实”的幻觉式诊断;同时以智能体式编排(而非昂贵重训)支持任务扩展与适配新诊断需求。方法突破在于把“证据检索/定位—推理—结论”做成可审计闭环,提高临床可用性与可验证性。
- 一句话总结: 通过将胸片诊断从“生成答案”升级为“证据驱动、可验证的推理流程”,该工作提升了医疗LVLM的可靠性与可扩展性,更贴近临床落地需求。
- [2026-02-26] Large Multimodal Models as General In-Context Classifiers
- 赛道归属: 多模态理解 / In-context 分类与评测
- 核心创新点: 系统性论证并基准评测:大多模态模型不仅适合复杂推理任务,也能作为通用的 in-context 分类器用于闭集分类。通过在多数据集设置下对比CLIP类对比学习VLM与LMM的ICL能力,揭示LMM在“示例驱动分类”范式中的适用边界与优势来源。
- 一句话总结: 重新定位LMM在分类任务中的角色:它们可作为通用 in-context 分类器,而不只是“复杂任务专用”。
- [2026-02-26] MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction
- 赛道归属: 视频理解与生成式摘要 / 长视频剧情梗概生成
- 核心创新点: 提出工具增强的电影梗概生成框架,通过“ID一致性(角色/实体一致)”与“渐进抽象”的分层生成策略,把长时序视频从片段级信息逐步抽象为高层叙事。用外部工具/模块辅助检索、对齐与一致性维护,缓解通用VLM在长视频中常见的角色混淆、事件断裂与时间跨度失忆问题。
- 一句话总结: 通过工具增强与分层抽象叙事,实现更长程、更一致的电影级视频梗概生成。
- [2026-02-26] Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy
- 赛道归属: 医学多模态 / 显微图像-语言弱监督对齐
- 核心创新点: 面向人脑组织显微图像中“配对图文稀缺”的现实约束,提出弱监督的视觉-语言建模方案,将细胞结构/皮层分层等“细胞构筑”知识以文本形式对齐到显微视觉表征。通过弱标注/间接监督学习可用的图文接口,支持研究者以自然语言进行检索、描述与交互式分析。
- 一句话总结: 在缺少高质量配对标注的脑显微场景中,用弱监督实现可用的图文对齐,为科研工作流提供自然语言入口。
- [2026-02-26] SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling
- 赛道归属: 异常检测 / 小样本工业视觉(训练-free)
- 核心创新点: 提出无需训练的 few-shot 异常检测方法 SubspaceAD:直接在基础视觉模型特征空间中对“正常样本”进行子空间建模,用重构误差/子空间距离实现异常评分。避免记忆库、辅助数据集或VLM调参等复杂组件,强调“用好现成表征即可”的极简范式。
- 一句话总结: 用子空间建模把 few-shot 异常检测做成训练-free、低工程复杂度的强基线。
GitHub
- [2026-03-01] OmniSVG/OmniSVG ⭐2381 🆕NEW
- [2026-02-25] xjywhu/Awesome-Multimodal-LLM-for-Code ⭐209
- [2026-02-27] EdinburghNLP/MMLongBench ⭐176 🆕NEW
- [2026-02-27] YuyangSunshine/Awesome-Continual-learning-of-Vision-Language-Models ⭐157 🆕NEW
- [2026-02-27] yaolinli/MLLM-Token-Compression ⭐115 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-03-02 01:56:41