AI 每日进展速报 - 2026-06-24
图像生成/编辑
arXiv
- IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图(结构可控生成 / 规划-渲染解耦)
- 核心创新点: 提出“隐式视觉思维链”作为潜空间的结构规划机制,将对象数量、空间关系、属性绑定与布局等“结构性意图”从外观渲染中解耦:先在潜变量中形成可组合的结构计划,再驱动后续生成以提升结构遵循能力;通过把结构推理从单一条件流的纠缠中分离,显著改善复杂结构提示下的可控性与一致性。
- PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation 🆕NEW
- 赛道归属: 文生图安全(越狱评测 / 基准与复现管线)
- 核心创新点: 将T2I越狱从“单提示评测”提升为“端到端管线评测”,提出可自演化的 paper-to-pipeline 复现框架 PixJail:覆盖提示改写/攻击、图像生成、安全过滤、多模态裁判等多阶段,并把论文方法自动化落地为可运行管线以提升可复现性与可比性;核心突破在于用标准化、可扩展的管线级协议刻画越狱效果与防护强度,而非孤立的prompt成功率。
- Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning 🆕NEW
- 赛道归属: 文生图评测(因果推理 / 反事实基准)
- 核心创新点: 提出反事实世界基准 CF-World,用“规则被改变的世界”来测试T2I是否具备因果/机制性理解而非相关性拟合:通过构造与训练分布相关性相冲突的反事实规则,要求模型在生成时遵循新因果机制;方法论突破在于用可控的反事实设定隔离“视觉真实感”与“因果一致性”,从生成结果中诊断模型的因果泛化能力。
- Bridging the Manifold Gap: Riemannian Residual Line Search for One-Step Image Editing 🆕NEW
- 赛道归属: 图像编辑(一步扩散编辑 / 后验强度自适应)
- 核心创新点: 针对一步扩散编辑“既要改得动又要保得住”的强度不可统一问题,提出黎曼残差线搜索作为模型外的后处理候选选择:在能量场传输更新上构建多强度候选,并在流形几何视角下用残差/一致性准则进行线搜索选优,从而无需训练新编辑器即可自适应不同编辑类型的最优步长,实现更稳的保真-编辑权衡。
- High-Fidelity Synthetic Transmission Electron Microscopy Image Generation Using Diffusion Probabilistic Models for Data-Limited Semiconductor Metrology 🆕NEW
- 赛道归属: 专业领域图像生成(科学/工业:TEM显微图合成 / 扩散模型)
- 核心创新点: 面向半导体计量中数据稀缺的TEM场景,构建基于DDPM的高保真TEM合成方案,重点建模TEM特有的噪声形态、微结构细节与随机性波动,使合成数据更贴近真实成像分布、可用于下游评测/训练;技术价值在于把扩散生成从通用自然图像迁移到强物理成像先验与噪声统计约束的工业显微域,并强调对“可用性噪声/细节”的逼真复现。
- EPEdit: Redefining Image Editing with Generative AI and User-Centric Design 🆕NEW
- 赛道归属: 图像编辑(生成式编辑系统 / 用户中心交互设计)
- 核心创新点: 从“模型能力”转向“可用性与成本”的系统化改造,提出EPEdit的用户中心生成式编辑流程:通过产品化的交互与工作流设计降低专业门槛,并避免重训练/重微调带来的高成本;其方法论亮点在于把生成式编辑拆解为可控的操作链路(如参数化编辑、模块化能力编排等)以提升可解释性与可操作性,而非单纯追求更大模型。
- DiffusionBench: On Holistic Evaluation of Diffusion Transformers 🆕NEW
- 赛道归属: 文生图/生成模型评测(DiT评测体系 / 训练-评测基础设施)
- 核心创新点: 指出DiT研究过度绑定ImageNet类条件FID的单一评测范式,提出DiffusionBench进行更“整体”的DiT评估,并配套NanoGen等更低成本的训练/评测设置以使T2I评测可行;核心突破在于把评测从单数据集单指标扩展为覆盖更真实生成任务与成本可控的基准套件,推动DiT改进能在更广泛场景中被验证而非指标过拟合。
- S1-Omni-Image: A Unified Model for Scientific Image Understanding, Generation, and Editing 🆕NEW
- 赛道归属: 科学多模态(科学图像理解+生成+编辑的一体化模型)
- 核心创新点: 提出开源权重的统一科学多模态模型S1-Omni-Image,将科学图像“理解/推理”骨干与图像生成/编辑能力耦合,面向科学语义、结构关系与领域知识的强约束任务;方法突破在于用统一模型同时覆盖理解与生成编辑,并通过面向科学任务意图的对齐机制缓解通用生成模型在科学场景中“懂不对/改不准”的问题。
- UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation 🆕NEW
- 赛道归属: 图像编辑(图内机器翻译IIMT / 理解-生成冲突消解)
- 核心创新点: 提出统一多模态端到端框架UniTranslator,实现“识别-翻译-回填渲染”一体化,并针对统一模型在IIMT中的理解-生成冲突(翻译正确但渲染破坏外观/区域)进行结构化约束:在保持原区域几何与风格一致性的同时生成目标语言文本;关键突破在于把文本语义转换与局部图像再合成在同一框架内协同优化,而非松耦合的OCR+翻译+修补流水线。
- Inclusive Interactive Collisions for Multi-View Consistent Compositional 3D Generation 🆕NEW
- 赛道归属: 3D生成(多物体组合式3D / 多视角一致性优化)
- 核心创新点: 面向多物体组合3D资产生成,提出“包容式交互碰撞”机制来显式建模高斯基元间的合理交互关系,解决多物体生成中穿插/不合理接触的问题;同时针对SDS逐视角优化导致的跨视角不一致,引入促进多视角一致的优化策略,使组合场景在不同视角下几何与外观更稳定。
HuggingFace Models
- krea/Krea-2-Turbo 🆕NEW
视频生成/编辑
arXiv
- GeoT2V-Bench: Benchmarking 3D Consistency in Text-to-Video Models via 3D Reconstruction 🆕NEW
- 赛道归属: 视频生成评测 / 3D一致性评测(Text-to-Video + 3D重建诊断)
- 核心创新点: 提出基于“显式3D重建可行性”的T2V评测范式:不再只看逐帧观感,而是将相机提示下生成的视频作为多视图观测,接入刚体3D重建流程,用重建质量/稳定性来量化跨视角几何一致性;以重建为“诊断器”定位T2V在相机运动、视差、结构漂移等方面的失败模式,从而把“看起来合理”提升为“可支持单一静态3D场景证据”的可检验指标。
- Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models 🆕NEW
- 赛道归属: 视频生成 / 世界模型与可控性学习
- 核心创新点: 将“视频生成=世界建模”的命题具体化为“可反事实控制的自演化世界模型”:强调仅靠视觉预测尺度化不足以获得可用的物理代理,提出以反事实可控性为目标,让模型不仅能续写视频,还能在干预变量下生成一致且可区分的反事实轨迹;通过把生成过程组织为可被操控、可自我改进的闭环,使世界模型从隐式表征走向可用于决策/干预评估的生成式模拟器。
- LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation 🆕NEW
- 赛道归属: 视频生成安全 / 水印溯源(Image-to-Video 水印)
- 核心创新点: 面向I2V提出“长时鲁棒水印”新问题设定:现有单模态水印难以跨越I2V扩散与时间演化而保持可检测性;提出Robust Diffusion Distance度量水印信号在生成视频中的时间持久性,并据此设计LoT-Pass,使水印在扩散生成与跨帧传播中更稳定、可追踪,从而实现对源图像在I2V产物中的可靠溯源。
- Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation 🆕NEW
- 赛道归属: 推理优化 / 视频扩散生成加速(全栈推理引擎)
- 核心创新点: 提出面向“实例自适应”的视频生成加速框架:指出最优加速策略强依赖模型结构、数值敏感性、注意力模式、硬件与采样配置,难以一招通用;以agent-native的方式把策略搜索/选择自动化,进行端到端全栈编排(算子、并行、精度、缓存/注意力优化、调度等),为不同实例动态选择最合适的加速配方,在尽量不损画质的前提下降低推理成本。
- SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation 🆕NEW
- 赛道归属: 机器人评测 / 基于视频世界模型的策略评估(多视角一致性)
- 核心创新点: 提出用“自一致视频生成”评测机器人基础模型的新框架:用动作条件视频世界模型模拟策略rollout以替代昂贵真实实验,并针对三大难点给出机制——(1) 自回归误差累积;(2) 多相机视角间互相一致;(3) 对分布外策略的泛化评估;通过自一致性约束/评估协议,让生成的多视角轨迹在时间与视角上可校验,从而更可靠地衡量策略质量与失败模式。
- Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation 🆕NEW
- 赛道归属: 视频生成 / 扩散蒸馏(少步采样质量与多样性恢复)
- 核心创新点: 针对DMD/DMD2等少步蒸馏的两类系统性退化(多样性下降、画面过饱和偏离真实视频外观),提出Data-Forcing Distillation:通过“数据强制”机制改变仅依赖reverse-KL分布匹配的训练动力学,把学生模型的生成分布拉回真实数据外观与覆盖度;在保持少步高效采样的同时,显式修复蒸馏导致的模式塌缩与色彩/对比度失真。
- OrbitForge: Text-to-3D Scene Generation via Reconstruction-Anchored Video Synthesis 🆕NEW
- 赛道归属: 文生3D / 由视频先验驱动的3D场景生成(Gaussian Splatting重建)
- 核心创新点: 提出“重建锚定的视频合成→3D资产”转换框架:利用冻结的通用T2V作为开放世界先验,但通过adapter与逐prompt的Gaussian Splatting重建优化,把单段文本生成视频规范化为“闭合轨道”的相机路径与更一致的视角覆盖;用重建目标反向约束视频帧一致性与相机运动可控性,从而把高质量但不稳定的T2V输出转化为可用的规范3D场景表示。
- CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning 🆕NEW
- 赛道归属: 多模态理解 / 视频字幕生成(电影语言与摄影学描述)
- 核心创新点: 面向“电影化字幕”提出结构化推理范式:用时空锚点把镜头运动、景别、景深、构图、机位角度等专业概念与具体片段对齐,避免仅靠自由文本生成导致的概念漂移;通过统一输出形式将多维摄影语义组织成可验证、可学习的描述任务,补齐现有多模态LLM在电影语言理解与可控生成接口上的能力缺口。
- Trimming the Long-Tail of Visual World Modeling Evaluation 🆕NEW
- 赛道归属: 世界模型评测 / 物理交互长尾评估(视频生成与预测)
- 核心创新点: 聚焦“物理交互长尾”这一被现有基准忽视的评测盲区:指出主流评测偏向常见交互,难以检验模型是否真正内化稀有/不规则物理规律;提出针对长尾交互的评估设计与分析框架,通过构造/筛选稀有交互情形并衡量模型在这些情形下的生成/预测一致性与物理合理性,系统性揭示世界模型在长尾物理上的能力边界。
- DramaDirector: Geometry-Guided Short Drama Generation 🆕NEW
- 赛道归属: 视频生成 / 剧情到多镜头短剧生成(几何引导的可控生成)
- 核心创新点: 提出几何引导的短剧生成框架:针对短剧多镜头快节奏与对摄影落地的强需求,引入“从真实短剧镜头库借用摄影几何”的规划机制,把构图/机位/镜头运动等几何要素作为中间表示来约束分镜与生成;实现从全局剧情与局部上下文到多镜头视频的可控合成,减少纯文本提示在镜头一致性、空间关系与叙事连贯性上的不稳定。
音频生成
arXiv
- CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation 🆕NEW
- 赛道归属: TTS评测基准 / 中文新闻场景发音鲁棒性评测
- 核心创新点: 提出面向“原始输入”的中文新闻TTS目标级自动化评测基准,将易错的书面密集形式(比分、范围、单位符号、百分比、英文缩写、中英数混写专名等)显式定义为可定位的“发音目标”,并以目标是否被正确口播为核心指标,避免仅用整体MOS掩盖关键读音错误;强调在不做文本规范化前提下评估产品级TTS对真实新闻文本的读音保持与语义口播一致性。
- Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages 🆕NEW
- 赛道归属: TTS主观评测方法 / 多语言(印度语系)偏好分析
- 核心创新点: 构建“受控的多维度成对评测框架”,通过语言学控制(覆盖母语与混码句、跨10种Indic语言)与感知维度标注相结合,降低TTS成对偏好评测在多语言场景中的高方差与不可解释性;在大规模众包设置下,把偏好拆解到可感知维度并进行系统性偏好归因分析,从而更稳定地比较多模型/多语言TTS质量差异。
- WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models 🆕NEW
- 赛道归属: TTS推理优化 / 高效自回归TTS
- 核心创新点: 提出WAND框架,将预训练decoder-only AR-TTS从“全序列自注意力的二次复杂度”改造为近似常数复杂度:把注意力拆分为对条件token的持久全局注意力与对生成序列的局部窗口注意力,在保持条件可达性的同时限制生成侧上下文;再结合知识蒸馏把全注意力教师的质量迁移到窗口注意力学生,实现显著降低显存/算力开销而尽量维持音质与韵律。
- EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation 🆕NEW
- 赛道归属: 视频到音频生成 / 可控音效生成
- 核心创新点: 提出事件中心的分层控制范式:以“视频中的事件”为可控生成的基本单元,构建层级化控制信号来同时约束事件类型、时间结构与细粒度声学表现,从而提升可控性与可编辑性;针对现有VT2A“视觉条件压制文本指令”的问题,引入更明确的指令遵循与条件平衡机制,使模型能在视频证据与文本创意指令之间进行更可控的融合,并强化细粒度事件级对齐。
- Real-Time Interactive Music Generation via Data-Free Streaming Consistency Distillation 🆕NEW
- 赛道归属: 音乐生成推理优化 / 实时交互式流式生成
- 核心创新点: 提出“数据无关的流式一致性蒸馏”以把离线渲染式音乐生成模型转化为可实时演奏的低延迟流式模型:通过蒸馏让学生模型在分块/流式输入输出条件下与教师的全局生成保持一致,从而在不依赖额外训练数据或昂贵标注的前提下,显著降低推理延迟并支持实时交互控制(更像“乐器”而非离线生成器)。
- ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge 🆕NEW
- 赛道归属: 音频生成评测 / LALM-as-a-Judge基准(副语言属性)
- 核心创新点: 提出ParaPairAudioBench成对基准,专门覆盖五类副语言细粒度维度(风格、语速、重音、年龄、性别),用“成对比较”而非整体自然度来检验LALM评审模型对细微差异的判别能力;通过系统实验量化当前LALM judge与人类判断的差距,推动从“泛自然度打分”走向“可诊断的维度化评测”,为自动评测与对齐训练提供更精确的监督信号。
- ZONOS2 Technical Report 🆕NEW
- 赛道归属: 大规模TTS模型 / MoE与数据工程(语音克隆与韵律)
- 核心创新点: 报告ZONOS2 8B的系统级升级:采用新型MoE骨干(总参8B、激活约900M)在提升容量的同时改善推理延迟与吞吐;通过新的数据处理流水线将训练语料从20万小时扩展到600万+小时,强化自然度、韵律与克隆保真;并简化后训练与条件控制配方,降低使用与适配复杂度,体现“规模+MoE+数据工程+训练配方”协同带来的产品级TTS跃迁。
- Comparative Reasoning: Making an Audio Language Model Better at Comparing Emotions 🆕NEW
- 赛道归属: 音频语言模型推理 / 情感比较推理(序关系SER)
- 核心创新点: 将SER从“单样本分类/回归”推进到“成对比较的序关系推理”,提出推理引导的框架:以两段语音为输入,让LALM显式进行比较判断(如哪段更高唤醒度/效价/支配度),并通过结构化提示/推理约束提升比较一致性与可解释性;该设定更贴近人类标注与主观感知过程,也为LALM在跨维度(情绪、环境、韵律、人际等)比较能力提供可评测、可训练的任务形式。
- Academic Text-to-Music Grand Challenge: Datasets, Baselines, and Evaluation Methods 🆕NEW
- 赛道归属: 文本到音乐生成评测基准 / 学术公平竞赛框架
- 核心创新点: 提出面向学术界可复现与公平对比的ATTM Grand Challenge技术框架:通过统一的数据集、基线与评测协议,约束参赛者在可获得资源下训练生成模型,缓解当前TTM被私有大数据与工业算力垄断导致的不可比问题;同时给出系统化评测方法(覆盖生成质量与文本一致性等维度),推动TTM从“闭源SOTA展示”走向“可复现实证研究”的基准化生态。
- HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation 🆕NEW
- 赛道归属: 音频音乐生成 / 人声条件的伴奏生成(分层自回归基础模型)
- 核心创新点: 提出分层自回归基础模型HAFM,用“高层语义结构→低层声学细节”的层级生成来解决伴奏生成中结构建模不足与细节重建受限的问题:高层捕获节奏/和声/段落等长期依赖以保证与人声的音乐性一致,低层再生成具备音色与质感的音频细节;相较单阶段音频生成或纯符号方法,实现更强的全局编配一致性与更高的声学保真。
HuggingFace Models
语言大模型
arXiv
- LLM-MINE: Large Language Model based Alzheimer's Disease and Related Dementias Phenotypes Mining from Clinical Notes 🆕NEW
- 赛道归属: 医疗NLP / 临床文本信息抽取(表型挖掘)
- 核心创新点: 提出LLM-MINE,用大语言模型将非结构化临床笔记中的ADRD(阿尔茨海默病及相关痴呆)表型进行自动化抽取与结构化归因;方法上强调以“专家定义的表型 schema/标签体系 + LLM抽取流程”来覆盖分散在叙述文本中的关键信息,并通过专家标注/验证形成可用于早筛与分期的高质量表型数据资产。
- Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War 🆕NEW
- 赛道归属: LLM评测基准 / 多智能体对抗与可靠性评测(推理+博弈+协议约束)
- 核心创新点: 提出Age of LLM这一1v1回合制对抗基准,将三类压力源系统化注入评测:战争迷雾(部分可观测)、完整外交沟通(谈判/停火/威胁且信息可隐藏)、以及严格JSON动作协议下的可靠性约束(非法动作被静默丢弃);通过私有引擎、随机地图种子与随机对手机制降低数据污染与“背题”风险,使评测更贴近真实交互式决策与工具/协议执行场景。
- IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图(结构可控生成 / 规划-渲染解耦)
- 核心创新点: 提出“隐式视觉思维链”作为潜空间的结构规划机制,将对象数量、空间关系、属性绑定与布局等“结构性意图”从外观渲染中解耦:先在潜变量中形成可组合的结构计划,再驱动后续生成以提升结构遵循能力;通过把结构推理从单一条件流的纠缠中分离,显著改善复杂结构提示下的可控性与一致性。
- Scaling Laws for Task-Specific LLM Distillation 🆕NEW
- 赛道归属: 模型压缩与蒸馏 / 任务域专用LLM缩放规律
- 核心创新点: 系统推导并验证“任务域蒸馏/压缩”的经验缩放规律,量化在不同数据规模、压缩比、监督格式以及迭代剪枝策略下,域内能力与通用知识保真度如何变化;以量化金融为实验域,对比多种压缩与训练配置,给出可操作的预算分配与训练策略指引(在给定延迟/成本约束下如何选数据与压缩路径)。
- ScaleToT: Generalizing Structured LLM Reasoning for Billion-Scale Low-Activity User Modeling 🆕NEW
- 赛道归属: 推荐与用户建模 / 结构化推理蒸馏与规模化部署(低活跃用户)
- 核心创新点: 提出ScaleToT:先对小规模用户子集调用LLM生成“结构化推理轨迹/树状思维(ToT式)”以学习可迁移的推理结构,再将该结构化推理能力蒸馏/泛化到海量低活跃用户,从而在稀疏画像下提升推断稳定性并显著降低对LLM逐用户调用成本;核心在于把LLM的高成本推理转化为可规模化的结构化策略/模型。
- A specialized reasoning large language model for accelerating rare disease diagnosis: a randomized AI physician assistance trial 🆕NEW
- 赛道归属: 医疗LLM / 临床推理与辅助诊断(罕见病)+ 随机对照评测
- 核心创新点: 提出RaDaR,一个面向罕见病诊断加速的专用推理型LLM(32B、开源、强调临床可部署性),并通过随机化“AI医生辅助”试验评估其对诊断流程的真实增益;方法论亮点在于将模型设计聚焦于临床推理链与证据对齐(而非泛化聊天能力),并用更接近临床实践的试验范式验证有效性与可靠性。
- CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference 🆕NEW
- 赛道归属: 推理优化 / 长上下文推理的KV-Cache压缩
- 核心创新点: 提出CompressKV:用“语义检索信号”指导KV-cache压缩/淘汰,而非对所有注意力头做统一的启发式打分;通过识别不同注意力头的功能差异,优先保留对当前语义检索最关键的历史token对应KV,从而在显著降低显存与解码开销的同时,减少关键token被误删导致的长上下文性能退化。
- AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming 🆕NEW
- 赛道归属: LLM Agent安全 / 规则学习与可解释安全约束
- 核心创新点: 提出AutoSpec,用归纳逻辑编程让LLM Agent的安全规则“可进化”:从交互轨迹/失败案例中归纳、修订并最小化规则集,在可解释(逻辑规则)与有效性之间取得更优权衡;相较手工规则的脆弱与静态,AutoSpec强调基于数据的规则迭代,降低误报(过度保守)与漏报(过度宽松)带来的安全风险。
- T2D-Bench: Evidence-Gated Evaluation of LLM Outputs for Type 2 Diabetes Using a Multi-Layer Clinical-Lifestyle Knowledge Graph 🆕NEW
- 赛道归属: 医疗LLM评测 / 证据约束与知识图谱校验(糖尿病)
- 核心创新点: 提出T2D-Bench:以多层临床-生活方式知识图谱为核心,将LLM输出的建议拆解为可被图谱“证据门控”校验的断言,评估其是否满足指南约束并能对生活方式控糖结论给出可追溯证据;方法突破在于把“医学正确性”从主观打分转为结构化、可复现、可自动核验的证据一致性评测。
- Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning 🆕NEW
- 赛道归属: 预训练优化 / 数据配比与在线数据调度(多目标强化学习)
- 核心创新点: 提出面向LLM预训练的Holistic Data Scheduler,用多目标强化学习统一优化在线数据混合:在训练过程中动态调整不同数据源配比,同时显式建模多种目标(如能力、泛化、稳定性/遗忘、效率等)之间的权衡;相较单一指标驱动的数据调度,该方法提供可学习的策略来实现更“整体”的数据课程与混合决策。
HuggingFace Models
HuggingFace Datasets
- [2026-06-19] Glint-Research/Fable-5-traces 🆕NEW
Glint Research Dataset Card Fable 5 Pi Agent Traces A compact, high-signal corpus of Fable 5 coding-agen...
- [2026-05-18] WithinUsAI/claude_mythos_distilled_25k 🆕NEW
Claude Mythos Distilled 25K
A high-quality synthetic supervised fine-tuning (SFT) dataset designed to train and fine-tune any LLM to mi...
- [2026-05-01] angrygiraffe/claude-opus-4.6-4.7-reasoning-8.7k
Background
Ended up with some tokens to burn on a Claude Max plan. Assembly began during 4.6 and moved to 4.7. Model is tagged. The dev...
- [2026-06-15] lordx64/agentic-distill-fable-5-sft 🆕NEW
Fable-5 SFT — prepared for Qwable fine-tuning
4,659 single-turn pairs from Claude Fable-5 (Anthropic preview model, suspended globally ...
多模态大模型
arXiv
- Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling 🆕NEW
- 赛道归属: 多模态理解(长视频理解/高效采样与推理加速)
- 核心创新点: 将长视频帧选择形式化为“准高斯采样”问题,提出一种自适应、免训练的帧采样策略:用连续、可调的软采样分布替代传统关键帧“硬采样”,在计算/显存受限下更灵活地覆盖关键时刻并抑制噪声帧,从而在不改动模型训练的前提下提升长视频理解效率与效果。
- AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression 🆕NEW
- 赛道归属: 多模态理解(长时音视频理解/上下文压缩与检索式建模)
- 核心创新点: 提出 AVOC,在模态编码器与LLM之间插入可学习的 token 压缩模块,借鉴检索思想将长时音视频的冗余 token 压缩为更“可检索/可聚合”的紧凑表示,以缓解上下文窗口限制与跨模态冗余;通过在不牺牲关键信息的前提下降低 token 数,实现小时级音视频输入的可扩展理解。
- Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models 🆕NEW
- 赛道归属: 推理优化(MLLM 视觉token剪枝/训练免调优加速)
- 核心创新点: 提出基于“谱演化”信号的免训练 token 剪枝框架:不再依赖单层注意力或相似度等局部指标,而是利用跨层表示变换的谱特征来评估 token 的全局贡献,减少位置偏置并更稳健地识别冗余视觉 token,在加速推理的同时尽量保持跨模态推理能力。
- video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding 🆕NEW
- 赛道归属: 多模态理解(视频问答/两阶段重观看与交互式推理)
- 核心创新点: 提出 video-SALMONN-R³ 的“ReWatch–ReAsk–ReAnswer”高效范式:先以低帧率/低分辨率进行粗理解定位相关片段,再对关键片段进行高保真重观看;同时通过“再提问/再回答”机制迭代聚焦信息需求,把计算预算集中到与问题最相关的时空区域,在有限算力下减少关键信息遗漏并提升QA表现。
- PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models 🆕NEW
- 赛道归属: 多模态安全(VLM 对抗攻击数据集/红队评测)
- 核心创新点: 构建 PHANTOM 大规模、开源的“预生成”多模态对抗攻击数据集,覆盖更广的有害意图层级(10大类、55子类),降低研究者生成攻击样本的计算与工程门槛;通过规模化、可复用的攻击集合推动VLM鲁棒性评测与防御方法的可比性与可复现性。
- M^2C-EvDet: Multi-Domain Multi-Order Cross-Modal Knowledge Distillation for Event-based Object Detection 🆕NEW
- 赛道归属: 多模态感知(事件相机目标检测/跨模态知识蒸馏)
- 核心创新点: 提出 M²C-EvDet 的“多域-多阶-跨模态”知识蒸馏框架:针对事件数据语义不足与稀疏表征导致的性能差距,从帧模态向事件模态进行更细粒度的跨模态对齐;通过多域适配与多阶(不同层级/不同统计阶)蒸馏信号协同,增强事件检测器的语义表达与泛化能力。
- Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction 🆕NEW
- 赛道归属: 推理优化(MLLM 视觉token压缩/注意力先验校正)
- 核心创新点: 提出“先验校正的 token 缩减”:揭示文本-视觉注意力排序会被模型固有的任务无关视觉先验主导,导致指令相关 token 的注意力被压制而误剪;通过显式估计/校正该先验,使 token 重要性更贴近指令条件贡献,从而在更激进的 token 缩减下仍保持指令跟随与跨模态推理性能。
- The Professor: Multi-Teacher Unsupervised Prompt Distillation for Vision-Language Models 🆕NEW
- 赛道归属: 模型压缩与蒸馏(VLM 提示词蒸馏/无监督多教师)
- 核心创新点: 提出 The Professor:在无标注域内数据上进行提示词蒸馏的多教师扩展,使用“域内微调教师 + 零样本强教师”的固定双教师集成进行监督;通过融合互补的logits/知识来源,缓解单教师的偏置与过拟合,提高轻量学生模型在域迁移与泛化场景下的性能与稳定性。
- HANCLIP: A Family of Hyperbolic Angular Negation Vision Language Models 🆕NEW
- 赛道归属: 多模态理解(VLM 语义鲁棒性/否定理解与表示学习)
- 核心创新点: 提出 HANCLIP 系列“超曲空间 + 角度否定”建模:针对VLM对否定语义脆弱的问题,在表示空间与训练目标上显式引入可组合的“否定”几何操作,使模型能区分“包含/不包含”“是/不是”等否定关系;并强调在增强否定能力的同时尽量减少对原有检索/分类能力的干扰。
- MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ? 🆕NEW
- 赛道归属: 多模态理解与评测(地图视觉推理/图可验证决策)
- 核心创新点: 提出 MapReason-OSM 基准与评测框架:基于自渲染 OpenStreetMap 面板,将VLM输出从“不可验证的自由文本”转为“可在道路图上验证的移动决策”(路线、落点、停车选择等),并提供图约束一致性的评测机制;推动面向真实出行/物流场景的可执行、可审计的地图推理能力评估。
HuggingFace Spaces
强化学习
arXiv
- Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback 🆕NEW
- 赛道归属: 强化学习对齐与可解释性(RLHF + XAI评测框架)
- 核心创新点: 提出将“可解释性测试/诊断”与“人类反馈对齐训练”统一到同一套可复用框架中的Themis,用于系统化发现与缓解RLHF中的不安全/不期望行为;核心突破在于把XAI作为一等公民嵌入RLHF的测试与评估流程(而非事后分析),支持多任务/多算法的标准化评测与可追溯的行为归因,从而提升对奖励黑客、策略捷径等问题的可观测性与调试效率。
- Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation 🆕NEW
- 赛道归属: GUI智能体强化学习与自动化奖励/评测
- 核心创新点: 针对桌面GUI环境“奖励难以机器可读、成功标准强视觉依赖”的瓶颈,提出用自主的视觉-语言评估器生成可扩展的训练信号与离线/在线评测闭环;方法论突破在于把“任务成功判定”从手工奖励工程转为可学习、可扩展的自动评审模块,从而支持对开放式GUI任务进行RL微调,并显著降低对人工标注与密集奖励设计的依赖。
- Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation 🆕NEW
- 赛道归属: 强化学习训练系统与推理/训练加速(面向扩散式视觉生成模型的RL系统)
- 核心创新点: 面向扩散/流式视觉生成模型的RL后训练,提出“基于扩散过程的并行化+ 训练器辅助生成”的系统级方案,加速解耦式RL流水线;关键突破在于利用扩散采样的结构特性实现更高吞吐的并行生成与更高效的采样-评估-更新协同,补齐现有主要面向自回归LLM的RL系统在扩散生成场景下的效率空白。
- Reinforcement Learning Towards Broadly and Persistently Beneficial Models 🆕NEW
- 赛道归属: 强化学习对齐与泛化鲁棒性(长期/跨域有益行为对齐)
- 核心创新点: 系统研究“在现实域中以有益行为为目标进行RL训练”能否产生跨任务、跨域且随时间保持的对齐泛化,并聚焦RL特有的失配风险(奖励黑客、欺骗性策略等);方法论价值在于将对齐评估从静态、同分布指标扩展到“广泛性+ 持久性”的分布外与时间维度检验框架,用实验方式刻画RL对齐是否会在迁移与持续交互中退化。
- Offline Reinforcement Learning for Warehouse SLAM Throughput Control 🆕NEW
- 赛道归属: 离线强化学习在工业运筹控制(仓储SLAM产能/拥塞控制)
- 核心创新点: 提出用于仓储履约场景SLAM吞吐控制的离线RL框架,通过动态推荐吞吐/限流设置在“吞吐最大化”和“下游稳定性/拥塞”之间自适应权衡;技术突破点在于引入历史信息驱动的状态表示与面向稳定性的控制目标建模,使策略能在仅有离线日志数据的条件下学习到对系统拥塞与波动的前瞻性调节,而非简单追求局部吞吐峰值。
- E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis 🆕NEW
- 赛道归属: 医学多模态强化学习与3D视觉-语言对齐(3D肿瘤分析/报告生成)
- 核心创新点: 针对3D CT报告生成中VLM易幻觉、RL/SFT只优化文本而忽视真实视觉证据的问题,提出跨视角对齐的“证据驱动”多模态RL;核心突破在于把奖励从“文本正确性”提升为“跨视角一致的可验证视觉证据”约束,通过跨view对齐与证据抽取/匹配机制,迫使模型在3D体数据上进行可追溯的视觉 grounding,从而降低语言先验导致的虚假诊断与幻觉描述。
- MyoInteract: A Framework for Fast Prototyping of Biomechanical HCI Tasks using Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习仿真平台与人机交互(生物力学HCI任务快速原型)
- 核心创新点: 面向生物力学RL在HCI研究中“难用、难解释”的痛点,提出MyoInteract框架,用Human Action Cycle作为设计框架,将任务搭建、用户模型与训练参数配置封装为可视化GUI的快速原型流程;方法论突破在于把RL训练管线产品化为交互式工具链,并强调可解释/可诊断的实验迭代,使非RL专家也能在分钟级构建与评估生物力学交互任务。
- Reinforcement Learning to Disentangle Multiqubit Quantum States from Partial Observations 🆕NEW
- 赛道归属: 量子控制与量子信息中的强化学习(部分观测下的纠缠消除/电路合成)
- 核心创新点: 在仅能访问两比特局部信息的部分观测条件下,使用actor-critic深度RL学习构造短深度的纠缠消除量子电路,支持最高16量子比特状态;关键突破在于把“从不完全观测推断并操控多体纠缠结构”转化为序贯决策问题,通过RL直接搜索电路序列以实现状态解纠缠/压缩目标,降低对全态层析或显式解析设计的依赖。
- LaGO: Latent Action Guidance for Online Reinforcement Learning 🆕NEW
- 赛道归属: LLM辅助强化学习(在线RL中的先验引导/策略优化)
- 核心创新点: 提出LaGO,将预训练LLM从“显式规划器/控制器”改为“潜在动作先验”,以软引导方式约束在线策略优化;方法论突破在于通过潜在动作空间的指导信号把LLM知识注入RL而不要求LLM输出精确可执行动作,从而提升在线学习的稳定性与可用性,并缓解LLM直接控策略时的动作格式脆弱性与执行不可靠问题。
- ASALT: Adaptive State Alignment for Lateral Transfer in Multi-agent Reinforcement Learning 🆕NEW
- 赛道归属: 多智能体强化学习迁移学习(跨域状态对齐与横向迁移)
- 核心创新点: 提出ASALT,面向源域/目标域观测与全局状态维度不一致的MARL迁移问题,进行自适应状态对齐以实现横向迁移;核心突破在于显式建模并学习跨域状态表示的对齐映射/适配机制,使得在状态空间不匹配时仍可复用协作/对抗策略知识,而不再受限于“源/目标必须同维同构”的强假设。
HuggingFace Models
HuggingFace Datasets
- [2026-06-22] XDOF/ABC-130k 🆕NEW
ABC-130k
ABC-130k is the largest open-source robot teleoperation dataset. It contains bimanual manipulation trajectories collected on t...
-
[2026-06-17] nvidia/Nemotron-Personas-Belgium 🆕NEW
Nemotron-Personas-Belgium(NL) Een compound-AI-benadering van meertalige Belgische persona's, verankerd in reële verdelingen...
世界动作模型
由 Research Daily 自动生成 生成时间: 2026-06-24 07:32:27