AI 每日进展速报 - 2026-06-29
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation
- 赛道归属: 文生图(结构可控生成 / 规划-渲染解耦)
- 核心创新点: 提出“隐式视觉思维链”作为潜空间的结构规划机制,将对象数量、空间关系、属性绑定与布局等“结构性意图”从外观渲染中解耦:先在潜变量中形成可组合的结构计划,再驱动后续生成以提升结构遵循能力;通过把结构推理从单一条件流的纠缠中分离,显著改善复杂结构提示下的可控性与一致性。
- RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
- 赛道归属: 文生图 / 强化学习对齐
- 核心创新点: 提出 RubricRL 框架,核心突破在于用"评分标准"替代传统单一标量奖励或复合指标加权求和的方式来设计强化学习奖励信号。该方法通过将生成目标分解为可解释的、细粒度的评估维度,利用大模型或规则生成结构化评分,从而在保持灵活性的同时提升了奖励的可解释性和泛化性,避免了固定权重复合指标和人类偏好蒸馏模型的局限性。
- PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation
- 赛道归属: 文生图安全(越狱评测 / 基准与复现管线)
- 核心创新点: 将T2I越狱从“单提示评测”提升为“端到端管线评测”,提出可自演化的 paper-to-pipeline 复现框架 PixJail:覆盖提示改写/攻击、图像生成、安全过滤、多模态裁判等多阶段,并把论文方法自动化落地为可运行管线以提升可复现性与可比性;核心突破在于用标准化、可扩展的管线级协议刻画越狱效果与防护强度,而非孤立的prompt成功率。
- SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion
- 赛道归属: 文生图基础模型 / 扩散模型训练加速
- 核心创新点: 提出 SeFi-Image,核心创新是"语义优先扩散"这一新型潜在扩散建模范式。与传统扩散模型将语义信息视为条件输入不同,该范式将语义结构的学习置于扩散过程的优先位置,从而利用语义引导显著加速基础模型训练。关键突破在于将此范式成功扩展至大分辨率、大规模模型(多个参数量档位),突破了以往仅在 ImageNet 等简单数据集上小模型验证的局限。
- Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning
- 赛道归属: 文生图评测(因果推理 / 反事实基准)
- 核心创新点: 提出反事实世界基准 CF-World,用“规则被改变的世界”来测试T2I是否具备因果/机制性理解而非相关性拟合:通过构造与训练分布相关性相冲突的反事实规则,要求模型在生成时遵循新因果机制;方法论突破在于用可控的反事实设定隔离“视觉真实感”与“因果一致性”,从生成结果中诊断模型的因果泛化能力。
- ScalingAR: Scaling Confidence for Autoregressive Image Generation
- 赛道归属: 自回归图像生成 / 测试时推理缩放
- 核心创新点: 提出 ScalingAR,专为基于下一个 Token 预测的自回归图像生成设计测试时缩放策略。核心创新在于引入"置信度缩放"机制——利用模型自身的 token 预测置信度作为内生质量信号,无需依赖外部奖励模型或频繁的部分解码操作。该方法有效规避了中间解码结果不稳定的问题,在推理阶段以更低的计算开销实现生成质量的可扩展提升。
- MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation
- 赛道归属: 图像生成 / 生成模型架构创新
- 核心创新点: 提出 MIMFlow,将掩码图像建模与归一化流深度融合为端到端统一框架。核心突破在于解决了归一化流的严格可逆性约束导致模型容量被低级像素细节"消耗殆尽"、无法有效捕捉高级语义结构的根本缺陷。通过将 MIM 的语义表征能力内嵌于归一化流的生成过程中(而非模块化地拼接),使模型同时具备精确密度估计和高质量语义感知生成能力,实现了两类方法的有机统一。
- Bridging the Manifold Gap: Riemannian Residual Line Search for One-Step Image Editing
- 赛道归属: 图像编辑(一步扩散编辑 / 后验强度自适应)
- 核心创新点: 针对一步扩散编辑“既要改得动又要保得住”的强度不可统一问题,提出黎曼残差线搜索作为模型外的后处理候选选择:在能量场传输更新上构建多强度候选,并在流形几何视角下用残差/一致性准则进行线搜索选优,从而无需训练新编辑器即可自适应不同编辑类型的最优步长,实现更稳的保真-编辑权衡。
- High-Fidelity Synthetic Transmission Electron Microscopy Image Generation Using Diffusion Probabilistic Models for Data-Limited Semiconductor Metrology
- 赛道归属: 专业领域图像生成(科学/工业:TEM显微图合成 / 扩散模型)
- 核心创新点: 面向半导体计量中数据稀缺的TEM场景,构建基于DDPM的高保真TEM合成方案,重点建模TEM特有的噪声形态、微结构细节与随机性波动,使合成数据更贴近真实成像分布、可用于下游评测/训练;技术价值在于把扩散生成从通用自然图像迁移到强物理成像先验与噪声统计约束的工业显微域,并强调对“可用性噪声/细节”的逼真复现。
- EPEdit: Redefining Image Editing with Generative AI and User-Centric Design
- 赛道归属: 图像编辑(生成式编辑系统 / 用户中心交互设计)
- 核心创新点: 从“模型能力”转向“可用性与成本”的系统化改造,提出EPEdit的用户中心生成式编辑流程:通过产品化的交互与工作流设计降低专业门槛,并避免重训练/重微调带来的高成本;其方法论亮点在于把生成式编辑拆解为可控的操作链路(如参数化编辑、模块化能力编排等)以提升可解释性与可操作性,而非单纯追求更大模型。
GitHub
- [2026-06-29] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐12702
- [2026-06-28] Light-Heart-Labs/ODS ⭐2330 🆕NEW
- [2026-06-28] AceDataCloud/Nexior ⭐374
- [2026-06-28] etkecc/baibot ⭐232
- [2026-06-28] Z1rconium/gpt-image-linux ⭐85 🆕NEW
HuggingFace Models
视频生成/编辑
arXiv
- DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation
- 赛道归属: 视频生成 / 主体驱动文生视频
- 核心创新点: 提出 DomainShuttle 框架,专门针对开放域主体驱动文生视频中"跨域"场景的不足进行突破。现有方法主要聚焦于域内高保真主体重现,而 DomainShuttle 通过"域穿梭"机制,在保留主体本质特征的同时,允许与主体无关的属性(如风格、场景、外观)根据文本提示灵活变化,实现了自由形式的开放域生成能力,有效解决了跨域场景下主体特征保留与文本可控性之间的平衡难题。
- Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
- 赛道归属: 视频生成评估 / 物理合理性细粒度评测
- 核心创新点: 提出 Physics Question Scene Graph,一种基于层次化问题图的评估流水线,用于细粒度定位视频生成中的物理规律违反问题。与现有粗粒度评估方法不同,PQSG 通过构建包含物体、动作、属性及其物理关系的场景图,将物理合理性评估分解为结构化问答任务,实现了对物理违规的精准溯源与量化,填补了当前文生视频评估体系在物理合理性细粒度诊断上的空白。
- Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models
- 赛道归属: 视频生成 / 自回归扩散蒸馏与流式视频生成
- 核心创新点: 提出 Causal-rCM,将先进扩散蒸馏框架 rCM 扩展至因果扩散变换器的自回归视频生成范式。核心创新在于统一了"Teacher-Forcing"(教师强制)与"Self-Forcing"(自强制)两种训练模式的开放配方:利用一致性模型的逆向散度与分布匹配蒸馏的正向散度互补性,在保持实时流式生成能力的同时显著提升采样效率,为交互式世界模型和动作条件视频生成提供了统一的高效蒸馏解决方案。
- Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation
- 赛道归属: 视频生成推理优化 / 跨请求稀疏注意力复用
- 核心创新点: 提出 Chorus II,针对图生视频大规模服务场景,首次发现并利用相似请求之间高度一致的稀疏注意力模式这一规律。与现有仅复用特征的跨请求加速方法不同,Chorus II 通过跨请求复用历史稀疏掩码,在不显著降低生成质量的前提下大幅减少注意力计算开销,为 I2V 扩散模型的高效部署提供了新的系统级优化维度。
- GeoT2V-Bench: Benchmarking 3D Consistency in Text-to-Video Models via 3D Reconstruction
- 赛道归属: 视频生成评测 / 3D一致性评测(Text-to-Video + 3D重建诊断)
- 核心创新点: 提出基于“显式3D重建可行性”的T2V评测范式:不再只看逐帧观感,而是将相机提示下生成的视频作为多视图观测,接入刚体3D重建流程,用重建质量/稳定性来量化跨视角几何一致性;以重建为“诊断器”定位T2V在相机运动、视差、结构漂移等方面的失败模式,从而把“看起来合理”提升为“可支持单一静态3D场景证据”的可检验指标。
- Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models
- 赛道归属: 视频生成 / 世界模型与可控性学习
- 核心创新点: 将“视频生成=世界建模”的命题具体化为“可反事实控制的自演化世界模型”:强调仅靠视觉预测尺度化不足以获得可用的物理代理,提出以反事实可控性为目标,让模型不仅能续写视频,还能在干预变量下生成一致且可区分的反事实轨迹;通过把生成过程组织为可被操控、可自我改进的闭环,使世界模型从隐式表征走向可用于决策/干预评估的生成式模拟器。
- BioVid: Autoregressive Video Generation with Biological Behavior Semantic Comprehension
- 赛道归属: 视频生成 / 生物行为自适应长度视频生成
- 核心创新点: 提出 BioVid,一个专为生物行为视频生成设计的数据驱动自回归框架,核心创新在于将"动作持续时长"作为语义属性内化于模型学习中,而非依赖外部指定。采用 2D 编码/3D 解码混合分词器架构,实现了自适应长度的生物行为视频生成,突破了现有模型固定时序窗口或外部续帧的局限,使生成视频的时长能够由行为语义自主驱动。
- MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation
- 赛道归属: 多模态视频生成评估 / 多镜头音视频生成基准
- 核心创新点: 提出 MSAVBench,首个专为多镜头音视频生成设计的综合评估基准与自适应混合评估框架。针对现有基准在评估范围、数据多样性和评估管道刚性方面的不足,MSAVBench 引入自适应混合评估机制,能够系统、可靠地评估现代 MSAV 模型在叙事一致性、音视频同步、跨镜头连贯性等维度的能力,推动视频生成从单镜头合成向复杂多镜头叙事的评估体系升级。
- SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation
- 赛道归属: 视频生成 / 联合摄像机运动与物体动态控制
- 核心创新点: 提出 SymphoMotion,首个在单一模型内联合控制摄像机轨迹与物体动态的统一运动控制框架。核心突破在于同时引入显式摄像机参数和物体运动控制机制,从根本上解决了现有方法依赖模糊2D线索导致摄像机视差与真实物体运动相互纠缠的问题,实现了摄像机运动与物体动力学的解耦感知与协同控制,显著提升了生成视频的连贯性与表达力。
- LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation
- 赛道归属: 视频生成安全 / 水印溯源(Image-to-Video 水印)
- 核心创新点: 面向I2V提出“长时鲁棒水印”新问题设定:现有单模态水印难以跨越I2V扩散与时间演化而保持可检测性;提出Robust Diffusion Distance度量水印信号在生成视频中的时间持久性,并据此设计LoT-Pass,使水印在扩散生成与跨帧传播中更稳定、可追踪,从而实现对源图像在I2V产物中的可靠溯源。
GitHub
- [2026-06-28] HKUDS/ViMax ⭐10738
- [2026-06-29] hao-ai-lab/FastVideo ⭐3780
- [2026-06-28] ZeroLu/awesome-seedance ⭐2020
- [2026-06-28] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1455
- [2026-06-28] alexchan197611/ai_media_assistant ⭐140 🆕NEW
音频生成
arXiv
- CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations
- 赛道归属: 文本转语音 / 跨语言口音强度可控语音合成
- 核心创新点: 提出 CrossAccentTTS 框架,核心突破在于对说话人身份与口音特征进行解耦表征,实现在保持说话人音色不变的前提下,独立控制目标口音类型及其强度。相比传统跨语言 TTS 系统缺乏口音显式控制的问题,该方法尤其针对低资源、音系多样的印度语系语言,提供了精细化的口音迁移与强度调节能力。
- Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis
- 赛道归属: 文本转语音 / 日语语音合成与汉字多音字消歧
- 核心创新点: 提出 Sarashina2.2-TTS,一个以日语为核心的 LLM-TTS 系统,针对日语中普遍存在的上下文依赖型汉字多音字问题,创新性地采用数据规模扩展与针对性数据合成双重策略加以解决。其核心突破在于通过定向数据构造弥补现有日语 TTS 数据集在多音字场景下覆盖不足的缺陷,有效提升了日语语音合成的发音准确率。
- Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS
- 赛道归属: 文本转语音 / 基于流匹配的零样本语音合成引导策略
- 核心创新点: 针对流匹配零样本 TTS 中分类器自由引导的局限,提出联合残差重加权方法。创新之处在于重新审视独立遮蔽条件下的 CFG 机制,通过对文本条件与说话人条件的残差项进行解耦重加权,突破了现有分支选择性引导方法在"文本正确性"与"说话人相似度"之间的权衡困境,实现两者的协同提升。
- Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS
- 赛道归属: 文本转语音 / 基于扩散模型的韵律动态建模
- 核心创新点: 针对扩散模型 TTS 解码器在建模急剧韵律转换与快速音调变化时的不足,提出自适应振荡归纳偏置机制。相较于现有使用 Snake 激活函数的周期性非线性方法,该工作引入可自适应调整振幅与频率的激活函数设计,使模型在捕捉谐波结构的同时,具备对突变幅度和频率的灵活建模能力,有效提升表达性语音中细粒度韵律动态的合成质量。
- CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
- 赛道归属: TTS评测基准 / 中文新闻场景发音鲁棒性评测
- 核心创新点: 提出面向“原始输入”的中文新闻TTS目标级自动化评测基准,将易错的书面密集形式(比分、范围、单位符号、百分比、英文缩写、中英数混写专名等)显式定义为可定位的“发音目标”,并以目标是否被正确口播为核心指标,避免仅用整体MOS掩盖关键读音错误;强调在不做文本规范化前提下评估产品级TTS对真实新闻文本的读音保持与语义口播一致性。
- Joycent: Diffusion-based Accent TTS without Accented Phone Prediction
- 赛道归属: 文本转语音 / 基于扩散模型的口音语音合成
- 核心创新点: 提出 Joycent,摒弃了传统口音 TTS 依赖的两阶段管线(标准音素序列→口音音素序列→语音合成),避免了误差积累及对稀缺配对标注数据的依赖。核心创新在于直接在扩散模型框架内,通过声学特征层面的口音表征来建模口音特性,无需显式的文本级口音音素预测步骤,从而实现更自然、更精准的口音语音合成。
- Task-Vector Arithmetic for Emotional Expressivity Control in Language-Model-Based Text-to-Speech
- 赛道归属: 文本转语音 / 基于语言模型的情感表达强度控制
- 核心创新点: 将计算机视觉与 NLP 领域成熟的任务向量算术方法迁移至大规模 LM-TTS 系统的情感强度控制任务。通过系统性消融研究,在 Qwen3-TTS 模型上逐层对比 LoRA 权重、连续编解码嵌入、离散编解码 Token 及说话人嵌入四类操作空间,揭示了任务向量算术在不同操作粒度下对跨说话人情感强度迁移的有效性边界,为 LM-TTS 情感可控性提供了系统性的方法论基准。
- Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages
- 赛道归属: TTS主观评测方法 / 多语言(印度语系)偏好分析
- 核心创新点: 构建“受控的多维度成对评测框架”,通过语言学控制(覆盖母语与混码句、跨10种Indic语言)与感知维度标注相结合,降低TTS成对偏好评测在多语言场景中的高方差与不可解释性;在大规模众包设置下,把偏好拆解到可感知维度并进行系统性偏好归因分析,从而更稳定地比较多模型/多语言TTS质量差异。
- WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models
- 赛道归属: TTS推理优化 / 高效自回归TTS
- 核心创新点: 提出WAND框架,将预训练decoder-only AR-TTS从“全序列自注意力的二次复杂度”改造为近似常数复杂度:把注意力拆分为对条件token的持久全局注意力与对生成序列的局部窗口注意力,在保持条件可达性的同时限制生成侧上下文;再结合知识蒸馏把全注意力教师的质量迁移到窗口注意力学生,实现显著降低显存/算力开销而尽量维持音质与韵律。
- EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
- 赛道归属: 视频到音频生成 / 可控音效生成
- 核心创新点: 提出事件中心的分层控制范式:以“视频中的事件”为可控生成的基本单元,构建层级化控制信号来同时约束事件类型、时间结构与细粒度声学表现,从而提升可控性与可编辑性;针对现有VT2A“视觉条件压制文本指令”的问题,引入更明确的指令遵循与条件平衡机制,使模型能在视频证据与文本创意指令之间进行更可控的融合,并强化细粒度事件级对齐。
GitHub
- [2026-06-28] huggingface/diffusers ⭐33949
- [2026-06-27] Ameobea/web-synth ⭐559
- [2026-06-28] apocas/restai ⭐510
语言大模型
arXiv
- LLM-MINE: Large Language Model based Alzheimer's Disease and Related Dementias Phenotypes Mining from Clinical Notes
- 赛道归属: 医疗NLP / 临床文本信息抽取(表型挖掘)
- 核心创新点: 提出LLM-MINE,用大语言模型将非结构化临床笔记中的ADRD(阿尔茨海默病及相关痴呆)表型进行自动化抽取与结构化归因;方法上强调以“专家定义的表型 schema/标签体系 + LLM抽取流程”来覆盖分散在叙述文本中的关键信息,并通过专家标注/验证形成可用于早筛与分期的高质量表型数据资产。
- Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War
- 赛道归属: LLM评测基准 / 多智能体对抗与可靠性评测(推理+博弈+协议约束)
- 核心创新点: 提出Age of LLM这一1v1回合制对抗基准,将三类压力源系统化注入评测:战争迷雾(部分可观测)、完整外交沟通(谈判/停火/威胁且信息可隐藏)、以及严格JSON动作协议下的可靠性约束(非法动作被静默丢弃);通过私有引擎、随机地图种子与随机对手机制降低数据污染与“背题”风险,使评测更贴近真实交互式决策与工具/协议执行场景。
- How Large Language Models Source Brand Reputation Across Languages and Markets
- 赛道归属: 大语言模型 / 品牌声誉分析 / 引用溯源
- 核心创新点: 该研究将分析视角从LLM生成的答案文本前移一步,聚焦于LLM回答时所引用的URL来源。通过融合三个Rankfor.AI数据集,覆盖128个品牌、12个市场、13种语言,对167,551条URL级别的引用记录进行系统性分类与跨语言/跨市场比较分析,揭示了LLM在品牌信息溯源过程中的语言偏差与市场差异规律,为企业AI品牌可见性管理提供了以"引用来源"为核心的新分析框架。
- Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation
- 赛道归属: 大语言模型安全评估 / 对抗鲁棒性 / 轻量化安全分类器
- 核心创新点: 针对LLM安全评估中判别器部署成本高、延迟大的痛点,系统性地探索以ModernBERT家族(含ModernBERT与Ettin)为代表的现代编码器微调分类器能否替代基于解码器的LLM安全判别器。研究通过对比编码器与解码器在对抗样本识别上的性能-成本权衡,为工业界在低延迟、低成本约束下构建安全护栏提供了系统性实证依据,核心突破在于验证了轻量级编码器架构在对抗安全评估场景中的竞争力。
- A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation
- 赛道归属: 大语言模型红队测试 / 可信度评估 / 多智能体对抗框架
- 核心创新点: 提出了一种结构化红队测试框架,其核心创新在于引入多角色架构——由目标模型、攻击模型和陪审团模型协同工作。攻击模型通过迭代生成越来越有效的对抗样本,陪审团模型负责客观评判,两者共同驱动对目标模型忠实性漏洞的系统性挖掘。该框架将自动化对抗生成与多视角评估相结合,突破了人工红队测试覆盖面有限的瓶颈,并以忠实性评估作为具体落地案例。
- Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models
- 赛道归属: 语音语言模型 / 方言鲁棒性评估 / 多模态LLM评测
- 核心创新点: 聚焦于语音语言模型在方言理解上的系统性评估空白,以日语方言为研究对象,设计了跨越语音与文本两种模态的方言鲁棒性评估体系。核心创新在于同时考察基础LLM的文本方言能力与集成语音组件后的SLM方言能力之间的关联与差异,揭示语音处理模块对方言理解的影响机制,为构建方言鲁棒的语音对话系统提供了系统性实证分析路径。
- LLM-Based Scientific Peer Review: Methods, Benchmarks, and Reliability Challenges
- 赛道归属: 大语言模型应用 / 自动化同行评审 / 可靠性与安全性综述
- 核心创新点: 这是一篇面向LLM辅助科学同行评审的系统性综述,其核心贡献在于从系统层面(而非仅关注单一模型性能)对该领域进行全面审视,涵盖方法论、评测基准与可靠性挑战三个维度。研究不仅梳理了LLM生成评审意见的能力现状,更重点揭示了其在鲁棒性与安全性方面的深层不足——包括对抗操纵风险和决策支持可靠性问题——为该领域的规范化应用提供了批判性的系统级分析框架。
- IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation
- 赛道归属: 文生图(结构可控生成 / 规划-渲染解耦)
- 核心创新点: 提出“隐式视觉思维链”作为潜空间的结构规划机制,将对象数量、空间关系、属性绑定与布局等“结构性意图”从外观渲染中解耦:先在潜变量中形成可组合的结构计划,再驱动后续生成以提升结构遵循能力;通过把结构推理从单一条件流的纠缠中分离,显著改善复杂结构提示下的可控性与一致性。
- Scaling Laws for Task-Specific LLM Distillation
- 赛道归属: 模型压缩与蒸馏 / 任务域专用LLM缩放规律
- 核心创新点: 系统推导并验证“任务域蒸馏/压缩”的经验缩放规律,量化在不同数据规模、压缩比、监督格式以及迭代剪枝策略下,域内能力与通用知识保真度如何变化;以量化金融为实验域,对比多种压缩与训练配置,给出可操作的预算分配与训练策略指引(在给定延迟/成本约束下如何选数据与压缩路径)。
- ScaleToT: Generalizing Structured LLM Reasoning for Billion-Scale Low-Activity User Modeling
- 赛道归属: 推荐与用户建模 / 结构化推理蒸馏与规模化部署(低活跃用户)
- 核心创新点: 提出ScaleToT:先对小规模用户子集调用LLM生成“结构化推理轨迹/树状思维(ToT式)”以学习可迁移的推理结构,再将该结构化推理能力蒸馏/泛化到海量低活跃用户,从而在稀疏画像下提升推断稳定性并显著降低对LLM逐用户调用成本;核心在于把LLM的高成本推理转化为可规模化的结构化策略/模型。
GitHub
- [2026-06-29] sgl-project/sglang ⭐29749
- [2026-06-28] google-ai-edge/LiteRT-LM ⭐5733
- [2026-06-28] HelloWorldLTY/scEval ⭐116 🆕NEW
- [2026-06-28] yzfly/awesome-context-engineering ⭐109 🆕NEW
- [2026-06-29] wonglaitung/fortune ⭐58
HuggingFace Models
HuggingFace Datasets
- [2026-06-19] Glint-Research/Fable-5-traces
Glint Research Dataset Card Fable 5 Pi Agent Traces A compact, high-signal corpus of Fable 5 coding-agen...
- [2026-06-21] Crownelius/Complete-FABLE.5-traces-2M 🆕NEW
Complete FABLE.5 Traces 2M
Full FABLE.5 / Mythos corpus restored, with session-limit answer rows removed. Dataset Viewer | Parq...
多模态大模型
arXiv
- Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling
- 赛道归属: 多模态理解(长视频理解/高效采样与推理加速)
- 核心创新点: 将长视频帧选择形式化为“准高斯采样”问题,提出一种自适应、免训练的帧采样策略:用连续、可调的软采样分布替代传统关键帧“硬采样”,在计算/显存受限下更灵活地覆盖关键时刻并抑制噪声帧,从而在不改动模型训练的前提下提升长视频理解效率与效果。
- AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs
- 赛道归属: 多模态理解 / 跨模态评测基准
- 核心创新点: 提出AMVICC基准,系统性地对比VLMs(图像→文本)与图像生成模型IGMs(文本→图像)在相同视觉概念上的失败模式,实现跨模态失效剖析。核心创新在于将图文双向任务置于同一评测框架下,通过"跨模态失败模式对齐"揭示两类模型在物体朝向、数量感知、空间关系等基础视觉概念上的共性与差异性缺陷,为多模态系统的弱点诊断提供了对称性视角。
- Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
- 赛道归属: 多模态理解 / GUI智能体 / 不确定性量化
- 核心创新点: 提出Argus基准,专门针对"计算机操作智能体"场景下VLM预测的不确定性量化问题,系统评估多种后验UQ方法在跨模型、跨数据集、跨GUI界面变化下的稳定性。创新点在于引入"跨体制"评测范式,分离模型、数据集、界面三个维度的UQ排名漂移,并定义拒绝决策、空间安全区域等面向GUI点击执行的实用UQ指标,填补了GUI智能体可靠性评估的空白。
- Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding
- 赛道归属: 多模态理解 / 流式视频理解
- 核心创新点: 提出CausalMem,一种无需训练的流式视频理解方法,通过构建"动态且固定预算"的记忆库来应对无限增长的视频帧。核心创新在于以因果推断视角设计帧重要性评估机制,在固定存储预算约束下动态淘汰低价值帧、保留关键语义信息,同时利用对未来指令的不确定性建模来增强记忆的通用性,实现了无训练开销下的高效长视频在线处理。
- Steering Vision-Language Models with Joint Sparse Autoencoders
- 赛道归属: 多模态理解 / 模型可解释性 / 跨模态表示控制
- 核心创新点: 提出联合稀疏自编码器,通过引入显式跨模态对齐约束,将视觉激活序列与语言激活序列联合分解为共享的、可解释的图文级别特征。相比传统单模态SAE,JSAE能从VLM内部提取真正跨模态的可控特征方向,使视觉特征可直接用作语言生成的引导向量,实现了对VLM内部多模态表示的精准解耦与可控操纵。
- AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression
- 赛道归属: 多模态理解(长时音视频理解/上下文压缩与检索式建模)
- 核心创新点: 提出 AVOC,在模态编码器与LLM之间插入可学习的 token 压缩模块,借鉴检索思想将长时音视频的冗余 token 压缩为更“可检索/可聚合”的紧凑表示,以缓解上下文窗口限制与跨模态冗余;通过在不牺牲关键信息的前提下降低 token 数,实现小时级音视频输入的可扩展理解。
- Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models
- 赛道归属: 推理优化(MLLM 视觉token剪枝/训练免调优加速)
- 核心创新点: 提出基于“谱演化”信号的免训练 token 剪枝框架:不再依赖单层注意力或相似度等局部指标,而是利用跨层表示变换的谱特征来评估 token 的全局贡献,减少位置偏置并更稳健地识别冗余视觉 token,在加速推理的同时尽量保持跨模态推理能力。
- MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism
- 赛道归属: 多模态理解 / 长视频理解 / 智能体推理
- 核心创新点: 提出MemDreamer框架,通过将感知与推理解耦,将小时级长视频理解转化为智能体式探索过程。核心创新包括:①构建层次化图记忆(三层自顶向下语义抽象结构),以增量流式方式处理视频并压缩长程时序信息;②设计智能体检索机制,按需动态查询记忆图中的相关节点,规避全序列注意力的token爆炸问题。该框架为即插即用设计,无需对底层VLM进行重新训练。
- Same Evidence, Different Answer: Auditing Order Sensitivity in Multimodal Large Language Models
- 赛道归属: 多模态理解 / 模型鲁棒性评测 / 顺序敏感性分析
- 核心创新点: 提出Facet-Probe审计框架,从选项顺序、证据块顺序、文档排名、图像集顺序、混合模态顺序五个维度系统评测18个前沿MLLM的顺序敏感性。方法论创新在于引入贝叶斯项目反应模型将"顺序噪声"与"每维度系统性偏差"解耦分离,并通过显著性感知的采样策略高效覆盖指数级排列空间,揭示了现有MLLM在顺序无关可靠性上的系统性缺陷。
- How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations
- 赛道归属: 多模态理解 / OCR推理 / 视觉鲁棒性评测
- 核心创新点: 提出OCR-Robust基准,专门评测VLMs在受控视觉退化条件下的OCR推理鲁棒性。核心创新在于系统设计了多级视觉扰动(模糊、噪声、压缩、几何变形等),并建立了"OCR错误传播→结构性失真→推理不确定性"的因果分析链路,区分了视觉层面的感知错误与推理层面的逻辑错误,为文本密集型场景下VLM的可靠性短板提供了细粒度诊断。
GitHub
- [2026-06-28] Blaizzy/mlx-vlm ⭐5094
- [2026-06-24] NVlabs/Eagle ⭐2845
- [2026-06-28] waybarrios/vllm-mlx ⭐1376 🆕NEW
- [2026-06-25] EvolvingLMMs-Lab/NEO ⭐842
- [2026-06-26] liudaizong/Awesome-LVLM-Attack ⭐563
强化学习
arXiv
- FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
- 赛道归属: 大语言模型强化学习对齐 / LLM RL Alignment
- 核心创新点: 针对GRPO等策略梯度方法在训练中梯度方向不稳定的问题,提出反馈驱动的双目标协同强化学习框架。核心突破在于同时优化策略目标与反馈信号目标,通过双目标协同机制动态校正梯度方向,避免单一奖励信号导致的训练偏移,从而更稳定地解锁大模型推理能力。
- Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It
- 赛道归属: 大语言模型智能体 / 多步工具调用强化学习
- 核心创新点: 系统性分析了多步工具调用场景下RL训练崩溃的根本原因——特定控制token的概率异常尖峰导致工具调用结构失效。核心创新在于引入监督信号对控制token进行约束,通过混合监督-强化学习范式稳定工具调用格式,从根本上解决agentic RL在工具使用场景中的稳定性问题。
- OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning
- 赛道归属: 开放域任务强化学习对齐 / Open-Ended RL Alignment
- 核心创新点: 针对创意写作等开放域任务中LLM-as-a-judge奖励模型存在风格偏见和位置不一致性问题,提出OPERA框架,以基于困惑度的内在奖励替代外部评判模型。核心突破在于利用参考模型的困惑度作为客观、无偏的奖励信号,摆脱了对外部评判器的依赖,实现开放域任务的稳定RL训练。
- Memory-Efficient Policy Libraries with Low-Rank Adaptation in Reinforcement Learning
- 赛道归属: 机器人强化学习 / 参数高效多任务策略学习
- 核心创新点: 将NLP领域的低秩适配技术迁移至机器人多任务强化学习场景,构建内存高效的策略库。核心突破在于用LoRA低秩矩阵参数化各专项任务策略,在显著降低内存占用和计算开销的同时,维持多任务策略库的性能,验证了PEFT方法在具身智能RL领域的可行性与优越性。
- Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors
- 赛道归属: 离线到在线强化学习 / Offline-to-Online RL
- 核心创新点: 针对现有离线先验辅助在线RL方法"一刀切"的局限性,提出诊断驱动的自适应框架。核心创新在于对在线RL训练过程进行实时诊断(如识别过拟合、分布偏移、探索不足等症状),根据诊断结果动态调整离线先验的利用策略,实现针对不同训练阶段和问题类型的个性化先验集成。
- Bias-Controlled Primal-Dual Natural Actor-Critic: Optimal Rates for Constrained Multi-Objective Average-Reward RL
- 赛道归属: 约束多目标强化学习 / 理论优化
- 核心创新点: 在无限时域平均奖励设定下,针对多目标冲突与安全约束并存的RL问题,提出偏差可控的原始-对偶自然Actor-Critic算法。核心突破在于:通过精确控制值函数估计的偏差项,配合自然策略梯度与原始-对偶框架,在非线性凹性标量化目标下首次实现最优收敛速率的理论证明,填补了约束多目标平均奖励RL的理论空白。
- Uncertainty-aware reinforcement learning for chemical language models
- 赛道归属: 分子设计强化学习 / 不确定性感知药物发现
- 核心创新点: 针对现有化学语言模型RL框架将所有评分函数视为确定性预言机、忽略分子属性预测不确定性的问题,提出不确定性感知RL框架。核心创新在于将分子属性预测的不确定性显式纳入奖励信号设计,通过不确定性惩罚或置信区间约束引导探索,避免在高不确定性区域的无效探索,提升分子从头设计的可靠性与效率。
- Supervised Reinforcement Learning for the Coordination of Distributed Energy Resources
- 赛道归属: 能源系统强化学习 / 分布式能源资源优化
- 核心创新点: 针对分布式能源资源管理中标准RL方法样本效率低、从零训练次优的问题,提出监督强化学习框架。核心创新在于将传统优化方法生成的离线专家解作为监督先验,结合在线RL探索,通过监督预训练初始化策略网络后再进行RL微调,显著提升样本效率并降低训练过程中的次优性风险,适应DERs固有的不确定性与复杂建模需求。
- Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback
- 赛道归属: 强化学习对齐与可解释性(RLHF + XAI评测框架)
- 核心创新点: 提出将“可解释性测试/诊断”与“人类反馈对齐训练”统一到同一套可复用框架中的Themis,用于系统化发现与缓解RLHF中的不安全/不期望行为;核心突破在于把XAI作为一等公民嵌入RLHF的测试与评估流程(而非事后分析),支持多任务/多算法的标准化评测与可追溯的行为归因,从而提升对奖励黑客、策略捷径等问题的可观测性与调试效率。
- Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation
- 赛道归属: GUI智能体强化学习与自动化奖励/评测
- 核心创新点: 针对桌面GUI环境“奖励难以机器可读、成功标准强视觉依赖”的瓶颈,提出用自主的视觉-语言评估器生成可扩展的训练信号与离线/在线评测闭环;方法论突破在于把“任务成功判定”从手工奖励工程转为可学习、可扩展的自动评审模块,从而支持对开放式GUI任务进行RL微调,并显著降低对人工标注与密集奖励设计的依赖。
GitHub
- [2026-06-28] Unity-Technologies/ml-agents ⭐19521 🆕NEW
- [2026-06-28] google-deepmind/dm_control ⭐4621 🆕NEW
- [2026-06-28] natolambert/rlhf-book ⭐2069
- [2026-06-28] Farama-Foundation/Metaworld ⭐1837
- [2026-06-28] ex18a/pwnagotchi64 ⭐54
HuggingFace Models
HuggingFace Datasets
- [2026-06-24] Qwen/AgentWorldBench
AgentWorldBench
AgentWorldBench is a comprehensive evaluation benchmark for language world models, constructed from real-world observat...
- [2025-01-15] mlabonne/open-perfectblend 🆕NEW
🎨 Open-PerfectBlend
Open-PerfectBlend is an open-source reproduction of the instruction dataset introduced in the paper "The Perfect Blend...
世界动作模型
GitHub
- [2026-06-26] OpenMOSS/Awesome-WAM ⭐972
- [2026-06-23] world-action-models/awesome-world-action-models ⭐293
- [2026-06-26] yuyangalin/ImageWAM ⭐87
- [2026-06-23] gangweix/next-forcing ⭐83
由 Research Daily 自动生成 生成时间: 2026-06-29 01:00:18