AI 每日进展速报 - 2026-08-14
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation
- 赛道归属: 文生图 / 多语言评测与跨语言一致性分析
- 核心创新点: 提出 LingT2I 基准测试集,覆盖 10 种主流语言、33K 条提示词,系统性地评估多语言文生图模型在内容生成与文字渲染两个维度上的跨语言一致性差异。核心突破在于首次将跨语言效应(cross-lingual effects)作为独立研究维度引入文生图评测体系,填补了现有研究过度聚焦英语场景的空白,为揭示语言特异性偏差提供了标准化分析框架。
- In-Loop Model Adaptation with Coupled Latent-Noise Guidance for High-Fidelity Subject-Driven Text-to-Image Generation
- 赛道归属: 文生图 / 主体驱动个性化生成(Subject-Driven Text-to-Image Generation)
- 核心创新点: 提出"循环内模型自适应"(In-Loop Model Adaptation)机制,结合"耦合潜变量-噪声引导"(Coupled Latent-Noise Guidance)策略,使扩散模型在推理阶段即可针对不同参考图像的主体外观进行动态适配,无需为每个主体单独微调模型。核心突破在于将参考图像的视觉信息通过潜变量与噪声的联合引导注入生成过程,从而在保持文本语义灵活性的同时,实现对主体身份的高保真一致性维护。
- Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation
- 赛道归属: 文生图(艺术风格控制与生成)
- 核心创新点: 提出 Atelier 框架,核心突破在于识别并规避图像生成模型对艺术家名称的"捷径依赖"问题(如模型倾向于复现艺术家的标志性符号、通用色调而非用户真实意图)。框架将模糊的艺术意图显式分解为独立的"控制状态",将艺术家风格属性(构图、笔触、色彩等)与场景语义解耦,从而实现更忠实于用户意图的艺术家风格引导生成,而非简单的风格标签映射。
- Introspective Attention Modulation for Safe Text-to-Image Generation
- 赛道归属: 文生图 / 安全内容生成与推理时干预
- 核心创新点: 提出基于推理时内省式注意力调制(Introspective Attention Modulation)的安全生成方法,通过在推理阶段动态监控并干预模型内部注意力动态来抑制不安全内容生成,而非依赖概念擦除、提示过滤或分类器门控等易被绕过的外部防护手段。核心突破在于将安全机制内化至模型的注意力机制层面,使其对参数高效微调(PEFT)等常见绕过攻击具备更强的鲁棒性,实现了无需修改模型权重的原则性安全控制范式。
- RL-Native Distillation: Exploiting Scored Trajectories for Few-Step Image Generation
- 赛道归属: 文生图 / 扩散模型加速蒸馏与强化学习对齐(Few-Step Distillation & RL Reward Alignment)
- 核心创新点: 提出"RL原生蒸馏"(RL-Native Distillation)范式,打破传统"先RL对齐、再蒸馏压缩"的串行流程。核心创新在于直接复用RL训练过程中已带奖励评分的有限步轨迹(scored trajectories),将其中间状态作为蒸馏监督信号,使奖励对齐与少步蒸馏在同一训练过程中协同完成,避免了两阶段流程中奖励增益在压缩时丢失的问题,同时降低了整体训练成本。
- HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models
- 赛道归属: 文生图(无训练高分辨率生成)
- 核心创新点: 针对现有无训练高分辨率生成研究主要集中于 U-Net 架构、而对 DiT 架构适配不足的问题,系统性地揭示了将现成 DiT 模型直接应用于高分辨率生成时的两大关键障碍,并提出 HRDiT 框架加以解决。其方法论突破在于无需任何额外训练,通过对 DiT 注意力机制和位置编码的针对性改造,使预训练 DiT 模型具备超出其原始训练分辨率的生成能力。
- Evaluation of Clinically Steerable Retinal Image Generation from Foundation Model Latent Spaces 🆕NEW
- 赛道归属: 医学图像生成(可控视网膜图像合成)
- 核心创新点: 该工作聚焦于医学基础模型潜在空间的可控图像生成能力评估。核心创新在于将四种视网膜基础模型纳入"表示tokenizer"框架,系统性地检验基础模型潜在表示中所编码的人口统计学信息(如年龄、性别)与临床表型信息,在经由潜在空间解码生成合成图像后是否得到忠实保留。该方法将基础模型的语义潜在空间作为生成的条件控制信号,实现了对临床属性的可引导式图像合成,为医学图像的临床可控生成提供了系统性评估框架,填补了医学基础模型在可控生成能力验证方面的研究空白。
- CoQui: A Coordinate-Conditioned Quantum Implicit Generative Adversarial Network for End-to-End Image Generation
- 赛道归属: 文生图 / 量子计算图像生成
- 核心创新点: 提出了一种基于坐标条件的量子隐式生成对抗网络(CoQui),核心突破在于将隐式神经表示(INR)范式引入量子GAN框架:以像素坐标作为输入条件,让量子电路逐像素预测颜色值,而非从归一化量子态中同时解码所有像素。这一设计从根本上解耦了量子资源需求与图像分辨率之间的强绑定关系,避免了传统振幅编码方案中像素间的概率竞争问题,实现了端到端的可扩展量子图像生成。
- Fingerprinting Text-to-Image Diffusion Models via Collapsed Generation
- 赛道归属: 文生图 / 模型安全与知识产权保护
- 核心创新点: 提出了一种基于"坍缩生成"(Collapsed Generation)现象的非侵入式文生图扩散模型指纹识别框架。核心发现是:特定输入条件会使模型在多个随机种子下产生高度一致的图像,这种确定性行为构成模型的天然指纹。该方法无需修改模型权重或嵌入水印,通过挖掘模型固有的生成退化模式来实现版权归属验证,对模型泄露、复制及未授权微调等场景具有较强的鲁棒性。
- TangPoetryBench: A Multi-Dimensional Benchmark and Rubric-Conditioned Evaluator for Poetry-to-Image Generation
- 赛道归属: 文生图 / 评测基准与评估方法
- 核心创新点: 针对诗歌(唐诗)到图像生成这一高语义密度任务,构建了多维度评测基准TangPoetryBench,并设计了基于评分细则条件化的自动评估器。核心创新在于将评估维度细化为视觉质量、意象忠实度、文化风格适配性、情感表达等多个层次,尤其攻克了"隐含情感"这一现有指标(CLIPScore、BLIPScore等)无法有效衡量的难题,通过引入rubric-conditioned评估机制实现对深层文学语义的量化评估。
GitHub
- [2026-08-14] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐13198 🆕NEW
- [2026-08-14] alfredxw/denova ⭐609 🆕NEW
- [2026-08-14] etkecc/baibot ⭐238
- [2026-08-14] Z1rconium/gpt-image-panel ⭐93
- [2026-08-14] yuji-hatakeyama/opencode-gpt-imagegen ⭐70 🆕NEW
HuggingFace Datasets
- [2026-08-08] biglam/british-library-book-images
视频生成/编辑
arXiv
- Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization 🆕NEW
- 赛道归属: 视频生成(空间可控文生视频)
- 核心创新点: 针对扩散Transformer文生视频模型中空间可控生成依赖梯度优化导致计算开销巨大的问题,提出一种推理阶段无梯度优化方法。核心突破在于完全绕开反向传播,通过无梯度策略在推理时实现对象空间位置的精确控制,在保持生成质量的同时大幅降低计算成本,尤其适配现代大规模架构。
- SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense
- 赛道归属: 视频生成安全防御 / 文生视频对抗攻击防护
- 核心创新点: 针对文生视频模型的越狱攻击防御问题,提出了一种基于交叉注意力特征空间的轻量级防御机制 SafeCA。核心创新在于:系统性地分析并揭示了正常样本与越狱样本在交叉注意力特征空间中的本质差异,据此设计了精准的跨注意力定位与调控策略,在无需对输入进行过滤或重建的前提下直接在模型内部特征层面实施干预,从而在大幅降低计算延迟的同时有效避免了语义失真问题,实现了高效且语义保真的越狱防御。
- Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation
- 赛道归属: 视频生成 / 流式视频生成 / 扩散模型训练策略
- 核心创新点: 针对流式视频生成中训练与推理阶段去噪顺序不一致(train-inference mismatch)的根本性问题,提出了 Stream Forcing 方法。核心创新在于:将视频生成过程重新形式化为统一的训练轨迹构建框架,通过设计一种兼顾训练覆盖多样性与推理时序一致性的噪声级别配置策略,打破了"训练多样性"与"推理一致性"之间的固有矛盾,使模型在保持对多样噪声条件充分学习的同时,与在线序列推理的去噪顺序高度对齐,从而显著提升流式视频生成的鲁棒性和连贯性。
- Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains
- 赛道归属: 视频生成评测基准
- 核心创新点: 提出首个面向科学领域的知识密集型与推理密集型视频生成评测基准 Sci-VBench,覆盖自然科学、医疗健康、人文社科和工程学四大学科共60个子领域、1253个专家标注样本。其核心突破在于将评测维度从"视觉合理性"提升至"科学推理正确性与知识一致性",要求模型生成具备时序逻辑和科学知识支撑的视频,填补了现有基准在科学领域深度评估上的空白。
- DUET: A Diversity-Quality Duet of Distillation Experts for Two-Step Video Generation
- 赛道归属: 视频生成(扩散模型加速/蒸馏)
- 核心创新点: 提出 DUET 框架,通过"双专家协同蒸馏"策略同时解决两步视频生成中质量与多样性的固有权衡问题。核心方法是将轨迹级蒸馏(如 sCM,擅长多样性)与分布级蒸馏(如 DMD,擅长质量)两种范式的专家模型进行互补融合,在仅两步采样的极端加速条件下实现质量与多样性的双重提升,突破了单一蒸馏范式难以兼顾两者的瓶颈。
- EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation
- 赛道归属: 视频生成 / 音频驱动视频生成 / 推理加速
- 核心创新点: 提出 EchoCache,一种面向音频驱动视频生成(A2V)的能量引导跨模态缓存加速方法。核心创新在于识别并解决了 A2V 场景中现有缓存方法的两层错位问题:现有方法仅利用视觉特征的时序冗余,而忽视了音频驱动视觉生成时跨模态对齐的高度非均匀时序重要性。EchoCache 通过音频能量信号动态指导缓存策略,在跨模态对齐感知下选择性复用特征,在保持音视频对齐质量的同时显著降低扩散模型迭代去噪的推理开销。
- VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
- 赛道归属: 视频生成(物理一致性/智能体系统)
- 核心创新点: 提出 VideoCoCo 系统,以"代码作为思维链(Code-as-CoT)"替代传统文本或视觉状态中间表示,通过可执行代码精确描述场景的完整时空演化过程。系统采用双引擎智能体架构(Agentic Dual-Engine),将物理规律编码为可运行的程序逻辑,从而在文生视频中实现可控、可验证的物理一致性动态生成,根本性地解决了文本提示对时序物理过程描述能力不足的问题。
- HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control 🆕NEW
- 赛道归属: 视频生成(自我中心/第一视角视频生成)
- 核心创新点: 提出HandsOnWorld框架,核心创新在于摆脱对多视角或标记式动捕设备的依赖,直接从无约束单目视频中学习手部控制的第一视角视频生成。引入以主角为中心的标注流水线,在动作语义、图像质量和3D几何三个层面对单目3D重建结果进行过滤,构建EgoVid-Pro数据集,并实现相机运动与手部运动的解耦控制,将可用训练场景从受限实验室环境扩展至真实世界多样化场景。
- Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation 🆕NEW
- 赛道归属: 视频生成(交互式自回归视频生成)
- 核心创新点: 提出Delta Forcing方法,核心创新在于引入信任域引导机制来解决交互式自回归视频生成中反应性与稳定性之间的根本矛盾。通过对模型输出的"增量"(delta)施加约束,在信任域内进行条件引导,使模型既能及时响应动态事件条件,又能在长时序上维持时序一致性,避免了现有蒸馏+流式微调方案中的稳定性退化问题。
- Not All Frames Deserve Full Computation: Accelerating Autoregressive Video Generation via Selective Computation and Predictive Extrapolation 🆕NEW
- 赛道归属: 视频生成(自回归视频生成推理加速)
- 核心创新点: 针对自回归视频扩散模型中重复多步去噪开销巨大的问题,突破现有方法"二元缓存或重计算"的粗粒度决策范式,提出选择性计算与预测外推相结合的加速框架。核心创新有两点:一是引入细粒度的中间计算状态,避免直接复用过粗或全量重算过贵的两难困境;二是针对异步自回归调度中不同帧具有不同噪声级别的特性,设计差异化的计算分配策略,而非对整个有效区间均匀处理,从而在无需训练的前提下实现更高效的推理加速。
GitHub
- [2026-08-14] hao-ai-lab/FastVideo ⭐3944
- [2026-08-14] ZeroLu/awesome-seedance ⭐2291
- [2026-08-14] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1837 🆕NEW
- [2026-08-14] wordghost1234/agnes-ai-storyboard-studio ⭐156
- [2026-08-14] 1038lab/ComfyUI-MiniMax-H3-Promptor ⭐118 🆕NEW
HuggingFace Models
音频生成
arXiv
- ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling 🆕NEW
- 赛道归属: 视频生成配音 / 视频转音频生成(Video-to-Audio Generation)
- 核心创新点: ControlFoley 提出了一个统一的多模态视频转音频生成框架,核心突破在于跨模态冲突处理机制:当视觉内容与文本描述存在语义冲突时,通过专门设计的冲突感知模块实现鲁棒的文本可控性,而非简单地让视觉信号主导生成。此外,针对参考音频中时序信息与音色信息相互纠缠导致风格控制不精准的问题,提出了解耦时序与音色表征的方法,实现细粒度的风格化控制。同时,该工作还构建了标准化评测基准,填补了该领域系统性评估体系的空白。
- VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching 🆕NEW
- 赛道归属: 文本生成音频 / 声音合成(Text-to-Audio Generation / Vocalized Audio Synthesis)
- 核心创新点: VoxAudio 针对"语音嵌入环境音景"这一复合音频合成任务,提出了基于因果自回归流匹配(Causal Autoregressive Flow Matching)的统一生成框架,核心突破在于:摒弃了传统"TTS独立生成后混音"的两阶段流水线,将可理解语音与环境声在同一模型内联合生成,从而天然保留了语音出现时机与场景声学交互的一致性。进一步引入多奖励训练机制,通过多维度奖励信号(如语音可懂度、音景真实性等)对自回归生成过程进行强化优化,解决了单一目标训练下语音清晰度与环境声质量难以兼顾的核心矛盾。
- Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder
- 赛道归属: 语音合成(Text-to-Speech / 跨语言零样本语音克隆)
- 核心创新点: 提出无需参考音频转录文本(Transcript-Free)的跨语言零样本TTS系统。核心突破在于引入可学习的说话人编码器(Learnable Speaker Encoder),使系统能够直接从未标注的野生参考音频中提取说话人特征,彻底消除推理阶段对音频文本对齐的依赖。这一设计使得跨语言语音克隆(如用中文参考音频合成英文语音)成为可能,同时支持14种语言的多语言场景,显著拓宽了零样本TTS在真实世界中的适用边界。
- Luna-TTS Family Technical Report
- 赛道归属: 语音合成(Text-to-Speech / 扩散语言模型语音生成)
- 核心创新点: 针对主流自回归(AR)Codec语言模型在TTS中存在的延迟随句长增长、前缀误差累积、RVQ token网格生成顺序不自然等固有缺陷,提出基于扩散语言模型(Diffusion Language Model)的TTS系统家族Luna-TTS。核心方法突破在于以扩散过程替代自回归解码,实现对RVQ token的非顺序并行生成,从根本上解耦生成顺序与语音时序的绑定关系。系统在中、英、日、韩四语言共100万小时语音数据上预训练,并通过渐进式构建策略形成模型家族,在保持高质量合成的同时大幅降低推理延迟。
- ASR-Roundtrip Evaluation Can Mask Context- and Convention-Dependent Reading Errors in Chinese News TTS
- 赛道归属: 文本转语音(TTS)评估方法
- 核心创新点: 该工作揭示了ASR往返评估(ASR-Roundtrip Evaluation)在中文新闻TTS场景下存在系统性盲区——当TTS模型对依赖上下文或领域惯例的文本(如体育比分、机型编号、技术单位、会员名称等)产生语义错误的发音时,ASR系统仍能将错误音频反向转录为"表面正确"的文本,从而掩盖真实的朗读错误,导致评估指标虚高。核心方法突破在于:系统性地构建了一套上下文依赖型和惯例依赖型的中文TTS测试用例集,通过对比Raw TTS输出与目标读音,量化揭示ASR往返评估的假阴性率,并提出以人工感知评估或针对性规则校正作为补充手段,从而为TTS可懂度评估体系的可靠性提供了重要的方法论警示与修正方向。
- Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions
- 赛道归属: 文本转语音(TTS)评估 / 语音质量评测
- 核心创新点: 将TTS评估中笼统的"自然度"概念解构为10个具有语言学依据的感知维度(如韵律、发音、流畅度等),并基于此构建了首个维度级TTS元评估基准。核心突破在于系统性地揭示了现有MOS预测器和Audio-LLM评判器在细粒度感知维度上的能力边界与盲区,为TTS评估方法的改进提供了可量化的诊断框架。
- MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation
- 赛道归属: 文本生成音乐(Text-to-Music Generation)/ 可控音乐生成
- 核心创新点: 提出MusicLayout,一种显式的音乐结构中间表示,将音乐生成过程解耦为"结构规划"与"音频生成"两阶段。MusicLayout以时间对齐的方式描述段落、音色、重复和变奏等结构元素,使得音乐的宏观组织在音频生成前即可被检查、修改和精确控制。核心突破在于将隐式的全局文本提示转化为可解释、可编辑的显式结构布局,填补了文生音乐领域结构级可控性的空白。
- CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents
- 赛道归属: 文本转语音(TTS)/ 零样本语音合成 / 流式推理优化
- 核心创新点: 提出CuteTTS,通过对连续潜变量进行自回归建模实现高效高质量语音合成。核心创新在于:设计了低码率且保留足够声学细节的连续潜空间序列,并针对流式场景优化推理效率,避免了扩散模型多步迭代采样和无分类器引导带来的高延迟问题,在紧凑流式系统与高保真合成之间取得平衡。
- CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis
- 赛道归属: 文本转语音(TTS)/ 表达性语音合成 / 细粒度韵律控制
- 核心创新点: 提出CtrlSpeech,基于DiTAR架构实现从粗到细的表达性语音控制框架。核心突破在于将全局说话人条件与音素级对齐的音高、响度、时长信号相结合,支持词级或音素级的局部韵律精细控制,同时保持目标说话人音色的一致性,解决了现有TTS系统在细粒度表达控制上的不足。
- MMAG: A Multi-Control Mixed Audio Generation Benchmark
- 赛道归属: 音频生成评测基准(Audio Generation Benchmark)
- 核心创新点: 提出首个面向多控制条件混合音频生成的综合评测基准 MMAG,核心突破在于将语音、音乐、音效三类声学元素的联合生成纳入统一评测框架,同时设计了涵盖语义保真度、说话人一致性和时序控制等多维度的细粒度评估指标,填补了现有基准仅聚焦单一模态或粗粒度描述的空白。
GitHub
- [2026-08-13] huggingface/diffusers ⭐34308 🆕NEW
- [2026-08-09] Stability-AI/stable-audio-tools ⭐3839
- [2026-08-10] BinWang28/audio-ai-hub ⭐948
- [2026-08-09] apocas/restai ⭐512
- [2026-08-13] xiaomi-research/controlfoley ⭐143 🆕NEW
HuggingFace Models
语言大模型
arXiv
- Large language models reorganize representational geometry during in-context learning
- 赛道归属: 大语言模型机制解释 / 上下文学习(In-Context Learning)
- 核心创新点: 提出利用LLM预训练表征几何结构来预测上下文学习(ICL)效果的新视角。核心发现是:LLM在ICL过程中会主动重组内部表征几何,将任务相关类别的表征从预训练空间中分离并重新排列,且这种重组程度与ICL性能高度相关。该工作首次将"表征几何可重组性"作为衡量任务是否可被有效上下文学习的预测指标,为理解ICL的内在机制提供了新的几何学解释框架。
- When Chain-of-Thought Helps and When It Hurts: An Empirical Investigation of the Serial-Depth Bottleneck in LLM Reasoning
- 赛道归属: 推理优化 / Chain-of-Thought 机制分析
- 核心创新点: 通过"串行深度瓶颈"(Serial-Depth Bottleneck)理论框架,系统性地揭示了CoT并非对所有任务普遍有益的规律。核心突破在于将H_dp带宽界限理论与实证实验相结合,识别出CoT在哪类任务(需要超出Transformer单次前向传播计算深度的串行推理)中有效,而在哪类任务(可在单次前向传播内完成的并行/浅层推理)中反而有害,从架构层面给出了CoT适用边界的解释性框架。
- Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
- 赛道归属: 多模态理解 / OCR与场景文字识别
- 核心创新点: 提出了一种无需外部OCR引擎、无需推理时提供OCR文本或边界框的多语言OCR感知后训练框架。核心突破在于通过视觉-文本联合微调与提示引导的思维链(Chain-of-Thought)推理机制,将OCR能力内化到通用多模态大语言模型中,使模型在处理小字、退化文本、复杂排版及手写体等真实场景时具备更强的视觉文本定位能力,实现了端到端的多语言场景文字理解,避免了传统级联管道的误差累积问题。
- Listwise Cross-Encoder Fine-Tuning vs. Agentic Instruction Tuning for LLM Rerankers: A Systematic Study in Medical Procedure Reranking
- 赛道归属: 信息检索 / LLM重排序(Reranking)/ 医疗领域NLP
- 核心创新点: 针对医疗保险场景下患者语言与临床术语之间存在巨大词汇鸿沟的问题,系统性对比了两种重排序范式:(1)基于列表式学习排序目标(Listwise LTR)对小型交叉编码器进行微调,并探索不同层冻结配置;(2)以Qwen3-Reranker-4B为代表的指令微调大模型重排序器。该研究的创新在于将列表式交叉编码器微调与智能体式指令调优在真实生产任务中进行受控对比,揭示了两种范式在领域适配效率、计算成本与排序质量之间的权衡关系。
- The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes
- 赛道归属: 推理优化 / LLM推理综述与分类体系
- 核心创新点: 提出"LLM推理元素周期表"这一结构化分类框架,对300余篇论文按推理范式、方法机制、评估设置和失败模式四个维度进行系统组织。核心贡献在于构建了一套统一的分类体系,将CoT、数学推理、多跳问答、代码生成、RAG、工具使用、多模态决策等异构推理方向纳入同一结构化视图,并显式归纳了各类推理方法的失败模式,为该领域提供了系统性的知识图谱。
- Keep, Customize, or Exit: Default Design and Token Pricing in LLM Reasoning Services 🆕NEW
- 赛道归属: LLM服务定价与机制设计
- 核心创新点: 将LLM推理服务中的定价与默认推理Token分配问题建模为Stackelberg博弈,推导出用户最优自定义分配的闭合解,并刻画了可接受默认值的区间结构。核心突破在于将经济学机制设计引入LLM服务场景,量化了准确率、延迟与Token成本之间的三方权衡,为服务提供商的最优定价策略提供了理论依据。
- MAG: MAnifold Guided Semi-Supervised Multi-modal In-Context Learning 🆕NEW
- 赛道归属: 多模态理解 / 少样本上下文学习(ICL)
- 核心创新点: 提出MAG(流形引导的半监督多模态ICL演示选择)框架,核心创新在于利用大量无标注多模态数据来改善ICL演示的质量与覆盖度。通过在数据流形上进行结构化建模,MAG能够从无标注数据中挖掘有效的演示候选,突破了传统ICL严重依赖有标注样本质量的瓶颈,实现了无需参数更新的任务自适应性能提升。
- ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents
- 赛道归属: LLM智能体安全 / 对抗鲁棒性评估
- 核心创新点: 提出了ToolHazard框架,核心创新在于构建了一套可扩展的对抗环境自动合成机制,大幅降低了人工工程成本,突破了现有研究依赖手工环境、随机LLM工具模拟和固定注入位置的局限。该框架能够跨更广泛领域自动生成包含间接提示注入(Indirect Prompt Injection)攻击的对抗性工具调用环境,为LLM智能体的安全评估与对齐研究提供了规模化的基准测试基础设施。
- MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching
- 赛道归属: 音频生成 / 多模态音频场景合成
- 核心创新点: 提出MiDashengLM-Gen,核心创新在于将预训练大语言模型与逐Token条件流匹配(per-token conditional flow matching)解码器进行端到端耦合,打破了传统"冻结文本编码器+独立音频解码器"的解耦管道范式。通过LLM驱动的自回归流匹配机制,实现了语音、音乐与音效的跨模态联合优化生成,从根本上解决了解耦架构导致的语音可懂度差和跨模态优化受限问题,实现了连贯音频场景的统一生成。
- Semantic Lenia: Emergence of Homeostatic Solitons within the Semantic Space of Large Language Models 🆕NEW
- 赛道归属: LLM动力学系统 / 人工生命
- 核心创新点: 提出Semantic Lenia框架,将LLM推理过程从静态优化问题转化为宏观logit空间中的连续动力系统。核心突破在于构建了一个非线性稳态反馈回路,动态平衡语义吸引力与句法排斥力,从而涌现出"自主语义孤子"——一种能够规避重复性结晶(退化循环)的宏观耗散结构。该工作将人工生命中的Lenia细胞自动机范式迁移至语言模型的语义空间,为理解LLM生成动力学提供了全新视角。
GitHub
- [2026-08-14] sgl-project/sglang ⭐31769 🆕NEW
- [2026-08-14] NVIDIA/TensorRT-LLM ⭐14379
- [2026-08-14] openJiuwen-ai/jiuwenswarm ⭐2922
- [2026-08-14] flagos-ai/FlagGems ⭐1075
- [2026-08-14] Jacobinwwey/obsidian-NotEMD ⭐294
HuggingFace Datasets
- [2025-07-11] HuggingFaceFW/fineweb
- [2026-08-11] HuggingFaceCode/stack-v3-train
多模态大模型
arXiv
- DataComp-VLM: Improved Open Datasets for Vision-Language Models
- 赛道归属: 多模态训练数据工程 / 视觉语言模型数据集构建
- 核心创新点: 提出 DataComp-VLM(DCVLM)基准框架,系统性地整合了涵盖图文对、多模态交错文档、纯文本及指令微调数据四种类型、共计160个数据集(规模达6T token级别)的超大规模语料库,并建立了以数据为中心的受控实验基准,填补了社区在VLM训练数据筛选策略系统性评估方面的空白,为数据配比、质量过滤等数据工程决策提供了可复现的对比框架。
- PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models
- 赛道归属: 多模态理解 / 视觉语言模型评测与推理能力分析
- 核心创新点: 提出 PragMatch 对比评测框架,核心创新在于将"语用不一致性(pragmatic incongruity)"与"跨模态表面不匹配(cross-modal mismatch)"解耦,揭示现有大型视觉语言模型在多模态讽刺检测中依赖浅层关联(shortcut learning)而非真正理解语用关系的本质缺陷,为评估VLM深层跨模态推理能力提供了更精细的诊断工具。
- MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification 🆕NEW
- 赛道归属: 多模态理解 / 图像分类与跨域泛化
- 核心创新点: 提出 ARMDIL(Adaptive Router for Multi-Domain Image classification with LLMs)框架,核心创新在于将多模态大语言模型(MLLM)作为智能路由器,动态地为每张输入图像选择最合适的视觉骨干网络。该方法构建了一个异构集成体系,融合了卷积神经网络(ResNets)、自监督表征学习模型等多种视觉骨干,通过 MLLM Agent 的语义理解能力感知图像的域特征与难度级别,实现自适应路由决策。相比传统固定集成或单一模型方案,该方法在跨数据集场景下具备更强的泛化鲁棒性,突破了单一骨干网络难以同时应对多域分布差异的瓶颈。
- Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System
- 赛道归属: 多模态理解 / 无人机图像理解与推理评测
- 核心创新点: 构建了UAVQA-Bench统一评测基准,系统覆盖无人机航拍图像的多任务理解与推理场景,填补了现有评测碎片化的空白;同时提出了一种无需训练的多智能体系统(Training-Free Multi-Agent System),通过多个专业化智能体协作的方式,在无需微调MLLM的前提下提升无人机图像的理解与推理能力,有效应对极端尺度变化、任意相机朝向和高密度目标等航拍场景特有挑战。
- Click2Poly: A VLM for vector mapping buildings and walls
- 赛道归属: 多模态理解 / 地理空间矢量化与人机协同
- 核心创新点: 在Florence-2视觉语言模型基础上进行扩展,提出Click2Poly,实现了以"点击交互"为驱动的建筑物与墙体矢量多边形提取。核心创新在于将人在回路(Human-in-the-Loop)机制与VLM深度融合,用户通过点击提示引导模型对复杂或难以自动处理的案例进行精确矢量化,从而在保证制图标准的前提下大幅降低人工质检与修正的工作量,实现了自动提取与人工干预的高效协同。
- StreamFlow: Dynamic Memory Flows for Streaming Video Understanding
- 赛道归属: 多模态理解 / 流式视频理解
- 核心创新点: 提出StreamFlow框架,通过动态记忆流机制解决流式视频理解中的计算冗余与记忆访问僵化问题。核心创新在于:无需修改骨干网络(非侵入式),引入动态记忆流对时序冗余内容进行高效过滤,并设计灵活的视觉历史访问机制,在严格因果约束和有界内存条件下实现对持续演化视频流的高效相关证据保留。
- Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models
- 赛道归属: 多模态理解 / 空间推理
- 核心创新点: 提出多视角关系蒸馏(Multi-View Relational Distillation)方法,在不增加模型规模、不依赖外部大型几何模型融合的前提下,通过关系蒸馏将几何空间知识注入VLM的视觉表征。核心突破在于:避免直接在空间问答数据上微调导致的虚假视觉表征问题,转而以多视角关系对比的方式强化VLM的几何感知能力,显著提升其在具身AI、机器人及自动驾驶等场景下的空间推理鲁棒性。
- MedUP: Awakening Unified Understanding and Perception in Medical Vision-Language Models
- 赛道归属: 多模态理解 / 医学视觉语言模型
- 核心创新点: 提出MedUP框架,通过统一Token空间(UniMedTok)将视觉感知(分割、定位)与语言理解原生融合于同一表征体系,打破了现有方法中"坐标字符串化"或"外部感知模块解耦"所带来的区域-语言对齐表征鸿沟。核心创新在于设计了区域感知的统一医学Token化机制,使模型在无需外部模块的情况下,在共享Token空间内同时完成精细视觉感知与语义理解,实现两者的深度协同。
- When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs
- 赛道归属: 推理优化 / 视觉Token压缩
- 核心创新点: 提出基于跨模态残差引导(Cross-Modal Residual Guidance)的视觉Token剪枝方法,突破现有相似度驱动剪枝仅捕获局部层级信号的局限。核心创新在于:将文本模态的残差信息作为全局推理过程的引导信号,补充传统逐对文本-视觉及视觉-视觉Token相关性所遗漏的全局推理上下文,从而在VLM推理全流程视角下实现更精准的冗余视觉Token识别与压缩,在降低推理成本的同时保持模型性能。
- Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation
- 赛道归属: 医疗多模态理解 / 手术场景语义分割
- 核心创新点: 提出首个基于视觉语言模型的宫腔镜手术场景分割框架,通过引导式自举(bootstrapping)机制将VLM的语义理解能力迁移至高难度手术场景,针对宫腔镜特有的镜面反射、运动模糊、液体遮挡等伪影以及不同病变形态高度相似的挑战,实现了语言先验知识对分割模型的有效增强。
GitHub
- [2026-08-14] Blaizzy/mlx-vlm ⭐5323 🆕NEW
- [2026-08-14] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1799
- [2026-08-12] hustvl/Senna ⭐552
- [2026-08-14] om-ai-lab/VLX-Seek ⭐152
- [2026-08-13] opendatalab/mineru-vl-utils ⭐136
强化学习
arXiv
- IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents
- 赛道归属: 强化学习 / 战略对话智能体
- 核心创新点: 提出"孤立双边强化学习"(IB-RL)框架,核心突破在于将对话双方(智能体与对手)的策略训练过程相互隔离,分别独立优化,而非在动态交互中联合训练。这一设计有效解决了战略对话中因对手策略随智能体策略同步变化而导致的非平稳环境问题,使奖励信号更加稳定可靠,从而将传统RL在固定规则环境中的优势迁移至双边博弈场景。
- Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness
- 赛道归属: 强化学习理论 / 鲁棒性与安全性
- 核心创新点: 提出基于Infra-Bayesian框架的RL智能体,核心突破在于将传统贝叶斯RL对"固定环境"的假设替换为对抗性最坏情况假设,使智能体能够在模型类无法完整描述真实世界(non-realizable setting)的情况下仍保持鲁棒性。该方法通过对环境行为的"下确界"(infimum)进行推断而非期望推断,在与预测器、人类、其他AI智能体等自适应实体交互时,相比经典RL在最坏情况性能上取得显著优势,对AI安全场景具有直接意义。
- Scheduling Mixed RL Rollouts Beyond Prefix Locality
- 赛道归属: LLM强化学习后训练 / 推理系统调度优化
- 核心创新点: 针对LLM RL后训练中多类型rollout(RLVR、RLHF、Agentic)混合共存时KV-cache竞争导致效率低下的问题,提出超越前缀局部性(Prefix Locality)的混合调度策略。核心创新在于引入感知KV-cache容量压力的异构rollout会话调度机制,在保留前缀感知路由优势的同时,通过全局容量视角协调不同反馈范式的rollout负载,从系统层面提升整体训练吞吐量。
- RoutePack: Expert Placement and Attention-Aware Data Packing for MoE Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习系统优化 / MoE模型训练效率
- 核心创新点: RoutePack 针对混合专家(MoE)模型在强化学习训练中同时存在的两个负载均衡问题(序列组合决定的密集注意力计算 vs. Token路由决定的稀疏专家计算)提出了一套层次化联合优化框架。其核心突破在于:利用 RL rollout 阶段的"路由回放"机制,在训练步骤前预先获取每个样本的序列长度和逐层专家需求信息,从而将数据打包(Data Packing)与专家放置(Expert Placement)解耦为可预知的优化问题。具体而言,RoutePack 通过注意力感知的数据打包策略最小化跨 microbatch 的注意力计算不均衡,同时通过专家放置算法优化专家并行维度上的 token 分发均衡,实现两个瓶颈的协同消除,而非单独优化其中一个而将瓶颈转移至另一个。
- Learning Loco-Manipulation From SMPC Demonstrations With Sparse Offline-to-Online RL
- 赛道归属: 机器人强化学习 / 运动操作(Loco-Manipulation)
- 核心创新点: 提出了一种"稀疏离线到在线强化学习"框架,核心突破在于完全绕开了繁琐的密集奖励设计难题。具体方法是:以仿真环境中的基于采样的模型预测控制(SMPC)作为自动化专家,批量生成大规模离线演示数据集,从根本上解决了复杂任务中的探索瓶颈问题;随后利用该数据训练离线策略RL智能体,再通过在线微调完成策略迁移。相比传统方法,该方案将专家数据生成与奖励设计的人工成本大幅降低,实现了运动与操作一体化任务的高效扩展。
- Unmasking Toxic Mimicry in Medical Offline Reinforcement Learning for ICU Sepsis Management via Counterfactual Clinical Audits
- 赛道归属: 医疗决策 / 离线强化学习安全性评估
- 核心创新点: 提出了"反事实临床审计(Counterfactual Clinical Audit, CCA)"框架,核心突破在于识别并量化了离线RL在ICU脓毒症管理场景中的一种新型失效模式——"毒性模仿(Toxic Mimicry)",即智能体在行为层面高度拟合历史数据(MSE/FQE指标表现良好),却同时复制了有害的临床行为模式(如安慰性护理阶段的治疗撤除)。CCA通过构建反事实干预场景对RL智能体进行压力测试,突破了传统评估指标仅衡量行为模仿质量、无法检测潜在危害的局限,为医疗离线RL的安全性评估提供了新的方法论范式。
- MoE Proxy Models for Low-Cost Failure Reproduction and Diagnosis in LLM RL Post-Training
- 赛道归属: LLM强化学习后训练 / 调试与故障诊断
- 核心创新点: 提出利用混合专家(MoE)代理模型低成本复现和诊断LLM RL后训练故障的方法。核心创新在于构建轻量级MoE代理模型来模拟大模型训练行为,使梯度溢出、损失发散等复杂故障(通常由框架适配、数值精度、算子实现差异引起)能够在低算力条件下被快速复现,系统性地建立了故障类型分类体系,大幅降低大规模RL后训练的调试成本。
- TideRL: Boosting Agentic RL Goodput with Readiness-Aware Scheduling
- 赛道归属: LLM强化学习后训练 / 多轮Agentic系统调度
- 核心创新点: 提出TideRL系统,专门针对多轮Agentic RL场景中任务频繁暂停(等待外部环境)、上下文持续增长、完成时间高度不均匀的特点,引入"就绪感知弹性调度"机制。核心创新包括:连续任务批处理(Continuous Task Batching)避免GPU空等,以及资源弹性管理策略减少重复prefill重计算开销,以训练goodput(有效训练吞吐)而非GPU占用率为优化目标,从根本上解决Agentic RL的系统效率瓶颈。
- Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks
- 赛道归属: LLM强化学习后训练 / 长时序工具调用Agent
- 核心创新点: 提出SINKFLEX-RL模块化训练系统,专为长时序双控制(dual-control)工具调用环境设计。核心创新在于:集成Gymnasium兼容的环境接口以支持多轮工具调用仿真,引入针对模型特定注意力层的自定义掩码机制,以及学习式sink归一化(learned sink normalization)来处理长上下文中的注意力稳定性问题,系统性地解决了长时序、延迟可验证奖励场景下on-policy rollout上下文过长导致的训练效率与稳定性问题。
- Procedural Fairness Failures in RLHF from Preference Averaging
- 赛道归属: RLHF对齐 / 公平性与偏好多样性
- 核心创新点: 从程序公平性(Procedural Fairness)视角揭示标准RLHF中偏好平均化(Preference Averaging)的系统性缺陷。核心创新在于形式化定义了对齐中的程序公平性概念——即在奖励建模阶段应保留不同群体的独立偏好信号,并证明标准RLHF的聚合机制会导致多数偏好群体主导奖励学习、少数偏好被系统性压制的公平性失效,为构建更公平的多元偏好对齐方法提供了理论基础。
GitHub
- [2026-08-14] OpenPipe/ART ⭐10581
- [2026-08-14] radixark/miles ⭐1986 🆕NEW
- [2026-08-14] agi-brain/xuance ⭐1078 🆕NEW
- [2026-08-13] utilForever/baba-is-auto ⭐189
- [2026-08-14] lucidrains/metacontroller ⭐105 🆕NEW
HuggingFace Datasets
- [2023-05-26] Anthropic/hh-rlhf
世界动作模型
arXiv
- Foresight Without Seeing: Latent Futures for World Action Models
- 赛道归属: 世界动作模型 / 机器人策略学习 / 视频预测与动作生成
- 核心创新点: 提出了一种"隐式未来"(Latent Future)范式,在显式未来WAM(需要迭代视频去噪,推理成本高)与直接策略WAM(无未来预测,缺乏场景演化建模)之间寻找中间路径。核心方法是将未来视觉预测压缩为紧凑的潜在表示,直接注入动作生成路径,从而在保留未来场景演化信息的同时,彻底规避了迭代视频去噪带来的高延迟问题。该方法实现了"无需显式看见未来帧"即可获得预见能力的推理效率与预测能力的双重兼顾。
- Keep the Future, Drop the Rollout: RIFT for World Action Models
- 赛道归属: 世界动作模型 / 机器人策略学习 / 推理加速与部署优化
- 核心创新点: 针对WAM在闭环部署中因迭代视频rollout导致高延迟的痛点,提出RIFT(Rollout-Independent Future Transfer)方法。通过系统性的闭环干预实验(在4个WAM模型、40个LIBERO任务上)验证了动作生成对未来缓存值(future-cache values)及其位置分配均存在显著敏感性,从而证明rollout轨迹的"内容"而非"生成过程"才是关键。RIFT的核心创新在于:将未来表示从完整rollout轨迹中解耦,仅保留未来表示而丢弃逐步展开的rollout过程,在不损失策略性能的前提下大幅降低部署延迟。
- Decoupling Intention from Trajectory: A Representational Deduction Framework for World Action Models
- 赛道归属: 世界动作模型 / 具身智能 / 运动规划
- 核心创新点: 提出了一种表征解耦框架(Representational Deduction Framework),将高层意图(Intention)与低层轨迹(Trajectory)在表征空间中显式分离。核心突破在于:现有视觉分支仅预测静态视觉观测,忽略了运动交互下世界状态演变的过渡信息,导致物理条件演化与动作轨迹生成之间产生表征纠缠。该框架通过解耦这两类信息,使视觉分支能够捕捉世界状态的动态转变过程,从而为动作规划提供更具语义层次的表征基础,实现意图理解与轨迹生成的协同优化。
- From World Models to World Action Models: A Concise Tutorial for Robotics 🆕NEW
- 赛道归属: 世界模型 / 机器人学习 / 综述教程
- 核心创新点: 本文并非全面综述,而是以教程形式构建了一套统一的概念框架,明确区分"世界模型"与"世界动作模型"的定义边界及其在机器人AI系统中的角色定位。核心贡献在于提出了一个统一的比较视角,将 World Labs 空间智能模型、Yann LeCun 的 JEPA 等代表性方法纳入同一分析框架,帮助研究者系统性地理解不同范式之间的本质联系与差异,为该领域的概念标准化提供了基础性参考。
- SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
- 赛道归属: 世界动作模型 / 自动驾驶 / 端到端规划
- 核心创新点: 提出SimWAM,核心创新在于将视频生成能力仅作为训练信号而非推理时的必要组件,从而彻底消除推理阶段昂贵的未来帧生成开销。具体方法上:采用联合流匹配(Joint Flow Matching)协同训练预训练视频专家与轻量动作专家;引入隔离注意力掩码(Isolated Attention Mask)机制,使动作预测在结构上独立于未来帧,推理时可直接丢弃视频分支。该设计实现了"训练时借力视频动态先验、推理时轻量高效执行"的解耦范式,在保留视频预训练知识迁移优势的同时,大幅降低了部署成本。
- BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving 🆕NEW
- 赛道归属: 自动驾驶 / 世界动作模型 / 端到端规划
- 核心创新点: 针对现有端到端驾驶方法要么侧重语义推理(VLA模型)、要么侧重预测动态(世界动作模型)的单一性缺陷,BrainWAM 提出了一种在动作空间层面协同融合语义先验与预测动态的统一规划框架。其核心突破在于:不在特征空间或输出空间进行简单融合,而是在动作空间中实现 VLM 语义约束与生成式世界模型预测能力的协调对齐,从而同时获得语义合理性与未来感知能力,解决了两类方法难以兼容的根本矛盾。
GitHub
- [2026-08-13] OpenMOSS/Awesome-WAM ⭐1276 🆕NEW
- [2026-08-08] DravenALG/awesome-vla-wam ⭐962
- [2026-08-11] neoteai/N0-TWAM ⭐166
- [2026-08-14] teee000/LiLa-WAM ⭐66
- [2026-08-11] H-EmbodVis/SimWAM ⭐51 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-08-14 05:31:24