AI 每日进展速报 - 2026-07-04

新旧
正在统计...
来源
当前筛选条件下没有条目。

图像生成/编辑

arXiv

  • 核心创新点: UltraFlux 针对将扩散Transformer扩展至原生4K分辨率时暴露的多因素耦合失效问题(位置编码、VAE压缩、优化策略),提出数据-模型协同设计范式,而非孤立解决单一瓶颈。核心贡献包括:(1)构建 MultiAspect-4K-1M 数据集,包含100万张多宽高比4K图像,从数据源头支撑多长宽比原生训练;(2)在 Flux-based DiT 架构上系统性地重新设计位置编码以适应极端宽高比与超高分辨率,同时改进VAE压缩策略以保留4K细节;(3)协同优化训练目标,使模型能够在多种宽高比下原生生成高保真4K图像,而非通过超分辨率后处理实现。整体方案证明了高分辨率多宽高比生成需要数据与模型层面的联合突破,任何单点优化均无法充分释放质量潜力。
  • 核心创新点: FaithRewriter 针对现有提示词重写方法缺乏视觉基础导致"过度推断"从而引入意图偏差的问题,提出以视觉锚点驱动提示词增强的新框架。核心创新在于:(1)在重写过程中引入视觉锚定机制,通过实际生成的或参考的视觉信号对重写内容进行约束与校验,而非纯粹依赖语言模型对文本的主观扩充,从而将"看见的内容"与"重写的描述"对齐;(2)构建对齐反馈回路,使重写后的提示词能够忠实反映用户的真实意图而非模型的想象性补全,有效缩小意图-生成鸿沟;(3)该框架可与现有T2I模型无缝结合,在不修改生成模型本身的前提下通过更精准的提示词提升生成结果与用户意图的一致性。

GitHub

HuggingFace Models

视频生成/编辑

arXiv

  • 核心创新点: 该工作提出了一种无需外部奖励模型或人工标注的视频生成质量对齐方法——Shell-LCC。其核心洞察是:高质量训练数据的流形结构本身即隐含了奖励信号。通过显式建模高质量视频数据的流形几何结构,将数据流形作为内生奖励模型,引导扩散模型生成结果向高质量数据分布对齐。该方法规避了传统基于RLHF/DPO路线中高昂的标注成本和计算开销,同时在局部细节保真度上取得了更优的提升,为T2V生成的对齐范式提供了数据流形驱动的新思路。
  • 核心创新点: GimbalDiffusion 提出了一种基于万向节坐标系的重力感知相机控制框架,核心突破在于将相机运动分解为"绕重力轴旋转+ 横滚角"的物理直觉表示,替代了传统的相对/模糊相机轨迹编码方式。该表示天然对齐人类感知的"水平地面"先验,从根本上解决了现有方法在大角度旋转(如180°掉头、垂直俯仰)场景下几何控制精度不足的问题,使得视频生成模型能够支持精确的极端相机轨迹控制。
  • 核心创新点: 针对自回归流式视频生成中KV Cache线性增长导致的内存瓶颈问题,提出了实例特定参数吸收框架。其核心创新在于:不采用传统的"丢弃冗余KV Token"压缩策略(该策略会破坏长程依赖,导致时序闪烁和身份丢失),而是将历史KV信息以参数化方式"吸收"进模型的轻量级实例特定参数中,在压缩内存占用的同时保留长程时序一致性。该方法实现了内存效率与生成质量的双重优化,为长视频自回归生成提供了新的推理范式。
  • 核心创新点: EcoVideo 提出了一种基于熵编排的动态帧间解耦视频生成框架,专门针对 DiT 架构视频生成的高延迟痛点。其技术突破有三:①利用自注意力熵作为无需训练的帧级信息密度代理指标,实现自适应关键帧选取;②在云边协同架构中,高熵关键帧由云端大模型去噪,低熵非关键帧由边缘轻量模型处理,并通过跨帧特征复用减少冗余计算;③框架可根据系统动态(如带宽、负载变化)自适应调整解耦策略,超越了以往静态步间解耦方法的局限。整体实现了计算资源分配与视频质量的精细化平衡。
  • 核心创新点: OmniDance 从数据与方法两个维度同时突破了音乐驱动舞蹈视频生成的瓶颈。在数据层面,构建了 CIPE-Dance 大规模互联网舞蹈视频数据集,填补了该领域高质量大规模数据的空白。在方法层面,提出了将音乐作为互补条件信号融入视频生成基础模型的原则性框架,创新性地设计了多模态条件注入机制,使音乐节拍、情感等信息与人体动作在时序上实现精确对齐,同时保持高视觉保真度。该工作的核心贡献在于将通用视频生成基础模型与特定领域多模态条件(音乐+姿态)进行系统性整合,为音乐驱动的人体运动合成建立了可扩展的新基准。
  • 核心创新点: 该工作针对自回归视频生成在长时序展开中存在的误差累积与时序退化问题,提出了一种融合人体运动与相机轨迹的异构复合控制框架。核心技术突破体现在以下几个方面:①设计了一种能够同时建模人体动作控制信号与相机运动轨迹的联合条件注入机制,解决了两类异构控制信号相互干扰、破坏预训练视频先验的问题;②针对自回归生成的长程稳定性,提出了有效抑制误差累积的架构设计,使模型在长时序rollout中保持视频质量;③在保证可控性的同时实现了快速自回归生成,在速度与质量之间取得了更优的平衡。整体方法为构建可交互、可控的世界模型提供了可扩展的技术路径。

GitHub

音频生成

arXiv

  • 核心创新点: 该工作从几何视角首次系统比较了语音语言模型模块与条件流匹配模块作为激活引导位点在混合情感语音合成中的特性差异。核心方法论突破体现在三个层面:① 利用线性探测局部内在维度对两类模块中的情感表征进行几何结构量化分析;② 将情感控制问题形式化为激活空间中的向量引导问题,揭示不同模块的情感表征可组合性与可操控性之间的几何关联;③ 通过对比研究为混合TTS系统中情感模块的设计选择提供了可解释的几何依据,而非依赖经验性的黑箱调参。
  • 核心创新点: 针对基于大语言模型的TTS系统在情感表达上的局限性,该工作提出了HPRO(分层渐进式奖励优化)框架,核心突破体现在两个层面:
  • 解耦潜空间设计:将内容信息与情感信息从共享隐空间中分离,解决了传统偏好优化中内容梯度与情感梯度相互冲突的结构性问题;
  • 分层渐进式偏好优化策略:通过从粗粒度到细粒度的渐进式偏好提取与奖励建模,逐层对情感韵律进行精细化优化,突破了标准SFT范式导致模型收敛于统计均值韵律的瓶颈,显著提升情感表现力。整体方案将偏好驱动学习与层次化情感表征深度结合,为情感TTS的强化学习对齐提供了新范式。

GitHub

语言大模型

arXiv

  • 赛道归属: Instruction tuning / Data Selection & Quality Optimization
  • 赛道归属: Reasoning Optimization / Representation Editing

GitHub

HuggingFace Models

HuggingFace Datasets

Full FABLE.5 / Mythos corpus restored, with session-limit answer rows removed. Dataset Viewer | Parq...

多模态大模型

arXiv

GitHub

HuggingFace Models

强化学习

arXiv

  • 核心创新点: 本文系统性地研究了强化学习后训练中各Transformer层的贡献差异,挑战了"全参数均匀更新"的传统假设。核心发现是:仅训练单个Transformer层即可匹配全参数RL训练的性能,揭示了RL适应过程在层间分布高度不均的规律。该工作通过逐层消融实验定位出对RL增益贡献最关键的层,为高效参数化RL训练提供了理论依据,大幅降低了LLM后训练的计算开销,同时揭示了Transformer层在RL后训练中功能专业化的内在机制。
  • 核心创新点: 针对现有基于无监督视频预训练的RL表征方法过度保留像素空间中大量静态信息、忽视小但关键的动态信息的问题,本文提出了一种从像素到时序相关性的表征学习框架。核心创新在于引入了时序相关性预测目标,驱动模型捕获跨帧的动态变化模式而非静态背景冗余,从而在无动作标注的大规模互联网视频上学习到对RL任务更具信息量的紧凑表征。该方法有效提升了RL的样本效率与策略性能,尤其在需要感知细粒度运动信号的任务中表现突出。
  • 核心创新点: 本文针对一致性模型和MeanFlow等少步Flow-Map生成器确定性采样导致无法直接用于RL后训练的核心痛点,提出了Flow-Map GRPO方法。核心技术突破包括两点:① 提出锚定随机组合策略,通过在确定性flow-map上叠加可控随机扰动,构造出具有良好定义似然比的随机轨迹,使GRPO等基于策略梯度的RL算法得以适用;② 将该随机化机制与GRPO目标有机融合,实现了在保持少步采样加速优势的同时,利用RL奖励信号对模型进行偏好对齐优化。该方法填补了少步确定性生成模型与RL后训练范式之间的技术鸿沟。

GitHub

HuggingFace Models

HuggingFace Datasets

Open-PerfectBlend is an open-source reproduction of the instruction dataset introduced in the paper "The Perfect B...

Non-invasive brain recordings (magnetoencephalography, MEG; and electroencephalograp...

AgentWorldBench is a comprehensive evaluation benchmark for language world models, constructed from real-world observat...

世界动作模型

arXiv

赛道归属 : Embodied Navigation / World Action Model / Spatial-Aware Planning

  • 核心创新点: 现有基于世界模型的视觉导航规划器通常采用"验证中心范式",将目标意图与轨迹合成解耦,导致候选依赖、计算开销大、采样动作与预测视觉不一致等问题。本文提出 SWAM(空间感知世界动作模型),核心创新在于:
  • 任务中心式联合生成框架:将观测与动作的生成统一建模,在给定起始与目标 RGB 观测后,同步生成导航动作序列与中间视觉帧,彻底摆脱对候选集的依赖;
  • 空间感知能力嵌入:在世界模型中显式引入空间感知模块,增强模型对三维场景结构的理解,使预测的视觉观测与动作保持几何一致性;
  • 范式转变:从"先采样后验证"的两阶段解耦范式,转变为端到端的联合推断范式,有效降低计算开销并提升动作预测的可靠性。

核心创新点 :

  • 核心创新点 :

[中文] 现有世界动作模型的研究主要集中于模型架构设计,而如何让模型高效学习更优质的世界表征以服务于规划任务,仍是一个待解决的问题。本文提出 ReWorld,这是首个专门面向自动驾驶世界动作模型的表征学习框架。其核心创新在于:突破了传统WAM仅依赖标准视频预测监督信号(即像素级重建损失)的局限,通过引入专门设计的表征学习目标,引导模型在训练过程中学习到更具语义性、结构性的世界状态表征,而非仅仅优化视觉保真度。这一框架与模型架构无关,具备良好的通用性,可作为现有WAM方法的即插即用增强模块,显著提升其用于规划时的表征质量。

GitHub


由 Research Daily 自动生成 生成时间: 2026-07-04 01:00:18