AI 每日进展速报 - 2026-07-02

新旧
正在统计...
来源
当前筛选条件下没有条目。

图像生成/编辑

arXiv

GitHub

HuggingFace Models

HuggingFace Datasets

Built by Rapidata. This dataset contains 1,355,161 human responses, collected with the Rapidat...

视频生成/编辑

arXiv

  • 核心创新点: 该工作提出了一种无需外部奖励模型或人工标注的视频生成质量对齐方法——Shell-LCC。其核心洞察是:高质量训练数据的流形结构本身即隐含了奖励信号。通过显式建模高质量视频数据的流形几何结构,将数据流形作为内生奖励模型,引导扩散模型生成结果向高质量数据分布对齐。该方法规避了传统基于RLHF/DPO路线中高昂的标注成本和计算开销,同时在局部细节保真度上取得了更优的提升,为T2V生成的对齐范式提供了数据流形驱动的新思路。
  • 核心创新点: EcoVideo 提出了一种基于熵编排的动态帧间解耦视频生成框架,专门针对 DiT 架构视频生成的高延迟痛点。其技术突破有三:①利用自注意力熵作为无需训练的帧级信息密度代理指标,实现自适应关键帧选取;②在云边协同架构中,高熵关键帧由云端大模型去噪,低熵非关键帧由边缘轻量模型处理,并通过跨帧特征复用减少冗余计算;③框架可根据系统动态(如带宽、负载变化)自适应调整解耦策略,超越了以往静态步间解耦方法的局限。整体实现了计算资源分配与视频质量的精细化平衡。
  • 核心创新点: OmniDance 从数据与方法两个维度同时突破了音乐驱动舞蹈视频生成的瓶颈。在数据层面,构建了 CIPE-Dance 大规模互联网舞蹈视频数据集,填补了该领域高质量大规模数据的空白。在方法层面,提出了将音乐作为互补条件信号融入视频生成基础模型的原则性框架,创新性地设计了多模态条件注入机制,使音乐节拍、情感等信息与人体动作在时序上实现精确对齐,同时保持高视觉保真度。该工作的核心贡献在于将通用视频生成基础模型与特定领域多模态条件(音乐+姿态)进行系统性整合,为音乐驱动的人体运动合成建立了可扩展的新基准。
  • 核心创新点: 该工作针对自回归视频生成在长时序展开中存在的误差累积与时序退化问题,提出了一种融合人体运动与相机轨迹的异构复合控制框架。核心技术突破体现在以下几个方面:①设计了一种能够同时建模人体动作控制信号与相机运动轨迹的联合条件注入机制,解决了两类异构控制信号相互干扰、破坏预训练视频先验的问题;②针对自回归生成的长程稳定性,提出了有效抑制误差累积的架构设计,使模型在长时序rollout中保持视频质量;③在保证可控性的同时实现了快速自回归生成,在速度与质量之间取得了更优的平衡。整体方法为构建可交互、可控的世界模型提供了可扩展的技术路径。

GitHub

音频生成

arXiv

  • 核心创新点: 针对基于大语言模型的TTS系统在情感表达上的局限性,该工作提出了HPRO(分层渐进式奖励优化)框架,核心突破体现在两个层面:
  • 解耦潜空间设计:将内容信息与情感信息从共享隐空间中分离,解决了传统偏好优化中内容梯度与情感梯度相互冲突的结构性问题;
  • 分层渐进式偏好优化策略:通过从粗粒度到细粒度的渐进式偏好提取与奖励建模,逐层对情感韵律进行精细化优化,突破了标准SFT范式导致模型收敛于统计均值韵律的瓶颈,显著提升情感表现力。整体方案将偏好驱动学习与层次化情感表征深度结合,为情感TTS的强化学习对齐提供了新范式。

GitHub

语言大模型

arXiv

  • 赛道归属: Instruction tuning / Data Selection & Quality Optimization
  • 赛道归属: Reasoning Optimization / Representation Editing

GitHub

HuggingFace Models

HuggingFace Datasets

Full FABLE.5 / Mythos corpus restored, with session-limit answer rows removed. Dataset Viewer | Parq...

多模态大模型

arXiv

GitHub

强化学习

arXiv

GitHub

HuggingFace Models

HuggingFace Datasets

Open-PerfectBlend is an open-source reproduction of the instruction dataset introduced in the paper "The Perfect Blend...

Non-invasive brain recordings (magnetoencephalography, MEG; and electroencephalograp...

AgentWorldBench is a comprehensive evaluation benchmark for language world models, constructed from real-world observat...

世界动作模型

arXiv

赛道归属 : Embodied Navigation / World Action Model / Spatial-Aware Planning

  • 核心创新点: 现有基于世界模型的视觉导航规划器通常采用"验证中心范式",将目标意图与轨迹合成解耦,导致候选依赖、计算开销大、采样动作与预测视觉不一致等问题。本文提出 SWAM(空间感知世界动作模型),核心创新在于:
  • 任务中心式联合生成框架:将观测与动作的生成统一建模,在给定起始与目标 RGB 观测后,同步生成导航动作序列与中间视觉帧,彻底摆脱对候选集的依赖;
  • 空间感知能力嵌入:在世界模型中显式引入空间感知模块,增强模型对三维场景结构的理解,使预测的视觉观测与动作保持几何一致性;
  • 范式转变:从"先采样后验证"的两阶段解耦范式,转变为端到端的联合推断范式,有效降低计算开销并提升动作预测的可靠性。

核心创新点 :

  • 核心创新点 :

[中文] 现有世界动作模型的研究主要集中于模型架构设计,而如何让模型高效学习更优质的世界表征以服务于规划任务,仍是一个待解决的问题。本文提出 ReWorld,这是首个专门面向自动驾驶世界动作模型的表征学习框架。其核心创新在于:突破了传统WAM仅依赖标准视频预测监督信号(即像素级重建损失)的局限,通过引入专门设计的表征学习目标,引导模型在训练过程中学习到更具语义性、结构性的世界状态表征,而非仅仅优化视觉保真度。这一框架与模型架构无关,具备良好的通用性,可作为现有WAM方法的即插即用增强模块,显著提升其用于规划时的表征质量。

GitHub


由 Research Daily 自动生成 生成时间: 2026-07-02 01:02:06