AI 每日进展速报 - 2026-06-30

新旧
正在统计...
来源
当前筛选条件下没有条目。

图像生成/编辑

arXiv

GitHub

HuggingFace Models

视频生成/编辑

arXiv

  • 核心创新点: 该工作针对自回归视频生成在长时序展开中存在的误差累积与时序退化问题,提出了一种融合人体运动与相机轨迹的异构复合控制框架。核心技术突破体现在以下几个方面:①设计了一种能够同时建模人体动作控制信号与相机运动轨迹的联合条件注入机制,解决了两类异构控制信号相互干扰、破坏预训练视频先验的问题;②针对自回归生成的长程稳定性,提出了有效抑制误差累积的架构设计,使模型在长时序rollout中保持视频质量;③在保证可控性的同时实现了快速自回归生成,在速度与质量之间取得了更优的平衡。整体方法为构建可交互、可控的世界模型提供了可扩展的技术路径。

GitHub

音频生成

arXiv

  • 核心创新点: 针对基于大语言模型的TTS系统在情感表达上的局限性,该工作提出了HPRO(分层渐进式奖励优化)框架,核心突破体现在两个层面:
  • 解耦潜空间设计:将内容信息与情感信息从共享隐空间中分离,解决了传统偏好优化中内容梯度与情感梯度相互冲突的结构性问题;
  • 分层渐进式偏好优化策略:通过从粗粒度到细粒度的渐进式偏好提取与奖励建模,逐层对情感韵律进行精细化优化,突破了标准SFT范式导致模型收敛于统计均值韵律的瓶颈,显著提升情感表现力。整体方案将偏好驱动学习与层次化情感表征深度结合,为情感TTS的强化学习对齐提供了新范式。

GitHub

语言大模型

arXiv

GitHub

HuggingFace Models

HuggingFace Datasets

Full FABLE.5 / Mythos corpus restored, with session-limit answer rows removed. Dataset Viewer | Parq...

A high-quality synthetic supervised fine-tuning (SFT) dataset designed to train and fine-tune any LLM to mi...

多模态大模型

arXiv

GitHub

强化学习

arXiv

GitHub

HuggingFace Models

HuggingFace Datasets

AgentWorldBench is a comprehensive evaluation benchmark for language world models, constructed from real-world observat...

Open-PerfectBlend is an open-source reproduction of the instruction dataset introduced in the paper "The Perfect Blend...

世界动作模型

arXiv

  • 核心创新点 :

[中文] 现有世界动作模型的研究主要集中于模型架构设计,而如何让模型高效学习更优质的世界表征以服务于规划任务,仍是一个待解决的问题。本文提出 ReWorld,这是首个专门面向自动驾驶世界动作模型的表征学习框架。其核心创新在于:突破了传统WAM仅依赖标准视频预测监督信号(即像素级重建损失)的局限,通过引入专门设计的表征学习目标,引导模型在训练过程中学习到更具语义性、结构性的世界状态表征,而非仅仅优化视觉保真度。这一框架与模型架构无关,具备良好的通用性,可作为现有WAM方法的即插即用增强模块,显著提升其用于规划时的表征质量。

GitHub


由 Research Daily 自动生成 生成时间: 2026-06-30 01:02:35