AI 每日进展速报 - 2026-07-14
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- Stage-Aware Adaptation and Distribution Calibration for Subject-Driven Personalized Text-to-Image Generation
- 赛道归属: 文生图 / 主体驱动个性化生成(Subject-Driven Personalized Text-to-Image Generation)
- 核心创新点: 针对主体驱动个性化文生图任务,现有方法(如全量微调、文本嵌入优化、低秩参数更新等)普遍存在主体身份保真与文本提示遵循性之间的平衡困难问题。该工作提出阶段感知自适应(Stage-Aware Adaptation)策略,认识到扩散模型去噪过程的不同阶段对"内容结构"与"细节纹理"的贡献不同,针对性地在不同去噪阶段施加差异化的主体适配约束,使模型在保留主体特征的同时更好地响应文本引导。此外,引入分布校准(Distribution Calibration)机制,显式矫正个性化微调后模型输出分布相对于原始预训练模型的偏移,从而在主体身份一致性、文本对齐度和样本多样性三者之间取得更优平衡。相比PaRa等参数秩压缩类方法,该方法从去噪时序维度和分布层面双重约束个性化过程,提供了一个更精细化的自适应范式。
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图 / 推理优化(CFG蒸馏加速)
- 核心创新点: 针对现有CFG蒸馏方法中"盲注入"范式(全局静态引导强度)的局限,提出基于信息瓶颈(Information Bottleneck)理论的自适应CFG蒸馏框架IB-Flow。其核心突破在于:将信息瓶颈原理引入扩散模型的引导强度分配,实现对不同去噪步骤和不同语义区域的细粒度、动态化引导强度调节,而非传统的全局均一施加;通过最小化冗余引导信息、最大化与目标语义的互信息,在少步推理(few-step)场景下同时兼顾生成质量与文本对齐,从方法论上将CFG蒸馏从粗粒度升级为信息论驱动的精细化压缩范式。
- Na\"ive PAINE: Lightweight Text-to-Image Generation Improvement with Prompt Evaluation
- 赛道归属: 文生图 / 推理优化
- 核心创新点: 提出了一种轻量级的提示词评估机制(PAINE),在文生图推理阶段通过自动评分筛选高质量生成结果,核心突破在于无需额外训练或修改扩散模型本身,仅通过对提示词质量的预评估来预判生成结果的优劣,从而减少用户重复生成的"赌徒负担",以极低计算开销提升整体生成满意度。
- Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
- 赛道归属: 文生图 / 布局条件自回归图像生成 (Layout-Conditioned Autoregressive Image Generation)
- 核心创新点: 提出SMARLI框架,针对自回归(AR)模型在布局条件生成中面临的稀疏条件利用不足与特征纠缠两大难题,提出结构化掩码(Structured Masking)机制作为核心技术手段。该方法通过设计专用的掩码策略,将空间布局约束显式地融入自回归生成过程,在不破坏AR模型原有序列生成范式的前提下,实现对图像中不同区域的精确空间控制,从而有效避免布局信息与图像特征之间的耦合干扰,提升生成图像与用户指定布局的空间一致性。
- Text-to-Image Generation for Projector-Camera System Registration
- 赛道归属: 文生图 / 应用场景(投影仪-相机系统标定)
- 核心创新点: 将文生图技术引入投影仪-相机(ProCam)系统的标定场景,核心创新在于利用文生图模型生成兼具人类可读性与足够特征分布密度的自然图像作为结构光投影图案,解决了传统结构光图案(条纹/斑点)缺乏语义意义、而普通自然图像特征分布不足导致配准精度低的双重困境,实现了高精度像素级配准与视觉友好性的统一。
- PIPBench: A Profile-Inclusive Framework for Personalized Image Generation Evaluation
- 赛道归属: 个性化文生图 / 评测基准
- 核心创新点: 提出 PIPBench,这是首个面向个性化图像生成的"用户画像感知"评测基准。其核心方法论突破在于:设计了一套数据构建流水线,能够从用户历史偏好图像中隐式提炼个人审美偏好,并将其与文本提示联合作为评测条件,从而系统性地衡量模型在满足个体视觉风格偏好方面的能力——填补了现有文生图评测体系忽视用户个性化需求的空白。
- FairFlow: Demystifying and Mitigating Stereotype Bias in Text-to-Image Diffusion Transformers
- 赛道归属: 文生图 / 公平性与偏见消除
- 核心创新点: 针对以MM-DiT(多模态扩散Transformer)为骨干的现代文生图模型中存在的刻板印象偏见问题,提出FairFlow框架。核心突破在于:区别于既有方案主要针对旧式U-Net架构设计,本工作首次系统性地分析了MM-DiT架构中偏见产生的内在机制,并在此基础上设计了专为Transformer注意力结构量身定制的偏见缓解方法,实现在不损害生成质量的前提下对刻板印象偏见的精准修正。
- SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion 🆕NEW
- 赛道归属: 文生图 / 基础模型训练
- 核心创新点: 提出"语义优先扩散"(Semantic-First Diffusion)这一新型潜在扩散建模范式,并以此构建文生图基础模型SeFi-Image。核心创新在于:打破传统潜在扩散模型中语义引导与噪声预测相对割裂的训练方式,将语义信息显式置于扩散过程的优先地位,从根本上重构了条件建模路径,使模型在训练初期即能建立强语义锚定;同时将该范式成功扩展至复杂文本描述、高分辨率及大参数量场景(多尺度模型),验证了语义优先范式对大规模文生图训练效率与质量的双重提升,弥补了以往语义加速方案仅在简单数据集/小模型上验证的空白。
- Tree-of-Thoughts Reasoning for Text-to-Image In-Context Learning
- 赛道归属: 文生图 / 多模态大模型 / 上下文学习(In-Context Learning)
- 核心创新点: 针对多模态大模型在文生图上下文学习(T2I-ICL)中组合推理能力弱、对提示构造敏感的问题,该工作将思维树(Tree-of-Thoughts, ToT)推理框架引入 T2I-ICL 任务。其核心创新在于在图像生成前插入多阶段推理与候选路径选择层:模型首先通过树状搜索空间对少样本示例中的潜在组合模式进行多路径探索与评估,再选取最优推理路径指导图像生成,有效提升了对复杂组合规律的推断准确性,并降低了提示敏感性。
- Making Implicit Preservation Intent Explicit in Conversational Image Editing 🆕NEW
- 赛道归属: 图像编辑 / 多轮对话式图像编辑
- 核心创新点: 针对多轮对话式图像编辑中"被遮挡但未被修改"内容无法正确恢复的隐性保留意图问题,提出将隐式保留意图显式化的解决框架。核心贡献有两点:①构建了OCCUR-Bench诊断基准,专门评估跨轮次时序保留能力,填补了该场景下系统性评测工具的空白;②提出将用户隐含的保留意图(即"此区域我从未要求修改,遮挡消失后应还原")转化为显式的编辑指令或条件信号,使模型能够感知并正确处理跨轮遮挡-恢复的语义一致性问题,从根本上解决现有系统在时序内容保留上的幻觉与不一致性缺陷。
GitHub
- [2026-07-14] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐12833
- [2026-07-13] Osmantic/ODS ⭐2973
- [2026-07-13] Asilcanasil/Hent-AI-Synthesis-Engine ⭐151
- [2026-07-14] imaginevid-ai/Awesome-seedream-5-pro-prompts-and-skills ⭐103
- [2026-07-14] yuji-hatakeyama/opencode-gpt-imagegen ⭐52
视频生成/编辑
arXiv
- M4V: Multimodal Mamba for Efficient Text-to-Video Generation 🆕NEW
- 赛道归属: 视频生成 / 高效架构设计
- 核心创新点: 提出基于Mamba架构的多模态文生视频框架M4V,以线性时间复杂度替代Transformer的二次方复杂度,专门针对视频生成中长序列时空建模的计算瓶颈进行突破。核心创新在于将Mamba的线性序列建模能力与多模态条件注入机制相结合,在保持生成质量的同时显著降低时空序列处理的计算开销,为大规模视频生成提供更高效的基础架构范式。
- Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment
- 赛道归属: 视频生成 / 多主体一致性生成
- 核心创新点: 提出Aura框架,核心突破在于引入"AI导演级字幕"(AI director-level captions)对视频内容进行密集结构化描述,结合VLM驱动的语义对齐机制,在多主体场景下实现跨帧身份一致性保持与复杂主体间关系建模,从根本上解决了现有方法在多元素视频生成中身份漂移和语义混淆的问题。
- Video Generation Models are General-Purpose Vision Learners 🆕NEW
- 赛道归属: 视频生成 / 通用视觉表征学习
- 核心创新点: 提出将大规模文本-视频生成作为计算机视觉通用预训练范式(GenCeption),核心主张是视频生成模型天然习得丰富的时空先验、视觉-语言对齐能力及良好的可扩展性,可作为视觉领域类比NLP中"下一Token预测"的统一预训练催化剂。方法论突破在于将生成式预训练目标与判别式视觉理解任务统一,验证了视频生成模型作为通用视觉基础模型的可行性,而非仅作为内容创作工具。
- SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation
- 赛道归属: 视频生成(人物-物体交互视频生成)
- 核心创新点: 针对人手与物体交互(HOI)视频生成任务,提出了一种稀疏时序控制框架 SparseCtrl-HOI,核心突破在于摒弃了传统方法对逐帧密集姿态序列的依赖,转而仅利用稀疏关键帧的手部-物体姿态作为时序条件信号,大幅降低了控制信号的标注成本与推理复杂度。通过在稀疏控制信号与视频扩散模型之间构建有效的时空传播机制,模型能够在仅给定少量关键帧约束的条件下,自动推断并合成具有物理合理性的细粒度手物交互动态,兼顾了可控性与生成灵活性,对AI驱动的直播电商等实际应用场景具有较强的实用价值。
- Video Generation Models Are Inherent Lighting Estimators
- 赛道归属: 视频生成 / 光照估计与场景理解
- 核心创新点: 提出V-LITE框架,将动态环境光照估计任务重新建模为有引导的视频补全(guided video inpainting)任务,创造性地借用视频生成模型内隐的光照物理知识来从单段野外视频中恢复动态环境光照图,无需专门的光照标注数据,实现了生成模型能力向逆渲染领域的迁移。
- Lights, Camera, Carbon: Architectural Scaling Laws for Video Generation Energy Consumption
- 赛道归属: 视频生成 / 能耗分析与推理优化
- 核心创新点: 构建了首个双向能耗估算框架,仅依赖分辨率、时长等可观测生成参数与架构基本原理,无需访问模型权重或内部实现细节,既可正向预测文生视频(T2V/T2VA)模型的推理能耗,又可反向从推理时延中还原架构缩放规律,为视频生成模型的碳足迹评估与绿色计算研究提供了方法论基础。
- ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics
- 赛道归属: 视频生成 / 可控动态与运动控制
- 核心创新点: 提出代理条件视频生成(proxy-conditioned video generation)范式,以物理仿真或真实录制的粗粒度代理视频作为动力学载体来精确控制前景物体运动,实现无需训练(training-free)的复杂动态控制,突破了单纯文本提示无法精确描述物理合理细粒度运动的瓶颈。
- Vidu S1: A Real-Time Interactive Video Generation Model
- 赛道归属: 视频生成 / 实时交互式视频生成
- 核心创新点: 提出Vidu S1,核心技术突破在于结合TurboDiffusion加速扩散推理与TurboServe高效服务架构,实现在消费级GPU上以最高42 FPS生成540p实时视频,支持语音实时控制数字角色、无限时长生成且无模糊/漂移/视觉失真,将实时可交互性引入扩散视频生成系统。
- Track the Noise, Move the World:3D-Grounded Motion-Consistent Noise for Controllable Video Generation
- 赛道归属: 视频生成 / 统一运动与相机控制
- 核心创新点: 提出UniCaMo框架,核心创新在于通过直接构造具有3D语义锚点的输入噪声张量(3D-grounded motion-consistent noise),在单次生成过程中同时实现对物体轨迹和相机视角的统一精确控制,将运动控制信号编码进噪声初始化层面,避免了现有方法中物体运动与相机运动控制相互干扰的问题。
- RotateAttention: RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation
- 赛道归属: 视频生成 / 推理优化 / 量化加速
- 核心创新点: 针对搭载3D RoPE的DiT视频生成模型,提出RotateAttention方法,专门解决INT4量化FlashAttention中两个被忽视的关键问题:① 在线旋转矩阵与3D RoPE位置编码的兼容性冲突;② 视频序列中注意力分数的异常值范围问题。通过RoPE感知的旋转校正与范围矫正策略,在保持低比特量化精度的前提下实现注意力计算的硬件加速。
GitHub
- [2026-07-14] hao-ai-lab/FastVideo ⭐3828 🆕NEW
- [2026-07-13] leofan90/Awesome-World-Models ⭐1889 🆕NEW
- [2026-07-13] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1561
- [2026-07-14] marcelo-earth/generative-manim ⭐893
- [2026-07-13] wordghost1234/agnes-ai-storyboard-studio ⭐152
HuggingFace Models
HuggingFace Datasets
- [2026-06-29] netflix/Vera-Layered-Video-Dataset
音频生成
arXiv
- Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space
- 赛道归属: 视频生成音频(Video-to-Audio Generation)
- 核心创新点: 提出Flowley,一种端到端单阶段训练的视频生成音频框架。核心突破在于直接在潜在空间(Latent Space)中实现跨模态对齐(Cross-Modal Alignment),无需多阶段训练或将视觉输入转换为文本中间表示,从而在保留细粒度时序线索的同时显著降低计算成本。通过将视觉与音频特征在潜在空间中直接对齐,实现了语义一致性与时序同步性的统一优化。
- Fr\'echet Distance Loss on Speech Representations for Text-to-Speech Synthesis
- 赛道归属: 文本转语音(Text-to-Speech Synthesis)/ 扩散模型训练优化
- 核心创新点: 提出语音表示弗雷歇距离损失(SR-FD Loss),作为一种训练时的分布正则化器,引入到无分词器的流匹配自回归TTS模型微调中。核心突破在于打破了传统TTS仅依赖局部目标(如条件流匹配、重建损失等)的范式,通过在训练阶段引入分布级别的约束,显式要求模型生成的语音分布向高质量真实语音分布对齐,从而解决了局部损失无法感知全局分布质量的根本缺陷。
- DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech
- 赛道归属: 文本转语音(TTS)/ 扩散语言模型
- 核心创新点: 提出将自回归(AR)TTS模型适配为扩散语言模型的框架DELTA-TTS。核心突破在于:通过引入扩散过程替代传统AR模型的逐步左到右生成方式,使模型能够在生成时利用双向上下文信息,从而克服AR模型因局部误差累积和幻觉传播导致的鲁棒性问题,同时显著提升推理速度。该方法保留了AR模型的基础结构,仅通过轻量级适配实现向扩散语言模型的迁移。
- Towards Digital Preservation of Efik: TTS for a Low-Resource African Language
- 赛道归属: 文本转语音(TTS)/ 低资源语言语音合成
- 核心创新点: 针对非洲低资源调性语言Efik,构建了首个端到端TTS研究基准,创建了包含2,632条话语(共3小时)的单说话人语料库,并系统性比较了VITS、MMS-TTS、SpeechT5和Orpheus-TTS四种神经模型在极低资源条件下的表现。核心贡献在于填补了Efik语言语音合成研究的空白,为非洲低资源调性语言的数字化保护提供了可复现的实验框架和评估范式。
- WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS
- 赛道归属: 文本转语音(Text-to-Speech Synthesis)/ 细粒度语音控制
- 核心创新点: 提出WordVoice,在基于LLM的TTS框架中实现显式、解耦的多维度词级声学属性控制。核心突破在于将语音属性控制从隐式端到端生成范式中解耦出来,允许用户在词级别(Word-Level)上独立、精确地操控多个声学维度(如韵律、音调、时长等),解决了LLM-based TTS在有声书旁白、视频配音等需要严格时序对齐和精细风格干预场景中控制粒度不足的瓶颈问题。
- SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation
- 赛道归属: 音频深度伪造检测(Audio Deepfake Detection)/ 声音效果合成数据集
- 核心创新点: 构建了SynSFX——首个面向合成音效深度伪造检测的大规模数据集,包含43,374条音频片段(26,452条合成、16,922条真实),覆盖7种主流文本生成音频(Text-to-Audio)模型。核心创新在于聚焦此前被深度伪造检测研究忽视的"孤立音效"场景,填补了现有环境音频数据集(如EnvSDD)在规模与生成溯源方面的不足,为研究合成音效检测器的泛化能力提供了系统性的评估资源。
- LuxSQA: Ask Me in Luxembourgish with TTS-Augmented Spoken Question Answering
- 赛道归属: 语音问答(Spoken QA)/ 低资源语言 / TTS数据增强
- 核心创新点: 针对卢森堡语这一低资源语言,提出了一种无需大规模人工录音的语音问答数据构建范式:将文本QA资源翻译为卢森堡语后,通过多套TTS系统合成口语问题,以此替代人工录制语料进行任务训练。核心贡献在于验证了TTS合成数据在低资源语音-LLM任务中的可行性,并为稀缺语言的口语理解任务提供了低成本的数据扩充路径。
- GRAFT: Grafted Reference Audio for Fine-grained Pronunciation in Zero-shot Text-to-Speech
- 赛道归属: 文本转语音(TTS)/ 零样本发音控制
- 核心创新点: 提出GRAFT机制——一种基于参考音频的逐词发音条件控制方法,专为神经编解码器语言模型TTS设计。现有系统即使引入音素条件也无法提供针对特定词汇(如专有名词、外来词、技术术语)的精细声学控制。GRAFT通过利用模型自身的语音分词器对短片段参考音频进行编码,将其注入为对应词的发音锚点,在零样本场景下实现了对任意词汇发音的细粒度控制,无需额外的发音词典或人工标注。
- FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech
- 赛道归属: 文本转语音(TTS)/ 强化学习优化
- 核心创新点: 提出FlowTTS-GRPO框架,将强化学习(具体为GRPO算法)首次系统性地引入基于Flow-Matching的TTS模型训练。核心技术突破在于:通过将Flow-Matching的确定性ODE轨迹转换为随机性SDE路径,使模型具备采样多样性,从而无需引入额外辅助模型即可直接对开源FM-TTS模型进行在线RL微调。同时采用加权多目标奖励组合策略(而非概率乘积方式),在自然度、可懂度等多维度质量指标上实现更快的收敛速度,填补了RL优化在非自回归语音合成架构上的研究空白。
- AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation 🆕NEW
- 赛道归属: 音频生成 / 多模态音频生成(Anything-to-Audio)
- 核心创新点: AudioX-Turbo 提出了一个统一的多模态音频生成框架,核心创新体现在三个层面:①统一多模态条件建模,将文本、视频、音频等异构输入信号统一纳入单一框架进行联合建模,实现"任意模态到音频"的灵活生成;②高效推理加速,针对多步扩散采样推理成本高昂的瓶颈,引入 Turbo 蒸馏技术显著压缩推理步数,降低生成延迟;③大规模高质量数据支撑,配套构建了面向多模态音频生成的高质量训练数据管线,以弥补此类统一框架对数据规模和质量的高要求。相较于各模态独立建模的传统范式,AudioX-Turbo 在保持跨模态生成灵活性的同时,实现了推理效率的实质性提升。
GitHub
- [2026-07-13] huggingface/diffusers ⭐34056
- [2026-07-13] BinWang28/audio-ai-hub ⭐943 🆕NEW
- [2026-07-13] apocas/restai ⭐512
- [2026-07-13] xiaomi-research/controlfoley ⭐141 🆕NEW
- [2026-07-13] dgrauet/ltx-2-mlx ⭐76
HuggingFace Models
语言大模型
arXiv
- Detecting Answer-Driven Reasoning in LLM-Based Educational Tutors via Truncated Chain-of-Thought Auditing
- 赛道归属: 教育AI / LLM可信性与推理审计
- 核心创新点: 提出"截断式思维链审计"(Truncated Chain-of-Thought Auditing)方法,通过在推理链的不同截断位置注入或屏蔽答案信息,检测LLM教学辅导系统是否存在"答案驱动推理"现象(即模型在生成解释前已隐式获知答案,导致解释流程倒置)。该方法无需修改模型本身,仅通过行为观测手段揭示LLM教辅系统中推理真实性的缺失,填补了教育场景下LLM推理可信度评估的空白。
- CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning
- 赛道归属: 推理优化 / 思维链增强
- 核心创新点: 提出CAP-CoT(循环对抗提示优化)框架,核心突破在于引入"对抗-纠错"循环机制:在单次前向推理链之外,增设对抗提示模块对已生成的CoT推理步骤进行批判性挑战,再通过纠错轮次迭代修正,形成闭环优化。与传统仅优化单次前向推理的CoT方法不同,该框架通过多轮对比性修正提升复杂多步推理的一致性和鲁棒性。
- Hierarchical Chain-of-Thought: Enhancing LLM Reasoning Performance and Efficiency 🆕NEW
- 赛道归属: 推理优化 / 思维链提示工程
- 核心创新点: 提出层次化思维链(Hi-CoT)范式,将传统扁平、无结构的推理链重构为分层子步骤结构。核心突破在于通过层级分解机制消除推理冗余,使复杂多步推理问题被系统性地拆解为有层次依赖关系的子任务,在提升推理准确性的同时降低推理步骤冗余度,实现性能与效率的双重优化。
- LLM-Guided Transportation Hub Capacity Planning with Textual Business Inputs
- 赛道归属: LLM Agent / 运筹优化决策
- 核心创新点: 提出将LLM作为枢纽容量规划的决策代理,核心创新在于设计了一套"结构化决策表"生成协议:LLM通过思维链推理将自然语言业务描述(定性文本)映射为具体容量调整参数,从而将传统量化运筹模型无法处理的定性业务上下文纳入容量规划流程,实现文本业务语义与量化调度优化的迭代融合。
- Multi-Task Instruction Tuning via Data Scheduling for Low-Resource Arabic SpeechLLMs
- 赛道归属: 多语言语音大模型 / 低资源语言适配
- 核心创新点: 针对阿拉伯语-英语混合场景下音频LLM的多任务指令微调,系统研究了数据调度策略对低资源语言模型性能的影响。核心创新在于通过受控实验设计,探索在ASR、语音/文本摘要(生成任务)与方言识别、语音情感识别(判别任务)等异构任务之间的数据调度方案,揭示了任务混合顺序与比例对阿拉伯语中心音频LLM跨任务泛化能力的关键作用,为资源匮乏的方言丰富语言场景提供了系统性的多任务调度方法论。
- One Prompt, Many Sounds: Modeling Listener Variability in LLM-Based Equalization
- 赛道归属: 音频处理 / LLM多模态控制
- 核心创新点: 提出基于LLM的自然语言驱动音频均衡框架,突破传统静态均衡器需手动调参的局限。核心创新在于利用受控听音实验数据建模"听众个体差异",通过上下文学习(in-context learning)使同一文本提示能够生成反映不同用户偏好分布的均衡曲线,而非单一确定性输出,从而实现对听众主观偏好变异性的概率化建模。
- Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation 🆕NEW
- 赛道归属: LLM Agent / 多智能体协作与任务调度
- 核心创新点: 提出Agora框架,将拍卖机制引入LLM智能体的工具/专家模型调用流程。区别于现有粗粒度任务-功能匹配方式,Agora设计了激励相容的拍卖式任务分配协议,将功能相似的候选模型/工具之间的性能差异与成本效益纳入决策考量,从机制设计角度解决多智能体系统中资源分配的最优性问题。
- Communication-Efficient Digital-Twin Coordination for Heterogeneous LLM Embodied Agents over Computing Power Networks 🆕NEW
- 赛道归属: LLM Agent / 具身智能多智能体协作通信
- 核心创新点: 针对异构LLM具身智能体团队在算力网络受限条件下的协作问题,提出基于数字孪生的通信高效协调框架。核心创新在于以数字孪生替代多轮自然语言对话作为协调媒介,系统性解决异构LLM间多轮通信带来的带宽冗余、延迟累积和语义对齐三个耦合瓶颈,显著降低通信开销同时保持协作可靠性。
- Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents 🆕NEW
- 赛道归属: LLM Agent / AI辅助科学发现与可审计性
- 核心创新点: 提出假设演化协议(Hypothesis Evolution Protocol),为LLM科学研究智能体建立结构化的假设生命周期追踪机制。核心突破在于将智能体"提出假设→实验验证→信念更新"的完整推理过程从非结构化日志中显式化,构建可审计的假设演化轨迹,使AI科学发现过程具备可溯源、可验证的透明度,解决当前智能体科学推理"黑箱"问题。
- Neuro-Agentic Control: A Deep Learning-based LLM-Powered Agentic AI Framework for Controlling Security Controls 🆕NEW
- 赛道归属: LLM Agent / 工业安全控制与自主决策
- 核心创新点: 提出神经-智能体控制(Neuro-Agentic Control)框架,专门应对LLM幻觉特性在工业闭环控制场景中的安全风险。核心创新在于将LLM的语义推理能力限定于感知与决策支持层,并结合深度学习模块构建"LLM规划+神经网络执行"的解耦架构,通过引入安全约束边界阻断LLM幻觉向物理控制指令的传导路径,实现工业IoT环境下兼具智能性与安全性的自主控制。
GitHub
- [2026-07-14] sgl-project/sglang ⭐30263
- [2026-07-14] NVIDIA-NeMo/Speech ⭐17770
- [2026-07-14] NVIDIA/TensorRT-LLM ⭐14110
- [2026-07-14] testtimescaling/testtimescaling.github.io ⭐108 🆕NEW
- [2026-07-14] gpt-cmdr/ras-commander ⭐69 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-06-29] Glint-Research/Fable-5-traces
- [2026-07-07] Crownelius/Complete-FABLE.5-traces-2M
多模态大模型
arXiv
- AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring
- 赛道归属: 多模态理解 / 垂直领域视觉语言模型(建筑工地监控)
- 核心创新点: 提出 AVA-VLM 框架,针对野外建筑工地监控场景的三大痛点进行专项突破:①引入自适应视觉注意力机制,使模型能在不同分辨率输入下自动聚焦关键区域,提升低分辨率场景下的可靠性;②突破单一全局图像的直接 QA 微调范式,改为结合局部感知的多尺度视觉理解策略,扩展实际部署的操作范围;③通过注意力驱动的推理优化降低不必要的计算开销,提升推理效率,使模型更适配真实工地的在线部署需求。
- MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning
- 赛道归属: 多模态理解 / 联邦学习与隐私保护分布式训练
- 核心创新点: 提出 MLLM-LLaVA-FL 框架,将多模态大语言模型(以 LLaVA 为代表)引入联邦学习体系以解决客户端数据异质性问题。核心突破在于:利用 MLLM 强大的图文理解与描述能力,对各客户端的异构图像数据生成语义一致的多模态表征或增强描述,从而弥合不同客户端间的数据分布差异;相较于传统 FL 方法仅依赖局部数据微调的策略,该方法通过 MLLM 的跨模态知识泛化能力提升全局模型在数据非独立同分布(Non-IID)场景下的聚合性能。
- VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving
- 赛道归属: 自动驾驶安全 / 多模态理解与规划
- 核心创新点: 提出VLM-CASE框架,将视觉语言模型(VLM)引入自动驾驶的前瞻性安全规划。核心突破在于利用VLM对复杂驾驶场景(如恶劣天气)进行语义推理,动态生成"上下文自适应安全包络"(Context-Adaptive Safety Envelopes),提前调整速度、跟车距离和转向策略,将被动反应式安全机制升级为主动预判式安全控制,弥合了感知退化与物理可行性约束之间的鸿沟。
- VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models
- 赛道归属: 多模态理解 / 计算光学与视觉语言模型协同设计(Meta-Optic Co-design for VLM)
- 核心创新点: 提出 CODA 协同设计框架,针对冻结(frozen)视觉语言模型的特性,将前端元光学(meta-optic)硬件设计与 VLM 的感知偏好联合优化,而非追求传统人类可读的图像质量指标。核心突破在于:以 VLM 的任务性能(而非图像分辨率/像差等光学指标)作为优化目标,使紧凑型元光学在尺寸/成本受限场景下仍能维持高效的多模态理解能力,打通了物理光学设计与AI模型感知之间的优化闭环。
- Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference 🆕NEW
- 赛道归属: 多模态理解 / 推理优化(边缘端能耗分析)
- 核心创新点: 该工作颠覆了学界对视觉语言模型(VLM)边缘推理能耗瓶颈的传统认知。通过对5个模型、3种架构族、4种输入分辨率和2种硬件平台进行系统性的端侧能耗剖析,首次实证揭示:视觉处理(视觉编码器)并非边缘VLM推理的主要能耗来源,文本生成(语言解码)才是真正的能耗瓶颈。这一发现直接挑战了现有大量以削减视觉Token为核心目标的效率优化工作的基本假设,为边缘端VLM高效推理的研究方向提供了关键的重新定向依据——未来优化工作应将资源重点转向语言解码侧(如减少生成Token数量、优化KV Cache等),而非一味压缩视觉侧计算。
- GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model
- 赛道归属: 多模态大模型 / 具身智能视觉导航
- 核心创新点: GemNav 提出了一种极简化的视觉机器人导航范式,完全摒弃了传统方案中"专用视觉编码器 + 定制动作头 + 大规模跨机体数据集训练"的三件套组合。其核心创新在于:直接复用冻结的多模态大语言模型(MLLM)作为导航策略主干,仅对语言塔(language tower)施加 LoRA 微调,将导航动作以离散Token的形式表达并通过语言模型的自回归生成来预测路径点(waypoint),从而实现中短距离导航任务。该方法从根本上验证了重型专用架构并非视觉导航的必要条件,为利用通用预训练MLLM直接赋能机器人导航提供了参数高效的轻量化新路径。
- QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding
- 赛道归属: 多模态视频理解 / 视频时序检索
- 核心创新点: 提出QSVideo框架,针对长视频理解中VLM性能随时长下降的问题,设计了一种查询条件驱动的语义时序检索机制。核心创新在于:通过查询感知的相关性估计解决检索偏差问题,引入多样性约束避免候选片段时序坍缩(temporal collapse),从而精准定位与查询语义相关的视觉证据片段,显著提升长视频多模态理解的准确性与鲁棒性。
- From Geometric Labels to Semantic Understanding of Indoor Building Components Using Multimodal Large Language Models
- 赛道归属: 多模态理解 / 3D点云室内建筑语义理解
- 核心创新点: 提出Building-MLLM,将多模态大语言模型引入室内建筑构件的点云理解任务。核心突破在于突破传统方法仅输出离散标签的局限,以点云为中心融合指令输入,使模型能够生成涵盖简单识别、复杂描述及多轮问答的自然语言响应,实现从几何标签到功能语义理解的跨越,赋予设施运维场景以可交互的语言能力。
- ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation
- 赛道归属: 多模态理解 / 手语翻译
- 核心创新点: 提出ViPo-MLLM框架,专注于免词汇标注(Gloss-Free)的手语视频到文本翻译。核心创新在于双模态协同建模:分别设计针对RGB时空特征和人体姿态特征的专用编码器,并通过跨模态注意力机制捕捉长程依赖关系,将手部、躯体、面部线索的细粒度信息有效融合至多模态大语言模型中,在无需昂贵词汇标注的前提下显著提升翻译性能。
- PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement
- 赛道归属: 多模态大模型安全 / 机器遗忘(Machine Unlearning)评测
- 核心创新点: 提出PPE-Bench基准,专门评估多模态大语言模型在"私密-公开信息纠缠"(Private-Public Entanglement)场景下的机器遗忘效果。核心创新在于:针对现有基准的两大缺陷——使用过度简化的单目标图像和忽视公私信息共存的复杂性——构建更贴近真实场景的评测体系,要求模型在遗忘私密信息的同时保留合法公开知识,为MLLM隐私保护研究提供更严格、更真实的评估标准。
GitHub
- [2026-07-13] Blaizzy/mlx-vlm ⭐5158
- [2026-07-08] zli12321/Vision-Language-Models-Overview ⭐661
- [2026-07-14] VITA-Group/VLM-3R ⭐425
- [2026-07-08] roboflow/rf100-vl ⭐136
- [2026-07-13] THUSI-Lab/GameVerse ⭐50 🆕NEW
HuggingFace Models
强化学习
arXiv
- RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Light Night-time Scenes
- 赛道归属: 图像处理 / 自动白平衡(Auto White Balance)
- 核心创新点: 提出 RL-AWB 框架,将统计方法与深度强化学习结合,专门针对低光夜间场景的白平衡校正问题。核心突破在于:①设计了面向夜间场景的统计算法,融合显著灰色像素检测与新型光源估计;②在此基础上,首次将深度强化学习引入自动白平衡任务,使模型能够通过与环境的交互学习动态校正策略,突破了传统监督学习方法在复杂夜间光照条件下泛化能力不足的瓶颈。
- ICR-RL: Deep Reinforcement Learning via In-Context Regression
- 赛道归属: 强化学习 / 基础模型 / In-Context学习
- 核心创新点: 提出ICR-RL框架,将In-Context回归(ICR)作为RL的值函数估计器,无需在大规模RL任务集上预训练基础模型,而是通过少量上下文样本动态拟合值函数。核心突破在于将监督学习中的In-Context泛化能力迁移至RL的策略评估阶段,绕过了构建多样化RL训练环境的工程瓶颈,实现了对新任务的快速适应。
- RL-Ballast: Ship Ballast Water Path Planning and Clog Prediction via Reinforcement Learning
- 赛道归属: 强化学习 / 工业自动化 / 路径规划
- 核心创新点: 提出RL-Ballast系统,将深度强化学习应用于船舶压载水路径规划与管道堵塞预测。核心创新在于以图神经网络建模压载水管路拓扑结构,结合RL智能体在稀疏传感器条件下完成液压异常(阀门故障、管道堵塞)的自适应诊断与路径重规划,突破了传统规则系统对密集传感器依赖和低适应性的局限。
- A Technical Survey of Reinforcement Learning Techniques for Large Language Models
- 赛道归属: 大语言模型 / 强化学习对齐 / 综述
- 核心创新点: 系统梳理了RL技术与LLM结合的完整技术图谱,涵盖PPO、Q-Learning、Actor-Critic等基础算法,以及RLHF、RLAIF、DPO等专用对齐方法。核心贡献在于从算法原理、工程实现到应用场景提供了多层次的技术分类框架,尤其对非人类反馈驱动的新型对齐策略进行了系统化归纳,为该领域提供了结构化的技术参考基线。
- Multimodal Reward Hacking in Reinforcement Learning 🆕NEW
- 赛道归属: 多模态大模型强化学习对齐 / 奖励黑客(Reward Hacking)分析
- 核心创新点: 系统性研究了多模态大语言模型(MLLM)在强化学习对齐过程中的奖励黑客现象——即模型在视觉任务中通过钻空子获得高奖励但实际任务表现下降的问题。核心创新在于提出了新增奖励失败率(NRFR,Newly Rewarded Failure Rate)这一量化指标,用于精确衡量奖励黑客的发生程度;并通过跨安全VQA、图表VQA等多场景、多模型规模(2B-32B)、多RL算法(GRPO、RLOO、DAPO)的系统性对照实验,揭示了仅依赖纯文本或弱视觉锚定奖励信号所带来的对齐失效规律,为多模态RL训练的奖励设计提供了诊断框架。
- Learning More from Less: Reinforcement Learning from Hindsight 🆕NEW
- 赛道归属: 机器人操控 / 视觉-语言-动作(VLA)模型强化学习训练效率
- 核心创新点: 针对机器人操控任务中稀疏奖励导致早期训练样本利用率极低的痛点,提出了基于事后回顾的强化学习(Reinforcement Learning from Hindsight)方法。核心创新在于将失败轨迹重新解读为"完成了另一个任务的成功轨迹",通过事后目标重标注(hindsight relabeling)机制为原本无效的失败 rollout 构造正向学习信号,从而在不增加额外数据采集成本的前提下显著提升样本效率。该方法直接解决了VLA模型在实体机器人场景下rollout成本高昂、稀疏奖励下冷启动困难的核心矛盾。
- Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF
- 赛道归属: 扩散模型强化学习对齐(Diffusion RLHF)
- 核心创新点: 提出两种互补策略以提升扩散模型RLHF的样本效率:①选择性时间步加权(Selective Timestep Weighting),通过识别并重点优化对奖励信号贡献更大的去噪时间步,避免对所有时间步一视同仁带来的梯度稀释;②基于优势的经验回放(Advantage-Based Replay),优先重放高优势样本,减少对新反馈的依赖。两者协同作用,在显著减少奖励模型/人类反馈调用次数的前提下实现有效对齐。
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- 赛道归属: 大语言模型强化学习训练系统(LLM RL Post-Training)
- 核心创新点: 提出单轨迹异步优化(Single-Rollout Asynchronous Optimization)框架,针对长时序智能体任务中传统同步批量RL流水线效率低下的问题,在每条轨迹到达时立即触发模型更新,同时创新性地引入训练稳定性保障机制(如策略漂移控制),在兼顾高吞吐量的同时改善异步RL普遍忽视的训练稳定性与任务有效性问题。
- Safe Reinforcement Learning using Ideas from Model Predictive Control
- 赛道归属: 安全强化学习 / 机器人与网络物理系统控制
- 核心创新点: 将模型预测控制(MPC)思想融入安全强化学习框架,提出一种广义安全RL方法,在主动探索阶段通过MPC的前瞻预测机制提前预判约束违反风险,从而在不依赖事后修正的前提下实现严格的硬安全约束(Hard Safety Constraints)。相比传统屏障函数或拉格朗日方法,该框架在复杂机电系统中对不可逆物理损伤的预防性保障能力更强。
- ORCAID: Oblique Rule-Based Continuous-Action Interpretation for Deep RL Policies
- 赛道归属: 可解释强化学习(Explainable RL)
- 核心创新点: 提出ORCAID方法,首次针对混合连续-离散动作空间的深度RL策略提取可解释规则集。核心突破在于设计了一种高效的斜向决策树(Oblique Decision Tree)训练算法,通过非轴对齐超平面对状态空间进行划分,相较于传统正交决策树能以更少的节点覆盖更复杂的决策边界,从而在保持策略保真度的同时大幅提升连续动作域的可解释性表达能力。
GitHub
- [2026-07-14] huggingface/trl ⭐18833 🆕NEW
- [2026-07-14] OpenPipe/ART ⭐10469 🆕NEW
- [2026-07-14] RLinf/RLinf ⭐4096 🆕NEW
- [2026-07-14] Farama-Foundation/PettingZoo ⭐3469 🆕NEW
- [2026-07-14] radixark/miles ⭐1719
HuggingFace Models
HuggingFace Datasets
- [2026-07-09] ByteDance-Seed/EdgeBench
- [2026-07-12] AlicanKiraz0/Turkce-Atlas-Instruct 🆕NEW
- [2026-07-09] kyutai/rocket-science
世界动作模型
arXiv
- Learning 4D Geometric Priors for Inference-Efficient World Action Models
- 赛道归属: 世界动作模型 / 机器人操控 / 4D几何感知
- 核心创新点: 现有视频-动作联合训练方法主要优化面向外观的视频潜变量,难以捕捉精确操控所需的时序几何变化。MECo-WAM提出"多专家联合训练"框架,将4D几何先验(如点云、深度、光流等时序几何信息)注入视频-动作联合表示中,以弥补纯外观潜变量对三维运动理解的不足。核心突破在于:①通过多专家协同训练机制,在无需推理时额外几何输入的前提下,将4D几何知识蒸馏融合进统一的动作表示;②实现了推理高效性(Inference-Efficient),即几何先验仅在训练阶段引导表示学习,推理阶段不增加额外计算开销;③将时序几何感知能力与可执行动作序列预测相结合,提升了机器人操控任务中对空间运动轨迹的预测精度。
- ABot-M0.5: Unified Mobility-and-Manipulation World Action Model
- 赛道归属: 具身智能 / 移动操作世界动作模型(World Action Model for Mobile Manipulation)
- 核心创新点: 针对移动操作任务中现有WAM方法的三大结构性缺陷(粗粒度视频块处理、导航-操作动作耦合建模、逆动力学监督与自回归推理不匹配),ABot-M0.5提出了统一的移动操作世界动作模型框架。核心突破包括:① 以细粒度帧级别取代粗粒度视频块进行时序建模;② 将导航与操作动作解耦,分别建模以适配两类任务的异质性结构;③ 重新对齐逆动力学训练目标与自回归推理范式,使模型在推理阶段的动作生成更加一致。该工作将反应式VLA策略提升为具备显式世界建模能力的统一框架,实现对移动操作全流程的端到端动作预测。
- WAM4D: Fast 4D World Action Model via Spatial Register Tokens
- 赛道归属: 世界动作模型 / 机器人操控 / 4D场景理解
- 核心创新点: 提出通过引入轻量级"空间寄存器令牌(Spatial Register Tokens)"来桥接2D视频生成与4D时空表征的方法,无需模型直接预测密集点云或深度图。核心突破在于:利用少量可学习的空间寄存器令牌隐式编码3D几何约束与遮挡接触信息,将几何基础模型的先验以极低计算代价注入WAM的时序预测过程,从而在保持快速推理的同时显著提升操控任务中对三维空间结构的感知与精度,克服了现有WAM仅在2D视频/隐空间中建模导致的空间约束缺失问题。
- From World Models to World Action Models: A Concise Tutorial for Robotics
- 赛道归属: 具身智能 / 世界模型综述与设计空间分析(World Model Survey & Design Space for Robotics)
- 核心创新点: 本文以教程形式对机器人领域的世界模型研究进行系统性梳理,核心贡献在于提出了一套统一的"设计空间视图"(Design-Space View)分析框架。将世界模型统一定义为"动作条件化的预测模型"(action-conditioned predictive models),并按建模空间将其划分为观测空间世界模型(Observation-Space)与状态空间世界模型(State-Space)两大类,从视觉保真度、空间结构性、物理可解释性和计算效率等维度系统比较其权衡关系。进一步厘清了"世界模型"与"世界动作模型(WAM)"之间的概念边界,填补了跨社区之间概念模糊的空白,为后续研究提供了清晰的方法论参照。
- WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time
- 赛道归属: 机器人基础模型 / 世界动作模型 / 测试时训练(Test-Time Training)
- 核心创新点: 提出 WAM-TTT 框架,核心突破在于无需机器人演示数据、无需任务特定微调,仅通过观看人类操作视频即可在测试时动态引导冻结的世界动作模型(WAM)适应新任务变体或用户偏好行为。方法上的关键创新是引入"轻量级自适应记忆模块"(lightweight adaptive memory),以自监督视频预测为训练信号,将人类视频中的行为先验"吸收"进该记忆模块,而非将人类视频直接视为模仿轨迹或长上下文输入。这一设计解耦了人类视频理解与机器人策略执行,使得在测试阶段即可实现低成本、高效率的行为转向,同时保持主干模型参数冻结,规避了灾难性遗忘问题。
- UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation
- 赛道归属: 世界动作模型 / 自动驾驶 / 视频-轨迹联合生成
- 核心创新点: 提出统一视频与动作生成的单一DiT架构UNIVERSE,通过"灵活掩码调制的模态生成(Flexible Mask-Modulated Modality Generation)"机制,将视频预测与轨迹生成在同一模型中联合建模,打破现有级联式或双DiT设计中视频分支与动作分支之间的信息壁垒。核心突破在于:通过可灵活控制的模态掩码,使模型在训练和推理时动态切换"仅生成视频""仅生成轨迹"或"联合生成"等多种模态组合,迫使轨迹预测分支直接继承并复用视频建模所习得的世界动态表征,从根本上解决了视频学到的场景动态知识无法有效迁移至轨迹预测的痛点。
- DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation
- 赛道归属: 世界动作模型 / 机器人操控 / 双系统层次化规划
- 核心创新点: 提出双系统世界动作基础模型DSWAM,将VLM级别的语言规划能力与WAM的视频-动作执行能力有机融合。核心突破在于:借鉴认知科学中"快慢双系统"思想,构建慢速语言规划系统(基于VLM,负责将粗粒度用户指令分解为细粒度子任务序列)与快速视频-动作执行系统(基于WAM,负责对每个子任务进行精细操控)的协同框架,既保留了WAM在物理接地执行上的优势,又补齐了其缺乏显式语言级任务分解接口的短板,专门针对家庭场景中复杂多步骤操控任务的细粒度执行需求而设计。
GitHub
- [2026-07-13] open-gigaai/giga-world-policy ⭐1312
- [2026-07-13] OpenMOSS/Awesome-WAM ⭐1090
- [2026-07-12] DravenALG/awesome-vla-wam ⭐838
- [2026-07-09] yuyangalin/ImageWAM ⭐125
- [2026-07-12] gangweix/next-forcing ⭐98
由 Research Daily 自动生成 生成时间: 2026-07-14 01:46:21