AI 每日进展速报 - 2026-07-29
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图(Prompt优化/提示词自动改写与对齐)
- 核心创新点: 提出一种“图像落地”的提示词精炼框架,通过让模型在生成图像后基于图像内容进行自诊断与自奖励(self-rewarding),把“提示词是否有效”从纯文本层面的启发式改写,转为由生成结果驱动的闭环优化;同时强调可学习、可复用的提示词优化策略(而非一次性prompt扩写),使优化过程能够沉淀为通用的prompt refinement policy,提升对不同提示与场景的泛化能力与稳定性。
- MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation 🆕NEW
- 赛道归属: 文生图(可控生成/区域级控制与组合生成)
- 核心创新点: 提出面向SDXL的区域级可控生成机制,通过“Mask Attention”在注意力计算中显式引入空间掩码约束,实现按区域绑定文本条件,从而降低多对象场景中属性串扰与对象混淆;在保持U-Net扩散骨干高效性的前提下增强跨区域/全局协调能力,避免直接切换到高成本的Transformer扩散架构,以较低额外计算实现更可靠的组合式生成与可控布局。
- MixDiffusion: Mixing Diffusion-based Uni-condition Text-to-Image Generation Models for Multi-condition Image Synthesis
- 赛道归属: 文生图(多条件可控生成 / 扩散模型推理框架)
- 核心创新点: 提出一种无需训练(training-free)的多条件扩散生成框架,通过在推理阶段对多个“单一条件控制”的T2I扩散模型进行可组合的混合(mixing),实现对任意数量、任意类型控制条件的统一支持;方法层面强调对不同条件分支的融合机制与理论可扩展性,使多条件约束在同一次采样过程中协同生效,而不依赖重新训练多条件ControlNet式模型。
- UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation
- 赛道归属: 文生图安全(NSFW检测与缓解 / 扩散模型安全对齐)
- 核心创新点: 提出统一的“噪声驱动”检测与缓解框架,将扩散模型生成过程中的噪声/去噪动态作为关键信号,用于识别隐式性暗示(implicit sexual prompts)而非仅依赖显式词表或生成后图像判别;并在同一框架内给出对应的生成期干预/抑制策略,实现从“意图检测”到“生成抑制”的闭环,针对隐式提示与对抗token导致的偏置触发提供更鲁棒的防护路径。
- CoBind: Stage-Aware Compositional Binding for Training-Free Text-to-Image Generation
- 赛道归属: 文生图(复杂提示组合生成 / 训练免提示遵循增强)
- 核心创新点: 提出训练免的阶段感知(stage-aware)组合绑定(compositional binding)机制,显式建模“属性-实体-关系”的归属与绑定,而不是仅做token级注意力增强;核心在于根据扩散去噪的不同阶段,分阶段施加不同约束(例如先布局/关系后细节属性),从而减少多实体场景中的漏物体、属性串绑、空间关系颠倒等典型失败,实现更稳定的复杂指令遵循。
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- 赛道归属: 文生图 / 推理优化(CFG蒸馏加速)
- 核心创新点: 针对现有CFG蒸馏方法中"盲注入"范式(全局静态引导强度)的局限,提出基于信息瓶颈(Information Bottleneck)理论的自适应CFG蒸馏框架IB-Flow。其核心突破在于:将信息瓶颈原理引入扩散模型的引导强度分配,实现对不同去噪步骤和不同语义区域的细粒度、动态化引导强度调节,而非传统的全局均一施加;通过最小化冗余引导信息、最大化与目标语义的互信息,在少步推理(few-step)场景下同时兼顾生成质量与文本对齐,从方法论上将CFG蒸馏从粗粒度升级为信息论驱动的精细化压缩范式。
- RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
- 赛道归属: 文生图对齐优化(RLHF/偏好对齐)
- 核心创新点: 提出 RubricRL,用“可解释的评分量表(rubric)”来构造文本到图像生成的强化学习奖励信号:将对齐目标拆解为多个可读、可控的维度(而非固定权重的复合指标或单一黑盒标量奖励),并以统一、通用的奖励框架进行优化,从而提升奖励的可解释性、可调节性与跨任务/跨概念的泛化能力,降低对特定指标权重调参或偏好模型蒸馏的依赖。
- Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
- 赛道归属: 文生图 + 指令式图像编辑(高效基础模型/原生分辨率生成)
- 核心创新点: 提出 Mage-Flow,一个面向高效训练与部署的“原生分辨率”生成与编辑基础模型栈,通过两项协同设计实现性能/成本平衡:1)Mage-VAE 作为轻量高保真 latent tokenizer,采用一步扩散式编码/解码以降低重建开销并保持细节;2)在原生分辨率上训练的多模态 Diffusion Transformer,并用 rectified flow matching(流匹配范式)替代传统扩散训练以提升训练/采样效率。整体以紧凑 4B 规模同时覆盖文本生成与指令编辑,强调端到端效率与高分辨率细节保真。
- Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing
- 赛道归属: 图像编辑安全(人脸身份保护 / 多模态统一编辑模型防护)
- 核心创新点: 针对统一多模态图像编辑模型(UMMs)存在多视觉分支处理路径、导致传统对抗保护迁移失效的问题,提出以跨分支冲突(cross-branch conflict)为核心的身份防护思路:在特征层面刻意诱导不同视觉分支对人脸身份表征产生不一致,从而在编辑/生成链路中形成“盾牌”,降低未授权的人像篡改与身份保持编辑的成功率;方法重点在于面向UMM结构特性设计可迁移、可触发的防护扰动/机制,而非单一路径的对抗噪声。
- Decomposing Subject-Driven Image Generation via Intermediate Structural Prediction
- 赛道归属: 文生图(主体驱动/个性化生成、结构-外观解耦)
- 核心创新点: 提出两阶段的“结构先行”生成范式,将主体驱动生成从直接RGB生成中解耦出来:第一阶段先进行中间结构预测(以Canny边缘图作为显式结构表征),第二阶段在“源外观特征 + 预测结构”的双条件下进行渲染生成。该设计通过显式约束几何与轮廓,显著提升大幅编辑场景下的高频身份细节保持能力(如logo、纹理、文字等),并通过面向文本细节的专门处理机制增强文字/图案的可控与可读性,缓解传统端到端RGB生成在细节处易退化的问题。
GitHub
- [2026-07-29] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐12988 🆕NEW
- [2026-07-28] Osmantic/ODS ⭐3792
- [2026-07-29] AceDataCloud/Nexior ⭐384
- [2026-07-28] linux4life1/front-porch-AI ⭐53
- [2026-07-28] piexian/astrbot_plugin_gemini_image_generation ⭐50 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-07-25] unstonio/pixelgpt-24x24-20k
视频生成/编辑
arXiv
- Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation
- 赛道归属: 视频生成(文生视频)/ 数据工程与数据配方研究
- 核心创新点: 聚焦“训练数据”这一长期被低估的变量,构建可控实验环境(Moving Alphabet)以系统剥离真实数据采集/清洗/标注的混杂因素,从而定量研究两类关键数据维度对文生视频模型的因果影响:①训练数据分布(动作/外观/时序变化等分布偏置)如何改变模型的生成能力与泛化;②字幕质量(描述粒度、时序对齐、噪声与歧义)如何影响文本-视频映射学习与可控性。该工作的方法论突破在于用“可控合成数据基准”替代不可控的真实数据配方对比,使数据分布与标注质量的影响可复现实证、可诊断并可指导后续数据配方设计。
- Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models
- 赛道归属: 视频生成安全/对抗攻防(Text-to-Video Jailbreak)
- 核心创新点: 针对T2V黑盒越狱中“沿用文生图攻击导致时序信息利用不足、且需要高查询优化成本”的痛点,提出利用视频生成固有的时间一致性作为攻击杠杆:通过在跨帧保持稳定的对抗提示/约束,使不安全语义在时间维度上被持续强化与传播,从而在更少查询、更贴近真实部署的黑盒条件下提升越狱成功率;方法论上把“时序一致性”从生成质量指标转化为可被利用的攻击面。
- When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation
- 赛道归属: 视频生成对齐/偏好优化(Text-to-Video Preference Optimization)
- 核心创新点: 识别并形式化“物理偏好 vs 语义一致性”的系统性冲突:传统物理偏好标注往往只比较两段视频的动力学优劣,却不判断其是否忠实于文本语义,导致优化会偏向物理合理但语义跑偏。提出物理-语义联合的直接偏好优化框架,在偏好学习目标中显式引入语义约束/过滤或联合判别机制,使物理改进只在满足文本语义的可行域内进行,从训练目标层面缓解两类偏好信号的梯度对冲与偏置。
- When Cultures Move: Measuring and Improving Multicultural Text-to-Video Generation
- 赛道归属: 视频生成评测与文化对齐(Multicultural Text-to-Video)
- 核心创新点: 面向“单提示多文化表达”这一未充分研究的能力,提出MAVEN多智能体提示精炼:将提示分解为人物(Person)、动作(Action)、地点(Location)等维度,由专门代理并行/串行地重写与约束提示,减少文化要素在生成中被稀释或误配;同时配套系统化评测设定以量化文化保真度与跨文化组合的失败模式。方法突破在于用可组合的结构化提示分解与代理协作,把文化对齐从单一提示工程提升为可控的流程化优化。
- Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation
- 赛道归属: 身份保持视频生成/视频生成条件控制(Sequential-Action T2V)
- 核心创新点: 针对带时间戳动作序列的身份保持生成(同一主体跨多动作、跨时间保持可识别性)提出关键帧锚定的身份保持机制:以关键帧作为身份“锚点”在时序上提供强约束,并将后续帧的生成对齐到锚定身份表征,从而在动作切换、姿态变化和长时序条件下抑制身份漂移;方法论上把身份一致性从逐帧弱约束提升为“关键帧—序列传播”的结构化约束方式,更适配分段动作脚本输入。
- FilmBench: A Film-Grade Benchmark for Cinematic Video Generation 🆕NEW
- 赛道归属: 视频生成评测基准 / Benchmark(电影级生成质量评估)
- 核心创新点: 构建面向“电影工业标准”的视频生成评测体系,核心突破在于将评估维度从通用基准常用的粗粒度指标(整体画质、文本一致性、时序平滑等)升级为更贴近专业影视制作与审美判断的“Cinematic Language”评价框架;同时针对现有基准依赖网页提示词/LLM模板与通用多模态打分器的问题,引入更贴合电影语境的任务设计与评价流程,旨在更真实地区分模型在镜头语言、叙事表达与专业制作质感等方面的能力差异,从而提升评测的可解释性与行业相关性。
- Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification 🆕NEW
- 赛道归属: 视频生成推理优化 / 加速(扩散Transformer注意力稀疏化)
- 核心创新点: 提出训练无关(training-free)的“在线注意力稀疏化”推理加速框架,在不改动/不重训生成模型的前提下,动态选择性计算注意力中的部分K-V块以降低长序列注意力开销;相较固定比例Top-k块选择的刚性预算与高路由成本,该方法强调“按需、按内容”的自适应稀疏策略与更轻量的路由机制,在保证生成质量(注意力近似精度)与时序一致性的同时,提高稀疏选择的稳定性与可预测性,从而更有效地缓解视频扩散Transformer推理瓶颈。
- VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation 🆕NEW
- 赛道归属: 视频生成(物理可控/物理一致性)/ 条件控制
- 核心创新点: 提出“视觉上下文物理推理(Visual In-Context Physics Reasoning)”范式,用视频示例而非仅文本/单图来提供连续、关系型的物理条件(材质响应、接触交互、形变、运动轨迹等),突破传统条件输入在物理行为表达上的“条件瓶颈”;通过将物理规律与交互模式以可演示的视觉上下文注入生成过程,使模型能够在生成时进行更贴近真实世界的物理行为对齐与可控合成,提升视频在接触、动力学与形变等方面的物理可信度与可操控性。
- AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment
- 赛道归属: 视频生成(人-物交互 HOI、文本驱动、扩散模型)
- 核心创新点: 提出“先推理、后生成”(thinking-before-generation) 的多智能体推理框架,将人、物体及其交互关系显式建模为可协同决策的多个 agent,在生成前先进行交互逻辑与时序行为的推演,从而把“交互合理性”从纯生成阶段前置为可控的规划问题;同时通过隐式表示对齐(implicit representation alignment) 将推理得到的交互意图/关系约束与视频扩散模型的潜空间表征对齐,减少对显式运动轨迹/关键点等强监督控制信号的依赖,提升对多样物体与复杂交互的可扩展性与泛化能力,并在保持文本可控性的同时增强 HOI 的细粒度一致性与连贯性。
- StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation
- 赛道归属: 视频生成(流式/长视频生成、HOI人-物交互视频生成)
- 核心创新点: 提出面向实时交互场景的低延迟流式HOI视频生成框架,通过“交互感知”的时间记忆自适应机制来组织与更新历史信息:不再将复杂离线强条件HOI管线硬改为流式,而是从图像到视频的流式生成器出发,研究如何在长时序生成中选择、压缩与调度历史记忆,使模型在持续生成时既能保持人-物交互的一致性与可控性,又能在流式推理约束下稳定扩展到长时长视频并降低延迟。
GitHub
- [2026-07-28] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1669 🆕NEW
- [2026-07-28] PurpleDoubleD/locally-uncensored ⭐972 🆕NEW
- [2026-07-29] wordghost1234/agnes-ai-storyboard-studio ⭐154
- [2026-07-28] heygen-com/heygen-cli ⭐102
- [2026-07-28] Ko-Lani/3DreamBooth ⭐60 🆕NEW
音频生成
arXiv
- Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm 🆕NEW
- 赛道归属: 语音生成(TTS)/ 可控语音合成 / 低延迟语音建模
- 核心创新点: 提出面向生产的多阶段协同训练范式,将语言模型(LM)的内容建模与Flow-Matching(FM)的声学生成进行五阶段渐进式联合优化,以同时提升内容一致性、音色相似度、韵律自然度与鲁棒性;引入约12.5Hz低帧率语音tokenizer,在尽量保持音质与可懂度的前提下显著降低序列长度,从而减少推理延迟并提升效率;整体上通过“低帧率离散表征 + 分阶段对齐LM与生成器目标”的系统化设计,实现更强可控性与多语覆盖下的稳定合成。
- Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer
- 赛道归属: 语音生成(TTS)/可控与情感表达语音合成
- 核心创新点: 提出一种可插拔的轻量级“Harness Layer”控制层,以“封闭集合的提示工具路由(prompt-tool routing)”重构TTS风格控制:离线构建带结构化元数据的风格提示工具注册表(style prompt tools registry),在线由LLM规划器根据显式指令与对话上下文选择并调用合适的风格工具,从而将表达性行为从TTS主模型中外置化、可治理化,实现更稳定、可解释且上下文感知的风格/情绪控制,而无需对底层TTS引擎进行大规模改造。
- Singlish, Can or Not? Fine-Tuning and Evaluating Zero-Shot TTS for Singapore English 🆕NEW
- 赛道归属: 语音生成(TTS)/ 口音与方言适配 / Zero-shot TTS微调与评测
- 核心创新点: 针对零样本TTS在区域口音(Singlish)上“保音色但口音被拉回通用英语”的系统性缺陷,提出以小规模、目标口音多说话人数据对现成ZS-TTS进行定向微调的实证路线,并在两类SOTA模型(Chatterbox、CosyVoice 3)上验证其对口音保真度的提升;方法论突破在于将“口音迁移失败”明确分解为可通过领域/口音分布再对齐来修复的问题,并配套建立面向新加坡英语的评测框架与对比基线,使口音适配从主观现象转为可量化、可复现的微调与评估流程。
- StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis
- 赛道归属: 语音生成(文本转语音TTS)/ 低延迟非自回归合成
- 核心创新点: 提出面向移动端的非自回归TTS框架,通过稀疏时间嵌入(Sparse Temporal Embedding)在时间轴上以更稀疏但信息更集中的方式建模对齐与时长,从而在不依赖严格、刚性的NAR对齐假设下,实现对音素时长、发音细节与韵律的细粒度可控;该策略旨在同时缓解传统AR的高延迟/误差累积与常见NAR的韵律僵硬问题,在鲁棒性与实时性之间取得更优折中。
- Staged Depth-Pruning Distillation of a Flow-Matching Text-to-Speech Teacher: A Compact Hindi Speech Synthesizer
- 赛道归属: 文本到语音生成(TTS)/ 模型压缩与蒸馏
- 核心创新点: 提出一种在极低数据预算(约17.6小时印地语语音)下构建小型TTS的可复现配方:以大规模Flow-Matching的DiT教师模型为起点,对学生进行“仅深度剪枝”的分阶段蒸馏。方法上刻意保持教师的宽度、文本嵌入维度、注意力头数以及mel/text输入输出接口不变,使除Transformer block外的张量可一对一拷贝,从而实现从教师到学生的稳定warm-start;再通过逐步减少网络深度(均匀保留block)完成容量压缩,避免小模型在小数据上从零训练直接崩溃,并在保持生成质量的同时显著降低参数量与推理成本。---
- FillGauss: Fine-Grained Filling-Aware Impact Sound Generation for 3D Gaussian Splatting
- 赛道归属: 视听生成(视觉到音频)/物理一致性冲击声生成(3D感知音频生成)
- 核心创新点: 针对3D高斯泼溅(3D Gaussian Splatting)场景下的冲击声合成,引入“细粒度填充状态(filling state)”这一以往3D音频生成忽略但显著影响共振与阻尼的关键物理因素,提出新任务“Fine-Grained Filling-Aware Impact Sound Generation”。方法层面从仅建模外表面几何扩展到对物体内部填充状态进行显式建模与条件化生成,使生成的冲击声在频谱共振、衰减特性等方面更符合真实物理规律,提升对同一几何但不同内部状态物体的可区分与可泛化能力。
- FreyaTTS: A Compact Tokenizer-Free Flow-Matching Transformer for Turkish-First Speech Synthesis
- 赛道归属: 语音生成(文本转语音TTS)/ 扩散-Flow Matching 非自回归建模
- 核心创新点: 提出紧凑、无Tokenizer(tokenizer-free)的Flow-Matching Diffusion Transformer,用条件流匹配(flow-matching)在连续潜空间直接学习“文本→语音潜变量”的映射;通过冻结的AudioVAE2将建模重心从波形/声码器细节转移到文本条件生成,并利用“16k编码、48k解码”的潜空间-重建分工继承高采样率音频质量;整体以较小参数量实现面向对话场景的高可靠、低复杂度非自回归合成范式。
- RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching
- 赛道归属: 文本到语音生成(TTS)/ Flow Matching 生成建模与对齐鲁棒性
- 核心创新点: 提出一种面向对齐错误的训练策略 RobustSpeechFlow,将对比式 Flow Matching 扩展为“增强驱动”的鲁棒学习:在潜变量轨迹上构造长度保持的 repeat/skip 增强,显式模拟真实 TTS 失败模式(跳读、重复)并在训练中进行对比惩罚,从而提升内容保真与对齐稳定性;方法不依赖外部强制对齐器或偏好数据,直接在生成轨迹学习层面增强对齐鲁棒性与零样本说话人相似度/自然度的兼容性。
- UtterTune: LoRA-Based Target-Language Pronunciation Edit and Control in Multilingual Text-to-Speech
- 赛道归属: 语音生成(多语种TTS)/ 参数高效微调与发音可控编辑
- 核心创新点: 提出基于LoRA的轻量适配方法,用于对LLM式多语种TTS进行目标语言发音(G2P/读音)编辑与控制:在不引入显式G2P模块、且尽量不破坏其他语言性能的约束下,通过低秩增量参数将“目标语言的发音规律与韵律偏好”定向注入模型,实现对目标语言读音错误的可控修正与稳定化,同时降低全量微调带来的跨语种遗忘与成本。
- Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis 🆕NEW
- 赛道归属: 多模态语音生成(视觉驱动/辅助TTS)/ 情感与对话式语音合成
- 核心创新点: 将面部表情作为关键情感线索显式引入对话式语音合成,面向“同一句话在不同表情/情绪下应生成不同韵律与表达”的问题,提出更细粒度的面部表情建模以驱动/约束语音生成,从而提升同理性与表达自然度;同时针对缺乏大规模自然对话的语音-视觉配对数据这一瓶颈,强调构建/利用包含语音与视觉模态的对话数据与训练策略,使模型能够学习表情到韵律、语气与情感强度的映射,弥补传统仅用文本/音频条件导致的情感信息缺失。
GitHub
- [2026-07-29] huggingface/diffusers ⭐34173 🆕NEW
- [2026-07-27] SamurAIGPT/Generative-Media-Skills ⭐3927
- [2026-07-28] Stability-AI/stable-audio-tools ⭐3830
- [2026-07-27] BinWang28/audio-ai-hub ⭐950
- [2026-07-27] dgrauet/ltx-2-mlx ⭐85 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-07-18] Manusagents/GPT-5.5-Gemini-3.1-Pro-Grok-4-Claude-Fable-5-Mythos-5-Qwen-3.7-Max-and-more-Distillation-Dataset
HuggingFace Spaces
- owensong/Inflect-v2 🆕NEW
语言大模型
arXiv
- Developing and Validating the Spanish Version of the Large Language Models Dependency Scale (LLM-D12-SP)
- 赛道归属: LLM应用评测与心理测量(人机交互/安全治理)
- 核心创新点: 将“对LLM的心理依赖”从概念层面落到可量化的心理测量工具上,完成LLM依赖量表在西语人群中的跨文化适配与信效度验证;通过系统的心理计量学流程(条目筛选、结构效度/聚合与区分效度、信度与测量等价性等)构建可复用的评估框架,使组织/工作场景中LLM使用带来的依赖风险能够被标准化监测与比较,为后续干预与治理提供可操作的量化指标。
- Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length
- 赛道归属: 大模型评测与基准(自适应测试/推理能力评估)
- 核心创新点: 将传统基于准确率的IRT(Item Response Theory)评测扩展为“延迟-响应”联合建模框架,把Chain-of-Thought长度作为反映推理过程开销/复杂度的关键观测量,与回答正确性一起纳入同一统计模型中进行估计与对比;从而在评测中同时刻画“答对了没有”和“以多长推理链条答对”的能力差异,提升对推理能力与效率权衡的可解释性与区分度,并可与自适应测试流程结合以更高效地测量模型能力。
- RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
- 赛道归属: 大模型对齐(RLHF/DPO改进、偏好建模)
- 核心创新点: 针对DPO在知识密集生成中存在的“冗长/流畅性偏置”导致逻辑正确性被系统性低估的问题,提出Hybrid-DPO的自动化偏好构造管线:将基于自然语言推断/逻辑一致性的判别信号(如DeBERTa类NLI/grounding信号)与偏好学习目标融合,用“逻辑扎根(grounding) + 语言流畅度”双目标共同驱动偏好优化;从方法上缓解仅靠人类或LLM裁判偏好带来的奖励错配,缩小SFT到逻辑对齐之间的“logical alignment gap”。
- Not All LLM Reasoning is Visible in the Chain-of-Thought 🆕NEW
- 赛道归属: 可解释性与AI安全(链式思维/隐式推理评估)
- 核心创新点: 揭示“链式思维并不等于模型全部推理”的具体失效模式:在合成推理任务中向输出中插入语义无关的填充token(filler tokens)可显著提升多款前沿模型的正确率(最高提升约13个百分点),表明模型可能在不可见的内部表征/隐式轨迹中完成关键推理,而表面CoT仅是部分或事后合理化的文本外显;并通过跨13个模型、三类任务的系统评测,将“不可见推理”从概念讨论落到可复现实证与可量化对比,为安全审计与可解释性评估提出新的对抗/探针范式(用无关token作为干预变量检测推理外显性)。
- LLM-Guided Transportation Hub Capacity Planning with Textual Business Inputs
- 赛道归属: LLM智能体决策与运筹优化(自然语言驱动的规划/决策)
- 核心创新点: 提出一种将“定性商业语境”注入传统枢纽容量规划的LLM代理框架:通过链式思维协议把自然语言业务描述转写为结构化“决策表”,显式建立“语境条目→容量调整动作”的可追溯映射;并采用迭代式提案-修正流程,让LLM在每轮基于语境与当前方案生成可执行的容量决策,从而弥合仅能处理量化输入的经典优化模型与真实业务文本约束之间的鸿沟。
- Learning to Make Friends: Coaching LLM Agents toward Emergent Social Ties
- 赛道归属: 多智能体LLM仿真与社会行为建模(Agent学习/记忆机制)
- 核心创新点: 提出一个多智能体LLM在线互动仿真框架,使智能体在“反复互动—相互评价—行为调整”的闭环中形成可涌现的社会关系;关键方法是在纯in-context学习的基础上引入“教练信号(coaching)”加速行为更新,并配套设计面向人类社交动力学(如同质性、互惠、社会认同/验证)的行为规则与记忆/偏好表征,使社会纽带的形成可被机制化地诱导与分析,而非仅靠静态提示或一次性设定。
- Efficient LLM-Generated Shuttling Compilers for Complex Trapped-Ion Architectures 🆕NEW
- 赛道归属: LLM代码生成与程序合成(科学计算/量子编译器自动化)
- 核心创新点: 证明单一前沿LLM可从自然语言规格出发生成并迭代完善“可运行的完整Python编译器代码”,面向复杂离子阱(trapped-ion)架构的shuttling编译问题;方法上强调端到端的“规格→实现→测试/修复→扩展”闭环:先构建线性分段离子阱编译器,再扩展到含junction的更复杂拓扑,并进一步追求编译效率,展示LLM在工程级算法系统(非单函数/片段)上的持续重构与架构迁移能力,为“LLM生成领域专用编译器/优化器”的可行路径提供了首个系统化案例。
- SIREN: Towards End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents 🆕NEW
- 赛道归属: LLM智能体(Agent)与多步骤工作流自动化(气象预警/决策支持)
- 核心创新点: 提出面向极端天气“预警到行动”全链路的端到端Agent框架SIREN,核心在于“经验落地(experience-grounded)”的智能体设计:不再只做孤立科学子任务,而是将预警流程中相互依赖的环节(信息收集、研判、沟通、行动建议等)串联为可执行的多阶段协作链,并用可复用的经验/案例来约束与校准Agent在真实业务语境下的决策与表达,从而提升可扩展性与落地性,降低对高成本专家工作流的依赖。
- LLM-SoccerArena: Benchmarking LLMs on Real-World Predictions in Sports 🆕NEW
- 赛道归属: LLM评测与基准(预测/不确定性下的真实世界决策)
- 核心创新点: 构建“前瞻式、在线、实时”的体育赛事预测基准LLM-SoccerArena,突破以往静态回顾式benchmark无法检验“面向未来的不确定性综合能力”的局限;通过持续更新的真实赛程与信息流,将评测从离线问答转为“给定当下信息→预测未来结果”的过程性考核,使模型在信息整合、概率判断、时效性与鲁棒性上的能力可被长期、可追踪地量化比较,并以公开网站形态提供可复现实验与对照。
- Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families 🆕NEW
- 赛道归属: LLM智能体对齐与运行时控制(安全/稳健性/情绪与行为调节)
- 核心创新点: 提出Gubernaut认知控制器(GCC),作为模型无关的运行时控制层,用确定性的“稳态(homeostatic)”机制在Nelson–Narens监控-控制闭环中调节Agent的行为倾向,针对挑衅下升级、奉承下漂移、卡住后反刍等“倾向性失效”(propensity failures)进行在线抑制;其方法论突破在于将对齐从训练期转向可插拔的推理期控制:通过可解释、可复现的确定性控制策略对输出进行动态约束/纠偏,并在不同模型家族上验证可迁移有效性,强调跨模型一致的运行时安全治理。
GitHub
- [2026-07-29] sgl-project/sglang ⭐30880 🆕NEW
- [2026-07-29] NVIDIA-NeMo/Speech ⭐17831
- [2026-07-29] huhusmang/Awesome-LLMs-for-Vulnerability-Detection ⭐1198
- [2026-07-29] flagos-ai/FlagGems ⭐1057
- [2026-07-29] chrisliu298/awesome-on-policy-distillation ⭐572
HuggingFace Models
HuggingFace Datasets
- [2026-07-29] HuggingFaceCode/stack-v3-train
- [2026-07-22] r0b0tlab/qwen3.8-max-distillation-50k
- [2026-07-29] greghavens/kimi-k3-coding-and-debugging-traces
- [2026-06-29] Glint-Research/Fable-5-traces
- [2026-07-16] ianncity/GLM-5.2-Conversation
- [2026-07-27] moonshotai/PerceptionBench 🆕NEW
多模态大模型
arXiv
- One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models
- 赛道归属: 多模态安全与机器遗忘(Vision-Language Models Unlearning)
- 核心创新点: 首次对VLM中的“跨模态遗忘迁移”进行系统、双向(文本→视觉、视觉→文本)研究,覆盖三类主流跨模态连接架构(MLP投影、Q-Former、门控交叉注意力),用统一实验框架量化“在一个模态执行unlearning是否会在另一模态同步生效”的程度与不对称性;进一步从架构耦合方式与表示共享机制角度揭示迁移失败/有限迁移的关键因素,为后续设计“单模态触发、跨模态一致清除”的unlearning策略提供了可操作的诊断基准与方法学依据。
- SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing
- 赛道归属: 遥感多模态理解(UAV视频理解/语言条件分割)
- 核心创新点: 面向无人机遥感视频中“小目标、外观歧义、视角动态变化”导致的细粒度理解难题,提出SkyVLaM这一UAV视频多模态大模型框架,将视频时序信息与语言条件分割能力进行模型级整合,以“语言驱动的目标级分割/定位”作为核心能力接口来提升对细粒度目标的可解释理解;通过针对UAV视频场景的建模与训练设计,强化模型在动态航拍视角下的时空一致目标理解与指令跟随分割表现。
- GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models
- 赛道归属: 多模态理解(3D空间感知增强/几何对齐预训练)
- 核心创新点: 提出GAP-MLLM的“几何对齐预训练”范式,针对MLLM在纯RGB输入下3D空间感知弱的问题,指出瓶颈并非缺少几何先验,而是训练范式错配(文本主导微调难以激活/对齐几何表征);通过在预训练阶段引入显式的几何对齐目标/约束,使视觉表征与3D几何关系在表示空间中可被语言推理有效调用,从而在不依赖显式3D输入的前提下显著提升空间关系理解、方位/深度等3D感知相关能力。
- GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
- 赛道归属: 多模态理解 / 视频分析推理
- 核心创新点: 提出 GHR-VLM 框架,将视觉语言模型(VLM)与传统监督视觉模型相结合,通过"视觉接地混合推理"机制实现零样本公交视频分析。核心突破在于:无需任务特定标注数据,通过混合推理架构(Grounded Hybrid Reasoning)协同利用监督模型的精确感知能力与 VLM 的语义理解能力,将长视频分析分解为可靠的结构化子任务,有效解决了 VLM 直接处理长视频时存在的不稳定性和高成本问题,实现了对公交车载视频的零样本细粒度分析(如乘客行为统计等)。
- CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding 🆕NEW
- 赛道归属: 长视频多模态理解与工具增强推理(自适应推理/证据检索)
- 核心创新点: 提出训练无关(training-free)的置信度感知动态证据推理框架:先基于模型输出置信度/不确定性对问题难度进行判别,再自适应地决定是否触发以及如何分配工具调用与时序证据检索粒度;对困难样例引入更细粒度的时间证据定位与迭代式证据聚合,提升长视频问答的可控性与可靠性,同时避免对简单样例的过度工具开销,实现“按需推理”的推理路径调度。
- MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning 🆕NEW
- 赛道归属: 垂直领域视频多模态理解(海洋事件理解)与视觉工具推理
- 核心创新点: 面向海洋视频的事件中心(event-centric)理解范式,引入“视觉工具推理”以弥补通用VLM在视频时序建模与领域知识上的不足:通过工具化的视觉分析模块(如事件候选定位、关键帧/片段检索、属性与行为线索抽取等)为VLM提供可验证的中间证据,并围绕事件结构进行组织与推理,从而在标注稀缺、领域专业性强的场景下提升事件识别/描述的准确性与可解释性。
- Development of Vision-Language Model-based GNSS Spoofing Detection for Autonomous Vehicle Navigation 🆕NEW
- 赛道归属: 多模态安全与鲁棒感知(自动驾驶GNSS欺骗检测)/跨模态传感器融合
- 核心创新点: 首次将视觉-语言模型用于GNSS欺骗检测的多模态融合框架:将前视摄像头视觉线索与车载动态传感器读数(速度、加速度、横摆角速度等)进行语义化对齐,并与GNSS推导的车辆机动/轨迹一致性进行对比推理;通过VLM的跨模态一致性判断与解释能力,把“视觉可见的运动/场景变化”与“GNSS报告的运动状态”之间的不一致显式化,从而实现对隐蔽重定向类攻击的检测与可解释告警。
- MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction
- 赛道归属: 多模态理解(评测基准/Benchmark,面向可视化界面生成与代码生成)
- 核心创新点: 提出面向“协调多视图(coordinated multi-view)可视化界面构建”的专用评测基准 MV-Bench,将评测从传统单图表生成扩展到更贴近真实可视化开发流程的多视图联动场景;评测重点覆盖多视图之间的数据语义一致性、视图间协调关系(如共享筛选/联动高亮等)以及交互逻辑的联合推理与代码生成能力,从而系统性暴露现有 MLLM 在复杂可视化界面构建任务中的能力缺口与失败模式。---
- Continual Video-MLLM Adaptation over Evolving Domains
- 赛道归属: 多模态理解(视频理解)/ 持续学习与域自适应
- 核心创新点: 面向“视频数据按时间持续流入且域分布不断演化”的真实部署场景,聚焦Video-MLLM在顺序多域适配中的灾难性遗忘与跨域干扰问题;相较于以往依赖共享适配空间(易导致不同域更新相互污染)的做法,该工作提出更适合“域持续扩展”的适配范式,通过降低跨域参数耦合/干扰来实现新域知识增量吸收,同时尽量保持旧域视频理解能力稳定,从方法层面强化了Video-MLLM的持续适配能力。
- MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts
- 赛道归属: 多模态理解(视觉-语言模型评测)/ 鲁棒性与幻觉诊断
- 核心创新点: 提出专门针对“缺失关键部件的物体”这一细粒度失败模式的评测基准MissingBench-Verified,用以系统性探测VLM在部件缺失检测上的能力缺口;该基准将问题从泛化的幻觉评测细化为“应当识别缺失但模型倾向于基于常识补全”的可验证场景,并通过验证机制提升标注与结论可靠性,从而更精准地区分模型的真实视觉证据利用能力与由先验知识偏置导致的错误补全,为后续针对性数据构造与训练/对齐提供可操作的诊断工具。
GitHub
- [2026-07-28] Blaizzy/mlx-vlm ⭐5266 🆕NEW
- [2026-07-29] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1754
- [2026-07-28] zli12321/Vision-Language-Models-Overview ⭐682
- [2026-07-28] gokayfem/ComfyUI_VLM_nodes ⭐576 🆕NEW
- [2026-07-27] tim-learn/Awesome-LabelFree-VLMs ⭐92
强化学习
arXiv
- LA-RL: Label-Aware Self-Reflection for Reinforcement Learning in Information Extraction 🆕NEW
- 赛道归属: 多模态/LLM信息抽取的强化学习对齐(结构化IE、反思式RL)
- 核心创新点: 提出LA-RL(Label-Aware Reflective RL)将“自我反思”从自由文本纠错对齐到结构化抽取空间:用结果监督把错误细分为缺失span、标签错误、边界不匹配、关系类型非法、论元顺序颠倒等可操作的失败类型,并据此生成面向标签/结构约束的反思与修正信号;通过将反思过程显式绑定到结构化输出的可验证属性,提升纠错的可定位性与可学习性,避免仅“指出有错但无法精确修复”的反思失配问题。
- Interpret Policies in Deep Reinforcement Learning using SILVER with RL-Guided Labeling: A Model-level Approach to High-dimensional and Multi-action Environments
- 赛道归属: 强化学习可解释性(策略解释/归因分析)
- 核心创新点: 在SILVER的Shapley回归式策略解释框架上,引入“RL-guided labeling”机制,将策略自身的多动作输出纳入标注/约束生成过程,从而把原本受限于低维、二元动作的解释方法扩展到高维观测与多动作空间;通过利用策略行为来引导解释模型的样本构造与边界设定,提升在复杂环境下的可解释性适用范围与稳定性。
- MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models
- 赛道归属: 强化学习用于大模型推理后训练(参数高效RL/多智能体辩论)
- 核心创新点: 提出MADA-RL后训练框架,将紧凑模型拆分为生成器与评论家两种角色,并用“辩论感知”的学习信号进行强化学习式优化;核心方法突破在于构造反事实(counterfactual)辩论/评估信号来降低训练噪声、强化可归因的改进方向,同时仅通过LoRA适配器微调少量参数,实现低预算下对小模型推理能力的有效专门化。
- RL-Struct: A Lightweight Reinforcement Learning Framework for Reliable Structured Output in LLMs
- 赛道归属: 大语言模型对齐与结构化输出(RLHF/GRPO、可靠生成)
- 核心创新点: 提出 RL-Struct,用无critic的GRPO(Gradient Regularized Policy Optimization)替代PPO式actor-critic以降低训练与显存开销,并设计分层奖励函数将“结构满足(schema/语法)”与“内容质量/字段有效性”等目标解耦、分级约束,从而直接缩小LLM概率生成与确定性schema需求之间的“结构鸿沟”。在复杂JSON生成上以更轻量的训练代价显著提升结构准确率与有效性,并通过去除critic实现更低峰值VRAM占用。
- Evaluating Fuzz Testing for Reinforcement Learning Agents 🆕NEW
- 赛道归属: 强化学习安全与鲁棒性评测(RL智能体Fuzz测试/测试基准)
- 核心创新点: 聚焦“RL fuzzing如何被公平、可复现地评估”的方法学缺口,系统化梳理并统一不同RL模糊测试方法在实验设置、基线选择与指标定义上的差异,构建可对齐的评测框架/协议以减少结论不可比问题;强调以覆盖/失效发现能力、触发条件多样性、崩溃/违规复现性等更贴近安全部署的指标来评价fuzzing有效性,从而把“提出新fuzzer”推进到“可验证、可对比的安全测试科学”。
- ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning 🆕NEW
- 赛道归属: LLM强化学习训练系统与推理优化(训练-推理一致性/稳定性)
- 核心创新点: 提出ACRL,通过“自适应控制训练-推理差异(training-inference discrepancy)”来稳定LLM的RL训练:将不稳定根因归结为训练/推理引擎架构割裂与推理侧低精度量化带来的数值分布偏移,并引入机制在训练过程中动态调节/约束这种差异(而非仅在训练端做算法补丁);核心突破在于把系统层面的精度与引擎不一致显式纳入RL优化闭环,用可控的差异管理降低梯度/奖励估计的漂移,从而提升训练稳定性与可部署一致性。
- Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习理论与函数逼近(在线离策略RL、Q函数建模/稀疏表示)
- 核心创新点: 提出基于稀疏高斯混合模型Q函数(S-GMM-QFs)的在线离策略策略迭代框架:用Hadamard过参数化实现可解释的稀疏化(通过平滑正则诱导混合成分/参数选择),并结合参数空间的黎曼几何结构进行优化,以更好地处理流式、非平稳数据下的稳定更新;同时通过经验回放缓解分布失配,使“在线+离策略+非平稳”场景下的Q函数学习兼具表达力(GMM)与可控复杂度(稀疏化)及几何一致的优化路径。
- Label-free Industrial Fault Detection via Adversarial Inverse Reinforcement Learning: A System for Run-to-Failure Prognostics 🆕NEW
- 赛道归属: 工业时序/设备健康管理的强化学习(无标签故障检测、逆强化学习/对抗IRL)
- 核心创新点: 将工业故障检测从常见的“伪RL的静态CB分类”提升为真正的序列决策建模:显式利用状态转移与时间折扣刻画退化过程,并提出对抗式逆强化学习在无故障标签条件下学习隐式奖励/健康度信号,用于run-to-failure预测与故障检测;方法论突破在于用AIRL式的奖励辨识替代监督标签,借助对抗学习从运行轨迹中抽取可泛化的退化驱动因素,实现面向寿命周期的序列化诊断与预后。
- Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs
- 赛道归属: 大语言模型对齐与强化学习(RLHF/RLAIF)、模型合并(Model Merging)分析
- 核心创新点: 系统性研究并量化对比不同训练范式(如SFT与RL)对模型合并效果的影响,聚焦“多任务/多能力合并时的任务冲突”这一关键瓶颈;通过全面实验与分析揭示RL在缓解合并后任务冲突、提升能力兼容性方面的作用机制与适用边界,为后续设计更可合并(merge-friendly)的对齐训练流程与合并策略提供可操作的经验规律与诊断框架
- Expert Behavior Prior Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习中的离线到在线迁移(行为先验RL、示范驱动的样本效率提升)
- 核心创新点: 提出“专家行为先验强化学习”,针对传统BPRL依赖静态离线示范集(多样性不足、轨迹质量参差)导致先验失效与在线训练不稳的问题,引入可随在线交互更新/校准的专家行为先验机制:在利用示范提供的策略先验进行高效探索与初始化的同时,增强对先验偏差与次优示范的鲁棒性,平衡“先验利用(exploitation)”与“在线修正(adaptation)”;核心在于把先验从静态约束升级为可适配的行为分布建模,从而提升在线阶段稳定性与样本效率。
GitHub
- [2026-07-28] huggingface/trl ⭐18956
- [2026-07-29] OpenPipe/ART ⭐10542
- [2026-07-29] natolambert/rlhf-book ⭐2220
- [2026-07-29] radixark/miles ⭐1808 🆕NEW
- [2026-07-28] MushroomRL/mushroom-rl ⭐939 🆕NEW
HuggingFace Datasets
- [2026-07-21] SupraLabs/reasoning-corpus-4K-5M-v1
世界动作模型
arXiv
- From World Models to World Action Models: A Concise Tutorial for Robotics 🆕NEW
- 赛道归属: 机器人世界模型/世界动作模型(World Action Model)综述与统一框架(多模态表征学习 + 模型式强化学习/规划)
- 核心创新点: 以“教程+统一视角”而非传统综述的方式,系统澄清机器人语境下“world”的构成要素,并给出世界模型(World Model)与世界动作模型(World Action Model)的明确定义与边界;进一步提出一个可对齐比较的统一分析框架,用同一套维度刻画不同路线(如空间智能模型、JEPA 等)在表征形态、预测目标(状态/潜变量/能量或一致性目标)、动作条件化方式、以及在机器人系统中承担的功能位置(感知表征、预测、规划/控制接口)上的差异,从而把分散的研究范式映射到可复用的设计空间,帮助研究者更直接地定位“从世界模型到可执行动作的世界动作模型”所需的关键模块与接口设计。
GitHub
- [2026-07-28] OpenMOSS/Awesome-WAM ⭐1188 🆕NEW
- [2026-07-24] serene-sivy/AHA-WAM ⭐79
由 Research Daily 自动生成 生成时间: 2026-07-29 01:46:41