AI 每日进展速报 - 2026-07-22
新旧
正在统计...
来源
当前筛选条件下没有条目。
图像生成/编辑
arXiv
- Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation
- 赛道归属: 文生图 / 自回归图像生成 / 样本多样性优化
- 核心创新点: 针对文生图任务中样本多样性坍塌问题,提出Cluster Truncation方法应用于自回归(AR)图像生成模型。其核心思路是在自回归解码阶段对token预测分布进行聚类截断,通过保留分布中多个语义聚类而非简单的top-k/top-p截断,从根本上扩大采样空间,在维持图像质量的同时显著提升样本多样性,推动AR模型在质量-多样性Pareto前沿上超越扩散模型。
- MixDiffusion: Mixing Diffusion-based Uni-condition Text-to-Image Generation Models for Multi-condition Image Synthesis 🆕NEW
- 赛道归属: 文生图(多条件可控生成 / 扩散模型推理框架)
- 核心创新点: 提出一种无需训练(training-free)的多条件扩散生成框架,通过在推理阶段对多个“单一条件控制”的T2I扩散模型进行可组合的混合(mixing),实现对任意数量、任意类型控制条件的统一支持;方法层面强调对不同条件分支的融合机制与理论可扩展性,使多条件约束在同一次采样过程中协同生效,而不依赖重新训练多条件ControlNet式模型。
- UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图安全(NSFW检测与缓解 / 扩散模型安全对齐)
- 核心创新点: 提出统一的“噪声驱动”检测与缓解框架,将扩散模型生成过程中的噪声/去噪动态作为关键信号,用于识别隐式性暗示(implicit sexual prompts)而非仅依赖显式词表或生成后图像判别;并在同一框架内给出对应的生成期干预/抑制策略,实现从“意图检测”到“生成抑制”的闭环,针对隐式提示与对抗token导致的偏置触发提供更鲁棒的防护路径。
- CoBind: Stage-Aware Compositional Binding for Training-Free Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图(复杂提示组合生成 / 训练免提示遵循增强)
- 核心创新点: 提出训练免的阶段感知(stage-aware)组合绑定(compositional binding)机制,显式建模“属性-实体-关系”的归属与绑定,而不是仅做token级注意力增强;核心在于根据扩散去噪的不同阶段,分阶段施加不同约束(例如先布局/关系后细节属性),从而减少多实体场景中的漏物体、属性串绑、空间关系颠倒等典型失败,实现更稳定的复杂指令遵循。
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- 赛道归属: 文生图 / 推理优化(CFG蒸馏加速)
- 核心创新点: 针对现有CFG蒸馏方法中"盲注入"范式(全局静态引导强度)的局限,提出基于信息瓶颈(Information Bottleneck)理论的自适应CFG蒸馏框架IB-Flow。其核心突破在于:将信息瓶颈原理引入扩散模型的引导强度分配,实现对不同去噪步骤和不同语义区域的细粒度、动态化引导强度调节,而非传统的全局均一施加;通过最小化冗余引导信息、最大化与目标语义的互信息,在少步推理(few-step)场景下同时兼顾生成质量与文本对齐,从方法论上将CFG蒸馏从粗粒度升级为信息论驱动的精细化压缩范式。
- Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
- 赛道归属: 文生图 / 强化学习对齐 / 奖励模型设计
- 核心创新点: 提出SpectraReward,一种无需额外训练的零样本奖励函数,将预训练多模态大语言模型(MLLM)直接复用为文生图强化学习的奖励信号。创新点在于将奖励计算转化为"反向阅读"任务——通过单次图像条件下的teacher-forced前向推理,衡量原始文本提示能否从生成图像中被准确还原,以图像条件下的提示平均对数似然作为奖励分数,无需任何判别式微调或问题分解,实现奖励模型的零样本复用。
- Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing 🆕NEW
- 赛道归属: 图像编辑安全(人脸身份保护 / 多模态统一编辑模型防护)
- 核心创新点: 针对统一多模态图像编辑模型(UMMs)存在多视觉分支处理路径、导致传统对抗保护迁移失效的问题,提出以跨分支冲突(cross-branch conflict)为核心的身份防护思路:在特征层面刻意诱导不同视觉分支对人脸身份表征产生不一致,从而在编辑/生成链路中形成“盾牌”,降低未授权的人像篡改与身份保持编辑的成功率;方法重点在于面向UMM结构特性设计可迁移、可触发的防护扰动/机制,而非单一路径的对抗噪声。
- Latent-Identity Tuning in Text-to-Image Personalization Models
- 赛道归属: 文生图 / 图像个性化 / 人脸身份精细化编辑
- 核心创新点: 提出Latent-Identity Tuning方法,专门针对文生图个性化模型中的高精度人脸身份调整场景。区别于传统图像编辑(操作已有图像),该方法在潜在空间中对身份表征进行精细化调整,修改的是模型对特定人物的身份隐式表达,从而支持在保持整体生成能力的前提下对人脸细粒度属性(如面部特征、年龄等)进行精准、可控的编辑,突破了通用文生图模型在细粒度人脸编辑上精度不足的瓶颈。
- Decomposing Subject-Driven Image Generation via Intermediate Structural Prediction
- 赛道归属: 文生图(主体驱动/个性化生成、结构-外观解耦)
- 核心创新点: 提出两阶段的“结构先行”生成范式,将主体驱动生成从直接RGB生成中解耦出来:第一阶段先进行中间结构预测(以Canny边缘图作为显式结构表征),第二阶段在“源外观特征 + 预测结构”的双条件下进行渲染生成。该设计通过显式约束几何与轮廓,显著提升大幅编辑场景下的高频身份细节保持能力(如logo、纹理、文字等),并通过面向文本细节的专门处理机制增强文字/图案的可控与可读性,缓解传统端到端RGB生成在细节处易退化的问题。
- Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models 🆕NEW
- 赛道归属: 文生图安全(越狱攻击 / 红队评测与攻防)
- 核心创新点: 提出“动态防御画像(Dynamic Defense Profiling)”驱动的认知型越狱框架,不再把模型反馈简化为成功/失败二值信号,而是利用多种失败模式(如被拒、被过滤、内容被弱化等)所携带的细粒度防御状态信息来反推防护策略并自适应调整攻击;方法论突破在于将越狱过程建模为对防御机制的在线探测与策略更新,从而更高效地绕过NSFW安全护栏,揭示现有防御在“反馈可被利用”层面的系统性风险。
GitHub
- [2026-07-22] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐12914
- [2026-07-21] Osmantic/ODS ⭐3414
- [2026-07-22] AceDataCloud/Nexior ⭐379
- [2026-07-21] etkecc/baibot ⭐237 🆕NEW
- [2026-07-21] Asilcanasil/Hent-AI-Synthesis-Engine ⭐152
视频生成/编辑
arXiv
- Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models 🆕NEW
- 赛道归属: 视频生成安全/对抗攻防(Text-to-Video Jailbreak)
- 核心创新点: 针对T2V黑盒越狱中“沿用文生图攻击导致时序信息利用不足、且需要高查询优化成本”的痛点,提出利用视频生成固有的时间一致性作为攻击杠杆:通过在跨帧保持稳定的对抗提示/约束,使不安全语义在时间维度上被持续强化与传播,从而在更少查询、更贴近真实部署的黑盒条件下提升越狱成功率;方法论上把“时序一致性”从生成质量指标转化为可被利用的攻击面。
- M4V: Multimodal Mamba for Efficient Text-to-Video Generation
- 赛道归属: 视频生成 / 高效架构设计
- 核心创新点: 提出基于Mamba架构的多模态文生视频框架M4V,以线性时间复杂度替代Transformer的二次方复杂度,专门针对视频生成中长序列时空建模的计算瓶颈进行突破。核心创新在于将Mamba的线性序列建模能力与多模态条件注入机制相结合,在保持生成质量的同时显著降低时空序列处理的计算开销,为大规模视频生成提供更高效的基础架构范式。
- When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation 🆕NEW
- 赛道归属: 视频生成对齐/偏好优化(Text-to-Video Preference Optimization)
- 核心创新点: 识别并形式化“物理偏好 vs 语义一致性”的系统性冲突:传统物理偏好标注往往只比较两段视频的动力学优劣,却不判断其是否忠实于文本语义,导致优化会偏向物理合理但语义跑偏。提出物理-语义联合的直接偏好优化框架,在偏好学习目标中显式引入语义约束/过滤或联合判别机制,使物理改进只在满足文本语义的可行域内进行,从训练目标层面缓解两类偏好信号的梯度对冲与偏置。
- Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation
- 赛道归属: 文生视频(Text-to-Video Generation)
- 核心创新点: 提出 Shell-LCC 方法,核心洞察是将训练数据的流形结构(data manifold)本身作为隐式奖励模型使用,无需额外的奖励模型或人工标注。通过显式建模高质量监督数据的流形结构(Shell 层次化局部一致性约束),在扩散模型训练中引导生成结果向数据流形靠近,从而在不引入额外计算开销的情况下提升生成内容的真实感和局部细节质量,突破了传统 RLHF/DPO 方案依赖外部信号的瓶颈。
- When Cultures Move: Measuring and Improving Multicultural Text-to-Video Generation 🆕NEW
- 赛道归属: 视频生成评测与文化对齐(Multicultural Text-to-Video)
- 核心创新点: 面向“单提示多文化表达”这一未充分研究的能力,提出MAVEN多智能体提示精炼:将提示分解为人物(Person)、动作(Action)、地点(Location)等维度,由专门代理并行/串行地重写与约束提示,减少文化要素在生成中被稀释或误配;同时配套系统化评测设定以量化文化保真度与跨文化组合的失败模式。方法突破在于用可组合的结构化提示分解与代理协作,把文化对齐从单一提示工程提升为可控的流程化优化。
- Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation 🆕NEW
- 赛道归属: 身份保持视频生成/视频生成条件控制(Sequential-Action T2V)
- 核心创新点: 针对带时间戳动作序列的身份保持生成(同一主体跨多动作、跨时间保持可识别性)提出关键帧锚定的身份保持机制:以关键帧作为身份“锚点”在时序上提供强约束,并将后续帧的生成对齐到锚定身份表征,从而在动作切换、姿态变化和长时序条件下抑制身份漂移;方法论上把身份一致性从逐帧弱约束提升为“关键帧—序列传播”的结构化约束方式,更适配分段动作脚本输入。
- Video Generation Models are General-Purpose Vision Learners
- 赛道归属: 视频生成 / 通用视觉表征学习
- 核心创新点: 提出将大规模文本-视频生成作为计算机视觉通用预训练范式(GenCeption),核心主张是视频生成模型天然习得丰富的时空先验、视觉-语言对齐能力及良好的可扩展性,可作为视觉领域类比NLP中"下一Token预测"的统一预训练催化剂。方法论突破在于将生成式预训练目标与判别式视觉理解任务统一,验证了视频生成模型作为通用视觉基础模型的可行性,而非仅作为内容创作工具。
- ShotPlan: Cinematic Video Generation with Learnable Planning Token 🆕NEW
- 赛道归属: 电影化多镜头视频生成/视频生成规划(Cinematic Multi-shot T2V)
- 核心创新点: 为解决多镜头叙事中缺乏显式镜头规划的问题,提出在视频扩散模型上引入可学习的规划token(planning token),用于编码镜头级的转场线索与构图/节奏意图,并在生成过程中作为可插拔条件注入,实现从“单镜头生成”到“多镜头有计划生成”的范式升级;关键突破在于用可学习的离散/连续token承载镜头计划,使规划与生成端到端协同优化,而非依赖外部脚本或手工规则。
- PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation 🆕NEW
- 赛道归属: 物理可控视频生成/Agent式生成控制(Physics-grounded T2V)
- 核心创新点: 针对“VLM一次性生成物理规格→驱动仿真”易误译用户意图、难覆盖细粒度动力学与长时序轨迹的问题,提出反思式Agent物理控制(PhysAgent):以代理循环方式生成—执行—评估—修正物理规格/仿真参数,在反馈中逐步逼近可执行且符合意图的物理过程,再用仿真结果作为强物理先验指导视频合成;方法论突破在于把物理控制从one-shot预测改为可迭代自校正的闭环规划,显著提升复杂运动与时序结构下的物理可信度与可控性。
- FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation
- 赛道归属: 视频生成(扩散Transformer推理优化 / 稀疏注意力加速)
- 核心创新点: 提出一种训练无关(training-free)的自适应稀疏注意力系统,针对视频扩散Transformer在长时空序列下自注意力成为主要瓶颈的问题,通过Top‑p路由实现稀疏化以降低计算/显存开销;关键突破在于识别并解决多GPU序列并行下“每个head稀疏度自适应导致负载不均”引发的rank级拖尾(straggler)问题,引入运行时负载均衡机制在不改模型、不再训练的前提下重分配/调度注意力计算,使稀疏注意力在分布式执行中获得稳定且可扩展的端到端加速。
GitHub
- [2026-07-21] Anil-matcha/Open-Generative-AI ⭐24233 🆕NEW
- [2026-07-22] hao-ai-lab/FastVideo ⭐3865
- [2026-07-21] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1619
- [2026-07-21] wordghost1234/agnes-ai-storyboard-studio ⭐154
- [2026-07-22] yuanze-lin/IllumiCraft ⭐121 🆕NEW
音频生成
arXiv
- Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer 🆕NEW
- 赛道归属: 语音生成(TTS)/可控与情感表达语音合成
- 核心创新点: 提出一种可插拔的轻量级“Harness Layer”控制层,以“封闭集合的提示工具路由(prompt-tool routing)”重构TTS风格控制:离线构建带结构化元数据的风格提示工具注册表(style prompt tools registry),在线由LLM规划器根据显式指令与对话上下文选择并调用合适的风格工具,从而将表达性行为从TTS主模型中外置化、可治理化,实现更稳定、可解释且上下文感知的风格/情绪控制,而无需对底层TTS引擎进行大规模改造。
- FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation
- 赛道归属: 文生音频(Text-to-Audio Generation)/ 扩散模型推理加速
- 核心创新点: 提出FdAudio框架,在预训练的文生音频模型基础上进行后训练(Post-Training),核心突破在于:不再像MeanAudio那样单纯回归目标速度场,而是通过多表示空间的Fréchet距离直接优化单步生成的最终分布质量。该方法将MeanFlow锚定机制与分布级别的优化目标相结合,填补了单步生成与多步采样之间的质量鸿沟,在保持单步推理速度的同时显著提升生成保真度。
- Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space
- 赛道归属: 视频生成音频(Video-to-Audio Generation)
- 核心创新点: 提出Flowley,一种端到端单阶段训练的视频生成音频框架。核心突破在于直接在潜在空间(Latent Space)中实现跨模态对齐(Cross-Modal Alignment),无需多阶段训练或将视觉输入转换为文本中间表示,从而在保留细粒度时序线索的同时显著降低计算成本。通过将视觉与音频特征在潜在空间中直接对齐,实现了语义一致性与时序同步性的统一优化。
- Fr\'echet Distance Loss on Speech Representations for Text-to-Speech Synthesis
- 赛道归属: 文本转语音(Text-to-Speech Synthesis)/ 扩散模型训练优化
- 核心创新点: 提出语音表示弗雷歇距离损失(SR-FD Loss),作为一种训练时的分布正则化器,引入到无分词器的流匹配自回归TTS模型微调中。核心突破在于打破了传统TTS仅依赖局部目标(如条件流匹配、重建损失等)的范式,通过在训练阶段引入分布级别的约束,显式要求模型生成的语音分布向高质量真实语音分布对齐,从而解决了局部损失无法感知全局分布质量的根本缺陷。
- Efficient Text-to-Audio Generation via Pruning
- 赛道归属: 文本生成音频(Text-to-Audio Generation)/ 推理优化
- 核心创新点: 针对基于扩散模型的文本生成音频系统AudioLDM,系统性地分析U-Net卷积块中的参数冗余,提出基于滤波器剪枝(Filter Pruning)的策略以降低模型推理计算开销。核心突破在于将结构化剪枝方法迁移应用至音频潜扩散模型的U-Net骨干网络,在保持感知质量与语义一致性的同时,显著减少计算量,为扩散式音频生成模型的轻量化部署提供了方法论依据。
- VoxENES 2026: Benchmarking Generalization of Speech Spoofing Detectors Against LLM-Era TTS and Voice Conversion
- 赛道归属: 语音生成安全评估 / TTS反欺骗检测基准
- 核心创新点: 提出VoxENES 2026双语(英语+西班牙语)基准数据集,专门针对LLM时代TTS与语音转换系统所产生的新型合成语音,系统性地评估现有反欺骗检测器的时序泛化能力(Temporal Generalization)。核心贡献在于揭示并量化了传统基准与现代LLM驱动合成语音之间的"时代鸿沟",包含53,628个样本、覆盖10种当代语音合成方法及真实后处理条件,为检测器在实际部署场景下的鲁棒性评估提供了更严格的现实基准。
- FillGauss: Fine-Grained Filling-Aware Impact Sound Generation for 3D Gaussian Splatting 🆕NEW
- 赛道归属: 视听生成(视觉到音频)/物理一致性冲击声生成(3D感知音频生成)
- 核心创新点: 针对3D高斯泼溅(3D Gaussian Splatting)场景下的冲击声合成,引入“细粒度填充状态(filling state)”这一以往3D音频生成忽略但显著影响共振与阻尼的关键物理因素,提出新任务“Fine-Grained Filling-Aware Impact Sound Generation”。方法层面从仅建模外表面几何扩展到对物体内部填充状态进行显式建模与条件化生成,使生成的冲击声在频谱共振、衰减特性等方面更符合真实物理规律,提升对同一几何但不同内部状态物体的可区分与可泛化能力。
- Data Augmentation for L2 English Speaking Assessment using TTS
- 赛道归属: TTS数据增强 / 第二语言(L2)口语自动评估
- 核心创新点: 针对L2英语口语评估中标注语音数据稀缺的痛点,提出利用TTS与声音克隆技术将书面L2文本转化为合成语音进行数据增强。核心挑战与创新在于:系统性地处理书面L2与口语L2之间的根本差异(如自发语音中的停顿、话语标记等),通过针对性设计将口语特征注入合成数据,使TTS生成的增强样本能够更真实地模拟真实L2学习者的口语表现,从而有效提升自动评分模型的性能与泛化能力。
- RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching
- 赛道归属: 文本到语音生成(TTS)/ Flow Matching 生成建模与对齐鲁棒性
- 核心创新点: 提出一种面向对齐错误的训练策略 RobustSpeechFlow,将对比式 Flow Matching 扩展为“增强驱动”的鲁棒学习:在潜变量轨迹上构造长度保持的 repeat/skip 增强,显式模拟真实 TTS 失败模式(跳读、重复)并在训练中进行对比惩罚,从而提升内容保真与对齐稳定性;方法不依赖外部强制对齐器或偏好数据,直接在生成轨迹学习层面增强对齐鲁棒性与零样本说话人相似度/自然度的兼容性。
- AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis
- 赛道归属: 对话式语音合成(Conversational Speech Synthesis, CSS)/ 情感语音生成与对话上下文建模
- 核心创新点: 提出 AuEmoChat 框架,针对 CSS 中“情感表达不真实”和“多轮上下文冗余干扰理解”两大瓶颈:一方面突破固定小规模情感标签空间的限制,强调更细粒度/更真实的情感理解与渲染机制以提升情感自然度与一致性;另一方面通过抑制/过滤多模态对话历史中的冗余 token来减少上下文噪声,增强对话语境建模能力,从而在多轮人机交互场景中实现更连贯、更可信的情感语音合成。
GitHub
- [2026-07-21] huggingface/diffusers ⭐34127
- [2026-07-21] SamurAIGPT/Generative-Media-Skills ⭐3876
- [2026-07-21] Stability-AI/stable-audio-tools ⭐3821 🆕NEW
- [2026-07-21] dgrauet/ltx-2-mlx ⭐82
- [2026-07-20] xiquan-li/Awesome-Audio-Generation ⭐74
HuggingFace Datasets
- [2026-07-18] Manusagents/GPT-5.5-Gemini-3.1-Pro-Grok-4-Claude-Fable-5-Mythos-5-Qwen-3.7-Max-and-more-Distillation-Dataset 🆕NEW
语言大模型
arXiv
- Interventional Grounding Audits: Black-Box Premise-Dependency Tests for LLM Chain-of-Thought via Predicate Substitution
- 赛道归属: LLM推理可靠性 / 思维链审计
- 核心创新点: 提出"干预性基础审计"(Interventional Grounding Audits)方法,通过对单一前提的谓词进行替换(predicate substitution),以黑盒方式逐步检测LLM思维链(CoT)中每个推理步骤是否真正依赖其声明的前提。核心突破在于将因果干预思想引入CoT可信度评估,无需访问模型内部权重,即可量化推理步骤与前提之间的实际依赖关系,从而区分"表面合理"与"真实接地"的推理过程。
- Hierarchical Chain-of-Thought: Enhancing LLM Reasoning Performance and Efficiency
- 赛道归属: 推理优化 / 思维链提示工程
- 核心创新点: 提出层次化思维链(Hi-CoT)范式,将传统扁平、无结构的推理链重构为分层子步骤结构。核心突破在于通过层级分解机制消除推理冗余,使复杂多步推理问题被系统性地拆解为有层次依赖关系的子任务,在提升推理准确性的同时降低推理步骤冗余度,实现性能与效率的双重优化。
- Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length
- 赛道归属: 大模型评测与基准(自适应测试/推理能力评估)
- 核心创新点: 将传统基于准确率的IRT(Item Response Theory)评测扩展为“延迟-响应”联合建模框架,把Chain-of-Thought长度作为反映推理过程开销/复杂度的关键观测量,与回答正确性一起纳入同一统计模型中进行估计与对比;从而在评测中同时刻画“答对了没有”和“以多长推理链条答对”的能力差异,提升对推理能力与效率权衡的可解释性与区分度,并可与自适应测试流程结合以更高效地测量模型能力。
- RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
- 赛道归属: 大模型对齐(RLHF/DPO改进、偏好建模)
- 核心创新点: 针对DPO在知识密集生成中存在的“冗长/流畅性偏置”导致逻辑正确性被系统性低估的问题,提出Hybrid-DPO的自动化偏好构造管线:将基于自然语言推断/逻辑一致性的判别信号(如DeBERTa类NLI/grounding信号)与偏好学习目标融合,用“逻辑扎根(grounding) + 语言流畅度”双目标共同驱动偏好优化;从方法上缓解仅靠人类或LLM裁判偏好带来的奖励错配,缩小SFT到逻辑对齐之间的“logical alignment gap”。
- LLM-Guided Transportation Hub Capacity Planning with Textual Business Inputs
- 赛道归属: LLM Agent / 运筹优化决策
- 核心创新点: 提出将LLM作为枢纽容量规划的决策代理,核心创新在于设计了一套"结构化决策表"生成协议:LLM通过思维链推理将自然语言业务描述(定性文本)映射为具体容量调整参数,从而将传统量化运筹模型无法处理的定性业务上下文纳入容量规划流程,实现文本业务语义与量化调度优化的迭代融合。
- It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief 🆕NEW
- 赛道归属: LLM对齐与鲁棒性评测(信念表达/语用影响)
- 核心创新点: 提出面向“用户信念表达(Expressions of Belief, EoBs)”的系统化评测框架与类型学,将用户以不同语言形式(如预设、证据性与确定性标记、语气/口吻等)表达的信念进行结构化划分,并据此评估LLM在两类目标之间的行为边界:何时应将对话上下文中的信念当作暂时事实接纳、何时应坚持模型先验知识不被“说法方式”误导。该工作把“表达方式的说服力”作为可控变量,显式检验模型对语用线索的敏感性与被诱导风险,从而为对齐与安全评测提供更细粒度、可复现的测试维度。
- Human Grounded Evaluation of Large Language Models for Optical Network Automation 🆕NEW
- 赛道归属: LLM评测体系与工程化基准(网络自动化/领域任务评测)
- 核心创新点: 提出HuGLEN分步式评测流水线,将“LLM-as-a-judge”的可扩展性与少量领域专家人工评分进行校准融合,实现对候选LLM在光网络自动化任务中的可复现、可扩展对比评测。方法上通过分阶段评估与统一打分机制,将输出质量与推理成本共同纳入“质量-效率分数(QES)”进行排序,解决仅看质量或仅看成本导致的选型偏差;同时强调人类专家锚定(grounding)以抑制纯自动评审的漂移与不稳定,使得跨模型家族的比较更稳定、更贴近真实部署需求。
- HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization 🆕NEW
- 赛道归属: 多模态LLM视频理解与视频摘要
- 核心创新点: 提出HAS(Highlight-guided Attention Steering)用于多模态LLM视频摘要,通过“高亮/重点片段”信号对注意力进行定向引导(steering),强化关键帧/关键片段选择与信息聚合能力。相较于仅依赖通用视频特征或后处理挑帧的做法,该方法把“摘要应关注什么”的先验以可控方式注入到模型注意力分配中,从机制上提升对长视频中稀疏关键信息的捕获与对齐,进而改善摘要的覆盖性与凝练度,并增强在不同视频内容分布下的鲁棒性。
- Harness Engineering for LLM-Driven GPU Kernel Generation 🆕NEW
- 赛道归属: LLM代码生成在系统/编译优化中的应用(GPU Kernel生成与自动调优)
- 核心创新点: 提出以“评测/约束Harness”为中心的LLM驱动GPU Kernel生成与优化系统架构,将生成过程与验证/性能评测解耦:由独立harness负责编译约束、正确性校验与性能剖析(profile),再由基于profile反馈的优化控制器进行候选代码选择与迭代优化。该设计把LLM生成的不确定性纳入可控闭环,通过强约束验证与可重复的性能测量实现“可靠生成—可比评测—自动择优”,显著提升LLM在真实竞赛/生产环境中进行内核优化的可用性与稳定性。
- C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference 🆕NEW
- 赛道归属: LLM推理优化与服务系统(KV Cache复用与压缩)
- 核心创新点: 提出C²KV(Compressed and Composable KV Cache Reuse),在长上下文推理中同时解决“重复prefill计算”与“KV缓存存取/存储成本”两大瓶颈:不仅做KV复用以减少冗余计算,还将KV压缩纳入复用框架,并强调“可组合(composable)”的复用机制,使得不同片段/不同来源上下文的KV能够在压缩形态下被拼接与复用。该方法把优化目标从单纯算力节省扩展到端到端服务开销(显存占用、带宽与访问成本),更贴合长上下文在线推理的系统约束。
GitHub
- [2026-07-22] sgl-project/sglang ⭐30592
- [2026-07-22] google-ai-edge/LiteRT-LM ⭐5983
- [2026-07-22] openJiuwen-ai/jiuwenswarm ⭐1552
- [2026-07-22] huhusmang/Awesome-LLMs-for-Vulnerability-Detection ⭐1191
- [2026-07-22] chrisliu298/awesome-on-policy-distillation ⭐548 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-07-17] openbmb/UltraX-Preview
- [2026-06-29] Glint-Research/Fable-5-traces
多模态大模型
arXiv
- One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models 🆕NEW
- 赛道归属: 多模态安全与机器遗忘(Vision-Language Models Unlearning)
- 核心创新点: 首次对VLM中的“跨模态遗忘迁移”进行系统、双向(文本→视觉、视觉→文本)研究,覆盖三类主流跨模态连接架构(MLP投影、Q-Former、门控交叉注意力),用统一实验框架量化“在一个模态执行unlearning是否会在另一模态同步生效”的程度与不对称性;进一步从架构耦合方式与表示共享机制角度揭示迁移失败/有限迁移的关键因素,为后续设计“单模态触发、跨模态一致清除”的unlearning策略提供了可操作的诊断基准与方法学依据。
- SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing 🆕NEW
- 赛道归属: 遥感多模态理解(UAV视频理解/语言条件分割)
- 核心创新点: 面向无人机遥感视频中“小目标、外观歧义、视角动态变化”导致的细粒度理解难题,提出SkyVLaM这一UAV视频多模态大模型框架,将视频时序信息与语言条件分割能力进行模型级整合,以“语言驱动的目标级分割/定位”作为核心能力接口来提升对细粒度目标的可解释理解;通过针对UAV视频场景的建模与训练设计,强化模型在动态航拍视角下的时空一致目标理解与指令跟随分割表现。
- GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models 🆕NEW
- 赛道归属: 多模态理解(3D空间感知增强/几何对齐预训练)
- 核心创新点: 提出GAP-MLLM的“几何对齐预训练”范式,针对MLLM在纯RGB输入下3D空间感知弱的问题,指出瓶颈并非缺少几何先验,而是训练范式错配(文本主导微调难以激活/对齐几何表征);通过在预训练阶段引入显式的几何对齐目标/约束,使视觉表征与3D几何关系在表示空间中可被语言推理有效调用,从而在不依赖显式3D输入的前提下显著提升空间关系理解、方位/深度等3D感知相关能力。
- GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
- 赛道归属: 多模态理解 / 视频分析推理
- 核心创新点: 提出 GHR-VLM 框架,将视觉语言模型(VLM)与传统监督视觉模型相结合,通过"视觉接地混合推理"机制实现零样本公交视频分析。核心突破在于:无需任务特定标注数据,通过混合推理架构(Grounded Hybrid Reasoning)协同利用监督模型的精确感知能力与 VLM 的语义理解能力,将长视频分析分解为可靠的结构化子任务,有效解决了 VLM 直接处理长视频时存在的不稳定性和高成本问题,实现了对公交车载视频的零样本细粒度分析(如乘客行为统计等)。
- Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors
- 赛道归属: 多模态理解(长视频理解/测试时推理优化)
- 核心创新点: 利用MLLM内部跨模态注意力在特定“验证集选定的抽取层”中已包含与文本查询相关的帧级证据这一现象,提出一种无需自回归生成即可完成长视频关键帧筛选的测试时方法(DAFS)。该方法通过读取/聚合注意力信号来对成千上万候选帧进行高效打分与选择,从而打破“先理解视频才能选帧”的循环依赖,在不显著增加推理开销的前提下实现更紧凑且更相关的帧子集抽取。
- Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models
- 赛道归属: 多模态理解(VLM提示工程/推理机制分析与改进)
- 核心创新点: 针对VQA中“问题放在图像前反而更差”的question-first悖论,提出Prompt Echoing(问两次、看两次)策略:在提示中对问题进行回声式重复/重申,使模型在不同计算阶段都能显式对齐问题语义与视觉证据。论文通过logit-lens与注意力探针定位到悖论源于VLM内部两个阶段的目标冲突(早期视觉编码/对齐与后期语言解码/回答),并用“问题回声”在不改模型参数的情况下缓解阶段错配,提升问题条件化的视觉检索与最终回答一致性。
- SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification
- 赛道归属: 多模态理解(生物特征识别评测/指纹验证)
- 核心创新点: 构建首个面向MLLM的四指SLAP指纹身份验证基准SLAPBench:基于NIST SD302b整理7,832对样本(含少量同一人mated与大量非同一人non-mated),将传统指纹“比对/验证”任务以多模态对话/判别形式标准化,提供可复现的评测设置以系统检验MLLM在细粒度纹理判别、跨指组合证据整合与低误报约束下的能力边界,从而填补“MLLM能否做指纹验证”的空白评测缺口。
- Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding
- 赛道归属: 多模态理解 / 长视频理解
- 核心创新点: 提出GMM-EVA框架,将高斯混合模型(GMM)引入长视频帧采样,实现事件感知的视觉预算动态分配。核心突破在于:将视频帧序列的语义分布建模为多个高斯分量,自动识别高层语义事件边界,并依据事件密度差异化地分配视觉token预算(而非均匀采样),从而在减少冗余计算的同时保留关键语义结构,突破了现有方法将帧视为孤立原子单元的局限。
- MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning
- 赛道归属: 多模态理解 / VLM参数高效微调
- 核心创新点: 提出MQAdapter(多模态量子适配器),将量子计算中的态叠加与纠缠机制引入VLM的适配器设计,实现从粗粒度到细粒度的两阶段分类优化。核心突破在于:利用VLM已有的高Top-K准确率能力筛选候选类别(粗粒度阶段),再通过量子态表示对视觉相似类别进行细粒度判别(细粒度阶段),以量子叠加态编码类间相关性,弥补VLM在细粒度视觉辨别上的不足,显著提升Top-1分类性能。
- Continual Learning with Elastic Regularization and Synthetic Replay for Federated MLLM Fine-Tuning
- 赛道归属: 多模态理解 / 联邦学习 & 持续学习
- 核心创新点: 提出一种面向多模态大语言模型(MLLM)联邦微调的持续学习框架,融合弹性权重巩固(Elastic Weight Consolidation, EWC)正则化与合成数据回放(Synthetic Replay)两大机制。核心突破在于:在分布式隐私保护场景下,通过EWC约束视觉、语言及跨模态表示的参数重要性漂移,同时利用模型自身生成合成样本替代真实历史数据进行回放,在无需共享原始数据的前提下有效缓解跨任务顺序更新导致的灾难性遗忘,适配安全敏感的动态网络环境。
GitHub
- [2026-07-21] Blaizzy/mlx-vlm ⭐5225
- [2026-07-22] NVIDIA-AI-Blueprints/video-search-and-summarization ⭐1750 🆕NEW
- [2026-07-17] zhengli97/Awesome-Prompt-Adapter-Learning-for-VLMs-CLIP ⭐785
- [2026-07-22] NVIDIA-NeMo/Automodel ⭐750 🆕NEW
- [2026-07-21] NVIDIA-Omniverse/usd-content-agents ⭐160 🆕NEW
强化学习
arXiv
- SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning
- 赛道归属: 多模态强化学习 / 视觉语言模型对齐
- 核心创新点: 现有视觉干预方法依据干预类型分配监督信号,但忽略了同一干预算子在不同样本上效果异质的问题。SIVA-RL 提出以实测效果而非干预类型来区分"敏感样本"与"不变样本",对敏感样本施加视觉基础对齐约束(鼓励模型依赖视觉证据),对不变样本则屏蔽该约束以避免错误梯度,从而在不改变奖励结构的前提下,将视觉语言模型的预测真正锚定于视觉输入。
- OOD-RL-Bench: A Benchmark Framework for Out-of-Distribution Detection in Reinforcement Learning
- 赛道归属: 强化学习 / 分布外检测与鲁棒性评估
- 核心创新点: 提出首个专门面向强化学习场景的OOD检测基准框架OOD-RL-Bench,突破了现有OOD基准仅针对图像分类器或静态低维数据集的局限。核心创新在于将OOD检测问题系统性地拆解为三个维度——观测偏移、状态转移偏移和轨迹动态偏移,覆盖传感器故障、动态扰动、环境渐变等真实部署场景,为评估RL智能体在非训练分布下的可靠性提供了标准化的测试协议与统一评价体系。
- Interpret Policies in Deep Reinforcement Learning using SILVER with RL-Guided Labeling: A Model-level Approach to High-dimensional and Multi-action Environments 🆕NEW
- 赛道归属: 强化学习可解释性(策略解释/归因分析)
- 核心创新点: 在SILVER的Shapley回归式策略解释框架上,引入“RL-guided labeling”机制,将策略自身的多动作输出纳入标注/约束生成过程,从而把原本受限于低维、二元动作的解释方法扩展到高维观测与多动作空间;通过利用策略行为来引导解释模型的样本构造与边界设定,提升在复杂环境下的可解释性适用范围与稳定性。
- MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models 🆕NEW
- 赛道归属: 强化学习用于大模型推理后训练(参数高效RL/多智能体辩论)
- 核心创新点: 提出MADA-RL后训练框架,将紧凑模型拆分为生成器与评论家两种角色,并用“辩论感知”的学习信号进行强化学习式优化;核心方法突破在于构造反事实(counterfactual)辩论/评估信号来降低训练噪声、强化可归因的改进方向,同时仅通过LoRA适配器微调少量参数,实现低预算下对小模型推理能力的有效专门化。
- RL-Struct: A Lightweight Reinforcement Learning Framework for Reliable Structured Output in LLMs
- 赛道归属: 大语言模型对齐与结构化输出(RLHF/GRPO、可靠生成)
- 核心创新点: 提出 RL-Struct,用无critic的GRPO(Gradient Regularized Policy Optimization)替代PPO式actor-critic以降低训练与显存开销,并设计分层奖励函数将“结构满足(schema/语法)”与“内容质量/字段有效性”等目标解耦、分级约束,从而直接缩小LLM概率生成与确定性schema需求之间的“结构鸿沟”。在复杂JSON生成上以更轻量的训练代价显著提升结构准确率与有效性,并通过去除critic实现更低峰值VRAM占用。
- PAMD: Structured Adaptive Distances for Bisimulation Representations in Visual Reinforcement Learning 🆕NEW
- 赛道归属: 视觉强化学习表征学习(双模拟/行为等价表征)
- 核心创新点: 针对双模拟表征学习中“潜空间距离度量选型”对性能高度敏感的问题,提出PAMD:用结构化、可自适应的距离族来匹配由奖励与转移相似性诱导的行为距离;相较固定全局范数(过于僵化)或完全自由的成对距离(易退化),PAMD在距离表达能力与可识别性/非退化约束之间取得平衡,使潜表征更稳定地对齐行为等价结构,从而提升视觉RL的表示质量与下游学习效果。
- Information-Based Exploration via Random Features for Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习探索(信息增益/核方法/理论保证)
- 核心创新点: 提出RFIG(Random Feature Information Gain),用随机傅里叶特征近似贝叶斯核方法中的信息增益,在不可数/连续状态动作空间中计算可行的探索奖励(exploration bonus);方法论突破在于将信息增益的核化计算转化为随机特征下的可扩展估计,并给出信息增益近似误差界,从而在保持深度表示能力的同时,降低算法复杂度并强化理论可分析性。
- Reinforcement Learning: From Algorithms To Foundation Models 🆕NEW
- 赛道归属: 强化学习综述/学位论文(算法与基础模型融合)
- 核心创新点: 该工作以论文集/博士论文形式系统研究RL从“经典算法”走向“基础模型”范式的路径:一方面聚焦博弈等场景中的RL算法问题,另一方面讨论在高维世界、战略交互与不确定性下,RL如何与更通用的表示与推理能力结合;其贡献主要体现在统一视角与问题框架的提炼、以及将RL研究议题扩展到面向基础模型的训练与应用设定。
- WAR: Workload-Aware Rollouts for Synchronous Agentic Reinforcement Learning 🆕NEW
- 赛道归属: 强化学习系统优化(Agentic RL训练加速/rollout调度)
- 核心创新点: 提出WAR(Workload-Aware Rollouts)系统,面向同步式agentic RL中“长时序rollout生成”成为主要瓶颈的问题,联合优化解码(decoding)与调度(scheduling);关键突破是以“工作负载感知”的方式选择/组织rollout生成策略,使不同长度与计算代价的轨迹在系统层面得到更优的资源分配与流水化,从而显著提升同步训练吞吐并降低rollout端的整体等待与开销。
- Distilled Reinforcement Learning for LLM Post-training 🆕NEW
- 赛道归属: 大模型后训练(RL与蒸馏融合/对齐与推理提升)
- 核心创新点: 提出“Distilled Reinforcement Learning”用于LLM后训练,针对纯RL仅有结果级监督导致信用分配困难、以及OPD用KL无条件贴合教师logits带来的“教师相似则增益小、教师更强则难以学习”的两难,设计将强化学习信号与蒸馏式学习耦合的训练范式;方法上的突破在于用更细粒度、可迁移的蒸馏目标辅助RL优化,从而在保持RL目标导向(对齐/任务回报)的同时,提高学习新知识与稳定优化的能力。
GitHub
- [2026-07-21] huggingface/trl ⭐18902
- [2026-07-22] OpenPipe/ART ⭐10514
- [2026-07-22] Farama-Foundation/PettingZoo ⭐3477
- [2026-07-22] radixark/miles ⭐1763
- [2026-07-21] tinker495/jax-baseline ⭐67
HuggingFace Datasets
- [2026-07-21] SupraLabs/reasoning-corpus-4K-5M-v1
世界动作模型
arXiv
- FlowWAM: Optical Flow as a Unified Action Representation for World Action Models
- 赛道归属: 世界动作模型 / 视频生成与机器人控制
- 核心创新点: 提出以光流(Optical Flow)作为统一的动作表示形式,用于世界动作模型(WAMs)。核心方法论突破在于:针对"数值动作表示与预训练视频生成器语义空间不对齐"以及"现有视觉动作表示忽略跨帧时序运动结构"这两大问题,将光流作为桥梁——它既与视频生成器的视觉特征空间天然兼容,又能显式编码跨帧的连续时序运动信息。通过将光流作为统一的动作表示,使得预训练视频生成器可以在无需大幅架构改动的前提下,同时胜任世界建模(预测未来帧)和动作预测(推断控制信号)两项任务,实现了控制精度与生成质量的协同提升。
- From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence
- 赛道归属: 世界动作模型(World Action Model)/ 具身智能 / 综述与路线图
- 核心创新点: 该工作系统性地提出了从"世界动作模型(WAMs)"迈向"具身大脑"的技术路线图,核心贡献在于:首次明确定义并统一了WAMs的概念框架——将其界定为能够将候选干预动作与预测后果相连接的模型,区别于单纯的视觉-语言-动作策略(VLA)和纯世界模型;深入剖析了当前领域碎片化的根源,包括动作空间不兼容、预测目标不统一、数据集与任务标准不一致,以及运行时系统差异等结构性问题;在此基础上,提出了一套覆盖模型架构、数据规范、评测体系和部署接口的系统性整合方案,旨在打通感知、预测与决策的闭环,推动开放世界物理智能的落地。该工作的方法论突破在于:以"后果预测"作为连接模型与物理世界的核心纽带,为跨任务、跨平台的具身智能统一建模提供了理论抓手。
- WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time
- 赛道归属: 机器人基础模型 / 世界动作模型 / 测试时训练(Test-Time Training)
- 核心创新点: 提出 WAM-TTT 框架,核心突破在于无需机器人演示数据、无需任务特定微调,仅通过观看人类操作视频即可在测试时动态引导冻结的世界动作模型(WAM)适应新任务变体或用户偏好行为。方法上的关键创新是引入"轻量级自适应记忆模块"(lightweight adaptive memory),以自监督视频预测为训练信号,将人类视频中的行为先验"吸收"进该记忆模块,而非将人类视频直接视为模仿轨迹或长上下文输入。这一设计解耦了人类视频理解与机器人策略执行,使得在测试阶段即可实现低成本、高效率的行为转向,同时保持主干模型参数冻结,规避了灾难性遗忘问题。
GitHub
- [2026-07-21] open-gigaai/giga-world-policy ⭐1359
- [2026-07-21] OpenMOSS/Awesome-WAM ⭐1153
- [2026-07-17] shaohua-pan/StarWAM ⭐177
- [2026-07-19] gangweix/next-forcing ⭐111
- [2026-07-20] serene-sivy/AHA-WAM ⭐74 🆕NEW
由 Research Daily 自动生成 生成时间: 2026-07-22 01:46:38