AI 每日进展速报 - 2026-07-02
图像生成/编辑
arXiv
- IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation
- 赛道归属: 文生图(结构可控生成 / 规划-渲染解耦)
- 核心创新点: 提出“隐式视觉思维链”作为潜空间的结构规划机制,将对象数量、空间关系、属性绑定与布局等“结构性意图”从外观渲染中解耦:先在潜变量中形成可组合的结构计划,再驱动后续生成以提升结构遵循能力;通过把结构推理从单一条件流的纠缠中分离,显著改善复杂结构提示下的可控性与一致性。
- Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment
- 赛道归属: 文生图 / 语义对齐增强
- 核心创新点: 针对文生图模型中"唯一性对象"(如天体、地标、艺术品)受到强视觉先验干扰、导致概念关联偏差的问题,提出引入中间文本表示作为引导信号。核心思路是在生成过程中插入一个结构化的中间语义层,将原始提示词解耦为更精确的语义描述,从而绕过模型内化的视觉偏见,强化"一对一"对象的忠实渲染,而无需重新训练模型。
- DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation 🆕NEW
- 赛道归属: 文生图 / 主体驱动文本生成图像评估基准
- 核心创新点: 提出DSH-Bench评测基准,核心贡献在于三个维度的系统性突破:① 构建了具有层次化主体分类体系的多样化主体图像集,覆盖更广泛的主体类别;② 引入难度感知机制,将主体图像按难度分级,实现对模型在不同难度主体上性能的细粒度区分;③ 设计场景感知评估框架,针对不同提示场景进行针对性评测,从而弥补现有基准在多样性、细粒度和场景覆盖方面的不足。
- RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
- 赛道归属: 文生图 / 强化学习对齐
- 核心创新点: 提出 RubricRL 框架,核心突破在于用"评分标准"替代传统单一标量奖励或复合指标加权求和的方式来设计强化学习奖励信号。该方法通过将生成目标分解为可解释的、细粒度的评估维度,利用大模型或规则生成结构化评分,从而在保持灵活性的同时提升了奖励的可解释性和泛化性,避免了固定权重复合指标和人类偏好蒸馏模型的局限性。
- Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking 🆕NEW
- 赛道归属: 文生图 / 布局条件自回归图像生成
- 核心创新点: 提出SMARLI框架,针对自回归模型在布局条件生成中面临的稀疏条件利用不足与特征纠缠两大难题,提出结构化掩码机制作为核心技术手段。该方法通过设计专用的掩码策略,将空间布局约束显式地融入自回归生成过程,在不破坏AR模型原有序列生成范式的前提下,实现对图像中不同区域的精确空间控制,从而有效避免布局信息与图像特征之间的耦合干扰,提升生成图像与用户指定布局的空间一致性。
- PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation
- 赛道归属: 文生图安全(越狱评测 / 基准与复现管线)
- 核心创新点: 将T2I越狱从“单提示评测”提升为“端到端管线评测”,提出可自演化的 paper-to-pipeline 复现框架 PixJail:覆盖提示改写/攻击、图像生成、安全过滤、多模态裁判等多阶段,并把论文方法自动化落地为可运行管线以提升可复现性与可比性;核心突破在于用标准化、可扩展的管线级协议刻画越狱效果与防护强度,而非孤立的prompt成功率。
- SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion
- 赛道归属: 文生图基础模型 / 扩散模型训练加速
- 核心创新点: 提出 SeFi-Image,核心创新是"语义优先扩散"这一新型潜在扩散建模范式。与传统扩散模型将语义信息视为条件输入不同,该范式将语义结构的学习置于扩散过程的优先位置,从而利用语义引导显著加速基础模型训练。关键突破在于将此范式成功扩展至大分辨率、大规模模型(多个参数量档位),突破了以往仅在 ImageNet 等简单数据集上小模型验证的局限。
- AccelAes: Accelerating Diffusion Transformers for Training-Free Aesthetic-Enhanced Image Generation
- 赛道归属: 文生图 / 推理加速与美学增强
- 核心创新点: 观察到扩散Transformer在去噪过程中对美学相关token的注意力分布呈现空间非均匀性,美学区域具有更大的时序变化量,而非美学区域变化缓慢。据此提出AccelAes框架:针对美学token关联区域采用精细化计算,对其余区域进行缓存复用,实现训练无关的自适应稀疏注意力加速,在不牺牲美学质量的前提下显著降低DiT的推理延迟。
- UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention
- 赛道归属: 文生图 / 超高分辨率生成
- 核心创新点: 针对现有扩散模型(如FLUX、SD3)受限于注意力机制二次复杂度而难以突破2MP分辨率的瓶颈,提出UltraImageGen框架。核心技术创新在于分层局部注意力机制,结合低分辨率全局语义锚定与高分辨率局部细节生成的两阶段策略,有效解耦全局结构一致性与局部纹理精度的矛盾,在训练数据稀缺的前提下实现超高分辨率图像的高效生成。
- Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance
- 赛道归属: 跨模态检索 / 低分辨率鲁棒性
- 核心创新点: 针对真实监控场景中分辨率差异导致的跨分辨率文本-图像行人重识别失效问题,识别并定义了两种耦合失效模式:视觉token退化导致的"证据可靠性崩溃"与混合分辨率图库引起的"排名分布漂移"。提出跨分辨率语义迁移框架,通过在高低分辨率表示之间构建语义桥接机制,在检索阶段同时修正特征可靠性与相似度排名分布,显著提升低分辨率监控场景下的检索鲁棒性。
GitHub
- [2026-07-02] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐12725
- [2026-07-01] wuyoscar/GPT-Image2-Skill ⭐3438 🆕NEW
- [2026-07-02] AceDataCloud/Nexior ⭐375
- [2026-07-01] Azornes/Comfyui-Resolution-Master ⭐286 🆕NEW
- [2026-07-01] Asilcanasil/Hent-AI-Synthesis-Engine ⭐151
HuggingFace Models
HuggingFace Datasets
- [2026-06-29] Rapidata/svg-benchmark
Rapidata Static SVG Generation Benchmark
Built by Rapidata. This dataset contains 1,355,161 human responses, collected with the Rapidat...
视频生成/编辑
arXiv
- Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation
- 赛道归属: 视频生成 / 训练优化与质量对齐
- 核心创新点: 该工作提出了一种无需外部奖励模型或人工标注的视频生成质量对齐方法——Shell-LCC。其核心洞察是:高质量训练数据的流形结构本身即隐含了奖励信号。通过显式建模高质量视频数据的流形几何结构,将数据流形作为内生奖励模型,引导扩散模型生成结果向高质量数据分布对齐。该方法规避了传统基于RLHF/DPO路线中高昂的标注成本和计算开销,同时在局部细节保真度上取得了更优的提升,为T2V生成的对齐范式提供了数据流形驱动的新思路。
- DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation
- 赛道归属: 视频生成 / 主体驱动文生视频
- 核心创新点: 提出 DomainShuttle 框架,专门针对开放域主体驱动文生视频中"跨域"场景的不足进行突破。现有方法主要聚焦于域内高保真主体重现,而 DomainShuttle 通过"域穿梭"机制,在保留主体本质特征的同时,允许与主体无关的属性(如风格、场景、外观)根据文本提示灵活变化,实现了自由形式的开放域生成能力,有效解决了跨域场景下主体特征保留与文本可控性之间的平衡难题。
- Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
- 赛道归属: 视频生成评估 / 物理合理性细粒度评测
- 核心创新点: 提出 Physics Question Scene Graph,一种基于层次化问题图的评估流水线,用于细粒度定位视频生成中的物理规律违反问题。与现有粗粒度评估方法不同,PQSG 通过构建包含物体、动作、属性及其物理关系的场景图,将物理合理性评估分解为结构化问答任务,实现了对物理违规的精准溯源与量化,填补了当前文生视频评估体系在物理合理性细粒度诊断上的空白。
- Event-Driven Video Generation 🆕NEW
- 赛道归属: 视频生成(事件驱动/物理交互一致性)
- 核心创新点: 针对现有文生视频模型在处理局部物理交互(如接触、支撑、放置等)时产生时序错误的问题,提出事件驱动视频生成框架。核心突破在于:在标准DiT架构中引入轻量级事件感知干预机制,打破"每一步更新所有潜在区域"的默认行为,将去噪过程与文本提示中隐含的局部交互事件绑定,使模型仅在事件激活的时空区域施加集中更新,从而显著提升接触一致性、动作完整性和支撑关系的物理合理性,且对现有DiT架构兼容、改动轻量。
- AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation 🆕NEW
- 赛道归属: 多模态生成(音视频联合生成)
- 核心创新点: 提出AVTok,一种用于音视频整体生成的一维统一tokenization方案。区别于主流双分支设计(视觉与音频各自独立tokenize和生成),AVTok的核心突破在于:将音频与视频信号共同映射到统一的1D离散token序列空间,消除跨模态表示鸿沟,避免双分支架构带来的大量冗余计算。该统一表示使单一自回归或生成模型可以同时建模音视频的时间同步性与语义对齐关系,在大幅降低训练资源消耗的同时,实现更细粒度的音画同步与整体语义一致性。
- EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics
- 赛道归属: 视频生成 / 云边协同推理加速
- 核心创新点: EcoVideo 提出了一种基于熵编排的动态帧间解耦视频生成框架,专门针对 DiT 架构视频生成的高延迟痛点。其技术突破有三:①利用自注意力熵作为无需训练的帧级信息密度代理指标,实现自适应关键帧选取;②在云边协同架构中,高熵关键帧由云端大模型去噪,低熵非关键帧由边缘轻量模型处理,并通过跨帧特征复用减少冗余计算;③框架可根据系统动态(如带宽、负载变化)自适应调整解耦策略,超越了以往静态步间解耦方法的局限。整体实现了计算资源分配与视频质量的精细化平衡。
- OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data
- 赛道归属: 视频生成 / 多模态条件驱动舞蹈视频生成
- 核心创新点: OmniDance 从数据与方法两个维度同时突破了音乐驱动舞蹈视频生成的瓶颈。在数据层面,构建了 CIPE-Dance 大规模互联网舞蹈视频数据集,填补了该领域高质量大规模数据的空白。在方法层面,提出了将音乐作为互补条件信号融入视频生成基础模型的原则性框架,创新性地设计了多模态条件注入机制,使音乐节拍、情感等信息与人体动作在时序上实现精确对齐,同时保持高视觉保真度。该工作的核心贡献在于将通用视频生成基础模型与特定领域多模态条件(音乐+姿态)进行系统性整合,为音乐驱动的人体运动合成建立了可扩展的新基准。
- Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control
- 赛道归属: 视频生成(自回归视频生成 / 可控视频生成)
- 核心创新点: 该工作针对自回归视频生成在长时序展开中存在的误差累积与时序退化问题,提出了一种融合人体运动与相机轨迹的异构复合控制框架。核心技术突破体现在以下几个方面:①设计了一种能够同时建模人体动作控制信号与相机运动轨迹的联合条件注入机制,解决了两类异构控制信号相互干扰、破坏预训练视频先验的问题;②针对自回归生成的长程稳定性,提出了有效抑制误差累积的架构设计,使模型在长时序rollout中保持视频质量;③在保证可控性的同时实现了快速自回归生成,在速度与质量之间取得了更优的平衡。整体方法为构建可交互、可控的世界模型提供了可扩展的技术路径。
- Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models
- 赛道归属: 视频生成 / 自回归扩散蒸馏与流式视频生成
- 核心创新点: 提出 Causal-rCM,将先进扩散蒸馏框架 rCM 扩展至因果扩散变换器的自回归视频生成范式。核心创新在于统一了"Teacher-Forcing"(教师强制)与"Self-Forcing"(自强制)两种训练模式的开放配方:利用一致性模型的逆向散度与分布匹配蒸馏的正向散度互补性,在保持实时流式生成能力的同时显著提升采样效率,为交互式世界模型和动作条件视频生成提供了统一的高效蒸馏解决方案。
- Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation
- 赛道归属: 视频生成推理优化 / 跨请求稀疏注意力复用
- 核心创新点: 提出 Chorus II,针对图生视频大规模服务场景,首次发现并利用相似请求之间高度一致的稀疏注意力模式这一规律。与现有仅复用特征的跨请求加速方法不同,Chorus II 通过跨请求复用历史稀疏掩码,在不显著降低生成质量的前提下大幅减少注意力计算开销,为 I2V 扩散模型的高效部署提供了新的系统级优化维度。
GitHub
- [2026-07-01] ZeroLu/awesome-seedance ⭐2032
- [2026-07-01] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1473
- [2026-07-01] PurpleDoubleD/locally-uncensored ⭐837
- [2026-07-02] wordghost1234/agnes-ai-storyboard-studio ⭐151
- [2026-07-01] dcharatan/millivid ⭐84
音频生成
arXiv
- CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations
- 赛道归属: 文本转语音 / 跨语言口音强度可控语音合成
- 核心创新点: 提出 CrossAccentTTS 框架,核心突破在于对说话人身份与口音特征进行解耦表征,实现在保持说话人音色不变的前提下,独立控制目标口音类型及其强度。相比传统跨语言 TTS 系统缺乏口音显式控制的问题,该方法尤其针对低资源、音系多样的印度语系语言,提供了精细化的口音迁移与强度调节能力。
- Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance 🆕NEW
- 赛道归属: 视频生成音频
- 核心创新点: 受传统拟音工作流启发,提出一种逐步式视频转音频生成框架。核心突破在于:将多音效合成问题分解为多个独立的"负引导V2A"步骤——每一步生成新的互补音效时,通过负向音频引导机制主动抑制已生成声音的重复,从而实现增量式、可控的多声音事件合成;该方法无需昂贵的多参考视频-音频配对数据集,显著降低了数据依赖,同时给予用户对各音效生成顺序与内容的细粒度控制能力。
- Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis
- 赛道归属: 文本转语音 / 日语语音合成与汉字多音字消歧
- 核心创新点: 提出 Sarashina2.2-TTS,一个以日语为核心的 LLM-TTS 系统,针对日语中普遍存在的上下文依赖型汉字多音字问题,创新性地采用数据规模扩展与针对性数据合成双重策略加以解决。其核心突破在于通过定向数据构造弥补现有日语 TTS 数据集在多音字场景下覆盖不足的缺陷,有效提升了日语语音合成的发音准确率。
- Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation 🆕NEW
- 赛道归属: 语音合成评估
- 核心创新点: 针对TTS评估中"自然度"与"适切性"指标的内涵分歧问题,提出跨领域双维度评估框架。核心突破在于:系统性地区分了"类人程度"与"上下文适切性"两个独立维度,并在AI助手、朗读者、演员、动画角色、自发说话者五个不同应用域上对五个SOTA TTS系统进行对比评测,实证揭示了"自然"不等于"适切"——同一系统在不同下游场景下的适切性感知存在显著差异。该工作为TTS评估体系从单一自然度向多域适切性转型提供了重要的实证基础。
- SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation 🆕NEW
- 赛道归属: 文本生成音频(Text-to-Audio Generation / 扩散模型推理加速)
- 核心创新点: 提出SwiftAudio,一个无需音频数据的一步式文本转音频蒸馏框架。核心突破在于:首次将变分得分蒸馏引入TTA领域,仅依赖文本描述即可从预训练扩散教师模型中完成知识蒸馏,彻底摆脱了现有一步式方法对文本-音频配对数据的依赖。该方法在大幅压缩推理步骤(多步→单步)的同时,通过纯文本驱动的蒸馏策略保持了合成质量,在数据效率与推理速度之间取得了显著突破。
- HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech
- 赛道归属: 情感语音合成 / 文本转语音
- 核心创新点: 针对基于大语言模型的TTS系统在情感表达上的局限性,该工作提出了HPRO(分层渐进式奖励优化)框架,核心突破体现在两个层面:
- 解耦潜空间设计:将内容信息与情感信息从共享隐空间中分离,解决了传统偏好优化中内容梯度与情感梯度相互冲突的结构性问题;
- 分层渐进式偏好优化策略:通过从粗粒度到细粒度的渐进式偏好提取与奖励建模,逐层对情感韵律进行精细化优化,突破了标准SFT范式导致模型收敛于统计均值韵律的瓶颈,显著提升情感表现力。整体方案将偏好驱动学习与层次化情感表征深度结合,为情感TTS的强化学习对齐提供了新范式。
- Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS
- 赛道归属: 文本转语音 / 基于流匹配的零样本语音合成引导策略
- 核心创新点: 针对流匹配零样本 TTS 中分类器自由引导的局限,提出联合残差重加权方法。创新之处在于重新审视独立遮蔽条件下的 CFG 机制,通过对文本条件与说话人条件的残差项进行解耦重加权,突破了现有分支选择性引导方法在"文本正确性"与"说话人相似度"之间的权衡困境,实现两者的协同提升。
- Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS
- 赛道归属: 文本转语音 / 基于扩散模型的韵律动态建模
- 核心创新点: 针对扩散模型 TTS 解码器在建模急剧韵律转换与快速音调变化时的不足,提出自适应振荡归纳偏置机制。相较于现有使用 Snake 激活函数的周期性非线性方法,该工作引入可自适应调整振幅与频率的激活函数设计,使模型在捕捉谐波结构的同时,具备对突变幅度和频率的灵活建模能力,有效提升表达性语音中细粒度韵律动态的合成质量。
- CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
- 赛道归属: TTS评测基准 / 中文新闻场景发音鲁棒性评测
- 核心创新点: 提出面向“原始输入”的中文新闻TTS目标级自动化评测基准,将易错的书面密集形式(比分、范围、单位符号、百分比、英文缩写、中英数混写专名等)显式定义为可定位的“发音目标”,并以目标是否被正确口播为核心指标,避免仅用整体MOS掩盖关键读音错误;强调在不做文本规范化前提下评估产品级TTS对真实新闻文本的读音保持与语义口播一致性。
- Joycent: Diffusion-based Accent TTS without Accented Phone Prediction
- 赛道归属: 文本转语音 / 基于扩散模型的口音语音合成
- 核心创新点: 提出 Joycent,摒弃了传统口音 TTS 依赖的两阶段管线(标准音素序列→口音音素序列→语音合成),避免了误差积累及对稀缺配对标注数据的依赖。核心创新在于直接在扩散模型框架内,通过声学特征层面的口音表征来建模口音特性,无需显式的文本级口音音素预测步骤,从而实现更自然、更精准的口音语音合成。
GitHub
- [2026-07-01] huggingface/diffusers ⭐33963
- [2026-06-29] BinWang28/audio-ai-hub ⭐933
- [2026-06-30] Ameobea/web-synth ⭐560
- [2026-07-01] apocas/restai ⭐511
- [2026-07-01] dgrauet/ltx-2-mlx ⭐67
语言大模型
arXiv
- LLM-MINE: Large Language Model based Alzheimer's Disease and Related Dementias Phenotypes Mining from Clinical Notes
- 赛道归属: 医疗NLP / 临床文本信息抽取(表型挖掘)
- 核心创新点: 提出LLM-MINE,用大语言模型将非结构化临床笔记中的ADRD(阿尔茨海默病及相关痴呆)表型进行自动化抽取与结构化归因;方法上强调以“专家定义的表型 schema/标签体系 + LLM抽取流程”来覆盖分散在叙述文本中的关键信息,并通过专家标注/验证形成可用于早筛与分期的高质量表型数据资产。
- Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety
- 赛道归属: LLM安全与对抗防御
- 核心创新点: 提出了一种以"对抗性视角"为核心的LLM安全框架Yuvion,核心突破在于将安全问题重新定义为对抗性问题而非单纯的自然输入分布问题。该工作明确指出现有通用模型在涉及规划、工具调用等真实场景下的安全防护缺口,并通过构建对抗感知能力来应对策略性越狱与滥用攻击,而非仅依赖传统的过滤或拒绝机制。
- Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War
- 赛道归属: LLM评测基准 / 多智能体对抗与可靠性评测(推理+博弈+协议约束)
- 核心创新点: 提出Age of LLM这一1v1回合制对抗基准,将三类压力源系统化注入评测:战争迷雾(部分可观测)、完整外交沟通(谈判/停火/威胁且信息可隐藏)、以及严格JSON动作协议下的可靠性约束(非法动作被静默丢弃);通过私有引擎、随机地图种子与随机对手机制降低数据污染与“背题”风险,使评测更贴近真实交互式决策与工具/协议执行场景。
- Online Data Selection for Instruction Tuning via Gaussian Processes
- 赛道归属: 指令微调 / 数据选择与质量优化
- 核心创新点: 提出GAIA框架,将数据价值评估从局部批次优化升级为全局估计过程。核心方法是引入高斯过程对数据效用进行全局建模,突破了现有在线数据选择方法"批次受限"的瓶颈,实现了跨批次的全局自适应指令微调数据筛选,从根本上改变了LLM训练中数据价值评估的范式。
- 赛道归属: Instruction tuning / Data Selection & Quality Optimization
- Search for Truth from Reasoning: A Dynamic Representation Editing Framework for Steering LLM Trajectories
- 赛道归属: 推理优化 / 表征编辑
- 核心创新点: 提出动态表征编辑框架,针对LLM推理轨迹中"真值"的几何结构进行深入分析,揭示了三项关键规律。与静态表征编辑不同,该方法将内在控制机制动态注入展开中的推理链,能够在推理过程中实时引导模型向"真值"方向收敛,而非仅仅让模型"思考更多",从根本上解决了CoT等方法缺乏真值导向的问题。
- 赛道归属: Reasoning Optimization / Representation Editing
- Optimal Self-Consistency for Efficient Reasoning with Large Language Models 🆕NEW
- 赛道归属: 推理优化 / 测试时计算效率
- 核心创新点: 针对自洽性推理方法在大规模数据集上计算成本过高的问题,本文从理论层面建立了统一的最优自洽性框架。核心突破在于将多次采样的答案聚合过程形式化为经验众数估计问题,并推导出最优采样数量的理论界,从而在保持性能的前提下大幅减少不必要的采样次数,实现自适应的高效推理。
- RAISE: LLM-based Automated Heuristic Design with Robust Adversary Instance Search 🆕NEW
- 赛道归属: 自动化启发式设计 / LLM驱动的组合优化
- 核心创新点: 现有基于LLM的自动化启发式设计方法在训练集固定分布上优化,面对真实世界的分布偏移时性能急剧下降。本文提出RAISE框架,其核心创新在于将受约束的最坏情况对抗实例搜索嵌入启发式优化循环中——在训练分布的受限邻域内主动搜索最具挑战性的对抗样本,并以此驱动启发式鲁棒性提升,从方法论上将鲁棒优化思想引入LLM启发式设计领域。
- Cross-lingual Relation Extraction with Large Language Models: Zero-Shot, Few-Shot, and Fine-Tuned Evaluation on Romanian 🆕NEW
- 赛道归属: 跨语言信息抽取 / 低资源NLP
- 核心创新点: 针对低资源语言(罗马尼亚语)关系抽取缺乏标注语料的瓶颈,本文创新性地结合LLM驱动的自动数据集翻译流水线与多配置评估体系(零样本、少样本、QLoRA微调),系统性地验证了跨语言迁移可行性。核心方法突破在于以LLM翻译替代人工标注,并通过与多个编码器基线的横向对比,量化分析了不同适配策略在低资源跨语言场景下的性能边界。
- A Tutorial on Autonomous Fault-Tolerant Control Using Knowledge-Grounded LLM Agents 🆕NEW
- 赛道归属: LLM智能体 / 工业过程自主容错控制
- 核心创新点: 本文提出将LLM智能体作为受约束的监督规划器,用于工业过程工厂的自主故障恢复决策。核心创新在于将工厂专有知识(P&ID、联锁逻辑、操作规程等)结构化接入LLM推理链,构建"知识锚定"的智能体框架,突破了传统预定义监督逻辑无法处理未见故障场景的局限,同时通过约束机制保障安全合规性,为LLM在高风险工业自动化领域的落地提供了系统性方法论。
- Automating Cause-Effect Specification with Knowledge Graphs and Large Language Models 🆕NEW
- 赛道归属: 知识图谱与LLM融合 / 工业过程安全规格自动化
- 核心创新点: 针对工业过程控制中因果效应矩阵等安全规格仍依赖人工、易出错的痛点,本文提出语义-AI融合框架,核心创新在于将知识图谱与受约束LLM协同分层:KG基于模块化对齐本体对工程语义进行结构化表示与一致性保障,LLM层负责受控的逻辑生成与自然语言交互。这种"结构化语义知识+生成式推理"的双层架构,从方法论上实现了从非结构化工程文档到形式化安全逻辑的自动化推导。
GitHub
- [2026-07-02] sgl-project/sglang ⭐29875
- [2026-07-02] NVIDIA-NeMo/Speech ⭐17687
- [2026-07-01] NVIDIA/TensorRT-LLM ⭐14008
- [2026-07-02] google-ai-edge/LiteRT-LM ⭐5763
- [2026-07-02] flagos-ai/FlagGems ⭐1040
HuggingFace Models
HuggingFace Datasets
- [2026-06-29] Glint-Research/Fable-5-traces
Glint Research Dataset Card Fable 5 Pi Agent Traces A compact, high-signal corpus of Fable 5 coding-agen...
- [2026-06-21] Crownelius/Complete-FABLE.5-traces-2M
Complete FABLE.5 Traces 2M
Full FABLE.5 / Mythos corpus restored, with session-limit answer rows removed. Dataset Viewer | Parq...
多模态大模型
arXiv
- DataComp-VLM: Improved Open Datasets for Vision-Language Models
- 赛道归属: 多模态理解 / 数据工程与基准测试
- 核心创新点: 提出首个系统性的视觉-语言模型数据配方基准 DCVLM,整合了160个数据集(涵盖图文对、多模态交错文档、纯文本及指令微调数据)构成6T规模语料库,将数据筛选策略的评估标准化,填补了社区在VLM训练数据系统性比较研究上的空白。其核心突破在于将"以数据为中心"的实验范式引入VLM领域,使研究者能够在受控条件下对比不同数据策略的效果,而非依赖模型架构变化来解释性能差异。
- Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling
- 赛道归属: 多模态理解(长视频理解/高效采样与推理加速)
- 核心创新点: 将长视频帧选择形式化为“准高斯采样”问题,提出一种自适应、免训练的帧采样策略:用连续、可调的软采样分布替代传统关键帧“硬采样”,在计算/显存受限下更灵活地覆盖关键时刻并抑制噪声帧,从而在不改动模型训练的前提下提升长视频理解效率与效果。
- VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models
- 赛道归属: 多模态理解 / 计算光学与视觉语言模型协同设计
- 核心创新点: 提出 CODA 协同设计框架,针对冻结视觉语言模型的特性,将前端元光学硬件设计与 VLM 的感知偏好联合优化,而非追求传统人类可读的图像质量指标。核心突破在于:以 VLM 的任务性能(而非图像分辨率/像差等光学指标)作为优化目标,使紧凑型元光学在尺寸/成本受限场景下仍能维持高效的多模态理解能力,打通了物理光学设计与AI模型感知之间的优化闭环。
- AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs
- 赛道归属: 多模态理解 / 跨模态评测基准
- 核心创新点: 提出AMVICC基准,系统性地对比VLMs(图像→文本)与图像生成模型IGMs(文本→图像)在相同视觉概念上的失败模式,实现跨模态失效剖析。核心创新在于将图文双向任务置于同一评测框架下,通过"跨模态失败模式对齐"揭示两类模型在物体朝向、数量感知、空间关系等基础视觉概念上的共性与差异性缺陷,为多模态系统的弱点诊断提供了对称性视角。
- RiverONE: Generating Knowledge-Intensive VLM by Simulated Quantum Machines
- 赛道归属: 多模态理解 / 轻量化模型与量子启发参数生成
- 核心创新点: 提出 RiverONE,利用模拟量子计算(而非真实量子硬件)在模型构建阶段生成结构化参数,将量子叠加、纠缠和测量诱导的非线性特征引入经典神经网络的权重初始化或参数生成过程,从而构建知识密集型轻量视觉-语言模型。核心创新在于将量子计算的高维信息表示能力以"软件模拟"形式移植至经典AI系统参数设计中,为紧凑型VLM提供了一种全新的参数来源范式。
- LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving
- 赛道归属: 自动驾驶 / 多模态规划
- 核心创新点: 提出 LWDrive 框架,通过逐层世界模型引导机制将 VLM 输出的粗粒度语义驾驶意图逐步细化为几何精确、具有未来感知能力和多视角一致性的轨迹规划。其核心突破在于打通 VLM 语义层与底层运动规划层之间的鸿沟——不再将 VLM 输出直接用作最终轨迹,而是将其作为世界模型各层的条件信号,实现语义理解与物理可行性的分层对齐。
- Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models
- 赛道归属: 多模态理解 / 模型评估与美学推理
- 核心创新点: 针对开放式美学评论任务提出新的评估范式,突破了传统数值评分对齐方式的局限,转而将 MLLM 生成的评论与多个经人工排序的参考评论进行比对,使用 Reddit Photo Critique 数据集对五个开源 MLLM 进行评测。核心创新在于将"排名人类参考"引入美学评估,构建了更贴近真实人类批评行为的评判标准,为衡量模型在无唯一正确答案的主观推理任务上的能力提供了方法论参考。
- Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages
- 赛道归属: 多模态安全 / 内容审核与对抗鲁棒性
- 核心创新点: 系统性研究图像分辨率对 VLM 检测 ASCII 艺术形式有害内容的影响,覆盖八种字符构造模式(L1–L8,从密集块字符到词嵌入设计)及多语言场景,揭示了分辨率阈值与检测能力之间的定量关系。核心创新在于将分辨率作为核心变量引入 VLM 安全评估体系,首次量化了视觉编码的有害信息在不同渲染精度下对主流 VLM 内容审核能力的系统性威胁边界,为实际部署中的防御策略提供了可操作的技术依据。
- Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models
- 赛道归属: 多模态理解 / 视觉语言模型机制可解释性
- 核心创新点: 针对视觉语言模型中"视觉感知"与"先验知识"发生冲突时的决策机制,首次提出组件级因果分析方法,综合运用残差流、注意力头、MLP 子层三个粒度的激活修补与模型组件消融实验。核心发现是跨三个 VLM 家族均存在"视觉默认、先验覆盖"的层次化因果机制——模型默认优先处理视觉输入,但特定组件可触发先验知识对视觉证据的覆盖。该工作将行为层面的冲突描述推进至可追溯的内部因果机制层面,为提升多模态系统可靠性提供了可操作的机制洞察。
- Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
- 赛道归属: 多模态理解 / GUI智能体 / 不确定性量化
- 核心创新点: 提出Argus基准,专门针对"计算机操作智能体"场景下VLM预测的不确定性量化问题,系统评估多种后验UQ方法在跨模型、跨数据集、跨GUI界面变化下的稳定性。创新点在于引入"跨体制"评测范式,分离模型、数据集、界面三个维度的UQ排名漂移,并定义拒绝决策、空间安全区域等面向GUI点击执行的实用UQ指标,填补了GUI智能体可靠性评估的空白。
GitHub
- [2026-07-01] Blaizzy/mlx-vlm ⭐5107
- [2026-06-28] waybarrios/vllm-mlx ⭐1391
- [2026-07-01] EvolvingLMMs-Lab/NEO ⭐846
- [2026-07-01] VITA-Group/VLM-3R ⭐417 🆕NEW
- [2026-06-29] FeiElysia/Tempo ⭐73
强化学习
arXiv
- RoAd-RL: A Unified Library and Benchmark for Robust Adversarial Reinforcement Learning
- 赛道归属: 对抗鲁棒性强化学习 / Adversarial Robust Reinforcement Learning
- 核心创新点: RoAd-RL 提出了一个统一的开源对抗强化学习基准框架,核心突破在于:通过标准化抽象层统一了策略、攻击者和环境的接口,解决了现有研究中实现碎片化、评估协议不一致和可复现性差的问题。该框架将多种主流对抗攻击方法与鲁棒训练算法整合至单一平台,并建立了一致的评估协议,使不同方法之间的横向比较成为可能,推动了对抗RL研究的标准化与可重复性。
- FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
- 赛道归属: 大语言模型强化学习对齐 / LLM RL Alignment
- 核心创新点: 针对GRPO等策略梯度方法在训练中梯度方向不稳定的问题,提出反馈驱动的双目标协同强化学习框架。核心突破在于同时优化策略目标与反馈信号目标,通过双目标协同机制动态校正梯度方向,避免单一奖励信号导致的训练偏移,从而更稳定地解锁大模型推理能力。
- Qwen-Image-2.0-RL Technical Report
- 赛道归属: 文生图 / RLHF后训练优化
- 核心创新点: 针对扩散模型的后训练流水线,创新性地将RLHF与在策略蒸馏结合,构建任务特定的复合奖励模型,引入基于视觉语言模型微调的逐点打分范式与链式思维推理,从而为文生图任务提供更可靠的奖励信号,同步提升视觉质量与指令遵循能力。
- Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models 🆕NEW
- 赛道归属: 具身智能 / 视觉-语言-动作模型强化学习后训练
- 核心创新点: 提出Z-1框架,专为基于流的VLA模型设计RL后训练方案。核心突破在于:(1)将连续动作流的生成过程与RL奖励信号对接,解决了传统行为克隆无法从自身失败中学习的根本缺陷;(2)通过高效的RL后训练范式,在不依赖新增演示数据的情况下显著提升机器人操控策略的泛化能力和鲁棒性,为流式VLA模型引入了在线自我改进机制。
- Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning 🆕NEW
- 赛道归属: 多模态理解 / 医学视觉问答与推理优化
- 核心创新点: 提出双流强化学习框架,联合优化视觉Token稀疏化与医学多模态推理两个任务。核心方法突破在于:识别到医学图像中有效视觉证据极度稀疏的特点,通过主动剪枝接地区域之外的视觉Token来强化临床推理质量;在统一的RL框架下,将视觉定位与语言推理解耦为双流结构,首次实现了自适应Token压缩与推理增强的协同训练,显著降低计算冗余的同时提升了医学诊断推理准确性。
- Stage-Transition Dense Reward Modeling for Reinforcement Learning 🆕NEW
- 赛道归属: 具身智能 / 长时序机器人操控稠密奖励学习
- 核心创新点: 提出STDR框架,核心创新在于:从无结构的专家视频中自动推断任务的阶段结构,并将阶段转换事件转化为逻辑一致的稠密奖励信号,无需人工设计奖励函数。方法上利用视觉语义理解自动识别任务关键阶段边界,将稀疏终止奖励转化为阶段级稠密监督,从根本上解决了长时序操控任务中奖励稀疏和延迟的核心挑战,且对环境变化和物体配置变化具备更强的泛化能力。
- Deep Reinforcement Learning for Spacecraft Attitude Control During Atmospheric Re-Entry 🆕NEW
- 赛道归属: 航空航天控制 / 深度强化学习姿态控制
- 核心创新点: 将深度强化学习应用于航天器大气再入姿态控制这一高度非线性、强不确定性的安全关键场景。核心贡献在于:(1)以工业级增益调度PID控制器作为强基线,系统性地评估无模型RL与混合控制器(RL+传统控制结合)的性能边界;(2)探索了混合控制架构,将RL的自适应决策能力与传统控制器的稳定性保障相结合,为极端动力学条件下(高温、气动扰动、系统故障)的鲁棒姿态控制提供了新的技术路径。
- Offline Reinforcement Learning for Fluid Controls: Data-based Multi-observational Policy Extraction 🆕NEW
- 赛道归属: 工程流体控制 / 离线强化学习主动流动控制
- 核心创新点: 提出面向流体主动控制的离线RL框架,核心方法突破体现在三个层面:(1)无需与高保真仿真环境进行实时交互,从离线数据中直接提取控制策略,大幅降低计算成本;(2)支持多观测配置的策略提取,使单一训练的策略可适配不同传感器布局,解决了在线RL每次传感器配置变更均需重新训练的痛点;(3)将离线RL引入计算流体力学控制领域,为实际工程应用中禁止实时在线探索的场景提供了可行的数据驱动控制范式。
- Staged Hybridisation for Visual Quantum Reinforcement Learning via Knowledge Distillation
- 赛道归属: 量子强化学习 / Quantum Reinforcement Learning
- 核心创新点: 提出了一种基于知识蒸馏的"分阶段混合化"策略,专门用于解决视觉量子强化学习中高维观测、优化不稳定和变分量子电路容量受限三重困难并存的问题。方法上的突破在于:先训练经典视觉教师网络并冻结其编码器作为特征接口,再通过知识蒸馏将教师策略迁移至量子学生智能体,实现了端到端混合视觉量子RL训练的解耦,回避了从像素直接联合训练经典-量子混合系统的优化难题。
- Domain Adaptation with Adaptive Imagination for Visual Reinforcement Learning under Limited Target Data
- 赛道归属: 视觉强化学习领域自适应 / Domain Adaptation for Visual Reinforcement Learning
- 核心创新点: 针对仿真到现实迁移中目标域数据极度匮乏的实际约束,提出了基于"自适应想象"的域自适应框架。核心创新在于:利用少量目标域数据动态生成与真实分布对齐的合成图像,通过自适应图像生成机制来补偿目标数据不足,从而在数据稀缺条件下维持有效的视觉策略迁移,突破了现有方法对大量目标域数据的强依赖假设。
GitHub
- [2026-07-02] huggingface/trl ⭐18741
- [2026-07-01] PufferAI/PufferLib ⭐6096
- [2026-07-01] radixark/miles ⭐1651
- [2026-07-02] OpenMLRL/CoMLRL ⭐88
- [2026-07-02] ex18a/pwnagotchi64 ⭐54
HuggingFace Models
HuggingFace Datasets
- [2025-01-15] mlabonne/open-perfectblend
🎨 Open-PerfectBlend
Open-PerfectBlend is an open-source reproduction of the instruction dataset introduced in the paper "The Perfect Blend...
- [2026-06-29] bcbl190626/SpanishBCBL
DECOMEG — Brain Activity During Typing (MEG & EEG)
Non-invasive brain recordings (magnetoencephalography, MEG; and electroencephalograp...
- [2026-06-24] Qwen/AgentWorldBench
AgentWorldBench
AgentWorldBench is a comprehensive evaluation benchmark for language world models, constructed from real-world observat...
世界动作模型
arXiv
- Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation
- 赛道归属: 具身导航 / 世界动作模型 / 空间感知规划
赛道归属 : Embodied Navigation / World Action Model / Spatial-Aware Planning
- 核心创新点: 现有基于世界模型的视觉导航规划器通常采用"验证中心范式",将目标意图与轨迹合成解耦,导致候选依赖、计算开销大、采样动作与预测视觉不一致等问题。本文提出 SWAM(空间感知世界动作模型),核心创新在于:
- 任务中心式联合生成框架:将观测与动作的生成统一建模,在给定起始与目标 RGB 观测后,同步生成导航动作序列与中间视觉帧,彻底摆脱对候选集的依赖;
- 空间感知能力嵌入:在世界模型中显式引入空间感知模块,增强模型对三维场景结构的理解,使预测的视觉观测与动作保持几何一致性;
- 范式转变:从"先采样后验证"的两阶段解耦范式,转变为端到端的联合推断范式,有效降低计算开销并提升动作预测的可靠性。
核心创新点 :
- ReWorld: Learning Better Representations for World Action Models
- 赛道归属 : 自动驾驶世界模型 / World Action Model for Autonomous Driving
- 核心创新点 :
[中文] 现有世界动作模型的研究主要集中于模型架构设计,而如何让模型高效学习更优质的世界表征以服务于规划任务,仍是一个待解决的问题。本文提出 ReWorld,这是首个专门面向自动驾驶世界动作模型的表征学习框架。其核心创新在于:突破了传统WAM仅依赖标准视频预测监督信号(即像素级重建损失)的局限,通过引入专门设计的表征学习目标,引导模型在训练过程中学习到更具语义性、结构性的世界状态表征,而非仅仅优化视觉保真度。这一框架与模型架构无关,具备良好的通用性,可作为现有WAM方法的即插即用增强模块,显著提升其用于规划时的表征质量。
GitHub
- [2026-07-01] OpenMOSS/Awesome-WAM ⭐1003
- [2026-06-26] yuyangalin/ImageWAM ⭐107
由 Research Daily 自动生成 生成时间: 2026-07-02 01:02:06