AI 每日进展速报 - 2026-07-01
图像生成/编辑
arXiv
- IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation
- 赛道归属: 文生图(结构可控生成 / 规划-渲染解耦)
- 核心创新点: 提出“隐式视觉思维链”作为潜空间的结构规划机制,将对象数量、空间关系、属性绑定与布局等“结构性意图”从外观渲染中解耦:先在潜变量中形成可组合的结构计划,再驱动后续生成以提升结构遵循能力;通过把结构推理从单一条件流的纠缠中分离,显著改善复杂结构提示下的可控性与一致性。
- Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment 🆕NEW
- 赛道归属: 文生图 / 语义对齐增强
- 核心创新点: 针对文生图模型中"唯一性对象"(如天体、地标、艺术品)受到强视觉先验干扰、导致概念关联偏差的问题,提出引入中间文本表示作为引导信号。核心思路是在生成过程中插入一个结构化的中间语义层,将原始提示词解耦为更精确的语义描述,从而绕过模型内化的视觉偏见,强化"一对一"对象的忠实渲染,而无需重新训练模型。
- RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
- 赛道归属: 文生图 / 强化学习对齐
- 核心创新点: 提出 RubricRL 框架,核心突破在于用"评分标准"替代传统单一标量奖励或复合指标加权求和的方式来设计强化学习奖励信号。该方法通过将生成目标分解为可解释的、细粒度的评估维度,利用大模型或规则生成结构化评分,从而在保持灵活性的同时提升了奖励的可解释性和泛化性,避免了固定权重复合指标和人类偏好蒸馏模型的局限性。
- PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation
- 赛道归属: 文生图安全(越狱评测 / 基准与复现管线)
- 核心创新点: 将T2I越狱从“单提示评测”提升为“端到端管线评测”,提出可自演化的 paper-to-pipeline 复现框架 PixJail:覆盖提示改写/攻击、图像生成、安全过滤、多模态裁判等多阶段,并把论文方法自动化落地为可运行管线以提升可复现性与可比性;核心突破在于用标准化、可扩展的管线级协议刻画越狱效果与防护强度,而非孤立的prompt成功率。
- SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion
- 赛道归属: 文生图基础模型 / 扩散模型训练加速
- 核心创新点: 提出 SeFi-Image,核心创新是"语义优先扩散"这一新型潜在扩散建模范式。与传统扩散模型将语义信息视为条件输入不同,该范式将语义结构的学习置于扩散过程的优先位置,从而利用语义引导显著加速基础模型训练。关键突破在于将此范式成功扩展至大分辨率、大规模模型(多个参数量档位),突破了以往仅在 ImageNet 等简单数据集上小模型验证的局限。
- AccelAes: Accelerating Diffusion Transformers for Training-Free Aesthetic-Enhanced Image Generation 🆕NEW
- 赛道归属: 文生图 / 推理加速与美学增强
- 核心创新点: 观察到扩散Transformer在去噪过程中对美学相关token的注意力分布呈现空间非均匀性,美学区域具有更大的时序变化量,而非美学区域变化缓慢。据此提出AccelAes框架:针对美学token关联区域采用精细化计算,对其余区域进行缓存复用,实现训练无关的自适应稀疏注意力加速,在不牺牲美学质量的前提下显著降低DiT的推理延迟。
- UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention 🆕NEW
- 赛道归属: 文生图 / 超高分辨率生成
- 核心创新点: 针对现有扩散模型(如FLUX、SD3)受限于注意力机制二次复杂度而难以突破2MP分辨率的瓶颈,提出UltraImageGen框架。核心技术创新在于分层局部注意力机制,结合低分辨率全局语义锚定与高分辨率局部细节生成的两阶段策略,有效解耦全局结构一致性与局部纹理精度的矛盾,在训练数据稀缺的前提下实现超高分辨率图像的高效生成。
- Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance 🆕NEW
- 赛道归属: 跨模态检索 / 低分辨率鲁棒性
- 核心创新点: 针对真实监控场景中分辨率差异导致的跨分辨率文本-图像行人重识别失效问题,识别并定义了两种耦合失效模式:视觉token退化导致的"证据可靠性崩溃"与混合分辨率图库引起的"排名分布漂移"。提出跨分辨率语义迁移框架,通过在高低分辨率表示之间构建语义桥接机制,在检索阶段同时修正特征可靠性与相似度排名分布,显著提升低分辨率监控场景下的检索鲁棒性。
- ScaleErasure: Inference-Time Minimal Intervention for Precise Concept Erasure in Next-Scale Autoregressive Image Generation 🆕NEW
- 赛道归属: 图像生成安全 / 自回归图像生成
- 核心创新点: 首次将概念消除问题引入下一尺度自回归图像生成范式。针对该范式中早期尺度语义高度压缩、不安全语义与无关语义严重纠缠的特有挑战,提出ScaleErasure——一种推理时最小干预方法,通过在关键尺度步骤上施加精准的最小化干预(而非全局修改),实现对目标概念的精确消除,同时最大程度保留模型的通用生成能力,无需任何训练或微调。
- Mural: Transferring LLM knowledge to image generation via Mixture-of-Transformers 🆕NEW
- 赛道归属: 文生图 / LLM知识迁移与多模态融合
- 核心创新点: 探索将冻结大语言模型的推理知识迁移至文生图生成的可行路径。创新性地采用混合Transformer架构,通过共享注意力机制将冻结的推理型LLM与扩散式图像生成器深度耦合,仅在标准文图对上训练图像生成分支。核心贡献在于验证了:在不解冻LLM参数、不依赖额外推理数据的前提下,LLM的语义理解与推理能力可有效转化为图像生成的语义对齐增益。
GitHub
- [2026-07-01] YouMind-OpenLab/awesome-nano-banana-pro-prompts ⭐12716
- [2026-06-30] varunvasudeva1/llm-server-docs ⭐800
- [2026-07-01] AceDataCloud/Nexior ⭐374
- [2026-06-30] eleiton/ollama-intel-arc ⭐371 🆕NEW
- [2026-06-30] Asilcanasil/Hent-AI-Synthesis-Engine ⭐152 🆕NEW
HuggingFace Models
HuggingFace Datasets
- [2026-06-29] Rapidata/svg-benchmark 🆕NEW
Rapidata Static SVG Generation Benchmark
Built by Rapidata. This dataset contains 1,355,161 human responses, collected with the Rapidat...
视频生成/编辑
arXiv
- Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation 🆕NEW
- 赛道归属: 视频生成 / 训练优化与质量对齐
- 核心创新点: 该工作提出了一种无需外部奖励模型或人工标注的视频生成质量对齐方法——Shell-LCC。其核心洞察是:高质量训练数据的流形结构本身即隐含了奖励信号。通过显式建模高质量视频数据的流形几何结构,将数据流形作为内生奖励模型,引导扩散模型生成结果向高质量数据分布对齐。该方法规避了传统基于RLHF/DPO路线中高昂的标注成本和计算开销,同时在局部细节保真度上取得了更优的提升,为T2V生成的对齐范式提供了数据流形驱动的新思路。
- DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation
- 赛道归属: 视频生成 / 主体驱动文生视频
- 核心创新点: 提出 DomainShuttle 框架,专门针对开放域主体驱动文生视频中"跨域"场景的不足进行突破。现有方法主要聚焦于域内高保真主体重现,而 DomainShuttle 通过"域穿梭"机制,在保留主体本质特征的同时,允许与主体无关的属性(如风格、场景、外观)根据文本提示灵活变化,实现了自由形式的开放域生成能力,有效解决了跨域场景下主体特征保留与文本可控性之间的平衡难题。
- Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
- 赛道归属: 视频生成评估 / 物理合理性细粒度评测
- 核心创新点: 提出 Physics Question Scene Graph,一种基于层次化问题图的评估流水线,用于细粒度定位视频生成中的物理规律违反问题。与现有粗粒度评估方法不同,PQSG 通过构建包含物体、动作、属性及其物理关系的场景图,将物理合理性评估分解为结构化问答任务,实现了对物理违规的精准溯源与量化,填补了当前文生视频评估体系在物理合理性细粒度诊断上的空白。
- EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics 🆕NEW
- 赛道归属: 视频生成 / 云边协同推理加速
- 核心创新点: EcoVideo 提出了一种基于熵编排的动态帧间解耦视频生成框架,专门针对 DiT 架构视频生成的高延迟痛点。其技术突破有三:①利用自注意力熵作为无需训练的帧级信息密度代理指标,实现自适应关键帧选取;②在云边协同架构中,高熵关键帧由云端大模型去噪,低熵非关键帧由边缘轻量模型处理,并通过跨帧特征复用减少冗余计算;③框架可根据系统动态(如带宽、负载变化)自适应调整解耦策略,超越了以往静态步间解耦方法的局限。整体实现了计算资源分配与视频质量的精细化平衡。
- OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data 🆕NEW
- 赛道归属: 视频生成 / 多模态条件驱动舞蹈视频生成
- 核心创新点: OmniDance 从数据与方法两个维度同时突破了音乐驱动舞蹈视频生成的瓶颈。在数据层面,构建了 CIPE-Dance 大规模互联网舞蹈视频数据集,填补了该领域高质量大规模数据的空白。在方法层面,提出了将音乐作为互补条件信号融入视频生成基础模型的原则性框架,创新性地设计了多模态条件注入机制,使音乐节拍、情感等信息与人体动作在时序上实现精确对齐,同时保持高视觉保真度。该工作的核心贡献在于将通用视频生成基础模型与特定领域多模态条件(音乐+姿态)进行系统性整合,为音乐驱动的人体运动合成建立了可扩展的新基准。
- Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control
- 赛道归属: 视频生成(自回归视频生成 / 可控视频生成)
- 核心创新点: 该工作针对自回归视频生成在长时序展开中存在的误差累积与时序退化问题,提出了一种融合人体运动与相机轨迹的异构复合控制框架。核心技术突破体现在以下几个方面:①设计了一种能够同时建模人体动作控制信号与相机运动轨迹的联合条件注入机制,解决了两类异构控制信号相互干扰、破坏预训练视频先验的问题;②针对自回归生成的长程稳定性,提出了有效抑制误差累积的架构设计,使模型在长时序rollout中保持视频质量;③在保证可控性的同时实现了快速自回归生成,在速度与质量之间取得了更优的平衡。整体方法为构建可交互、可控的世界模型提供了可扩展的技术路径。
- Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models
- 赛道归属: 视频生成 / 自回归扩散蒸馏与流式视频生成
- 核心创新点: 提出 Causal-rCM,将先进扩散蒸馏框架 rCM 扩展至因果扩散变换器的自回归视频生成范式。核心创新在于统一了"Teacher-Forcing"(教师强制)与"Self-Forcing"(自强制)两种训练模式的开放配方:利用一致性模型的逆向散度与分布匹配蒸馏的正向散度互补性,在保持实时流式生成能力的同时显著提升采样效率,为交互式世界模型和动作条件视频生成提供了统一的高效蒸馏解决方案。
- Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation
- 赛道归属: 视频生成推理优化 / 跨请求稀疏注意力复用
- 核心创新点: 提出 Chorus II,针对图生视频大规模服务场景,首次发现并利用相似请求之间高度一致的稀疏注意力模式这一规律。与现有仅复用特征的跨请求加速方法不同,Chorus II 通过跨请求复用历史稀疏掩码,在不显著降低生成质量的前提下大幅减少注意力计算开销,为 I2V 扩散模型的高效部署提供了新的系统级优化维度。
- GeoT2V-Bench: Benchmarking 3D Consistency in Text-to-Video Models via 3D Reconstruction
- 赛道归属: 视频生成评测 / 3D一致性评测(Text-to-Video + 3D重建诊断)
- 核心创新点: 提出基于“显式3D重建可行性”的T2V评测范式:不再只看逐帧观感,而是将相机提示下生成的视频作为多视图观测,接入刚体3D重建流程,用重建质量/稳定性来量化跨视角几何一致性;以重建为“诊断器”定位T2V在相机运动、视差、结构漂移等方面的失败模式,从而把“看起来合理”提升为“可支持单一静态3D场景证据”的可检验指标。
- Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models
- 赛道归属: 视频生成 / 世界模型与可控性学习
- 核心创新点: 将“视频生成=世界建模”的命题具体化为“可反事实控制的自演化世界模型”:强调仅靠视觉预测尺度化不足以获得可用的物理代理,提出以反事实可控性为目标,让模型不仅能续写视频,还能在干预变量下生成一致且可区分的反事实轨迹;通过把生成过程组织为可被操控、可自我改进的闭环,使世界模型从隐式表征走向可用于决策/干预评估的生成式模拟器。
GitHub
- [2026-07-01] hao-ai-lab/FastVideo ⭐3786
- [2026-06-30] ZeroLu/awesome-seedance ⭐2027
- [2026-06-30] YouMind-OpenLab/awesome-seedance-2-prompts ⭐1466
- [2026-07-01] wordghost1234/agnes-ai-storyboard-studio ⭐152 🆕NEW
- [2026-06-30] dcharatan/millivid ⭐84 🆕NEW
音频生成
arXiv
- CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations
- 赛道归属: 文本转语音 / 跨语言口音强度可控语音合成
- 核心创新点: 提出 CrossAccentTTS 框架,核心突破在于对说话人身份与口音特征进行解耦表征,实现在保持说话人音色不变的前提下,独立控制目标口音类型及其强度。相比传统跨语言 TTS 系统缺乏口音显式控制的问题,该方法尤其针对低资源、音系多样的印度语系语言,提供了精细化的口音迁移与强度调节能力。
- Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis
- 赛道归属: 文本转语音 / 日语语音合成与汉字多音字消歧
- 核心创新点: 提出 Sarashina2.2-TTS,一个以日语为核心的 LLM-TTS 系统,针对日语中普遍存在的上下文依赖型汉字多音字问题,创新性地采用数据规模扩展与针对性数据合成双重策略加以解决。其核心突破在于通过定向数据构造弥补现有日语 TTS 数据集在多音字场景下覆盖不足的缺陷,有效提升了日语语音合成的发音准确率。
- HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech
- 赛道归属: 情感语音合成 / 文本转语音
- 核心创新点: 针对基于大语言模型的TTS系统在情感表达上的局限性,该工作提出了HPRO(分层渐进式奖励优化)框架,核心突破体现在两个层面:
- 解耦潜空间设计:将内容信息与情感信息从共享隐空间中分离,解决了传统偏好优化中内容梯度与情感梯度相互冲突的结构性问题;
- 分层渐进式偏好优化策略:通过从粗粒度到细粒度的渐进式偏好提取与奖励建模,逐层对情感韵律进行精细化优化,突破了标准SFT范式导致模型收敛于统计均值韵律的瓶颈,显著提升情感表现力。整体方案将偏好驱动学习与层次化情感表征深度结合,为情感TTS的强化学习对齐提供了新范式。
- Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS
- 赛道归属: 文本转语音 / 基于流匹配的零样本语音合成引导策略
- 核心创新点: 针对流匹配零样本 TTS 中分类器自由引导的局限,提出联合残差重加权方法。创新之处在于重新审视独立遮蔽条件下的 CFG 机制,通过对文本条件与说话人条件的残差项进行解耦重加权,突破了现有分支选择性引导方法在"文本正确性"与"说话人相似度"之间的权衡困境,实现两者的协同提升。
- Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS
- 赛道归属: 文本转语音 / 基于扩散模型的韵律动态建模
- 核心创新点: 针对扩散模型 TTS 解码器在建模急剧韵律转换与快速音调变化时的不足,提出自适应振荡归纳偏置机制。相较于现有使用 Snake 激活函数的周期性非线性方法,该工作引入可自适应调整振幅与频率的激活函数设计,使模型在捕捉谐波结构的同时,具备对突变幅度和频率的灵活建模能力,有效提升表达性语音中细粒度韵律动态的合成质量。
- CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
- 赛道归属: TTS评测基准 / 中文新闻场景发音鲁棒性评测
- 核心创新点: 提出面向“原始输入”的中文新闻TTS目标级自动化评测基准,将易错的书面密集形式(比分、范围、单位符号、百分比、英文缩写、中英数混写专名等)显式定义为可定位的“发音目标”,并以目标是否被正确口播为核心指标,避免仅用整体MOS掩盖关键读音错误;强调在不做文本规范化前提下评估产品级TTS对真实新闻文本的读音保持与语义口播一致性。
- Joycent: Diffusion-based Accent TTS without Accented Phone Prediction
- 赛道归属: 文本转语音 / 基于扩散模型的口音语音合成
- 核心创新点: 提出 Joycent,摒弃了传统口音 TTS 依赖的两阶段管线(标准音素序列→口音音素序列→语音合成),避免了误差积累及对稀缺配对标注数据的依赖。核心创新在于直接在扩散模型框架内,通过声学特征层面的口音表征来建模口音特性,无需显式的文本级口音音素预测步骤,从而实现更自然、更精准的口音语音合成。
- Task-Vector Arithmetic for Emotional Expressivity Control in Language-Model-Based Text-to-Speech
- 赛道归属: 文本转语音 / 基于语言模型的情感表达强度控制
- 核心创新点: 将计算机视觉与 NLP 领域成熟的任务向量算术方法迁移至大规模 LM-TTS 系统的情感强度控制任务。通过系统性消融研究,在 Qwen3-TTS 模型上逐层对比 LoRA 权重、连续编解码嵌入、离散编解码 Token 及说话人嵌入四类操作空间,揭示了任务向量算术在不同操作粒度下对跨说话人情感强度迁移的有效性边界,为 LM-TTS 情感可控性提供了系统性的方法论基准。
- Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages
- 赛道归属: TTS主观评测方法 / 多语言(印度语系)偏好分析
- 核心创新点: 构建“受控的多维度成对评测框架”,通过语言学控制(覆盖母语与混码句、跨10种Indic语言)与感知维度标注相结合,降低TTS成对偏好评测在多语言场景中的高方差与不可解释性;在大规模众包设置下,把偏好拆解到可感知维度并进行系统性偏好归因分析,从而更稳定地比较多模型/多语言TTS质量差异。
- WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models
- 赛道归属: TTS推理优化 / 高效自回归TTS
- 核心创新点: 提出WAND框架,将预训练decoder-only AR-TTS从“全序列自注意力的二次复杂度”改造为近似常数复杂度:把注意力拆分为对条件token的持久全局注意力与对生成序列的局部窗口注意力,在保持条件可达性的同时限制生成侧上下文;再结合知识蒸馏把全注意力教师的质量迁移到窗口注意力学生,实现显著降低显存/算力开销而尽量维持音质与韵律。
GitHub
- [2026-07-01] huggingface/diffusers ⭐33959
- [2026-06-29] BinWang28/audio-ai-hub ⭐933
- [2026-06-30] Ameobea/web-synth ⭐559
- [2026-06-28] apocas/restai ⭐510
- [2026-06-30] dgrauet/ltx-2-mlx ⭐67
语言大模型
arXiv
- LLM-MINE: Large Language Model based Alzheimer's Disease and Related Dementias Phenotypes Mining from Clinical Notes
- 赛道归属: 医疗NLP / 临床文本信息抽取(表型挖掘)
- 核心创新点: 提出LLM-MINE,用大语言模型将非结构化临床笔记中的ADRD(阿尔茨海默病及相关痴呆)表型进行自动化抽取与结构化归因;方法上强调以“专家定义的表型 schema/标签体系 + LLM抽取流程”来覆盖分散在叙述文本中的关键信息,并通过专家标注/验证形成可用于早筛与分期的高质量表型数据资产。
- Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety
- 赛道归属: LLM安全与对抗防御
- 核心创新点: 提出了一种以"对抗性视角"为核心的LLM安全框架Yuvion,核心突破在于将安全问题重新定义为对抗性问题而非单纯的自然输入分布问题。该工作明确指出现有通用模型在涉及规划、工具调用等真实场景下的安全防护缺口,并通过构建对抗感知能力来应对策略性越狱与滥用攻击,而非仅依赖传统的过滤或拒绝机制。
- Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War
- 赛道归属: LLM评测基准 / 多智能体对抗与可靠性评测(推理+博弈+协议约束)
- 核心创新点: 提出Age of LLM这一1v1回合制对抗基准,将三类压力源系统化注入评测:战争迷雾(部分可观测)、完整外交沟通(谈判/停火/威胁且信息可隐藏)、以及严格JSON动作协议下的可靠性约束(非法动作被静默丢弃);通过私有引擎、随机地图种子与随机对手机制降低数据污染与“背题”风险,使评测更贴近真实交互式决策与工具/协议执行场景。
- Online Data Selection for Instruction Tuning via Gaussian Processes 🆕NEW
- 赛道归属: 指令微调 / 数据选择与质量优化
- 核心创新点: 提出GAIA框架,将数据价值评估从局部批次优化升级为全局估计过程。核心方法是引入高斯过程对数据效用进行全局建模,突破了现有在线数据选择方法"批次受限"的瓶颈,实现了跨批次的全局自适应指令微调数据筛选,从根本上改变了LLM训练中数据价值评估的范式。
- 赛道归属: Instruction tuning / Data Selection & Quality Optimization
- Search for Truth from Reasoning: A Dynamic Representation Editing Framework for Steering LLM Trajectories 🆕NEW
- 赛道归属: 推理优化 / 表征编辑
- 核心创新点: 提出动态表征编辑框架,针对LLM推理轨迹中"真值"的几何结构进行深入分析,揭示了三项关键规律。与静态表征编辑不同,该方法将内在控制机制动态注入展开中的推理链,能够在推理过程中实时引导模型向"真值"方向收敛,而非仅仅让模型"思考更多",从根本上解决了CoT等方法缺乏真值导向的问题。
- 赛道归属: Reasoning Optimization / Representation Editing
- Words Speak Louder Than Code: Investigating Cognitive Heuristics in LLM-Based Code Vulnerability Detection 🆕NEW
- 赛道归属: 代码安全 / LLM可靠性与偏差分析
- 核心创新点: 首次系统性地研究认知启发式偏差对LLM代码漏洞检测的影响。构建了受控实验框架,将人类认知偏差(如锚定效应、可得性启发等)引入代码漏洞检测场景,定量揭示了LLM在安全评估中受非代码语义信息(如注释、变量命名等"词语"线索)干扰的机制,为LLM安全工具的可靠性评估提供了新的方法论视角。
- 赛道归属: Code Security / LLM Reliability & Bias Analysis
- Attractor States Emerge in Multi-Turn LLM Conversations 🆕NEW
- 赛道归属: 多智能体系统 / LLM动态行为分析
- 核心创新点: 首次从吸引子状态的动力系统视角分析多轮LLM对话的长期演化规律。跨7个LLM模型和20个争议性话题,通过追踪表征空间轨迹、话语特征和立场变化,揭示了LLM多智能体交互中存在与话题无关的稳定行为集合,从根本上揭示了模型间长期交互的收敛机制,为理解和设计多智能体LLM系统提供了理论基础。
- 赛道归属: Multi-Agent Systems / LLM Behavioral Dynamics
- Collective cooperation without individual fidelity in LLM agents 🆕NEW
- 赛道归属: LLM智能体 / 社会模拟与人类行为建模
- 核心创新点: 采用直接实证基准对照方法,以大规模网络化囚徒困境人类实验为基准,系统比较9个开源LLM与真实人类决策数据。核心发现是LLM智能体在集体合作层面可复现群体涌现模式,但在个体忠实度上与真实人类行为存在显著偏差,精确划定了LLM作为人类代理的适用边界,为社会科学模拟研究提供了重要的方法论警示。
- 赛道归属: LLM Agents / Social Simulation & Human Behavior Modeling
- Using Large Language Models as Low-Cost Statistical Estimators for Human-Response Data 🆕NEW
- 赛道归属: 社会科学研究方法 / LLM统计估计应用
- 核心创新点: 从统计学理论层面严格证明了预训练LLM可作为低成本条件期望估计器,提出"受限函数风险等价"理论:在平方损失下,LLM诱导的估计器其风险与条件期望的贝叶斯最优风险相匹配。该理论突破将LLM的人类响应预测能力从经验性观察提升为可形式化证明的统计保证,为其替代昂贵人类被试实验提供了坚实的理论依据。
- 赛道归属: Social Science Methodology / LLM as Statistical Estimator
- Grounding LLM Reasoning under Incomplete Graph Evidence 🆕NEW
- 赛道归属: 知识图谱增强推理 / LLM图谱接地
- 核心创新点: 提出了在不完整图谱证据条件下对LLM推理轨迹进行接地的理论框架。核心贡献在于将不完整知识图谱的证据状态形式化为实体锚点、类型关系残差、路径能量和支持区域等结构化要素,并与LLM的先验分布相结合,从理论层面系统刻画了检索到的、不完整的图谱证据如何约束和引导LLM推理路径,填补了现有工作中对图谱不完整性理论分析的空白。
- 赛道归属: Knowledge Graph-Augmented Reasoning / LLM Graph Grounding
GitHub
- [2026-07-01] sgl-project/sglang ⭐29836
- [2026-07-01] google-ai-edge/LiteRT-LM ⭐5748
- [2026-07-01] flagos-ai/FlagGems ⭐1036
- [2026-07-01] lone-cloud/gerbil ⭐471
- [2026-07-01] wonglaitung/fortune ⭐58
HuggingFace Models
HuggingFace Datasets
- [2026-06-29] Glint-Research/Fable-5-traces
Glint Research Dataset Card Fable 5 Pi Agent Traces A compact, high-signal corpus of Fable 5 coding-agen...
- [2026-06-21] Crownelius/Complete-FABLE.5-traces-2M
Complete FABLE.5 Traces 2M
Full FABLE.5 / Mythos corpus restored, with session-limit answer rows removed. Dataset Viewer | Parq...
多模态大模型
arXiv
- DataComp-VLM: Improved Open Datasets for Vision-Language Models 🆕NEW
- 赛道归属: 多模态理解 / 数据工程与基准测试
- 核心创新点: 提出首个系统性的视觉-语言模型数据配方基准 DCVLM,整合了160个数据集(涵盖图文对、多模态交错文档、纯文本及指令微调数据)构成6T规模语料库,将数据筛选策略的评估标准化,填补了社区在VLM训练数据系统性比较研究上的空白。其核心突破在于将"以数据为中心"的实验范式引入VLM领域,使研究者能够在受控条件下对比不同数据策略的效果,而非依赖模型架构变化来解释性能差异。
- Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling
- 赛道归属: 多模态理解(长视频理解/高效采样与推理加速)
- 核心创新点: 将长视频帧选择形式化为“准高斯采样”问题,提出一种自适应、免训练的帧采样策略:用连续、可调的软采样分布替代传统关键帧“硬采样”,在计算/显存受限下更灵活地覆盖关键时刻并抑制噪声帧,从而在不改动模型训练的前提下提升长视频理解效率与效果。
- VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models
- 赛道归属: 多模态理解 / 计算光学与视觉语言模型协同设计
- 核心创新点: 提出 CODA 协同设计框架,针对冻结视觉语言模型的特性,将前端元光学硬件设计与 VLM 的感知偏好联合优化,而非追求传统人类可读的图像质量指标。核心突破在于:以 VLM 的任务性能(而非图像分辨率/像差等光学指标)作为优化目标,使紧凑型元光学在尺寸/成本受限场景下仍能维持高效的多模态理解能力,打通了物理光学设计与AI模型感知之间的优化闭环。
- AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs
- 赛道归属: 多模态理解 / 跨模态评测基准
- 核心创新点: 提出AMVICC基准,系统性地对比VLMs(图像→文本)与图像生成模型IGMs(文本→图像)在相同视觉概念上的失败模式,实现跨模态失效剖析。核心创新在于将图文双向任务置于同一评测框架下,通过"跨模态失败模式对齐"揭示两类模型在物体朝向、数量感知、空间关系等基础视觉概念上的共性与差异性缺陷,为多模态系统的弱点诊断提供了对称性视角。
- RiverONE: Generating Knowledge-Intensive VLM by Simulated Quantum Machines 🆕NEW
- 赛道归属: 多模态理解 / 轻量化模型与量子启发参数生成
- 核心创新点: 提出 RiverONE,利用模拟量子计算(而非真实量子硬件)在模型构建阶段生成结构化参数,将量子叠加、纠缠和测量诱导的非线性特征引入经典神经网络的权重初始化或参数生成过程,从而构建知识密集型轻量视觉-语言模型。核心创新在于将量子计算的高维信息表示能力以"软件模拟"形式移植至经典AI系统参数设计中,为紧凑型VLM提供了一种全新的参数来源范式。
- LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving 🆕NEW
- 赛道归属: 自动驾驶 / 多模态规划
- 核心创新点: 提出 LWDrive 框架,通过逐层世界模型引导机制将 VLM 输出的粗粒度语义驾驶意图逐步细化为几何精确、具有未来感知能力和多视角一致性的轨迹规划。其核心突破在于打通 VLM 语义层与底层运动规划层之间的鸿沟——不再将 VLM 输出直接用作最终轨迹,而是将其作为世界模型各层的条件信号,实现语义理解与物理可行性的分层对齐。
- Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models 🆕NEW
- 赛道归属: 多模态理解 / 模型评估与美学推理
- 核心创新点: 针对开放式美学评论任务提出新的评估范式,突破了传统数值评分对齐方式的局限,转而将 MLLM 生成的评论与多个经人工排序的参考评论进行比对,使用 Reddit Photo Critique 数据集对五个开源 MLLM 进行评测。核心创新在于将"排名人类参考"引入美学评估,构建了更贴近真实人类批评行为的评判标准,为衡量模型在无唯一正确答案的主观推理任务上的能力提供了方法论参考。
- Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages 🆕NEW
- 赛道归属: 多模态安全 / 内容审核与对抗鲁棒性
- 核心创新点: 系统性研究图像分辨率对 VLM 检测 ASCII 艺术形式有害内容的影响,覆盖八种字符构造模式(L1–L8,从密集块字符到词嵌入设计)及多语言场景,揭示了分辨率阈值与检测能力之间的定量关系。核心创新在于将分辨率作为核心变量引入 VLM 安全评估体系,首次量化了视觉编码的有害信息在不同渲染精度下对主流 VLM 内容审核能力的系统性威胁边界,为实际部署中的防御策略提供了可操作的技术依据。
- Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models
- 赛道归属: 多模态理解 / 视觉语言模型机制可解释性
- 核心创新点: 针对视觉语言模型中"视觉感知"与"先验知识"发生冲突时的决策机制,首次提出组件级因果分析方法,综合运用残差流、注意力头、MLP 子层三个粒度的激活修补与模型组件消融实验。核心发现是跨三个 VLM 家族均存在"视觉默认、先验覆盖"的层次化因果机制——模型默认优先处理视觉输入,但特定组件可触发先验知识对视觉证据的覆盖。该工作将行为层面的冲突描述推进至可追溯的内部因果机制层面,为提升多模态系统可靠性提供了可操作的机制洞察。
- Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
- 赛道归属: 多模态理解 / GUI智能体 / 不确定性量化
- 核心创新点: 提出Argus基准,专门针对"计算机操作智能体"场景下VLM预测的不确定性量化问题,系统评估多种后验UQ方法在跨模型、跨数据集、跨GUI界面变化下的稳定性。创新点在于引入"跨体制"评测范式,分离模型、数据集、界面三个维度的UQ排名漂移,并定义拒绝决策、空间安全区域等面向GUI点击执行的实用UQ指标,填补了GUI智能体可靠性评估的空白。
GitHub
- [2026-06-30] Blaizzy/mlx-vlm ⭐5102
- [2026-06-28] waybarrios/vllm-mlx ⭐1381
- [2026-06-25] EvolvingLMMs-Lab/NEO ⭐842
- [2026-06-26] liudaizong/Awesome-LVLM-Attack ⭐565
- [2026-06-29] FeiElysia/Tempo ⭐72
强化学习
arXiv
- RoAd-RL: A Unified Library and Benchmark for Robust Adversarial Reinforcement Learning 🆕NEW
- 赛道归属: 对抗鲁棒性强化学习 / Adversarial Robust Reinforcement Learning
- 核心创新点: RoAd-RL 提出了一个统一的开源对抗强化学习基准框架,核心突破在于:通过标准化抽象层统一了策略、攻击者和环境的接口,解决了现有研究中实现碎片化、评估协议不一致和可复现性差的问题。该框架将多种主流对抗攻击方法与鲁棒训练算法整合至单一平台,并建立了一致的评估协议,使不同方法之间的横向比较成为可能,推动了对抗RL研究的标准化与可重复性。
- FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
- 赛道归属: 大语言模型强化学习对齐 / LLM RL Alignment
- 核心创新点: 针对GRPO等策略梯度方法在训练中梯度方向不稳定的问题,提出反馈驱动的双目标协同强化学习框架。核心突破在于同时优化策略目标与反馈信号目标,通过双目标协同机制动态校正梯度方向,避免单一奖励信号导致的训练偏移,从而更稳定地解锁大模型推理能力。
- Qwen-Image-2.0-RL Technical Report
- 赛道归属: 文生图 / RLHF后训练优化
- 核心创新点: 针对扩散模型的后训练流水线,创新性地将RLHF与在策略蒸馏结合,构建任务特定的复合奖励模型,引入基于视觉语言模型微调的逐点打分范式与链式思维推理,从而为文生图任务提供更可靠的奖励信号,同步提升视觉质量与指令遵循能力。
- Staged Hybridisation for Visual Quantum Reinforcement Learning via Knowledge Distillation 🆕NEW
- 赛道归属: 量子强化学习 / Quantum Reinforcement Learning
- 核心创新点: 提出了一种基于知识蒸馏的"分阶段混合化"策略,专门用于解决视觉量子强化学习中高维观测、优化不稳定和变分量子电路容量受限三重困难并存的问题。方法上的突破在于:先训练经典视觉教师网络并冻结其编码器作为特征接口,再通过知识蒸馏将教师策略迁移至量子学生智能体,实现了端到端混合视觉量子RL训练的解耦,回避了从像素直接联合训练经典-量子混合系统的优化难题。
- Domain Adaptation with Adaptive Imagination for Visual Reinforcement Learning under Limited Target Data 🆕NEW
- 赛道归属: 视觉强化学习领域自适应 / Domain Adaptation for Visual Reinforcement Learning
- 核心创新点: 针对仿真到现实迁移中目标域数据极度匮乏的实际约束,提出了基于"自适应想象"的域自适应框架。核心创新在于:利用少量目标域数据动态生成与真实分布对齐的合成图像,通过自适应图像生成机制来补偿目标数据不足,从而在数据稀缺条件下维持有效的视觉策略迁移,突破了现有方法对大量目标域数据的强依赖假设。
- Be Faithful When Response: Returning Fluent and Grounded Answers for Vision-Language Models Reinforcement Learning 🆕NEW
- 赛道归属: 多模态视觉语言模型强化学习 / Reinforcement Learning for Vision-Language Models
- 核心创新点: 针对直接将RL应用于多模态推理时出现的语言先验利用过度、视觉证据被忽视、推理链流畅但不接地气等问题,提出了在RL训练前引入视觉忠实性引导阶段的两阶段训练范式。方法突破在于:通过在RL优化前先将策略引导至视觉接地的推理模式,构建了"先忠实后流畅"的训练机制,从根本上抑制了多模态RL中视觉幻觉和推理不忠实的问题。
- Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models 🆕NEW
- 赛道归属: 视觉-语言-动作模型强化学习 / Reinforcement Learning for Vision-Language-Action Models
- 核心创新点: 提出了一种无需外部环境反馈信号的测试时强化学习方法。核心发现与创新在于:揭示了离散动作VLA模型内部存在可利用的自评估能力——生成置信度与轨迹成功率具有显著正相关性,并基于此将模型自身的生成置信度作为内在奖励信号驱动策略更新,彻底摆脱了对预定义成功信号和外部评估器的依赖,为VLA模型的在线自我改进提供了新范式。
- PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF 🆕NEW
- 赛道归属: 大语言模型RLHF训练优化 / RLHF Training Optimization for LLMs
- 核心创新点: 提出了前缀采样PPO,专门针对无评价器RLHF方法中轨迹级学习信号均匀传播至所有token导致的优化低效问题。方法创新在于:通过对轨迹的不同前缀进行采样,将策略更新精确定位到包含关键学习信息的中间前缀,而非对完整轨迹执行统一更新,从而在长推理链场景下大幅降低优化计算开销,同时保持或提升学习效率。
- The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning 🆕NEW
- 赛道归属: 大语言模型强化学习训练稳定性 / LLM Reinforcement Learning Training Stability
- 核心创新点: 首次系统性地揭示并形式化了LLM强化学习中"训练-推理不匹配"问题的根本成因:由于LLM采用独立的推理引擎和训练引擎,即便模型参数同步,同一轨迹在两侧产生的概率也不一致,导致训练信号失真。核心方法突破在于提出以"单调推理策略"为真实优化目标,重新定向RL训练目标,从根本上化解训练崩溃与不稳定性问题。
- Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy 🆕NEW
- 赛道归属: 强化学习基准评估方法论 / RL Benchmark Evaluation Methodology
- 核心创新点: 这是一篇立场论文,提出了RL研究中一个被长期忽视的方法论问题:研究者常将"求解模拟器"与"将模拟器作为代理学习"两个根本不同的目标相混淆。核心贡献在于明确区分了这两种研究范式,并指出专门为刷榜设计的解法(如利用模拟器特异性漏洞)无法泛化至真实部署场景,呼吁RL社区在实验设计和评估协议上建立更严格的范式区分标准,以推动真正具有泛化价值的序列决策研究。
GitHub
- [2026-06-30] rllm-org/rllm ⭐5666
- [2026-07-01] natolambert/rlhf-book ⭐2088
- [2026-07-01] radixark/miles ⭐1642
- [2026-06-30] OpenMLRL/CoMLRL ⭐88 🆕NEW
- [2026-06-30] ex18a/pwnagotchi64 ⭐54
HuggingFace Models
HuggingFace Datasets
- [2026-06-24] Qwen/AgentWorldBench
AgentWorldBench
AgentWorldBench is a comprehensive evaluation benchmark for language world models, constructed from real-world observat...
- [2025-01-15] mlabonne/open-perfectblend
🎨 Open-PerfectBlend
Open-PerfectBlend is an open-source reproduction of the instruction dataset introduced in the paper "The Perfect Blend...
- [2026-06-29] bcbl190626/SpanishBCBL 🆕NEW
DECOMEG — Brain Activity During Typing (MEG & EEG)
Non-invasive brain recordings (magnetoencephalography, MEG; and electroencephalograp...
世界动作模型
arXiv
- Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation 🆕NEW
- 赛道归属: 具身导航 / 世界动作模型 / 空间感知规划
赛道归属 : Embodied Navigation / World Action Model / Spatial-Aware Planning
- 核心创新点: 现有基于世界模型的视觉导航规划器通常采用"验证中心范式",将目标意图与轨迹合成解耦,导致候选依赖、计算开销大、采样动作与预测视觉不一致等问题。本文提出 SWAM(空间感知世界动作模型),核心创新在于:
- 任务中心式联合生成框架:将观测与动作的生成统一建模,在给定起始与目标 RGB 观测后,同步生成导航动作序列与中间视觉帧,彻底摆脱对候选集的依赖;
- 空间感知能力嵌入:在世界模型中显式引入空间感知模块,增强模型对三维场景结构的理解,使预测的视觉观测与动作保持几何一致性;
- 范式转变:从"先采样后验证"的两阶段解耦范式,转变为端到端的联合推断范式,有效降低计算开销并提升动作预测的可靠性。
核心创新点 :
- ReWorld: Learning Better Representations for World Action Models
- 赛道归属 : 自动驾驶世界模型 / World Action Model for Autonomous Driving
- 核心创新点 :
[中文] 现有世界动作模型的研究主要集中于模型架构设计,而如何让模型高效学习更优质的世界表征以服务于规划任务,仍是一个待解决的问题。本文提出 ReWorld,这是首个专门面向自动驾驶世界动作模型的表征学习框架。其核心创新在于:突破了传统WAM仅依赖标准视频预测监督信号(即像素级重建损失)的局限,通过引入专门设计的表征学习目标,引导模型在训练过程中学习到更具语义性、结构性的世界状态表征,而非仅仅优化视觉保真度。这一框架与模型架构无关,具备良好的通用性,可作为现有WAM方法的即插即用增强模块,显著提升其用于规划时的表征质量。
GitHub
- [2026-06-30] OpenMOSS/Awesome-WAM ⭐994
- [2026-06-26] yuyangalin/ImageWAM ⭐102
由 Research Daily 自动生成 生成时间: 2026-07-01 01:03:18