0
作者:岑峰
7月8日,机器学习领域最具影响力的顶级学术会议ICML 2026进入正会第二天。本次大会共接收6352篇论文,其中Spotlight论文536篇(占投稿总数的 2.2%),Oral 论文168篇 (仅占投稿总数的 0.7 %)。
作为机器学习领域最顶级的学术会议之一,ICML 今年的 Spotlight 论文涵盖了从图像美学评估到无线电信号理解、从3D生成到Agent优化等多个前沿方向。
雷峰网已派出报道小组赴首尔COEX会展中心参会。在会议现场,我们从Poster展区的数千张学术海报中精选出最具代表性的研究成果,以“一张图 + 一段解读”的方式呈现给未能亲临现场的读者。
以下精选Poster Session 4 九篇Spotlight论文。从这9篇Spotlight论文,我们可以发现以下趋势(如果你也想让你的研究成果出现在这里,请与我们联系):
具身智能与自动驾驶正加速迈向深水区,视觉-语言-动作(VLA)模型成为解决高延迟、灾难性遗忘与跨环境泛化等落地痛点的绝对主力;
大模型研究告别盲目扩张,开始“向内”深挖免训练的底层推理机制(如引入L2范数),“向外”追求多模态感知层级的统一理解;
因果推断在打通底层统计理论壁垒与解决复杂微服务故障定位上展现出巨大的双重潜力;
面对算力瓶颈,聚焦张量内存虚拟化与轻量级免训练算法的AI底层系统与效能优化,正成为支撑前沿AI运转的刚性需求。
下面是这9篇论文的图文解读:(如果你也想让你的研究成果出现在这里,请与我们联系)
当前对大语言模型(LLMs)推理机制的研究,普遍缺乏对内部层级推理动态的系统性量化分析。针对这一痛点,论文创新性地提出,将隐藏状态的l2范数作为衡量模型推理强度的内生指标。
研究团队通过稀疏自动编码器观察并理论证明,模型后期层中显著的推理特征激活增强与数的变化密切相关。基于这一核心发现,论文巧妙地提出了三种基于l2范数的测试时调整技术(包括层级递归、内生状态引导及响应选择)。这些方法的突出优势在于“开箱即用”,完全无需额外的模型训练或数据支持。
在多种模型架构与基准测试中的广泛实验表明,该方案能有效提升大模型的推理性能。本研究不仅首次明确了隐藏状态l2范数与推理强度的内在关联,更为理解和操控大语言模型的推理过程提供了简单高效的全新视角。
论文链接:https://icml.cc/virtual/2026/poster/66815
该论文聚焦于零样本逆问题,致力于在无需外部训练数据的前提下,仅凭单一退化观测即可恢复干净信号,从而打破传统方法对复杂大模型的依赖。
作者在研究中发现,随机网络结构本身即可作为一种架构先验。基于此现象,文章提出了一种名为**“Lottery Prior”**的轻量化逆问题求解器。该方法巧妙地结合了压缩理论,通过随机网络和集合优化,实现了基于率失真约束的隐式正则化。
在去噪、含噪超分辨率以及图像修复等多项实验中,该方法仅使用了显著更少的有效参数,便达到了当前的最优(SOTA)性能。本文的重大贡献在于首次构建了结合压缩理论的随机网络逆问题求解框架,不仅揭示了其隐式正则化作用,还提供了明确的非渐进误差界,具备扎实的理论与应用价值。
论文链接:https://icml.cc/virtual/2026/poster/63286
本文(入选ICML Spotlight)聚焦于多模态大模型的视觉理解瓶颈。尽管当前模型在常规视觉任务上进展显著,但在“感知层级”的图像特征(如美感、画质等)理解上仍显薄弱,且业界长期缺乏统一的定义与综合评价体系。为此,研究团队提出了涵盖美学、质量、结构和纹理四大领域的感知级图像理解统一框架。
在核心方法上,研究巧妙结合了“领域自适应预训练”与“任务优化的强化学习”技术,成功打造出能够泛化处理各类感知任务的强基线模型 UniPercept。此外,团队还构建了大规模分层定义数据集,通过视觉评分与问答等多项任务充分验证了模型的优异性能。该研究不仅首次系统性地定义了感知层级图像理解,更通过提供统一的基准测试(UniPercept-Bench)与强基线模型,为多模态大模型在深层视觉感知领域的演进奠定了坚实基石。
论文链接:https://icml.cc/virtual/2026/poster/65959
现有的自动驾驶系统在引入视觉-语言模型(VLM)以提升复杂场景理解时,常面临推理与行动空间分布错位、预训练模型推理能力未充分发挥,以及高推理延迟导致实际驾驶性能下降等痛点。为此,本篇ICML论文提出了一种全新的端到端自动驾驶框架——AutoMoT。该框架成功构建了一个统一的视觉-语言-动作(VLA)模型,旨在彻底打通场景推理与驾驶动作生成之间的壁垒。
在核心技术层面,AutoMoT创新性地采用了混合Transformer架构,并引入了“异步任务执行”机制,这一设计极大地优化了模型的推理效率,有效缓解了动作策略生成时的延迟问题。此外,研究团队还巧妙结合了动作精炼模块,通过扩散式微调技术进一步提升了驾驶动作生成的质量与精准度。经过在多个基准测试中的开放与闭环实验验证,AutoMoT展现出了与当前最先进(SOTA)方法相竞争的优异驾驶性能。该研究通过统一架构、异步执行及动作精炼三大创新,为高效、安全的端到端自动驾驶提供了极具潜力的新范式。
论文链接:https://icml.cc/virtual/2026/poster/64489
论文深入探讨了“结构学习”与“条件独立性检验”之间的内在联系。长期以来,明确这二者在统计复杂性与最优性上的确切关系,一直是该领域的关键问题。
为此,研究团队建立了一种一般性的转化机制,旨在刻画结构学习问题中的minimax最优率及其决定因素。该研究通过严谨的现象分析证明,无论是在Bernoulli模型、高斯模型还是非参数模型下,结构学习的最优率实际上均可直接由条件独立性检验的最优率推导而出。在具体方法上,作者提出了一种基于经典PC算法的适配优化算法,巧妙地将复杂的结构学习任务还原并转化为条件独立性检验任务,并通过多种理论模型示例验证了该推导的适用性。
论文链接:https://icml.cc/virtual/2026/poster/60976
针对当前大模型推理任务对内存灵活性的极高要求,现有的软件定义分页方法(如vLLM)虽能缓解内存压力,却破坏了连续张量抽象。这不仅暴露了内存碎片化的复杂性、增加了开发负担,且操作系统的序列化瓶颈也严重拖累了内存映射效率,进而限制了算法创新。
为解决这一痛点,这篇ICML Spotlight论文提出了CONTINUUM系统。该系统引入了一种高效的张量内存虚拟化子系统,通过结合轻量化GPU驱动扩展,成功绕过了操作系统的性能瓶颈。同时,研究团队创新性地设计了“Elastic Tensor”机制,以支持灵活的张量操作,从容应对复杂的内存动态需求及高效拓扑复用。
多项动态场景下的实验评估表明,CONTINUUM展现出了显著更高的系统吞吐量和极低的内存映射时延,充分验证了其在高速大模型推理任务中的优越性。总体而言,该研究不仅成功构建了一个高效的底层张量内存虚拟化系统,还提出了一套贴合动态AI工作负载的新型张量操作接口,为下一代大模型应用的高效实现提供了强有力的底层支持。
论文链接:https://icml.cc/virtual/2026/poster/62347
在机器人策略学习中,模型在掌握新技能时往往面临严重的“灾难性遗忘”问题。以往的研究多局限于探索从零开始训练的小规模行为克隆模型,而这篇ICML Spotlight论文则率先将目光投向了大规模预训练的视觉-语言-动作(VLA)模型。
针对大模型在持续学习中的表现,研究团队采用经验回放(ER)技术,在多种任务场景下使用小规模回放数据对VLA模型进行了测试。实验揭示了一个反直觉的重要现象:预训练机制能够显著降低模型的遗忘风险。在仅依赖极小规模回放缓冲的情况下,预训练模型不仅能保持强劲的前向学习能力,还能迅速恢复那些看似已经遗忘的旧技能。
该研究深入剖析了预训练模型在持续学习中的知识保留与动态恢复能力,有力地证明了大规模预训练大模型本身即具备优异的抗遗忘特性。这一发现不仅彰显了预训练对知识动态变化的关键作用,更为在大型机器人模型中应用简单高效的经验回放方法提供了坚实的理论支撑。
论文链接:https://icml.cc/virtual/2026/poster/63561
现代云系统微服务架构的复杂依赖关系使得传统故障诊断举步维艰。尽管因果模型被引入该领域,但现有方法通常依赖完整的因果图或海量故障后样本,导致在实际低样本场景下效率极低。
针对这一痛点,本篇ICML Spotlight论文提出了一种全新的贝叶斯根因发现方法(BRCD)。该方法打破了对完整图的依赖,仅利用预先学习的部分因果图结构,并结合前沿的均匀DAG采样框架进行贝叶斯推断。这一创新不仅有效避开了穷举因果图的计算难题,更首次在非参数根因分析中提供了统计一致性保证。
通过在合成基准及Online Boutique等三个真实微服务数据集上的广泛实验,BRCD展现出了卓越的性能。即使在故障样本极少的苛刻条件下,它仍能精准、高效地定位故障根因,并具备向大规模因果图扩展的能力,其准确率在多个数据集上均达到了当前的SOTA(最先进)水平。
论文链接:https://icml.cc/virtual/2026/poster/65359
现有的视觉-语言-动作(VLA)模型在面对环境分布转移时常面临性能下降的困境。传统方法过度依赖以动作为中心的潜变量来构建行为表征,导致时间片段化及静态执行对齐失效,模型难以在复杂多变的场景中实现跨环境的泛化与一致性行为。
为此,本篇ICML Spotlight论文创新性地提出了BehaviorVLA框架。该方法由两部分核心构成:基于因果Mamba架构的视觉运动行为编码器,以及与任务进程动态对齐的阶段条件行为解码器。这种设计有效克服了传统方法受限于短时间片段的难题。
实验表明,BehaviorVLA在RoboTwin 2.0、LIBERO及CALVIN等多项基准测试中均取得了领先效果。尤为瞩目的是,在真实环境的迁移任务中,它仅需50%的数据量即可匹敌现有方法的性能。该研究成功实现了跨环境一致性行为表征学习,大幅提升了VLA模型的数据效率与泛化能力,为解决分布转移问题提供了高效的新方案。
论文链接:https://icml.cc/virtual/2026/poster/66596
雷峰网(公众号:雷峰网)&AI科技评论将继续在现场带来更多ICML 2026的精彩内容,如果你想推荐ICML上的其他论文,欢迎联系我们进一步交流探讨。
一个人读论文太孤单,一群人刷顶会才好玩。
ICML 2026 召开在即,我们正在召集一波含金量极高的 AI 研究者。群内主打实时论文跟踪与硬核技术探讨,拒绝灌水。
? 进群传送门: 扫码进群或添加微信Vin_Vivid,备注:论文群 + 关注的 AI 方向。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注专区。
雷峰网原创文章,未经授权禁止转载。详情见转载须知。