AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢
梦瑶 发自 凹非寺量子位 | 公众号 QbitAI
大语言模型LLM(Large Language Model)在卷得飞起的同时——
LDM (Large Data Model),即 结构化数据基础模型 ,其瞄准的是生产侧的核心痛点:即如何让基础模型直接学习不同结构化数据中的变量关系、条件关系和生成机制。
像咱熟悉的美国 Google、Amazon ,德国企业软件巨头SAP等玩家纷纷下场布局~
不过,谁成想呢,巨头们刚涌进LDM抢位,一支中国团队已经先把榜首坐成了「固定席位」。
9月15日,德国软件巨头SAP抢发TabPFN-3.5,几小时后(9月16日),一支由 清华博士 组成的团队,用一个400M参数的结构化数据基础模型——
直接拿下了TabArena、TALENT、BCCO三个国际主流基准测试中二分类、多分类、回归等各项任务的 「第一」 ,呈现断层领先:
不卖关子,这个把谷歌等一众大厂按在地上摩擦的,就是「稳准智能」刚刚发布的: LimiX-2 。
去年他们发布的国内首个结构化数据基础模型LimiX已经上演过很长一段时间的霸榜大戏,但此后团队也没有追着榜单追赶,而是继续往底层技术和模型储备里扎。
在这家中国团队看来,真正重要的, 从来不是拿下一次第一,而是每到关键节点,都有能力重新回到第一。
而作为国内首个结构化数据通用大模型,LimiX啃下的,正是数据背后最值钱也最难找的「因果规律」。
相比TabPFN这类偏目标预测的行级建模路线,LimiX-2把 面向变量关系建模 前置为核心目标,学习跨变量、跨样本的联合依赖结构。
此外,其还自建了一套高质量 自动化数据合成引擎 ,先让模型见过足够复杂的数据世界,再去处理真实任务。
过去几年,LLM已经吃透了文本、语音、视频,但一碰到工业生产、科学研究等应用侧真正拿来做决策的场景,对因果关系、准确性和稳定性的要求会陡然提高,这也让LDM的价值开始越来越清晰。
当前就在这条越来越热的赛道中,稳准智能联合清华已然率先把成果跑进了行业头部位置。
LLM啃不动的数据分析硬骨头,LDM开始接手了
但热闹归热闹,随着AI真正往产业深处走,一个此前很容易被模型能力增长掩盖的问题,也开始变得越来越清晰——
文本、代码、论文、数学公式,甚至经过标注和描述的图像、视频,其中承载的知识都有一个共同特点,那就是它们已经经过了人类的一次理解、筛选和抽象。
LLM做的事情,就是把这些已经进入人类知识体系的信息编码成Token,通过海量语料学习上下文关系,再进一步形成知识、推理和生成能力。
△AI生成 但问题是, 在产业系统里,另一类数据是长期存在于这个语义层「之外」的。
以制造业为例,温度、压力、转速、原料配比、设备状态、能耗等几十、几百甚至上千个变量会同时变化,共同构成一个持续演化的高维数据空间。
更重要的是,产业真正关心的,往往也不是单个变量是什么,而是变量之间存在什么稳定关系,哪些关系可以跨环境成立,以及一个变量变化之后,系统整体会如何响应。
如果先把这类数据转写成文本,再交给LLM处理,中间天然会经历一次 「信息压缩」 。
但在生产系统中,那些被压缩掉的细粒度差异,恰恰可能直接决定预测精度、良率和风险判断,在语义空间里看似可以忽略的信息,到了生产空间里可能恰恰是最 值钱 的信息。
如果说LLM主要学习人类已经表达出来的世界,那么LDM更希望直接进入真实世界留下的高维数据空间,从变量关系本身出发理解规律。
能往生产深处扎,也能补足LLM对真实数据世界理解不足的那一块儿缺口,确实有前景啊。。。
随着AI越来越多进入复杂决策场景,LDM也正成为基础模型体系中越来越重要的一块能力拼图。
于是乎,这两年,海内外玩家也开始接连入场,结构化数据基础模型的竞争,正在明显《提速》。
今年 Google 直接发布TabFM,把表格数据基础模型正式纳入自己的Foundation Model版图。
Amazon 也推出Mitra,专门探索一个预训练模型如何跨不同表格、不同任务直接迁移。
SAP 动作更猛,先做SAP-RPT-1,今年又直接收购TabPFN背后的Prior Labs,投入超过10亿欧元扩建结构化数据AI研究团队。
就在几天前,最新的 TabPFN-3.5 Plus 又正式进入SAP AI Core,直接开始做现金流预测、付款延迟、供应商风险、客户流失这些企业核心决策任务。
从Google、Amazon一路到SAP,结构化数据基础模型已经从学术圈里的新方向,迅速变成全球科技巨头集体押注的一块基础能力。
重做底层技术范式,LimiX让模型理解数据背后的因果机制
稳准智能首席科学家、清华大学计算机系 崔鹏 教授,长期研究结构化数据与因果智能,也是LDM理念的提出者之一。
很长一段时间里,这支团队都在啃一些更底层的问题:Scaling规律能否延伸到结构化数据,CMNs能否进一步打开因果建模的能力上限。
如今,LimiX、LimiX-2连续冲上国际Benchmark前列,也让这条当初看起来更冒险的技术路线,开始得到模型效果的直接验证。
比如TabPFN为代表的PFN路线,核心目标很明确:给定上下文和目标,让模型快速适应一张新表,并把Y预测准。
这条路线非常适合分类、回归等任务,也推动了Tabular Foundation Model快速发展。
但当结构化数据模型继续往更深处走,一个问题开始冒出来: 如果我们想知道的,已经不止是「Y等于多少」呢?
毕竟生产侧真正关心的,往往还包括变量之间是什么关系,一个变量发生变化之后,其他变量会怎么动。
对于不少PFN类模型而言,数据通常会先被压缩成更高层的表示,再用于完成目标预测,这样做有利于快速适配任务,但问题是部分变量级的细粒度信息,也可能在表示过程中被折叠。
当问题继续从「预测结果」往「理解变量关系」推进时,模型需要保留和利用的信息粒度,也随之发生变化!!
△AI生成 而稳准智能这次在LimiX-2上真正动刀的,则是 结构化数据模型最底层的「技术范式」。
作为较早用机器学习方法研究变量关系和因果规律的团队之一,崔鹏团队长期关注的问题,就是如何让模型超越表面相关性,找到那些跨环境依然稳定的关系。
因此到了LimiX-2,稳准没有继续沿着传统预测范式往上堆能力,而是直接改了模型「学什么」——
团队创造性提出上下文机制网络 Contextual Mechanism Networks(CMNs), 把结构化数据建模从以目标变量为中心的预测问题,推进为面向全变量联合依赖和数据生成机制的关系建模问题。
如果说PFN仍然是在给定目标下学习怎么预测得更准,那么CMNs想回答的问题,已经变成了X、Y和其他变量放在一起,到底是怎么共同构成这份数据的。
换句话说,LimiX-2没再把变量关系当成服务于预测的中间信息,而是直接把它变成模型要学习的核心对象。
这种底层范式的切换有点类似大语言模型从BERT走向GPT,真正变化的核心,不只体现在参数规模和Benchmark上,更在于模型学习目标和组织信息的方式被重新定义了。
△AI生成 当然,CMNs这个新的学习目标,听起来很理想,真正做起来却没那么简单。
既然想让模型搞清楚变量之间到底是什么关系,训练时就不能永远给它一道「固定」的题。
所以稳准团队联合清华在LimiX-2做的一件重要的事,便是通过提出 上下文条件掩码建模(CCMM) ,并升级自动化合成数据的生成引擎,不断给模型换题——
通过不断遮住-预测不同变量,逼着模型从预测单一目标,转向学习变量之间的条件依赖和联合结构。
反复训练后,模型掌握的也就不只是某一道题怎么答,而是逐渐理解:这些变量彼此如何作用。
预测目标不断变化,模型也就没法只围着某一个Y死磕,而得慢慢把整张表里变量之间的关系摸清楚。
此外在底层技术层面,LimiX还进一步将建模粒度下沉到 Cell-Level ,以单元格作为基础表示单元,保留列身份、具体取值和缺失状态,并支持跨变量、跨样本的信息交互。
在这套框架下,分类、回归、缺失值填补等任务,都可以进一步统一为对同一个数据模型的不同查询;而对联合关系的持续建模,也为后续的结构发现乃至因果骨架发现提供了基础。
CMNs先把「目标」改成学关系,CCMM负责让模型真正去「学关系」,Cell-Level负责保留各种细粒度「特征」,三者共同构成一套从学习目标、训练机制到数据表示的技术范式。
中国LimiX-2研发团队成果到底有多强?
对LDM来说,比再刷一张AI榜单更重要的,是它能不能把这些能力真正带进生产环境。
而在走进真实场景之前,LimiX-2已经先在主流Benchmark上把这条路线跑到了行业头部。
在TabArena、TALENT、BCCO等国际主流Benchmark中,LimiX-2在二分类、多分类和回归任务上均位居第一,超过Google TabFM、TabPFN、TabICL、Mitra等模型。
分类任务解决的是「它到底属于哪一种状态」的问题,比如设备会不会故障、客户会不会流失、一笔交易是否存在风险,本质上都要求模型从大量变量中找出真正影响结果的信号。
在TabArena评测中,按Elo排名,LimiX-2四项指标均居第一,Elo达到1917,领先TabFM+143分。
回归要求模型进一步理解连续变量之间的依赖关系,并最终把这种关系压到一个足够准确的数值预测上。
在TabArena回归任务中,按Elo排名,LimiX-2四项指标均居第一,Elo达到2206,位列第一。
换句话说,LimiX-2的优势已经不只体现在「分得对」,也开始体现在对连续关系建模得更细、更准。
CMNs把学习目标进一步扩展到变量关系建模,对训练数据的多样性也提出了更高要求。
因此,LimiX-2升级了大规模自动化合成数据引擎,覆盖更多分布、交互关系和噪声类型,让模型提前见过更丰富的数据结构,从数据侧支撑能力维度的扩展。
不仅如此,除了分类、回归等预测能力,LimiX-2也开始把能力进一步推向因果发现。
面对高维复杂数据,传统方法往往受专家先验和统计假设限制;而在Sachs、UF、Causal Chamber等公开数据集上,LimiX-2已经领先多种传统因果发现方法。
分类、回归和跨数据泛化,都是企业的日常任务。这类榜单真正检验的,是模型面对真实数据时能否稳定预测、迁移并支撑决策。
从Prediction走向Relationship、Causality、Intervention、Decision,让AI进一步理解真实世界中的变量关系、生成机制和变化规律,直达通用因果智能。
它让行业第一次清晰看到,基础模型一旦跨过能力临界点,AI就可能从解决单点任务,走向更通用的智能。
理解变量如何彼此作用、因果如何层层传导,以及一个微小变化,最终会把整个系统推向哪里。
而LDM这块竞争场域所指向的,恰恰就是这块仍处早期、却可能决定AGI下一阶段能力的 GPT-3时刻 ——
就在这个可能决定下一阶段AI能力上限的赛道上,显然已经有中国团队走到了行业头排。
[1]技术报告标题:LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
[2]技术报告地址: https://arxiv.org/abs/2609.17488
[3]Github:https://github.com/limix-ldm-ai/LimiX
[4]Huggingface:https://huggingface.co/stable-ai/LimiX-2
[5]model scope: https://modelscope.cn/models/stable-ai/LimiX-2
千万奖池找“鲸锐”!单项奖金200万,只等一个最会用AI讲故事的你 2026-09-19
华为汪涛:华为要打造AI算力底座,只做好一颗芯片远远不够 2026-09-19
AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水 2026-09-19
从“会回答”到“会办事”,vivo如何解AI手机这道题? 2026-09-17
相关阅读
在恋爱游戏里跟你实时聊天的“AI”,其实可能是一位抠脚大汉
解锁产业互联网新周期,他们都说了什么
车圈新卖点8155背后,汽车智能化竞争已踩下油门 | 幂集创新
阿里和清华联手一呼:我们给钱给资源,求解这些AI安全难题
比GPU更胜任AI计算的芯片已经诞生?参与直播,带你认识高性能“GPU+”架构 | 量子位·视点
瑞为技术完成数亿元C轮融资
热门文章
Kimi突发K2.8:性能逼近K3,百万上下文全员开放
AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4
A社承认Claude安全对齐存在缺陷,但“尚无解决方案”
探索RSI,生数新世界模型让机器人开始自我进化
首届蚂蚁灵波具身大模型挑战赛正式启动
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1