AI 日报hiw3c.com

金融AI的年度大考交卷了:2万名选手、30+家机构、百亿级数据开源

量子位 www.qbitai.com 网页快照

金融AI的年度大考交卷了:2万名选手、30+家机构、百亿级数据开源

鹭羽 发自 凹非寺 量子位 | 公众号 QbitAI

清北、复旦、麻省理工等海内外顶尖高校学子,以及大厂核心技术骨干,纷纷汇聚一堂,赛场内火力全开——

有人从L2行情中识别资金动向,有人拆解复杂金融文档,也有人掏出Harness、RSI,让Agent读懂市场情绪。

除了有历届成果集中亮相、创投资本1v1现场对接、HR一站式发offer,千问AI眼镜等前沿技术产品也同步开放体验。

这正是有着 「金融AI创新年度风向标」 之称的AFAC金融智能创新大赛(AFAC2026)总决赛现场,也是迄今为止举办的第四届。

上海市科学技术委员会、中国计算机学会、北京大学、蚂蚁集团、GFTN全球金融与技术网络、真格基金、中国银行……

参赛选手更是五湖四海掐尖而来,自 2023年首届举办 以来,AFAC大赛已累计吸引来自全球超2万支队伍6万名选手,覆盖600余所高校、700余家企业。

最关键的是,AI技术专业度拉满,几道赛题几乎把当下金融AI最热门的内容一网打尽。

一场真实场景的金融大考 普通算法比赛通常可以被压缩成一个清晰目标,也就是在固定数据集上,把某个指标刷到更高。

真实业务中,多调用一次模型就是实实在在翻倍的成本,而且光答案合理还远远不够,还要系统说明依据来自哪儿,要经得起复核。

所以再看AFAC2026大赛的四道挑战组赛题,都在尽可能模拟真实金融场景下的压力:

据赛题一 「市场参与者交易行为识别与资金流向分析」 的评审专家、中科大计算机学院副院长、软件学院副院长、教授 王超 介绍:

这道题研究的是一个非常经典的问题,在二级市场乃至大模型出现之前,市场参与者的交易行为识别就已经存在。

数据:数据规模、多样性、多模态特性和可变性都发生了很大变化,给交易行为与主体识别带来了新的挑战;

评价标准:赛题包含两个子任务,其中一个没有明确的评价指标。选手面对的是开放问题,而非命题作文,需要自行构建逻辑框架与评估体系;

系统的动态特性:模型面对的是不断变化的市场,能依赖的却只有静态的历史数据。从静态走向动态,中间隔着迁移与泛化的复杂过程。

三个标准相继击中了传统Benchmark的痛点:一次高分可能来自偶然,一套真实可落地的系统却能在条件变化后依旧成立,还要讲清楚为何成立。

OCR识别出字符,并不等于模型读懂了文件。赛题二的评审专家、复旦大学计算机科学技术学院教授 张军平 指出:

真正困难的是超长表格。大部分大模型无法一次性完成识别,还需要后处理来补足。

更麻烦的是复杂表格的 鲁棒性 ,金融没有永远固定的模板,模型能否稳定适应这些变化,都是未来方案迁移到业务场景中亟需解决的问题。

张军平同时也观察到,本届不少选手的策略仍依赖参赛者本人对文档的理解,下一步要做的,是 把人的理解真正转化为机器能力 。

所以这道题可以说是,既抓住了金融文档智能的现实痛点,又瞄准了企业AI未来的关键。

另一边,赛题三 「稀疏反馈下的自动化实验挑战」 把困难放进了Agent决策过程。

Agent需要像研究员一样,在无法并行、预算有限的情况下,根据每轮实验完成闭环反馈。

赛题三评审专家、蚂蚁集团财富保险事业群资深算法专家 陈召群 将它指向了Agent产业化的关键节点。

流程自动化本身就是技术商业化的一种典型范式,生成式AI让环节之间相对模糊的交接成为可能,这也是我们希望通过这道赛题呈现的意义。

赛题强调资源约束,也是因为技术一旦从POC(概念验证)走向大规模应用,成本和ROI是绕不开的话题。

无独有偶,同样的逻辑也发生在赛题四 「金融长文本Agent的动态记忆压缩与高效问答挑战」 中。

乍看之下,把整份文件一股脑塞给模型,似乎就能解决问题。可到了机构级调用量,这条路线很快就会同时撞上成本和效果两堵墙。

真正拉开差距的,不是Prompt写得多漂亮,而是系统是否具备 上下文控制能力 。

这同样也是现实业务场景的需要,Token消耗会直接决定该项能力能否以合理成本服务海量用户。

蚂蚁集团财富保险事业群财富AI Lab研发负责人 徐万青 ,用互联网与AI的成本曲线作了一个对比:

从互联网时代进入AI时代,我们逐渐意识到二者的成本结构不同。 互联网时期 ,新增用户的边际成本很低,甚至可能接近零。 AI时代 并非如此,边际成本曲线也许会缓慢下降,但不会归零。每增加一个用户,就会增加一份Token消耗,而这些Token都对应真实成本。

换言之,成本并非技术能力之外的一道附加题,它就是能力本身的一部分,也是AI逐步走向产业应用、面向用户创造价值的一种体现。

所以总的来看,今年的题目看似多元分布,归根结底都是在考验 模型能否在真实约束中持续完成任务 。

四届赛题,画出金融AI的技术迁徙

如果我们把2026年的题目单独拎出来看,Agent、Token经济学、自动化科研,上半年AI圈讨论度最高的几条主线,全在里头了。

蚂蚁做出了一个在当时看来颇为大胆的决定,直接将金融赛事与前沿大模型技术绑定,这在以稳健著称的金融业并不多见。

到了第二年 ,模型能力跃迁让金融垂类应用加速,讨论开始从要不要用大模型,转向如何接进具体业务。

同年,AFAC设立初创组,把考察范围从算法方案扩展到商业落地,技术第一次需要回答比赛之外的问题。

2025年 ,金融AI不再满足于一个答案,因果溯源、逻辑推理和工具调用的重要性也日益增长,考题也随之将重点放在工业级约束上。

智能体能否管理上下文、能否适应动态环境、能否利用稀疏反馈、能否控制调用成本,成为比智能程度更具体的问题。

这条技术迁徙路径,也被本届总决赛上正式开源发布的 「AFAC百万金融智能数据集」 完整保留了下来。

数据集沉淀自2023年至2025年的14道高价值赛题,包含13万条评测样本、2000余份专业金融文档和130多个历届优胜方案,覆盖百亿级金融科技数据条目。

数据形态从单模态到多模态,核心能力从单一精度预测到复杂推理,落地应用也从单点模型微调走向面向真实业务的综合智能系统。

于是多年的 Know-how经验 转换成外部研究者共用的接口,后来者也能沿着已有方案继续往前走,摸索出更多的新技术反哺赛事和数据集。

赛题定调,生态定速

正如 徐万青 所说,把一个好想法变成稳定、高效、成本最优且可执行的产业方案,仍要在大量实现细节中持续打磨。

SGInnovate Director Jae Annie Tay 长期参与新加坡深科技生态建设,第一次来到AFAC,她注意到:

团队越小,越需要一个足够大的外部生态提供支持,让创业者始终能够连接到所需的人才、资金和产业资源。

它一端站着高校、开发者和年轻初创团队,另一端放置蚂蚁长期积累的业务场景,两端之间是围绕赛事搭起的 一整套连接人才、场景、资本和产业的转化体系 。

以今年为例,大赛发起机构扩张至33家,首次新增新加坡金融科技节的发起方GFTN—全球金融与技术网络(Global Finance & Technology Network),孵化网络也在层层加码,为早期团队技术验证提供 创业辅导、资本对接和孵化入口 。

除了百万奖金池,AFAC还提供算力支持、大厂直通机会和6个月加速成长计划,并携手WAIC世界人工智能大会、外滩大会、CNCC中国计算机大会等平台,进一步打开产业交流和国际连接的空间。

赛场负责验证方案,论坛让学术界、产业界与创投机构交换判断,展区则让技术和项目获得进一步show time~

细分的两个组别中,挑战组解决的是如何从真题中识别能力,初创组接着回答如何把能力变成产品,两条路径最终殊途同归,落于真实场景。

毕竟赛题赛制可以模仿,奖金规模也可以追赶,但恰是这样一套 生态系统 ,才是抄也抄不来的。

毫不夸张地说,也只有像 蚂蚁 这样长期深耕金融AI的产业参与者,才能既将问题从真实金融业务中抽丝剥茧,又为答案提供持续生长的土壤。

因为最接近,所以最懂得,才能大浪淘沙,在每年最热的技术浪潮退去之后,把那些被泡沫冲刷出来的 真问题 迅速摆上考场。

世界生成模型来了3D头部玩家,可进入生产管线的场景级生成时代来临! 2026-09-03

114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型 2026-08-05

相关阅读

万亿思考模型新速度!蚂蚁开源Ring-2.5-1T:IMO金牌水平,强;混合线性架构,快!

杭州蚂蚁投了家腾讯系具身智能公司

更高智商更快思考!蚂蚁开源最新万亿语言模型,多项复杂推理SOTA

蚂蚁代码大模型商业化:全面融合SOFAStack,机构产研效能提升30%

真AI用钱表达:这家少年班毕业生创办的AI公司三年就盈利,增速300%

大模型开发生态还有哪些新机遇?9月13日来外滩找答案 | 报名开启

热门文章

去年归国的徐梦迪,成了清华姚班班主任

AI本地部署不如官方版的元凶找到了:734个依赖包,每一个都可能坑

Claude开始训练Claude!4美元一小时,跑赢150美元人类研究员

20ms把PDF变成Markdown!开源OCR神器快了近300倍

Coding不再是程序员专属!阿里Qoder这波有点绝

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1