AI 日报hiw3c.com

国产RSI模型交卷!Flash模型靠它反打旗舰

量子位 www.qbitai.com 网页快照

国产RSI模型交卷!Flash模型靠它反打旗舰

从硅谷一路烧到国内, 「让模型参与训练下一版自己」 几乎一夜之间成了AI圈最热的叙事。

而就在这一当口,「港股AGI第一股」云知声正式发布U2-Flash,率先交出一份国产RSI早期答卷 。

△图源:云知声 在U2-Flash的后训练闭环里,模型已经开始深度参与自身演进:

按行业惯例,Flash一般默认是「旗舰平替」,通常更快、更便宜,但能力相对打折。

速度和省钱能力的提升确实没含糊。相比U2,其生成速度提升2.1倍,Agent任务完成时间缩短35%,任务迭代步数和Token消耗也降低了20%至30%。

DeepSWE v1.1从上一代U2的32分冲到64.6分,直接翻倍;

TerminalBench 3.0从2.7分飙到24.3分,达到9倍;

SWE-Bench Pro拿下61.6分,较前代提升10.5分。

它采用稀疏MoE架构,总参数约266B,单次推理只激活约10B, 不到总参数的4%,却在代码、Agent等任务上,交出了足以和主力模型正面掰手腕的成绩,部分表现甚至闯进万亿参数级模型所在的区间 。

把Flash当干活主力,答案这次是:yes!

打开云知声MaaS平台,U2-Flash已经摆在首页,平台支持在线体验以及申请API调用。

重点看了下API,它同时兼容OpenAI和Anthropic两套主流协议,Claude Code、Trae、Cursor、Cline这些常用工具官方给了接入方式,剩下的Harness只要支持自定义模型,换下Base URL、API Key和模型ID就能接。

顺带一提,U2-Flash还提供none、low、high和max四档思考强度,可以按任务难度在速度和推理深度之间切换,不过WorkBuddy这次没有开放手动切档,我也就没有强行横评。

输入价格0.6元/百万Tokens、输出价格1.2元/百万Tokens、缓存命中价格0.12元/百万Tokens。

熟悉国内主流模型API价格的我知道,U2-Flash基本可以归属「便宜」这一档。

9月15日至9月30日,人人都能免费领取1亿Tokens使用额度。

1亿Tokens,按一次代码仓库分析或长文档任务消耗几十万到百万Tokens计算,也够连续跑上数十到上百次。

我直接拉了一个表格对比了一下U2和U2-Flash,然后挑出了三个需要重点测试的地方。

U2-Flash虽然只支持文本输入输出,但接入Harness和外部工具后,照样能交付PPT,甚至搭建3D场景 。

视频地址:https://mp.weixin.qq.com/s/JH9JICzAqfYz0xyfbCeaOQ

PPT提示词是AI顺手帮我写的,我只给了一个大致方向,U2-Flash便自动搜集公开资料、梳理内容结构,再一路完成设计与交付。

Case 1:不给Issue,自己找Bug

为了排除模型见过答案的可能,我专门虚构了一个全新的ExpenseFlow报销统计项目。

一笔北京时间8月1日凌晨提交的记录,存成UTC时间后又被系统塞回了7月;

请独立完成发布前验收,自己找问题、改代码、补测试,最后交付完整结果。

视频地址:https://mp.weixin.qq.com/s/JH9JICzAqfYz0xyfbCeaOQ

结果,它只用了 7分6秒 就准确揪出了全部问题,还附赠了一份内容详尽的验收报告。

Case 2:撞墙之后,能不能自己回来

README给了错误的启动命令,旧文档写着过期字段,历史日志又把问题甩给了网络 。

请独立完成ProfileSync 2.0发布前验收,自行确认运行方式和接口契约,发现问题后完成修复、补充测试,并交付完整结果。

仅用时3分32秒 ,它便锁定真正故障、完成修复,还把测试从1项补到7项,最终全部通过。

视频地址:https://mp.weixin.qq.com/s/JH9JICzAqfYz0xyfbCeaOQ

Case 3:14份文件一股脑塞进去,能不能直接交稿

里面既有Brief、采访和产品白皮书,也有Release Notes、数据表、客户案例、会议纪要、合规说明和行业报告。

包含1200至1500字发布稿、核心事实来源表、材料冲突清单,以及五个发布前待确认问题。

它没有沿用旧Brief里的10月8日,准确采用了最新版的10月18日;也没有误用旧版81.2%的成绩,更新为78.4%,并注明属于内部测试。

视频地址:https://mp.weixin.qq.com/s/JH9JICzAqfYz0xyfbCeaOQ

从找Bug、辨别错误线索到处理14份材料,它都一路跑到了最终交付,展现出了主力模型该有的执行力。

U2-Flash背后的「后训练闭环」

深耕行业十余年,云知声积累了海量真实场景数据与高质量标注能力,这为后训练提供了不可替代的数据质量壁垒。好数据是好模型的第一性原理——正是多年沉淀的高质量数据,让U2-Flash的后训练效果远超纯规模驱动的方案。

U2-Flash会根据当前能力动态生成新任务,专门挑选那些「现在还做不好,但已经接近突破」的问题。

目前,这套闭环已经自主构建出近 10万道高质量SWE任务 ,覆盖多种主流编程语言。

Agent训练特别耗时间,一个任务可能要连续调用几十次工具,中间还得等待代码运行和环境反馈。

而U2-Flash直接把任务拆给多个Worker,让它们同时进入不同沙盒执行。有人跑代码,有人调工具,有人尝试另一条路径,后方的策略更新则持续进行。

同时,系统会给关键Action做标记,把最终的成功或失败,一路追溯到真正决定结果的那一步。

云知声先分别训练数学、代码、Agent等专项教师模型,再让学生模型自己生成轨迹,由不同教师逐Token打分。

这套方法让U2-Flash达到同等能力所需的 训练步数减少约55% ,多种专项能力也能在复杂任务中协同发挥。

后训练让它学会更早选对工具、更快发现错误,把无效试探和Token浪费一起压了下去。

国产模型向RSI迈出第一步

现在AI圈多少有点「万物皆可RSI」的意思,模型会反思叫RSI,能生成训练数据叫RSI……

一台足够聪明的机器,可以设计出比自己更聪明的机器,后者再继续设计下一代,能力由此滚雪球般加速。

1993年,科幻作家兼计算机科学家Vernor Vinge又把这套想象推向了「技术奇点」。

△指路I.J. Good论文第3页 现在,技术终于追上了这场想象的一角,RSI也由此被纳入工程范畴。

作为拥有最前沿大模型的硅谷双星,OpenAI和Anthropic已经分别给出了自己的判断。

AI只有能够自主设计并开发出比自己更强的后继系统,才算实现完整的递归自我改进。

只要模型能够加速AI研究、推动自身能力提升,就已经属于「AI Self-Improvement」;但到了Critical级别,标准同样会陡然收紧,要求模型能够完成全自动AI研发,或者持续把一代模型的升级周期压缩到原来的五分之一。

至于这条路具体怎么一步步走,翻了一圈,目前海外尚未形成一套统一的RSI升级路线图。

国内这边最近倒是刚好冒出了一篇论文综述:《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》,来自上海交大、清华、上海AI Lab等机构的研究者,干脆按照模型接管「自我改进闭环」的程度,画出了一张从L1到L5的路线图。

△图片由AI生成 而按这套最新分级,U2-Flash已经显露出明显的L3特征 :

过去一年,多份国产前沿模型技术报告都指向了相似的变化:模型开始参与生产训练任务,在可执行环境中积累轨迹,再通过强化学习与专家蒸馏,把这些经验转化为通用能力。

后训练的竞争,已经从「人给模型准备多少答案」,升级为「模型能否持续为自己创造有效经验」 。

U2-Flash不仅跑通了这条完整链路,还把效果兑现到了代码、Agent和推理成绩上。从技术体系的完整度与实际能力增益来看,云知声无疑已经具备与国内头部厂商同台较量的后训练能力。

对国内模型而言,能否适配国产算力,直接关系到这套自我迭代体系能否稳定、可控地长期运行 。

U2-Flash已经围绕主流国产算力平台,对模型架构、核心算子、推理框架和集群调度进行适配优化。实际服务中,它在国产平台上的吞吐、时延、并发和集群扩展效率正在持续提升,部分场景已接近NVIDIA GPU方案。

「最后一个由人类造出的AI」尚未出现,但第一批参与打造下一版自己的国产模型,已经上场了。

传送门: https://maas.unisound.com/models/u2-flash

ECCV上,顶尖学者们开始研究如何让AI做生意了 2026-09-10

实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug 2026-09-10

OpenAI这是拿千禧年难题当Benchmark刷啊。。。 2026-09-11

相关阅读

云知声山海知医慧保大模型重磅发布:以高密智能深耕高价值场景,重构医疗保险数智新生态

「AI语音第一股」云知声冲刺科创板,募资9.1亿,累计营收100%投入研发

ChatGPT上岗医疗还有多远?哈佛教授亲测表现接近医生,云知声被曝打造行业版

刚刚,港股AGI第一股杀疯了!Agent业务半年进账近5亿,Token收入Q2暴涨500%

AI独角兽云知声,已完成一期科创板IPO辅导

WAIC 2024 丨AGI的无限可能,云知声“山海+”场景应用全景呈现

热门文章

Kimi突发K2.8:性能逼近K3,百万上下文全员开放

AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4

A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

啊?Anthropic最高320万招销售,只为服务Meta

吹爆开源!RunningHub让MiniMax H3满血提速12倍,本地部署照样起飞

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1