AI 日报hiw3c.com

陈大年复出,入局大模型

量子位 www.qbitai.com 网页快照

陈大年复出,入局大模型

鹭羽 发自 凹非寺 量子位 | 公众号 QbitAI

排在它前面的,是梁文锋藏了近一年的大杀器——参数量高达1.6万亿的 DeepSeek-V4-Pro 。

这匹黑马就是 StartLux-V1.0-27B-Preview ,来自StartLux(原点星辉)。

他在盛大创新院18周年老友聚会上公开喊话, “AI时代有八条非共识” ,其中四条都在强调本地模型。

本地模型会完全摧毁云端市场,3年时间打平Claude,占据80%的市场。模型拼参数的玩法要OUT了……

公司业务没随行业大流,专注小而美的本地模型商业化,它也是 全球第一家 真正意义上的本地模型公司。

而作为第一张面向市场的成绩单,StartLux-V1.0-27B-Preview不依赖云端,可直接运行在 消费级PC 上。

27B对上1.6T,小模型打出大结果

成绩出自权威机构,中国信通院的可信AI大模型基准测试 MCP专项 ,其围绕真实应用场景设置六类任务:

简单来说,MCP-Universe不看模型回答得好不好,看的是 事情究竟能不能做出来 。这也是判断Agent好坏最本质的地方。

结果显示,StartLux-V1.0-27B-Preview综合得分39.25%, 排名第二 。

超过284B参数的DeepSeek-V4-Flash-0731和198B的Step-3.7-Flash,仅落后DeepSeek-V4-Pro 1.3个百分点。

同为27B参数规模,StartLux也比Qwen 3.6要高出5.34个百分点。

单项成绩也很能打 ,位置导航、金融分析和浏览器自动化均位列第一,其余细分项也同样名列前茅。

第一道题,是一笔跨越两年的 微软股票投资 ,同题PK的是 Claude Sonnet 4.6 。

Prompt:如果在2023年1月9日往微软投入25000美元,一直持有到2025年1月8日收盘,最终价值和总收益率分别是多少?

视频链接:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfg

视频链接:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfg

仔细看两个模型的思考过程,由于原始数据缺失,Claude Sonnet 4.6直接把2025年1月8日 误判 为非交易日,计算的是前一天的收盘价。

同样的情况下,StartLux分别 回查 当初数据,再 验证 目标日期附近的行情, 确认 准确收盘价后,才完成计算并生成可视化。

Prompt:浏览器打开Google Flights,找一班从新加坡飞北京的单程航班,5天后出发,我要最便宜的直飞经济舱,而且不要落在大兴机场。只看价格,任务结束后关闭浏览器。

其中,StartLux-V1.0-27B-Preview用时约95秒完成搜索,找到了价格为299美元的国航机票。

视频链接:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfg

反观Claude Sonnet 4.6在日期选择、弹窗关闭和筛选菜单之间经历了更多截图确认,还一度误触时间筛选面板。

两百多秒后,它给出的最低报价是556美元。价格更高,搜索时间还是StartLux的两倍。

尤其是在 操作路径 上,StartLux要简洁得多,全程只用了12步,而Sonnet足足用了21步。

视频链接:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfg

参数做减法,能力不打折

其实它也是以 Qwen3.6-27B 为基座的,最终测试分数却要比Qwen高不少,原因就藏在 任务数据 和 自动化后训练方法 里。

简单来说,StartLux训练的是一个更会干活的Agent,训练数据重点强化任务理解、工具选择、参数构造、多步执行、状态检查和结果验证等能力。

模型要学会的不只是给出最终文本,还包括什么时候调用哪个工具、工具返回异常后如何调整,以及什么情况下才能宣布任务完成。

团队自主研发出一套全新的多维度、可验证、可规模化的 模型迭代优化技术 ,其中采用 AI训练AI (Auto Research)的方法,让模型能在真实工具环境中自主执行任务,再根据环境反馈持续调整策略。

比如前文提到的金融分析案例,其中的回查修正,以及浏览器任务里的约束识别和路径选择,正是这种后训练最直观的体现。

据官方介绍,StartLux-V1.0-27B-Preview也是 国内首个 采用Auto Research方式完成后训练的本地Agent模型。

大参数云端模型仍然是当下的主流选择,但StartLux也给出了清晰的信号: 这并非唯一通解。

Scaling Law是“过路神仙” ,没有它,AI起不来。但它只是从AI的发展路径上路过,未来不一定属于它。

一边是 “大力出奇迹” 的忠实信徒,参数从百亿卷到千亿,再卷到万亿,训练成本也跟着指数级攀升;

另一边是以Harness为代表的Agentic评估体系迅速走红,越来越多专家学者开始明确 “少即是多” 。

化用王阳明的说法, 知行合一 ,更高质量的行动才是关键。StartLux为模型做减法提供了又一例证。

模型一旦进入PC,对于长时任务,其成本结构可以从持续累积的云端Token费用,转化为更可控的设备算力和电力消耗,同时模型也能更好地理解用户的长上下文,实现更个性化的目标。

不止StartLux, Meta、Google、NVIDIA 最近也在加码本地小模型方向。

不过这些大多还都停留在实验阶段或偏向极客,以本地模型产品化为主的,目前 只此一家 。

StartLux也表示,后续它们将稳步推进自有基模训练,探究扩散式语言模型等新架构,总之路线对了,那就未来可期。

StartLux接棒本地模型 既然这是一条非共识的路线,掌舵的就需要两种人: 敢下注的 和 能做出来的 。

CEO 陈大年 此前已经简单介绍过了,是连续创业者也是中国初代程序员,跟张小龙、雷军同期成名,创业时间跟马云、马化腾同代。

他是中国最早引入“共享软件”概念的人,和二哥陈天桥一起创办 盛大网络 以及互联网创新摇篮之一的 盛大创新院 ,国民级产品 “WiFi万能钥匙” 也是由他一手孵化。

郭权玮拥有国立阳明交通大学计算机科学与工程博士学位,研究方向覆盖本地部署大模型、Agentic AI、AI for Science、AI for Finance和隐私保护机器学习等领域。

加入StartLux前,他曾任AI科学公司幻量科技首席算法科学家,更早之前在台湾工业技术研究院从事数据隐私、数据去标识化和隐私保护机器学习研发。

他还是 2024年TAAI最佳论文奖获得者 ,并以第一发明人身份拥有数据隐私相关发明专利。

陈大年懂产品和用户,郭权玮长期研究本地模型、Agent和数据隐私,罗永祥负责市场和投融资。 这套组合高度适配StartLux,也将助力StartLux长线发展。

在StartLux的构想中,本地智能解决方案应该像 安装Office 一样,一键完成部署。用户不需要理解量化、显存配置和推理框架,也不用自己反复调优。

它也代表着,继DeepSeek、Kimi等云端模型公司涌现之后, 国产本地模型也开始陆续补位 。

从智能时代的后起之秀又兜兜转转回到互联网时代的初代程序员,模型基本范式在换挡,但 始终有中国公司在接力往前跑 。

世界生成模型来了3D头部玩家,可进入生产管线的场景级生成时代来临! 2026-09-03

114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型 2026-08-05

热门文章

Claude开始接管物理世界!能用机械臂阻拦5000万美元打款了

智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持

《时代》周刊全球AI 100放榜,精准捕获稚晖君最“想低调”的幕后老板

e生涯斩获浙江一等奖,同蚂蚁、浙大一道晋级数据要素国赛

去年归国的徐梦迪,成了清华姚班班主任

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1