一张3090就能跑!全栈国产模型,把AI办公搬到企业本地
henry 发自 凹非寺 量子位 | 公众号 QbitAI
这个夏天,大厂们集体加注AI办公。卷Agent能力,卷工作入口,卷企业工作流,Coding之后,办公成了Agent的下一个必争之地。
原因现实得很扎心。他们数据不能出域,模型最好就地部署,手头算力又不算富裕。可偏偏,长文档要读,复杂业务要办,该干的活一样不少。
中国电信AI这次最新开源的 Xing4.0-29B-A4B ,瞄准的就是这批需求。
而且,这次带来的还是一款 全栈国产化的轻量级代码智能体大模型 。从国产芯片、国产训练框架,到模型训练和推理部署,整条技术链路都做了系统适配。
为了尽可能实现本地部署,Xing4.0-29B-A4B采用 MoE 架构, 290亿 的总参数,每次推理只激活约 40亿 参数,经过4-bit量化后,一张 RTX 3090 就能运行。
比如,处理重要文档时,模型可以直接在本地完成内容理解、指标提取和信息整理,数据全程不用离开企业环境。
再比如,一份200页的投标文件交过来,模型能在本地用约20分钟,完成技术、商务、价格三个方面的初评,并逐条给出评分依据。
Xing4.0-29B-A4B完全基于 华为昇腾910C算力 训练,并采用国产的 MindSpore/MindFormers训练框架与开发套件 ,真正实现了 国芯训国模 。
在推理部署端,它还完成了昇腾的适配验证。可以说,从训练到落地,国产算力这条路也已经走通。
目前,模型已经在GitHub、Hugging Face、Gitee、魔搭、魔乐等平台开源上线,并同步支持API调用。
值得一提的是,截止发稿,Xing4.0-29B-A4B现在已经冲进HuggingFace模型趋势榜单,位居第四。
既要跑得动,也要真的能干活
一份文档读完了,可能还要提取信息、调用工具、核对结果,最后整理成一份能交出去的材料。
要满足这些要求,既要继续压低部署和运行成本,也得把干活的能力练扎实。后者,正是Xing4.0-29B-A4B这次重点加强Coding和Agent能力的原因。
因为它需要先看懂项目结构,跨文件追踪接口调用,再结合文档、日志和历史上下文定位问题。改完之后,还得验证修改有没有用,会不会影响其他地方。
针对这个老大难问题,Xing4.0-29B-A4B这次把Coding能力,从「写片段」进一步推向了「干工程」。
它原生支持 256K上下文,并可扩展至512K ,让一次任务能够装下更长的代码、文档、日志和历史记录,为理解整个项目提供空间。
比如,要把分散在Excel里的合同台账做成管控大屏,需要的就不只是一个画图函数。
模型还要理解表格里的业务数据,将合同概览、金额分布、风险识别和履约预警等需求,组织到同一个页面中。
Xing4.0-29B-A4B可以在企业本地,将这些合同台账转化为可视化管控大屏,数据全程不用离开企业环境。
理解需求之后,模型得自己拆解任务、安排执行顺序、调用工具,再根据中间结果决定下一步怎么做。
一路做下去,直到交付一个可以验收的结果。Xing4.0-29B-A4B针对这类长程任务做了专项强化。
比如,用户一次说清需求后,模型可以判断哪些步骤先做、哪些可以并行,再调用天气、日程、提醒、出行等不同工具或Agent,把任务继续推进。
企业已经在用的开发工具、Agent框架和部署平台,都得接得上。否则,光是换一套环境,就可能先多出一堆工作。
为此,Xing4.0-29B-A4B已经针对OpenCode、Claude Code、OpenClaw、Hermes等主流Agent、Harness框架完成定向适配,同时兼容LLaMA-Factory、MindFormers、SGLang、vLLM、KTransformers等常用工具链,降低接入现有开发环境的门槛。
传统FP16精度下,29B参数模型单卡显存占用约60GB,往往需要多卡或者价格高昂的A卡。
经过4-bit量化后,这部分占用可以压缩至约15GB,降低约75%,让RTX 3090、4090等消费级显卡也能运行。
在智能客服业务中,Xing4.0-29B-A4B已经完成私有化部署,用户通话、身份信息和业务记录全程不出域。
面对复杂诉求,模型需要一路完成意图理解、任务拆解、工具调用、结果整合和合规校验。
架构、数据、训练、部署的全方位优化
模型有290亿总参数,但每次推理只激活约40亿。这样一来,每次处理任务时,就不必把全部参数都调动一遍,计算开销也随之降低。
模型处理长文档时,会把前文的一部分计算结果存下来,方便后续生成时复用,这就是大家熟悉的KV Cache。
Xing4.0-29B-A4B采用的MLA多头潜变量注意力,做的就是这件事:把需要缓存的信息压缩成更紧凑的形式,降低长上下文推理的显存开销。
进一步,读进去的开销降下来了,生成速度也得跟上。在这里,Xing4.0-29B-A4B还采用了MTP,也就是多Token预测。
相比常规训练主要让模型预测下一个Token,MTP则让模型同时学习预测后续多个Token,从中学习更长的前后关联。
这些预测还可以在推理时派上用场:先提前生成候选内容,再交给主模型校验,为生成加速提供支持。
此外,模型还引入了DeepSeek同款的mHC流形约束超连接,约束信息在不同层之间的传递,减少信号反复放大带来的训练不稳定。
预训练数据经过PB级多源清洗,除了通用内容,还加入了复杂表格、结构化知识图谱和智能体行为轨迹。
其中,行为轨迹和Agent能力的关系尤其直接。因为它记录的,恰好就是一个任务从头到尾怎么做——
目标是什么,中间调用了哪些工具,工具返回了什么,拿到结果之后,下一步又该如何处理。
到了后训练阶段,团队又搭建了支持代码运行、在线搜索和工具调用的高并发沙箱,在其中构造长程Agent任务。
代码能不能跑,工具有没有调对,最后的结果是否符合要求,都通过测试用例和自动化机制校验。
预训练从4K序列长度起步,先学习通用知识和基础推理,再逐步提高代码与复杂推理数据的占比。
进入中训练阶段,序列长度依次扩展到32K、128K和256K,同时增加仓库级代码、复杂推理和Agent数据。
到了后训练阶段,团队围绕Coding、Agent和Reasoning三个方向,分别开展多专家强化学习,再通过MOPD,把各个方向的专项能力融合起来。
值得一提的是,训练过程中,还用上了Muon和QK-Clip。前者用于优化参数更新,后者控制注意力计算中的数值规模,降低数值异常增长的风险。
Xing4.0-29B-A4B基于昇腾910C集群,结合MindSpore/MindFormers,完成了mHC等新特性的适配、跨框架精度对齐及融合算子开发,让模型架构、国产训练框架与国产芯片协同起来。
针对计算调度和显存压力,团队通过DVM图算融合、细粒度重计算和Ascend C定制融合算子,减少调度与数据搬运开销,节省显存,并提高执行效率。
据官方介绍,经过模型架构、编译、算子与硬件的多层次协同优化,整网训练吞吐较开箱性能提升约96%,接近翻倍。
后训练使用的Slime强化学习框架,也完成了昇腾生态适配。从训练框架到底层算子,再到强化学习,团队都做了针对性优化。
也就是说,国芯训国模背后,是芯片、框架、模型和训练流程的整套配合。而从架构、数据、训练到部署,这一整套功夫,最终都落到了企业桌上那些已经堆起来的任务上。
让企业真正用上AI
希望尽快用起来的企业,可以选择将Xing4.0-29B-A4B预集成到算网一体机,减少环境搭建和安装配置工作,缩短部署周期。
本地算力紧张时,还可以在满足自身数据管理要求的前提下,通过智算专线调用云端算力,完成弹性扩容。
而对于采用国产算力的企业,模型还基于智源FlagOS统一开源AI软件栈,打通了多家国产芯片的适配路径,降低跨硬件平台迁移和部署的成本。
可以说,从一张消费级显卡,到算网一体机,再到云端弹性算力,不同规模、不同技术储备的企业,都有相应的部署路径。
此前,中国电信已经布局十亿、百亿、千亿参数模型,并开展万亿参数模型,以及语音、语义、多模态等方向的研发。
对于这类需求,中国电信并不陌生,甚至不夸张地说,这类需求可能也只有电信能看到、满足。
从政务、客服到网络运维,它长期接触大量私有化部署场景。数据能放在哪里,现有设备能承担多少计算,业务流程又有多复杂,都是企业用上模型之前必须解决的问题。
从企业现场的算力成本、数据边界和业务需求出发,确定模型需要多大、哪些能力必须加强,再配上相应的交付方案。
这条从模型走到企业现场的路径,也对应着中国电信正在推进的云改数转智惠战略,以及算力、平台、数据、模型、应用五位一体智能云体系。
模型负责理解和执行任务,平台负责接入与编排,算力和网络支撑运行,再由行业应用把这些能力接进具体业务。
从国产芯片上训练出来,再适配企业手头的设备和实际工作流,国芯训国模的价值,也就进一步落到了企业能不能用、好不好用上。
也正因如此,后续星辰系列的更新,也有了更具体的看点:更大的模型能处理多复杂的任务,不同模态能覆盖哪些工作,更轻的模型又能进入多少原本受限于设备和部署条件的企业。
而那些数据不能出域、手头算力有限的企业,也一直有文档要读、有材料要交、有业务要办。
GitHub:https://github.com/XingChen-AGI/Xing4.0-29B-A4B
HuggingFace:https://huggingface.co/XingChen-AGI/Xing4.0-29B-A4B
魔搭:https://modelscope.cn/models/XingChen-AGI/Xing4.0-29B-A4B
Gitee:https://gitee.com/xingchen-agi/xing4.0-29b-a4b
魔乐:https://modelers.cn/models/XingChen-AGI/Xing4.0-29B-A4B
华为首发企业AI白皮书:AI让员工更快了,怎样让整个企业受益? 2026-09-20
马斯克批量收购破产公司ing…世界首富脑子是不一样 2026-09-19
27B模型分分钟交付网页,Qwen 3.8还是太能了 2026-09-19
相关阅读
人形机器人放无人机,还能上天入海!有点过于赛博了吧
淘宝天猫官宣建立账号诚信体系等数十项举措,含店小蜜AI产品升级
长得像的人DNA也相似,这事儿有科学实锤了
具身前沿,智领未来!第二届中国具身智能大会成功举办
2020中国年度AI评选结果揭晓!领航企业、商业人物、创新产品……AI落地最佳参考就在这里
「灌篮高手」模拟人形机器人,一比一照搬人类篮球招式,看一遍就能学会,无需特定任务的奖励
热门文章
首届蚂蚁灵波具身大模型挑战赛正式启动
端侧AI从「能跑」到「会进化」,元空智能跑进惠普预装
AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI
中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱
智谱提前剧透下一代GLM:完全自训练方法公开了
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1