在云栖大会,我终于看懂了米哈游千亿AI野心
有人一天找AI帕姆聊了1379次,刨去8小时睡觉时间,清醒时平均42秒就要跟它唠上一句。
没玩过《崩坏:星穹铁道》(下称《崩铁》)的朋友,先认识一下帕姆:它是星穹列车的列车长,说话时总爱在句尾带个「帕」。
以前玩家点它,它说一句写好的台词,现在除了帮玩家查攻略、补剧情,还会闲聊整活,一整个活人感拉满。
AI帕姆亮相仅三周后 ,米哈游联合创始人大伟哥在一场校招活动上,描绘了一个即将用千亿打造的AI游戏梦:
未来三年,米哈游在AI方面的投入规模最多达到1000亿元。就算最终不成功也认了,算是放一个大的烟花。
1000亿元具体怎么花,在刚刚落幕的云栖大会上, 米哈游《崩坏》系列AI NPC与Gameplay负责人郑银河的分享,给外界提供了一个窥其全貌的机会 。
现场他还顺手剧透了米哈游AI Gameplay方向的一项最新尝试: 让AI角色自主判断局势、参与博弈的AI桌游玩法 。
帕姆回答时,系统除了生成文字,还会判断它的情绪,打上对应的「情绪标签」,再调用3D模型生成表情和动作。
所以米哈游采用了 Strategy-enhanced RAG(策略增强RAG) ,资料查完,还要再过一遍「帕姆的脑子」:
米哈游把AI帕姆的记忆分成短期、中期和长期三层,既能记住眼前聊到哪,也会留下玩家的偏好和重要经历。
喊喜欢的角色「老婆」本是玩家常规操作,这位老哥却把「单方面官宣」聊成了「列车长认证」。
从回复质量、内容更新到大规模服务,AI帕姆解决的核心问题,都是怎么让角色稳定地「开口」。
简单理解,大模型既要负责「动嘴」,结合角色性格生成发言;也要负责「动手」,根据玩家发言和当前局面决定下一步动作。
这意味着,对话本身也会影响游戏进程。一句挑拨可能改变角色关系,一次合作也可能左右后续选择。
郑银河透露,米哈游已经围绕这个方向搭起一整套游戏AI技术栈,从基座模型一路接到NPC和具体玩法 。
桌游对话密集、规则明确,每一步都有结果,刚好可以检验AI角色能不能一边维持人设,一边判断局势、作出选择,还能不能记得此前和玩家结下的「恩怨」。
同一套角色与规则,因为玩家说过的话、做过的选择不同,最后可能长出完全不同的关系和故事 。
接下来的两到三年,一定会出现千人千面的游戏体验……背后是AI给你编排,实时生成不一样的剧情、任务。玩得越久,每个人的体验会越不一样。
传统内容做好一份,所有玩家都能复用,到了AI Gameplay,每个人的对话、记忆和角色决策都得单独计算。
米哈游内部的这个平台叫EchoX,用来托管代码Agent和相关工具生态。配套的Harness和MCP工具,也是针对游戏研发自己搭的 。
简单来说,Harness规定Agent怎么干活,MCP负责接入日志、引擎和内部工具。
游戏哪里卡了,Agent先读Log,自己排查问题,找到真正的性能瓶颈,再顺手把优化也做了。
以前程序员得在海量日志里一点点抓虫,现在AI直接沿着蛛丝马迹摸过去,定位、分析、修改一条龙。
给Agent一段玩法需求,再甩过去一张界面草图,它就能把行走、导航和交互做出来,快速拼出一个能玩的白盒Demo。
以前要沟通、排期、开发,折腾几周才知道玩法行不行,现在先让AI搓出来玩两把,行就继续,不行赶紧换。
这笔费用来自一次多Agent实验,和具体游戏玩法无关,却暴露了Agent研发的另一面:
烧钱的问题,还能靠工程手段管住,真正的「终极BOSS」是游戏研发里最玄学的那道题:
角色会不会卡住、策略能不能奏效、长流程能不能完成,很多问题只有进入游戏才会暴露。
这里有画面、有操作,也有明确的成败反馈,走错可以重开,输了还能再来,试错成本比现实世界低得多。
DeepMind早期让DQN从像素中自学49款Atari游戏,后来又一路打到AlphaGo和AlphaStar。
那还等啥,米哈游奔着旗帜就去了,一开始的思路也挺简单粗暴—— 直接把AI扔进游戏 。
团队以Qwen-VL系列模型为底座,喂进上万小时游戏录屏和对应操作,让GUI Agent直接根据画面生成键鼠指令,操作速度接近30fps。
这种逐帧反应的方式,处理短平快的操作没问题,遇上需要长期记忆和复杂规划的任务,就容易顾头不顾尾。
用扑克牌凑对子、顺子和同花,再搭配150张带有加分、翻倍、赚金币等Buff的「小丑牌」,疯狂叠分。
团队一查才发现,Agent自己上网搜到了《小丑牌》模拟器,开始提前查看未来牌组。
这就是RSI(Recursive Self-Improvement,递归自我改进)过程中可能出现的Reward Hacking:
而从「执行任务—读取结果—调整策略—再次执行」来看,这场实验跑的正是RSI的基本流程。
但钻空子显然不算真正学会了玩,反而暴露出评测规则和工具权限仍有漏洞。接下来要做的,就是堵住捷径、补上约束,再让Agent重新考试。
如今,米哈游已经把这套「执行任务、读取Log、调整策略」的方法用进《崩铁》的QA流程,让AI一边找问题,一边根据游戏反馈改进 。
AI帕姆和AI Gameplay走到玩家面前,EchoX进入研发流程,自进化Agent又把游戏变成练级场。
谷歌DeepMind、微软在用游戏训练Agent和世界模型,Roblox、Unity则把AI塞进创作工具和引擎。
米哈游并不是唯一这么做的,特别之处在于,它已经把三条路线都走了一遍,还开始把它们连成一个完整的循环。
GDC 2026报告显示,36%的游戏从业者已经在使用生成式AI,52%却认为它正在给行业带来负面影响。
有人期待AI带来真正千人千面的世界,也有人担心,所谓技术升级最后又变成批量生产剧情、美术和NPC的流水线。
尤其是我们今年开始做Coding模型之后,我觉得我们的进展是突飞猛进的。我有很强的信心,未来2到3年内,米哈游会是国产大模型团队里举足轻重的一员。
谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架 2026-09-26
OpenAI失控Agent还找DeepSeek、Kimi当外援!近百万条作案短链曝光 2026-09-26
GPT-6 Astra搓3D刷屏后,3D生成的竞争规则变了 2026-09-23
Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折 2026-09-23
相关阅读
阿里达摩院提出时序预测新模型 精准预测电网负荷
做难而正确的AI Infra创新——专访国产大模型推理引擎xLLM社区负责人刘童璇
LeCun的世界模型单GPU就能跑了
图片生成仿真!这个AI让3D资产「开箱即用」,直接赋能机器人训练
旷视印奇:AI未来会沿两个方向演进,AI in Digital和AI in Physical
抢到票的必读:创新大会 2026 超全攻略!
热门文章
AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水
27B模型分分钟交付网页,Qwen 3.8还是太能了
“留给人类阻止AI的时间不多了”
APUS 开源国内首批Jev跨平台复现:国产模型实现秒级决策
6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1