AI 日报hiw3c.com

精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了!

量子位 www.qbitai.com 网页快照

精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了!

星空下,一辆白橙色的反重力赛车如利刃出鞘,猛地切进弯道,丝滑拐弯,在赛道上拖拽出一道道冰蓝光带,溅起金黄色的摩擦星火,直至冲线。

这可不是好莱坞特技大片,而是我用 IQuest-Q1模型 搓出来的沉浸式反重力竞速游戏。

它既能 凭一句Prompt原地打造一款炫酷游戏 ,也能 把十万步三体方程解成克林姆特笔下流淌的金色丝线 ,甚至还能 从RL训练数据里揪出隐藏空格bug ,让模型重回训练正轨。

从Benchmark的表现来看,IQuest-Q1也交出了一份相当能打的成绩单。

它在仓库级代码生成NL2Repo、网络安全基准CyberGym、终端Terminal-Bench 2.1、代码长程任务DeepSWE v1.1、办公场景JobBench等复杂任务评测中均表现不俗。

那么IQuest-Q1究竟是一款怎样的模型?它具体能帮我们做些什么?它诞生的研究土壤是怎样的?

IQuest-Q1采用了 decoder-only Transformer主干 ,配 稀疏MoE架构 ,总参数约 320B ,激活参数约 15B 。

这意味着,它虽然体量看起来像个 “沉睡的绿巨人” ,但稀疏激活一上线,便能立马化身 “精准点穴的叶问” ,每一分算力都点在关键的穴位上,一点都不带浪费。

更有意思的是,我们从IQuest-Q1官宣的少量文字中察觉到, 模型亲自参与了自身的研发迭代。

一旦它提出的研发方案被人类研究者们拍板通过,那么验证过的模型更新、训练资产和研究流程,便会直接流进下一轮迭代,被后续版本接着用。

而每一轮攒下来的数据流程、训练配置、评估方法和工具,也会像滚雪球一样越滚越大,直接转化为后续版本可复用的研发资产。

第一题,我直接让IQuest-Q1给国庆不想出门人挤人、SAN值狂掉的我,搓个 《国庆卧室保卫战》小游戏 。

可一刷朋友圈,九宫格一个比一个精致,心里又忍不住冒出点遗憾和苦恼,更别提每天早上爬起来,还得纠结半天今天到底干点啥了…

我只丢给它一段200字左右的提示词,外加摸鱼三分钟,它就交给我一个能在竖屏手机上直接玩的HTML游戏。

更绝的是,它还给各位“小情绪怪”配好了独一无二又精准的 NPC设定 和 血条 。

同时,要是咱们玩嗨了,被怪兽击中要回血,那也可以直接回床上躺平,血条蹭蹭往上涨。

游戏结束后,它还会从奶茶、炸鸡、看电影、逛超市、附近散步里随机掉落一个 “今日目标小彩蛋” ,让咱们在不知道干啥的时候直接抄作业。

当时,一场RL训练中突然发现,Reward曲线没有按照预期爬升,像被什么看不见的东西卡住了一样,非常不对劲。

然后,研究人员们试着把这个问题交给IQuest-Q1,并让它基于Claude Code CLI框架分析训练日志、训练中的落盘轨迹,并从代码库中反向追查故障原因。

最终,问题被定位到RL框架接入Scaffold时的文本回传与轨迹拼接环节—— 推理服务在文本解码时额外插入了一个空格 。

这个空格看似微不足道,却足以让模型生成文本与回传历史错位,导致前缀匹配断裂、多轮生成中断、RL训练前几轮的读代码、跑命令、改代码全白跑了,只练了最后一轮回答。

从创意生成到工程排错,两场实测看下来,我能明显感觉到 IQuest-Q1不只是能答,更能稳稳交付经得起查验的成果。

而要理解IQuest-Q1为什么如此重视交付,咱们不妨扒一扒它的研发团队 至知创新研究院IQuest Research 。

从今年7月底到8月,团队逐步把研究扎进模型训练的核心环节,并相继提出了 MuonH优化 、 UBio-MolFM 和 稀疏权重分解 等研究成果,为模型训练打下了坚实的基础。

再到本月16号,IQuest Research参与提出的 ModularRSI自进化框架 登上了Hugging Face日榜第二。

它不仅将Agent在Terminal-Bench 2.0和SWE-Bench Verified的准确率分别从47.57%、73.40%提升至 52.43% 、 76.45% ;

更能让Agent把习得的执行能力跨任务、跨模型直接复用,有效解决了自改进中信用分配与泛化的难题。

还是团队从堵住Agent搜索时的偷懒捷径,到让模型参与下一轮研发,IQuest Research团队追问的始终是同一件事:

参考链接: [1]GitHub: https://github.com/IQuestLab/IQuest-Q1 [2]Hugging Face: https://huggingface.co/IQuestLab/IQuest-Q1 [3]Blog: https://iquestlab.github.io/ 一键三连「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 点亮星标 科技前沿进展每日见

量子AI创业来了一支“清华梦之队”:10亿估值,用量子改造大模型底层 2026-09-27

啥题啊能干崩OpenAI最强模型训练… 2026-09-27

GitHub三榜第一背后,一个“专升本”工程师的十年 2026-09-13

20ms把PDF变成Markdown!开源OCR神器快了近300倍 2026-08-29

相关阅读

大模型中的「罗翔老师」!北大团队搞出ChatLaw,发布即登顶热榜

ICML2024高分!魔改注意力,让小模型能打两倍大的模型

剪掉ImageNet 20%数据量,模型性能不下降!Meta斯坦福等提出新方法,用知识蒸馏给数据集瘦身

考考大模型视频理解能力,中科院人大百川提出新基准合成框架

人在知乎,被AI总结了

谷歌用大模型重写超级助手,为推进度先裁员重组!

热门文章

6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官

GPT-6 Astra搓3D刷屏后,3D生成的竞争规则变了

PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍

出海Agent“小元AI”入驻腾讯WorkBuddy:找买家写开发信谈生意

别人忙着卷Code,Kimi抽身反打浏览器插件:网页操作一秒变Skill

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1