AI 日报hiw3c.com

不简单,“吃货快乐榜”也全面AI化了

量子位 www.qbitai.com 网页快照

不简单,“吃货快乐榜”也全面AI化了

林方舟 发自 凹非寺 量子位 | 公众号 QbitAI

升级后的2026版扫街榜,用AI算法理解不同导航到店行为的评分权重,更精准体现用户真实选择,让更多经得起反复考验的宝藏好店脱颖而出。

要知道,空间智能可是现在世界模型圈子里的顶流,李飞飞团队的Atlas刚发出来时,朋友圈都快被刷爆了。

而高德,早就不是你以为的那个“只会导航的地图App”了。人家攒了二十多年时空数据,业务遍布物理世界的犄角旮旯,搞空间智能属于是“专业对口”。

特别是高德空间智能的核心引擎——ABot-Earth 0.7,被称为 “全球首个3D原生城市世界模型” 。

这玩意儿有多猛?仅需一张卫星图或一段文字,在消费级GPU上跑10分钟,它就能给你生成一座拥有真实街景的3D城市,效率比传统方法提升了1000倍。

“3D原生”路线,效率和性价比拉满 人在中关村工位,突然想像梁朝伟一样任性一把,飞去伦敦喂鸽子……

于是我打开订票软件,哦不对,打开“高德地球”的官网,喂给它一张伦敦特拉法加广场的卫星图。

没过多久,它就给我生成了一个1平方公里的“真实世界”,建筑错落有致,植被层次分明,地标还原逼真……

无论是浪漫的土耳其,还是东京和巴黎,ABot-Earth 0.7都能带我抵达。按照团队的说法,目前它已囊括190多个国家、300多座城市,建成了 全球覆盖国家和地区数量最多的3D地图 。

反观大家熟悉的Google Earth,只有少数大都市的核心区才有3D场景的待遇,广大中小城市和欠发达地区还停留在二维的卫星图片时代。

把一座城市搬进三维世界,是个费时费钱的大工程。以Google Earth采用的传统三维重建为例,先要采集影像,再计算建筑的位置和形状,最后还得还原表面的纹理。要覆盖更多地方、更新更多场景,这些工作就得持续投入。一套流程下来,更新一次动辄数月甚至数年,家里有矿才敢这么玩。

ABot-Earth 0.7想降低的,正是生成下一个三维场景的成本。 它先用大量真实的室外场景三维重建数据训练模型,让模型学会城市和地貌的空间规律:道路怎么延伸,街区如何排布,建筑、植被与水体怎样分布。这些看似复杂的地表信息,其实都有迹可循。

有了这样的基础,模型拿到一张卫星图或少量地面信息,就能根据已有线索推断空间结构、补全细节,快速生成结构合理、外观逼真的三维场景。过去积累的三维数据,由此支撑起更多新场景的生成,也让高保真三维内容能够以更低成本、更大规模生产出来。

这里插播一个知识点:三维高斯(3DGS)。你可以把它想象成空间里一团团带颜色、有透明度的“小椭球棉花糖”。无数个这样的棉花糖堆在一起,就变成了楼房、树木和马路。

ABot-Earth 0.7说的“3D原生”,就是模型直接学习并生成这些“棉花糖”,输出结果天生自带3D结构,想从哪个角度看都行。

于是高德设计了原生3DGS压缩与重建方案:“先压缩,再生成”。训练时把复杂的3D场景压成紧凑的“潜空间压缩包”;生成时在潜空间里搞定,再解压成三维高斯。

这套方案兼顾高压缩率与高质量重建,既降低训练和推理的开销,也提升场景的几何质量 ,让建筑立面更规整、地面更平整,为高效生成高保真三维场景打下基础。

这就好比你不直接搬运整座图书馆,而是先做成电子书,下载后再打印,省时省力还省硬盘。

更重要的是,原生3D很吃数据的质量。为此,高德先用自研引擎ABot-3DGS,把卫星、航空、街景等多源影像重建成城市级3D场景,再通过高效的3D与2D数据清洗流水线,筛选出高质量、高精度的训练数据,让模型从真实世界中学习丰富的空间结构与外观细节。

正是严选高质量的真实3D数据,才保证了生成内容既好看又靠谱,不会出现“路飞到天上、楼长在水里”的灵异事件。

未来的数字地球,不仅能看还能“盘”

鼠标滚轮狂滚,从蔚蓝地球秒切城市全景,再无缝钻到具体街道,中间几乎没有卡顿,比我汇报工作还流畅。

这种丝滑体验得益于高德设计的原生3DGS多层次解码器(LOD),它可以在不进行昂贵后处理的情况下,直接生成层次化的三维高斯结构,主打一个“实时在线,拒绝加载条”。

ABot-Earth 0.7采用了一种高效的滑窗推理机制,在重叠区域进行智能融合,极大地消除了拼接痕迹,能生成近乎无缝的地球级场景。这套方案让场景的破洞率、破损率降低了97%,区域边界过渡自然平滑,单次推理即可完成超过10平方公里的三维场景生成。

比如卫星影像看不到建筑立面,需要模型自己“脑补”。所以虽然它生成的画面逼真,但并不意味着每扇窗户都与现实一一对应。

因此,对于埃菲尔铁塔、罗马斗兽场这种知名地标,高德采取了“大片城区由ABot-Earth 0.7生成、地标使用3D生成模型制作,再通过Agent自动校准拼接”的方式,获得了“混搭”的视觉效果。

高德通过世界模型能力,从有限实景照片等多模态输入生成高质量可漫游的3DGS场景,把生成能力从“上帝视角”推进到“街景级细节”,通过自增强空间生成技术突破了传统级联生成中误差随轮次累积、纹理与几何逐轮退化的问题,使模型的生成范围显著扩大、纹理质量显著提升,实现从城市级到街道级的真实感3D游览。

这也意味着,数字地球将不再只是被动观看的“电子沙盘”,而会成为可生成、可仿真、可编辑的动态空间智能平台。

用这个框架来看ABot-Earth 0.7,它目前解决了“三维空间”的高效构建问题,同时保留了与“二维网络拓扑”的精确对齐,为后续叠加“时间的变化”和“真实世界的流动”打下了地基。

在这个意义上,ABot-Earth 0.7不只是技术产品,更是AI “理解真实世界的入口” 。

Benchmark只是基本功,用户买账才是真本事 ABot-Earth 0.7很强,但它也只是高德空间智能中的一环。

按照李飞飞给世界模型的分类框架(渲染器、模拟器、规划器),高德是业内少有的在同一个架构里把三者都做了一遍的公司。

渲染器负责3D呈现,对应高德的ABot-World、ABot-Earth系列、ABot-Recon和云境、飞行街景2.0等产品;

模拟器负责对现实世界进行预测与模拟,在高德语境下体现为未来交通态势推演、商圈客流预测等能力;

规划器则在理解与预测之后,为各类Agent输出具体行动指令,比如高德ABot全栈具身技术体系中的ABot-Navigation(导航模型)和ABot-Manipulation(操作模型),可直接部署在机器人上指导移动与操作;以及能够超视距预警的高德鹰眼守护。

这三者共享底层的因果Transformer架构。不同模态的输入(图像、文本、点云、交通流等)经过各自编码器处理后,进入共享注意力机制。既保持独立表征,又实现跨模态互通。

这种设计让高德能在一个统一框架内,同时支撑C端体验优化、B端数字孪生服务和具身智能落地,而不是为每个场景单独训练一套模型。

打个比方,这套架构像一场多语种联合国大会:不同模态信息先由各自的“同声传译”(编码器)转成通用语言,再围坐在同一张圆桌(共享注意力机制)旁对话协作,既听得懂彼此,又不丢失各自的表达方式。

目前,包括ABot体系在内的高德空间智能前沿模型及研究在全球获得20多项冠军和SOTA。

除基础导航外,自2025年提出全面AI化以来,高德已经把空间智能用到了多种场景,比如推出开放环境全自主具身机器人高德途途、发布专为具身智能打造的城市级仿真训练场,并推出红绿灯倒计时和高德鹰眼守护以及全面AI化的扫街榜2026等产品。

在高德看来,数字世界中的智能,最终都要在物理世界里找到自身的价值。 未来,空间智能将如云计算一样,成为各行各业与物理世界交互的标配基础能力。

以前,高德是连接人和现实世界的基础设施;现在,高德正在变成连接机器人和物理世界的基础设施。

当你在扫街榜上精准找到一家宝藏小馆,当无人机在摩天大楼丛中自主避障,当智能汽车在晚高峰预判拥堵、提前变道——这些看似不相关的场景,底层是同一套 空间智能体系 。

神秘具身团队又放出一连串很炸的Demo视频…自进化模型,技术路线曝光 2026-09-03

宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底 2026-08-26

这届“WRC必看”:全栈AI、20+超难家务,8.99万带回家 2026-08-20

机器人赛道新岗位:月入6000元的“骨科大夫”,专治缺胳膊断腿 2026-08-11

相关阅读

商汤开源SenseNova-SI-1.3,八大空间智能榜单综合评分登顶

5700问答对全面评估拷问AI空间感!最新空间智能评测基准来了丨浙大&成电&港中文

GPT-4o能拼好乐高吗?首个多步空间推理评测基准:闭源模型领跑

英伟达Jim Fan:「世界建模」是新一代预训练范式

医学领域也有世界模型了:精准模拟肿瘤演化,还能规划治疗方案

世界模型接棒语言模型,这家公司全球首创物理AGI“双金字塔”体系,通用机器人进入“家庭时代”

热门文章

陶哲轩吐槽GPT-6孪生素数新突破:令人无语的一幕

姚班校友主导,Claude攻克费马大定理首个完整形式化证明

这个世界模型训练完就“退场”,机器人反而更能干了

GPT-6带火循环Transformer,阿里早已布局

押中SpaceX的硅谷老将,把票投给了一家中国世界模型公司

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1