AI 日报hiw3c.com

陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产

量子位 www.qbitai.com 网页快照

陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产

阿里:三年之内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界。

田晏林 发自 凹非寺 量子位 | 公众号 QbitAI

不用搭景,不用等演员,导演陆川和团队,直接用AI把一场发生在400年前的明代灾难现场,搓出来了!

宫廷、火药库,还有史料中烟云如黑灵芝的大爆炸。按照传统影视工业的做法,这样的场景复原往往需要数月时间和千万级投入。

人物的脸、皮肤、神态已经相当逼真,几个明代人物也不再是过去那种一眼AI的塑料感。

再看爆炸。烟尘、碎片、火光一起往外冲,这种最容易穿帮的复杂场面,也都稳稳接住了。

这次,陆川团队把史料里的文字一点点翻译成现代视觉概念,前后大约做了四轮提示词优化,再参考真实爆炸影像去校准。

最后,阿里视频生成模型对烟尘、碎片这些复杂画面的还原 ,准确度已经达到团队预期的95%以上。

从史料搜集、画面制作到主题讨论,它开始进入完整创作链路;单在视频生成环节,阿里模型的贡献度就超过了一半。

Qwen3.8-Max 开始自己训练自己, Qwen3.8-Flash 提前放出下一代架构, Qwen3.8-Omni 为大模型开辟全新的思考分区, Qwen4 已经开练, Qwen4.5、Qwen5 也在路上。

另外,图像生成模型 Qwen-Image-3.1 、音乐生成模型 Happy Shrimp 1.1 、世界模型 HappyOyster 2.0 Preview 、语音模型家族 Qwen-Audio-3.1 、同声传译模型 Qwen3.8-LiveTranslate 也集体亮相。

阿里这一轮全模态升级,已经不太像是在补单项能力。它更在意的, 是这些模型能不能更快进入场景,变成真正的生产力。

阿里的全模态拼图,基本铺齐了

往外看,图像生成与编辑有Qwen-Image-3.1;视频生成有Wan、Happy Horse系列,以及计划11月发布的下一代视频模型;声音这边是Qwen-Audio-3.1,音乐则交给Happy Shrimp 1.1。

再往真实世界延伸,HappyOyster 2.0 Preview开始处理世界模型和交互环境;Qwen3.8-Omni-Flash把文字、图片、音频、视频放进统一理解框架;Qwen Intelligence继续把Agent能力推向手机终端。

导演给模型的可能是一段文字、一张参考图、一首音乐,最后交付的是一套完整的视听内容。

文字、图像、视频、声音、空间信息往往同时出现,模型最终要处理的,也很少是一种单独的信息。

文本、图像、视频、声音、空间的能力正在加速协同,AI也从生成一张图、一段视频、一首音乐,继续走向理解人的意图,创造完整沉浸式视听体验。

阿里方面判断: 如果语言模型是机器的大脑,多模态模型正在成为机器感知世界、创造内容并与物理世界互动的中枢。

Qwen负责语言、知识和推理;Image、Wan、Happy Horse、Audio、Happy Shrimp把能力往视觉、影像、声音和音乐延伸;HappyOyster再往三维空间和交互环境里走。

一张图生成得多漂亮,一段视频有多炸裂,依然重要。到了生产环境里,还会多出一长串更现实的考题。

从Demo走进生产线,多模态开始接受真考验

第一层:内容生产

据阿里披露,它曾经在Artificial Analysis的文生视频和视频编辑两项榜单上位列第一。

比如广告,一条片子里的商品外观、Logo、人物和口播只要有一个漂掉,前面生成得再炫也很难直接交付。

不过, Wan3.0已经拿到正向反馈了。 据使用者介绍,Wan3.0已接近真实广告拍摄水平。

第二层:进入专业创作

5天重建一场400年前的历史现场很惊艳,但这次尝试更有意思的地方,其实是它把AI带到了创作者真正难啃的位置。

通用模型很容易生成大家熟悉的古装剧质感,真正的历史现场反而需要陌生感,需要更严谨的史料,也需要模型理解导演到底想表达什么。

对此,阿里巴巴视频生成模型技术负责人表示, 未来将与更多导演、行业专家及历史学者合作,为模型引入更全面、更严谨的专业信息。

9月22日下午,在2026云栖大会的视听分论坛上,太合音乐集团总裁余灏坦言,AI给音乐行业带来的焦虑并不新鲜。

电子合成器、MIDI(乐器数字接口)、DAW(数字音频工作站)都曾经引发过类似担忧,但最后都变成了新的生产工具。

而现在,AI又把音乐创作成本往下压了一大截,普通用户和专业艺人都开始把它当生产力工具。

太合和阿里Happy Shrimp的合作,也开始往音乐人共创、产业生态、版权机制和AI音乐新消费场景延伸。

余灏特别提到,无授权AI翻唱的成本太低,大量版本泛滥,会直接侵蚀原版版权方和艺人的价值。

先做人设和视觉锚点,再用音乐模型做歌曲、人声和编曲,接着把音乐交给视频模型做MV和对口型视频,后面还要接大模型做评论抓取、分类和运营反馈。

据他透露,其 团队6个人就能孵化十多个AI歌手IP ,一些账号 4个月涨粉20万 ,全网累计播放量突破2亿。

电影要理解导演意图,音乐要处理版权和产业规则,AI歌手还得把音乐、视觉、人设、运营串成一整套工作流。

进入专业创作之后,多模态拼的已经不只是生成质量,还要能吃进专业知识,理解创作目标,并接进完整生产流程。

第三层:进入终端和物理世界

目前,千问端到端全双工实时语音交互大模型 Qwen-Audio-3.1-Realtime, 已经进入千问办公、Qoder(阿里智能体编程工作台)、千问AI眼镜、随身助理和桌面机器人等,能够边听、边想、边说。

Qwen Intelligence 继续把Agent能力塞进手机,希望完成跨应用复杂任务。

HappyOyster 2.0 Preview 则把战线拉到了物理世界。它要解决的是另一类问题:环境能不能长期保持一致,物体运动能不能符合物理规律,用户操作后能不能及时得到反馈。

这张多模态布局图已经越来越清楚: 先给人生成内容,再帮人完成工作,接着让机器真正理解并作用于世界。

但问题在于,这么多单项能力越来越强,AI怎么才能在一件复杂任务里,一直记得自己到底在干什么?

多模态的下一关,是连续理解和完成任务

今年年初,她开始认真学AIGC,自己下场做短片。最开始,她连人物三视图都要一点点学。

王珞丹曾经 抽卡抽到凌晨4点 ,一度觉得很绝望,到了早上6点,终于抽到了想要的镜头。

她的脑子里明明有一个很具体的状态,模型却很难准确呈现。反而在给一个宽泛概念时,模型倒有可能突然给出惊喜。

放到更广泛的Agent任务里,则是记住上下文、环境变化,以及前面已经执行过什么。

但一项完整任务,往往同时包含视觉、声音、语言、空间、时间和动作,而且这些信息还会一路变化。

多模态走到下一阶段,看的已经不只是能不能看、能不能听、能不能生成,更要看它能不能围绕同一个目标持续理解。

三年之内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界。

不同模态从模型底层共享同一个任务、同一份上下文和同一套世界理解,图像、视频、声音、空间、动作都围绕同一个目标往前走。

据了解,阿里的下一代视频模型已经沿着这条路继续推进。 新模型将在11月发布,方向之一就是从生成单个镜头走向理解完整叙事。

意思是,模型开始理解创作目标和创作意图,从一个想法、一段故事出发,自动拆剧情、做分镜、组织角色和场景,再完成生成。

今天,创作者还得反复重讲人物、风格和情绪。但理想状态则是把故事和角色讲清楚一次,AI就能记住全片设定,一路跟下去。

但陆川的《历史·现场》,已经让另一种可能开始出现。 AI可以真正进入专业创作链路,并承担相当一部分生产工作。

只是今天,这条链路还需要导演和团队在中间不断组织:查史料、定视觉、调提示词、校准画面,再把不同模型的能力接起来。

这意味着,AI要从理解创作意图,到记住人物、场景和叙事,再到调用图像、视频、声音乃至空间能力持续完成任务。

这样再回头看阿里这一轮密集的多模态更新,真正值得关注的,也就不只是又多了几个模型。

直播预告:未来两三年,哪些工业AI场景会率先爆发? 2026-09-22

具身智能技术路线尚未定型,基础设施却先收敛 2026-09-18

西门子不造机器人,为什么机器人进厂的故事里总有它? 2026-09-16

9月21日,深圳前海!聊聊工业AI与生态共创的下一步 2026-09-15

热门文章

从“会回答”到“会办事”,vivo如何解AI手机这道题?

刚刚,唐杰发布智谱RSI首个成果

刚刚,Claude Code大重构!内部3万Agent管理技术免费开放

协同办公进入Agent时代,飞书+豆包工作跑在了最前面

央企做了个通用Agent,直接杀进IDC实测前三!

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1