很抱歉,当前没有启用javascript,网站无法正常访问。请开启以便继续访问。
媒体矩阵
创投日报
财联社 AI daily
科创日报
新消费日报
创业服务PE/VC服务城市服务未上市公司路演笔记
通往AGI的岔路口:谁在押注世界模型
原创
人工智能
科创板日报记者 余诗琪
2026-07-27 12:41
①2026年上半年,全球风险投资流向世界模型创业公司的资金已超过30亿美元。
②智象未来是这轮世界模型热潮中代表性的样本之一。过去三个月,这家合肥公司完成三轮、超21亿元融资,社保基金、上影、华策等多元资本入场。

《科创板日报》7月27日讯(记者 余诗琪)世界模型是不是通向AGI的必经之路,在AI圈内还未达成共识。

一部分人认为,世界模型与智能的上限无关,无非是一门“好生意”;另一部分人则坚信,大语言模型无法独立走向AGI,只有让AI真正理解物理世界的运行规律,才能突破智能的边界。

分歧存在,但另一个事实也在同步发生:2026年上半年,全球风险投资流向世界模型创业公司的资金已超过30亿美元。智象未来、生数科技、千寻智能等代表性公司都连续完成大额融资。

一边是分歧未歇,一边是资本速度涌入,世界模型赛道的叙事显然并未收敛。

同一个概念,指向不同问题的回答

今年4月,《科创板日报》记者在合肥科交会上首次报道智象未来。当时,这家总部位于合肥科大硅谷的AI公司刚完成超5亿元融资,并发布新一代原生全模态世界模型HiDream-O1。

三个月后,智象未来已接连完成三轮融资,累计融资额超过21亿元,公司估值也在密集融资中跨过独角兽门槛。《科创板日报》近日再度对话智象未来创始人梅涛,试图透过这家公司的快速崛起,理解一线从业者对世界模型赛道的真实判断。

梅涛可以说是世界模型路线的坚定支持者。

在此前采访中,他曾提出,大语言模型难以独立走向AGI,因为其无法指导机器与真实世界进行交互。真正的世界模型需要具备对物理世界进行表达、建模、推理和反馈的能力。

行业通常将世界模型概括为“model the world”,梅涛则更倾向于使用“mold the world”——塑造世界。

在最新的采访中,梅涛进一步解释称,如果AI仅仅复现世界,本质上仍是在压缩、拟合和复刻人类已有知识。在这一范式下,人类文明积累的信息量也会成为模型能力的边界。

按照他的理解,世界模型至少应当具备三种能力:表达世界、推演世界和构造世界。这意味着模型不仅要生成看似真实的图像或视频,还要理解不同模态信息之间的联系,以及场景背后的空间关系、时间变化和因果逻辑。

这一判断也决定了智象未来的技术路线。

当前不少多模态模型采用相对分立的架构:图像、文字等不同模态先分别编码,再在模型中完成对齐和融合。智象未来则选择原生全模态路线。

据梅涛介绍,公司自研的UiT(Unified Transformer)架构不再沿用VAE图像压缩与独立文本编码器相结合的传统方式,而是尝试将图像像素、文本Token、视频体素以及音频、动作、空间关系等信号映射至共享的Token空间,在同一个系统中完成理解、生成和推理。

“原生全模态从某种意义上说,是对人类感知世界方式的还原。”梅涛举例称,人看到一则台风即将登陆的新闻时,可能会同时联想到狂风、雷声乃至温度变化。这种联想来自人类多种感知系统的协同,而不是单一模态的独立处理。

按照梅涛的规划,智象未来将沿着“以图入视、以视入世”的路径,从图像生成向视频生成延伸,最终探索世界模型的完整能力。在图像生成这一阶段性能力上,智象未来已获得部分第三方评测验证。在Artificial Analysis的文生图榜单中,其开源模型在开源模型中位列第一,闭源商用模型进入全球前三。

梅涛进一步表示,公司不会在通用语言模型上与头部厂商正面竞争,而是继续聚焦视频和原生多模态。

这让智象未来成为了观察当前世界模型分歧的一个样本:梁文锋关注的是世界模型能否提升通用智能的上限,智象未来则试图从多模态生成出发,将世界模型转化为内容生产、视频创作乃至物理世界建模的技术基础。

可以说,双方使用了同一个概念,实际回答的未必是同一个问题。

同一个“世界模型”,不同的路径和商业模式

事实上,世界模型这个概念本身也并未收敛,贴上这个标签的企业,仔细看也有着迥异的技术路线和商业选择。结合过往跟踪采访的企业,《科创板日报》记者试图将这些企业做一个粗略的划分。

第一类就是像智象未来这样从图像和视频生成切入的企业。生数科技、爱诗科技也可以被归入这一类,这类公司首先需要解决的是画面质量、空间关系、长时序一致性、内容可控性和生成成本等问题。

但具体到不同的企业,在具体路径上仍有所不同。智象未来强调原生全模态,希望通过统一架构处理图像、文本、视频等不同模态;生数科技从视频生成起步,提出MoT统一架构;爱诗科技则以多模态视频大模型和面向消费者的视频生成产品为主要落点。

第二类世界模型公司则聚焦具身智能基础模型。这类企业试图让模型通过视频、机器人数据或仿真环境,学习物理世界的状态变化,并进一步预测动作可能产生的结果。

从《科创板日报》记者此前的采访了解的情况看,自变量、逆矩阵都可以被放进到这一类别当中。这类世界模型不以生成供人观看的视频为最终目标,而是为机器人的感知、决策和动作生成服务。其核心难点包括训练数据稀缺、仿真与现实之间的差异、长时序任务规划,以及模型在不同机器人本体和应用场景中的泛化能力。

第三类公司面向机器人的技能生成与动作执行,试图利用世界模型能力,打通机器人从任务理解到真机执行的链路。逐际动力、跨维智能可以被归入到这一类别当中。

与试图建立通用物理规律表征的世界基础模型不同,这类公司并不以训练一个覆盖所有物理场景的基础模型为首要目标,而是关注机器人如何将视觉、语言和环境状态等信息,转化为可以在具体本体上执行的动作策略。世界模型在这里更像连接机器人理解任务与完成动作的“技能层”。

对这类企业而言,世界模型的商业价值不在于单独出售一套通用基础模型,而在于缩短机器人从理解任务到执行任务的链路,并最终通过机器人整机、技能方案或场景交付实现收入。

由此来看,当前被冠以“世界模型”概念的企业,从底层逻辑来看并不处于同一条赛道:视频生成公司率先在内容产业寻找收入,具身智能基础模型公司试图成为物理世界的通用能力底座,世界动作模型公司则希望让机器人率先获得可以落地执行的技能。

三条路线共享“理解和推演世界”的技术叙事,产品形态、面对的客户和商业化周期却并不相同。

谁在押注世界模型?

智象未来的融资速度,是观察这轮资本热情的一个切片。

最新完成的15亿元C轮融资,由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投。这是社保基金首次作为LP投资多模态大模型方向,工银资本也是第一次进入这一领域

跟投方阵容同样跨越多重属性:厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金等。老股东合肥产投、东方富海、金浦投资、金华金投持续加注。

梅涛对投资者的入局逻辑有自己的观察。在他看来,国家级资本的进入意味着长周期投入的可能——“世界模型的研发不是一场短跑,需要底层架构的持续原始创新”。影视产业资本指向的是内容生产方式的重构——上影、华策带来的不只是资金,更是高质量影像数据和真实内容场景。地方国资的逻辑则落在产业生态上——合肥产投已连续三轮加注,从合肥到厦门、杭州、湖北,多地国资正在形成一个跨区域的“资本+产业”支撑网络。

智象未来并非孤例,前文不同路线的公司正在以不同的节奏吸收资本,从资金分布来看资本青睐程度差异明显。

第一类从图像和视频生成切入的企业(智象未来、生数科技、爱诗科技等),智象未来三个月融资超21亿元、爱诗科技完成29.8亿元C轮融资、生数科技B+轮单笔5亿美元,三家公司融资合计已超过百亿元,摸到了独角兽的门槛。

第二类聚焦具身智能基础模型的企业是当前独角兽密度最高的方向——智元机器人(估值150亿+)、星海图(估值200亿)、智平方(估值百亿+)、银河通用(估值百亿+)均属此列,自变量投后估值亦突破200亿元。

第三类面向机器人技能生成与动作执行的企业(逐际动力、跨维智能等),融资阶段整体偏早期,公开融资信息有限,尚无独角兽级别的公司跑出。

可以看到,资本对“离物理世界交互更近”的方向倾斜明显,但对“离内容生成更近”的方向同样保持投入。

“世界模型现在就像2010年的移动互联网,”一位VC内部人士对《科创板日报》记者表示,“我们也不知道哪个方向最终能跑出来,但我们知道不投一定会错过。”

资本确实已经来了,而且来得不慢。产业资本中,华为哈勃、小米战投等相继入局;市场化VC里,顺为资本、红杉中国等在多个头部项目中密集落子;国家队方面,社保基金、中网投、中国国新等相继布局;地方国资层面,杭州、厦门、湖北等多地同步跟进。四种不同性质的资本在同一赛道交汇,百亿级的资金已经进来了。

这些钱最终能烧出什么,是技术突破、商业模式,还是仅仅一场估值游戏,取决于这些公司能否把“世界模型”从一个概念变成可交付的产品。在此之前,分歧和竞速都将继续。

9195特别声明:文章内容仅供参考,不构成投资建议。投资者据此操作风险自担。
合作伙伴
科创板日报 ©2019-2026上海界面财联社科技股份有限公司 版权所有沪ICP备14040942号-11沪公网安备31010402006048号
举报电话:021-54679377转617举报邮箱:jinran@cls.cn