京东前副总裁,三个月拿下超21亿元融资

创业邦07-24

作者丨晨阳

编辑丨小龙

图源丨智象未来

如果说大语言模型教会了AI如何阅读世界,那么全模态世界模型正在教会AI如何观看推演干预世界——这是一场从认知到行动的范式革命。

7月23日,智象未来(HiDream.ai)宣布完成15亿元人民币C轮融资。

本轮融资由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金等多家机构跟投,老股东合肥产投、东方富海、金浦投资、金华金投、中哲创、财鑫资本持续加注。

至此,智象近三个月内已完成三轮密集融资,累计融资超过21亿元人民币,正式迈入独角兽企业行列。

这家成立仅三年多的公司,何以在资本寒冬中逆势吸金?

答案藏在它的技术路线里——全球首创的UiT原生全模态架构,让智象未来在文生图领域超越谷歌,全球排名仅次于OpenAI;其开源模型登顶国际权威评测榜首,闭源商用模型稳居全球前三。

微软实验室到合肥独角兽:

一群“视觉老兵”的二十年征途

智象未来成立于2023年3月21日,总部位于安徽省合肥市高新区,是国内最早布局多模态生成式AI的企业之一。

2024年9月将总部落户至合肥高新区,成为安徽人工智能产业先导区的“零号企业”。

创始人兼CEO梅涛博士,是加拿大工程院外籍院士、ACM Fellow、IEEE Fellow,同时还是国际模式识别学会和中国人工智能学会会士。

创始人兼CEO梅涛博士

他毕业于中国科学技术大学,获工学学士和博士学位。在微软亚洲研究院工作的12年间,他深耕计算机视觉与多模态领域。2018年至2023年,梅涛担任京东集团副总裁,负责AI技术商业化应用,是科技部科技创新2030人工智能重大项目首席科学家。

联合创始人兼CTO姚霆博士同样是微软亚洲研究院出身,曾参与Bing的视频搜索、小冰视觉对话系统的研发。2018年加入京东后,他带领团队完成了十亿级商品图像搜索系统和7×24小时物流智能机械臂分拣视觉方案的部署。

联合创始人兼CTO姚霆博士

这个团队的真正“原点”,可以追溯到2017年。

彼时,梅涛、姚霆等人在微软亚洲研究院发布了全球首篇文生视频论文,获得当年ACM Multimedia会议最佳创新论文奖。

这一超前布局在2022年迎来了爆发点——Midjourney的图像生成和ChatGPT的横空出世,让团队看到了多模态技术的巨大商业前景。

于是,梅涛带着姚霆等人,迅速搭建团队创业。

从创业到独角兽,智象未来只用了三年多。

2023年公司完成种子轮和天使轮融资,种子轮由阿尔法公社、中喝大种子投资,天使轮由讯飞创投领投、将门创投、阿尔法公社、中喝大种子跟投;

2024年,公司获得由合肥产投、安徽省人工智能母基金领投的A轮融资;2025年底,京东集团作为战略投资方加码;2026年4月完成超5亿元融资,由东方富海、安徽省投资集团旗下的省产业投资公司、峰华资本等新股东联合投资,合肥产投、兴泰集团、合肥高投、安徽省人工智能母基金等老股东持续加注;5月再度完成亿级融资;7月C轮15亿元落地,三个月累计超21亿元。

合肥产投连续三轮加注,折射出企业成长与合肥“硬科技+人工智能”城市战略之间的深度耦合。

UiT架构打破“大力出奇迹

如果说大模型竞赛的上半场是“堆参数、拼算力”,那么智象未来选择了一条截然不同的路径——从底层架构重新定义AI如何理解世界。

当前主流的DiT(扩散Transformer)架构遵循“文本编码器+VAE+扩散模型”的模块化路径,图片、视频等信号需要分开编码解码,信息在多次转换中不断损失,性能提升只能依赖堆数据和算力。

智象未来自研的UiT(Unified Transformer)原生全模态架构,从底层将图像像素、文本Token、视频体素以及音频、动作、空间关系等原始信号,统一映射进同一个共享Token空间,由同一套Transformer完成理解、生成与推理。

这一设计让文字、图片、视频等信号以更接近原始的方式直接进入模型,信息损失更小,可控性更强。

UiT架构的效率提升是惊人的——80亿参数的模型即可达到传统560亿参数模型的效果。

这意味着智象未来用极少的训练算力,就能实现国际领先水平,彻底跳出了“大力出奇迹”的行业惯性。

理解智象未来的技术路线,必须理解“多模态大模型”与“世界模型”之间的逻辑递进关系。 

梅涛认为,一个真正的世界模型有三个要素:表达、推演、构造世界。实现这些的关键在于,让模型真正建立起对物理世界统一的认知。

“不是做一个更大的拼接模型,而是在最底层把'世界的运行规律'刻进模型的DNA里,以统一的方式理解视觉、语言、动作和空间关系”。

基于此,智象未来的技术演进路径清晰而坚定:从多模态走向原生全模态,再走向世界模型。“原生全模态大模型是通往世界模型的最优路径”。

在模型层,HiDream-O1系列覆盖了从开源到超大规模的完整能力谱系。

2026年5月发布的HiDream-O1-Image-Pro,参数规模超过2000亿,在多个基准测试中刷新SOTA纪录。

商用版HiDream-O1-Image-1.5在全球权威AI评测平台Artificial Analysis的文生图榜单中综合评分超越谷歌同类模型,排名全球第三,仅次于OpenAI的两款模型。

开源图像模型HiDream-I1在榜单上线24小时内登顶,成为首个取得该领先位置的中国自研生成式视觉模型,全球下载量已超200万次。

图像编辑模型HiDream-E1.1则进入了Artificial Analysis图像编辑智能体榜单第一梯队。

在智能体应用层,智象未来构建了“1+1+3”业务架构——1个底座(HiDream系列大模型)、1个平台(HiHarness企业服务平台)、3个面向垂直场景的智能体应用。

HiHarness 企业服务平台是智象“1+1+3”业务架构中的中间层,提供标准化的模型能力输出。其核心是HiDream Token Hub,以MaaS模式对外输出标准化API,接入全球主流生态大模型,实现统一调度与融合调用。Token Hub为企业提供“一键集成”全球领先大模型能力的同时,持续优化推理成本。

2026年7月世界人工智能大会期间,公司发布了全球首个无限时长内容创作多模态智能体vivago R1。

行业现有AI视频产品普遍仅支持15-30秒短镜头生成,vivago R1突破性地支持任意时长视频连续、连贯生成,并通过多智能体协同机制将内容可用成功率提升至85%。

面向专业影视创作团队的“帧赞”,是全球首个专业级AI影视创作协作智能体,打通从剧本解析、分镜制作到粗剪成片的全链路,已累计制作短漫剧超5000分钟。

HiBurst 是面向平台商家的商业短视频内容生成与管理智能体自动生成适配 TikTok、Meta、抖音、小红书等主流平台的商业短视频。已成为TikTok官方前五大AI合作伙伴之一。

HiDreamFans是全球首款3D全息智能广告扇,面向实体商户与跨境电商。该终端已在全国落地超万家门店。

智象未来2025年全年营收过亿元,2026年第一季度签约收入超4亿元,已超过2025年全年。产品已覆盖全球100多个国家和地区,服务超过5000万专业用户和4万家企业客户。

从感知到行动:

多模态大模型的跨越时刻

多模态大模型正在成为继大语言模型之后,通往AGI的下一条核心路径。过去半年,大模型竞争的重心正在从语言理解和文本生成,向对真实世界的感知、推理、模拟与交互延伸。在这条赛道上,国内外玩家各显其能。

生数科技是智象未来在国内最直接的对手之一。

这家成立于2023年3月的清华系企业,由清华大学人工智能研究院副院长朱军领衔。

其成名之战是2024年4月发布的视频大模型Vidu,后者是中国首个全面对标Sora的文生视频大模型。

2026年1月,Vidu迭代至Q3版本,实现最长16秒声画同出,并支持多镜头切换、运镜控制与音效生成。

生数科技在2026年7月完成5亿美元(约34亿元)B+轮融资,创下国内通用世界模型领域单笔融资最高纪录。成立仅三年累计融资超50亿元。

Vidu在2025年实现用户和收入超10倍增长,ARR突破2000万美元,服务企业超3000家。

生数科技的战略已从视频生成延伸至通用世界模型,先后推出开源世界行动模型Motus和具身智能机器人大脑Motubrain,形成“数字世界视频生成+物理世界具身智能”双赛道布局。

爱诗科技则走了一条截然不同的路——以C端全球化产品为突破口。

这家由前字节跳动AI Lab总监王长虎创立的公司,旗下产品PixVerse面向全球市场。

融资层面,爱诗科技2026年7月完成整体C轮(含C+轮)累计29.8亿元融资,投后估值超20亿美元。

2026年初推出实时世界模型PixVerse R1,支持1080P分辨率实时生成;3月发布的PixVerse V6在Artificial Analysis图生视频、文生视频榜单中均位列全球第二。

爱诗科技约80%收入来自C端订阅,绝大部分来自海外用户,ARR超4000万美元。PixVerse注册用户超1.5亿,月活超1500万,覆盖177个国家和地区。

2026年5月,谷歌在I/O大会上发布了Gemini Omni,定位为“从任何输入创造任何内容”的统一基座全模态世界模型。

Omni依托Genie世界模型、Nano Banana图像模型、Veo视频生成模型三大技术底座,在单一模型内部完成所有模态的分析与生成。

首个版本Omni Flash已上线Gemini App、Google Flow和YouTube Shorts。模型生成视频具备精确的物理效果模拟,包括重力、动力及逼真音效。

多模态大模型正在经历从“技术验证”到“规模落地”的集体跨越。

这条赛道的玩家们正在用不同的路径回答同一个问题:如何让AI真正理解并推演真实世界的运行规律。

多模态大模型不仅是技术叙事,更是下一代生产力基础设施的竞赛。

在这场竞赛中,谁能率先打通从“感知”到“生成”再到“行动”的完整闭环,谁就有可能站在下一轮AI浪潮的潮头。

AIGC社群邀您加入

点赞、在看点这里

免责声明:本文观点仅代表作者个人观点,不构成本平台的投资建议,本平台不对文章信息准确性、完整性和及时性做出任何保证,亦不对因使用或信赖文章信息引发的任何损失承担责任。

精彩评论

我们需要你的真知灼见来填补这片空白
发表看法