刚刚!WAIC首发无限时长智能体,四条路线改写多模态格局

今年世界人工智能大会(WAIC)期间的感受就一个词:热闹。
1100余家企业集中参展亮相,超300款产品全球首发、超4400款展品令人目不暇接。
这说明,AI****技术已经不是某个行业的事,而是所有人的事。
更重要的是AI企业估值规模快速增加。
其中,快手可灵最近公布完成总额上限30亿美元外部增资,投后估值有望达180亿美元;DeepSeek最新已经完成500亿元融资,已确定估值超过3500亿。
目前,中国平均每天生产芯片超过15亿块,大模型日均调用量达数百万亿词元,居世界第一。今年中国AI核心产业规模预计将继续超过30%。
高盛近期发布的行业研究报告指出,当前中国AI科技板块总市值约4万亿美元,增长潜力巨大。
就在7月18日,加拿大工程院外籍院士、ACM Fellow、IEEE Fellow梅涛创立的智象未来(HiDream.ai)适时加速多模态Agent落地——现场发布全球首款无限时长内容创作多模态智能体vivago R1。
简单来说,vivago R1就是一款能不限时长、逻辑不乱、画质稳定的全自动AI****长视频创作大脑,不用你分段拼接,它自己就能从头到尾完整拍出靠谱的长视频,直接商用。
智象未来创始人、CEO梅涛在演讲中表示,Agent OS是释放大模型核心价值的“最后一公里”。它并非简单的工具集合,而是一套可复用、可编排、可进化的创意生产力组件体系。依托Agent OS,vivago R1可实现全流程自主创作。用户仅需输入核心创作需求,智能体可在半小时内自主完成分钟级完整视频的全链路创作,全程无需人工干预。
显然,多模态AI正迎来属于它的DeepSeek时刻。

多模态Agent****背后四条核心演进路线
最近发生的一件小事,直观折射出多模态对于AI发展的重要性。
万亿估值的智谱,近期开源了大模型GLM-5.2****,一度达到开源AI编程第一、全球第二,仅屈居于大名鼎鼎的神话级模型Fable-5,强到离谱。但是,GLM-5.2却只是纯文本模型,实现百万Token超长上下文和深度逻辑推理,没有搭载视觉编码器,看不了图也造不出图。
反观拿来对标的Fable-5,甚至是DeepSeek视图模式,都是原生多模态模型,视觉能力应有尽有。
近期,智谱创始人唐杰征集对GLM-5.3的新功能建议,但大家一致认为,需要增加多模态能力。
所以你可以看到,大模型正以前所未有的速度快速跃迁,顶尖AI模型的智能水平已经很高了,Coding、Hermes Agent、企业级AI产品,都已经开始落地在真实场景中。但是,这其中依然存在落地难、适配弱、不可控的产业鸿沟,多模态能力至关重要。
而Agent智能体具备自主记忆、逻辑规划、工具调度、多端协作的核心能力,可将基础模型的生成与推理优势,转化为标准化、可验证、可交付的系统化产业能力,基础模型叠加智能体能力,正是一条新的路径。
“2023年之后,智能体产业迎来快速萌芽,2024年更是进入规模化爆发的关键阶段。站在当前产业节点来看,智能体的进化远未止步,未来将全面迈入自进化发展阶段,同时完成从单智能体独立作业到多智能体协同协作的核心迭代。自此,AI智能体不再是简单的工具辅助载体,逐步成长为可承接复杂任务、可自主完成全链路工作、可实现最终标准化任务交付的数字化员工,真正实现AI价值的落地闭环。”梅涛表示。
这意味着,无论是基座AI模型,还是具身智能、世界模型,多模态Agent是通用人工智能(AGI)发展的必经之路。
正如梅涛在演讲中所言,纵观智能体的整体发展历程,其技术迭代始终遵循四条核心演进路线,构建起全新的AI工程范式,彻底重构了传统AI的应用逻辑。
第一,是能力抽象维度的迭代,从传统的工具调用(Tool Calling)升级为可复用技能(Reusable Skills)的沉淀。过去智能体平台的开发落地,大多依赖API、SDK等基础接口调用,应用门槛高、复用性差。而当下的产业发展核心,是引导开发者将各行业的专业知识、业务经验与行业方法论,沉淀为标准化、可复用的AI技能。如今,行业技能已经取代传统接口,成为智能体调用、执行任务的核心基础单元,让智能体具备垂直行业的专业作业能力。
第二,是工程范式的核心升级,从提示词驱动(Prompt Centric)转向系统可靠驱动(Honney Centric)。早期AI应用优化,核心聚焦于单次对话、单次生成的效果优化,追求单轮回答的精准度。而新时代的智能体研发,核心目标已经转变为保障全系统输出的稳定性、可靠性与低成本,解决大模型概率性输出偏差、效果不稳定、落地成本高的行业痛点,这也是智能体能够规模化商用的核心前提。
第三,是迭代机制的颠覆性变革,从静态预定义工作流升级为反馈驱动的自主进化模式。传统智能体的工作流程、任务链路、工具调度逻辑,均依赖人工提前定义、固定固化,无法适配复杂多变的业务场景。而新一代智能体可依托真实业务反馈形成闭环,自主迭代工作链路、优化工具调度逻辑、完善任务执行流程,无需人工持续干预,实现真正意义上的自主进化。
第四,是协作框架的全面升级,从单智能体独立作业演进为多智能体协同调度。面对复杂、长链路、多维度的产业任务,单一智能体的能力边界有限。行业发展正加速构建完善的智能体编排系统,通过多智能体分工协作、统筹调度、互补赋能,破解单智能体的能力局限,承接更高复杂度、更高专业度、更高落地要求的业务场景。
基于这套成熟的技术架构与操作系统底座,当前智能体产业已形成两大核心应用形态,分别是通用智能体与多模态智能体,覆盖不同维度的产业需求。

全球首个无限时长内容创作智能体来了
从应用角度来说,过往我们用AI做视频,只能做几十秒短片、越长越容易画面崩坏、人物人设和剧情说断就断。
不管是个人创作者做短剧,还是企业拍宣传片、营销成片,AI始终只能当个“临时素材工具”,撑不起完整的商业创作全流程。
而在今年WAIC,智象未来带着多年多智能体协同与AgentOS系统的核心技术沉淀,直接打破了这个行业僵局——全球首款无限时长创作智能体vivago R1正式首发亮相。
以智象未来(HiDream.ai)自研的vivago R1为代表的多模态智能体,是全球首个无限时长内容创作智能体。
相较于通用智能体,多模态智能体需要应对更复杂、更精细化、更具创意属性的创作流程,核心要解决内容专业性、结果可复现性、流程可协作性三大核心问题,最终为用户交付可落地、可商用、高品质的内容价值。

在梅涛看来,AI创作不再是拼接碎片素材的辅助工具,已经实现了一次行业升级:从“单点素材生成”,进阶到能自主思考、自主规划、自主跑完整条长链路创作的全能创作搭子。
简单说,以前AI只能帮你“拼片段”,现在vivago R1能帮你“做完整成片”。
纵观整个行业,vivago R1的核心优势可以精准概括为长、长**、准,刚好对症下药,解决了困扰创作者和企业已久的难题。**
vivago R1先拆掉的是时长。
市面上的AI视频模型大多卡在15到30秒。要做几分钟的短剧、一条品牌宣传片,过去只能反复生成、手动拼接,费时间,接缝还看得出来。vivago R1不设这个上限,任意时长一条生成完,短视频矩阵、连载短剧、品牌大片走同一套流程。AI长视频商业化这块空白,算是补上了。
时长之后,麻烦是连贯。
短片接起来不等于长视频。手拼的片子常见毛病是前后不像同一个东西:人脸变了、场景风格散了、剧情接不上,整条片过不了商用那条线。vivago R1的做法是先想后做。接到任务,它会先把故事线、镜头节奏、人物和场景设定钉住,过程中持续校准。AI视频跳变、人设崩、叙事断这些老问题,是从这里压下去的。

最后一关是产出稳不稳。
用过AI做视频的人都清楚,模型随机性强,十次翻车八九次,有效成片率低。企业想批量接单、规模化交付,人力和时间顶不住。
依托自研AgentOS全流程调度与治理技术,vivago R1实现了创作全链路的可控、可校准、可复盘。目前其内容有效可用成功率达到****85%,远超行业平均水平。这意味着大部分生成内容无需反复微调,可直接用于商业制作、品牌传播、市场化交付,真正把AI创作从“碰运气”变成了“稳产出”。
这事不是调个API、套个模板就能干的。
同样是出分镜、做成片,专业活儿要读镜头语言、压叙事节奏、接内容情绪,还要分清Vlog、短剧、营销片、专题片各怎么做。

这种行业理解和调度颗粒度,普通大模型没有。
这款产品早已获得全球行业认可。
今年5月,vivago 灰度测试版成功登顶Product Hunt日榜第一。硅谷知名技术博主Chris Messina亲自体验产品,仅通过简单文字输入,便生成出一段叙事完整、分镜丰富、画面流畅的一分钟短视频,充分验证了其极简操作、高阶输出、全链路自主创作的核心能力。
基于技术演进路线,整个AI产业已经形成清晰的五层Agent技术架构,自上而下依次为应用场景层、能力层、系统层、资源层与底层模型层,层层赋能、闭环联动。而贯穿整套架构、保障全链路高效运转的核心关键,便是智象未来自研的全新HD-AgentOS智能体操作系统。
该智能体操作系统依托资源层、系统层、能力层三层耦合架构,构建起完整的智能体产业落地支撑体系:
资源层决定了智能体可调用的资源、可依托的基础能力,是智能体作业的基础支撑;
**系统层定义了智能体的作业标准、调度逻辑,保障任务高效、**稳定落地;
能力层界定了智能体的业务边界与专业水准,决定其可实现的业务效果;
最上层的应用场景层,则面向各行各业真实业务,实现技术价值的最终落地。
简单来说,HD-AgentOS是套智能体操作系统,管的是多个智能体怎么搭班。单个智能体能兜的事有限,几个搭成团队,能看、能想、能动手,跑起来还会自己改。这么搭是为了让智能体能在复杂的真实产业场景里落下去,不停在演示那一步。
可以说,Agent OS是释放大模型核心价值的“最后一公里”****,它并非简单的工具集合,而是一套可复用、可编排、可进化的创意生产力组件体系。
vivago R1的核心价值,是将AI内容创作从传统的单点、单次碎片化生成,推进到长链路、全流程、智能化、可商用的规模化生产新阶段,重构了AI内容创作的产业范式。

33天融资超5****亿,
已覆盖5000万专业个人用户
今年4月,智象未来(HiDream.ai)宣布完成超5亿元新一轮融资。本轮融资由东方富海、安徽省投资集团旗下的省产业投资公司、峰华资本等新股东联合投资,同时合肥产投、兴泰集团、合肥高投、安徽省人工智能母基金等老股东持续加注。
今年5月,智象未来宣布完成新一轮亿级融资,深创投、金浦投资、财鑫资本、复聚资本等多家机构参与。
短短30天左右,智象未来迎来两次超过5亿元融资,体现出资本市场对原生全模态大模型方向的持续看好。
随着视觉生成、具身智能等前沿技术加速融合,世界模型成为 AI 演进的重要方向,智象未来在底层模型架构、产品化能力与产业生态布局上的持续突破,也获得了市场进一步认可。
截至目前,智象未来产品已覆盖全球超5000万专业用户及4万余家企业客户,形成了从技术研发到产品商业化的闭环。
今年5月,智象未来正式发布超2千亿参数、基于新一代原生全模态模型架构 Unified Transformer(UiT)打造的图像大模型 HiDream-O1-Image-Pro。
这不仅在多个基准测试中刷新 SOTA 纪录,也标志着智象未来正向图像、视频、文本、音频等多模态统一建模的“原生全模态”阶段迈进。
如今,AI大模型的演进路径清晰且笃定,正从单模态走向多模态,从多模态升级为全模态,最终迈向原生世界模型。
行业赛道虽存在多种技术流派,包括3D原生模型、视频多模态模型、具身智能等,但最具落地可行性的核心路径,是从视频多模态迭代到原生全模态,最终完成世界模型的终极进化。
梅涛认为,未来的原生全模态世界模型,将实现“任意模态到任意模态”的自由转换,无需二次分发、压缩与适配,实现认知、感知、交互、生成的一体化闭环。
其中,图像是世界模型进化的核心起点:图像向时间维度延伸,形成动态视频;向空间维度拓展,构建三维几何空间;叠加交互能力,最终形成具备自主感知、自主反馈、自主进化的具身智能形态。
在他看来,原生全模态大模型的落地,将推动智能体实现架构升级、能力跃迁、协作革新、安全落地四大维度的跨越式升级:
“我们可以总结出AI产业进化的核心逻辑:大模型让AI读懂世界、拥有认知能力,智能体让AI落地行动、实现价值交付,而原生全模态世界模型,将认知、行动、反馈深度串联,最终推动AI从简单的内容生成,进化为能够重构场景、赋能产业、改变世界的核心生产力。”梅涛在演讲结尾表示。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐

所有评论(0)