当前位置:主页 > 国内 >

婉君

魔法原子WRC2026实景验真!魔法原子物理 AI:横跨工业与商业,多形态机器人真实上岗_我的网站

女生名叫黄蒲军校

A |     文|晓静          编辑|徐青阳          方汉给世界模型的竞争设定了一个简单直接的判断标准:谁先拿到1000万小时数据,谁就更有可能率先跨过模型能力的拐点。         7月19日,昆仑万维在WAIC上发布具身智能世界模型Riemann 1.0。相比已经进入产品和商业化讨论的大语言模型,世界模型仍处于更早期阶段:技术路线尚未完全确定,模型能力有限,行业甚至还没有形成统一的数据生产方法。            8月19日至23日,魔法原子亮相WRC2026,以"打造场景驱动的物理AI原生平台"为核心叙事,将"魔法小镇"搬进展台,沉浸式呈现工业制造、物流分拣、公共安全等真实业务场景解决方案,并通过三大demo展示自研通用具身大模型Magic-VLA K02的全新进化能力,拆解"场景出题—模型解题—数据反哺"的技术闭环。       大会期间,魔法原子还以承办“场景驱动,产需共融”主题论坛为契机,撬动产学研界头部资源,牵引产业链上下游企业共同探索具身智能从演示走向实用、从单点作战到生态共融、从区域协同到全球竞争的规模化路径,集中呈现商业化落地成果,释放强大生态动能。       01|真实业务沉浸式还原,工业制造、物流分拣、公共安全等三大场景成全场焦点        今年的WRC,真实业务场景的闭环验证成为检验具身智能企业实力的核心标尺。

B |          在昆仑万维董事长兼CEO方汉看来,这条赛道接下来的核心变量,是谁能率先把训练数据从十万小时推到百万乃至千万小时。         他的判断来自训练视频生成模型的经验。

C | 昆仑万维曾用约20亿个、每个15秒的视频片段训练模型,并观察到明显的Scaling拐点。以此推算,方汉认为,具身智能世界模型可能至少需要1000万小时数据,才有机会进入类似的收敛阶段;更高的门槛甚至可能达到1亿小时。展会现场,魔法原子把工厂、仓库、园区等真实任务场景"搬"进展馆,让观众在同一个空间里看到具身智能在工业制造、智慧物流、公共安全等行业的真实工程场景与商业落地价值。魔法原子WRC2026实景验真!魔法原子物理 AI:横跨工业与商业,多形态机器人真实上岗        展会现场,魔法原子工业轮式人形机器人MagicBot D1成为当之无愧的焦点。         这不是已经验证的行业定律,更接近模型公司基于Scaling经验作出的下注。它兼顾大范围移动与精细化操作,在模拟货舱边流畅完成物料搬运、上下料与跨区转运全流程,整个过程流畅顺滑。       D1采用轮式底盘与人形上肢复合构型,搭载7自由度力控机械臂,单臂负载5kg、力控精度0.5N,配备厘米级建图定位系统(定位误差≤7cm)与自研RCS集群调度系统,作业高度覆盖80-230cm、抓取半径90cm,支持热插拔换电与自动回充,可实现7×24小时无人值守运行。但如果判断成立,世界模型首先是一场成本战争。

D |        这款产品定位工业级量产的智能机器人,主打替代人工重复性体力劳动,目前已在追觅智能制造工厂承担车间物料搬运、流水线上下料等真实生产任务,得到可靠验证,并成为未来魔法原子面向工业制造、智慧物流场景解决方案中的核心载体。       在工业制造场景,魔法原子已形成“一脑多形”的多机型落地路径,同一通用大脑驱动人形机器人、轮式人形机器人、分拣机器人等多形态硬件在不同岗位规模上岗,从根本上降低跨本体迁移的训练与开发成本,让具身智能真正嵌入制造生产的核心环节。         目前,UMI数据和真机数据的单小时采集成本通常在500元以上,部分可达到一两千元。魔法原子WRC2026实景验真!魔法原子物理 AI:横跨工业与商业,多形态机器人真实上岗        在智慧物流场景,魔法原子实景复刻仓储流通完整业务链路,现场演示模块化产品的多机协同作业,轮式人形机器人 XGZ1、分拣机器人 HyperBot 异构多机协同作业,完整呈现 “供包‑分拣‑转运” 全流程闭环方案        展台上,XGZ1作为柔性工作站,通过3D视觉与AI多模态融合感知将杂乱堆叠的物料逐一精准抓取,投入HyperBot分拣系统接续处理;HyperBot以2.5m/s运行速度配合弧线转弯流畅穿梭,货品被精准分拨至对应位置,引得围观人群频频举起手机记录。

E | 按照这一价格,1000万小时意味着50亿至200亿元投入,几乎没有公司能够长期承担。

F |        该方案以XGZ1的6秒末端执行器快换系统打破传统工业机器人"一机一用"的刚性壁垒,以免改造适配降低基础设施投入,以自研RCS调度系统实现人形、机械臂、AGV等多形态机器人的集群协同与数据链路打通,形成"设备部署—现场运行—算法迭代"的数据飞轮,可为物流行业从刚性自动化向柔性智能化转型提供模块化、可即刻部署的解决方案。魔法原子WRC2026实景验真!魔法原子物理 AI:横跨工业与商业,多形态机器人真实上岗        在公共安全场景,魔法原子 “智慧警务” 解决方案已落地交通管理、巡控处突、政务服务等核心业务场景。         异构数据可以改变这个难以承受的账单。       此前携手无锡市公安局,魔法原子交管机器人亮相 2026 无锡马拉松,圆满完成交通指挥、人流疏导等实战工作,成为全球首个服务大型赛事的双足机器人交警,获得外交部发言人公开点赞。所谓异构数据,主要是通过手机、胸挂摄像头或采集帽,记录人类在真实环境中的操作过程,不需要昂贵的采集手套和VR设备。今年 7 月,企业牵头筹建江苏省公共安全具身智能机器人重点实验室,搭建 “领军企业 + 公安院校” 产学研用协同创新联合体,技术能力与实战价值收获官方认可。       依托沉淀的警务定制研发与全链条交付能力,魔法原子联动生态伙伴,与中国移动连云港分公司 5G‑A 算力网络基础设施深度融合,多方围绕交通管理、应急处突、政务服务等一线警务场景开展联合攻关。方汉预计,随着硬件和供应链继续降价,异构数据成本有机会降至每小时10元左右。       公共安全是检验具身智能技术的实战 “炼金场”。这样一来,1000万小时数据的直接成本约为1亿元,Scaling第一次具备了经济上的可行性。魔法原子凭借全栈自研技术、一线实战打磨、重点实验室赋能的组合优势,率先实现人形机器人在公安业务领域的规模化应用闭环,加速具身智能从实验室走向真实业务现场。

G |          但异构数据天然粗糙。一段普通视频只能看到一只手抓起杯子,却无法直接获得手指的三维姿态、空间距离和受力信息。昆仑万维的做法,是用辅助模型恢复视频的深度信息,再通过高斯泼溅等方式重建手部三维模型和运动轨迹,把低成本的二维视频“升维”为接近专业设备采集的数据。       未来,魔法原子也将持续根据实际需求发力服务机器人,以酒店、洗衣房、商场三大商业场景为起点,联合生态伙伴打造一体化解决方案,覆盖接待导购、物品分拣、无人作业、终端配送全业务环节,赋能线下服务智能化升级,推动实体零售业态跳出传统静态无人柜模式,迈向移动式具身智能服务新时代。       02|完善四足机器人产品矩阵适配工业巡检场景,轻工业四足MagicDog T1新品重磅首发        本届WRC,魔法原子重磅首发轻工业四足机器狗MagicDog T1,全家族产品矩阵再增一员,为公司在工业巡检、园区安防等场景解决方案提供全新的标准化产品模块。         这意味着,世界模型的数据壁垒不只在于买到多少视频,更取决于能否把脏数据转化成高质量训练数据。Riemann 1.0提供了初步验证:加入大量异构数据后,模型在叠衣服等精细操作任务上的表现仍然明显提升,并在RoboCasa 365基准测试中比此前方法高出8个百分点。       T1以"轻装重载,智足先行"为产品理念,与工业级四足机器人MagicDog Y1形成轻-重搭配的载荷梯度覆盖。相较于Y1,T1体型更小、性价比更高、灵活性更强,其核心竞争力在于模块化与场景适配能力,让园区、仓库、商铺等此前"用不起也用不上"工业四足机器人的轻工业场景具备部署条件。魔法原子WRC2026实景验真!魔法原子物理 AI:横跨工业与商业,多形态机器人真实上岗        性能方面,T1整机重量约18kg,持续负载最高15kg,最高运动速度5m/s,可完成18cm高度攀爬、从容应对40°坡道,支持单人搬运和快速部署;机身搭载RGB相机、RGBD视觉以及16线激光雷达,提供自主导航、智能避障、目标追踪和实时图传功能,空载连续作业时间最长约3小时,补能提供回充和换电两种方案。         按照方汉的时间表,目前主要厂商还在10万至20万小时量级;2026年底可能有人进入百万小时;2027年底或许会有厂商达到千万小时;1亿小时则至少需要三至五年。

H |          谁最可能跑在前面?方汉的回答很现实:“看融资能力,谁钱多,谁采购的数据就多。       尤其是,通过背部标准化拓展接口,T1可快速搭载各类夹爪配件与行业模块,完成垃圾捡拾、按钮按压、杂物清理等轻量作业,将巡检与现场干预集成于同一平台——一台机器狗不再只是"会走路的摄像头",而是能够动手干活的多用途平台,这种模块化设计思路,正契合当前工业场景对"一机多能、按需扩展"的柔性诉求。魔法原子WRC2026实景验真!魔法原子物理 AI:横跨工业与商业,多形态机器人真实上岗        目前T1已在追觅智能制造工厂开展实际验证,通过加装机械臂完成地面杂物清理、设备按钮按压等轻量操作;本届WRC现场,T1演示搭载机械臂完成地面杂物清理等轻量作业,配合背部拓展接口加装的视觉与环境传感器,实现设备状态巡查、按钮操作、地面杂物清理等轻量作业的集成化执行,进一步拓展四足机器人在工厂中的任务边界。”但他同时认为,中国在数据生产环节具备结构性优势。       03|Magic-VLA K02通用具身大模型全面进化,"一脑多形"从概念走向工程现实        四足机器人、人形机器人、轮式机器人等不同硬件形态如何协同,形成合力赋能场景中复杂任务难题的解决?魔法原子给出的答案是——物理AI中央大脑式通用具身大模型底座。       WRC现场,魔法原子设置三个demo,展示Magic-VLA K02通用具身大模型能力,吸引观众驻足互动。

I | 魔法原子WRC2026实景验真!魔法原子物理 AI:横跨工业与商业,多形态机器人真实上岗        非遗雕版拓印展示区,机器人左右手协同,依次进行刷墨、放纸、压重物、递出成品等动作,一气呵成为观众送上定制卡片。这一demo展示Magic-VLA K02在超长程任务规划与执行方面的超强能力,验证左右手异构协同与精准时序动作规划。       在传统工业机械臂中,此类左右手协同需工程师手动编写大量coordination逻辑,而Magic-VLA K02通过高层系统将"拓印"这一抽象指令自主拆解为具有明确时序关系的原子任务序列,从源头降低多步骤操作中的误差累积。世界模型依赖摄像头、传感器、采集设备和机器人本体,中国拥有完整的消费电子和制造业供应链,也拥有制造、物流、家政、医疗等丰富的真实任务场景。魔法原子WRC2026实景验真!魔法原子物理 AI:横跨工业与商业,多形态机器人真实上岗        柔性衣物整理展示区,demo则直击高自由度可变形物体操控这一行业公认难题,Magic-VLA K02在WAIC已掌握T恤折叠的基础上,面对从未见过的新品类Polo衫自主将已有技能模块进行零样本重新组合,通过多轮探索与试错习得叠衣策略,完整呈现从"单品专用"到"跨品类泛化"的能力跃迁;现场观众可任意打断叠衣过程,机器人基于"关键结果图像"机制重新识别衣物状态、判断任务偏差并恢复后续操作。因此,他判断,未来全球具身智能公司可能都需要到中国采购设备和数据。         这种模型观也解释了他为什么不认同“竞争重点正在从模型转向应用”。魔法原子WRC2026实景验真!魔法原子物理 AI:横跨工业与商业,多形态机器人真实上岗        叠盒贴胶展示区则展示了行业首次由通用具身大模型完整实现叠盒与封胶组合式长程任务,验证刚性箱体精细操控与柔性胶带动态控制的组合挑战,现场成功率超过90%,标志着大模型驱动的长程操作正从实验室走向可部署的生产力工具。       尽管三个demo虽任务物理属性差异显著,但现场呈现的并非三套彼此独立的固定程序,而是同一模型框架在不同任务中的能力外化。方汉认为,应用公司最大的风险,是今天独立存在的能力,明天可能被基础模型直接吸收。

J | 今年4月,魔法原子正式发布自研通用具身大模型Magic-VLA K02,4个月以来模型能力实现全面进化。行业专家写下的Skills、工作流和操作流程,一旦成为训练材料,就可能反过来增强基础模型,压缩应用层的价值。         他的结论是,无论做模型还是应用,能够持续沉淀进模型的数据,才是更持久的资产。         当然,这套逻辑仍有一个未经验证的前提:世界模型会继续遵循Scaling规律。方汉判断,具身智能最终可能像自动驾驶一样收敛到端到端路线,主流架构或走向DiT;但他也承认,自监督架构未来存在取代DiT的可能。         一旦出现架构层面的范式切换,千万小时数据还能保留多强的壁垒,仍然没有答案。对方汉而言,当前的判断比较明确:在下一次技术范式变化发生之前,先把数据规模推过拐点。其分层式双系统联合架构使复杂长程任务整体准确率达到92%,任务中断率降低至5%以内,场景适配吞吐量提升110%,跨设备适配成功率达100%,所需机器人示范训练数据量减少60%,为行业从"单品专用"迈向"通用泛化"提供了可量化的技术标杆。       Magic-VLA K02通过引入元数据描述体系,对不同机器人的本体类型、控制模式和动作空间进行统一表达,使同一套模型框架能够支持机械臂、移动操作机器人以及单臂、双臂等不同硬件形态,兼容设备品类提升200%以上,"一脑多形"从概念走向工程现实。

K |        04|获评2026全球具身智能标杆企业TOP100        魔法原子携手生态伙伴共话行业下个十年        真干活、真聪明、真落地成为今年WRC主旋律,具身智能商业化落地成为行业最关心的议题。         以下为对话实录:          01 世界模型的技术路线最终会走向哪里?          Q:具身智能领域存在多种世界模型路线,未来会向哪一种技术路线收敛?          方汉:可以参考自动驾驶的发展过程。自动驾驶早期经历了多种技术路线的竞争,最后逐渐走向端到端模型。截至目前,魔法原子在手订单和跟进中的订单超11亿元,成为行业扎实推进量产交付与工程化落地的标杆。魔法原子WRC2026实景验真!魔法原子物理 AI:横跨工业与商业,多形态机器人真实上岗        8月21日,魔法原子获评2026全球具身智能标杆企业TOP100,魔法原子CTO陈春玉受邀参加由亿欧网举办的具身智能商业化落地论坛,与行业头部企业共话具身智能机器人量产交付与工程化落地。       陈春玉认为,量产是体系性考验,跨过几百台到几千台这道槛考验的是供应链、工程化能力与稳定性测试,最终目标是达到万台以上规模,让机器人长期稳定、可靠地为客户使用。展望未来,通用大脑是终极目标,在它到来之前,有大量限定场景需要企业深耕,魔法原子将锚定全栈自研,践行场景驱动,与各界伙伴携手,共同探索行业发展。

L | 魔法原子WRC2026实景验真!魔法原子物理 AI:横跨工业与商业,多形态机器人真实上岗        今年7月,魔法原子全票当选江苏省具身智能机器人产业联盟第二届轮值理事长单位,接棒首届理事长单位南京埃斯顿自动化——这一交接被业内视为江苏机器人产业由工业自动化向AI驱动的具身智能跃迁的标志性信号,也折射出"物理AI元年"的区域产业共振。我认为,具身智能的世界模型最终也会收敛到端到端路线,因为只有端到端模型才具备持续扩展的能力。       接棒联盟后,魔法原子发布"承上启下、破局立标"工作规划,聚焦场景落地、数据闭环、标准制定、产品出海、产学融合五大方向,响应"地方征集、联盟张榜、企业揭榜"的供需对接机制,推动具身智能产品由"展示品"变为"商业品"。

M |          视频生成模型也是类似的过程。"单打独斗难成气候,生态协同才是规模化落地的关键。

N | 视频模型发展了很多年,但长期没有出现压倒性的能力跃迁。直到训练数据扩大到数十亿个视频片段,模型才迎来明显拐点,进入类似文本大模型“ChatGPT时刻”的发展阶段。

o |          具身智能也面临同样的问题:端到端模型究竟需要多少数据,才能迎来能力拐点?目前行业的判断并不完全一致,但我认为至少需要1000万小时的数据,模型才有可能开始明显收敛;更高的估计可能达到1亿小时。"魔法原子总裁顾诗韬表示,魔法原子愿以全栈技术和场景驱动打通落地最后一公里,与300多家联盟成员并肩前行。魔法原子WRC2026实景验真!魔法原子物理 AI:横跨工业与商业,多形态机器人真实上岗        WRC 2026期间,魔法原子承办的“场景驱动 产需共融”2026具身智能机器人产业生态论坛在北京圆满举办。来自中国科学院、清华大学、中国信通院、赛迪研究院等产学研界的专家学者,与江苏省具身智能产业链上下游企业代表齐聚一堂,围绕具身智能产业前沿趋势、场景落地、标准建设与国际化路径展开深入探讨。         Q:世界模型大约会在什么时间迎来技术拐点?          方汉:关键要看谁先获得足够规模的数据。目前行业头部模型的训练数据大多还处于十万小时量级。我们这次发布的模型使用了20多万小时数据,其他厂商公开的数据规模也大致在相近水平。

p |          接下来可以观察几个节点:谁先达到100万小时、500万小时和1000万小时,以及达到1000万小时后,模型是否真的会出现能力拐点。

q |        “消费者不苛求通用性,但要求机器人执行任务的成功率必须达到99%。         按照我们的判断,2026年底可能会有厂商达到百万小时级别,但达到千万小时仍然比较困难;到2027年底,可能会有厂商进入千万小时规模。”魔法原子技术负责人霍江浩在圆桌对话中强调。具身智能的最大挑战不是技术本身,而是部署执行与场景的深度融合能力。       本次论坛由江苏省工业和信息化厅指导、江苏省具身智能机器人产业联盟主办。论坛期间,江苏省具身智能机器人产业联盟与TÜV南德意志、TÜV莱茵两家国际权威认证机构签署战略合作协议,标志着江苏具身智能产业在标准化、国际化道路上迈出关键一步。

r |        魔法原子总裁顾诗韬在论坛上表示,公司定位为场景驱动的物理AI原生平台,坚持软硬件全栈自研,核心算法与硬件自主可控率超90%,已在工业制造、智慧物流、公共安全等场景商业化落地,产品覆盖近30国,海外收入占四成。物理AI元年已至,未来,魔法原子将以生态思维替代单点竞争,让场景成为试金石,让协同成为加速器,与产业伙伴共同定义具身智能的下一个十年。【广告】免责声明:本内容为广告,相关素材由广告主提供,本文仅代表作者个人观点,与本网无关。至于1亿小时,大概率还需要三至五年。         Q:您为什么把2026年称为“世界模型元年”?          方汉:一个赛道真正进入元年,需要先证明核心技术路线可以成立。

s |          世界模型的概念此前已经很热,但行业一直没有确定,到底应该依赖真机数据、UMI数据、仿真数据,还是普通人类操作视频。本网发布目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,广告内容仅供读者参考,请自行核实相关内容。大家都在做实验。

t |          到了今年,包括我们在内的一批团队逐渐证明,第一视角的人类操作视频等异构数据,能够有效提升世界模型的能力,而且这种数据具备大规模扩展的可能。         它不需要操作者佩戴昂贵的手套或VR设备,通过手机、胸挂摄像头等设备就能采集。异构数据能够成为世界模型预训练的主要数据来源,这条路线得到验证,是我认为2026年成为世界模型元年的重要原因。

u |          Q:世界模型领域什么时候会出现明显的公司分化?          方汉:还是要看数据规模。         目前大家的起点相对接近,尚未出现特别明显的分化。当部分公司拥有百万小时数据,而另一些公司仍停留在十万小时,差距就会开始拉开。         如果有厂商率先进入千万小时级别,它的模型能力很可能发生比较大的变化。Scaling的红利已经得到初步验证,现在的问题是,谁能更早获得足够多、足够高质量的数据。         02 异构数据将成为具身智能扩展的关键          Q:为什么世界模型需要异构数据?          方汉:最现实的原因是成本。

v |          传统的UMI数据和真机数据采集成本非常高。过去一套数据采集手套可能需要十几万元,目前虽然已经降到一万多元,但单小时数据采集成本通常仍在数百元,部分高质量数据甚至达到一两千元。         按照每小时500元计算,1000万小时数据需要50亿元;如果达到1亿小时,就是500亿元。几乎没有公司能够长期承担这样的成本。         异构数据的采集门槛低得多。通过手机、胸挂摄像头等设备拍摄人类完成真实任务,当前每小时成本可能在几十元。随着设备和供应链进一步成熟,未来有机会降到每小时10元左右。这样一来,1000万小时数据的成本可能下降到1亿元量级,开始进入企业可以承担的范围。

w |          与此同时,异构数据的多样性和环境复杂程度,往往高于标准化的真机数据。我们在模型中加入大量异构数据后,即使是叠衣服这样的任务,能力也出现了明显提升。         Q:普通视频缺少深度和手部姿态信息,如何转化成机器人可以使用的数据?          方汉:普通视频确实只是二维画面,无法直接获得手指关节、空间距离和运动轨迹等信息。         我们的做法是训练一系列辅助模型。第一步,通过深度估计模型,从二维画面中恢复物体和手部的前后空间关系;第二步,对手部进行三维重建,把视频里的手部运动转化成可计算的三维轨迹。         经过这些处理,普通视频所包含的数据维度,就能够逐渐接近专业采集设备得到的数据。         数据清洗本身也是模型能力的一部分。团队需要针对深度估计、手部重建、姿态识别等环节训练专门的标注模型,才能把规模庞大但相对“脏”的视频数据转化成可用的训练数据。         与此同时,采集硬件也在快速降价。现在已经出现双目摄像头、胸挂设备和采集帽等产品,未来还会加入运动传感器、鱼眼镜头等组件。随着中国供应链持续降低设备成本,异构数据的数量和质量都会提高。         Q:异构数据、真机数据和仿真数据之间是什么关系?          方汉:这些数据会在不同阶段发挥作用。         异构数据成本低、规模大、场景丰富,更适合承担预训练阶段的主要任务。高质量UMI数据和真机数据成本更高,可以用于监督微调、强化学习和后训练。         机器人最终要在真实环境里工作,因此真机数据不可缺少。

x | 更合理的路线是,用大规模异构数据建立模型的基础能力,再用少量、高质量的真机数据完成能力校准和强化。         仿真数据可以在早期提供帮助,但它无法完整替代真实世界数据。

y | 游戏引擎中的物理规律并不完备。

z | 例如,虚拟角色抓取杯子时,杯子的形变、摩擦和受力可能与真实世界不同。         仿真数据之所以被大量采用,主要因为成本低,并不意味着数据质量更好。短期可以使用,长期仍然要依靠真实的人类操作数据和真机数据。         Q:具身模型的后训练会不会成为下一个竞争重点?          方汉:后训练非常重要。缺少后训练,模型很难真正落到具体机器人和具体任务上。         目前现场展示的许多机器人,在进入新环境后仍然需要采集一部分现场数据,再进行小规模后训练。随着世界模型能力提高,模型的泛化能力会增强,对现场数据采集的依赖有望下降。         后训练的重点不只是速度,更重要的是数据质量。后训练看起来很快,有时是因为高质量真机数据太贵,企业能够使用的数据量有限。

|          文本大模型已经证明,少量高质量后训练数据可以显著激发模型能力。具身智能未来可能也会出现类似情况:几千条覆盖不同行业、不同场景和不同任务的高质量数据,可能比数万条低质量数据更有价值。         03 中国的优势在数据生产,竞争仍未被大厂垄断          Q:哪些公司更有可能率先获得千万小时数据?          方汉:数据规模与融资能力确实存在直接关系,因为企业需要采购和生产大量数据。

|          但中国在这一轮竞争中具备比较明显的优势。世界模型的数据生产依赖摄像头、传感器、采集设备和机器人本体,而中国拥有完整的消费电子和制造业供应链,降低硬件成本的能力很强。         中国的工业门类齐全,制造业、家政、医疗、物流等行业也能够提供丰富的真实任务场景。

| 因此,我认为全球世界模型数据的重要生产地很可能在中国。         未来,海外具身智能公司也可能需要从中国采购采集设备和训练数据。中国在设备成本、数据生产效率和算法工程人才方面,都具备较强的竞争力。         Q:具身智能赛道目前是否已经出现明显的头部格局?          方汉:目前行业热度很高,新产品、新模型和机器人本体公司不断出现,但整体仍处于早期阶段,除少数巨头外,大部分公司还站在相对接近的起跑线上。

|          具身智能模型的训练,与视频生成模型存在较强的技术关联。训练过数十亿视频片段的团队,在数据清洗、Scaling和生成模型训练方面积累了大量经验,这也是许多视频模型团队进入世界模型领域的原因。         未来两年会是行业分化的重要阶段。具身模型目前的数据规模仍然较小、模型能力也相对有限,因此每一次数据规模和技术路线的突破,都可能带来比成熟模型更大的能力变化。         Q:大厂拥有资金、算力和数据,中小型模型公司还有机会吗?          方汉:大厂在模型训练上确实具备资源优势,但资源并不能自动转化成领先模型。         目前中国一些表现最好的模型,也来自创业公司。决定模型竞争力的核心,仍然包括人才团队厚度、算法迭代速度和数据构建能力。

|          以音乐模型为例,很多大厂都投入过,但最终模型效果仍然存在差异。资金很多,却没有训练出好的模型,这在行业中并不少见。         这一阶段尚未形成大厂垄断一切的格局,创业公司仍然存在窗口期。企业需要选择自己最擅长、数据壁垒最明确的方向,在大厂形成全面优势之前,把技术和产品壁垒建立起来。         Q:昆仑万维同时投入音乐、视频、游戏和世界模型,资源是否会过于分散?          方汉:这些方向表面上不同,底层存在较强的技术共性。         视频、音乐、游戏和具身世界模型,本质上都属于生成模型,底层架构、数据清洗方法和训练经验可以相互迁移。例如,视频模型的数据处理流程,可以迁移到游戏模型和世界模型中。         不同领域的数据规模也并不相同。视频模型可能需要数十亿个视频片段,音乐数据的总量小得多,世界模型目前也只有数十万小时级别。因此,各方向需要的资源并非完全相同,可以根据技术阶段动态调整。         我们并非在同时做几个完全独立的方向,而是在一套生成模型能力上延伸出多个分支,通过技术复用降低成本。

|          04 应用创业、商业模式与AI内容的下一步          Q:随着垂直应用增加,AI竞争的重点是否会从模型层转向应用层?          方汉:我不完全认同这个判断。         应用层面临一个风险:今天看起来独立的功能,未来可能被基础模型吸收和内化。很多行业正在编写Skills和工作流,但这些流程也可能被模型厂商用于训练,最终变成基础模型自身的能力。         因此,模型能力仍然很重要。企业可以做应用,但需要确保应用产生的数据、用户行为和行业流程能够反过来沉淀到模型中,形成持续积累。

| 如果应用只是在外部调用通用模型,缺少独有数据和模型能力,随着基础模型升级,它的价值可能被快速压缩。         Q:您对应用层创业者有什么建议?          方汉:很多团队习惯“拿着锤子找钉子”:先有一个模型或技术,再寻找可以落地的行业。这种产品定义方式风险比较高。         更合理的路径是先理解行业,找到真实、具体、长期存在的需求,再倒推需要什么模型和产品能力,也就是“拿着钉子找锤子”。         例如,用户希望智能体完成完整的视频制作,单靠一个通用模型可能还不够,还需要剪辑、超分辨率、音频处理等专门能力。创业者应该从完整任务出发,拆解用户真正缺少的环节,再决定模型和产品如何组合。         Q:AI产品在中国更适合免费模式,还是订阅模式?          方汉:商业模式与国家的人均收入和生产力水平高度相关,简单区分国内和海外并不准确。发达市场对订阅制的接受程度通常更高。

| 在中国,编程等能够直接提高生产效率的产品,也已经证明订阅模式存在市场,因为程序员和企业能够明确计算产品带来的价值。         与此同时,中国用户对免费加广告的模式更加熟悉。当前免费模式面临的主要限制是Token成本较高,企业难以长期承担。         但Token成本正在快速下降。当推理成本降到足够低时,免费服务仍然会大规模出现,AI也只有在成本下降之后,才可能真正成为普惠服务。

| 未来很可能是订阅、API、广告和免费服务并存,具体选择取决于产品所在的国家、用户收入水平和使用场景。         Q:视频生成模型还需要持续投入多久,市场上限在哪里?          方汉:视频生成仍处于Scaling红利期。文本大模型的Scaling速度已经有所放缓,但视频、音乐和游戏模型仍然可以通过扩大数据和算力获得明显提升。         视频生成的市场空间远没有到达上限。创作门槛下降后,创作者数量会快速增加。网络文学的发展就是一个例子:过去能够发表作品的作者数量有限,现在中国每个月有数百万网络文学作者持续创作。         视频的受众范围比文字更广,能够跨越语言和识字能力的限制。

| 随着制作门槛降低,视频创作者的规模有可能达到甚至超过网络文学作者。

|          未来的内容市场也未必只追求少数全民爆款。

| 创作者增加后,大量长尾需求会得到满足,不同用户可以看到更符合自己兴趣的内容。爆款的绝对高度可能下降,但内容的数量和类型会更加丰富。         Q:AI电影和长剧为什么还没有大规模出现?          方汉:技术已经不是唯一限制,商业机制和行业接受度更加关键。         电影和长剧制作周期长、投入高,市场反馈速度较慢。短剧成本低,可能几周就能完成一部作品,投放后很快就能看到回报,因此迭代速度更快,更多团队也愿意尝试。         传统导演和制作人还面临行业评价压力。早期音乐人也曾认为使用AI意味着作品“没有灵魂”,电影行业同样存在类似顾虑。谁先大规模采用AI,可能会面临舆论压力。         但这种阻力会逐渐减弱。

| 未来一定会出现具有商业影响力的AI电影和AI电视剧,只是需要有人率先完成商业验证。         Q:为什么至今还没有真正的AI原生游戏?          方汉:现在几乎所有游戏公司都在使用AI辅助写代码、制作美术或生成内容,但这些仍然属于AI辅助开发,不能算真正的AI原生游戏。         真正的AI原生游戏,应该由端到端的游戏世界模型实时生成画面、环境和交互结果。

|          目前最大的障碍是推理成本和运行速度。世界模型实时生成游戏画面的效率,必须接近甚至超过传统3D引擎,同时还要能够在普通用户可以负担的硬件上运行。         现阶段,一张普通消费级显卡就能运行传统3D游戏,而端到端世界模型可能需要非常昂贵的算力,商业上无法成立。         我认为,游戏世界模型真正面向普通用户落地,可能还需要三至五年。AI已经广泛进入游戏生产流程,但端到端的AI原生游戏仍需要等待推理成本出现数量级下降。

Current article:http://xqj.chuandanfozhuanbenglipaicuzi.pics/news/20260826_32163.html

Published on:07:31:42


相关新闻

最后更新

热门新闻