【导语】近期,外媒一则关于 AI 实时空间视频生成项目的报道,让 “世界模型” 一词受到科技行业广泛关注。北京大陆航星质量认证中心(HXQC)作为具有国际影响力的第三方认证机构,仅基于公开可查的媒体报道、行业公开研究成果,客观梳理相关信息。 近日,彭博社援引匿名知情人士消息称,字节跳动正在筹备一款可实时生成空间视频的 AI 模型,报道提及该项目将 VR 头显作为应用载体,被列为企业 2026 年 AI 重点项目,预计最快 10 月对外发布。该消息仅来自媒体爆料,字节跳动未就上述项目、技术参数、发布计划发布官方公告,相关规划存在变动可能性。报道被多家媒体转载后,“世界模型” 概念引发大众讨论。 根据该篇媒体报道转述信息:该项目拟基于字节自研 Seedance 视频生成模型开展研发;报道给出的参考目标为 20 帧 / 秒、端到端延迟约 50 毫秒;推理计算部署在云端,计划对接 Pico 头显、抖音生态,面向直播、短剧、游戏场景。报道同时提及企业上调 AI 资本开支,将大量资源投入 GPU 算力采购。 从公开的行业研究成果来看:Google 发布 Genie 3 研究预览项目,可实现 24 帧 / 秒、720p 实时视频生成,公开资料显示交互一致性仅可维持数分钟,该项目为实验室非开源研究版本;部分学术界开源项目可在单张 A100 显卡实现约 10 帧 / 秒的交互视频 Demo。以上均属于实验室研究成果,不等同于商用成熟产品。 行业公开资料显示,当前该技术方向普遍存在几类技术难点: 1、若追求低延迟生成效果,采用蒸馏压缩生成步骤,会带来画质、物理仿真一致性方面的取舍; 2、长期空间一致性存在技术挑战:短时间流畅画面可以实现,但用户视角移动之后,虚拟环境物体位置、场景布局保持稳定,持续符合物理规律,仍是行业尚未完全攻克的问题; 3、行业存在两类概念区分:一类面向内容消费,定位可交互实时视频生成系统;另一类为通用世界模型,要求具备物理因果理解能力,服务具身智能、仿真训练,二者技术目标存在明显差异,不同机构对概念的定义并不统一。 报道还提到,该企业具备 AI 大模型、云端算力、硬件终端、内容生态完整业务链条。媒体观点认为该业务组合属于行业稀缺资源,但项目最终落地形态、实际效果均无官方信息佐证。 站在第三方质量认证的行业角度:AI 新技术的概念宣传、实验室演示 Demo,不能等同于稳定可用的商业化产品。评价 AI 技术,应重点考察实际可复现效果、长期运行稳定性、风险约束能力。各类 AI 技术的实际价值,最终需要以正式公开的产品、实测数据作为判断依据。
