长视频生成同步冲到-京东在-上甩出可交互视听世界模型-10-JDD-EchoWM-开源-分钟以上 (免费长视频生成工具)

 互联网资讯     |      2026-09-14 12:26:35

9月9日的京东全球科技探索者大会(JDD)上,京东探索研究院端出了 JoyAI-Echo 系列的两项新进展:超长音视频生成模型升到 JoyAI-Echo1.5,同时发布并开源可交互视听世界模型 EchoWM。前者把音视频持续生成拉过10分钟门槛,后者把原生视听生成和用户控制拧在一起,让 AI 内容从"能看"进一步走到"能进、能探索"。

长视频这条线,JoyAI-Echo1.5押的是音视频 Memory Bank 架构。它能在多镜头、长时程的生成里死死抓住人物形象、声音和故事线索不跑偏,撑住10分钟以上的音视频持续产出。模型靠长视频后训练把推理速度拉了7.5倍,只需要2张 H200,就能在480P 下平均每秒生成24帧,做到1:1等时生成;Director Agent 还能按自然语言完成故事展开、分镜规划、生成审核和成片组装这一整套活。

image.png

世界模型这边通常分两路走:一路能跟着用户操作不停生成画面,却缺了自然声音;另一路能联合生成音视频,可用户很难持续钻进去改内容。EchoWM 把这两类能力并在了一起,原生联合生成720P 视频、环境音、音乐和语音,让声音随场景、摄像机和主体运动同步变;通过统一的"相机意图",模型同时支持人称导航、第三人称摄像机与主体协同控制,以及多轮连续探索。在 WBench Navigation 评测里,EchoWM 和四步因果流式版本 EchoWM-Flash 包揽前两名,其中 EchoWM 在涵盖158个多轮导航案例的榜单上拿下综合。

底座层面,京东这次集中亮出 JoyAI 基础模型矩阵,能力覆盖图像与视频生成、多模态理解、实时交互、世界建模、智能语音和具身操作,把 JoyAI 从内容生成往动态环境的感知、模拟与交互推。JDD 现场还展示了新一代音视频基础模型 JoyAI-Video,重点强化商业视频生成、物理规律呈现、人称视角和多镜头连续叙事,瞄准电商广告、短剧创作和具身智能演练,计划10月正式发布。模型之外,京东同步展出了 EgoLIVe 真实数据、JoyAI-Sim 仿真转换工具链和大模型基础设施,搭起从真实数据、仿真转换到模型研发的支撑体系。

产业落地上,零售、物流、医疗、工业、政务五大行业模型和智能体集中亮相:零售多模态模型管图搜、智能导购和素材质检;物流超脑3.0用 Agentic 框架把决策、流程和物理执行串起来;京医千询3.0强化医疗影像分析、模拟问诊和可信推理;工业大模型扎进专业选型、维保和 CAD 设计;政务大模型服务政策咨询、智能办公和数据分析。基础模型创新与产业 AI 实践双线推进,构成了京东把 AI 从数字世界推向物理世界的整体布局。


【双语热点】Sora爆火!AI视频生成模型是什么

AI视频生成模型是一种基于人工智能技术,能够根据给定文本提示自动生成视频内容的多模态大语言模型,Sora作为代表性模型,其爆火体现了生成式人工智能在视频领域的突破性进展。

相关术语补充

百度蒸汽机发布通用 AI 长视频生成功能

网络蒸汽机正式推出通用AI长视频生成功能,首次实现无限时长AI视频生成。 此次升级通过引入流式生成技术,突破了传统AI视频技术5秒至10秒短片段输出的限制,也无需依赖首尾帧控制续写,支持用户持续生成高质量的长视频内容。

腾讯混元发布并开源视频生成工具HunyuanCustom,支持主体一致性生成

腾讯混元于5月9日发布并开源多模态定制化视频生成工具HunyuanCustom,该工具基于混元视频生成大模型(HunyuanVideo)打造,支持主体一致性生成,效果超越现有开源方案,可媲美顶尖闭源模型。

HunyuanCustom的核心能力 HunyuanCustom的技术优势 应用场景与用户价值

HunyuanCustom可服务于视频创作者、短视频博主、电商从业者、广告创意人等不同用户群体,具体应用场景包括:

开源与体验信息
DirectorAgentEcho1.5JoyAI音视频MemoryBankEchoWM

上一篇: 15比13欧洲队主场战胜美国队夺回索尔海姆杯 下一篇: 小特产撑起大产业赓续长征精神红色热土育红