译自英文

Luma AI,前身为Luma Labs,是一家总部位于旧金山的生成式人工智能公司,以其文本转视频模型Dream Machine和3D生成器Genie而闻名,并提供用于创建和编辑媒体的智能手机应用程序。

Luma AI,前身为Luma Labs,是一家总部位于加利福尼亚州旧金山的生成式人工智能公司。该公司开发用于生成和编辑视频及3D内容的模型和应用,主要通过面向消费者的智能手机应用和网络平台提供服务。Luma AI最著名的是其于2024年6月发布的文本转视频模型Dream Machine,以及早期的3D生成工具Genie。该公司在更广泛的生成式人工智能领域运营,与OpenAI的Sora和Google DeepMind的Veo等其他文本转视频系统竞争。

Luma AI的产品基于深度学习神经网络架构的进步,专注于逼真的运动合成和基于提示的创意生成。该公司的工具允许用户从文本描述或静态图像生成短视频片段,以及从照片创建3D模型。自早期发布以来,Luma AI因其运动捕捉的质量以及围绕训练数据透明度的法律和伦理问题而受到关注。

历史

Luma AI由Alex Yu和Amit Jain于2021年创立。Yu此前从事神经渲染研究,Jain是前苹果工程师,两人创办公司时专注于照片级逼真的3D重建。2022年,Luma AI推出了一款名为Luma的智能手机应用,该应用使用机器学习通过手机摄像头扫描现实世界中的物体和空间,生成高质量的3D模型。该公司后来转向生成式3D创作,推出了Genie,这是一种可以从文本提示或图像生成3D资产的模型。

2024年6月,Luma AI于6月12日向公众发布了文本转视频模型Dream Machine。该发布在公司X账户上宣布,并附有示例视频。几天之内,社交媒体上的用户分享了Dream Machine生成的视频,这些视频重现了Midjourney的图像,动画化了《戴珍珠耳环的少女》等著名艺术作品,并制作了Doge和分心男友等互联网迷因的动态版本。一位用户为虚构动画电影《Monster Camp》制作的预告片被Luma AI在X上转发,引发了用户的批评,称其抄袭了《怪兽电力公司》系列的视觉风格,并包含一个类似大眼仔的角色。另一部由Ellenor Argyropoulos执导、描绘皮克斯风格动画并设定在古埃及的视频走红网络。

到2024年底和2025年初,Luma AI扩展了其产品线,发布了Dream Machine的更新版本,并于2025年1月添加了Ray2视频生成模型。该公司还与其他AI公司合作,并获得了大量资金,估值达到数亿美元,尽管具体数字尚未公开确认。

Dream Machine

Dream Machine是Luma AI开发的文本转视频模型。它根据用户提供的提示或静态图像生成短视频片段。该模型基于Transformer架构构建,类似于大型语言模型系统中使用的架构,但针对视觉时间生成进行了调整。截至2024年6月,Dream Machine生成的视频长度为五秒,分辨率为1360乘752像素。用户可以使用Google账户注册,输入提示或上传静态图像以启动生成。

该系统在生成视频之前,会根据自身的大型语言模型内部修改用户的提示。用户可以免费创建有限数量的视频,每天十个视频,总共三十个免费视频,并可以选择付费订阅计划。标准、专业和高级计划分别允许生成120、400和2,000个视频,如公司网站所述。Luma AI表示计划在发布后不久添加视频扩展、发现页面和视频内编辑等功能。该网站也承认了局限性,指出Dream Machine在描绘文本和某些类型的运动方面可能存在困难。

能力与技术

Dream Machine利用大规模Transformer模型,在视频数据上训练,以生成连贯的运动序列。与早期基于扩散的视频模型不同,Dream Machine使用多阶段流水线,首先预测潜在帧,然后将其放大到最终分辨率。该模型可以接受自然语言提示和参考图像,从而实现风格迁移和对象操作。例如,用户可以上传一个人的静态图像,要求模型让其行走,或提供一幅绘画场景并请求摄像机运动。

Luma AI还发布了面向开发者的Dream Machine应用程序编程接口(API),并在发布后不久宣布计划添加视频扩展、发现功能和视频内编辑工具。这些更新表明其意图超越休闲使用,进入专业和企业应用领域,包括广告、电影预可视化以及概念艺术。底层技术依赖于Transformer架构和可能的基于扩散方法的进步,尽管具体架构细节尚未完全公开。

能力与特点

Dream Machine接受文本提示或静态图像作为输入,将其转换为具有逼真运动的短视频片段。该模型的优势在于其捕捉连贯运动的能力,包括角色手势、摄像机平移和对象交互。Luma AI还开发了3D生成模型Genie,该模型从文本或图像提示创建3D资产,面向游戏开发和虚拟环境。

该公司的智能手机应用包括用于3D捕捉的原始Luma扫描应用,以及后来的视频生成和编辑应用。用户可以通过网页界面访问Dream Machine,并计划推出开发者API。Luma AI还尝试了视频扩展功能和发现平台,允许用户浏览和混编社区生成的内容。

底层技术结合了Transformer模型和基于扩散的视频生成,这是现代生成式人工智能系统中的常见风格。Luma AI未公开其训练数据的完整细节,公司文档指出该模型在文本渲染和复杂运动序列方面存在困难。

反响

Dream Machine在2024年6月发布时获得了大量媒体关注。记者和用户将其与OpenAI的Sora(一个此前已宣布但未广泛发布的文本转视频模型)以及另一个竞争视频生成模型Kling进行了有利比较。The Verge和TechRadar的评论者称赞了运动的真实感和易用性,但对训练数据的不透明性表示担忧。TechRadar的Mark Wilson指出,训练数据缺乏透明度限制了人们对该模型在个人创意项目之外实用性的信心。Tom's Guide的Ryan Morrison称Dream Machine是“最好的提示遵循和运动理解AI视频生成器之一”,但仍认为其尚未达到专业级输出。Mashable的Chase DiBennedetto在撰文中将使用Dream Machine创建的社交媒体视频描述为“令人毛骨悚然地”逼真,并唤起超现实或奇幻场景的感觉。

一些安全研究人员指出,Dream Machine可能被用于创建逼真的深度伪造,该公司面临关于版权和内容来源的持续审查。尽管存在这些担忧,该工具因其可访问性和免费层级的质量而广受赞誉。

比较与背景

Luma AI在竞争激烈的环境中运营,包括OpenAI的Sora、Google DeepMind的Veo以及其他人工智能视频模型。与一些限制访问的竞争对手不同,Luma AI早期向公众发布了Dream Machine,允许广泛实验。该公司对面向消费者工具的专注使其区别于面向企业的视频生成平台。Luma AI还与云提供商合作,并使用AWS Trainium或类似基础设施,尽管具体的硬件合作伙伴关系尚未公开详细说明。

在3D领域,Luma AI的Genie与OpenAI和Nvidia等公司的工具竞争,面向需要快速原型制作3D资产的创作者。该公司将自己定位为神经网络渲染高级研究与实用创意工具之间的桥梁。

参见

参考文献

信息基于2024年6月和2025年1月的公开报道和公司公告。来源包括The Verge、TechRadar、Tom's Guide和Mashable的新闻报道。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·text-to-video·artificial-intelligence-companies·3d-modeling
本页最后编辑于 2026年9月8日 编辑者 AI Wiki Bot · 历史