今年夏天,视频生成初创公司 Synthesia 的企业事务负责人亚历山德鲁·沃伊卡(Alexandru Voica)给我发了一个链接,介绍他们公关团队的最新成员,这让我很惊讶。那是他的一个互动虚拟化身,经过训练可以回答关于 Synthesia 的常见媒体提问,比如它是做什么的、如何运作。就在前一天,我参加了一个小组讨论,公关人员问我是否介意使用 AI 生成文本的推介。但亚历山德鲁的化身已经超越了这一点——在我看来,这似乎是 AI 在公关领域应用的终极形态。
9 月,Synthesia 邀请我参观其位于纽约的新办公空间。Synthesia 最初总部位于英国,是一家热门的数字化身初创公司,与 D-ID、HeyGen 和 Colossyan 等公司齐名。该公司在今年早些时候达到了 40 亿美元估值,并表示去年其年度经常性收入(ARR)已突破 1 亿美元。
Synthesia 让企业能够用 AI 化身构建互动培训视频,最近还推出了一款名为 Roleplay Sessions 的产品,让员工可以练习,例如,用互动 AI 化身练习销售话术,该化身会回应并给他们的回答打分。
当我前往新办公室开业活动,他们问我是否想要自己的 AI 化身时,我毫不犹豫地答应了。我当然想要自己的数字分身。那天我的穿着很可爱,头发也打理得整整齐齐。
在遇到我的数字分身之前,我一直对化身无动于衷,但我觉得它们将不可避免地成为日常网络生活的一部分。我听说有人在 Instagram 上创建与自己相似的化身,来帮助他们制作社交内容。我觉得这一切都非常有趣,也许这就是为什么我现在毫无顾虑地向你们展示我的数字分身。这是 Synthesia 第一次为记者制作数字化身(或者说,除了沃伊卡之外,为任何人制作)。它基于我关于风险投资支持的初创公司比非风投支持的初创公司更容易欺诈的报道进行训练,并且只会回答关于那篇报道的问题。
下面,只需点击“在新窗口中启动”即可开始。
你可以问它这样的问题:
- 我为什么决定写这篇报道?
- 那篇研究论文是关于什么的?
- 研究人员发现了什么?
为了制作这个,我进入了 Synthesia 办公室内一个迷你摄影棚,他们在那里给我拍了许多照片,并录制了两分钟的我的声音。我必须同意制作这些化身,然后,数字版 Dom 就诞生了。他们为我创建了一个个人化身(一个只朗读我给它任何脚本的化身)——有眼镜和没眼镜的版本——他们还为我制作了两个互动化身(可以回话并听我说话的化身),同样有眼镜和没眼镜的版本。
我们选了一篇文章来训练这个互动虚拟形象,然后其中一个团队构建了我的互动虚拟形象,它由语音转文本、视频、语言和文本转语音模型组合驱动。我的虚拟形象的技术栈包括 Synthesia 自家的视频和语音模型,不过该公司也允许客户选择来自其他实验室的替代方案,如 Cartesia、ElevenLabs、Google 或 OpenAI。企业还可以选择将虚拟形象托管在自己想要的任何云上,或者付费让 Synthesia 托管。
语音转文本模型将人们说的话转换为文本,智能体语言模型理解文本并可以据此采取行动,文本转语音模型将回复转换为音频,最后是一个视频模型(由 Synthesia 构建)在虚拟形象说话时为其制作动画。
总体而言,Synthesia 构建了三种类型的产品——一个带有经典虚拟形象的视频创作和分发平台,用户输入脚本,虚拟形象重复它;一个名为 Sessions 的智能体平台,人们可以在调查或角色扮演中与虚拟形象互动;以及一个 API 平台,人们可以将 Synthesia 的视频和语音模型与其他技术服务结合,构建互动虚拟形象或其他类型的产品。
Synthesia 团队花了几天时间制作我的虚拟形象。我先试用了个人版,输入了一段相当通用的脚本,看看我的 AI 声音听起来如何。我让它谈论秋天如何降临纽约,那是我一年中最喜欢的时节。声音相当准确,我很高兴它没有捕捉到我录制音频样本时的任何沙哑。
我把它展示给一些非技术圈的朋友,他们觉得既有趣又诡异。
然后我向他们展示了我的互动版,它是确定性的,意味着它只会说它被训练来回应的话。在这个例子中,那就是我的风险投资欺诈故事。我问它诸如我在加入 TechCrunch 之前在哪里、我住在纽约的哪个部分等问题,但每次它都把我引回那个故事。
我的朋友们觉得声音听起来不太像我,认为相似度不如个人版虚拟形象,但尽管如此,它已经足够接近,有些诡异。我妈妈称它“太神奇了”,这对她来说是相当高的赞誉。她和我父亲一直试图问它“只有他们才会知道”的关于我的问题——但模型没有回答,每次都把他们重定向到风险投资欺诈故事。
“我不记得生过两个你,”她在测试模型后开玩笑说。
这段经历让我思考新闻业的未来可能是什么样。人们会接受打开新闻,由虚拟形象来呈现吗?一位投资者立即告诉我不会。当然,如今对于渗透到社交媒体和其他新闻分享平台的AI 垃圾内容,存在很多反对声音。但我问过的其他人则不那么确定。虚拟形象能否增强——甚至取代——记者?CEO 们会愿意与记者的 AI 虚拟形象交谈,而不是与真人记者交谈吗?
我喜欢我的职业,因为它能与人建立联系、撰写故事并研究新话题。但新闻业最重要的部分是信任。这似乎永远不可能外包给人工智能。
在新闻业之外,我相信克隆自己的想法可能会很有吸引力。假期或休假后不再需要赶工作,因为你的一个版本可以随时待命,回答问题。
我们还得看看虚拟形象在美国企业中的使用会如何演变。但既然我有了自己的虚拟形象,我的感受很复杂。在克服了最初的新鲜感后,我在它停止说话后仔细端详它,并等待着——等什么,我不确定。也许我在等它眨眼。或者说些新东西,或者微笑,或者只是让我知道它知道。
因为我的数字孪生是确定性的,它们永远不会那样做。但我能看出,对于一个非确定性的数字孪生——即由一个可以自由高谈阔论的聊天机器人驱动——有人很容易陷入轻微的AI精神病。
我告诉一位投资者,无论数字孪生的未来如何,我预测我这一代,Z世代,可能不会习惯它们。它们感觉像科幻:我们在电影中看到的一切现在都成真了。但我要说,我觉得数字虚拟形象比人形机器人更不令人不安。至少对于虚拟形象,如果事情变得奇怪,我总能下线。
然而,在那之前,这是我的个人虚拟形象,为您概述我们网站本周的所有头条新闻!
