
虚拟形象进入新闻业:Synthesia 为记者打造数字分身
今年夏天,Synthesia 企业事务负责人 Alexandru Voica 给我发来一条链接,展示其公关团队最新成员——一个以他为原型训练而成的可交互虚拟形象。这位"数字员工"专门用于回答关于 Synthesia 的常见媒体提问,比如公司做什么、业务如何运转。就在前一天,我刚在一个论坛上被公关从业者追问:是否介意收到用 AI 生成文本的推广邮件。相比之下,Alexandru 的虚拟形象早已越过那条线——用 AI 介入公关,这在我眼中近乎终极挑战。
Synthesia 总部位于英国,是数字虚拟形象领域的热门初创公司,同赛道的还有 D-ID、HeyGen 和 Colossyan 等对手。今年早些时候,公司估值达到 40 亿美元,去年已跨过 1 亿美元 ARR(年度经常性收入)门槛。9 月,Synthesia 邀请我参观其位于纽约的新办公室,并询问我是否愿意拥有自己的 AI 虚拟形象。我毫不犹豫地答应了——谁不想有个数字分身呢?那天的着装还算得体,头发也打理好了。
可交互形象如何炼成
要制作虚拟形象,需进入 Synthesia 办公室内的一间小型摄影棚。团队会拍摄大量照片,并录制约两分钟的语音样本。制作者必须签署同意书,整个流程大约需要 两到三天。就这样,数字版 Dom 诞生了。
技术层面,Synthesia 团队构建了一套完整的语音—文本—视频管道:
- 语音转文本模型:将用户说的话转换为文本;
- 语言代理模型:理解文本内容并基于此决定响应动作;
- 文本转语音模型:将文本响应转换为音频;
- 视频模型(Synthesia 自研):驱动虚拟形象在说话时的面部表情与动作。
Synthesia 的可交互形象技术栈支持灵活组合。视频与语音模型由 Synthesia 自研,但也允许客户选用 Cartesia、ElevenLabs、Google 或 OpenAI 等第三方模型。企业还可选择自托管或由 Synthesia 代为托管。
三条产品线:各场景的分工
Synthesia 目前提供三种类型的虚拟形象产品:
- 经典虚拟形象(Classic Avatars):用户输入脚本,虚拟形象按稿朗读,适用于视频内容批量制作与分发;
- 交互式会话平台(Sessions):用户可与虚拟形象进行实时对话、填写调研问卷,或进行角色扮演训练,系统会根据回答给出评分反馈;
- API 平台:将 Synthesia 的视频与语音模型与第三方服务组合,构建自定义可交互虚拟形象或其他创新产品。
体验数字分身:有趣,也有点诡异
拿到自己的虚拟形象后,我先用个人版(非交互版)做测试——输入一段关于纽约秋天的通用文案。语音还原度相当准确,难得的是没有复制我录音时嗓音的沙哑。
我将这段演示拿给不懂技术的朋友们看,他们的反应是"有趣,但有点诡异"。随后我展示了交互版——它运行在确定性模式下,只回答被训练过的内容,即我那篇关于风险投资支持的初创公司为何比非 VC 初创公司更容易出现欺诈的研究故事。我问了它"写这篇报道的初衷是什么""研究论文讲了什么""作者发现了什么",每次它都准确引导回那篇报道本身。
但当朋友们问起"我来 TechCrunch 之前在哪里工作""住在纽约哪个区"这类个人问题时,模型一律将对话重定向到风险投资欺诈研究上,拒绝回答。
一位朋友评价语音不太像本人,另一位觉得形象相似度不如个人版。但我妈妈的反应最为典型——她称之为"太厉害了",这是她给出的极高评价。她和我父亲反复尝试问一些"只有家人才知道"的问题,结果每次都被模型礼貌地挡回。
"我不记得自己生了两个你啊。"——我妈测试完后的玩笑。
虚拟形象能否重塑新闻业
这段经历引发我对新闻业未来的思考:人们能接受由虚拟形象播报新闻吗?
一位投资人斩钉截铁地回答"不能"。当前 AI 内容泛滥社交平台的现状,也让许多人对虚拟形象持谨慎态度。但也有人持开放态度——企业高管是否更愿意与记者的 AI 分身对话,而非本人?
对我而言,这份职业最有价值的部分在于人与人之间的连接、故事的撰写、以及对新领域的不懈探索。但新闻业最核心的仍是信任——这件事似乎永远无法外包给 AI。
不过,在新闻业以外的场景,我确信"克隆自己"的概念拥有广泛的吸引力。度假归来不再需要补上堆积的工作,因为你的数字分身可以随时待命,替你回答问题。
数字替身:我用了,我有一些话想说
用了自己的数字替身之后,我的心情有些复杂。
最初的"新鲜感"消退之后,我仔细端详着这个不会说话、一动不动的数字形象,陷入了某种等待——等什么呢?我自己也说不清。也许是在等它眨眼,也许是在等它说出什么新的话,也许只是在等一个信号:它知道我在看着它。
数字替身是确定性的,这意味着它永远不会主动给我这些反馈。但我也意识到,如果一个替身是由自由度更高的聊天机器人驱动的——那种可以自由发挥、"侃侃而谈"的——人可能会更容易陷入一种轻微的"AI 精神病"(AI psychosis),分不清虚拟与现实的边界。
我曾告诉一位投资人:不管数字替身的未来如何,我预测我这一代人,也就是 Z 世代,大概率不会习惯它们。毕竟这种感觉太科幻了——我们以前在电影里看到的一切,现在竟然成真了。
不过我要承认,比起人形机器人(humanoids),数字替身给我的不适感还是要少一些。至少,当事情变得奇怪的时候,我可以随时退出登录。


评论