做 YouNavi 这段时间,我们经常被问到两个问题。

第一个是你们跟那些桌面生产力办公 Agent 有什么区别。这个问题之前或多或少回复过一些(可见 YouNavi 产品日志 Vol.15- 会中 AI 的体验不应该只停留在实时转写 做杂活助理还是思维伙伴:YouNavi 的选择 —— 观猹·WAIC 桌面 Agent 分享会实录

第二个则是说,手头已经有在用一些比较成熟的录音转写工具了,还有必要用你们吗。今天我想认真回答一下这个问题。

首先所谓录音转写服务,本质上就是一个把语音文件转换成文本文件的过程,也就是把声音这种模态和背后对应的文字做模式匹配,依赖的是一种称为 ASR(Automatic Speech Recognition,自动语音识别)的模型(而非更为大家熟知的大语言模型 LLM)。而当 LLM 发展起来之后,ASR 模型也获得了一些红利,比如在语义层面的识别准确率要比过去好了不少。记得在 22 年的时候我有尝试过用通义听悟给自己做的访谈播客生成转写文稿,当时的感受是准确率上还不太可用,甚至不如自己听几句录音然后用大脑的理解+手打字的方式来得效率高。而现如今至少直接阅读转写文本的障碍没那么大了,但不得不说离“完全的可读性”还是有些差距的。

[查看原文配图:22 年时使用通义听悟转写的访谈,比如智驾、智舱这样的名词识别还很不准确] [查看原文配图:如今使用飞书妙记转写的文字,除个别名词外,已经非常准确了]

LLM 还带来了另一个好处。我们常见的会议纪要工具,就是先把原始转写文本丢给 LLM 过一遍,让它按照一个模板输出结构化的纪要,这个体验现在已经做得相对不错了。哪怕转写里有些事实性小错误,大模型本身具备一定的理解能力,在总结和压缩的过程中,也能消掉一部分拼写错误(typo)带来的干扰。

但站在 YouNavi 的角度,我们认为这些东西还是不够的。

在体验了大量录音转写的工具之后,最让我们困扰的问题可以用一句话概括——“谁”说了“什么”。我们经常看到转写内容出现张冠李戴的情况,把 A 说的话安到 B 头上,或者凭空冒出一个 C 来。又或者出现上面这样把“智舱”“智驾”转成“置仓”“支架”的情况。这两点的准确识别在 YouNavi 服务的严肃分析场景里,我们认为是非常非常重要的。

为此,我们做了一些额外的产品尝试。

第一个尝试发生在转写完成之后。原始转写文本出来,我们会让 LLM 做一次后处理。但这里的后处理和通用的不太一样,它会结合用户本地的两个全局记忆文件,一个是常用人名表,一个是专有名词表

这两个词表一方面来自于初始化时的记忆导入,另一方面,如果用户在 YouNavi 同步了第三方渠道的录音文件,比如飞书、腾讯会议、钉钉、Plaud,这些平台自带的说话人标签,我们也会快速导入到专有词表里。也就是说,从第一次转写开始,AI 就不是在完全陌生的语境里猜与会人的身份。它手里有你的常用人脉,有你的专有名词,有你熟悉的世界。

第二个尝试是在会议录音结束之后自动发起一次人脉整理。一场会结束,你可以开启一个自动化任务,调用「修正人名标注」和「整理人脉网络」这两个官方定制的 Skill。这两个 skill 会先结合你本地的人名词表判断转写文本里哪些人名可能是错的,先帮你更新一批。对于那些没有把握的,它不会乱猜,会把名单列出来问你。你给出反馈之后,这个反馈除了用来更正本次转写,还会被放回 YouNavi 的词表里。这样一来,词表越用越准,转写也跟着越用越准。你开完一百场会,AI 认识的人越来越多,出错的地方就越来越少。

服务于让转写更准,我们目前还在打磨的功能:

第一个是说话人分离。目前大多数录音转写产品在这件事上做得还不够好,可能上一个人说的话和下一个人的话连分段都没分干净,更不用说谁说了什么了。我们希望通过模型和工程调用,先能能做到说话人身份的分离尽可能精准。

第二个是声纹识别和标注。在说话人分离的基础上,用户可以进一步去标注对应的人,或者让系统根据你已经整理好的词表去做匹配。以后这个人一开口,系统就知道是谁。

第三个是数据反馈飞轮。如果你在 Navi 的分析产出物里修改了一些内容,我们希望能帮你把这个修改自动转化成模型可理解的词表形式。比如你反复修正的一个人名,或者一个重要的名词,通过模型输出上的修改功能,自动存回你的词表里。

回到开头那个问题。

手头已经有成熟录音转写工具的人,还有必要用 YouNavi 吗?——录音转写工具解决的是把声音变成文字,这件事现在做得越来越好了,行业红利大家都能吃到。但我们觉得,对一场需要严肃分析的对话来说,转写只是起点,起点之上还要有,要有名词,要有你熟悉的世界。准确理解“谁”说了“什么”,才是严肃而精准的分析的起点。

YouNavi 要做的,是让 AI 认识你的圈子,记住你的世界。