昨天晚上带着 Navi 去参加了「WAIC UP!× 观猹 Good or Bad 之夜」,与现场的朋友们交流了如何做一个专注于对话分析场景的桌面 Agent。整场演示是让 Navi 自己生成的自我介绍,由我作为嘴替完成的,现场 Q&A 也尝试了让 Navi 来直接回答问题。
现场录音我让 Navi 做了转写,在这里也分享给大家。
[查看原文配图:WAIC UP!× 观猹 Good or Bad 之夜活动现场]首先非常感谢大家今天“漂洋过海”来到现场,毕竟做 AI 应用是一定要“出海”的。我是 YouNavi 的联创兼产品负责人 Ray。
其实刚才主持人说今天咱们不讲 PPT,主打真实产品演示,搞得我现在有点慌。因为其实我现在手头就是一个 PPT。(笑)
不过恰好呢,这个 PPT 就是 Navi 自己做的,好像也符合真机演示的要求:最开始我是一句话让它帮我做了一个网页;后来主办方发来一个模板,我就又用一句话的提示词,让 Navi 按照模板帮我做了这个 PPT。我们可以点这里直接跳转过去。
然后现在大家可以看到我的电脑屏幕右上角一直在录音——这是一个实时转写。也就是说我现在说的每一句话,包括待会儿提问环节大家说的每句话,Navi 都是知道的。如果网络允许,我想搞个行为艺术:待会儿你们提问时,我在回答的同时,也让 Navi 实时做一个它的回答。
接下来,我就花几分钟过一下这份 PPT。但要说明的是,这份 PPT 是 Navi 站在它自己的立场上给大家讲它的故事,我今天其实只是它的嘴替。
[查看原文配图:Navi 生成的自我介绍 PPT]Navi 首先想告诉大家的是:它不想做一个帮你“交差”的助手,它想做一个帮你想得更深的 AI 参谋。
这是什么意思呢?大家知道,从去年 Manus 出来开始,Agent 这个概念就一直非常火。我觉得这个世界上其实已经不缺很多好用的 Agent 工具了。但目前市面上的产品可能还有两个局限:
最早像 Manus 这类产品,你给它一个任务,它能做得很好,但它不知道你的个人上下文。到了今年,像 Claude Code、Codex、OpenClaw这些工具,它们或多或少也知道了一些你的上下文,因为它们都是本地的 Agent。
但我观察到一个现象,现在很多媒体老师在介绍 Agent 时,举的场景例子大多还是是“批量帮你提交发票申请”、“批量生成小红书文案”。这里我们有一个反共识的想法:我们用高阶的 SOTA 模型的成本其实并不低,我不太想让我的 Agent 只帮我去干这些偏“杂活”性质的事情。
所以,我们做 YouNavi 想实现的是:做一个真正理解你、懂你,并且能够帮你去做深度分析和决策的 Agent。
我们的切入点是“对话”。
这很好理解。就像我现在正在做的现场录音,包括你日常的会议、沟通,甚至是你对着电脑自言自语几分钟——这里面有着极高的信息密度。同时,它又没有被很好地线上化。
更重要的是,这些语料本质上非常适合大模型来分析。我算过一场普通会议的 Token 量大概也就在一万左右。而现在主流的大模型都有百万级别的上下文窗口,这意味着,即使我们不做复杂的 Agent 工程,模型也已经能帮你一次性分析几十场会议的内容。这至少是你一周甚至一个月的会议量。所以我们选择从这里切入。
那么很多人就会问了:那你们跟飞书妙记有什么区别?
飞书妙记确实也是优秀的 AI 产品,但它更多是帮你完成一个固定的工作流——录音、转写,然后按照模板自动总结成一份会议纪要。对我们来说,我最近才刚刚在产品里加上了“自动总结会议纪要”这个功能,因为我想让大家做的其实并不是会议纪要。
我们想做的是:把你的会议语料获取过来之后,结合你历史上的相关记忆,去做整体的跨周期分析。它能去挖掘那些更深入的问题,甚至是对话里的“潜台词”。它不是为了给你一份你可能看完就丢的纪要,而是给你洞察。
在记忆层面,相对于那些通用 Agent,我们所说的“有记忆”更多是指它真正拥有你的日常语料。我们做了大量一键同步的功能:市面上主流的录音卡、录音豆、会议软件,我们基本上都打通了。
整体的产品架构是:
- 采集层:无感同步你各类软硬件的录音与文档。
- 理解层:在声纹识别、关系人、专有名词上做了深度优化。
- 记忆层:基于 Agentic Memory 架构,而不是简单的 RAG。
- 分析层:围绕分析决策场景,定制了专属的 Skills 生态和工程调优。
很多 AI 产品都只有一个拟人的但属于 AI 的名字,但我们是两个名字:因为我们希望它是 You + Navi,而不是只有 You 或者只有 Navi。
在这个组合里,你的角色是去定义问题、做出决策判断;而 Navi 更多的是帮你汇集上下文,去做分析来挑战你、启发你、给你帮助。它是你的伙伴,是你的参谋。
顺便提一句,因为今天在场的极客朋友比较多,Navi 在自我介绍里还专门给自己加了几个标签:
- 它是 Local-first(本地优先)的,非常关注数据隐私;
- 它有丰富的 Skill 和Hook 机制,可以帮你做很多自动化的循环分析任务;
- 我们也提供了 CLI 工具,如果你日常有其他常用的 Agent,完全可以把我们当做其中的一个子 Agent 来调用。
目前平台上的种子用户画像是:
- 创业者与投资人:有很多创业者在用它分析投资人的反馈,也有很多投资人在用它多维审视创业者的 BP。
- 商务/BD/销售 人群:那些有大量涉及商机谈判的朋友,非常依赖 Navi 来做会前的背景准备和会后的深度复盘。
- 产品经理:用得比较杂,比如像我,平时做用户调研或其他需要深度沟通的场合,都会用它来梳理。
- 招聘与求职:无论是面试官还是候选人,都在用它来分析供需匹配度和水下信息。
场景演示:让 Agent 成为你的“外脑”
我分享几个我今天真实在用的 Case。
比如,来之前我让 Agent 帮我查了一下今天参与分享的其他几款产品。大家如果在观猹上看到我们发的那篇 AMA 帖子,其实就是 Navi 写的,我当时只给了它一句话的指令。
再比如,我每天晚上会看它根据全天语料给我写的晚报。周五我参加了另一个交流局,它帮我总结了关于企业Agent的一些启发;同时它还结合了一篇 Anthropic 的论文,告诉我这对我正在做的产品有什么帮助。
今天上午,我去听了 WAIC 理查德·萨顿的论坛。因为我英文不算太好,我用了 Navi 的实时翻译功能。但我发现光靠翻译,还是很难跟上这种比较硬核分享的思路。所以,我当时让 Navi 帮我做了一件事:结合上下文,帮我总结主讲人刚才讲了什么,并对我听不懂的概念实时做 Research 补充背景信息。这个场景在听讲座或开跨国会议时非常实用。
[查看原文配图:Navi 实时翻译与 Research 演示]最后我想说,现在的 Agent 赛道非常热闹,大家都在比拼效率、快速和交付能力。
但我个人的一个非共识是:效率不等于智慧。AI 快速帮你交付出来的一个东西,不代表它就是对的,甚至它可能也没法帮助你获得任何个人成长,它仅仅是“交了差”。
在这个效率至上的时代,我们想做的,是为深思熟虑找一个属于它的位置。
谢谢大家!
【现场 Q&A】
Q1:你们侧边栏列出来的这些录音纪要产品除了海外的其实我都用过,那在什么样的情况下,我会必须选择你们的产品?
Ray:理论上,你用 Plaud 新出的 CLI 接入 Claude Code,或者用飞书妙记加上飞书自己的 Agent,确实能实现类似的效果。但你还是得在至少两个产品、两个环节间跳跃,或者被困在某个生态内。
我们想做的是把这个过程变顺滑。这其实是一个叫“Context Hub(上下文归集)”的概念。你不需要再去折腾配CLI 的 Key 或者在各种工具里切来切去。其次,我们希望降低使用门槛,让它不那么 Geek,专注于“分析”这个特定场景,提供比通用 Agent直接回答更符合业务深度的结果。
(这条是现场语音输入给 Navi 让它自己回答的)
Q2:这种主打线下沟通场景收集的工具,未来如何防止被主流 Agent 跨界降维打击?
Ray:这是一个非常好的问题,因为投资人也经常问(笑)。首先,只要大家开放 CLI,上下文其实是互通的。如果用户就是习惯在 Codex或 Claude Code里工作,把YouNavi当成一个数据源接入,我们也为此做了 CLI,是完全 OK 的。
但我们的目标是,在“沟通分析与决策辅助”这个特定场景下,让用户第一时间想到 YouNavi。我们不奢求去抢占做 PPT 或者写代码之类的场景。术业有专攻,我们只求在目标场景里把体验做得足够好。
Q3:很多录音纪要产品的转写功能都有时长限制,而且不支持实时。这是因为技术限制吗?
Ray:不支持实时确实是ASR 模型能力差别,但时长限制其实更多是从成本角度出发做的限制,就是说是一个商业层面的问题。
本文由 YouNavi 整理,让每次对话沉淀为可行动的洞察。
下载 YouNavi 桌面版 · 让每一次谈判都有复盘 → younavi.me
