用户反馈分析中的 ai 应用. 一套能读取客服、评价和销售记录中每一条反馈的软件,把它们聚类成去重后的主题,并按实际提出人数给这些主题排序。产出的是路线图的输入依据,而不是一张词云。
一家 200 人规模 SaaS 公司的产品负责人每月要处理 2000 多条反馈,分别来自 Zendesk、Intercom、App Store 和 Play Store 的评价、G2,以及 Gong 的通话记录。这是八个标签页,却没有一份统一排序的清单。于是路线图最后就取决于上周是谁给 CEO 发了邮件。
声音最大的客户很少是最有代表性的那一个。一条愤怒的企业客户投诉,分量可能压过 340 条安安静静要求同一个导出按钮的评价。ai 解决的是计数这个问题:它读完全部 2000 条反馈,把重复的合并起来,然后告诉你导出功能的诉求其实出现了 341 次,而不是被大声喊了一次。
#ai 是怎么把 2000 条反馈变成一份有排名的路线图的?
ai 是如何跨客服、评价和销售通话来分析用户反馈的?
它从你现有的工具中拉取每一条数据,逐条阅读,并按背后的真实诉求(而不是措辞)来聚类。重复的内容会合并成同一个主题,每个主题都带有数量和来源占比,这样你就能按各渠道的真实数量来排序,而不是靠一条声音大的反馈来猜。
连接层比模型本身更关键。我们对接的是产品团队本来就在付费使用的数据源:客服用 Zendesk 和 Intercom,评价用 App Store 加 Play Store,公开评分用 G2,销售通话记录用 Gong。最终输出的是一份去重、排好序的主题清单,而不是八个标签页加一张每个迭代都要有人重新整理的电子表格。
对产品负责人来说,到底改变了什么?
- 路线图主题由信号数量决定,而不是这周谁能跟 CEO 说上话。
- 每个迭代花在手动给工单打标签、做人工分诊上的时间被省了下来。
- 销售团队会看到自己在 Gong 里的反馈,和一条 Play Store 评价出现在同一份排名清单里,这样影响销售管道和影响留存的论据就能并排摆在一起。
- 每个主题都自带证据:341 条反馈,62% 来自客服、28% 来自评价、10% 来自销售。你在路线图评审会上能拿出实打实的依据来说明优先级。
这套方法的重点不是取代判断力,产品负责人依然要决定一个只有 90 条反馈的流失问题主题,是否比一个有 300 条反馈的锦上添花需求更优先。重点在于,这个判断是从一份真实的计数出发,而不是从直觉出发。
we are
stennir 把你现有的反馈工具对接起来,产出一份去重、排好序的主题清单,归你的产品团队所有,也经得起路线图评审会上的追问。
we aren't
我们不是一个问卷工具,也不是又一个给你多加一个标签页的仪表盘。我们处理的是你已经在收集的信号,用的是你已经在付费的技术栈。
为什么跨数据源的聚类现在已经足够可靠、值得信任?
过去,把五个来源的反馈聚类到一起是件很脆弱的事:单次生成的模型可能会把两个只是听起来相似的主题合并到一起,也可能把同一个诉求的三种不同措辞拆成三个主题。这一情况随着 Anthropic 在 2026 年 7 月 24 日发布的 Claude Opus 5 所带来的多步骤研究和自查能力而改变(coursiv.io)。模型会先起草一版聚类结果,再自己检查这个分组是否合理,然后才返回结果。正是这一步自查,决定了它是一个演示品,还是一份真正能拿去做路线图决策的主题清单。
我们不希望 ai 去凭空发明优先级,我们希望它做的是,把用户已经告诉我们的诉求老老实实地数清楚,而且是跨所有渠道地数清楚。
这是我们咨询业务线交付的部门级应用场景之一,与平台业务线的产品工作相辅相成。我们会在第一次沟通时就按照你真实的反馈量来定方案,而不是拿一个通用演示搪塞。如果你想了解这套按数量排序方法背后的思路,更多内容都在日志里。
如果你是一位产品负责人,正对着八个标签页里每月 2000 条反馈发愁,最快弄清楚这套方案是否适合你的技术栈的办法,就是聊一聊你实际用的数据源。预约一次 30 分钟的沟通,把你最头疼的那个标签页也带上,我们会告诉你,用你自己的数据能得出一份怎样的排名主题清单。