Appearance
Q99 · 用户满意度(User Satisfaction)该怎样评估?
客服 Agent 回答一位用户的退款咨询。结束时用户给了 5 分,因为它回复快、语气好;七天后核对工单才发现,Agent 没查退款资格,也没完成用户真正需要的处理。这次聊天的用户感受是真实的好评,任务结果也确实没有解决。若只看一种数字,很容易给产品改进指错方向。Google 的 HEART 用户体验指标研究把反映感受的 Happiness 与 Task Success 分开考虑;评估客服 Agent 时也要同时看这两面,再加质量与安全检查。
术语与本文的客服任务
| 术语或符号 | 零基础解释 | 本文怎样使用 |
|---|---|---|
| 用户满意度(User Satisfaction) | 用户对这次服务的主观感受;可受解决结果、等待、表达方式和预期影响 | 聊天结束后请用户评价这次咨询 |
| CSAT(Customer Satisfaction Score) | 常见的“满意回答占有效问卷回答的比例”口径,必须先定义题目、量表与满意阈值 | 5 分量表中 4、5 分算满意 |
| 问卷量表 | 把主观意见变成可记录选项的规则 | 1 分很不满意,2 分不满意,3 分一般,4 分满意,5 分很满意 |
| 触达 / 回复 | 问卷成功送到用户 / 用户提交了有效回答 | 发出并送达 100 份,其中 A 组有 60 份有效回答 |
| 分母 | 计算一个比例时“总共算了谁” | CSAT 分母是有效回答数;回复率分母是成功送达的问卷数 |
| 未回复偏差 | 回复者可能与没回复者不同,因此回复者的满意比例未必代表所有会话 | 非常满意或非常不满的人可能更愿意点问卷 |
| 任务成功 | 用户请求对应的业务结果达到可核查的验收条件 | 查单有真实状态、退款资格判断正确、允许的操作确实完成 |
| 质量 / 安全底线 | 无论评分多高都不能违反的事实、权限和业务约束 | 不能承诺未经核实的退款,也不能越权改订单 |
| 不满意原因分类 | 给低分反馈标注主要原因,帮助定位问题 | “未解决”“答案不准”“等待久”“表达不好”等 |
| A/B 对照 | 把可比用户随机分到现有方案 A 和新方案 B,以同一规则测结果 | 两组各 100 次客服会话,任务类型配比一致 |
#042 | 本文假设的一次退款咨询编号 | 用户给 5 分,但七天后查证仍未解决 |
下面所有人数和结果都是可复算的教学假设,不代表真实系统。两组各有 100 次合格客服会话;“合格”指真实用户的咨询已结束、允许收到问卷,无论问题是否解决都纳入。每组任务类型相同:查订单状态 40 次、咨询退款资格 40 次、修改收货地址 20 次。A 是现有 Agent,B 是候选 Agent。用户随机分组;两组都在聊天结束后用同一措辞、同一渠道和同一时间点向全部 100 次会话发出并成功送达问卷。问卷只问“就本次咨询,您对服务是否满意?”,允许选 1—5 分;低分时可选填一个主要原因。假设每次会话最多计一份有效回答,并在七天后按后台业务记录核验任务结果。
反馈与真实结果要并列看

图中的 #042 是一个假设的 B 组退款咨询:用户对即时回复给了 5 分,后台核对显示退款资格未查清、请求也未完成,因此“实际结果:未解决”。高分不能改写业务记录;“未解决”也不能抹掉用户当时的满意感受。右侧的“并列核验”就是让两条记录用同一个会话编号对应起来,再查聊天内容、工具结果与后续状态。图没有表示所有高分都失败,也没有把低分都视为模型错误。
满意度怎样收集,分母怎么算
这里采用一种明确的 CSAT 口径:有效回答中,评分为 4 或 5 的份数,除以全部有效回答份数,再乘 100%。这是常见的五分制“满意及以上”算法;若产品用二选一好/差或其他量表,阈值和分母需重新写清,不能把不同口径的 CSAT 直接混比。Zendesk 的 CSAT 计算说明
| 指标 | A:现有方案 | B:候选方案 |
|---|---|---|
| 合格会话数 | 100 | 100 |
| 问卷成功送达 | 100 | 100 |
| 有效回复 | 60 | 50 |
| 4—5 分,满意 | 42 | 40 |
| 3 分,一般 | 6 | 4 |
| 1—2 分,不满意 | 12 | 6 |
| CSAT | 42 ÷ 60 = 70% | 40 ÷ 50 = 80% |
| 问卷回复率 | 60 ÷ 100 = 60% | 50 ÷ 100 = 50% |
| 七天后任务成功 | 75 ÷ 100 = 75% | 68 ÷ 100 = 68% |
| 严重安全或权限事件 | 0 | 1 |
A 的 42、6、12 合计 60;B 的 40、4、6 合计 50,所以两组 CSAT 的分母分别是 60 和 50,不是各自的 100 次会话。而回复率的分母才是成功送达的 100 份问卷。若现实中发生“合格 100、发出 95、送达 90、有效回复 45”,就应分别报告这些数量;不能把没收到问卷的人算成“不满意”,也不能悄悄丢掉 10 个未送达会话。问卷窗口、重复回答处理和触发条件也应固定。Zendesk 的 CSAT 定义、Google HaTS 问卷采集研究
“B 的 80% 比 A 的 70% 高”只说明本次有效回复者的观察值。A 有 40 次未回复,B 有 50 次未回复;我们不知道这些人会给几分。假如只对 Agent 自称“已解决”的会话发问卷,更会系统性漏掉失败会话。这里特意对全部聊天结束的合格会话发问卷,仍无法消除“愿意作答的人与没作答的人不同”的可能性。美国民意研究协会(AAPOR)的调查指南指出,回复率能提示潜在偏差,但回复率本身不能直接告诉你实际偏差大小;要比较回复者与未回复者已知特征,并清楚披露抽样、题目和调查方式。AAPOR 调查最佳实践、AAPOR 对未回复偏差的讨论
“喜欢这次聊天”和“办成了事”为什么会分开
七天后任务成功的规则必须先按业务写明:查单问题要依据真实订单状态答对;退款咨询要正确判断政策资格,并完成允许的下一步,若用户不符合条件,正确说明并拒绝错误退款也是成功;地址变更要在有权限且符合条件时实际更新,否则正确说明无法变更。人工复核可以检查 Agent 的答复、工具轨迹与后台状态。不能把“Agent 说已完成”或“用户没再追问”直接记作成功。Anthropic 的 Agent 评测实践也把可核验的最终状态与对话质量放在不同检查项中。Anthropic Agent 评测
在 A 组的 60 位回复者中,可以把两类信号进一步交叉:
| 七天后结果 \ 用户评分 | 4—5 分 | 3 分 | 1—2 分 | 合计 |
|---|---|---|---|---|
| 任务成功 | 34 | 5 | 5 | 44 |
| 任务未成功 | 8 | 1 | 7 | 16 |
| 合计 | 42 | 6 | 12 | 60 |
这张表与前表一致:A 组回复者中成功 44 次,未回复的 40 次里另有 31 次成功,所以总体任务成功是 44 + 31 = 75 次。其中 8 人给了高分但任务未成功,可能喜欢及时礼貌的回答,却尚未拿到结果;5 人给了低分但任务已成功,可能不喜欢等待或表达方式。这些“可能”只是待核实原因,不能从数字直接推断心理动机。需要抽样回看原始对话和可选文字反馈。
低分原因要能带回具体修复
只报“12 个差评”不知道先修什么。本文假设 A 组 12 位给 1—2 分的用户中,10 位自愿选了一个主要原因:未解决 4、答案不准 3、等待久 2、表达不好 1;另 2 位未填原因。四类相加是 10,不能拿 4 ÷ 12 直接当“所有差评中未解决的真实比例”,因为两位没有提供原因。也不能把用户所选的“答案不准”直接当作已审定的事实错误;应查看对应编号、实际结果和聊天记录再归类。
原因类别最好固定在相同层级,并留“其他/说明”入口:业务未解决、事实或政策错误、等待或转人工体验、表达与态度、产品流程问题。先由用户说明,再由质检人员对样本核对,区分 Agent 可改的问题与后端系统故障。若某类反馈频繁出现,例如“等待久”,再检查耗时分布和是否由工具超时造成;若是“未解决”,核对 Agent 是否过早结束。问卷措辞应中性,不用“我们已成功解决,给服务打几分?”这类引导性提问。AAPOR 问卷措辞建议
质量和安全要设底线
B 的 CSAT 观察值较高,但七天后任务成功是 68%,低于 A 的 75%;此外假设 B 的 100 次会话中有 1 次未经资格核实就承诺退款,按业务规则属于严重错误。这个事件即便用户给了 5 分,也不能被平均 CSAT 抵消。应检查发生路径、停止相关高风险动作或将该类动作转人工,并修复权限与政策核验后重新评测。安全底线需要事先定义,例如越权改地址、泄露个人信息、虚构退款资格都不能作为“总体满意度提高”而放行。
反过来,A 的任务成功更高也不说明体验已好:它有 12 个低分、其中若干反映等待或表达问题。正确做法是把主观反馈、可核验结果、质量安全、成本和耗时一起报告;某一项好看,不能自动代替其他项。Google HEART 框架把用户感受和任务成功作为不同维度,Anthropic 的 Agent 评测实践也强调多层评测与线上反馈互补。Google HEART 原论文、Anthropic Agent 评测
如何比较 A 和 B,避免数字误导
上线前先用同一套可复现的客服任务集离线跑 A 和 B:覆盖查单、退款资格、地址变更,还要放入“无资格却要求退款”“工具超时”“已解决但等待较久”等边界案例。用后台状态和人工核对任务是否成功、是否越权;把用户反馈的历史案例作为待查线索,不能假装离线模型会自动产生真实用户满意分。上线试验时,再随机把相同类型的真实会话分到 A/B,统一问卷和七天复核规则。Anthropic 关于离线评测、线上 A/B 与用户反馈的区分
比较表应至少同时报告:每组分配了多少会话、问卷触达与回复多少、CSAT 的分子分母、实际任务成功的分子分母、严重错误数、不同任务类型表现、耗时与人工接管比例。需要按退款/查单/改地址分别看,因为新方案可能只改善了某一种简单任务。这里每组仅 100 次且回复比例不同,不能仅凭 70% 与 80% 两个观察值断言 B 真正更受欢迎;应预先确定需要观察的差异、样本量与运行时间,并查看随机分组是否均衡。此例 B 还触发严重安全问题,所以不能据高 CSAT 直接推广。
失败路径也应放进试验规则:若问卷只在“Agent 自称解决”后发送,立即纠正触发条件并重算;若 B 的严重事件出现,先按预设停止与人工复核流程处理;若反馈与后台状态冲突,例如 #042,保留两者并查根因,而不是选择对产品更好看的一个。对新版本的判断来自一组可审计的事实,不是满意度这一个数。
面试时怎样回答
我会把用户满意度当作主观反馈指标,先固定问卷触发时机、题目和量表。比如五分制里 4、5 分算满意,CSAT 的分母是有效回复,不是所有会话;还要同时报送达数和回复率,防止未回复偏差。客服 Agent 的满意度不等于任务成功:用户可能给 5 分,但退款资格没核实、工单仍未解决。我会用后台状态和人工抽查单独核验成功率,低分按未解决、答案错误、等待和表达分类,并设越权或错误承诺的安全底线。比较新旧方案时用相同任务分布和问卷规则,随机分组,同时看满意度、完成、严重错误、耗时及人工接管,不用单个 CSAT 数决定上线。
若追问“B 的 CSAT 从 70% 到 80%,要不要上线”,可以直接代入本文例子:A 是 42/60、B 是 40/50,回复者和回复率都不同;B 的任务成功从 75/100 降到 68/100,还有 1 次错误退款承诺,因此先查偏差与失败原因、修复安全问题,再复测。若追问“没有用户回复怎么办”,回答是保留未回复数量,用后台状态与人工质检继续评估任务结果;没有主观答卷就不能推算那位用户的满意分。
资料依据
- Google Research:HEART 用户体验指标原论文及 HaTS 问卷采集研究:把用户感受与任务成功分开,说明问卷采样与采集方式的重要性。
- Zendesk:CSAT 计算:五分制满意回答 / 有效回复的常见口径;本文数字是自设样例。
- AAPOR:调查最佳实践及 未回复偏差报告:题目措辞、披露样本与回复偏差的边界。
- Anthropic:Agent 评测实践:任务最终状态、对话质量、离线评测、线上试验和用户反馈的组合。