信任校准:最好的用户是半信半疑的
全信的把编造判例抄进法庭文书,不信的把 AI 变成摆设。六个场景亲手判断信任状态;可点开的引用、置信度代理信号、有条件的警告
本页解决的问题
先给结论「信任校准:最好的用户是半信半疑的」要解决的关键问题是什么?
全信的把编造判例抄进法庭文书,不信的把 AI 变成摆设。六个场景亲手判断信任状态;可点开的引用、置信度代理信号、有条件的警告
把品味变成产品可重复的行为。 有用的结果不是一句“我觉得更好”。它应该是一条看得见的规则、一个小例子,以及判断体验何时低于标准的方法。
记录一个前后对比,让别人不用听解释也能看懂质量线。
表面更精致了,却没有减少用户的不确定感。
⚠ 过度信任:把幻觉当真相用
2023 年纽约的 Mata v. Avianca 案:执业律师用 ChatGPT 检索判例,把 6 个查无此案的编造判例原样抄进法庭文书,法官逐个核实后律师吃了罚单、上了全球新闻。类似的事故此后接连发生:AI 的输出流畅、自信、格式规范,每一个表面特征都在诱导「它很靠谱」的判断,而这些特征和内容真伪互不相干。
⚠ 信任不足:AI 变成昂贵的摆设
另一头的翻车安静得多:企业买了 AI 工具,员工试了一次撞上错误,从此每条输出都逐句复核,复核成本超过自己写,最后干脆不用了。采购的钱照付,效率一分没涨。信任不足不上新闻,只出现在「AI 工具活跃率 8%」的内部复盘里。
判断口诀先给你:盯着「风险 × 可核验性」看,别盯着「AI 强大与否」看。同样是全盘采纳,用在周报上是校准,用在法庭上是过度。六个场景,你来当校准师。
第一件校准工具:来源引用,要能点开的那种。想核实的用户一键到原文,压住过度信任;懒得核实的用户看到「有出处」也建立了合理的底气,补上信任不足。一举两得的前提是引用真实可点:装饰性的假引用被戳穿一次,比没有引用糟糕十倍。下面这条 AI 回答挂了三个角标,逐个点开,和原文比对。
第二件工具:置信度。第一篇章讲过,模型不知道自己不知道,让它自报把握靠不住。但产品层有诚实的代理信号:检索命中了几篇文档、相关度多高、多个来源是否一致、知识截止日期盖住问题了没有。下面是同一条用药回答,三组开关对应三个产品决策,拨一拨,看右边的回答和用户的信任校准度怎么变。
第三件工具管的就一件事:那行「AI 可能出错,请核实重要信息」的小字,到底有没有人在看。心理学的答案叫横幅盲视(banner blindness):Benway & Lane(1998)用眼动实验发现,恒定出现在固定位置的元素,会被大脑当成背景纹理直接滤掉。下面连点五条回答,亲眼看这行小字怎么消失。
从「先看两种翻车姿势」把感觉变成判断
「2023 年纽约的 Mata v.」指出,AI 降低了做出“能用”成品的门槛,读者真正需要练的是看出哪里不对,并把感觉说成可以执行的要求。
观察用户的下一步,而不是只看表面
「另一头的翻车安静得多:企业买了 AI 工具,员工试了一次撞上错误,从此 每条输出都逐句复核 ,复核成本超过自己写,最后干脆不用了。采购的钱照付,效率一分没涨。信任不足不上新闻,只出现在「AI 工具活跃率 8%」的内部复盘里」可以转成几个可观察的问题:用户是否知道现在发生了什么,是否知道下一步做什么,出错或空白时能否恢复,以及信息层级是否让重要内容先被看见。
- 把信任目标定在校准 :全信的出事故,不信的白花钱,产品要把用户往对角线上拉
- 引用做成能点开的 :把「信我」换成「你可以验」,同时提防装饰性假引用反噬
- 置信度用代理信号说 :检索命中数、相关度、来源一致性,比模型自报的把握诚实
漂亮不等于容易用
把「第三件工具管的就一件事:那行「AI 可能出错,请核实重要信息」的小字,到底有没有人在看。心理学的答案叫 横幅盲视(banner blindness) :Benway & Lane(1998)用眼动实验发现,恒定出现在固定位置的元素,会被大脑当成背景纹理直接滤掉。下面连点五条回答,亲眼看这行小字怎么消失」用在第二个页面或流程上,记录一个具体犹豫点和一个改动后的用户动作;能被观察到的变化,才是体验改善。
从「先看两种翻车姿势」走到「六个用户,逐个把脉」
「先看两种翻车姿势」先把问题落在「2023 年纽约的 Mata v. Avianca 案:执业律师用 ChatGPT 检索判例,把 6 个查无此案的编造判例 原样抄进法庭文书,法官逐个核实后律师吃了罚单、上了全球新闻。类似的事故此后接连发生:AI 的输出流畅、自信、格式规范, 每一个表面特征都在诱导「它很靠谱」的判断 ,而这些特征和内容真伪互不相干」上;到了「六个用户,逐个把脉」,讨论继续推进到「判断口诀先给你:盯着 「风险 × 可核验性」 看,别盯着「AI 强大与否」看。同样是全盘采纳,用在周报上是校准,用在法庭上是过度。六个场景,你来当校准师」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
评估体验时,把抽象的“好看”或“顺手”换成用户动作:他是否看懂状态、找到了下一步、能从错误中恢复,并且愿意继续使用。
- 「先看两种翻车姿势」:2023 年纽约的 Mata v. Avianca 案:执业律师用 ChatGPT 检索判例,把 6 个查无此案的编造判例 原样抄进法庭文书,法官逐个核实后律师吃了罚单、上了全球新闻。类似的事故此后接连发生:AI 的输出流畅、自信、格式规范, 每一个表面特征都在诱导「它很靠谱」的判断 ,而这些特征和内容真伪互不相干
- 「六个用户,逐个把脉」:判断口诀先给你:盯着 「风险 × 可核验性」 看,别盯着「AI 强大与否」看。同样是全盘采纳,用在周报上是校准,用在法庭上是过度。六个场景,你来当校准师
- 「最后的要点」:警告有条件地出现 :恒定免责三天就隐形,低置信时带原因弹出才会被读
最后的「最后的要点」把讨论落到「警告有条件地出现 :恒定免责三天就隐形,低置信时带原因弹出才会被读」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
✅ 这一课想和你分享的
- 把信任目标定在校准:全信的出事故,不信的白花钱,产品要把用户往对角线上拉
- 引用做成能点开的:把「信我」换成「你可以验」,同时提防装饰性假引用反噬
- 置信度用代理信号说:检索命中数、相关度、来源一致性,比模型自报的把握诚实
- 警告有条件地出现:恒定免责三天就隐形,低置信时带原因弹出才会被读
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。