首页/ 产品知识/ 正文

感官差别测试是什么?三个杯子里的假设检验

安浩夕· 2026-10-08 发布· 约 6 分钟· 2 阅读 系列 · 用户体验 4/7

换配方之前的那道题

食品公司动配方,动机五花八门:换掉一部分蔗糖以降成本、供应商换了产地、工艺调了杀菌温度、保质期要延长。无论哪种,研发团队都要先回答一个排在「好不好吃」之前的问题:消费者能察觉出新旧的区别吗?

这个问题和喜好无关。新配方可能被清楚地喝出来但没人介意,也可能评分掉了却根本没人察觉差异——评的是两件事。上一篇聊的判罚分析回答「感知到的东西讨不讨厌」,而「感不感觉得到」本身,要靠另一套专门的工具:感官差别测试(discrimination testing,也常译差异测试)。

它的应用极其现实:如果统计上测不出差异,配方就可以放心换——降本、换料、改工艺而不惊动消费者的舌头,每年为食品饮料行业省下的钱以亿计。

从一杯茶说起:方法论的祖先

差别测试的统计内核,源头是个著名的下午茶典故。1920 年代末的剑桥,一位女士宣称:把牛奶倒进茶里,和把茶倒进牛奶里,她能靠味觉分辨先后。在场的统计学家 Ronald Fisher 没有嘲笑,而是设计了一个实验:端上八杯茶,四种先奶后茶、四种先茶后奶,顺序打乱,请她逐杯判断——这就是后来《实验设计》一书开篇的「女士品茶」。

Fisher 的思路是现代差别测试的全部骨架:顺序随机化、强迫判断、然后算一道概率题。如果女士全无辨别力、纯靠猜,八杯全对的概率只有 1/70(约 1.4%)——小到可以拒绝「她在瞎猜」这个假设。据说那位女士真的一杯没错。

二战后,这套「强迫选择 + 概率判定」的框架流进了啤酒与软饮料工厂的品控室——酿酒师要回答「换了一批酒花,酒有没有喝得出的问题」,后来逐步定型为标准方法,ISO 也为之立了规范:三角测试是 ISO 4120,二-三点测试是 ISO 10399,成对比较是 ISO 5495。

四种经典玩法

差别测试是一族方法,共同的设定:盲测、强迫选择(不许答「尝不出/一样」),然后统计正确率是否显著高于「纯靠猜」。家族里最常用的四种:

测试 玩法 纯猜答对的概率 典型场景
三点测试 三杯样品,两杯相同一杯不同,圈出「不一样的」那杯 1/3 配方、工艺变更的通用确认
二-三点测试 先尝一杯标准样,再从两杯里挑出与它相同的 1/2 有明确参照的替换验证
成对比较 两杯里选出某属性更强的那杯(哪个更甜、更酸) 1/2 定向确认某个属性的增减
「A」「非A」 先记住 A 样,再逐杯判断是不是 A 视混样比例而定 样品不能反复品尝、或涉及外观气味的场景

最常用的是三角测试:猜对概率只有 1/3,运气最难帮忙;代价是要连尝三杯,感官疲劳重,对酒精饮料、重口味样品不太友好——那就换二-三点或 A/非A,牺牲一点统计效率换可行性。

统计判定:赢过运气多少才算数

判定逻辑就是女士品茶那道概率题的工业版。以三角测试为例,猜对概率 1/3,那么:

  • 60 位品评员参与,纯随机水平的正确人数期望是 60 × 1/3 = 20 人;
  • 实际 30 人正确选出。用二项分布做单侧检验,这个结果出现的概率不到 1%——远超运气能解释的范围,判定「差异可被察觉」;
  • 若只有 22 人正确,只比期望多 2 人,在随机波动范围内,判「未测出差异」。

三件事决定这张判定表的成色:

  1. 显著性水平 α:把「其实是瞎猜」误判成「有辨别力」的风险,通常定 5%,即 20 次里容忍错 1 次;
  2. 检验力(1−β):差异真实存在时,测试能把它抓出来的概率——这个参数的戏份在下一节;
  3. 样本量:人越多判定越稳,但品评员不是免费午餐,工业实践在 α、β 与成本之间查表定人数。

最大的坑:没测出差异,不等于没有差异

这是差别测试被误用得最狠的地方。统计上「未测出差异」只说明证据不足,不证明两样品相同——就像 12 个人试射靶没上靶,不能证明枪没问题,可能只是打得太少。

换配方恰恰最需要「证明相同」(证明消费者喝不出区别),所以业界专门有一套相似性测试:事先设定「可接受的最大真实可辨率」(比如真实人群中能尝出差异的比例不超过 25%),再按 α 与 β 反推样本量——结论通常是几十人不够,得上百人。事前不设计检验力、随便拉十几个人测一轮、没显著就宣布「消费者无感」,是产品线上一再重演的事故剧本:省下的测试预算,日后加倍还给客诉与销量。

操作层面还有几个纪律:呈送顺序必须随机平衡(防止位置偏好);强迫选择,品评员说「一样」也要逼他挑一个;样品编号随机三位数,别用 1 号 2 号;尝完漱口、休息,三角测试连喝三杯尤其要防疲劳。品评员选谁也有讲究:训练有素的感官评价员更敏锐,适合研发内部确认;要推断「市场消费者能否察觉」,则应招募普通消费者——敏锐的舌头会夸大差异。

结语

把这一系列串起来,正好是一条从舌尖到态度的流水线:NPS 与 T2B 量整体态度,判罚分析 诊断态度从哪些属性损失,而感官差别测试守在最上游:差异到底存不存在、能不能被人类舌头捕获。方法内核一百年没变——Fisher 那杯茶里已经写全了:随机、盲测、强迫选择,然后老老实实和运气比大小。下次看到「盲测显示消费者根本喝不出新配方」的新闻,不妨看一眼三个数字:几个人测的、几个人对、检验力设计了多少——三个数字都在,结论才站得住。

最后更新于 2026-10-08· 版权所有 · 禁止转载

评论

0 条