口味测试在测什么
食品饮料公司在新品上市、配方改版或降本换料前,几乎都会做一轮口味测试(taste test):招募一批目标消费者,盲测产品,填一份问卷。问卷里通常有两类数据:
- 总体喜好度:用九点享乐量表打分,从「极其不喜欢」到「极其喜欢」,回答「整体爱不爱」;
- 属性恰好度:针对甜度、酸度、香气、稠度这些具体属性,问消费者觉得「太淡——恰好——太甜」这样双向的评价,业界叫 JAR 量表(Just About Right,恰好度量表)。
第一类数据给出总分,第二类给出诊断线索。问题在于:线索一多,先修哪个?配方工程师的时间是有限的,把甜度调到位和把香气提上来,往往不可兼得。
如果只看比例——「40% 的消费者觉得太酸」,很容易得出「先降酸」的结论。但这个直觉可能是错的:也许酸奶消费者对酸本来容忍度就高,觉得太酸的人照样打出了不低的喜好分;而只有 35% 的人觉得甜度不对,这批人的喜好分却断崖式下跌。喊的人多,不代表事情重要。
判罚分析(Penalty Analysis,也译惩罚分析)就是来解决这个问题的:它把 JAR 数据与总体喜好度打通,算出每个属性偏离理想值要付出多大的「喜好罚分」,让修改优先级有据可依。
从军队口粮到超市货架
在算数之前,值得知道这套方法是从哪来的。它的家谱可以追溯到二战时期的美国军需实验室:为了替前线士兵挑出不挨骂的口粮,Peryam 等人开发了一套「享乐量表」,让士兵用九个等级表达对每种食物的喜爱,1957 年正式发表后,它成了口味测试里那张九点量表的祖先。战后,为军队发明的测试流程被消费品公司整体接走,可口可乐、通用食品们的市场研究部门开始用它给新品打分。
光有总分很快就不够用了。1960 到 1970 年代,研究者在问卷里加入了另一类问法:不问「爱不爱」,而问「甜度你觉得怎么样」——太淡、恰好、太甜。它把心理物理学里的「理想点」概念翻译成了问卷语言,这就是 JAR 量表的雏形。从此口味测试的报表上,总分旁边多了一排属性诊断。
而把两类数据真正「打通」成判罚分析,是 1990 年代末到 2000 年代初的事。Popper、Kroll 等市场研究者系统论证了以恰好组为基准、用喜好均值差计算罚分的框架,并给出了 0.5 折减的经验修正(后文会讲到为什么需要它)。再往后,Compusense、FIZZ 这类感官测试软件把罚分计算与矩阵图做成标准报表,一键出图,方法从此成为全球食品公司新品开发的常规动作。
一句话概括这条演化线:先学会问「喜不喜欢」,再学会问「哪里不对」,最后学会算「不对的代价」——判罚分析就是第三步的产物。
罚分怎么算
逻辑一句话:以「恰好」组为基准,看「偏弱」组、「偏强」组的总体喜好各掉了多少分,掉的分就是罚分(penalty)。
用一个虚拟但贴近真实的例子走一遍。某酸奶新品,200 位消费者盲测,甜度一栏的结果:
| 甜度评价 | 人数占比 | 该组总体喜好均值 |
|---|---|---|
| 太淡 | 20% | 5.2 |
| 恰好 | 65% | 7.5 |
| 太甜 | 15% | 6.3 |
计算三步:
- 单侧罚分:恰好组均值减去偏离组均值。「太淡」的罚分 = 7.5 − 5.2 = 2.3 分,「太甜」的罚分 = 7.5 − 6.3 = 1.2 分——甜度偏淡的杀伤力几乎是偏甜的两倍;
- 影响面:偏离 JAR 的总人数占比 = 20% + 15% = 35%;
- 加权总罚分:按人数加权,0.20 × 2.3 + 0.15 × 1.2 ≈ 0.64 分。含义直观:如果配方把甜度恰好化,全体样本的平均喜好度理论上能提升约 0.64 分。
同样的三步,套到其余三个属性上。酸度一栏:太酸 30%(该组喜好均值 6.9)、恰好 60%(7.5)、不够酸 10%(7.2):
- 罚分:太酸 = 7.5 − 6.9 = 0.6;不够酸 = 7.5 − 7.2 = 0.3;
- 影响面:30% + 10% = 40%;
- 加权总罚分:0.30 × 0.6 + 0.10 × 0.3 = 0.18 + 0.03 = 0.21。
香气一栏:太淡 25%(6.8)、恰好 70%(7.4)、太浓 5%(6.4):
- 罚分:太淡 = 7.4 − 6.8 = 0.6;太浓 = 7.4 − 6.4 = 1.0;
- 影响面:25% + 5% = 30%;
- 加权总罚分:0.25 × 0.6 + 0.05 × 1.0 = 0.15 + 0.05 = 0.20。
稠度一栏:略稀 15%(6.9)、恰好 80%(7.4)、略稠 5%(7.3):
- 罚分:略稀 = 7.4 − 6.9 = 0.5;略稠 = 7.4 − 7.3 = 0.1;
- 影响面:15% + 5% = 20%;
- 加权总罚分:0.15 × 0.5 + 0.05 × 0.1 = 0.075 + 0.005 ≈ 0.08。
四个属性汇总成一张优先级表:
| 属性 | 偏离占比 | 加权总罚分 | 判读 |
|---|---|---|---|
| 甜度 | 35% | 0.64 | 优先修 |
| 酸度 | 40% | 0.21 | 观察 |
| 香气 | 30% | 0.20 | 观察 |
| 稠度 | 20% | 0.08 | 放后 |
两个观察值得停下来看一眼。其一,喊「酸不对」的人最多(40%),酸度的加权罚分却只有 0.21——觉得太酸的那组人喜好均值 6.9,和恰好组的 7.5 只差 0.6,他们嘴上说酸,心里并没有太介意;甜度恰好相反。结论反转了比例给出的直觉:**优先调甜,酸先不动。**其二,香气的「太浓」单侧罚分并不小(1.0 分),但只有 5% 的人这么觉得,加权后的贡献仅 0.05——影响面与影响深度必须放在一起看,这正是下一节矩阵要做的事。
优先级矩阵:影响面 × 影响深度
单个属性算完,还要放回全景里比。标准做法是画一张散点图,业内叫判罚分析矩阵或 JAR 罚分图:
- 横轴:偏离 JAR 的人数占比——问题波及多广;
- 纵轴:加权总罚分——问题扎得多深;
- 参考线:常见取偏离占比 20–25%、罚分 0.5–1.0,具体阈值按品类经验校准。
于是四个象限有了各自的名字:
| 罚分高 | 罚分低 | |
|---|---|---|
| 偏离人多 | 优先修:又广又深,配方团队的头号任务 | 记录在案:喊声大但无伤大雅,先别动 |
| 偏离人少 | 小众硬伤:一群人的强烈不满,看这批人是不是目标客群 | 皆大欢喜:资源别浪费在这里 |
上面酸奶例子里,甜度落在右上偏中的位置,酸度、香气落在右下,稠度缩在左下角——资源往哪投,图上一目了然。配方修改后再测一轮,罚分图前后对比,就是改版有没有改到点上的证据。
四个常见的坑
判罚分析不复杂,但解释数据时有几件事必须心里有数:
- 0.5 折减惯例:JAR 评价和总体喜好来自同一个人对同一个产品的整体印象,天然带光环——喜欢这杯酸奶的人,倾向于给每个属性都打「恰好」。因此不少研究者与感官软件会把观测罚分乘以 0.5,当作调整后的真实影响。好消息是折减通常不改变属性之间的排序,优先级结论不受影响;
- 小组样本量:罚分是分组均值之差,某个偏离组如果只有几个人,均值极不稳。经验法则是偏离组至少占样本 10–20%,或不少于 20 人,不够格的组宁可不算;
- 属性突显:问卷里列的属性会被消费者「越问越重要」。JAR 问题控制在 4–6 个真正可调的属性内,别把二十个感官词全塞进问卷;
- 相关不是因果:罚分说的是「觉得太淡的人,喜好也低」,不证明「把甜度加上去,喜好就涨」。属性之间还互相纠缠——甜度和香气常常同涨同落。最终定案前,让配方师做一轮实改样品再测,才算闭环。
结语
本系列前两篇聊的 NPS 与 T2B,回答的是「用户态度怎么样」;判罚分析往前多走了一步,回答「产品具体哪里不对、先改哪里」。方法本身不过是分组求均值再加权,一张矩阵图,却把口味测试从「报分数」变成「开处方」——问卷两端,一端连着消费者的舌头,一端连着配方工程师的下一版样品,罚分就是中间的翻译。下次看到「四成消费者觉得太酸」的新闻,不妨多问一句:这四成人的喜好分,掉了多少?
评论
0 条登录后参与讨论。本站评论仅对注册用户开放(需站长审核注册),用于展示你的身份。