「这次问卷回收率有 45%。」「不对,我算出来只有 18%。」——两个人可能都没算错,只是分母不一样:一个除以了触达人数,一个除以了投放总量。问卷调研里最容易出事故的,往往不是分析,而是这些听起来人尽皆知、口径却从未对齐的「率」。
这篇文章把一份问卷从发出到变成可用数据的全过程拆开,逐个定义投放率、触达率、回收率、有效率这些关键参数,讲清样本量、误差幅度、置信水平三者的关系,最后说说为什么高回收率不等于好数据。
先画漏斗:从计划投放到有效样本
一切口径问题,都因为没先画漏斗。一份问卷的旅程是:
计划投放 → 投放(发送)→ 触达(送达)→ 打开/进入 → 开始作答 → 完成回收 → 有效样本
每个箭头都是一个流失关口,每个关口都能算出一个「率」。先统一各节点的人数口径(都是去重后的设备/账号数,而不是发送次数),再谈比率:
- 计划投放量:样本框里计划覆盖的目标人数;
- 投放量:实际发出的人数;
- 触达量:成功送达的人数(扣除退信、空号、拦截);
- 进入量:打开链接或弹出问卷页的人数;
- 开始量:回答了第一题的人数;
- 完成量:提交成功的人数;
- 有效量:通过质量清洗后可进入分析的人数。
漏斗上的六个比率
投放率:执行有没有到位
投放率 = 实际投放量 ÷ 计划投放量 × 100%
它衡量的是执行力,不是效果。低于 100% 通常意味着渠道配额限制、发送失败或排期未走完——先修执行,再谈分析。
触达率(送达率):发出去了,没送到
触达率 = 送达人数 ÷ 投放人数 × 100%
退信、空号、被拦截、命中机器人账号,都算没送达。邮件列表老化、社群里混入大量僵尸号,是触达率低的最常见原因。触达率是后面所有比率的真实分母起点——用发送量当分母,会系统性低估后续所有转化。
打开率与开始率:愿意看,才愿意答
打开率 = 打开/进入人数 ÷ 送达人数 × 100%
开始率 = 开始作答人数 ÷ 进入人数 × 100%
邮件问卷的打开率常见只有两三成,而站内弹窗几乎人人「看见」——所以跨渠道比较这两个指标没有意义,只能在同一渠道内做前后对比。触达文案里把时长和激励讲清楚(「3 分钟,抽 50 元红包」),在这里的杠杆最大。
完成率:中途流失都流失在哪
完成率 = 完成人数 ÷ 开始作答人数 × 100%
完成率是问卷设计质量的直接体检:题目太长、必答太多、开放题靠前、没有进度条,都会在流失曲线上留下「断崖」。逐题的流失数据(哪一题之后掉得最狠)比总完成率更有诊断价值。
回收率(应答率):口径争议最大的一个
回收率 = 完成人数 ÷ 触达人数 × 100%(口径一)
回收率 = 完成人数 ÷ 投放人数 × 100%(口径二)
学术上有更严格的 AAPOR 应答率体系,核心思想都是:分母只算「有资格被调查的人」。实务建议:报告里永远写明分母;对外比较(比如对标行业基准)用口径一,评估渠道发送质量用口径二。
经验参考(渠道差异极大,仅供校验数量级):邮件/短信问卷回收率常见 10%–30%,站内弹窗 30%–60%,定向邀约(如深度访谈前筛)可以更高。
有效率:洗完澡的数据才是数据
有效率 = 有效样本量 ÷ 回收样本量 × 100%
无效问卷的常见判定:
- 速度者(speeders):作答时长低于最短合理时长;
- 直线作答(straight-lining):量表题一路选同一个数字;
- 陷阱题不通过:注意力检查题答错;
- 逻辑矛盾:前面说没用过产品,后面答了使用频率;
- 重复提交:同一设备或 IP 多份问卷。
关键是:清洗规则要在分析前定义并留档,而不是看着结果不顺眼再回头删数据。
一张汇总表
| 指标 | 公式 | 分母口径 | 主要用途 |
|---|---|---|---|
| 投放率 | 实际投放 ÷ 计划投放 | 计划量 | 执行监控 |
| 触达率 | 送达 ÷ 投放 | 投放量 | 渠道质量 |
| 打开率 | 进入 ÷ 送达 | 送达量 | 触点吸引力 |
| 开始率 | 开始作答 ÷ 进入 | 进入量 | 开场设计 |
| 完成率 | 完成 ÷ 开始 | 开始量 | 问卷长度体检 |
| 回收率 | 完成 ÷ 触达(或投放) | 必须写明 | 总效果衡量 |
| 有效率 | 有效 ÷ 回收 | 回收量 | 数据质量 |
决定「样本够不够」的三个参数
回收了多少只是数量问题,能不能代表总体是另一个问题。这里需要三个统计参数出场。
误差幅度(边际误差)
问卷得出的是「样本比例」,比如 72% 的用户满意。误差幅度(margin of error)告诉你:真实的总体比例,大概落在样本比例上下多大的范围里。
置信水平与置信区间
置信水平(confidence level)是「真实值落在这个范围内的把握」,行业默认 95%。置信区间(confidence interval)把两者合起来写:满意度 72% ± 4.9%(95% 置信水平)——意思是如果重复抽样一百次,约有九十五次算出的区间会盖住真实值。
比例的误差幅度近似为 1.96 × √(p(1-p)/n)。样本 384 人、满意度 40% 时,误差约 ±4.9%;想把它压到 ±3%,样本量要翻到一千以上。
样本量:Cochran 公式
n₀ = Z² × p × (1-p) ÷ e²
Z 在 95% 置信水平下取 1.96,p 是总体比例(未知时取 0.5 最保守),e 是目标误差幅度。代入 p=0.5、e=5%,得到 384——这就是「四百样本」这个行业口头禅的来历。
| 总体规模 | ±5% 所需样本 | ±3% 所需样本 |
|---|---|---|
| 100 | 80 | 92 |
| 1,000 | 278 | 517 |
| 10,000 | 370 | 965 |
| 10 万以上 | 383 | 1,056 |
| 无限大总体 | 384 | 1,067 |
总体不大时用有限总体修正:n = n₀ ÷ (1 + (n₀−1)/N),所以一千人的总体,384 会自动缩到 278。
还要提醒一点:384 是总样本,不是分群样本。如果之后要单独看「华东区女性用户」这个子群体,每个子群体都得有自己的最小样本量,总量就得按分群数放大。
高回收率不等于好数据:三个偏差关键词
覆盖偏差(Coverage Bias)
问卷只发给了「够得着的人」:只给会员发邮件,就永远听不到流失用户的声音;只在 App 内投放,沉默的大多数(卸载者、低活跃者)根本不在抽样框里。覆盖率 = 抽样框覆盖的目标人群 ÷ 目标总体,这个数没有系统替你算,只能自己想清楚。
无应答偏差(Non-response Bias)
愿意回答的人和不回答的人,可能系统性地不一样。最典型的场景:满意度问卷里,极端不满的人懒得填、特别满意的人抢着填,分数天然虚高。补救办法:对无应答者做小规模追访,比较「早回应者」与「追访后才回应者」的答案差异——差异不大,可以放心一些;差异大,说明沉默的那群人真的不一样。
自选择偏差(Self-selection Bias)
自愿参与机制本身就在筛选样本:红包激励吸来羊毛党,社群调研里冲在最前面的是铁粉,官网弹窗里愿意停留的是本来就遇到问题的人。配额抽样(按性别、年龄、活跃度提前定好各群配额)和事后加权(把样本结构拉回总体结构)是两种常用解法。
落地清单
把这篇压成四条可以直接执行的事:
- 报告里永远写清分母:所有「率」后面括号注明「÷ 触达人数」还是「÷ 投放人数」;
- 清洗规则前置:速度者、直线作答、陷阱题、重复设备的标准,在投放前定好并存档;
- 按分析计划倒推样本量:先想清楚结果要分几个子群体看,再放大总量;
- 保留原始数据与漏斗日志:每个关口的流失数都记下来,复盘时才知道下一轮该修哪里。
结语
和之前聊过的 NPS、Top 2 Box 一样,问卷调研的难点从来不是算出那个数字,而是搞清楚数字的口径与来历。漏斗上的每一个「率」,本质上都在回答同一个问题:你听到的声音,到底是谁的声音,缺了谁的声音。
下次有人汇报「回收率 45%」,先别急着点头,问一句:分母是什么?
参考资料
- AAPOR(美国民意研究协会)Standard Definitions:应答率的规范计算口径;
- Cochran, W. G. (1977). Sampling Techniques(第 3 版):样本量公式的出处。
评论
0 条登录后参与讨论。本站评论仅对注册用户开放(需站长审核注册),用于展示你的身份。