抽样误差是统计学中由于抽取样本的随机性所造成的样本值与总体值之间的差异,也称为代表性误差。抽样调查只观察总体的一部分,样本对总体的代表性存在局限,因此这种误差在概率抽样中不可避免,但可以计量并加以控制,抽样误差越小,样本对总体的代表性越高。它是抽样推断和置信区间估计的基础概念,决定了调查结果的可信程度。
定义
抽样误差指在严格遵循随机原则抽取样本的条件下,样本统计值与总体参数真值之间的差异,主要包括样本平均数与总体平均数之差、样本成数与总体成数之差[1]。它有时也被称作代表性误差,但这一口径只涵盖按随机原则抽样必然产生的部分[2]。
统计调查中的误差通常划分为两大类:一类是登记误差,又称调查误差或工作误差,源于指标口径不清、被调查者提供不实资料以及登记、计算、抄写中的差错,在抽样调查、其他形式调查甚至普查中均可能出现;另一类是代表性误差,即用部分推断总体所产生的误差[3]。代表性误差又有两种情形,一是违反随机原则、有意识多选或漏选某些单位而造成的系统性误差,二是即使遵守随机原则仍会出现的偶然性误差。抽样误差特指后者,不包括登记误差和系统性误差[3]。偏离随机原则的系统性误差与登记误差合称偏差,属于可以避免的非抽样误差[2]。
抽样误差只存在于概率抽样之中;非抽样误差则在概率抽样、非概率抽样乃至普查中都可能出现,并贯穿抽样设计、数据采集、数据处理与分析各个环节[2]。由于总体指标是唯一确定的数值,而样本指标随样本不同而变动,抽样误差本身是一个随机变量。
原理
从同一总体中随机抽取含量相等的若干样本,各样本的统计量之间会互有差异,这种差异反映了样本与总体之间的差异[4]。为衡量其一般水平,统计学引入抽样分布概念:假定从总体中抽取所有可能的含量为 $n$ 的样本,各样本统计量形成的理论分布即为抽样分布,据此可求出该统计量的方差,其平方根就是标准误[5]。
抽样平均误差即所有可能样本统计量的标准差,反映样本指标与总体指标之间的平均离差程度[6]。在单纯随机抽样且重复抽样的条件下,样本均值的抽样平均误差为 $\mu_{\bar{x}} = \frac{\sigma}{\sqrt{n}}$,样本成数的抽样平均误差为 $\mu_p = \sqrt{\frac{p(1-p)}{n}}$;不重复抽样时需乘以有限总体修正系数 $\sqrt{1-\frac{n}{N}}$[6][7]。式中 $\sigma$ 为总体标准差,$p$ 为总体成数,$n$ 为样本容量,$N$ 为总体单位数。
抽样极限误差又称允许误差,指在一定概率保证程度下抽样误差的最大可能范围,用 $\Delta = t\mu$ 表示,其中 $t$ 称为抽样误差的概率度[6]。依据正态分布定理,误差范围在正负 1 个平均误差内的概率约为 68.27%,正负 2 个平均误差内约为 95.45%,正负 3 个平均误差内约为 99.73%[8]。区间估计通常取正负 2 到 3 个平均误差的范围[8]。
flowchart LR
A[总体] --> B[随机抽取含量为n的样本]
B --> C[计算样本统计量]
C --> D[构造抽样分布]
D --> E[求统计量标准差 得标准误]
E --> F[结合概率度t 得极限误差]
F --> G[推断总体参数并给出置信区间]
发展历程
抽样误差的概念建立在概率论与大数定律的基础之上。正态分布定理表明,大量随机现象的分布总是围绕其平均数两侧展开,只有随机现象才可能呈正态分布,这一规律为说明抽样误差范围与概率之间的关系提供了依据[8]。
随着统计学的发展,对于抽样误差的控制和测算逐步形成了较为深厚的理论体系,抽样分布、标准误、置信区间等工具相继被引入统计推断[2]。在应用层面,样本量的确定、抽样方式的选择以及误差范围与把握程度之间的取舍,逐渐成为抽样方案设计的核心内容[8]。
应用
抽样误差是抽样推断的依据,用于说明样本指标与总体指标之间的相差范围,并据此估计总体参数。标准误是表示统计量抽样误差大小的指标,常用于估计参数的可信区间,例如以样本均数加减 1.96 倍标准误的形式给出总体均数的 95% 可信区间[9]。
在医学统计中,样本均数的标准误由样本标准差除以样本含量的平方根得到,样本率的标准误由 $\sqrt{p(1-p)/n}$ 计算,按单纯随机抽样的算式近似处理其他抽样方法[5]。在质量控制与计量测试领域,抽样平均误差和抽样极限误差的计算被用于把握检验结果的可靠程度[10]。
对抽样误差的量化也会影响样本量的确定。容许误差是假设检验试图揭示的差异大小,其值越小,所需样本含量越大[8]。
局限
抽样误差是抽样调查固有的误差,即使严格遵守随机原则也无法彻底消除,只能在一定条件下加以控制[2]。就一次具体的抽样调查而言,由于总体指标数值未知,样本指标与总体指标之间的实际误差无法直接计算,它只是众多可能误差数值中的一个,不能概括全部可能产生的误差[3]。
抽样误差只存在于概率抽样中,其测算依赖于随机抽样机制。对于不依赖概率机制的抽样方式,误差量化的可能性受到限制[11]。同时,抽样误差的度量并不能反映偏差:置信区间只在统计量由随机抽样获得时才有效,它无法把系统性偏差纳入考虑[12]。
抽样误差与样本量、总体内部差异程度、抽样方法及抽样组织形式有关,其中样本量和抽样方法由人为决定,而总体差异程度是客观存在的,样本容量增大时抽样误差会缩小,但在一定阶段后趋于稳定[1]。
参见
参考资料
- 抽样误差 . stats.gov.cn [引用日期2026-10-02]
- 抽样误差_知网阅读 . cnki.net [引用日期2026-10-02]
- [科普中国]-抽样误差 . kepuchina.cn [引用日期2026-10-02]
- {{custom_sec.title}} . pku.edu.cn [引用日期2026-10-02]
- 抽样方法与抽样误差-公卫百科-公共卫生科学数据中心 . phsciencedata.cn [引用日期2026-10-02]
- 根据全及总体各个单位的标志值或标志属性计算的,反映总体某种属性或特征的综合指示称为全及指标 . cupl.edu.cn [引用日期2026-10-02]
- 统计学 . sdut.edu.cn [引用日期2026-10-02]
- [科普中国]-容许误差 . kepuchina.cn [引用日期2026-10-02]
- 标准差与标准误的关系-公卫百科-公共卫生科学数据中心 . phsciencedata.cn [引用日期2026-10-02]
- 抽样误差分析-计量与测试技术2005年01期-知网阅读 . cnki.net [引用日期2026-10-02]
- nationalacademies.org 上的网页 . nationalacademies.org [引用日期2026-10-02]
- standard-error-mean-fred-pyrczak-deborah-oh . taylorfrancis.com [引用日期2026-10-02]
浏览次数:1 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-10-02T12:33:00Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。