抽样调查法是一种非全面调查方法,其做法是依照既定程序,从由全部调查对象组成的总体中选出一部分个体作为样本,再根据样本结果对总体的有关指标或特征作出统计推断[1]。由于只调查总体中的一小部分单位,它在人力、财力与时间上比全面调查更为节省,取得信息也更快[1]。按抽选样本的方式,可分为概率抽样与非概率抽样两类,其中概率抽样应用最为广泛[2]。该方法是政府统计、市场调查与科学研究中普遍采用的调查方式[2]。
定义
抽样调查法属于非全面调查,其做法是依照既定程序,从由全部调查对象组成的总体中选出一部分个体作为样本,再根据样本的调查结果对总体的有关指标或特征作出统计推断[1]。例如要了解消费者对某商品的满意程度,可以从全部消费者中抽出若干人开展调查,用所得数据反映总体情况[1]。按抽选样本的方式划分,可分为概率抽样与非概率抽样两类[2]。
一次完整的抽样调查通常包含若干基本要素:包含全部研究目标的抽样总体、被抽中的个体样本、具体的抽样方法、统计推断以及总误差[2]。总体中全部抽样单元的名单或清册称为抽样框[2]。概率抽样按随机规则选取样本,每个单元被抽中的概率可以计算,因而能够对总体的总量、均值或比率作出估计,并求得估计量的方差来衡量精度[2]。非概率抽样依赖调查者的主观判断或意愿,通常没有抽样框,也无法确定抽样误差,其样本一般不能直接用于推断总体[2]。
背景
在抽样方法普及以前,官方统计的数据收集主要依靠全面调查以及人口普查、登记系统等方式[3]。全面调查覆盖的议题范围有限,且耗费大量资源;当时以专论形式出现的部分研究又难以说明自身是否具有代表性[4]。此外,产品质量检查、农产品试验、医药临床试验等情形不适合或难以开展全面调查[1]。
19世纪末,统计学家基尔(A. N. Kiaer)主张以抽样(当时称为代表方法)取代全面查点,是最早推动这一做法的人物之一[5]。1906年阿瑟·鲍利(A. L. Bowley)为抽样方法提供了理论论证,1912年又发表了在雷丁实施的实际调查[6]。1925年国际统计学会在罗马举行的会议通过决议,同时认可随机抽样与目的抽样的使用[6]。此后随机化逐渐成为必须遵循的要求,1934年耶日·内曼论证了概率抽样的优越性[6]。中国国家统计局的资料称,抽样调查方法起源于19世纪的欧洲,到20世纪中期逐步形成了较为完整的理论体系[2]。
内容
概率抽样的组织方式有多种。简单随机抽样从总体中不加分组、分类或排队,完全随机地抽取单位,是其他各种抽样形式的基础,通常在总体单位之间差异较小、数目较少时使用[7]。等距抽样又称机械抽样或系统抽样,把总体单位按一定标志或次序排队后,按相等间隔抽取样本;中国城乡居民收支一类调查即采用这种方式[7]。
分层抽样先把总体单位按属性特征划分为若干类型或层,再在层内随机抽取,适用于总体情况复杂、单位之间差异较大的对象[7]。整群抽样成组地抽取调查单位,组织与实施较为便利,但单位在总体中的分布可能不够均匀,准确性相对差一些[7]。多阶段抽样把抽样过程分为两个或更多阶段,便于对规模庞大而复杂的总体实施,且不需要为每一级抽样单位编制完整名单[7]。此外还有与规模成比例的概率抽样(PPS)、二重抽样等方式[7]。
在推断环节,研究者以样本信息估计总体的总量、均值或比率,并计算估计量的方差以衡量精度[2]。误差分为抽样误差与非抽样误差两类:抽样误差因以样本估计总体而产生,在方案既定的条件下与样本量相关;非抽样误差则包括抽样框误差、无回答误差、测量误差与调查误差等[2]。为把误差控制在允许范围以内,样本量需依据精度要求和总体各单位之间的差异程度来确定[8]。
影响与争议
1936年美国总统选举期间,美国刊物《文学文摘》依据电话簿和俱乐部会员名册向约1000万人寄出问卷,收回约240万份,据此预测共和党候选人兰登将以57%对43%胜出,而实际结果是罗斯福以62%对38%当选[9]。当时美国家庭的电话普及程度有限,以电话簿选样使样本偏向较富裕人群,加上寄回问卷者的回答倾向,造成了系统性偏差[9]。有研究利用1937年盖洛普调查的数据分析后认为,该刊的样本偏差与回答偏差共同造成了严重失真的估计[10]。这一案例常被引用以说明样本量大并不等于结果可靠[11]。
1934年,内曼证明分层随机抽样优于当时使用的目的抽样,并提出效率与最优样本分配的概念,即后来所称的内曼分配[5]。20世纪40年代以后,概率抽样逐渐成为各国统计机构和社会科学研究的标准工具[5]。1953年,汉森(M. H. Hansen)、赫尔维茨(W. N. Hurwitz)与马多(W. G. Madow)合著的抽样教科书出版,在此后近20年间未受有力挑战[6]。
1970年代,罗亚尔(R. M. Royall)等人质疑以随机化为基础的推断,主张改用基于模型的抽样推断,引发了抽样史上的又一次重要争论;也有学者认为基于设计的推断与基于模型的推断各有其用处[6]。近年来,由于概率抽样在实施中的不完善与成本上升,加上互联网和大数据能够以较低成本快速获得大规模样本,非概率抽样在许多应用领域重新增多,同时也出现了将其校准到外部总体控制数的方法[12]。在中国,统计法要求统计资料的搜集与整理以周期性普查为根基,以经常性的抽样调查作为主要方式[2]。
参见
参考资料
- 抽样调查 . stats.gov.cn [引用日期2026-09-29]
- 什么是抽样调查 . stats.gov.cn [引用日期2026-09-29]
- wiley.com 上的 PDF 文件 . wiley.com [引用日期2026-09-29]
- cambridge.org 上的网页 . cambridge.org [引用日期2026-09-29]
- 02-eng . gc.ca [引用日期2026-09-29]
- Three controversies in the history of survey sampling . anu.edu.au [引用日期2026-09-29]
- 抽样调查的主要方法 . sh.gov.cn [引用日期2026-09-29]
- 统计知识_天津市统计局 . tj.gov.cn [引用日期2026-09-29]
- 《文学文摘》为何遭遇滑铁卢? . gmw.cn [引用日期2026-09-29]
- NSTL回溯数据服务平台 . nstl.gov.cn [引用日期2026-09-29]
- Essential Epidemiology | Cambridge Aspire website . cambridge.org [引用日期2026-09-29]
- gov.pl 上的网页 . gov.pl [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T10:23:18Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。