抽样主要有两个原则——重复和随机。
重复的意思是,具有相同的效应的对象需要研究多次。这个原则来自于统计学的基石——中心极限定理,也叫做”大数定理“,简单说就是数量越多越准确。做重复的时候,需要保证每个重复是独立的,互相没有影响。比如,我们要研究植物能否让蜡烛持续燃烧,那么就用一个玻璃罩把一盆绿植和一支蜡烛罩住,在10个房间进行摆放,每个房间布置5个这样的组合,重复为10,而不是50。需要注意的是,如果找一些人去背圆周率,每个人背10次,由于不断的重复,可能背下来的位数会逐渐增多,这10次虽然是实际的重复次数,却不能叫做实验中的重复或统计学上的重复。
重复的次数到底需要多少才合适?这曾经是个是困扰科学工作者的难题。一般而言,有两答案:一是越多越好,二是30个。当然,不考虑经济和时间成本,的确是越多越好。综合考虑,在大量的实践过程中,30成了一个非常恰当的重复数量。当然,如果调查的对象是群体,那么2个重复在国际上也是认可的。有很多专门针对这种情况开发的统计方法,保证该方案能够足够的统计学功效。
随机可以保证每个对象都有均等机会进入样本集合。大多数时候,研究者会把非随机搜集的信息视为随机。举个例子,我们想要在一座山上选取50个蘑菇,只要看一眼,你就会发现一些蘑菇很有特点,然后不自觉的选择了,相对细小的蘑菇品种,则很容易被忽略,这实际上并不是随机选择。一些研究人员喜欢先划定一个区域,然后在区域内随便取两个点连成一条直线,选取直线上所有的蘑菇,一条不够就两条。当然,这样的选取方式,比前一个要科学得多,但实际上偏向于长得密集的小蘑菇。
经常去花鸟去虫市场,总会看到一些面包虫,有人就拿这些面包虫做过实验——把从袋子里最先爬出来的面包虫拿出来放进鸟笼,然后把第二只放进去,再是第三只,经过几次重复后,发现总是第一只放进去的面包虫被吃掉所用的时间最短。这个实验可以如何改进?
发表评论