免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

问卷信效度分析实操:从Cronbach‘s α到因子分析

问卷信效度分析实操:从Cronbach‘s α到因子分析 前面八节我们聊完了选题定义、量表设计、抽样方案和数据收集的种种细节按理说数据拿到手论文的大半就已经稳了。但我这些年帮忙看过的问卷数据里七八成的问题恰恰是在数据到手之后才开始爆发的——信度、效度分析这一关不过前面做得再认真评审眼里也是白搭。我记得有一次帮一位硕士生看初稿对方特别激动地说老师我的量表信度特别好Cronbachs α都算出0.98了。但我拿原始数据一查发现四十多道题目几乎全部高度相关细看之下受访者在答题时大部分都选了同一个选项显然没有认真审题。果然后续的效度分析怎么旋转因子都分不出维度整个问卷的结构效度直接崩盘。所谓信度、效度分析本质上就是在回答两个问题你测出来的数据可不可重复、稳不稳定以及你测出来的东西是不是你真正想测的那个东西这两个问题不过关后面再花哨的回归、结构方程模型都等于在沙子上盖楼。这篇内容我会把信度、效度背后的逻辑、SPSS实操流程、常见翻车现场和论文写作时的呈现方式一次讲透不需要你有统计基础只要跟着一步步来就行。1. 真分数模型与测量误差先搞懂信度和效度在保护什么1.1 观测分数等于真分数加误差一个公式串起所有概念信度和效度看似是两个独立的指标实际上源于同一个统计模型——真分数理论也叫经典测量理论。这个理论的核心用一个公式就能说清楚X T E观测分数X等于真分数T加上随机误差E。你测量到的每一个数据都包含两部分受访者真实水平的反映以及测量过程引入的误差。比如用同一份问卷调查消费者的购买意愿上周填和这周填结果可能不一样这不是因为消费者的意愿变了而是因为测量过程本身存在随机波动。信度衡量的是T在X里占多大比例。信度高说明随机误差占比小、数据稳定可重复信度低说明误差淹没了真实信息数据基本等同于噪声。效度衡量的是T是否真正反映了你想测的那个概念。一个测量工具可能非常稳定但测的可能是错误的东西。打个生活化的比方用弹簧秤量身高。如果每次量出来的数字都差不多那这个工具信度不错但如果弹簧秤的刻度本身就是错的量出来的身高全都少十厘米那它效度就有问题。信度解决的是稳不稳定效度解决的是准不准。这个区分在实际项目中非常关键。我在帮人看数据时经常遇到一种情况问卷的α系数高得漂亮可一旦做效度检验就露馅——因为题项之间高度相关往往只是受访者答题时形成了某种固定倾向跟你的理论概念没有半毛钱关系。这也是为什么我反复强调信效度必须放在一起看单看任何一个都容易被表面数字骗过去。1.2 为什么信度检验要排在效度检验前面在一般的量化研究流程中拿到数据之后总是先做信度、再做效度这个顺序不只是流程上的习惯背后有严格的逻辑关系高信度是高效度的必要条件但不是充分条件。这话怎么理解一个测量工具完全可能极端稳定但测的却不是它声称要测的东西。你设计一份职业倦怠量表里面却都在问职业满意度问卷可能表现出很好的内部一致性因为满意度和倦怠确实相关但它测的根本不是你要的倦怠内容效度这一关就过不了。反过来如果一份量表信度很低数据里充满了随机噪声相关性被稀释那你无论如何也折腾不出稳定合理的效度结构。所以逻辑链条是这样的先确认测量是稳定可靠的才有资格讨论测得到底准不准。如果信度都过不了效度分析做了也是白做如果信度过了但效度出问题说明你的问卷设计环节有系统性偏差不是靠统计手段能弥补的。这里还要顺手纠正一个普遍误区很多论文把信度分析写成总量表的Cronbachs α是0.93因此信度良好却完全没报告分维度的信度。其实对多维量表来说总量表的α意义极其有限不同维度可能在测完全不同的概念硬凑在一起算一个α既不能说明整体信度还会掩盖某些维度本身信度不足的问题。正确做法是给每个维度单独算α这一点在后面的实操部分会详细展开。2. 信度分析不是只有Cronbachs α三种信度怎么选2.1 内部一致性信度最常用也最容易误用Cronbachs α可能是社科论文里出现频率最高的统计量没有之一。它的基本逻辑是如果一份量表的题目都在测量同一个潜变量那么题与题之间应该具有较高的相关性。α值由题项之间的平均相关性和题目数量共同决定。公式我在这里不展开但你一定要记住α的两个特点。第一题项数量越多α越容易被抬高。三十道题的量表哪怕题间平均相关只有0.2α也可能超过0.9这时候的高信度并不说明题项之间高度一致只是题目多而已。第二α只适用于单维度量表。如果你把一个多维量表的所有题目放在一起算α结果会高得离谱却没有实际意义。正确的操作是对每个维度分别计算α。判断标准一般参考下面这张表α范围评价适用场景0.9以上优秀成熟量表的信度表现0.8~0.9良好多数正式研究可接受0.7~0.8可接受新编量表或探索性研究0.6~0.7勉强可用探索性研究需谨慎解释0.6以下不理想建议删除或修改题项严格来说α临界值的选取要结合研究阶段。成熟量表拿来本土化时α低于0.8都值得警惕要是自己开发的新量表探索性阶段0.65以上也可以接受毕竟新量表的题项还需要迭代。我见过有些学生一看到α是0.68就开始恐慌到处删题这其实没必要关键要看你的研究定位是验证性的还是探索性的。2.2 重测信度时间稳定性怎么验证内部一致性信度考察的是同一时间点上各题项之间的相关性但有些研究关心的是量表跨时间的稳定性这就需要做重测信度。操作方法是对同一批受访者用同一份量表间隔一段时间后再测一次然后计算两次得分的相关系数。间隔时间一般建议两到四周太短容易受记忆效应影响受访者还记得上次怎么选信度虚高太长则可能遇上真实特质的自然变化把信度人为压低。重测信度在纵向追踪研究和干预实验里特别重要。比如你要测量患者的焦虑水平在干预前后的变化如果量表本身时间稳定性差你测出来的差异就分不清是干预效果还是测量误差。我做过的一些项目里间隔三周的重测相关系数到0.7以上基本可以接受理想状态是0.8以上。需要提醒的是重测信度也有局限性。它只能说明量表结果的时间稳定性如果被测特质本身会随时间变化比如情绪、态度这类状态性变量重测信度反而不容易做高。这类研究里更常用的是内部一致性信度。2.3 折半信度与Spearman-Brown系数另一个补充视角折半信度的思路是把量表按题目顺序分成两半比如奇数题和偶数题各一组然后计算两半得分的相关系数。如果两半高度相关说明题目之间一致性好。不过折半信度对分半方式比较敏感奇偶分、前后分、随机分结果可能都不一样。所以实际操作中更常看的是Spearman-Brown系数它相当于校正了分半带来的偏差得到一个更稳定的信度估计值。在SPSS里选了折半信度模型后输出结果会直接给出Spearman-Brown系数。折半信度现在用得不算多但有一个场景很有价值当你的量表中包含一些比较特殊的题型或者你已经预设了题项难度递进的顺序比如从简单到困难这时候内部一致性α可能被题项难度差异干扰折半信度反而更能说明问题。我在实际项目里一般把信度检验分成两个层次常规问卷研究以Cronbachs α为主辅以删除该项后的α值来检查题项贡献如果涉及追踪设计或特定题型再补充重测信度或折半信度。别贪多每一种信度背后都有特定的适用场景写论文时不是堆的指标越多越好而是要让每个指标都对应一个明确的研究需求。3. 效度检验的三条路径内容、结构、效标效度如何落地3.1 内容效度量表开发期就要做的前置工作内容效度关心的是量表题目到底有没有覆盖你所要测量概念的全部内涵。这个指标不靠统计计算主要靠理论推理和专家判断所以很多人误以为它没有操作空间随便在论文里写一句邀请了三位专家对题目进行评审就带过去了。实际操作中内容效度是可以量化呈现的。常用的方法是计算内容效度比也叫CVR出自Lawshe提出的专家评审框架。操作流程是把量表的题项逐个拿给专家请他们按必要、有用但不必要、不必要打分。然后套用这个公式CVR (Ne - N/2) / (N/2)其中Ne是评为必要的专家人数N是专家总人数。CVR的范围在-1到1之间越接近1说明专家认同度越高。根据Lawshe的临界值表专家人数较少时要求几乎全票通过专家人数到10人以上CVR临界值会放宽到0.62左右20人时约0.42。一般研究至少请5位专家人数少于5位时结果不太稳定。这里有个亲身经验的提醒专家评审表的措辞很重要。如果你直接写这个题项是否相关专家很容易全选是因为模棱两可的题项看起来都沾边。更有效的做法是给专家提供概念界定让专家评价题项与对应维度的匹配程度并允许提出语义不清晰或存在双重否定的题项修改意见。你拿到反馈后把修改过程也写进论文附录审稿人会觉得你的内容效度有据可查而不是走过场。3.2 结构效度的两条路线探索性因子分析与验证性因子分析结构效度是效度检验中技术含量最高的部分也是论文里最容易出错的地方。它要回答的问题是测量工具的题目结构是否符合你预期的理论维度划分。路线一是探索性因子分析英文缩写EFA适合量表开发初期。事先不预设维度硬约束让数据自己说话看哪些题目天然聚在一起。路线二是验证性因子分析英文缩写CFA适合成熟量表或已有明确理论框架的场景。做CFA时你已经设定了每个题目属于哪个维度统计软件会检验这个预设结构与实际数据是否吻合。很多人以为EFA和CFA是二选一的关系其实在严格的量表开发流程里两者是先后关系先用一半样本做EFA探索维度结构再用另一半样本做CFA确认这个结构稳定成立。如果用同一份数据既探索又验证CFA的拟合结果会虚高评审一眼就能看出来。做EFA时有几个硬性指标需要记住第一个是KMO取样适合性检验通常要求大于0.6越接近1越好但KMO低不完全是数据问题详见后面的排雷部分第二个是Bartlett球形检验要求p值小于0.05第三个是累计方差解释率社会科学研究里一般要求提取出的因子能解释50%以上总方差不低于40%也可以接受第四个是因子载荷量常规要求大于0.4理想状态大于0.5同时一个题项不能在多个因子上同时载荷很高。CFA使用的指标就更多了。常用的有卡方自由度比、CFI、TLI、RMSEA和SRMR。这些指标我在实操部分的表格里会给具体判读标准这里先记住结论CFA是比EFA更严格的结构效度检验如果你的研究只是把现成量表用于不同人群至少要做一轮CFA才够扎实。3.3 效标效度找一个靠谱的参照物效标效度做的人相对少但它在特定研究场景里价值很高。思路是找一个被广泛认可的外部标准看你的量表测出的分数跟这个标准的相关程度。比如开发一份新的工作满意度量表可以拿已有成熟量表或者客观离职意向作为效标计算新量表得分与效标之间的相关系数。效标效度又分为同期效度和预测效度。前者是量表得分与同时收集的效标数据做相关比如新量表和工作绩效同时评估后者是量表得分预测未来某个结果比如高考前测的学习焦虑预测几个月后的考试成绩。实际操作中效标效度的难点在于找效标。理想的效标应该是客观、可靠、且与目标概念高度相关的。如果连一个大家都认可的效标都没有那就别硬做效标效度因为选了不靠谱的效标反而会拉低研究质量。很多审稿人其实不会苛求每篇论文都做全三种效度如果你使用的是成熟量表并且做了CFA内容效度通过专家评审基本就够有说服力了。4. 完整SPSS实操流程从数据清洗到两张核心结果表4.1 数据清洗是信效度分析前最容易被跳过的一步我每年会看不少同学发来的数据文件能直接用于信效度分析的其实不到一半。最常见的问题包括反向题没有重编码、存在全选同一个选项的无效样本、缺失值没有被处理。这些数据直接跑信度和效度结果全是虚的。反向题的处理是第一关。问卷里通常会有意设置几道反向表述的题比如我觉得工作让我身心俱疲和我觉得工作让我充满活力前一种可能设置成1分代表非常不同意那么后者的计分方向就得反过来。如果你的问卷在数据录入时没有把反向题重编码会导致维度内的题项相关被压低α系数明显偏低。编码操作其实很简单。在SPSS里用计算变量功能对反向题的原始得分做转换新值 量表满分 1 - 原值。比如李克特5点量表原得分为1的变成52变4以此类推。做这一步之前一定要先确认你的题项哪些是反向题把编码脚本保存好论文附录里也可以放上一句所有反向题均进行了反向计分。接下来是无效样本筛查。比较朴素的方法是检查同一用户的大量连续同值情况比如四十道题里超过一半选了同一个选项这种数据大概率是应付作答。我通常还会结合填写时长判断问卷预设需要五分钟结果有人四十几秒提交那数据质量就很可疑。剔除无效样本后的有效样本量要在论文里明确报告。缺失值的处理则要看你缺失的比例。整体缺失率低于5%时可以用序列均值或者中位数填补更稳妥的做法是直接剔除存在关键变量缺失的样本如果缺失比例偏高就要反思问卷设计是不是有题项过于敏感或者表述不清。4.2 第二步信度分析菜单操作与结果判读数据清洗完打开SPSS点选菜单分析 刻度 可靠性分析。在弹出窗口中把某个维度下的所有题项选入项目框模型默认选Alpha点击确定就能跑出结果。这里记得在统计选项里勾上删除项后的标度和相关性后面两步非常关键。对应的SPSS语法也贴在下面方便你日后批量操作RELIABILITY /VARIABLESq1 q2 q3 q4 q5 /SCALE(感知有用性) ALL /MODELALPHA /STATISTICSDESCRIPTIVE SCALE CORR /SUMMARYTOTAL.跑完第一份输出先看可靠性统计表格里的Cronbachs Alpha值。如果低于0.6接着看项总计统计表格里每个题项的删除项后的克隆巴赫Alpha列。假如删除某一道题后α能显著提升比如从0.55跳到0.72这道题大概率是问题题项可以考虑删除但如果删除后提升幅度很小则没必要动它。我需要特别强调一句删题要用理论支撑不能纯粹为了凑α值。有些同学为了把0.68凑到0.71连续删掉三四道题最后量表被删得支离破碎这种做法在审稿人眼里非常掉价。正确逻辑是先统计后理论先找出降低α的题项再回看题目内容判断它是不是表述不清晰、测的维度不统一有理有据才删。4.3 第三步探索性因子分析的操作与参数设置信度没问题之后进入效度重点环节。同样是菜单操作分析 降维 因子。把进入因子分析的全部题项选入变量框后要先设几个关键参数。第一个是描述选项卡里勾选KMO和巴特利特球形度检验第二个在提取选项卡里方法先选主成分提取处如果基于特征值大于1一般默认即可第三个在旋转选项卡里选择最大方差法最后在选项里勾选按大小排序和禁止显示小系数显著系数习惯填0.4。这些参数组合起来就是社科论文里最常出现的主成分分析最大方差旋转方案。但我多说一句如果你的量表维度之间有理论上的相关比如工作满意度各维度本就彼此关联用斜交旋转方法更合理。SPSS里对应的方法是直接Oblimin或Promax结果更贴近现实只是解释起来比正交旋转麻烦一点。对应SPSS语法如下FACTOR /VARIABLESq1 q2 q3 q4 q5 q6 q7 q8 q9 q10 /MISSING LISTWISE /ANALYSISq1 q2 q3 q4 q5 q6 q7 q8 q9 q10 /PRINT INITIAL KMO EXTRACTION ROTATION /FORMAT SORT BLANK(0.4) /PLOT EIGEN /CRITERIA FACTORS(3) ITERATE(25) /EXTRACTION PC /ROTATION VARIMAX /METHODCORRELATION.输出结果里你需要看三张表。第一张是KMO和Bartlett检验KMO大于0.8算好0.7到0.8可用0.6到0.7勉强低于0.6就要警惕。第二张是总方差解释表看提取出的因子累计解释了多少方差一般要求到60%左右。第三张是旋转后的成分矩阵这是核心中的核心——你要检查每个题项在预设维度上的载荷是否都大于0.5并且没有严重的跨因子载荷。如果因子结构与预期不一致先别急着否定量表按我在下一节讲的方法做系统性排查。5. 数据反常识排雷α高到可疑KMO低到抓狂先查这几件事5.1 α异常偏高时先查反向题编码、回答定势和重复题项先回到开头那个案例α等于0.98看起来是信度极佳实际上往往意味着数据存在严重的作答倾向问题。当受访者不认真读题、全部选同一选项时题项之间的相关性会被强行拉高α自然虚高。这种数据不只是信度失真整个效度分析都会崩盘因为因子分析找不到区分度。遇到α超过0.95甚至0.98的情况我的常规排查顺序是先查反向题有没有被正确重编码如果反向题方向没变α就可能是负值或者虚高再查题项之间是不是存在语义重复比如同一维度里两道题几乎一个意思这种现象叫冗余题项会让α虚高但没有信息增量最后查受访者是否存在大量连续同值作答可以通过频率分析快速定位。当然还有一种可能你的量表题项确实高度同质比如只有五道题且都是对同一概念的重复测量那α高也合理但这种情况下你其实需要考虑量表内容覆盖是否太窄。5.2 KMO低于标准时先看样本量、题项相关分布再考虑删不删题KMO偏低是信效度分析里最常见的问题之一。它的逻辑是考察变量之间是否存在足够多的共同方差共同方差太小就提取不出有意义的因子。KMO低有时不代表题目不行而是样本量不够。因子分析对样本量比较敏感总样本少于一百时KMO很难做高。经验规则是样本量至少为题项数的5到10倍最好不低于两百。如果你的样本量本身就偏小KMO低是正常的优先补充样本比删题更明智。另外一个容易被忽略的原因是题目与题目之间相关太低甚至不相关。出现这种情况很可能是这些题目并不同属一个维度却被人为合在一起做因子分析。我在指导项目时见过很多次学生把整个量表的二十几道题一口气全部丢进因子分析结果KMO惨不忍睹。对于多维量表应该分维度审视或者先做整体分析时明确你想要提取的因子数而不是全凭软件自动决定。异常现象可能原因优先排查方向α偏高到0.95以上反向题未重编码、统一作答倾向、题项语义重复重编码检查、频率分布、题项文本对比KMO低于0.6样本量不足、题项跨维度混杂补样本、分维度分析Bartlett检验不显著变量间相关过弱检查题项区分度因子结构混乱题项理论维度不清晰、样本有偏回到问卷设计重审题项归属某维度的α特别低反向题混入、题项表述不清、维度概念过宽逐项看删除后α结合理论判断5.3 维度归属和预期不符先检查题项文本再怀疑统计因子分析跑出来发现第三道题跑到另一个维度上去了很多人的第一反应是统计结果有问题或者干脆手动指定因子数把题目摁回预设维度里这都不对。最靠谱的第一步是回到题目原文。我遇到过不少情况写问卷时觉得某道题测的是A维度仔细一读才发现它在问的内容其实更贴近B维度——这是问卷编写时的概念混淆统计只是如实反映出来了。这时候要么把这道题移回更合理的维度要么直接删掉并在正文里说明处理依据。如果题目文本完全合理再考虑样本来源是不是有特殊群体特征。比如你调查大学生群体的学习压力问卷拿到的样本却以研究生为主那因子结构确实可能跑偏。最后才考虑统计层面的问题比如旋转方法选择是否合适、因子数设定是否合理。这种排查顺序的本质是统计结果永远只是提示信号真正决定维度归属的是理论逻辑和题目内容。一味迎合统计结果删改题目是做量化的忌讳。6. 论文里如何规范呈现信效度结果模板、语法与审稿人潜台词6.1 信度结果的三线表格式分维度报告别只给总α到了写论文环节信效度部分通常放在研究结果开头或者变量测量章节的末尾。信度结果的呈现建议直接用三线表维度作为行题项数和α值作为列表X 各潜变量的信度检验结果潜变量题项数Cronbachs α感知有用性50.884感知易用性40.821行为意愿30.756许多论文喜欢额外写一句总量表信度α为0.93对多维量表而言这句话信息量不大还容易暴露问题。分维度报告才是硬道理每个维度下有哪几道题、α多少一目了然。如果还做了重测信度就在同一张表旁边加一列重测信度附上两次得分的相关系数。如果做了折半信度同样单独列一列。表格注释部分写清楚α为内部一致性系数重测间隔为三周这属于研究透明度的体现。6.2 效度结果的文字模板怎么描述才能让审稿人无话可说效度部分的写作比你想象中更讲究措辞。常规格式是先报内容效度再报结构效度如果做了效标效度就放在结构效度之后。下面给一段可以直接参考的文字模板在内容效度方面本量表题项基于已有文献和半结构化访谈整理而成并邀请五位相关领域专家对题项与维度的匹配性进行评审。根据专家反馈对语义模糊的题项进行了修改最终形成正式问卷各题项的内容效度比CVR均不低于0.80表明量表具有较好的内容效度。在结构效度方面样本数据的KMO值为0.842Bartlett球形检验近似卡方值为1863.24df171p0.001表明数据适合进行因子分析。采用主成分分析结合最大方差旋转法提取出特征值大于1的因子3个累计方差解释率为68.72%各题项在对应因子上的载荷介于0.682与0.891之间且不存在明显的跨因子载荷表明量表具有较好的结构效度。这段文字中每个数字都有意义CVR数值对应内容效度KMO证明数据能做因子分析累计方差解释说明因子提取程度载荷范围说明题目对维度的贡献。把数字背后的解释补齐再配合三线表这部分基本没得挑。如果是做了CFA的研究则要单独报告模型拟合指标表X 验证性因子分析模型拟合指标指标判断标准本模型结果χ²/df31.847CFI0.900.928TLI0.900.916RMSEA0.080.061SRMR0.080.0476.3 审稿人看信效度部分时真正在意的是什么我有段时间参加期刊审稿发现很多稿件先说信度表多漂亮再下来效度分析一塌糊涂这说明作者根本没搞明白信效度之间的逻辑关系只是按流程每个指标都做了一遍。审稿人真正在意的三件事是第一你有没有确认量表在本研究样本中的适用性第二你报告的指标是否和你的研究阶段匹配第三你在处理题项增删时是否有理论依据。研究阶段的不匹配是最常见的问题。自己新开发的量表只做了信度检验和因子分析没有做CFA审稿人会问结构稳定性如何验证反过来用的成熟量表却花大篇幅解释EFA结果也会显得外行因为成熟量表更应该做CFA。所以在你动笔之前先想清楚你用的是成熟量表、修订量表还是完全自编量表不同情境下信效度报告的侧重完全不一样。写到这里我特别想分享一个个人体会信效度分析并不存在标准答案式的固定流程它更像是在数据和理论之间来回打转。我第一次帮别人做数据分析时也迷信α越高越好、KMO越大越好后来踩了无数次坑才明白统计指标再好也得服务一个逻辑自洽的研究故事。如果你的维度设计有问题再多的旋转方法也旋转不出合理的结构如果你的样本数据是应付作答得来的再完美的α也只是数字游戏。这一节的目的归根结底是让你学会读懂数据在说什么话以及数据背后是否站得住脚。真正把问卷设计的每个维度都打磨清楚把测量误差从源头上控制住信效度分析其实就是水到渠成的事情。
返回列表