教程 ·
非量表题要不要做信效度?研究主题相关,不等于统计上属于同一个潜变量
最常用的AI工具、是否付过费这类题,不需要算 Cronbach α、CR、AVE,也不需要做 CFA。实测演示为什么不适用、该改用什么分析、审稿人问起来怎么答。演示数据 300 份。
不需要。 「最常用的 AI 工具」「是否为 AI 工具付过费」这类题,不需要算 Cronbach α、CR、AVE,也不需要进 CFA。产品给的理由很直接:它们是「五个相对独立的背景或行为变量」,各自量各自的东西,并没有共同指向同一个潜在心理构念。
这一页解决什么
大部分问卷长这样:前面几道是选项题(用什么工具、付没付费、有没有培训过),后面才是 1~5 分的量表题。量表题那一半该怎么做信效度,CFA 怎么做:lavaan 因子载荷、CR、AVE 与拟合指标真实边界里写全了。本文只解决前面那一半:它们要不要一起算进去。
先把两个词说明白。「量表题」是好几道题合起来量同一件看不见的东西,比如"感知有用性"没法直接问出来,得靠四道题一起推。「潜变量」就是那个看不见、只能被推出来的东西。
演示数据(不是真实论文数据,模拟问卷,产品读到的是 300 行 × 31 列)。量表部分是 20 道 1~5 分题、五个维度;非量表部分是五道选项题:最常用的 AI 工具、主要使用场景、每月在 AI 工具上的花费、是否为 AI 工具付过费、是否接受过 AI 工具培训。
这五道题分别是什么性质
| 变量 | 变量性质 | 是否适合做 α、CR、AVE、CFA |
|---|---|---|
| 最常用的 AI 工具 | 名义分类变量 | 不适合 |
| 主要使用场景 | 名义分类变量 | 不适合 |
| 每月在 AI 工具上的花费 | 有序分类变量 | 不适合直接做 |
| 是否为 AI 工具付过费 | 二分类变量 | 不适合 |
| 是否接受过 AI 工具培训 | 二分类变量 | 不适合 |
数据来源:ChatSRS 实测输出的变量性质判定表,演示数据 300 份,非真实论文数据。
「名义分类变量」是只有类别、没有大小的变量(两个不同的 AI 工具之间排不出谁大谁小);「有序分类变量」的取值有高低先后,但相邻两档之间差多少并不确定(花得多还是花得少排得出来,档与档之间的间距却不能当成一样宽);「二分类变量」就是只有是和否两种取值。
变量性质判定表:五道题逐行给出变量性质和"是否适合做 α、CR、AVE、CFA"的结论,花费那一行写的是"不适合直接做",跟其余四行的措辞不一样。
为什么算 α 没有意义
产品先把 Cronbach α 的前提摆出来了:「Cronbach α 的前提是:多道题共同反映同一个潜在概念,例如“感知有用性”由 PU1~PU4 共同测量。这些题目应具有一定的相关性,且删除其中某一道题后,测量的是同一构念的不同侧面。」
然后逐条对照:「而“最常用的 AI 工具”和“是否接受过培训”并不是同一个概念的不同表现;“主要使用场景”也不是“每月花费”的测量题。把它们放在一起计算 α,得到的数值没有明确的心理测量含义,甚至可能因为类别编码方式不同而产生误导。」
注意最后半句:数值算得出来,但它会随编码方式变。 给"最常用的 AI 工具"那几个选项换一个编号顺序再算一遍,α 就是另一个数。一个跟着编号方式跑的系数,写进论文没有解释力。
产品把这一条单独拎出来强调了一次:
「尤其需要注意:不能因为这些变量都与 AI 使用有关,就把它们组成一个量表。研究主题相关,不等于统计上属于同一个潜变量。」
这句话是本页的骨头。 判断依据是"这几道题是不是在量同一件看不见的东西",跟"它们是不是都跟我的研究主题有关"没有关系。信度和效度各自到底在管什么,见信度和效度有什么区别?一篇讲透量表质量评估。
那这几道题该怎么分析
产品给的定位是:「这些变量应作为样本特征、解释变量、分组变量或控制变量使用,而不是作为量表维度使用。」
| 变量 | 产品给的处理方式 |
|---|---|
| 最常用的 AI 工具 | 报告各工具的频数和百分比 |
| 主要使用场景 | 报告查资料、翻译、编程等场景的频数和百分比 |
| 每月在 AI 工具上的花费 | 作为有序分类变量报告频数和百分比;不建议简单编码为 1、2、3、4 后当作等距连续变量 |
| 是否为 AI 工具付过费 | 按"是/否"报告频数和百分比,也可以作为二分类自变量 |
| 是否接受过 AI 工具培训 | 按"是/否"报告频数和百分比,也可以作为二分类自变量 |
数据来源:ChatSRS 实测输出的处理方式建议,演示数据 300 份,非真实论文数据。
想进一步看它们跟量表维度的关系,产品列了五条路:二分类变量与量表得分的差异分析;分类变量与行为意向之间的卡方检验;把分类变量做哑变量编码后纳入回归模型;对有序花费变量使用有序回归;对 AI 工具和使用场景这类多类别变量保留基准组后做回归。
哑变量编码就是把"用哪个工具"这种一列多种取值的题,拆成几列只有 0 和 1 的变量再进回归,参照组怎么选、k-1 是什么意思,见哑变量编码怎么做。
处理建议原文:五道题逐条给出报告方式,下面接着列出跟量表维度做关系分析时可选的五条路径,花费那一条明确写了"不建议简单编码为 1、2、3、4 后当作等距连续变量"。
审稿人问起来怎么答
这是这一页最容易被误用的地方,所以先把话说在前面:下面这两段是产品给出的表述范例,不是可以照抄交差的模板。 里面每一句描述的都是你自己问卷的设计事实——这几道题到底是不是背景与行为信息、你后续到底把它们当成什么变量在用——这些只有你自己能确认。确认完再写,不确认就照贴,审稿人再追问一句就答不上来。
产品给的完整回复范例是:
「感谢审稿人的建议。本研究中的“最常用的 AI 工具”“主要使用场景”“每月在 AI 工具上的花费”“是否为 AI 工具付过费”和“是否接受过 AI 工具培训”属于受访者的客观背景或使用行为信息,并非共同测量某一潜在心理构念的多个反映性题项。因此,Cronbach’s α、组合信度(CR)、平均方差抽取量(AVE)及验证性因子分析并不适用于这些变量。研究中对上述变量采用频数和百分比进行描述,并根据变量的测量水平,在后续分析中将其作为分类变量、二分类变量或有序分类变量使用。信度和效度检验仅针对 PU、PEOU、SI、ATT 和 BI 等由多个 Likert 题项构成的潜变量量表开展。」
写进论文方法部分的简写版是:
「对于由多个 Likert 题项共同测量的潜变量,本研究采用 Cronbach’s α、CR、AVE 和 CFA 检验其信度与效度。AI 工具类型、使用场景、花费、付费情况和培训经历属于独立的背景及行为变量,不构成反映同一潜变量的量表,因此不进行内部一致性和聚合效度检验,而采用频数、百分比及相应的分类变量分析方法进行处理。」
这两段里的变量名和维度名都是这份演示问卷的,换到你的问卷上,要逐个替换成你自己的题目和维度,并且核对一遍"我后面确实是这么用这些变量的"。
上面那段回复范例的产品输出原文。照贴之前先逐句对着自己的问卷核一遍——变量名、题项数、实际采用的描述方式都要换成你自己的。
如果审稿人坚持要"效度"
产品的处理是:换一种形式的质量控制说明,而不是硬算一个系数。它给了五条:
| 做法 | 具体是什么 |
|---|---|
| 内容合理性 | 依据研究目的、既有文献和研究对象实际情况设计选项 |
| 专家评审 | 邀请相关领域专家检查选项是否覆盖主要工具、场景和行为类型 |
| 预测试 | 通过小样本预测试检查选项是否清楚、是否存在重复或遗漏 |
| 选项完整性 | 必要时增加"其他,请注明"或"不清楚/未使用"等选项 |
| 数据质量检查 | 检查逻辑矛盾,例如选择"未付费"但填写了非零花费 |
数据来源:ChatSRS 实测输出的内容效度说明,演示数据 300 份,非真实论文数据。
产品自己给这五条划了边界:「这属于问卷设计和内容效度方面的说明,不等同于对这些分类变量计算 Cronbach α 或进行因子分析。」
这五条能不能写,取决于你当初有没有真做。 没做过专家评审就不能写专家评审,没跑过预测试就不能写预测试——这一栏是研究过程的记录,不是话术。
什么时候这几道题又需要做信效度了
有一种情况会翻过来:你把这些内容重新设计成好几道 Likert 题,共同量同一个构念。
产品举的例子是"组织支持",可以设成这样几道题:学校提供了 AI 工具使用指导;学院鼓励学生合理使用 AI 工具;学校为 AI 工具使用提供了相关资源;教师会在学习中支持 AI 工具的合理应用。
「这时这些题目共同测量“组织支持”,才可以进行 α、CFA、CR 和 AVE。相反,现有的“是否培训”“是否付费”“使用什么工具”等变量,即使都与 AI 使用相关,也不应强行组成一个量表。」
分界线画在题目形态上。 同一个话题,问成一道单选题就归背景变量;拆成四道 1~5 分题共同量一个构念,才进得了信效度那条线。
什么情况下不适用
- 这是模拟数据(300 份,非真实论文数据),上面的判断针对的是这五道题的变量性质,不构成对你那份问卷的结论。
- 你自己那几道非量表题到底是不是背景与行为变量,得你自己逐题看过再定。
- 上面两段回复范例是表述参考,用之前必须核对它描述的事实跟你的问卷对不对得上。
- 内容效度那五条只能写你真做过的。
- 有序变量(比如花费档位)在什么条件下可以当连续变量用,学科惯例不一样,这个得问导师。
- 产品的结论原话是「这五道题不需要做信度和效度分析,也不应为了回应审稿人而机械计算 α 或 CFA。」——为了让审稿人闭嘴而硬算一个数,是这一页最反对的做法。
- AI 给的判断也建议自己再核一遍。
常见问题
非量表问卷还需要做信效度吗?
选项题、二分题这类非量表题不需要。本文实测里,产品对五道非量表题的判定全部是"不适合"(花费那一条写的是"不适合直接做"),理由是它们不是共同测量同一个潜在心理构念的多道量表题。信度和效度检验只针对由多个 Likert 题项构成的潜变量量表开展。
这几道题都跟我的研究主题有关,能不能凑成一个量表算 α?
不能。产品的原话是「研究主题相关,不等于统计上属于同一个潜变量。」判断依据是这几道题是不是在量同一件看不见的东西,跟主题相不相关无关。硬算出来的 α 还会随着你给类别编号的方式变化,没有稳定的解释力。
二分变量(是/否)能不能算 Cronbach α?
本文实测里的判定是"不适合"。α 的前提是多道题共同反映同一个潜在概念、彼此有一定相关、删掉一道之后测的仍是同一构念的不同侧面。单独一道"是否接受过培训"不满足这个前提,它应该按"是/否"报频数和百分比,或者作为二分类自变量进后续分析。
审稿人要求补这几道题的信效度,我该怎么回?
本文正文给了产品输出的完整回复范例和一段方法部分简写版,两段都可以作为表述参考。但用之前要自己确认里面每一句跟你的问卷对不对得上——变量名、维度名、以及"后续确实把它们当分类/二分类/有序变量在用"这几件事。审稿人追问的是你这份研究的具体做法。
如果审稿人坚持要看"效度"证据呢?
产品给了五条内容效度层面的做法:内容合理性、专家评审、预测试、选项完整性、数据质量检查。它同时划清了边界——「这属于问卷设计和内容效度方面的说明,不等同于对这些分类变量计算 Cronbach α 或进行因子分析。」这五条只能写你研究过程中真做过的部分。
什么情况下这些题又需要做信效度?
当你把它们重新设计成多道 Likert 题、共同测量一个明确构念的时候。产品举的例子是把"组织支持"拆成四道 1~5 分题,这时候才可以做 α、CFA、CR 和 AVE。
先分清哪些题进信效度,再动手
数据去标识之后,可以登录 ChatSRS 开始分析。开跑之前先把问卷分成两堆:多道题共同量一个构念的进信效度那条线,剩下的选项题走频数、百分比和分类变量分析。分错了,后面那张表就是白算的。
相关文章推荐
本文演示数据为模拟问卷(产品读到 300 行 × 31 列),非真实论文数据。具体功能、数据处理规则和价格以当前产品页面与真实输出为准。