教程 ·

拟合指标全达标,区分效度却不满足:两个维度分不开怎么处理

十项拟合指标全部达标,Fornell-Larcker 那张表却没过。实测演示区分效度不足怎么识别、是哪道题把两个维度粘在一起、该怎么处理。演示数据 N=289。

拟合指标全达标,不等于几个维度在数据上已经分开了。 实测这份数据十项拟合指标全部落在可接受范围内,可 Fornell-Larcker 那一张表里,使用态度和使用意愿的相关高到 0.875,超过了两个维度各自 AVE 的平方根 0.827 和 0.820。产品自己把这件事挑明了:「因此,不能仅凭整体拟合指标良好就认为五个维度在数据上已经完全分开。」

这一页解决什么

这篇不讲验证性因子分析怎么跑,模型设定、估计方法、输出字段那些在CFA 怎么做:lavaan 因子载荷、CR、AVE 与拟合指标真实边界里已经写全,想先跑起来看结果的从那一篇开始

本文只解决一个局面:结果表上的拟合指标一片绿,唯独区分效度过不了,这时候该怎么读、怎么改、论文里该怎么写。

先把两个词说清楚。「潜变量」是问卷里量不到、只能靠好几道题一起推出来的那个东西,比如"使用态度"没法直接量,只能问四道题再合起来推。「区分效度」问的是两个潜变量在数据上分不分得开——受访者答这两组题的时候,到底是当成两件事还是一件事。

演示数据(不是真实论文数据,模拟问卷;因题项存在少量缺失,采用完整案例分析,最终纳入 289 个样本,产品原话是「占总样本的 96.3%」)。问卷是 20 道 1~5 分量表题,理论上分五个维度:PU 感知有用性、PEOU 感知易用性、SI 社会影响、ATT 使用态度、BI 使用意愿。

先确认一件事:拟合指标是真的全达标

十项指标,产品在"是否可接受"那一列全部写了"接受"。

指标类别指标名称适配标准检验结果是否可接受
绝对适配度参数GFI>0.80.934接受
AGFI>0.80.914接受
RMSEA<0.080.033接受
SRMR<0.100.038接受
增值适配度参数NFI>0.80.936接受
IFI>0.80.984接受
CFI>0.80.984接受
TLI>0.80.981接受
简约适配度参数χ²/df<31.311接受
PGFI>0.50.712接受

数据来源:ChatSRS 实测输出的五因子 CFA 模型拟合指标表,演示数据 N=289,非真实论文数据。

这些指标衡量的是"模型算出来的关系网,跟真实数据对不对得上",它们全绿,说明五个维度的整体框架撑得住。各家期刊用的临界值不完全一样,具体分歧见SEM 模型拟合指标临界值一览

ChatSRS 输出的五因子 CFA 模型拟合指标表,GFI、AGFI、RMSEA、SRMR、NFI、IFI、CFI、TLI、χ²/df、PGFI 十行的适配标准与检验结果并排 模型拟合指标表:三类指标共十行,"是否可接受"那一列整齐地全是"接受"——这正是最容易让人停下来不再往下看的一张表。

过不了的是这一张:Fornell-Larcker 矩阵

这张表的读法是:对角线上那个数(每个维度 AVE 的平方根),要比它同行同列的相关系数都大。 AVE 叫平均方差抽取量,粗略说就是"这个维度的几道题里,有多大一块信息真的属于这个维度"。开平方之后拿来跟相关系数比大小,是 Fornell-Larcker 准则的做法。

PUPEOUSIATTBI
PU0.789
PEOU0.3470.798
SI-0.007-0.0440.612
ATT0.5360.3020.0350.827
BI0.5950.2680.0290.8750.820

数据来源:ChatSRS 实测输出的区分效度(Fornell-Larcker 准则)表,演示数据 N=289,非真实论文数据。对角线加粗数字为 AVE 平方根,非对角线为因子间相关系数。

问题就在最后一行那个 0.875。 ATT 和 BI 的相关是 0.875,而 ATT 的 AVE 平方根只有 0.827、BI 只有 0.820。产品的判断是「在五因子 CFA 中,ATT 与 BI 的潜变量相关为 0.875。这一相关非常高,且超过了 ATT 的 AVE 平方根 0.827 和 BI 的 AVE 平方根 0.820,不满足 Fornell-Larcker 区分效度准则。」

翻成大白话:受访者在回答"我认不认可 AI 工具"和"我以后还用不用 AI 工具"的时候,给分给得几乎一模一样。

顺带说一句,两个维度各自的题目质量都过关。标准化载荷都不低,ATT 是 0.766~0.835、BI 是 0.774~0.823,BI 的 CR=0.891、AVE=0.672 都过线。产品的原话是「问题在于两个潜变量之间的相关过高,说明它们虽然各自内部一致,但彼此缺乏足够的区分。」

ChatSRS 输出的区分效度 Fornell-Larcker 矩阵表,对角线 AVE 平方根加粗,ATT 与 BI 相关 0.875 高于两侧对角线值 区分效度矩阵:五行五列,对角线是 AVE 平方根,最后一行 ATT 与 BI 那一格 0.875 高过了 0.827 和 0.820,这一格是全表唯一越界的地方。

它指认了哪道题:ATT4

产品没有停在"两个维度分不开"这个结论上,而是往回追到了具体题目。

它的判断是:ATT4“我愿意在以后的学习里一直用AI工具”这道题,已经从"我怎么看"变成了"我将来会不会做"。 原话写的是「ATT4“我愿意在以后的学习里一直用AI工具”已经直接表达了未来持续使用意愿,实际上更接近 BI;」,后面收口时又写「因此,ATT4 很可能是连接两个维度的关键题项。」

对照看 ATT 剩下的三道题——"是不是明智的选择""是不是持积极态度""喜不喜欢尝试"——问的都是评价和感受,只有第四道问到了未来的行为。而 BI 那四道题(继续使用、向同学推荐、扩展到更多场景、未来经常使用)问的全是未来行为。一道题跨到了对面那个维度的地盘上,两个维度就被它粘住了。

产品还补了一条环境因素:「与此同时,所有题目均采用相同的 1~5 分回答格式,也可能使受访者形成一种总体的 AI 接受倾向,从而同时在 ATT 和 BI 上给出相似评分。」

把五因子和四因子放一起比,拟合掉了多少

既然怀疑两个维度是一件事,那就直接把它们合成一个因子再跑一遍。

指标五因子模型ATT 与 BI 合并的四因子模型
CFI0.9840.959
TLI0.9810.953
RMSEA0.0330.051
SRMR0.0380.042
GFI0.9340.903
χ²/df1.3111.761

四因子(ATT 与 BI 合并)模型的十项拟合指标表,最后一列全为「接受」 合并模型那一次的完整拟合表。上面表格里四因子那一列的六个数,逐个都能在这张图里指出来——CFI 0.959、TLI 0.953、RMSEA 0.051、SRMR 0.042、GFI 0.903、χ²/df 1.761。

数据来源:ChatSRS 实测输出的两次 CFA 模型拟合指标表,演示数据 N=289,非真实论文数据。

合并之后所有指标仍在可接受范围里,但整体比五因子那一版差。产品的读法是「这说明数据并非完全否定 ATT 和 BI 的理论区分。更准确的判断是:五因子模型整体拟合更好,但 ATT 与 BI 的经验区分效度不足。」

所以这不是一个"合并就完事"的局面。 理论上该分开、数据上又分不干净,两边的证据都在,得同时报。

它主动交代了自己没做的那一步

这段是本页最值得抄走的一句,因为它决定了你论文里能写多硬的话:

「需要说明的是,目前输出没有提供五因子模型与四因子模型之间的卡方差异检验结果,因此不能据此报告严格的 Δχ² 显著性检验。现有结论主要依据潜变量相关、Fornell-Larcker 准则以及两个模型的拟合指标进行判断。」

Δχ² 检验(卡方差异检验)是拿两个嵌套模型的卡方值作差、看这个差值显不显著,它是"五因子显著优于四因子"这类断言的正规依据。这一步没做,那句断言就写不了。

没做的这一步被写出来了,比数字本身更值钱。 如果输出里只有一堆漂亮的拟合指标而没有这句话,很容易顺手把"五因子模型更好"写成一句有检验支撑的结论——而它没有检验支撑。

产品输出的两段解读原文:模型比较的启示,以及卡方差异检验未提供的说明 产品解读的两段连续原文:模型比较那段,以及紧接着的"目前输出没有提供……卡方差异检验结果"那段。下一节引的那句稳妥论文表述在同一次输出的更后面,不在这张图里。

拿到这个结果该怎么处理

产品给的处置顺序是:先改题,不要先合并维度。

局面产品给的处置
一道题跨到了对面维度ATT4「建议删除或改写,因为它和 BI 的持续使用意愿高度重叠」,改写方向回到态度评价,例如“总体而言,我认为使用 AI 工具辅助学习是一种好的做法”
改完题之后「但正式修改题目后需要重新收集数据,不能直接把现有答案当作新题目的答案。」
理论上必须区分两个维度「建议暂时保留两个维度,并在论文中报告:五因子模型整体拟合良好,但 ATT 与 BI 的区分效度未达到理想标准。」
想给出更硬的证据重新修订题项、重新收集数据,再比较修订后的五因子模型、合并的四因子模型、以及删除该题后的五因子模型,同时报告潜变量相关、AVE 平方根、HTMT 和拟合指标变化

数据来源:ChatSRS 实测输出的建议段落,演示数据 N=289,非真实论文数据;表中引号内为产品原话。

论文里那句话怎么落笔,产品也给了:「较稳妥的论文表述是:五因子模型整体拟合良好,但 ATT 与 BI 的潜变量相关较高,区分效度不足,需要通过优化态度题项和重新验证加以处理。」这句话怎么排进 APA 格式的效度表里,见效度分析 APA 7th 报告写法

什么情况下不适用

  • 这是模拟数据(N=289,非真实论文数据),上面任何结论都说明不了真实情况。
  • Fornell-Larcker 只是区分效度的判断方式之一,HTMT 是另一种;用哪个、报几个,得看期刊和导师的要求。
  • 本次输出没有卡方差异检验,所以"五因子显著优于四因子"这句话在本文范围内写不了。
  • 两个维度分不开时,先改题还是先合并,最终要回到理论上判断;统计只能告诉你它们在这份数据里没分开。
  • 改了题目就必须重新收数据,旧答案不能挪用。
  • AI 给的判断也建议自己再核一遍,尤其是维度该不该合并这种要写进理论章节的判断。

常见问题

拟合指标全部达标,是不是就说明模型没问题了?

不是。本文实测里十项拟合指标全部标注"接受",CFI=0.984、TLI=0.981、RMSEA=0.033、χ²/df=1.311,但 ATT 与 BI 的区分效度仍然没过。产品的原话是「不能仅凭整体拟合指标良好就认为五个维度在数据上已经完全分开」。拟合指标看的是整体框架,区分效度看的是维度之间分不分得开,两件事要分开查。

Fornell-Larcker 准则具体怎么判断?

拿每个维度 AVE 的平方根(表格对角线上那个数),跟这个维度和其他维度的相关系数比大小。对角线的数更大就算过。本文实测里 ATT 的 AVE 平方根是 0.827、BI 是 0.820,而两者相关是 0.875,比两个对角线值都大,所以没过。

两个维度的相关系数多高算过高?

本文只给实测这一例:相关 0.875,AVE 平方根 0.827 和 0.820。Fornell-Larcker 的判断标准是相对的——拿相关系数跟自己的 AVE 平方根比大小,并没有一个固定的绝对门槛。不同教材和期刊对"高相关"的绝对参考值说法不一致,这一条建议按导师和目标期刊的要求来。

区分效度不够,能不能直接把两个维度合并?

产品明确不建议先合并。它给的顺序是先回头改题——本文实测里指认的是 ATT4,因为这道题问的已经是未来行为而不是态度评价。如果理论上必须保留两个维度,产品建议保留并在论文里如实报告区分效度未达理想标准。

没有卡方差异检验,还能不能说五因子模型更好?

不能说成有检验支撑的结论。本文实测里产品主动交代「目前输出没有提供五因子模型与四因子模型之间的卡方差异检验结果,因此不能据此报告严格的 Δχ² 显著性检验」,现有结论依据的是潜变量相关、Fornell-Larcker 准则和两个模型的拟合指标。可以写"五因子模型整体拟合更好",不能写"显著优于"。

按这个顺序读一遍你自己的 CFA 结果

数据去标识之后,可以登录 ChatSRS 开始分析。拿到 CFA 结果后,先看拟合指标那张表,再单独翻到区分效度那张表逐格对一遍对角线,最后专门找一句:输出里有没有交代哪一步没做。

相关文章推荐


本文演示数据为模拟问卷(完整案例分析后纳入 289 个样本),非真实论文数据。具体功能、数据处理规则和价格以当前产品页面与真实输出为准。