教程 ·

问卷数据清洗怎么做?310 份问卷剔到291份,出样本表前AI先查了什么

问卷回收后、出样本表之前的清洗环节:重复提交、直线作答、漏答、题项越界怎么判定,AI一次查出该剔的19份,演示数据从310份到291份的完整剔除标准与账目,可用率93.87%。

问卷回收回来,第一关不是分析,是这批数据到底能不能用——AI 说清剔除标准,一次查完能出样本表。

这一页解决什么

问卷收回来,第一关从来不是分析,是这批数据到底能不能用。有人点了两次提交,有人二十道题从头到尾全填同一个选项,有人漏答,还有录入时手滑把 1–5 分打成了 0 或 9。这些一份份翻着找,一晚上就没了;翻漏了更麻烦——后面所有描述统计、频数分析都建在一堆脏数据上,样本表里的 N 从一开始就是错的。

这篇只讲清洗这一段:310 份问卷进去,AI 按什么标准查、查出什么、最后剩多少份能进样本表。字段怎么选、描述统计和频数分析具体输出哪些项,《描述统计与频数分析怎么做》那一篇已经讲清楚了,这里不重复——本文只讲跑分析之前的那一步。

用的是演示数据(不是真实论文数据,模拟问卷,原始回收 310 份、27 个字段:性别、年级、专业类别、使用频率分组、是否接受过 AI 工具培训、每周使用 AI 工具的小时数,加上五个维度共 20 道量表题)。

怎么查:一句话说清楚要查什么

在 ChatSRS 里把 Excel 传上去,不用先弄懂"直线作答""缺失值处理"这些名词该怎么对应到下拉框,一句话说清楚要查什么就行。

ChatSRS 中文界面全景,数据文件区显示模拟数据-第3批.xlsx,310 行 x 27 列 ChatSRS 中文界面全景:数据文件区能看到已上传的模拟问卷文件,310 行 × 27 列,27 个变量的类型(数值/分类/布尔)已经识别好。

实际打的那句话,一个统计名词都没有:「我刚回收了一批问卷数据,想先确认哪些是能用的。帮我做数据质量检查:有没有重复提交的、有没有从头到尾都填同一个选项的、有没有漏答的、有没有填出范围的数字、有没有明显不合常理的极端值。告诉我该剔除哪些、剩下多少份能用。」——"从头到尾都填同一个选项"学名叫直线作答,指的是敷衍作答的那种问卷;"填出范围"指的是 1–5 分的题里冒出 0 或 9 这种不可能的值。

用户输入的中文指令气泡与AI返回的数据质量检查表,检查项目/发现情况/建议处理三列 用户指令原样保留:五类问题一句话说全;AI 紧接着返回按检查项目 / 发现情况 / 建议处理三列排好的数据质量检查表。

清洗结果:AI 查出的问题与剔除标准

它一项一项查完,把结果排成了一张表,每一类都写明了具体是哪几个编号:

检查项目发现情况建议处理
重复提交3 组完全重复记录,涉及编号 123、59、162每组保留 1 份,剔除后提交的 3 份
直线作答(从头到尾填同一选项)5 份,编号 301、302、303、304、305剔除
漏答8 份,编号 276、200、24、66、244、125、57、43剔除
题项超出 1–5 分范围3 份,编号 29、286、252剔除

越界那三份它连是哪道题都点出来了——「编号 29、286、252 的具体异常分别是:ATT1=0、BI3=0、PEOU3=9。」

那笔账:310 到 291 是怎么算出来的

四类问题合起来,剔除的份数不是简单相加——它专门交代了一句「这些问题之间没有实质重叠,因此共剔除 19 份。」意思是这 19 份没有重复计算,不是把同一份问卷数了两遍。

ChatSRS返回的剔除结论,原始问卷310份、明确剔除19份、初步可用291份、可用率93.87% ChatSRS 给出的最终账目:原始问卷 310 份,明确剔除 19 份,初步可用 291 份,可用率 93.87%。

指标数值
原始问卷310 份
明确剔除19 份
初步可用问卷291 份
可用率93.87%

有一类它没有替你做主:极端值

这里有件事值得单独说一句:不是所有异常都直接剔。另有 9 份问卷的每周使用时长明显偏高,它把编号列出来,给的处理意见是「建议人工复核,不宜仅凭统计异常自动剔除」。

编号 306 填的是 168 小时/周,它的判断是「等于一周全部时间,明显需要核实,建议剔除或确认是否误填」;其余几份数值在 29.2–44.2 小时之间,它给的是另一种判断:「虽然偏高,但对于高频使用者并非绝对不可能,暂不建议直接删除」。该剔的直接剔,该你自己拿主意的它交回给你——这个分寸比多剔几份更有用。

剔完之后的样本表长什么样

清洗做完,接着才是样本情况这一节该出的表。注意这张表的百分比分母是 291,不是 310——因为算的是清洗后的样本,没有回头用原始数据。

ChatSRS返回的频数分析表,变量/选项/频数/百分比/累积百分比五列,底数为291 清洗后跑出的频数表:性别、专业类别、使用频率分组等分类变量的频数与百分比,分母统一是 291。

变量选项频数百分比
性别17359.45%
性别11840.55%
专业类别理工类8830.24%
使用频率分组高频11238.49%

字段具体怎么选、描述统计和频数分析各自输出哪些项、两种缺失口径怎么区分,这篇讲得更细

信息图:五类问题各一行,加上310/19/291/93.87%的剔除账目 清洗这一步的完整流程回顾:五类问题各查什么、剔了多少、最后剩下的样本量。

什么情况下不适用

  • 这次演示的剔除标准是重复提交、直线作答、漏答、题项越界四类;具体研究如果还有别的质检规则(比如答题时长过短、IP 重复),需要自己另外加。
  • 剔除标准是要写进论文方法部分的,不能只在心里过一遍;剔了哪几类、各多少份、判定依据是什么,都要交代清楚。
  • AI 给的剔除建议建议自己再核一遍,尤其是"偏高但不是不可能"这种需要人工复核的情况,不能全部交给自动化判断。
  • 本文演示数据为模拟问卷,不是真实论文数据,具体剔除结果不能套用到别的数据集。

常见问题

问卷数据清洗和描述性统计是一回事吗?

不是。清洗是判断哪些问卷能进样本表,解决的是"数据能不能用";描述性统计是拿到干净数据之后算均值、标准差、频数这些指标,解决的是"数据长什么样"。清洗必须在描述统计之前做,顺序反了,算出来的均值和百分比分母都是错的。

直线作答一定要剔除吗?

从头到尾都填同一个选项,通常意味着受访者没有认真作答,这类问卷保留下来会拉低数据质量,一般建议剔除。但具体标准(比如是否要区分"部分题项连续同值"和"全部题项同值")要结合研究设计和导师要求确定。

剔除之后样本量变小,会不会影响论文效度?

剔除是为了保证留下来的数据是认真作答、没有录入错误的,这是保证数据质量的必要步骤,不是"凑数据"。剔除标准写清楚、剔除比例合理(本文演示剔除率约 6.13%),审稿人和导师通常能接受。

AI 给出的剔除建议能直接照抄进论文方法部分吗?

数字本身(该剔哪几份、剩多少份)是真实输出,可以作为方法部分的数据来源;但方法部分的措辞、是否需要补充统计检验依据,还是要自己核对一遍,尤其是那些标为"建议人工复核"而不是"建议剔除"的样本,不能直接当成已经剔除处理。

开始你的第一次问卷数据清洗

问卷刚回收回来,还没想好该按什么标准查?把 Excel 传上去,一句话说清楚要查重复、查直线作答、查漏答、查越界,剩下的交给 AI 排表,可以登录 ChatSRS 开始分析。清洗结果建议逐项核对后再写进论文方法部分。

相关文章推荐


本文演示数据为模拟问卷(原始回收 310 份,清洗后有效样本 291 份,性别、年级、专业类别、使用频率分组、是否接受过 AI 工具培训、每周使用 AI 工具的小时数,加上五个维度共 20 道量表题),非真实论文数据。具体功能、数据处理规则和价格以当前产品页面与真实输出为准。