教程 ·
问卷数据清洗怎么做?310 份问卷剔到291份,出样本表前AI先查了什么
问卷回收后、出样本表之前的清洗环节:重复提交、直线作答、漏答、题项越界怎么判定,AI一次查出该剔的19份,演示数据从310份到291份的完整剔除标准与账目,可用率93.87%。
问卷回收回来,第一关不是分析,是这批数据到底能不能用——AI 说清剔除标准,一次查完能出样本表。
这一页解决什么
问卷收回来,第一关从来不是分析,是这批数据到底能不能用。有人点了两次提交,有人二十道题从头到尾全填同一个选项,有人漏答,还有录入时手滑把 1–5 分打成了 0 或 9。这些一份份翻着找,一晚上就没了;翻漏了更麻烦——后面所有描述统计、频数分析都建在一堆脏数据上,样本表里的 N 从一开始就是错的。
这篇只讲清洗这一段:310 份问卷进去,AI 按什么标准查、查出什么、最后剩多少份能进样本表。字段怎么选、描述统计和频数分析具体输出哪些项,《描述统计与频数分析怎么做》那一篇已经讲清楚了,这里不重复——本文只讲跑分析之前的那一步。
用的是演示数据(不是真实论文数据,模拟问卷,原始回收 310 份、27 个字段:性别、年级、专业类别、使用频率分组、是否接受过 AI 工具培训、每周使用 AI 工具的小时数,加上五个维度共 20 道量表题)。
怎么查:一句话说清楚要查什么
在 ChatSRS 里把 Excel 传上去,不用先弄懂"直线作答""缺失值处理"这些名词该怎么对应到下拉框,一句话说清楚要查什么就行。
ChatSRS 中文界面全景:数据文件区能看到已上传的模拟问卷文件,310 行 × 27 列,27 个变量的类型(数值/分类/布尔)已经识别好。
实际打的那句话,一个统计名词都没有:「我刚回收了一批问卷数据,想先确认哪些是能用的。帮我做数据质量检查:有没有重复提交的、有没有从头到尾都填同一个选项的、有没有漏答的、有没有填出范围的数字、有没有明显不合常理的极端值。告诉我该剔除哪些、剩下多少份能用。」——"从头到尾都填同一个选项"学名叫直线作答,指的是敷衍作答的那种问卷;"填出范围"指的是 1–5 分的题里冒出 0 或 9 这种不可能的值。
用户指令原样保留:五类问题一句话说全;AI 紧接着返回按检查项目 / 发现情况 / 建议处理三列排好的数据质量检查表。
清洗结果:AI 查出的问题与剔除标准
它一项一项查完,把结果排成了一张表,每一类都写明了具体是哪几个编号:
| 检查项目 | 发现情况 | 建议处理 |
|---|---|---|
| 重复提交 | 3 组完全重复记录,涉及编号 123、59、162 | 每组保留 1 份,剔除后提交的 3 份 |
| 直线作答(从头到尾填同一选项) | 5 份,编号 301、302、303、304、305 | 剔除 |
| 漏答 | 8 份,编号 276、200、24、66、244、125、57、43 | 剔除 |
| 题项超出 1–5 分范围 | 3 份,编号 29、286、252 | 剔除 |
越界那三份它连是哪道题都点出来了——「编号 29、286、252 的具体异常分别是:ATT1=0、BI3=0、PEOU3=9。」
那笔账:310 到 291 是怎么算出来的
四类问题合起来,剔除的份数不是简单相加——它专门交代了一句「这些问题之间没有实质重叠,因此共剔除 19 份。」意思是这 19 份没有重复计算,不是把同一份问卷数了两遍。
ChatSRS 给出的最终账目:原始问卷 310 份,明确剔除 19 份,初步可用 291 份,可用率 93.87%。
| 指标 | 数值 |
|---|---|
| 原始问卷 | 310 份 |
| 明确剔除 | 19 份 |
| 初步可用问卷 | 291 份 |
| 可用率 | 93.87% |
有一类它没有替你做主:极端值
这里有件事值得单独说一句:不是所有异常都直接剔。另有 9 份问卷的每周使用时长明显偏高,它把编号列出来,给的处理意见是「建议人工复核,不宜仅凭统计异常自动剔除」。
编号 306 填的是 168 小时/周,它的判断是「等于一周全部时间,明显需要核实,建议剔除或确认是否误填」;其余几份数值在 29.2–44.2 小时之间,它给的是另一种判断:「虽然偏高,但对于高频使用者并非绝对不可能,暂不建议直接删除」。该剔的直接剔,该你自己拿主意的它交回给你——这个分寸比多剔几份更有用。
剔完之后的样本表长什么样
清洗做完,接着才是样本情况这一节该出的表。注意这张表的百分比分母是 291,不是 310——因为算的是清洗后的样本,没有回头用原始数据。
清洗后跑出的频数表:性别、专业类别、使用频率分组等分类变量的频数与百分比,分母统一是 291。
| 变量 | 选项 | 频数 | 百分比 |
|---|---|---|---|
| 性别 | 女 | 173 | 59.45% |
| 性别 | 男 | 118 | 40.55% |
| 专业类别 | 理工类 | 88 | 30.24% |
| 使用频率分组 | 高频 | 112 | 38.49% |
字段具体怎么选、描述统计和频数分析各自输出哪些项、两种缺失口径怎么区分,这篇讲得更细。
清洗这一步的完整流程回顾:五类问题各查什么、剔了多少、最后剩下的样本量。
什么情况下不适用
- 这次演示的剔除标准是重复提交、直线作答、漏答、题项越界四类;具体研究如果还有别的质检规则(比如答题时长过短、IP 重复),需要自己另外加。
- 剔除标准是要写进论文方法部分的,不能只在心里过一遍;剔了哪几类、各多少份、判定依据是什么,都要交代清楚。
- AI 给的剔除建议建议自己再核一遍,尤其是"偏高但不是不可能"这种需要人工复核的情况,不能全部交给自动化判断。
- 本文演示数据为模拟问卷,不是真实论文数据,具体剔除结果不能套用到别的数据集。
常见问题
问卷数据清洗和描述性统计是一回事吗?
不是。清洗是判断哪些问卷能进样本表,解决的是"数据能不能用";描述性统计是拿到干净数据之后算均值、标准差、频数这些指标,解决的是"数据长什么样"。清洗必须在描述统计之前做,顺序反了,算出来的均值和百分比分母都是错的。
直线作答一定要剔除吗?
从头到尾都填同一个选项,通常意味着受访者没有认真作答,这类问卷保留下来会拉低数据质量,一般建议剔除。但具体标准(比如是否要区分"部分题项连续同值"和"全部题项同值")要结合研究设计和导师要求确定。
剔除之后样本量变小,会不会影响论文效度?
剔除是为了保证留下来的数据是认真作答、没有录入错误的,这是保证数据质量的必要步骤,不是"凑数据"。剔除标准写清楚、剔除比例合理(本文演示剔除率约 6.13%),审稿人和导师通常能接受。
AI 给出的剔除建议能直接照抄进论文方法部分吗?
数字本身(该剔哪几份、剩多少份)是真实输出,可以作为方法部分的数据来源;但方法部分的措辞、是否需要补充统计检验依据,还是要自己核对一遍,尤其是那些标为"建议人工复核"而不是"建议剔除"的样本,不能直接当成已经剔除处理。
开始你的第一次问卷数据清洗
问卷刚回收回来,还没想好该按什么标准查?把 Excel 传上去,一句话说清楚要查重复、查直线作答、查漏答、查越界,剩下的交给 AI 排表,可以登录 ChatSRS 开始分析。清洗结果建议逐项核对后再写进论文方法部分。
相关文章推荐
本文演示数据为模拟问卷(原始回收 310 份,清洗后有效样本 291 份,性别、年级、专业类别、使用频率分组、是否接受过 AI 工具培训、每周使用 AI 工具的小时数,加上五个维度共 20 道量表题),非真实论文数据。具体功能、数据处理规则和价格以当前产品页面与真实输出为准。