描述统计表怎么写:N、均值、标准差与偏态检查
问卷与截面数据论文中,描述统计是第一张表。说明变量怎么选、均值/标准差/极值如何报告、何时补充中位数,并对照 Stata summarize 与 SchoolStore 描述统计工具。
描述统计在论文里的作用
审稿人与答辩老师通常会先看样本量、变量分布是否合理。描述统计不是「凑页数」,而是说明数据质量:Likert 题有没有越界、连续变量有没有极端值、分类变量编码是否一致。
管理学/心理学问卷论文常见做法:主变量(构念得分)、控制变量(年龄、性别、工龄等)分组报告;若变量量纲差异大,正文可说明「均分制 1–5」或「已标准化」,避免读者误读数量级。
连续变量报告什么
大样本、近似正态的连续变量:报告均值 M 与标准差 SD 即可。偏态明显(如收入、点击次数)或存在极端值时,可同时报告中位数 Mdn 与四分位距 IQR,并在方法部分说明是否 Winsorize 或取对数。
SchoolStore 描述统计工具对数值列给出 N、缺失、均值、样本标准差(ddof=1)、最小/最大与四分位数,与 Stata summarize 的常规输出一致。Stata:summarize varlist, detail 可看偏度与峰度(定稿建议在此复核)。
分类变量与控制变量
性别、行业、地区等分类变量应报告频数与百分比,而不是强行算均值。若已编码为 0/1(如 male=1),回归表可写「男性=1」,描述统计表仍建议还原为分类展示。
控制变量是否与主分析同表:有的期刊要求「表1 描述统计」含全部进入回归的变量;有的允许控制变量另表。以目标期刊近三期论文为准,全篇保持一致。
表注与常见写法
表注建议写:N(有效样本)、缺失处理方式(listwise/pairwise)、量表计分方式(题项均分/总分)。若有多组子样本,注明分组规则。
正文引用示例:「员工满意度均值为 3.62(SD=0.71),组织支持均值为 3.85(SD=0.68),均在 1–5 量表范围内。」避免只写「均值较高」而不给数值。
跑回归之前为什么要先看描述统计
描述统计能提前发现:标准差为 0(所有答卷相同)、某构念得分恒定、异常录入(如年龄 200)。这些问题在相关/回归阶段会以奇异矩阵或离谱系数形式爆发,排查成本更高。
推荐顺序:描述统计 → 相关矩阵 → 信度 → 量表得分(若尚未合成)→ VIF → 回归。数据在 SchoolStore 实证专区各工具间共享,描述统计确认无误后再进入后续步骤。