Appearance
用 Codex 分析数据并制作可视化
让 Codex 直接“分析这个 CSV”通常会很快得到几张图,但你不知道它怎样处理缺失值、重复记录、币种和时区。本页要求所有清洗和计算可重跑,图表能回到明确数据口径。
不会写代码怎样完成本章
数据量适中时,普通用户可以在 ChatGPT Work 中附加 Excel 或 CSV,先让它解释字段、缺失值和业务口径,再使用表格能力生成清洗后的工作簿、公式、透视表、图表和结论页。原始文件始终保留副本,不要求你亲自编写脚本。
下文的 scripts/、notebook 和可重跑代码属于需要严格复现、批量处理或团队交接时的技术增强方案。普通用户仍要做到:记录清洗规则、保留原始数据、检查公式、抽查结果,并且不把相关性写成因果。
第一次分析建议先学习 怎样检查 Excel 和数据文件。
第一步:把原始数据设为只读
目录:
text
analysis/
├── data/raw/
├── data/processed/
├── scripts/
├── notebooks/
├── figures/
├── reports/
└── README.md原始文件不覆盖,处理结果写 processed/。记录来源、下载日期、许可和校验值。
第二步:先做数据剖析
text
只读分析 data/raw/。输出 data-profile.md:
- 文件、行列数和编码;
- 字段类型与候选主键;
- 日期、时区、币种和单位;
- 缺失、重复、异常和无法解析值;
- 表之间可连接字段;
- 隐私和敏感字段;
- 需要业务确认的问题。
不要清洗或画图。业务口径问题先问人,例如退款按申请日还是完成日、收入含税还是不含税。
第三步:写数据字典和分析计划
data-dictionary.csv:字段、含义、单位、来源、允许值、缺失处理。
text
根据已确认口径写 analysis-plan.md。每个问题包含指标公式、分组、过滤、比较基线、预期图表和可能混杂因素。不要把相关性设计成因果结论。第四步:生成可重跑清洗脚本
text
在 scripts/ 中编写清洗脚本,把 raw 转换为 processed。要求:
- 不修改 raw;
- 每一步有明确函数;
- 输出处理前后行数;
- 对丢弃/修复记录生成质量报告;
- 日期、币种和单位转换可配置;
- 相同输入重复运行得到相同输出;
- 补最小测试。清洗规则不应只存在 notebook 单元格或聊天中。
第五步:做质量闸门
例如:
- 主键重复为 0;
- 必填字段缺失率低于明确阈值;
- 金额、数量不超出业务范围;
- Join 后未匹配比例可解释;
- 汇总金额与来源报表差异在允许范围;
- 行数变化有记录。
质量闸门失败时停止后续分析,而不是继续画图。
第六步:探索与验证分开
探索阶段可以用 notebook、多个 worktree 或可视化插件尝试不同方向;最终结论必须落回稳定脚本和固定数据集。
可以并行:
- 一个 worktree 研究缺失值和异常;
- 一个 worktree 比较图表与分组;
- 一个 worktree 检查模型或敏感性。
主任务统一口径和最终 pipeline,避免不同分支各用一套清洗方式。
第七步:制作可解释图表
每张图必须回答一个问题,并包含:
- 有结论的标题;
- 轴、单位、时间范围;
- 样本量或数据覆盖;
- 来源和口径;
- 不确定性或异常说明;
- 色彩和排序有含义。
提示:
text
为分析计划中的每个问题选择最简单有效的图表。不要默认使用 3D、双轴或过多小卡片。图表标题写出观察结论,脚注写数据范围和限制。第八步:进行反证和敏感性检查
- 改变时间窗口,结论是否稳定;
- 去除极端值,方向是否变化;
- 分组差异是否被样本结构解释;
- 缺失值处理是否改变结果;
- 相关变量是否只是共同受第三因素影响;
- 指标分母是否在变化。
模型结果还要检查训练/测试划分、泄漏、基线和适用范围。
第九步:交付报告和可运行说明
README.md 写清:
text
环境与依赖
输入文件放置位置
清洗命令
质量检查命令
分析/图表命令
输出位置
已知限制报告区分:数据事实、统计结果、解释、建议和未确认假设。
一个完整任务提示
text
分析 data/raw/ 中的订单、退款和广告数据,回答“毛利下降主要发生在哪些 SKU 和渠道”。
先完成数据剖析和口径问题,不要直接画图。确认后建立可重跑清洗脚本、质量报告、指标表、最多 5 张图和两页结论报告。
所有结果必须能从脚本复现;原始数据只读;真实用户字段要脱敏;不要把相关性写成因果。输出运行命令和未解决的数据问题。常见失败
图表先于口径
先做数据字典和质量报告。
notebook 能跑,别人不能跑
提取稳定脚本、依赖和 README,从干净环境重跑。
Join 造成数据膨胀
验证主键唯一性、Join 前后行数和未匹配比例。
漂亮图表掩盖不确定性
保留样本、范围、异常和敏感性结果。
完成门槛
- [ ] 原始数据只读且有来源记录。
- [ ] 数据字典和业务口径已确认。
- [ ] 清洗脚本可重复运行。
- [ ] 质量闸门通过。
- [ ] 图表可回到明确指标和 processed 数据。
- [ ] 结论通过敏感性/反证检查。
- [ ] 其他人能按 README 复现。