Appearance
用 Codex 处理 Word、Excel 和 PDF
办公文件任务不能停在“生成了一个文件”。Word 要检查分页和样式,Excel 要检查公式与口径,PDF 要检查逐页渲染和文本提取。本页用统一流程处理三类文件,并给出各自验收门槛。
先查看当前可用文件能力
普通用户打开 ChatGPT 桌面应用中的 Skills 或 Plugins 列表,查看是否提供 Documents、Spreadsheets、Presentations、PDF 或模板相关能力。也可以直接说明要生成 Word、Excel 或 PDF,让 Work 选择当前可用能力。
开发者需要从终端检查 Plugin 时,可以运行下面命令;普通用户可跳过:
bash
codex plugin list --available --json实际名称、版本和可用性以你的环境为准。没有对应文件能力时,先生成结构清楚的文本或 CSV,再使用 Word、Excel 或常用办公软件完成格式转换,不要从陌生网站安装来历不明的工具。
通用五步流程
- 盘点输入文件和可信来源;
- 先输出结构/数据映射;
- 生成目标文件;
- 用对应应用或渲染器检查;
- 对照源数据做一致性验证。
任务开场:
text
处理 input/ 中的文件,输出到 output/。先列出每个输入的格式、页数/工作表、日期和用途,不修改源文件。
所有数字、名称和结论必须能追溯到输入。遇到冲突或缺失时列出来,不要猜。生成后必须渲染或重新读取目标文件做一致性检查。Word:从资料生成可维护文档
假设要把会议记录和计划表整理为项目简报。
先确定文档结构
text
根据 meeting-notes.docx 和 plan.xlsx 设计一份 4-6 页项目简报结构。受众是项目赞助人。先输出标题层级、每节目的、需要引用的数据和待确认问题,不生成 docx。确认后生成:
text
使用 Documents 能力生成 output/project-brief.docx。
要求:
- 使用标题样式,不用手工加粗模拟标题;
- 决策、风险和下一步放在前两页;
- 表格可编辑,数字来自 plan.xlsx;
- 页眉页脚、页码和日期统一;
- 不写未出现在源文件中的承诺;
- 生成后渲染每一页检查分页、表格、孤行和文本溢出。Word 验收
- 目录和标题层级可导航;
- 段落、列表和表格样式统一;
- 没有空白页、孤立标题和被切断表格;
- 批注、修订和隐藏内容符合交付要求;
- 在 Word/兼容软件中打开无修复提示;
- 导出 PDF 后布局一致。
Excel:先保证口径,再追求图表
假设要制作月度销售模型。
先做数据字典
text
读取 sales.csv、refunds.csv 和 sku-map.xlsx。先输出字段字典、主键、日期/币种/时区、缺失值、重复值和无法关联记录。不要先做图表。生成可编辑工作簿
text
使用 Spreadsheets 能力生成 output/monthly-sales.xlsx。
工作表:
1. Raw_Sales:保留原始数据只读副本;
2. Raw_Refunds;
3. Clean:清洗和 SKU 映射;
4. Metrics:销售额、退款、净收入、订单、客单价;
5. Dashboard:趋势和异常;
6. Assumptions:口径和可修改参数。
要求:公式引用单元格/命名区域,不把假设写死;异常值有标记;所有图表能回到 Metrics;生成后重新计算并抽查公式。Excel 验收
- 原始数据未被覆盖;
- 主键、日期、币种和退款口径明确;
- 公式没有
#REF!、#VALUE!、循环引用; - 汇总与独立手算样本一致;
- 过滤、排序和新增行不会破坏公式;
- 图表标题、轴和单位完整;
- 使用真实 Excel/LibreOffice 打开并重算。
不要把“公式存在”当作“公式正确”。抽取 5-10 条记录手工核对。
PDF:区分读取、编辑和生成
PDF 可能是:
- 有文本层的正式文档;
- 扫描件,需要 OCR;
- 表格或图纸;
- 由 Word/PPT 导出的最终交付;
- 带表单、签名或受保护内容。
提取和比较
text
使用 PDF 能力比较 contract-v1.pdf 和 contract-v2.pdf。逐条列出文本、数字、日期和条款差异,标注页码。扫描/OCR 不确定内容标为低置信度。只做差异报告,不提供法律结论。生成 PDF
text
把 approved-report.docx 转为 output/report.pdf,并逐页渲染检查。确认页数、书签、链接、字体、图片清晰度和页边距。不要覆盖源 docx。PDF 验收
- 页数、纸张和方向正确;
- 搜索/复制文本符合预期;
- 扫描件 OCR 有抽样核对;
- 链接、书签和表单可用;
- 字体嵌入和图片清晰;
- 红线、批注、隐藏层和元数据经过检查;
- 涉及签名和法律文件时由专业人员复核。
从现有模板生成文件
如果有已批准的 .docx、.pptx 或 .xlsx 模板,优先使用 Template Creator 或对应文件 Skill 提取样式和结构。先制作一份样例,验证字体、页边距、母版、公式和占位符,再批量生成。
不要只凭截图重建复杂模板;原始文件能保留更多可编辑信息。
批量处理的安全策略
- 在副本目录运行;
- 先处理 3-5 个代表文件;
- 输出 manifest:输入、输出、状态、警告、校验值;
- 失败文件不覆盖原件;
- 对 OCR、公式和分页做抽样;
- 批量结果通过后再扩大范围。
常见失败
文档内容对,但分页很差
必须渲染成页面图片/PDF检查,而不是只读 DOCX XML 或文本。
Excel 看起来正常,但公式写死
检查公式栏、Assumptions 和新增数据后的更新行为。
PDF 提取漏字
判断是否扫描件、字体编码或多栏布局;使用 OCR 并保留置信度。
覆盖源文件
所有输出进入 output/,批量任务保留 manifest 和原件。
完成门槛
- [ ] 输入来源、口径和冲突已列出。
- [ ] 目标文件可在真实应用中打开。
- [ ] Word/PDF 已逐页渲染检查。
- [ ] Excel 公式和样本已独立核对。
- [ ] 原始文件未被覆盖。
- [ ] 未确认内容被明确标记。