Claude Code 官方内置 PDF 全能技能:覆盖文本/表格/图片提取、合并拆分、旋转水印、加密 OCR 与 PDF 生成,并通过 8 个配套脚本把最易错的表单填充编排成「探测→结构提取→视觉精修→校验→填充→回读验证」的工程化流水线。
仓库:anthropics/skills
热度证据:同上,官方文档技能三件套;官方 anthropics/skills 仓库 168,637 star,Claude Code 内置核心技能之一,全网被教程引用最多;五库分析第5章推荐安装 document-skills(pdf/xlsx/do
五维评分
热度5/5
质量5/5
创新4/5
易用4/5
文档5/5
优秀点拆解
- 任务→工具→代码速查表:SKILL.md 用 Quick Reference 表格为 8 类任务直接指定最佳工具和可复制代码,把 agent 选工具的决策成本降为零
- 表单填充三层精度策略:结构解析(Approach A)优先、视觉估计(Approach B)兜底、混合场景按公式换算统一坐标系,是成本与精度权衡的成熟设计
- 强制校验闭环:check_bounding_boxes.py 检测框相交与框高不足,fill_fillable_fields.py 校验字段ID/页码/取值合法性并 exit(1),填充后强制转图回读验证,三重拦截挡住填错表单
- 把多模态看图编排成显式步骤:convert_pdf_to_images(200dpi限1000px控制成本)+ ImageMagick zoom crop 精修 + 坐标换算公式,视觉能力接入点清晰可控
- 三层文档按需加载(SKILL/FORMS/REFERENCE):主指南30秒扫完、专精流程强制顺序、高级用法与排障沉底,控制 agent 上下文占用
- 踩坑知识固化:reportlab Unicode 上下标渲染黑块须用 <sub>/<super> 标签等硬规则直接写进文档
可复用的设计模式
- 探测脚本先行+分支路由:第一步跑 check_fillable_fields 这类便宜的分类脚本,按结果决定进入哪条流程,避免 agent 盲猜
- JSON 文件即契约:脚本间用固定 schema 的 JSON 传递数据(field_info/field_values/fields.json),schema 同时充当文档与校验依据
- 机器精度优先、模型视觉兜底、公式换算统一坐标系:能结构化的先结构化,视觉只补缺口,最终收敛到单一坐标系统
- 失败信息即修正指令:脚本输出带具体数值与修正方向的 FAILURE 消息(上限20条防刷屏),把纠错对话标准化成输出格式
适用场景
PDF 文本/表格/图片批量提取与扫描件 OCRPDF 合并、拆分、旋转、加水印、加密/解密、损坏修复用 reportlab 生成多页报表 PDF可填 PDF 表单批量填充(含 checkbox/radio/下拉选项合法性校验)扫描件/手写表单按视觉坐标填充并回读验证
边界与注意:依赖 poppler-utils/qpdf/pdftk/ImageMagick/pytesseract 等系统级工具链,新环境需先装齐;非可填表单的填充是叠加 FreeText 注释而非写入表单字段,二次编辑可能不认;复杂扫描件仍依赖模型视觉精度;reportlab 内置字体不含中文与上下标字形,中文 PDF 需额外注册字体;skill 为 Proprietary 许可。
完整拆解分析文档
本页为摘要版,完整精读分析(核心机制、逐条优秀点拆解、写作过程)见本地 Markdown 文档:
analysis/anthropics-pdf.md