文档转换与文件处理 Skill 查看原始 SKILL.md

准备交给 Coding Agent 执行?先阅读 AI 接入指南,确认接口契约与调用边界。

文档转换与文件处理 Skill

面向 PDF、Word、HTML、Markdown、PPT 与图片转换、拆分、识别和内容归档的公开 API 组合。

业务场景

用于文档自动化、内容归档、合同处理、报告生成和格式转换。适合把 PDF、Word、HTML、Markdown、PPT、图片和 OCR 相关接口组合成文档采集、转换、拆分和整理链路。

  • 数据范围:覆盖 URL/HTML/Markdown/PDF/Word/PPT/图片相关转换、PDF 拆分、文档摘要、OCR、图片压缩和文档内容整理。
  • 关键数据维度:文件维度:文件类型、页数、大小、来源 URL、转换目标和输出格式。;内容维度:正文、标题、段落、表格、图片、OCR 结果和摘要。;处理维度:转换、拆分、压缩、识别、提取和归档。

何时使用

  • 把网页、PDF、Word、Markdown、HTML 或图片转换为业务需要的格式。
  • 拆分、压缩、识别或整理文档,方便归档和后续处理。
  • 为报告生成、资料入库、合同流转和内容发布准备文档数据。

不适用场景

  • 用户只需要查看某一个接口的完整参数、响应字段、价格或购买入口时,直接打开接口详情页。
  • 用户希望绕过接口开通、鉴权、配额或人工复核要求时,不应使用 Skill 作为替代。
  • 任务需要法律、医疗、金融投资或升学录取的最终决策时,Skill 只能提供数据辅助和复核线索。

用户需要提供的信息

  • 原始文件、URL 或 HTML 内容,以及目标格式、页码范围、文件大小和输出用途。
  • 是否需要 OCR、摘要、拆分、压缩、转换或归档。
  • 调用接口所需的 AppKey、开通状态和接口详情页限制。

推荐工作流

  1. 先按输入格式选择解析或转换接口。
  2. 再根据结果输出 PDF、Word、HTML、图片或纯文本。
  3. 需要分段处理时,先拆分 PDF 或转换成中间格式。

参数传递关系

  • 文件 URL、上传结果或 HTML 内容先进入转换接口,转换后的文本或文件地址再进入摘要、OCR、拆分或归档步骤。
  • 拆分和转换任务需要保留页码范围、目标格式和原文件名。
  • OCR 结果可继续传给文本处理 Skill 做摘要、纠错或结构化。

典型任务模板

  • 格式转换:输入文件或 URL、目标格式;输出转换结果、失败原因和文件链接。
  • 文档拆分:输入 PDF、页码范围;输出拆分文件和页码映射。
  • 扫描件整理:输入图片或 PDF;输出 OCR 文本、摘要和人工复核项。

接口与关键参数

统一鉴权:调用接口前需要准备咕咕数据 AppKey。AppKey 应从环境变量或凭据管理系统注入,不要写入 SKILL.md、代码仓库、URL、日志或对话正文。推荐在服务端通过 Header 传递 AppKey;历史 Query 参数 appkey 仍以接口详情页说明为准。

HTML/URL 转 PDF

关键请求参数:

参数必填类型默认值说明来源与传递
type是stringYOUR_VALUE可选参数为 HTML 或 URL(注意,当类型为 URL 时,需要保证页面可以正常请求,我们的接口不解决加密页面、反爬虫页面等不能正常返回 HTML 的页面请求)由用户输入、业务筛选条件或上一轮接口结果确定。
content是stringYOUR_VALUE内容正文,如果 type=HTML,那么传递 HTML 内容;如果 type=URL,那么传递需要存储为 PDF 的站点 URL 即可文本内容来自用户输入、网页正文抽取或文档识别结果
landscape否integer0控制生成 PDF 是否为横向页面模式,传递 1 控制页面横向渲染模式,默认为 0由用户输入、业务筛选条件或上一轮接口结果确定。
showpages否integer0控制生成的 PDF 是否在页脚包含页码信息,传递 1 控制页脚生成页码,默认为 0由用户输入、业务筛选条件或上一轮接口结果确定。
filename否stringN/A可选参数,控制生成的文件名称,不需要后缀文件或图片来自用户上传、公开 URL 或上一轮转换结果
storage否stringpublic文件存储方式,可选 public 或 private。默认 public 返回公开下载地址;private 存入私有存储,返回 file_id,需生成短期下载链接后下载。由用户输入、业务筛选条件或上一轮接口结果确定。

HTML 转 Word

关键请求参数:

参数必填类型默认值说明来源与传递
type是stringYOUR_APPKEY可选参数为 HTML 或 URL(注意,当类型为 URL 时,需要保证页面可以正常请求,我们的接口不解决加密页面、反爬虫页面等不能正常返回 HTML 的页面请求)由用户输入、业务筛选条件或上一轮接口结果确定。
content是stringYOUR_VALUE内容正文,如果 type=HTML,那么传递 HTML 内容;如果 type=URL,那么传递需要存储为 Word 的站点 URL 即可文本内容来自用户输入、网页正文抽取或文档识别结果
filename否stringN/A可选参数,控制生成的文件名称,不需要后缀文件或图片来自用户上传、公开 URL 或上一轮转换结果
storage否stringpublic文件存储方式,可选 public 或 private。默认 public 返回公开下载地址;private 存入私有存储,返回 file_id,需生成短期下载链接后下载。由用户输入、业务筛选条件或上一轮接口结果确定。

Markdown 转 PDF

关键请求参数:

参数必填类型默认值说明来源与传递
content是stringYOUR_VALUEMarkdown 内容文本内容来自用户输入、网页正文抽取或文档识别结果
storage否stringpublic文件存储方式,可选 public 或 private。默认 public 返回公开下载地址;private 存入私有存储,返回 file_id,需生成短期下载链接后下载。由用户输入、业务筛选条件或上一轮接口结果确定。

Word 转 HTML

关键请求参数:

参数必填类型默认值说明来源与传递
file是string/binary-Word 文档文件,支持 .doc 和 .docx 格式文件或图片来自用户上传、公开 URL 或上一轮转换结果
storage否stringpublic文件存储方式,可选 public 或 private。默认 public 返回公开下载地址;private 存入私有存储,返回 file_id,需生成短期下载链接后下载。由用户输入、业务筛选条件或上一轮接口结果确定。

PDF 解析格式化输出

关键请求参数:

参数必填类型默认值说明来源与传递
type是stringYOUR_VALUE定义输出格式,可选 text|html|xml|tag由用户输入、业务筛选条件或上一轮接口结果确定。
pdffile是string/binaryYOUR_VALUE文件格式参数,待转换的 PDF 文件文件或图片来自用户上传、公开 URL 或上一轮转换结果

PDF 转 HTML

关键请求参数:

参数必填类型默认值说明来源与传递
file是string/binary-multipart 单个 PDF 文件;最大 20 MiB、100 页,不支持加密和扫描型 PDF。文件或图片来自用户上传、公开 URL 或上一轮转换结果
storage否stringpublicpublic 返回 HTML 地址;private 返回既有文件引用。支持表单或 Query,同值允许,冲突拒绝。由用户输入、业务筛选条件或上一轮接口结果确定。

通用 PDF 文件流 OCR 到文本

关键请求参数:

参数必填类型默认值说明来源与传递
pdffile是string/binary-multipart 单个未加密 PDF;20 MiB、20 页。APPKEY 可通过 Query、multipart appkey、AppKey/X-GUGUDATA-APPKEY/X-API-Key 请求头或 Bearer 传递;同值允许,冲突返回 501。文件或图片来自用户上传、公开 URL 或上一轮转换结果

通用 PDF 文件流 OCR 到 Word

关键请求参数:

参数必填类型默认值说明来源与传递
pdffile是string/binaryN/Aformdata 文件流文件或图片来自用户上传、公开 URL 或上一轮转换结果
storage否stringpublic文件存储方式,可选 public 或 private。默认 public 返回公开下载地址;private 存入私有存储,返回 file_id,需生成短期下载链接后下载。由用户输入、业务筛选条件或上一轮接口结果确定。

PDF 分割拆分

关键请求参数:

参数必填类型默认值说明来源与传递
file是string/binaryYOUR_FILE恰好一个 PDF;最大 50 MiB、500 页,不支持加密文件。文件或图片来自用户上传、公开 URL 或上一轮转换结果
pageSize否integer10每份 1~100 页,默认 10;拆分 PDF 不超过 100 个,ZIP 同样适用。分页参数由调用方控制,用于分批读取结果
isZip否booleanfalse布尔值,默认 false;true 时交付一个包含全部拆分 PDF 的 ZIP。由用户输入、业务筛选条件或上一轮接口结果确定。
storage否stringpublicpublic 返回下载地址数组;private 返回既有文件信息数组。由用户输入、业务筛选条件或上一轮接口结果确定。

PPT 转高精度 PDF

关键请求参数:

参数必填类型默认值说明来源与传递
file是string/binary-PPT 文件,支持 .ppt 和 .pptx 格式文件或图片来自用户上传、公开 URL 或上一轮转换结果
storage否stringpublic文件存储方式,可选 public 或 private。默认 public 返回公开下载地址;private 存入私有存储,返回 file_id,需生成短期下载链接后下载。由用户输入、业务筛选条件或上一轮接口结果确定。

PPT 转高精度图片

关键请求参数:

参数必填类型默认值说明来源与传递
file是string/binary-PPT 文件,支持 .ppt 和 .pptx 格式文件或图片来自用户上传、公开 URL 或上一轮转换结果
url否string-不传递 PPT 文件流,可直接传递可访问的 PPT 文件地址URL 或域名由用户提供,调用前需要确认协议、跳转和可访问性
scale_factor否number1图片导出缩放因子,默认为 1,最大为 4 倍高清模式由用户输入、业务筛选条件或上一轮接口结果确定。
storage否stringpublic文件存储方式,可选 public 或 private。默认 public 返回公开下载地址;private 存入私有存储,返回 file_id,需生成短期下载链接后下载。由用户输入、业务筛选条件或上一轮接口结果确定。

通用图片文件流 OCR 到文本

关键请求参数:

参数必填类型默认值说明来源与传递
imagefile是string/binary-图片文件,支持 JPEG、PNG、GIF、BMP 与 TIFF,最大 20 MiB;单边不超过 12000 像素,总像素不超过 4000 万。文件或图片来自用户上传、公开 URL 或上一轮转换结果

通用图片地址 OCR 到文本

  • 业务角色:图片地址 OCR
  • 调用阶段:识别输入
  • 接口地址:POST https://api.gugudata.com/imagerecognition/ocr
  • 产出用途:用于通用图片地址 OCR 到文本。
  • 参数来源:URL 或域名由用户提供,调用前需要确认协议、跳转和可访问性;文件或图片来自用户上传、公开 URL 或上一轮转换结果
  • 接口资料:详情页 https://www.gugudata.com/api/details/ocr;接口 Markdown https://www.gugudata.com/api/details/ocr/llm.md

关键请求参数:

参数必填类型默认值说明来源与传递
imageurl否stringYOUR_VALUE图片 URL 地址,与图标 Base64 编码选其一进行传参URL 或域名由用户提供,调用前需要确认协议、跳转和可访问性
imagebase64否stringYOUR_VALUE图片 Base64 编码,与图标 URL 地址选其一进行传参文件或图片来自用户上传、公开 URL 或上一轮转换结果

图片 OCR 转 Word

  • 业务角色:图片 OCR 到 Word
  • 调用阶段:转换输出
  • 接口地址:POST https://api.gugudata.com/imagerecognition/ocr2word
  • 产出用途:用于图片地址 OCR 到 Word。
  • 参数来源:语言参数来自用户指定的源语言、目标语言或语种检测结果;URL 或域名由用户提供,调用前需要确认协议、跳转和可访问性;文件或图片来自用户上传、公开 URL 或上一轮转换结果
  • 接口资料:详情页 https://www.gugudata.com/api/details/ocr2word;接口 Markdown https://www.gugudata.com/api/details/ocr2word/llm.md

关键请求参数:

参数必填类型默认值说明来源与传递
language否stringauto识别语言,可选 auto、zh-cn、zh-tw、en、ja、ko、fr、de。语言参数来自用户指定的源语言、目标语言或语种检测结果
imageurl否stringYOUR_VALUE公开可访问的 HTTPS 图片地址,与 imagebase64 必须且只能提供一个。URL 或域名由用户提供,调用前需要确认协议、跳转和可访问性
imagebase64否stringYOUR_VALUE图片 Base64 编码或图片 Data URI,与 imageurl 必须且只能提供一个。文件或图片来自用户上传、公开 URL 或上一轮转换结果
storage否stringpublic文件交付方式,可选 public 或 private。由用户输入、业务筛选条件或上一轮接口结果确定。
fileName否stringocr-result.docx输出文件名,最长 80 个字符,文件格式固定为 DOCX。文件或图片来自用户上传、公开 URL 或上一轮转换结果

图片压缩与尺寸优化

关键请求参数:

参数必填类型默认值说明来源与传递
image_file否string/binary-本地图片文件,最大 10 MiB;与 image_url 二选一。文件或图片来自用户上传、公开 URL 或上一轮转换结果
image_url否string-公开可访问的 HTTP 或 HTTPS 图片地址;与 image_file 二选一。URL 或域名由用户提供,调用前需要确认协议、跳转和可访问性
targetWidth否integer-目标宽度上限,范围为 1 至 8192 像素。由用户输入、业务筛选条件或上一轮接口结果确定。
targetHeight否integer-目标高度上限,范围为 1 至 8192 像素。由用户输入、业务筛选条件或上一轮接口结果确定。
maxWidth否integer-最大宽度,范围为 1 至 8192 像素。由用户输入、业务筛选条件或上一轮接口结果确定。
maxHeight否integer-最大高度,范围为 1 至 8192 像素。由用户输入、业务筛选条件或上一轮接口结果确定。
quality否integer85JPEG 或 WebP 输出质量,范围为 1 至 95,默认 85。由用户输入、业务筛选条件或上一轮接口结果确定。
format否string-输出格式:jpeg、png、webp、gif 或 bmp;未传时保持原格式。由用户输入、业务筛选条件或上一轮接口结果确定。

失败处理与恢复

  • 缺少必填输入或数据口径不明确时,停止调用并先向用户补齐信息。
  • 收到 401 或 403 时,检查 AppKey、安全配置和服务权限;不要在输出中回显凭据。
  • 收到 429 时,遵守接口返回的限流提示,降低频率后再试,不要并发放大请求。
  • 遇到网络或 5xx 异常时,只对幂等请求进行有限次数重试,并记录失败接口与时间。
  • 数据为空或多接口结果冲突时,返回已确认事实、证据缺口和复核建议,不要臆造结论。

数据校验与使用边界

  • 转换前确认文件格式、大小限制、页数和目标格式。
  • OCR、格式转换和内容抽取可能受扫描质量、字体、版式和图片清晰度影响。
  • 合同、财务、法律等重要文档需要人工复核。

输出建议

  • 输出文档处理结果时说明原始格式、目标格式、页数和失败项。
  • 对批量任务给出成功、失败、需人工处理的清单。
  • 对摘要或抽取内容保留原文件链接或文件名以便追溯。

常见问题

  • 问:什么情况下应该使用这个 Skill? 答:当用户提出的目标需要多个咕咕数据公开 API 组合完成,而不是只查询一个接口时,优先阅读这个 Skill。
  • 问:这个 Skill 是否需要单独购买? 答:不需要。Skill 文档只负责业务流程和接口选型,具体接口购买、价格和账号权益仍以接口详情页为准。
  • 问:Agent 应该怎样使用这个 Skill? 答:Agent 应先阅读 SKILL.md,确认业务场景和推荐工作流,再进入接口详情页核对参数、响应字段、价格和调用示例。
  • 问:调用接口前需要先核对什么? 答:需要核对业务对象、地区、时间范围、输入格式、必填参数、返回字段、购买状态和接口详情页中的限制说明。
  • 问:文档转换与文件处理 Skill 会替代接口文档吗? 答:不会。Skill 负责说明业务组合和调用顺序,接口参数、响应结构、计费和购买入口仍以接口详情页为准。