从文本提取数据
文本提取将文档中的记录整理为有类型的表格,并保留对应原文,便于在写入前逐项核对。
描述要提取的内容#
通过工作区或 POST /data/extractions 提供原文、每行代表什么,以及各字段的名称、类型和含义。支持的基础类型包括 text、integer、number 和 date。
行描述应明确记录单位。例如,“每行表示一笔送货记录”比“提取重要信息”更容易核对。字段说明应包含金额或数量的单位,以及日期所代表的事件。
此操作需要 reviewer 权限。默认 commit: false,先返回提取预览。
核对预览#
检查提取出的值及其原文证据,尤其注意同名对象、缺失字段、多个日期和单位。证据用 Unicode 字符位置标记,数值转换由确定性规则处理,不应补造原文没有提供的值。
缺失与不确定需要明确保留。如果业务允许某字段为空,可以显式配置可空字段及 on_missing: null。这与默认填零或填入空字符串不同。
确认导入#
核对完成后,使用预览返回的令牌提交:
POST /data/extractions/{preview_token}/commit请求体为 {}。预览绑定创建者与租户,有效期为一小时。对同一预览重复提交是安全的;重新发起一次提取则是新的操作,可能产生重复记录。
只有满足提交条件的完整结果才能写入。直接使用 commit: true 也不会绕过未解决字段或权限检查。
本页介绍用法与注意事项。完整参数及详细约定请参阅对应英文文档。