性能与成本
耗时与费用取决于实际提交给模型的工作、可复用证据、并发限制和服务配置。原生执行器目前没有公开的端到端速度、成本或检索质量对比,不能据此承诺固定提升。
哪些操作会调用模型#
| 操作 | 模型调用 |
|---|---|
| 普通 SQL 筛选、关联和计算 | 不需要,由 PostgreSQL 执行。 |
| 语义扫描、生成概率嵌入 | 对尚未取得证据的问题调用模型。 |
| 复用兼容的观察结果 | 对已复用的部分无需重新推理。 |
decide、answer_matrix、embedding_distance |
本地处理,不调用模型。 |
| 混合规划 | SQL 生成与 JEV 的选择、复核分别计量。 |
共享上下文减少重复输入,并发让独立请求重叠执行;不同问题仍分别计入判断次数。SQL 回滚不能撤销已发生的模型调用。
减少不必要的工作#
先在源 SQL 中使用精确条件缩小范围,只选择判断所需字段。外层的 LIMIT 不保证减少模型评估量。
概率嵌入应使用精简、固定的问题基底;查询文本只嵌入一次,再与已保存的兼容向量做本地比较。跨连接复用需要配置证据注册表。
设置预算#
max_requests、max_judgments、max_rows 和 max_input_bytes 分别限制不同资源。concurrency 控制单次调用的并发;注册表还可以跨会话协调请求额度。
原生同步调用会在推理期间占用 PostgreSQL 后端连接,连接池大小应把这一点考虑在内。
读取用量#
原生结果包含 usage、receipt 和 policy。行级结果可能重复携带累计计数,应读取完整结果中的最大累计值,不要逐行相加。
请求准入数不等于服务商计费数;字节数也不是 token 数。比较方案时,应分别记录冷启动与证据复用、完整与未完成结果、模型请求、延迟和连接占用。
本页介绍用法与注意事项。完整参数及详细约定请参阅对应英文文档。