j.jev4pg使用文档
概率嵌入
原生扩展预览

概率嵌入

开发预览原生功能需要开发版本,当前支持 Linux 上的 PostgreSQL 17。

概率嵌入用一组固定问题描述文本。每个维度都有明确的问题和答案含义,便于检查差异,并在兼容的结果之间计算距离。

固定问题基底#

先定义 1 到 32 个问题,并固定问题顺序、答案选项和上下文字段。jev_native.embed(source_sql, basis, options) 对源数据逐行评估,返回完整答案概率矩阵及展开后的向量。

例如,两个问题各有两个答案:

json
{
  "matrix": [[0.2, 0.8], [0.7, 0.3]],
  "vector": [0.2, 0.8, 0.7, 0.3]
}

这些数字仅用于说明表示形式。向量保留每个问题的所有答案概率,不能只保留最大项,也不能随意改变维度顺序。

复用已有判断#

jev_native.answer_matrix(basis, decisions, evaluator) 可以将已有类型化判断投影到相同表示,无需再次调用模型。

未执行的问题保持 NOT_EVALUATED,相应值为空;不能用全零向量伪装成完成的结果。比较前应先检查完整性。

保存与比较#

保存矩阵时一并保存问题基底和评估器标识。jev_native.embedding_distance(left, right) 对完整且身份兼容的矩阵做本地距离计算,不调用模型。

该比较使用 Hellinger 距离。即使向量长度相同,问题、答案含义或评估器版本不同,也不能直接混用。

适用场景#

当你能明确说出关心的语义轴时,可以用它比较消息、查找相似记录或分析文本差异。检索质量仍取决于问题设计与模型判断,需要使用独立测试数据评估,不能仅凭向量可解释就认定效果更好。

本页介绍用法与注意事项。完整参数及详细约定请参阅对应英文文档。