Belief System 分析 · 更新于 .

有用的 GEO 度量可以区分组织的存在、其描述的准确性以及观察到的响应中使用的来源。这些维度回答不同的问题。将它们合并成一个乐谱可以隐藏可见性进展并伴有重大错误。

仪表板必须始终显示范围:问题、语言、引擎、日期和可用响应的数量。它描述的是这个面板,而不是所有用户的所有对话。该限制不会减损测量值;它表明如何解释它。

存在:组织出现在哪里?

存在度可以定义为在特定集合中提及该品牌的可用响应的比例。该比率必须保留分子和分母。缺失的响应不应自动计为缺失分数。

Reading by engine and by question family is essential.平均值可以掩盖品牌问题和寻求建议之间的巨大差异。必须报告面板变更。否则,这个数字可能会增加,而最初问题的答案却没有改变。

准确性:我们对组织有何评价?

准确性来自事实存储库:身份、活动、报价、范围和敏感信息。每个错误根据其重要性及其重复发生情况进行限定。遗漏、旧信息和捏造的陈述必须加以区分。

NIST 记录了生成内容中的伪造风险。因此,人工审查对于组织参与的主张保留了核心地位。编码系统可以提供帮助,但应该对样本进行检查,并在出现模糊情况时进行修改。 [1]

来源:哪些页面提供了答案?

该报告区分了域、URL 和可观察的使用情况。页面无需被引用即可检索;引用可能指的是讨论该组织的第三方来源。在得出公司网站提出论点的结论之前,有必要检查相关段落。

应根据工具的定义来阅读工具提供的指标。引用计数并不是达到的人数。平均引用次数不一定是百分比。比较必须保持相同的单位和相同的周长,不得添加不兼容的数据。

跨读示例

在一个虚构的例子中,该品牌更多地出现在选择问题上,但经常引用以前的活动。结果不应该得出结论说它已经完全成功。优先事项可能会成为参考页和外部描述的澄清。

在另一种情况下,准确性会提高,而存在感却不会增加。如果首要目标是纠正混淆,则此结果可能很有用。通信部门必须能够认识到这一进步,而不会将其转化为无法衡量的商业收益。 AMEC 提供了一个衡量成就及其效果的基准。 [1]

将每个观察结果与一个行动联系起来

错误会导致检查事实和来源。访问困难的页面会导致技术审查。对专业知识了解甚少,需要澄清报价和内容。仅凭弱引用不允许您在这些操作之间进行选择。

仪表板还必须记录所做的更改及其日期。然后,下一步措施可以谨慎地审查事态发展,同时考虑其他因素。 GEO 成为一个学习过程:观察、纠正、记录和重新检查,但不承诺控制发动机的响应。

来源和基准

  • NIST:生成式人工智能风险管理概况 [1]
  • AMEC — 巴塞罗那原则 4.0 [1]
所提出的方法涉及编辑分析。识别虚构的例子;它们不构成研究结果或客户参考。
发现相关支持 ↗