如今每个 LLM 评估框架都发明了自己的测试用例格式、评分器定义和结果模式。DeepEval、Promptfoo、Inspect AI 和 lm-evaluation-harness 都在解决同一个核心问题(检查模型输出是否正确),但它们都无法读取彼此的评估数据集。
这意味着每当团队想要比较不同框架,或将评估从笔记本原型迁移到生产评估流水线时,都不得不一遍又一遍地手动重写相同的测试用例。
OpenEval 试图通过定义一个小型、可移植的 JSON Schema 来解决这一问题,涵盖评估测试用例、评分器和结果,同时提供在不同框架间迁移数据而非重复输入的工具。
仓库包含:
针对测试用例、评分器配置和结果记录的版本化 JSON Schema 规范。
用于读写 OpenEval 格式数据集的 TypeScript 和 Python SDK。
带有 validate、convert、init 和 summarize 命令的 CLI。
流行框架的转换器,无需手动重写即可导入或导出现有数据集。
该项目刚刚在 npm 和 PyPI 上发布 v1.0.0,目前已有 17+ 个框架集成相关的 issue 开放,欢迎任何人帮助尚未覆盖的框架编写转换器。
仓库:https://github.com/adhabnr-ux/openeval
欢迎任何在切换评估工具时遇到相同可移植性问题的人提供反馈。
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.