目前每一個 LLM 評估框架都會自行發明測試案例格式、評分定義,以及結果結構。DeepEval、Promptfoo、Inspect AI 和 lm-evaluation-harness 都解決了同一個核心問題(檢查模型輸出是否正確),但它們都無法讀取彼此的評估資料集。
這表示每當團隊想要比較不同框架,或是從筆記本原型移轉到正式評估管線時,都必須一次又一次地手動重寫相同的測試案例。
OpenEval 試圖透過定義一個小型、可攜式的 JSON Schema 來解決這個問題,涵蓋評估測試案例、評分器以及結果,同時提供工具在不同框架之間移動資料,而不必重新輸入。
本儲存庫包含:
版本化的 JSON Schema 規格,用於測試案例、評分器設定和結果紀錄。
用於讀取和寫入 OpenEval 格式資料集的 TypeScript 和 Python SDK。
具備 validate、convert、init 和 summarize 指令的 CLI。
熱門框架的轉換器,讓現有資料集可以匯入或匯出,而不需要手動重寫。
本專案已於 npm 和 PyPI 發布 v1.0.0,若有尚未支援的框架整合需求,歡迎在 17+ 個框架整合的 issue 中協助開發轉換器。
儲存庫:https://github.com/adhabnr-ux/openeval
如果您在切換評估工具時也遇到相同可攜性問題,非常歡迎提供回饋。
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.