記事一覧に戻る

The Open Arabic LLM Leaderboard (OALL) は、アラビア語処理分野における専門的なベンチマークの必要性の高まりに対応するために設計されました。自然言語処理 (NLP) の分野が進むにつれ、焦点は英語に大きく偏りがちで、他の言語向けのリソースに大きなギャップが生じています。OALL は、アラビア語大規模言語モデル (LLM) のパフォーマンスを評価・比較するための専用プラットフォームを提供することで、このギャップを埋め、アラビア語 NLP の研究開発を促進することを目指しています。

この取り組みは、世界中の 3 億 8,000 万人以上のアラビア語話者に直接貢献するという点で特に重要です。アラビア語 LLM を正確に評価・改善する能力を高めることで、OALL がアラビア語のニュアンス、文化、遺産に細かく対応したモデルやアプリケーションの開発に重要な役割を果たすことを期待しています。

ベンチマーク、メトリクス、技術的セットアップ

ベンチマークデータセット

The Open Arabic LLM Leaderboard (OALL) は、包括的なモデル評価を確実にするために、広範で多様な堅牢なデータセットのコレクションを利用しています。

  • AlGhafa benchmark: TII LLM チームが作成したもので、読解、感情分析、質問応答など幅広い能力を評価することを目的としています。当初は 11 のネイティブアラビア語データセットで導入され、その後、英語 NLP コミュニティで広く採用されている他のベンチマークの翻訳版を追加した 11 のデータセットを含むように拡張されました。
  • ACVA および AceGPT ベンチマーク: 論文 「AceGPT, Localizing Large Language Models in Arabic」 から 58 のデータセットを収録し、MMLU および EXAMS ベンチマークの翻訳版を追加することで評価範囲を拡大し、言語タスクの包括的なカバレッジを実現しています。これらのベンチマークは慎重にキュレーションされ、アラビア言語の複雑さと微妙なニュアンスを正確に捉えるさまざまなサブセットを備えています。

評価メトリクス

タスクの性質上、多肢選択式およびはい/いいえ形式の質問を含むため、リーダーボードではすべてのタスクに対して正規化された対数尤度精度を主に使用します。このメトリクスは、さまざまなタイプの質問に対するモデルパフォーマンスの明確で公平な測定を提供できるため選択されました。

技術的セットアップ

The Open Arabic LLM Leaderboard (OALL) の技術的セットアップでは、以下を使用しています。

  • demo-leaderboard に着想を得たフロントエンドおよびバックエンド(バックエンドは TII クラスター上でローカルに実行)
  • 評価の実行には lighteval ライブラリを使用。上記の Arabic ベンチマークを lighteval に統合するための多大な貢献が行われており、アラビア語モデルのコミュニティ向けの即時評価をサポートしています(詳細は GitHub の PR #44 および PR #95 を参照)。

今後の方向性

The Open Arabic LLM Leaderboard の範囲を拡大するためのアイデアを多数持っています。Retrieval Augmented Generation (RAG) シナリオにおけるアラビア語 LLM の評価用リーダーボードや、ユーザーの好みに基づいて異なるアラビア語チャットボットの ELO スコアを計算するチャットボットアリーナなど、さまざまなカテゴリで追加のリーダーボードを導入する計画があります。

さらに、Nagoudi らが論文 “Dolphin: A Challenging and Diverse Benchmark for Arabic NLG” で行った研究のオープンな再現として、約 50 のデータセットを含む OpenDolphin ベンチマークを開発することで、ベンチマークをより包括的なタスクに拡張することを目指しています。ベンチマークの追加や OpenDolphin プロジェクトへの協力に関心のある方は、ディスカッションタブまたは メールアドレス からお問い合わせください。

これらの点へのご貢献を歓迎します!コミュニティの皆様には、モデルの提出、新規ベンチマークの提案、または議論への参加を通じて貢献することをお勧めします。また、現在のリーダーボードの上位モデルを活用して、ファインチューニングやその他の手法で新しいモデルを作成し、ランキングを1位に引き上げることをお勧めします!あなたが次の Arabic Open Models Hero になれるかもしれません!

OALL が技術的進歩を促し、アラビア語に固有の言語的・文化的特性を強調し、大規模で言語固有のリーダーボードを展開する際の技術的セットアップと学びが、他の十分にリソースが配分されていない言語における同様の取り組みに役立つことを願っています。この焦点により、従来英語中心のモデルが支配していたリソースと研究のギャップを埋め、より多様で包括的なツールでグローバルな NLP の展望を豊かにすることができます。これは、AI 技術が世界中の日常生活にますます統合される中で非常に重要です。

モデルを提出する!

モデル提出プロセス

The Open Arabic LLM Leaderboard へのモデル提出がスムーズに進むよう、参加者は以下のガイドラインに従う必要があります。

  1. モデルの精度の整合性を確保する: 提出モデルの精度が元のモデルと一致していることが重要です。精度の不一致がある場合、モデルは評価されてもリーダーボードに正しく表示されない可能性があります。

  2. 提出前の確認:

    • モデルとトークナイザーのロード: モデルとトークナイザーが AutoClasses を使用して正常にロードできることを確認してください。以下のコマンドを使用します。

      from transformers import AutoConfig, AutoModel, AutoTokenizer
      config = AutoConfig.from_pretrained("your model name", revision=revision)
      model = AutoModel.from_pretrained("your model name", revision=revision)
      tokenizer = AutoTokenizer.from_pretrained("your model name", revision=revision)
      

      エラーが発生した場合は、エラーメッセージに従って対処し、モデルが正しくアップロードされていることを確認してください。

    • モデルの公開設定: モデルが公開設定になっていることを確認してください。また、モデルが use_remote_code=True を必要とする場合、この機能は現在サポートされていませんが、開発中であることに注意してください。

  3. モデル重みを Safetensors に変換する:

    • モデル重みを safetensors に変換してください。これは、重みのロードと使用をより安全かつ高速にする形式です。この変換により、Extended Viewer にモデルのパラメータ数を含めることも可能になります。
  4. ライセンスとモデルカード:

    • オープンライセンス: モデルがオープンライセンスであることを確認してください。このリーダーボードは、オープン LLM のアクセシビリティを促進し、広く利用可能にすることを目指しています。
    • 完全なモデルカード: モデルカードに詳細な情報を入力してください。このデータは自動的に抽出され、リーダーボード上のモデルと一緒に表示されます。

モデルが失敗した場合

モデルが「FAILED」カテゴリに表示される場合、実行が停止されたことを示します。上記のステップを確認してトラブルシューティングを行い、問題を解決してください。また、スクリプト をローカルでモデルに対してテストし、再提出前に機能を確認してください。

謝辞

本プロジェクトへの多大な支援をいただいた Technology Innovation Institute および Hugging Face をはじめ、すべての貢献者、パートナー、スポンサーに感謝いたします。TII は、アラビア語 NLP 分野におけるコミュニティ主導のプロジェクトとオープンサイエンスの推進へのコミットメントに沿って、必要不可欠な計算リソースを惜しみなく提供しました。一方、Hugging Face は、新しい評価フレームワークとリーダーボードテンプレートの統合とカスタマイズを支援しました。

また、Open Ko-LLM Leaderboard に取り組んだ Upstage にも感謝いたします。彼らの取り組みは、私たちの努力にとって貴重な参考とインスピレーションの源となりました。彼らの先駆的な貢献は、包括的で包括的なアラビア語 LLM リーダーボードを開発する際のアプローチを導く上で重要な役割を果たしました。

引用と参考文献

@misc{OALL,
  author = {El Filali, Ali and Alobeidli, Hamza and Fourrier, Clémentine and Boussaha, Basma El Amel and Cojocaru, Ruxandra and Habib, Nathan and Hacid, Hakim},
  title = {Open Arabic LLM Leaderboard},
  year = {2024},
  publisher = {OALL},
  howpublished = "\url{https://huggingface.co/spaces/OALL/Open-Arabic-LLM-Leaderboard}"
}

@inproceedings{almazrouei-etal-2023-alghafa,
    title = "{A}l{G}hafa Evaluation Benchmark for {A}rabic Language Models",
    author = "Almazrouei, Ebtesam  and
      Cojocaru, Ruxandra  and
      Baldo, Michele  and
      Malartic, Quentin  and
      Alobeidli, Hamza  and
      Mazzotta, Daniele  and
      Penedo, Guilherme  and
      Campesan, Giulia  and
      Farooq, Mugariya  and
      Alhammadi, Maitha  and
      Launay, Julien  and
      Noune, Badreddine",
    editor = "Sawaf, Hassan  and
      El-Beltagy, Samhaa  and
      Zaghouani, Wajdi  and
      Magdy, Walid  and
      Abdelali, Ahmed  and
      Tomeh, Nadi  and
      Abu Farha, Ibrahim  and
      Habash, Nizar  and
      Khalifa, Salam  and
      Keleg, Amr  and
      Haddad, Hatem  and
      Zitouni, Imed  and
      Mrini, Khalil  and
      Almatham, Rawan",
    booktitle = "Proceedings of ArabicNLP 2023",
    month = dec,
    year = "2023",
    address = "Singapore (Hybrid)",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2023.arabicnlp-1.21",
    doi = "10.18653/v1/2023.arabicnlp-1.21",
    pages = "244--275",
    abstract = "Recent advances in the space of Arabic large language models have opened up a wealth of potential practical applications. From optimal training strategies, large scale data acquisition and continuously increasing NLP resources, the Arabic LLM landscape has improved in a very short span of time, despite being plagued by training data scarcity and limited evaluation resources compared to English. In line with contributing towards this ever-growing field, we introduce AlGhafa, a new multiple-choice evaluation benchmark for Arabic LLMs. For showcasing purposes, we train a new suite of models, including a 14 billion parameter model, the largest monolingual Arabic decoder-only model to date. We use a collection of publicly available datasets, as well as a newly introduced HandMade dataset consisting of 8 billion tokens. Finally, we explore the quantitative and qualitative toxicity of several Arabic models, comparing our models to existing public Arabic LLMs.",
}
@misc{huang2023acegpt,
      title={AceGPT, Localizing Large Language Models in Arabic}, 
      author={Huang Huang and Fei Yu and Jianqing Zhu and Xuening Sun and Hao Cheng and Dingjie Song and Zhihong Chen and Abdulmohsen Alharthi and Bang An and Ziche Liu and Zhiyi Zhang and Junying Chen and Jianquan Li and Benyou Wang and Lian Zhang and Ruoyu Sun and Xiang Wan and Haizhou Li and Jinchao Xu},
      year={2023},
      eprint={2309.12053},
      archivePrefix={arXiv},
      primaryClass={cs.CL}
}
@misc{lighteval,
  author = {Fourrier, Clémentine and Habib, Nathan and Wolf, Thomas and Tunstall, Lewis},
  title = {LightEval: A lightweight framework for LLM evaluation},
  year = {2023},
  version = {0.3.0},
  url = {https://github.com/huggingface/lighteval}
}