シリコンバレーの開発者が教えるLLM評価ハーネスエンジニアリング

LLMを活用したサービスを作る中で、プロンプトやモデルを変更した後、以前より回答の品質が低下したかどうかを確認するのが難しかった経験があるなら、この講義が解決策になるかもしれません。自分で評価基準を作成し、変化した回答を自動的に見つけ出す方法を学びます。

難易度 初級

受講期間 無制限

JavaScript
JavaScript
TypeScript
TypeScript
Business Productivity
Business Productivity
AI
AI
ChatGPT
ChatGPT
JavaScript
JavaScript
TypeScript
TypeScript
Business Productivity
Business Productivity
AI
AI
ChatGPT
ChatGPT

学習した受講者のレビュー

4.8

5.0

Be Dev

91% 受講後に作成

Evalという評価手法をマスターするというよりは、「こういう概念やこういう検証パターンがある」といったことを知ってもらう内容だと思います。 つまり、視野を広げるうえで大いに役立つと感じます。実際、私もこの講義を受講しながら、かなり斬新なテーマだと思いました。

5.0

seha incheon

83% 受講後に作成

コード数もファイル数も多いため、ただコピーしながら進めていく過程では、ついていくのが少し難しいと感じました。 それでも、内容が非常に有益で、生まれて初めて聞くテーマだったので、こうした欠点も受け入れられたのだと思います。 特に、評価を行うモデル自体も信頼できないため、そのモデルも評価しなければならないのですが、さらにまたモデルが評価するとなると、結局は信頼することが不可能になる、という観点で理解していくと、 モデル評価の結論は、「人間が苦労しなければならない」ということに帰結する内容だと思います。 - 実際、Metaでもモデルに課題を与えたり学習させたりするために、より多くの人を雇い、実際の人員をさらに多く投入したと認識していますが、その観点もここで反映されているように感じました。

5.0

우당탕탕

83% 受講後に作成

講義を有意義に拝見しました!

受講後に得られること

  • LLMの応答を収集し、定量・定性評価するツールの実装

  • プロンプトとモデルの変更前後における品質差を回帰テストで検証

  • 評価データセットと明確なLLM評価基準の設計方法

  • LLM Judgeとルールベース評価を組み合わせ、信頼性の高い評価パイプラインを構築する

  • 失敗した応答を追跡し、プロンプト・検索・モデルのうち問題の原因を分析する

  • 評価結果をCI/CDに連携し、LLMサービスの品質を継続的に管理する

こんな方に
おすすめです

学習対象は
誰でしょう?

  • LLMサービスを運用し、プロンプトやモデル変更の影響を検証する必要がある開発者

  • LLM AgentとRAGサービスの回答品質を体系的に評価したい開発者

  • 評価データセットと基準がなく、品質検証を始めるのが難しいAIサービス開発者

  • 手動テストを自動化し、デプロイ前の回帰テストを導入しようとしている開発者

  • 実際の業務にすぐ適用できるLLM評価ハーネスをプロジェクトとして完成させたい開発者

こんにちは
Hongです。

インフラン認証

キャリア認証

10,501

受講生

652

受講レビュー

172

回答

4.8

講座評価

34

講座

家でだらだら過ごしていたところ、開発に興味を持ち勉強を始め、現在は板橋(パンギョ)でプラットフォームサーバーの開発を担当しています。私が勉強してきた方法や、実務で直面する可能性のある様々な問題点とその解決策を皆さんに提供したいと思い、知識共有者としての活動を続けています。

 

講義は私一人の知識だけで作られるものではありません。すべての講義には、共に作り上げてくださる方々がいます。

 

[知識共有者の経歴]

[前] サンドボックスIP関連ブロックチェーン開発者

[前] メタバースバックエンドエンジニア

[現] 板橋(パンギョ)でベテランになりつつあるサーバー開発者

 

[インタビュー履歴]

[その他のお問い合わせ]

[公式サイト]

もっと見る

カリキュラム

全体

23件 ∙ (5時間 21分)

講座資料:

授業資料
講座掲載日: 
最終更新日: 

受講レビュー

全体

5件

4.8

5件の受講レビュー

  • achoi68339754님의 프로필 이미지
    achoi68339754

    受講レビュー 2

    ∙

    平均評価 5.0

    5

    87% 受講後に作成

    要約:AI Agentを評価する方法はさまざまあり、それらをすべて適用することもできますが、結局のところ、評価というものにはまだ人が大きく関与し、判断を下さなければなりません。 かなり斬新なテーマで、興味深く拝見しました!!

    • sehaincheon1507님의 프로필 이미지
      sehaincheon1507

      受講レビュー 3

      ∙

      平均評価 5.0

      5

      83% 受講後に作成

      コード数もファイル数も多いため、ただコピーしながら進めていく過程では、ついていくのが少し難しいと感じました。 それでも、内容が非常に有益で、生まれて初めて聞くテーマだったので、こうした欠点も受け入れられたのだと思います。 特に、評価を行うモデル自体も信頼できないため、そのモデルも評価しなければならないのですが、さらにまたモデルが評価するとなると、結局は信頼することが不可能になる、という観点で理解していくと、 モデル評価の結論は、「人間が苦労しなければならない」ということに帰結する内容だと思います。 - 実際、Metaでもモデルに課題を与えたり学習させたりするために、より多くの人を雇い、実際の人員をさらに多く投入したと認識していますが、その観点もここで反映されているように感じました。

      • jhong
        知識共有者

        こんにちは。良い評価をしてくださり、ありがとうございます!! 何しろ評価方法はあまりにも多く、これらを一つひとつすべて扱うと、皆さんにとってハードルが高く感じられるかもしれないと思い、まずはどのような感覚で、どのような方向性を持つべきかという点を中心に取り上げてみました。 そのため、全体的なコードの構造よりも、このようなパターンや方法を学んでいっていただけると良いと思います!! これからも、より有益な内容をお届けできるよう努めてまいります!!

    • kask814587762님의 프로필 이미지
      kask814587762

      受講レビュー 6

      ∙

      平均評価 5.0

      5

      83% 受講後に作成

      講義を有意義に拝見しました!

      • lookupjoin님의 프로필 이미지
        lookupjoin

        受講レビュー 3

        ∙

        平均評価 5.0

        5

        91% 受講後に作成

        Evalという評価手法をマスターするというよりは、「こういう概念やこういう検証パターンがある」といったことを知ってもらう内容だと思います。 つまり、視野を広げるうえで大いに役立つと感じます。実際、私もこの講義を受講しながら、かなり斬新なテーマだと思いました。

        • jhong
          知識共有者

          こんにちは、レビューをお寄せいただきありがとうございます!!視野を広げるお手伝いができたようで何よりです!!やはり最近は、視野を広げて取り組むことがとても重要な時期になっているように思います。 これからもより有益な内容をお届けできるよう努めてまいります!!ありがとうございます!

      • leenux2890님의 프로필 이미지
        leenux2890

        受講レビュー 1

        ∙

        平均評価 4.0

        4

        100% 受講後に作成

        Hongの他の講座

        知識共有者の他の講座はこちら

        似ている講座

        同じ分野の他の講座を見てみましょう!

        期間限定セール、あと4日日で終了

        ¥911,863

        59%

        ¥13,780