シリコンバレーの開発者と学ぶ実践AIエージェントの核心原理と拡張開発
Hong
¥13,729
29%
¥9,628入門 / JavaScript, TypeScript, AI, ChatGPT, AI Agent
5.0
(23)
300+
AIエージェントフレームワークは知っていても、その原理の理解や実務への応用は難しいですよね。シリコンバレーで実際に培ったノウハウをもとに、基本原理から実践的な活用方法までお伝えします。
入門
JavaScript, TypeScript, AI
LLMを活用したサービスを作る中で、プロンプトやモデルを変更した後、以前より回答の品質が低下したかどうかを確認するのが難しかった経験があるなら、この講義が解決策になるかもしれません。自分で評価基準を作成し、変化した回答を自動的に見つけ出す方法を学びます。
36名 が受講中です。
難易度 初級
受講期間 無制限
LLMの応答を収集し、定量・定性評価するツールの実装
プロンプトとモデルの変更前後における品質差を回帰テストで検証
評価データセットと明確なLLM評価基準の設計方法
LLM Judgeとルールベース評価を組み合わせ、信頼性の高い評価パイプラインを構築する
失敗した応答を追跡し、プロンプト・検索・モデルのうち問題の原因を分析する
評価結果をCI/CDに連携し、LLMサービスの品質を継続的に管理する
昨日は正しかった答えが、今日ひっそりと間違いになります。エラーもログもないまま。シリコンバレーでAIを開発する13年目のバックエンド開発者と、デプロイ前にそれを検知するツールを、ライブラリなしで自作します。
LLMは同じ入力に対しても毎回異なる答えを出します。もっともらしさと正確さは異なり、正しい/間違っていると単純に割り切れるものでもありません。だから、ほとんどのチームが"目で見て問題なければデプロイ"にとどまっています。
LLM評価ハーネスは、AIが出した回答を人間の代わりに自動採点し、デプロイ前に悪化した部分を検出するコードの集合です。この講義では、それをTypeScriptで、他人が作ったツールを使わずにゼロから作ります。採点ルールを作り、AIにも採点を任せてみて、そのAIがどれほど信頼できるかを測定し、悪化した場合はデプロイを阻止し、実行がどの段階でどれくらい時間がかかったのかまで記録します。
いくつか質問を投げかけ、もっともらしければ「できた」として先に進んだ瞬間、品質は測定されないまま運用されます。そして誰も気づかないうちに、崩れていきます。
目測で見ていたものを、スコアと根拠に置き換えます。
再評価していない採点は、コイン投げと大差ありません。以下は16問を実際に実行して得られた値です。
答えの内容はそのままにして表示する順番だけを変えましたが、2回とも先頭の位置が勝ちました。16問中14問がこのように逆転しました。選んだ理由が答えの内容ではなく、位置だったということです。
この数字を知らないままAIに採点を任せると、誤った点数の上に品質を積み上げることになります。この数字を測る方法も、講義の中で自ら作ります。
ルールで採点することから始め、採点をAIに任せ、そのAIを検証し、最後にはデプロイを阻止する検査まで。一つひとつの段階を自分で積み上げていきます。
文字まで同じか、決められた形式で出力されているか、必須の単語が含まれているか、答えてはいけない質問を拒否したか、表現は違っても意味が同じか。AIを呼び出さないので、あっという間に終わります。
人が一つ一つ読んでいた採点をAIに任せます。採点基準表を作り、回答一つに点数を付ける方式と、二つの回答を並べてどちらかを選ばせる方式の両方を使います。
人間が付けた点数とどれくらい一致するか、選択肢の順番を変えただけで答えが変わるか、長く書かれた答えを無条件に良いと見る癖があるかを測ります。
質問と期待する答えを集めて問題集を作り、一度実行した結果を基準回答として保存しておきます。以降はこれと比較します。
保存しておいた基準回答と比較して、合格・不合格を判定します。"2%低下したのは本当に悪化したのか、それとも単なる揺らぎなのか"も計算で見分けます。
1回の実行がどの段階を通過し、各段階にどれくらい時間がかかり、どれだけトークンを使ったのかを棒グラフで描きます。外部ツールを使わずに自作します。
講義で実際に登場した画面です。検査がデプロイを阻止し、記録ツールがその理由を示します。
デプロイ前検査
16問を保存しておいた基準回答と一つずつ照合し、case-01 · 08 · 10が悪化したことを検出します。人が目で比較することなく、あらかじめ決めた件数を超えると自動的にブロックします。
自作の記録ツール
棒が長い2つの欄がAIを呼び出す段階です。1回実行するのにトークン413個(質問331・回答82)を使ったことまで表示されます。外部ツールを接続せず、TypeScriptで直接作った画面です。
測り直していない採点は、品質を守ってくれません。守れているという錯覚を生むだけです。その錯覚を取り払うことが、この講義の骨子です。
"LLM評価ツールを使ってみました"と"判定が順序を変えるだけで16回中14回覆ることを測定しました"は、別の文章です。後者を書くには自分で測ってみる必要があり、この講義がそのプロセスです。
6行すべて、この講義で実際に作り、実際に測定するものです。面接で"その評価を何を根拠に信じるのですか"と聞かれても、答えが残ります。
この講義がどのあたりまで掘り下げるのかは、数字で見ると明確になります。
評価ツール市場は、2026年の16億ドルから2033年には87億ドルへ拡大すると見込まれています。ですが、ツールを購入することと、そのツールが出したスコアを信頼してよいか判断することは別の話です。後者ができる人は、まだ少ないのが現状です。
出典:VentureBeat VB Pulse 2026年6~7月調査(従業員100人以上の企業の実務担当者、回答265件)· LangChain State of Agent Engineering(実務担当者1,300人以上)· Ye et al., Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge, ICLR 2025(arXiv 2410.02736) · ドイツ・ハム高等裁判所2026年5月12日判決、Moffatt v. Air Canada 2024 BCCRT 149 · Persistence Market Research(AI評価ツール市場規模)
"自分に合った講座かな?"と思ったら
統計の知識は? グラフィックカードは? 有料APIキーは? 必要なものと不要なものを、以下にすべて書いておきました。
以下のいずれか1つでも当てはまるなら、この講座はすぐに役立ちます。
コードはTypeScriptで書き、Node.js上でtsxを使ってそのまま実行します。回答の生成と採点にはOllamaでローカル起動したllama3.2を使い、意味が似ているか比較するときだけbge-m3を呼び出します。採点結果の形式がずれないように、zodでスキーマを定義しておきます。
支払いが必要なAPIキーも、登録するサービスも、グラフィックカードもありません。1つのフォルダ内ですべて完結します。
大げさな準備は必要ありません。ノートパソコン1台あれば始められます。
基本文法が読めて、AI APIを一度でも呼び出したことがあれば十分です。統計や機械学習の知識は必要ありません。計算が必要な箇所は、講義内でコードを使って説明します。
zshとHomebrewを基準に進めます。回答の生成と採点はllama3.2、意味が似ているかの判定はbge-m3――どちらもノートパソコンで動作します。グラフィックカードなしで最後まで進めます。
支払いが必要なAPIキーはありません。登録するサービスも、借りるサーバーもありません。インターネットなしでも、最初から最後まで動作します。
13年目のバックエンドサーバー開発者です。国内の複数の企業を経て、現在はシリコンバレーでAI関連の開発を行っています。LLMを組み込んだサービスが「うまくいっているようだ」という段階で止まると、どのように崩れていくのかを現場で見てきました。そのため、採点ツールやデプロイ前の検査を自ら作って使っています。この講義は、そのツールを作る過程をそのまままとめたものです。私が知っていることを、できるだけわかりやすく、気軽にお伝えします。
次のデプロイで何がひそかに悪化するのか、今は知る術がありません。その方法を自分たちで作り、終わらせましょう。
学びは講義の外でも続きます。キャリアの悩み、現場の状況、技術の話を自由に語り合う場です。講義を受けていてつまずいた点も、気軽に質問してください。誰でも無料で参加できます。
오픈채팅 참여하기学習対象は
誰でしょう?
LLMサービスを運用し、プロンプトやモデル変更の影響を検証する必要がある開発者
LLM AgentとRAGサービスの回答品質を体系的に評価したい開発者
評価データセットと基準がなく、品質検証を始めるのが難しいAIサービス開発者
手動テストを自動化し、デプロイ前の回帰テストを導入しようとしている開発者
実際の業務にすぐ適用できるLLM評価ハーネスをプロジェクトとして完成させたい開発者
インフラン認証
キャリア認証
10,139
受講生
625
受講レビュー
169
回答
4.8
講座評価
34
講座
家でだらだら過ごしていたところ、開発に興味を持ち勉強を始め、現在は板橋(パンギョ)でプラットフォームサーバーの開発を担当しています。私が勉強してきた方法や、実務で直面する可能性のある様々な問題点とその解決策を皆さんに提供したいと思い、知識共有者としての活動を続けています。
講義は私一人の知識だけで作られるものではありません。すべての講義には、共に作り上げてくださる方々がいます。
Tossの開発者からの推薦で合流されたシリコンバレーの開発者 Waddy, người đã tham gia theo lời giới thiệu của một nhà phát triển từ Toss
[知識共有者の経歴]
[前] サンドボックスIP関連ブロックチェーン開発者
[前] メタバースバックエンドエンジニア
[現] 板橋(パンギョ)でベテランになりつつあるサーバー開発者
[インタビュー履歴]
[その他のお問い合わせ]
[公式サイト]
全体
23件 ∙ (5時間 21分)
講座資料(こうぎしりょう):
知識共有者の他の講座を見てみましょう!
同じ分野の他の講座を見てみましょう!
期間限定セール
¥34
59%
¥13,729