www.shoeisha.co.jp 昨日 09:22

LLMアプリケーション評価駆動開発 継続的に改善し運用していくための実践知

LLMアプリケーションの評価手法を体系的に解説する書籍。正解が一意に定まらないLLM出力特有の評価の難しさを踏まえ、評価設計の全体像、LLM-as-a-Judgeの活用法、LangSmithを用いたリリース前後の評価・モニタリング・継続的改善(LLMOps)までを理論と実践の両面から扱う。

LLMアプリケーションの評価手法を体系的に解説する書籍。正解が一意に定まらないLLM出力特有の評価の難しさを踏まえ、評価設計の全体像、LLM-as-a-Judgeの活用法、LangSmithを用いたリリース前後の評価・モニタリング・継続的改善(LLMOps)までを理論と実践の両面から扱う。
↗ 元記事を開く
tech.pepabo.com 2日前

AIが生成したWebサイトの品質を数値化する — ルーブリック × LLM-as-a-Judge による評価駆動開発 - Pepabo Tech Portal

ペパボのAIサイト生成サービス「ロリポップ!AIホームページ」で、Webサイト品質を定量評価する仕組みを構築した事例。デザイナーの暗黙知を4カテゴリ約170項目のルーブリックに言語化し、LLM-as-a-Judgeでキャプチャから0〜3点採点する「完成品スコア」と、工程途中のJSON出力をテキストのみで採点する「工程スコア」の2種類を設計。総合スコアはLLMではなくコードで加重集計し再現性を確保、モデル移行時の品質ゲートにも活用した。課題として採点妥当性の検証とばらつきの統計的扱いが残る。

ペパボのAIサイト生成サービス「ロリポップ!AIホームページ」で、Webサイト品質を定量評価する仕組みを構築した事例。デザイナーの暗黙知を4カテゴリ約170項目のルーブリックに言語化し、LLM-as-a-Judgeでキャプチャから0〜3点採点する「完成品スコア」と、工程途中のJSON出力をテキストのみで採点する「工程スコア」の2種類を設計。総合スコアはLLMではなくコードで加重集計し再現性を確保、モデル移行時の品質ゲートにも活用した。課題として採点妥当性の検証とばらつきの統計的扱いが残る。
↗ 元記事を開く
tech.pepabo.com 2日前

AIが生成したWebサイトの品質を数値化する — ルーブリック × LLM-as-a-Judge による評価駆動開発

ロリポップ!AIホームページにおいて、AI生成Webサイトの品質を定量評価する仕組みを構築した事例。デザイナーの暗黙知を4カテゴリ・約170項目のルーブリックに言語化し、フルページキャプチャをLLM-as-a-Judgeで採点する「完成品スコア」と、テキストのみで判定できる7項目に絞り工程途中のJSON出力を評価する軽量な「工程スコア」の2種を整備。総合スコアはLLMではなくコード側で加重集計することで再現性を確保し、プロンプト改修の評価駆動開発ループやモデル移行時の品質ゲーティングに活用した。今後の課題として自動化・採点妥当性の検証・ばらつきの統計的扱いを挙げている。

ロリポップ!AIホームページにおいて、AI生成Webサイトの品質を定量評価する仕組みを構築した事例。デザイナーの暗黙知を4カテゴリ・約170項目のルーブリックに言語化し、フルページキャプチャをLLM-as-a-Judgeで採点する「完成品スコア」と、テキストのみで判定できる7項目に絞り工程途中のJSON出力を評価する軽量な「工程スコア」の2種を整備。総合スコアはLLMではなくコード側で加重集計することで再現性を確保し、プロンプト改修の評価駆動開発ループやモデル移行時の品質ゲーティングに活用した。今後の課題として自動化・採点妥当性の検証・ばらつきの統計的扱いを挙げている。
↗ 元記事を開く
github.blog 4日前

How to evaluate LLMs before production

GitHubブログの記事。LLMを本番導入する前の評価手法について、secret scanningの誤検知削減事例をもとに解説。ベンチマークだけでなく製品判断の明確化、オフライン評価の統合テスト的運用、本番環境に近いデータ構成、production labelの信頼性検証、synthetic/公開データによるカバレッジ補完、エラー分析、LLM-as-judgeによる人手レビューの絞り込みという8つの実践知を紹介している。

GitHubブログの記事。LLMを本番導入する前の評価手法について、secret scanningの誤検知削減事例をもとに解説。ベンチマークだけでなく製品判断の明確化、オフライン評価の統合テスト的運用、本番環境に近いデータ構成、production labelの信頼性検証、synthetic/公開データによるカバレッジ補完、エラー分析、LLM-as-judgeによる人手レビューの絞り込みという8つの実践知を紹介している。
↗ 元記事を開く