tech.pepabo.com 2日前

AIが生成したWebサイトの品質を数値化する — ルーブリック × LLM-as-a-Judge による評価駆動開発 - Pepabo Tech Portal

ペパボのAIサイト生成サービス「ロリポップ!AIホームページ」で、Webサイト品質を定量評価する仕組みを構築した事例。デザイナーの暗黙知を4カテゴリ約170項目のルーブリックに言語化し、LLM-as-a-Judgeでキャプチャから0〜3点採点する「完成品スコア」と、工程途中のJSON出力をテキストのみで採点する「工程スコア」の2種類を設計。総合スコアはLLMではなくコードで加重集計し再現性を確保、モデル移行時の品質ゲートにも活用した。課題として採点妥当性の検証とばらつきの統計的扱いが残る。

ペパボのAIサイト生成サービス「ロリポップ!AIホームページ」で、Webサイト品質を定量評価する仕組みを構築した事例。デザイナーの暗黙知を4カテゴリ約170項目のルーブリックに言語化し、LLM-as-a-Judgeでキャプチャから0〜3点採点する「完成品スコア」と、工程途中のJSON出力をテキストのみで採点する「工程スコア」の2種類を設計。総合スコアはLLMではなくコードで加重集計し再現性を確保、モデル移行時の品質ゲートにも活用した。課題として採点妥当性の検証とばらつきの統計的扱いが残る。
↗ 元記事を開く