ルーブリックとEvalは最初から正しく作れないので、失敗ログで育てる
LLMの出力改善ループで、評価基準が粗いままだと弱い出力が合格してしまう問題を、外部APIに依存しない検証スクリプトで確認します。ルーブリックを運用しながら育てるための判断軸を整理しました。
Category
LLMの出力改善ループで、評価基準が粗いままだと弱い出力が合格してしまう問題を、外部APIに依存しない検証スクリプトで確認します。ルーブリックを運用しながら育てるための判断軸を整理しました。
生成、評価、フィードバック、再生成を分けた最小ループを検証用スクリプトで実装し、AI出力を安定させるときに見るべき停止条件と評価単位を整理します。
プロンプトの工夫だけでは出力がブレ続ける問題に対して、生成、評価、フィードバック、再生成のループで対処する考え方を整理しました。手動で始める最小ステップも書いています。