Cloudflare AI GatewayのpatchLogでLLMの評価ログを育てる
AI Gatewayのログにfeedback、score、metadataを後付けし、LLMのリクエストログを改善対象の評価データへ変えるための小さな検証メモ。
Category
AI Gatewayのログにfeedback、score、metadataを後付けし、LLMのリクエストログを改善対象の評価データへ変えるための小さな検証メモ。
Eveの評価で一度落ちた天気ツールの失敗ログをLangfuse Datasetに登録し、失敗runと修正後runを比較しながら評価条件を改善する検証ログ。
PerplexityやChatGPTが検索の代わりになる中、個人ブログをAI Agentからも発見可能にするAIO(AI最適化)の実装。llms.txt、JSON API、MCP Serverの3層設計と、46本規模での採用判断基準。
LangfuseのMonitors機能を、自前で作ったSlack朝ブリーフィングWorkerの実験ログと比較し、どこまで公式機能に寄せるべきかを整理します。
Langfuseのtrace、token、cost、latencyをCloudflare Workers Cronで集計し、見るべき異常だけをSlackへ流す実装検証。
Traceを毎日見に行く運用は続かない。Langfuseの失敗、トークン急増、低評価出力だけをSlackへ集約する個人GenAIOpsの構想メモ。
Cloudflare AI GatewayをOpenAI互換エンドポイントとして利用し、基本ログ、payload保存制御、メタデータ、コスト推定、OTel連携まで含めてLLM観測の入口として使えるかを整理する。