LangfuseのLLMトレースをClickHouseで長期分析する
LangfuseのObservationとScoreをClickHouseへ正規化し、モデル別コスト、prompt version別の品質推移、再試行によるコスト増をSQLで確認する検証ログ。
Tag
LangfuseのObservationとScoreをClickHouseへ正規化し、モデル別コスト、prompt version別の品質推移、再試行によるコスト増をSQLで確認する検証ログ。
Langfuse AssistantのPublic Betaを、既存のSakana Fugu観測データとPublic APIから計算した正解値で検証します。
Sakana FuguのOpenAI互換APIをLangfuseで計装し、Level 1〜3のタスクでレイテンシ、消費トークン、TTFTがどう変化するかを観測した実践レポート。
Sakana Fuguをサブスク契約して分かったOpenAI互換APIとしての性質と、ブラックボックスな協調推論を外側から観測するための検証計画。
VercelのエージェントフレームワークEveで同じ天気ツール呼び出しをTUIとHTTP APIから観測し、開発者向け表示と外部連携向けイベント列の違いを整理した検証ログ。
Flue 1.0 BetaのobserveイベントをredactionしたうえでLangfuseへ送信し、IssueトリアージWorkflowのrunId、モデル、結果を追う実験ログ。
Vercelのエージェントフレームワークeveで動かしたtool calling実行を、Langfuseへtrace/span/generationとして送る方法を2パターン試して比較したログ。
Flue 1.0 Betaを手元で触る前段として、Harness-first、Agent、Workflow、Skill、Tool、Sandbox、永続化まわりの考え方をざっくり整理したメモ。
LangfuseのMonitors機能を、自前で作ったSlack朝ブリーフィングWorkerの実験ログと比較し、どこまで公式機能に寄せるべきかを整理します。
Cloudflare AI GatewayをOpenAI互換エンドポイントとして利用し、基本ログ、payload保存制御、メタデータ、コスト推定、OTel連携まで含めてLLM観測の入口として使えるかを整理する。