SWE-1.7の自己圧縮から考えるAIDDの再開メモ設計
CognitionのSWE-1.7記事をきっかけに、長時間化するAI駆動開発で作業を再開できるメモには何が必要かを、外部APIに依存しない検証スクリプトで確認しました。
Tag
CognitionのSWE-1.7記事をきっかけに、長時間化するAI駆動開発で作業を再開できるメモには何が必要かを、外部APIに依存しない検証スクリプトで確認しました。
AI Gatewayのログにfeedback、score、metadataを後付けし、LLMのリクエストログを改善対象の評価データへ変えるための小さな検証メモ。
Flue 1.0 BetaのIssueトリアージAgentで、通常の指示とSkillの明示実行を同じ入力で比べ、finish到達、schema検証、分類品質を分けて確認した検証メモ。
Eveの評価で一度落ちた天気ツールの失敗ログをLangfuse Datasetに登録し、失敗runと修正後runを比較しながら評価条件を改善する検証ログ。
LLMの出力改善ループで、評価基準が粗いままだと弱い出力が合格してしまう問題を、外部APIに依存しない検証スクリプトで確認します。ルーブリックを運用しながら育てるための判断軸を整理しました。
生成、評価、フィードバック、再生成を分けた最小ループを検証用スクリプトで実装し、AI出力を安定させるときに見るべき停止条件と評価単位を整理します。
Hermes Agentにサポートトリアージを任せる前段階として、実データを使わずに評価可能な3本の合成シナリオを作り、判断根拠と安全制約を先に固定する。
プロンプトの工夫だけでは出力がブレ続ける問題に対して、生成、評価、フィードバック、再生成のループで対処する考え方を整理しました。手動で始める最小ステップも書いています。