AIエージェントは「動いた」で評価してはいけない。見るべきは、失敗を保存し、修正後も同じ実タスクを回せるかだ。Supabase Evalsの記事を書きました。モデル順位より回帰試験の設計...
AIエージェントは「動いた」で評価してはいけない。見るべきは、失敗を保存し、修正後も同じ実タスクを回せるかだ。Supabase Evalsの記事を書きました。モデル順位より回帰試験の設計が面白い。 自分のチームなら、最初にどの失敗を試験へ残す?
「shugo」タグが付いたAI Pulseの更新一覧です。
1 件のシグナルAIエージェントは「動いた」で評価してはいけない。見るべきは、失敗を保存し、修正後も同じ実タスクを回せるかだ。Supabase Evalsの記事を書きました。モデル順位より回帰試験の設計が面白い。 自分のチームなら、最初にどの失敗を試験へ残す?