Introducing Supabase Evals
Matt Rossman introduces Supabase Evals, an open-source framework for benchmarking AI coding agents with Supabase. It evaluates agents like Claude Code and Codex on real tasks, providing scores through a web app. Feedback is requested on testing and scoring methods. Paco Cartones suggests adding a process safety dimension to the scoring system to enhance its utility for evaluating agent safety in real project environments.