Supabase выпустила Evals: открытый бенчмарк для оценки LLM-кодеров

Открыть в Telegram →
#ии #llm #supabase #opensource
Supabase выпустила Evals: открытый бенчмарк для оценки LLM-кодеров

Supabase, известная платформа для разработки, сделала значительный шаг вперед в области оценки искусственного интеллекта, представив свой новый проект с открытым исходным кодом — `supabase/evals`. Этот бенчмарк и фреймворк, распространяемый под лицензией Apache-2.0, предназначен для объективной оценки производительности современных кодирующих агентов ИИ, таких как Claude Code, Codex и OpenCode. Выпуск Evals подчеркивает стремление Supabase к прозрачности и развитию инструментов, которые помогают разработчикам лучше понимать и использовать возможности генеративного ИИ в реальных проектах.

Основная цель Evals — предоставить стандартизированный и воспроизводимый метод для сравнения различных моделей ИИ, способных генерировать код. Вместо абстрактных тестов, Evals фокусируется на реальных задачах, с которыми разработчики сталкиваются при работе с Supabase. Это включает в себя такие критически важные операции, как построение схем баз данных, отладка функций Edge Functions и исправление политик безопасности Row Level Security (RLS). Такой подход гарантирует, что оценка ИИ-агентов максимально приближена к практическим сценариям использования, что делает результаты бенчмарка особенно ценными для разработчиков и исследователей.

Одной из ключевых особенностей Evals является его архитектура. Оценка агентов происходит внутри контейнеризованных стеков, что обеспечивает изолированную и воспроизводимую среду для каждого теста. Это исключает влияние внешних факторов и гарантирует, что результаты тестов являются надежными и сопоставимыми. После выполнения задач, производительность агентов оценивается с помощью двух основных методов: детерминированных проверок и подхода "LLM-as-a-judge". Детерминированные проверки позволяют объективно оценить корректность и функциональность сгенерированного кода, в то время как метод "LLM-as-a-judge" использует другую большую языковую модель для более тонкой и контекстуальной оценки качества, стиля и эффективности решений, предложенных тестируемым агентом.

Открытый исходный код Evals под лицензией Apache-2.0 имеет огромное значение для всего сообщества разработчиков и исследователей ИИ. Он позволяет любому желающему изучать, модифицировать и вносить свой вклад в развитие бенчмарка, обеспечивая его постоянное улучшение и адаптацию к новым вызовам. Это также способствует повышению доверия к результатам оценки, поскольку методология является полностью прозрачной. В конечном итоге, Evals призван стать незаменимым инструментом для выбора наиболее подходящих ИИ-агентов для конкретных задач кодирования и для стимулирования дальнейших инноваций в области генерации кода с помощью ИИ.

Этот релиз от Supabase не только предоставляет ценный инструмент для оценки ИИ-моделей, но и подчеркивает растущую потребность в надежных и прозрачных бенчмарках в быстро развивающейся сфере искусственного интеллекта. По мере того как ИИ-агенты становятся все более способными к написанию и отладке кода, такие инструменты, как Evals, будут играть ключевую роль в обеспечении их качества, безопасности и эффективности для реальных приложений.

Подробнее на marktechpost.com →

Есть похожая задача? Опишите ее своими словами — вернемся с предварительной оценкой. Это ни к чему не обязывает.
Написать в Telegram