Supabase выпустила Evals: открытый бенчмарк для оценки LLM-кодеров

Supabase, известная платформа для разработки, сделала значительный шаг вперед в области оценки искусственного интеллекта, представив свой новый проект с открытым исходным кодом — `supabase/evals`. Этот бенчмарк и фреймворк, распространяемый под лицензией Apache-2.0…
Первоисточник xadmin.dev
Есть похожая задача? Опишите ее своими словами — вернемся с предварительной оценкой. Это ни к чему не обязывает.
Написать в Telegram