RPMs представляют собой инновационный подход к оптимизации использования вычислительных ресурсов, в частности дорогостоящих GPU-часов. Суть их работы заключается в том, что эти модели, функционирующие как "замороженные" LLM-судьи, способны ранжировать до 15 невыполненных кандидатов на эксперименты. Из этого списка RPMs выбирают только один наиболее перспективный эксперимент для фактического запуска, тем самым значительно сокращая объем ненужных вычислений.
Эффективность RPMs была продемонстрирована на бенчмарке AIRS-Bench, где они показали впечатляющие результаты. Средний нормализованный балл вырос с 0.684 до 0.729, что свидетельствует о существенном улучшении качества выбираемых экспериментов. Более того, благодаря применению RPMs, результаты, которые ранее достигались за 24 часа работы базовой системы, теперь могут быть получены примерно за 15 часов. Это означает значительную экономию времени и вычислительных ресурсов, что критически важно для ускорения темпов исследований в области машинного обучения.
Внедрение RPMs открывает новые горизонты для оптимизации исследовательского процесса в ИИ. Позволяя заранее оценивать потенциал экспериментов и выбирать наиболее перспективные, эти модели способствуют более рациональному распределению ресурсов и ускорению научного прогресса. Это особенно актуально в условиях постоянно растущих требований к вычислительной мощности для обучения и тестирования сложных моделей.
Meta FAIR представила RPMs: ранжирование ML-экспериментов до затрат GPU-часов