Команда FAIR в Meta, совместно с Университетом Оксфорда и Университетом колледжа Лондона, разработала модели предпочтений в исследовании ИИ (RPM), которые помогают в выборе наиболее перспективных экспериментов машинного обучения. Эти модели позволяют агентам предлагать, реализовывать и оценивать свои собственные эксперименты, что особенно важно, поскольку обучение одного кандидата может занять от нескольких часов до нескольких дней времени на GPU.
Основная задача RPM заключается в ранжировании неисполненных кандидатов и выборе одного для выполнения. Исследования показали, что языковые модели не всегда надежны в прогнозировании метрик или результатов выполнения, поэтому RPM не предсказывает абсолютные оценки. В настоящее время модели используют замороженные предварительно обученные LLM без дополнительной настройки, и их компоненты, такие как AIRA-dojo и AIRS-Bench, доступны в открытом доступе.
Внедрение RPM в процесс работы агентов позволяет оптимизировать исследовательские усилия, что может значительно ускорить прогресс в области машинного обучения. Это открытие подчеркивает важность эффективного распределения ресурсов в ИИ-исследованиях и может привести к более значительным результатам в будущем.