Автор эксперимента поделился опытом создания визуально-языковой модели (VLM) с ограниченным бюджетом и одной арендованной GPU. Он использовал небольшую языковую модель и подключил к ней визуальный энкодер, что позволило ему пройти все этапы обучения, начиная от настройки архитектуры до оценки качества ответов.
В процессе работы автор столкнулся с рядом ошибок, которые были подробно разобраны в статье. Он также представил результаты модели, обученной на 628 миллионах параметров, которая научилась описывать изображения, затратив всего около $200 на обучение.
Этот эксперимент демонстрирует, что создание сложных моделей возможно даже с ограниченными ресурсами. Подобные исследования могут вдохновить других разработчиков и исследователей на эксперименты в области искусственного интеллекта, открывая новые возможности для создания доступных технологий.