Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Проверка теории LoRA файн‑тюнинга на активных слоях модели

В рамках исследования была проведена проверка теории улучшения результатов LoRA файн‑тюнинга, сосредоточив внимание на активных слоях модели. Обычно адаптеры применяются ко всем слоям, однако активность различных слоев может значительно варьироваться в зависимости от темы обработки промпта. Это исследование ставит под сомнение традиционный подход и предлагает альтернативный метод выбора слоев для повышения качества.

Эксперимент был проведен на модели Qwen3-1.7B, где использовался метод, описанный в статье Act‑LoRA. В дополнение к этому была добавлена новая метрика по градиентам, что позволило статистически проверить устойчивость сигнала. Результаты показали, что выбор более активных слоев может привести к значительному улучшению качества работы модели.

Данное исследование имеет важное значение для дальнейшего развития методов файн‑тюнинга в области искусственного интеллекта. Оно открывает новые перспективы для оптимизации моделей, что может привести к более эффективным решениям в различных приложениях, связанных с обработкой естественного языка и другими задачами.

Главное

  • Исследование проведено на модели Qwen3-1.7B.
  • Использован метод из статьи Act‑LoRA.
  • Добавлена новая метрика по градиентам для проверки устойчивости сигнала.

Важное из дайджеста

Открыть полный дайджест →