Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Gemini 4 демонстрирует лидерство в бенчмарках, но его реальная эффективность под вопросом

Модель Gemini 4 Argon от Google продемонстрировала лидерство в 12 из 18 бенчмарков, что подчеркивает её высокие показатели в тестовых условиях. Тем не менее, аналогичная ситуация наблюдалась с предыдущей моделью Gemini 3.1 Pro, которая в итоге показала значительно худшие результаты в реальных задачах, уступив конкуренту Claude более чем на 300 очков.

Ситуация с Gemini 4 вызывает вопросы о том, насколько результаты бенчмарков отражают реальную производительность моделей. В последние годы наблюдается тенденция, при которой успехи в тестах не всегда коррелируют с эффективностью в практическом применении. Это может быть связано с изменениями в подходах к оценке моделей и их адаптацией к специфическим задачам.

Важно учитывать, что победа в бенчмарках не всегда является гарантией успешного выполнения реальных задач. Это подчеркивает необходимость более глубокого анализа и тестирования моделей в условиях, приближенных к реальным, чтобы избежать недопонимания их истинных возможностей.

Главное

  • Gemini 4 Argon лидирует в 12 из 18 тестов.
  • Gemini 3.1 Pro проиграла Claude более чем на 300 очков в реальной работе.
  • Тенденция показывает, что успехи в бенчмарках становятся менее значительными для оценки реальной эффективности.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →