Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

DeepSeek AI представила обновленную модель DeepSeek-V4.1-Flash

DeepSeek AI выпустила новую версию своей модели DeepSeek-V4.1-Flash, которая предназначена для работы с длинными контекстами и оптимизирована для снижения нагрузки на память. Модель использует 552 миллиарда основных параметров и 196 миллиардов дополнительных параметров, обеспечивая окно контекста в 1 миллион токенов. Это позволяет эффективно управлять кэшами и снижать нагрузку на ресурсы, такие как HBM и SSD.

Новая модель активирует 8 миллиардов параметров на токен во время предварительной обработки и 16 миллиардов во время декодирования. Важным достижением является уменьшение объема кэширования до 890 байт на токен, что значительно меньше по сравнению с предыдущими версиями. DeepSeek-V4.1-Flash также доступна с открытыми весами под лицензией MIT, что позволяет разработчикам интегрировать ее в свои проекты через платформы, такие как Hugging Face.

Эта версия модели имеет значительное значение для разработчиков и исследователей в области искусственного интеллекта, так как она предлагает новые возможности для работы с большими объемами данных и сложными задачами. Оптимизация кэша и возможность использования различных уровней рассуждения делают DeepSeek-V4.1-Flash привлекательным инструментом для создания более эффективных AI-приложений.

Главное

  • DeepSeek-V4.1-Flash имеет 552 миллиарда основных параметров и 196 миллиардов дополнительных параметров.
  • Модель предлагает окно контекста в 1 миллион токенов.
  • Объем кэширования составляет 890 байт на токен, что в 437 раз меньше, чем у DeepSeek-V1.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →