Gemini 3.8 Flash: обзор новой модели Google для программирования, агентов и кибербезопасности

808
Gemini 3.8 Flash: обзор новой модели Google для программирования, агентов и кибербезопасности

Google сделала с Gemini 3.8 Flash довольно странную вещь. Серия Flash раньше ассоциировалась прежде всего со скоростью и дешёвыми массовыми запросами, а теперь компания пытается превратить её в рабочую модель для многочасового программирования, автономных агентов и сложных цепочек действий. По отдельным тестам новая Flash действительно подходит вплотную к моделям значительно более высокого класса.

После изучения результатов я бы не называл Gemini 3.8 Flash просто «дешёвым аналогом Claude Opus». Сильная сторона модели уже не обычный чат и даже не генерация отдельной функции. Google явно оптимизировала 3.8 Flash под длинную работу, где модель читает проект, запускает инструменты, получает ошибку, исправляет код, снова запускает тесты и повторяет цикл. Именно в подобных задачах прирост оказался самым большим. В абстрактных тестах рассуждений революции при этом не произошло.

Что именно изменилось в Gemini 3.8 Flash

Google называет Gemini 3.8 Flash своей самой интеллектуальной моделью семейства Flash. Согласно официальной документации, модель принимает текст, изображения, аудио, видео и PDF, а возвращает текст. Контекст составляет 1 048 576 токенов, максимальный ответ достигает 65 536 токенов.

Большое окно контекста здесь полезно не столько для трюка «загрузить очень толстую книгу», сколько для работы с репозиториями, документацией, журналами событий и длинной историей действий агента. Модель поддерживает вызов функций, выполнение кода, поиск по файлам, структурированный вывод, поиск Google, работу с URL и предварительную поддержку управления компьютером.

Параметр Gemini 3.8 Flash
Контекст 1 048 576 токенов
Максимальный вывод 65 536 токенов
Входные данные текст, изображения, видео, аудио, PDF
Выполнение кода поддерживается
Вызов функций поддерживается
Поиск и работа с URL поддерживаются
Управление компьютером предварительная версия
Уровни рассуждений low, medium, high

Самое интересное изменение находится глубже. Gemini 3.8 Flash получила более настойчивое поведение при сложных заданиях. Google прямо пишет, что модель делает дополнительные шаги рассуждений, повторно вызывает инструменты и проверяет собственную работу. Для автономного агента такой подход полезнее, чем небольшой прирост способности правильно ответить с первой попытки.

У поведения есть цена. Чем усерднее модель проверяет себя, тем больше токенов расходует. Поэтому одинаковая цена за миллион токенов ещё не означает одинаковую стоимость выполненной задачи. Программа, которая раньше требовала пяти действий агента, а теперь вызывает восемь или десять, может обойтись дороже несмотря на неизменный тариф.

Разработчик управляет компромиссом через thinking_level. По умолчанию Google использует medium. Для простого чата, классификации или обработки большого потока данных можно выбрать low. Для сложного анализа кода и длинной последовательности действий пригодится high. Режим minimal, который присутствует у некоторых других Gemini, 3.8 Flash не поддерживает.

from google import genai
 from google.genai import types
 
 client = genai.Client()
 
 response = client.models.generate_content(
     model="gemini-3.8-flash",
     contents="""
     Проверь проект на ошибки обработки повторных транзакций. 
     Найди потенциальные состояния гонки и предложи исправление. 
     """,
     config=types.GenerateContentConfig(
         thinking_config=types.ThinkingConfig(
             thinking_level="medium"
         )
     )
 )
 
 print(response.text)

Такой параметр кажется мелочью, но для промышленного внедрения намного полезнее очередных красивых процентов в тестах. Один и тот же движок можно использовать как быстрый маршрутизатор простых запросов и как более дорогого агента для сложных задач.

Тесты выглядят впечатляюще, но не везде

Самый заметный скачок произошёл в заданиях, где модель должна работать с терминалом и инструментами. В опубликованной Google Cloud таблице испытаний Gemini 3.8 Flash получила 90,8% в Terminal-Bench 2.1 против 81,6% у Gemini 3.7 Flash. SWE-Atlas вырос с 48,0 до 51,9%, а SWE-Bench Pro лишь с 60,4 до 61,6%.

Тест Gemini 3.8 Flash Gemini 3.7 Flash
Terminal-Bench 2.1 90,8% 81,6%
SWE-Bench Pro 61,6% 60,4%
SWE-Atlas 51,9% 48,0%
τ³-bench Banking 38,1% 30,9%
CharXiv 86,2% 84,5%
Humanity's Last Exam 45,4% 45,7%

Последняя строка хорошо отрезвляет. На Humanity's Last Exam результат даже немного снизился. В другом варианте оценки, HLE-Verified, Google сообщает 54,9%, но смешивать HLE и HLE-Verified в одной сравнительной таблице нельзя. Методики отличаются.

Похожая путаница возникла вокруг Terminal-Bench. В материалах о запуске встречается значение 89,4%, тогда как актуальная документация Google Cloud указывает 90,8%. Без точного совпадения конфигурации запуска, версии набора заданий и вычислительного бюджета десятые доли процента вообще не имеют большого смысла. Поэтому утверждение «Gemini победила Opus на 0,3 процентного пункта» я бы воспринимал скорее как красивый заголовок, чем как доказательство превосходства модели.

Гораздо содержательнее картина целиком. Gemini 3.8 Flash сильно прибавила там, где требуется серия команд и самостоятельное исправление ошибок, умеренно выросла в работе с реальными репозиториями и почти не изменилась в универсальном экзамене на сложные знания и рассуждения. Значит, Google улучшила не «интеллект вообще», а конкретный режим работы.

Именно поэтому меня больше интересует DeepSWE v1.1, где проверяется длинная автономная разработка. Google сообщает, что Gemini 3.8 Flash обходит большинство более крупных передовых моделей. Подобные испытания ближе к тому, для чего сегодня покупают дорогих программных агентов, чем традиционная задача «напиши функцию сортировки».

Gemini 3.8 Flash Cyber выглядит даже интереснее обычной версии

Вместе с основной моделью Google выпустила Gemini 3.8 Flash Cyber. Версия предназначена для поиска уязвимостей, анализа больших кодовых баз и автоматического исправления ошибок безопасности. Свободного доступа к Cyber нет. Google распространяет модель через программу Fairwind среди проверенных разработчиков, операторов критической инфраструктуры, государственных организаций и других доверенных защитников.

Ограничение логично. Обычная Gemini 3.8 Flash сохраняет более строгие фильтры для потенциально опасных запросов в области кибербезопасности. Cyber получила более широкие возможности, необходимые исследователям защиты.

Информация о кибербезопасности в материале предназначена для легального анализа и защиты собственных систем. При работе с уязвимостями нужно соблюдать законодательство своей страны, включая российское законодательство, правила сервисов и разрешённые границы тестирования. Инструкции нельзя применять для несанкционированного доступа, слежки или взлома чужой инфраструктуры.

По данным Google DeepMind, на внутреннем наборе реальных уязвимостей в сложных проектах на 20 языках программирования Flash Cyber превысила 70% успешных обнаружений. Цифра впечатляет, но тест внутренний, поэтому независимо воспроизвести результат пока нельзя.

Интереснее внешний CWE-Bench, где проверяется способность не просто указать на проблему, а подготовить правильное исправление. Gemini 3.8 Flash Cyber получила 47,2% pass@1. Лучший сопоставляемый результат в опубликованном Google сравнении составляет 47,8%, но обходится заметно дороже.

Google уже применяет модель внутри компании. Команда безопасности Chrome сообщила, что Cyber подготовила в 2,6 раза больше правильных исправлений уязвимостей, чем лучшие протестированные ими крупные коммерческие модели. Wiz также заявила о росте полноты обнаружения на своём внутреннем тесте при меньшей стоимости. Оба результата интересны, хотя сравнение всё равно контролировали Google и её партнёры, а не независимая лаборатория.

Мне кажется, именно здесь находится наиболее важное направление развития Gemini. Модель безопасности ценна не потому, что может рассказать определение SQL-инъекции. Настоящая польза начинается, когда агент получает репозиторий на миллионы строк, строит гипотезу об уязвимости, прослеживает поток данных, воспроизводит ошибку, создаёт исправление и проверяет, что патч не сломал тесты.

Сколько стоит Gemini 3.8 Flash и кому она нужна

Сейчас Gemini 3.8 Flash стоит $0,75 за миллион входных токенов и $3,75 за миллион выходных токенов, причём в выходной тариф входят скрытые токены рассуждений. Цена рекламная и временная. Согласно тарифам Gemini API, затем ставка вырастет вдвое до $1,50 и $7,50 соответственно.

Последняя деталь сильно меняет оценку модели. Сравнивать Gemini с конкурентами только по текущей цене неправильно. Проект, который выбирает модель для эксплуатации на несколько лет, должен считать экономику уже по стандартному тарифу и учитывать, сколько внутренних токенов тратит medium или high.

Для обычного пользователя преимущества 3.8 Flash менее драматичны. Модель доступна подписчикам Google AI Pro и Ultra в Gemini, режиме ИИ поиска и некоторых сервисах Google. Если задача сводится к написанию письма, пересказу документа или простому вопросу, переход с предыдущей Flash вряд ли изменит жизнь.

Я бы выделил три сценария, где модель действительно выглядит интересной.

  • Программные агенты. Работа с репозиторием, терминалом, тестами и длинными цепочками исправлений.
  • Корпоративная автоматизация. Агенты, которые читают документы, вызывают внешние функции, проверяют результаты и выполняют много последовательных операций.
  • Защитный анализ кода. Поиск и исправление уязвимостей, особенно если организация получит доступ к Flash Cyber.

Главный риск тоже связан с автономностью. Чем больше прав получает агент, тем опаснее ошибка модели или внедрение вредоносной инструкции через документ, веб-страницу либо другой внешний источник. Google заявляет об улучшенной устойчивости Gemini 3.8 к внедрению инструкций, однако никакой тест не превращает автономного агента в доверенную программу. Права доступа, изоляция среды, журналы действий, ограничения инструментов и подтверждение критических операций всё равно нужны.

Есть и ещё одно ограничение, которое легко пропустить. Согласно карточке модели Google DeepMind, актуальность встроенных знаний неоднородна. Для части областей граница знаний доходит до марта, для других информация может быть существенно старше. Подключение поиска решает часть проблемы, но не превращает ответы без источников в гарантированно актуальные.

Мой вывод по Gemini 3.8 Flash поэтому довольно конкретный. Google не выпустила универсальную модель, которая внезапно стала лучше всех. Компания сделала более интересную вещь и перенесла способности дорогих агентных моделей в относительно дешёвый и быстрый класс Flash. Программистам и разработчикам автономных систем обновление стоит протестировать сразу. Пользователям обычного чата можно не спешить.

А заявления про «уровень Claude Opus» я бы оставил маркетологам. По отдельным тестам сравнение оправдано, по другим разница небольшая или прогресса относительно Gemini 3.7 вообще нет. Настоящая проверка начнётся не на диаграммах Google, а в репозиториях, где агенту придётся несколько часов подряд не терять контекст, правильно пользоваться инструментами и в конце действительно закончить работу.

Что такое Gemini 3.8 Flash?

Gemini 3.8 Flash представляет собой быструю модель Google, ориентированную на программирование, автономных агентов, сложные многоэтапные задачи и корпоративные сценарии.

Чем Gemini 3.8 Flash лучше Gemini 3.7 Flash?

Наибольший прирост Google показывает в работе с терминалом, инструментами и длинными агентными задачами. В отдельных универсальных тестах рассуждений разница с Gemini 3.7 Flash минимальна.

Какой размер контекста у Gemini 3.8 Flash?

Модель принимает до 1 048 576 токенов контекста и может сформировать ответ размером до 65 536 токенов.

Сколько стоит API Gemini 3.8 Flash?

В период действия вводного тарифа Google берёт $0,75 за миллион входных токенов и $3,75 за миллион выходных токенов. В дальнейшем стандартная цена должна составить $1,50 и $7,50 соответственно.

Что такое Gemini 3.8 Flash Cyber?

Gemini 3.8 Flash Cyber представляет собой специализированную версию для защитного анализа кода, поиска уязвимостей и подготовки исправлений. Доступ ограничен проверенными участниками программы Google Fairwind.

Можно ли считать Gemini 3.8 Flash аналогом Claude Opus?

По отдельным тестам программирования и агентной работы результаты действительно близки. Универсального превосходства результаты не показывают, поэтому сравнивать модели лучше на конкретных рабочих задачах, а не по одному тесту.

Gemini Google нейросеть программирование агент кибербезопасность модель API
Alt text
Обращаем внимание, что все материалы в этом блоге представляют личное мнение их авторов. Редакция SecurityLab.ru не несет ответственности за точность, полноту и достоверность опубликованных данных. Вся информация предоставлена «как есть» и может не соответствовать официальной позиции компании.
DCAP
Вебинар 10 сентября · 11:00

Новые возможности Гарда DCAP

Эксперты обсудят, как датацентричный подход помогает навести порядок в корпоративных хранилищах.

Принять участие
Реклама. ООО «Гарда Технологии», ИНН 5260443081. 16+