Google DeepMind выпустила Gemini Ultra 2, и результаты тестов однозначны: впервые с момента запуска GPT-4 в 2023 году модель, отличная от OpenAI, занимает лидирующие позиции во всех основных оценочных пакетах. Этот релиз знаменует собой настоящий переломный момент в гонке ИИ и имеет серьезные последствия для предприятий, разработчиков и всех, кто полагается на большие языковые модели в своей повседневной работе.
Эталонный анализ
По MMLU (массовое многозадачное понимание языка) Gemini Ultra 2 набрал 92,1% по сравнению с 90,8% у GPT-5. По математике разрыв еще больше: 87,4% против 84,2%. Что наиболее важно, по новому тесту GPQA Diamond, предназначенному для проверки научных рассуждений выпускников в области физики, химии и биологии, Gemini Ultra 2 набирает 71,3%, что на целых 4 балла опережает своего ближайшего конкурента.
Это не незначительные улучшения. GPQA Diamond широко считается наиболее строгим общедоступным эталоном научных рассуждений, а преимущество в 4 балла представляет собой значительный пробел в возможностях. Независимые исследователи из Стэнфордского CRFM (Центра исследований фундаментальных моделей), которые провели собственные оценки, подтвердили результаты, отметив, что Gemini Ultra 2 показал особую эффективность в многоэтапных задачах рассуждения, требующих интеграции информации в длинных контекстах.
Мультимодальное доминирование
В чем Gemini Ultra 2 действительно выделяется, так это в мультимодальных задачах. Модель может обрабатывать видео, аудио, изображения и текст одновременно с помощью контекстного окна размером 2 миллиона токенов — самого большого из всех общедоступных моделей. В ходе внутренних тестов, опубликованных в техническом отчете Google, он правильно ответил на подробные вопросы о трехчасовом документальном фильме после просмотра его в реальном времени, сохраняя четкое понимание сюжетной линии, развития персонажей и фактических утверждений на всем протяжении.
Для практических приложений это означает, что Gemini Ultra 2 может анализировать всю кодовую базу, просматривать полный юридический документ или обрабатывать финансовые отчеты за год в одном контекстном окне. Последствия для сценариев корпоративного использования — комплексная проверка, проверка соответствия, синтез результатов исследований — существенны.
Архитектура
Google не раскрыл полных деталей архитектуры, но подтвердил, что Gemini Ultra 2 использует подход смешанных экспертов (MoE) с 1,8 триллионами общих параметров, из которых примерно 280 миллиардов активны для любого конкретного вывода. Эта архитектура, в принципе аналогичная той, которую, как широко полагают, использует GPT-4, позволяет модели достичь высокого качества при значительно меньших затратах на вывод, чем плотная модель с эквивалентными возможностями.
Подход Министерства образования также обеспечивает более эффективную специализацию. Различные экспертные сети в модели активируются для разных типов задач — научных рассуждений, генерации кода, творческого письма — что позволяет модели применять специализированные возможности там, где они больше всего необходимы, а не усреднять все задачи.
Цены и доступность
Gemini Ultra 2 доступен через Google AI Studio и Gemini API. Цена установлена на уровне 0,0125 доллара США за 1000 входных токенов и 0,0375 доллара США за 1000 выходных токенов для полной модели — примерно сопоставимо с GPT-5 Turbo, но со значительно большим контекстным окном без дополнительных затрат. Вариант Gemini Ultra 2 Flash, оптимизированный по скорости и стоимости, стоит 0,00375 доллара США за 1000 входных токенов.
Для разработчиков, уже работающих в экосистеме Google, использующих Vertex AI, Google Cloud или Workspace, интеграция проста. Для тех, кто использует платформу OpenAI, миграция требует изменений API, но прирост производительности может оправдать переход на чувствительные к задержке или чувствительные к стоимости приложения.
Что это значит для расы ИИ
В сфере искусственного интеллекта уже три года доминирует идея OpenAI. GPT-4 установил эталон в 2023 году; GPT-4o доработал его в 2024 году; GPT-5 расширил его в 2025 году. Gemini Ultra 2 не просто бросает вызов этому повествованию — он переворачивает его. Впервые модель Google стала явным лидером по критериям, которые наиболее важны для корпоративных покупателей.
Последствия для конкуренции выходят за рамки контрольных показателей. Преимущества распространения Google — интеграция с Search, Workspace, Android и YouTube — дают Gemini Ultra 2 поверхность развертывания, с которой OpenAI не может сравниться только через доступ к API. Если преимущество в качестве модели сохранится, Google сможет преобразовать масштаб своего распространения в долю рынка ИИ, что было невозможно с предыдущими поколениями Gemini.
Для предприятий, оценивающих инфраструктуру искусственного интеллекта, расчеты фундаментально изменились. Вопрос больше не в том, использовать ли OpenAI, а в том, перевешивают ли преимущества экосистемы OpenAI возможности и ценовые преимущества Gemini Ultra 2. Это гораздо более сложный вопрос, чем шесть месяцев назад.
Источники и дополнительная литература
- Google DeepMind — официальный технический обзор Gemini Ultra 2 и документация по возможностям
- arXiv — Gemini: семейство высокофункциональных мультимодальных моделей (оригинальный технический отчет)
- Stanford CRFM HELM — независимая целостная оценка языковых моделей, включая Gemini
- Papers With Code — живая таблица лидеров MMLU со всеми оценками моделей
- Google AI Studio — текущие цены и ограничения Gemini API