Google DeepMind wypuściło Gemini Ultra 2, a wyniki testów porównawczych są jednoznaczne: po raz pierwszy od premiery GPT-4 w 2023 r. model inny niż OpenAI zajmuje czołową pozycję we wszystkich głównych pakietach ewaluacyjnych. Ta aktualizacja stanowi prawdziwy punkt zwrotny w wyścigu sztucznej inteligencji i ma znaczące konsekwencje dla przedsiębiorstw, programistów i każdego, kto w swojej codziennej pracy korzysta z dużych modeli językowych.
Przegląd benchmarków
W teście MMLU (Massive Multitask Language Understanding) Gemini Ultra 2 uzyskał 92,1% w porównaniu do 90,8% w GPT-5. W przypadku MATH różnica jest jeszcze większa: 87,4% w porównaniu z 84,2%. Co najważniejsze, w nowym teście GPQA Diamond — zaprojektowanym w celu testowania rozumowania naukowego na poziomie absolwentów w zakresie fizyki, chemii i biologii — Gemini Ultra 2 osiąga 71,3%, czyli pełne 4 punkty przewagi nad najbliższym konkurentem.
Nie są to marginalne ulepszenia. Diament GPQA jest powszechnie uważany za najbardziej rygorystyczny, publicznie dostępny punkt odniesienia dla rozumowania naukowego, a 4-punktowa przewaga oznacza znaczącą lukę w możliwościach. Niezależni badacze z CRFM (Centrum Badań nad Modelami Podstawowymi) na Uniwersytecie Stanforda, którzy przeprowadzili własne oceny, potwierdzili wyniki, zauważając, że Gemini Ultra 2 wykazał się szczególną mocą w zadaniach wieloetapowego rozumowania, które wymagają integrowania informacji w długich kontekstach.
Dominacja multimodalna
Gemini Ultra 2 naprawdę wyróżnia się w zadaniach multimodalnych. Model może jednocześnie przetwarzać wideo, audio, obrazy i tekst za pomocą okna kontekstowego o pojemności 2 milionów tokenów — największego ze wszystkich publicznie dostępnych modeli. W wewnętrznych testach opublikowanych w raporcie technicznym Google poprawnie odpowiedział na szczegółowe pytania dotyczące 3-godzinnego filmu dokumentalnego po obejrzeniu go w czasie rzeczywistym, zachowując przez cały czas spójne zrozumienie wątku fabularnego, rozwoju postaci i twierdzeń faktycznych.
W zastosowaniach praktycznych oznacza to, że Gemini Ultra 2 może analizować całą bazę kodu, przeglądać cały dokument prawny lub przetwarzać roczne raporty finansowe w jednym oknie kontekstowym. Konsekwencje dla przypadków użycia w przedsiębiorstwach – należyta staranność, przegląd zgodności, synteza badań – są znaczne.
Architektura
Firma Google nie ujawniła pełnych szczegółów architektonicznych, ale potwierdziła, że Gemini Ultra 2 wykorzystuje podejście złożone z ekspertów (MoE) z 1,8 biliona całkowitych parametrów, z czego około 280 miliardów jest aktywnych przy dowolnym wnioskowaniu. Architektura ta — w zasadzie podobna do tej, którą powszechnie uważa się za wykorzystywaną przez GPT-4 — umożliwia modelowi osiągnięcie wysokiej jakości przy znacznie niższych kosztach wnioskowania niż gęsty model o równoważnych możliwościach.
Podejście Ministerstwa Środowiska umożliwia również skuteczniejszą specjalizację. Wydaje się, że różne sieci eksperckie w modelu aktywują się w przypadku różnych typów zadań — rozumowania naukowego, generowania kodu, kreatywnego pisania — umożliwiając modelowi zastosowanie wyspecjalizowanej zdolności tam, gdzie jest ona najbardziej potrzebna, zamiast uśredniać wszystkie zadania.
Ceny i dostępność
Gemini Ultra 2 jest dostępny poprzez Google AI Studio i Gemini API. Ceny ustalono na 0,0125 USD za 1000 tokenów wejściowych i 0,0375 USD za 1000 tokenów wyjściowych w przypadku pełnego modelu — mniej więcej porównywalne z GPT-5 Turbo, ale ze znacznie większym oknem kontekstowym dostępnym bez dodatkowych kosztów. Wariant Gemini Ultra 2 Flash, zoptymalizowany pod kątem szybkości i kosztów, kosztuje 0,00375 USD za 1000 tokenów wejściowych.
Dla programistów już pracujących w ekosystemie Google – korzystających z Vertex AI, Google Cloud lub Workspace – integracja jest prosta. W przypadku użytkowników platformy OpenAI migracja wymaga zmian w interfejsie API, ale wzrost wydajności może uzasadniać przejście na aplikacje wrażliwe na opóźnienia lub koszty.
Co to oznacza dla wyścigu AI
Od trzech lat krajobraz AI jest zdominowany przez narrację OpenAI. GPT-4 wyznaczył punkt odniesienia w 2023 r.; GPT-4o udoskonalił go w 2024 roku; GPT-5 rozszerzył tę funkcję w 2025 r. Gemini Ultra 2 nie tylko podważa tę narrację, ale ją odwraca. Po raz pierwszy model Google jest wyraźnym liderem w testach porównawczych, które są najważniejsze dla nabywców korporacyjnych.
Konsekwencje dla konkurencji wykraczają poza standardy referencyjne. Korzyści dystrybucyjne Google — integracja z Search, Workspace, Android i YouTube — dają Gemini Ultra 2 przestrzeń wdrożeniową, której OpenAI nie jest w stanie dorównać samym dostępem API. Jeśli przewaga jakościowa modelu się utrzyma, Google będzie w stanie przełożyć skalę dystrybucji na udział w rynku sztucznej inteligencji w sposób, który nie był możliwy w przypadku poprzednich generacji Gemini.
W przypadku przedsiębiorstw oceniających infrastrukturę AI kalkulacja uległa zasadniczej zmianie. Pytaniem nie jest już, czy używać OpenAI, ale czy zalety ekosystemu OpenAI przeważają nad możliwościami i kosztami Gemini Ultra 2. To znacznie trudniejsze pytanie niż sześć miesięcy temu.
Źródła i dalsze czytanie
- Google DeepMind — oficjalny przegląd techniczny i dokumentacja możliwości Gemini Ultra 2
- arXiv — Gemini: rodzina wysoce wydajnych modeli multimodalnych (oryginalny raport techniczny)
- Stanford CRFM HELM — niezależna holistyczna ocena modeli językowych, w tym Gemini
- Papers With Code — tabela liderów MMLU na żywo ze wszystkimi wynikami modeli
- Google AI Studio — aktualne ceny i limity stawek Gemini API