Google DeepMind heeft Gemini Ultra 2 uitgebracht en de benchmarkresultaten zijn ondubbelzinnig: voor het eerst sinds de lancering van GPT-4 in 2023 bekleedt een niet-OpenAI-model de toppositie in elke grote evaluatiesuite. De release markeert een echt keerpunt in de AI-race – en heeft aanzienlijke gevolgen voor bedrijven, ontwikkelaars en iedereen die in zijn dagelijkse werk afhankelijk is van grote taalmodellen.

De benchmark-sweep

Op MMLU (Massive Multitask Language Understanding) scoort Gemini Ultra 2 92,1%, vergeleken met de 90,8% van GPT-5. Op MATH is de kloof zelfs nog groter: 87,4% versus 84,2%. Het belangrijkste is dat Gemini Ultra 2 op de nieuwe GPQA Diamond-benchmark – ontworpen om wetenschappelijk redeneren op universitair niveau in de natuurkunde, scheikunde en biologie te testen – 71,3% behaalt, een volle 4 punten voorsprong op zijn naaste concurrent.

Dit zijn geen marginale verbeteringen. GPQA Diamond wordt algemeen beschouwd als de meest rigoureuze, publiekelijk beschikbare maatstaf voor wetenschappelijk redeneren, en een voorsprong van vier punten vertegenwoordigt een betekenisvolle capaciteitskloof. Onafhankelijke onderzoekers van het CRFM (Center for Research on Foundation Models) van Stanford, die hun eigen evaluaties uitvoerden, bevestigden de resultaten en merkten op dat Gemini Ultra 2 bijzonder sterk bleek te zijn bij meerstaps-redeneringstaken waarbij informatie over lange contexten moet worden geïntegreerd.

Multimodale dominantie

Waar Gemini Ultra 2 zich echt onderscheidt, zijn multimodale taken. Het model kan video, audio, afbeeldingen en tekst tegelijkertijd verwerken met een contextvenster van 2 miljoen tokens – het grootste van alle openbaar beschikbare modellen. In interne tests die in het technische rapport van Google zijn gepubliceerd, beantwoordde het correct gedetailleerde vragen over een drie uur durende documentaire nadat het deze in realtime had bekeken, waarbij het coherente begrip van de verhaallijn, karakterontwikkeling en feitelijke beweringen overal werd behouden.

Voor praktische toepassingen betekent dit dat Gemini Ultra 2 een volledige codebase kan analyseren, een volledig juridisch document kan beoordelen of een jaar aan financiële rapporten kan verwerken in één enkel contextvenster. De implicaties voor zakelijke gebruiksscenario’s – due diligence, compliancebeoordeling, onderzoekssynthese – zijn aanzienlijk.

De architectuur

Google heeft geen volledige architectonische details bekendgemaakt, maar heeft bevestigd dat Gemini Ultra 2 een mix-of-experts (MoE)-benadering gebruikt met in totaal 1,8 biljoen parameters, waarvan er ongeveer 280 miljard actief zijn op basis van een bepaalde gevolgtrekking. Deze architectuur – in principe vergelijkbaar met wat algemeen wordt aangenomen dat GPT-4 gebruikt – zorgt ervoor dat het model hoge kwaliteit kan bereiken tegen aanzienlijk lagere inferentiekosten dan een compact model met vergelijkbare capaciteiten.

De MoE-aanpak maakt ook een efficiëntere specialisatie mogelijk. Verschillende expertnetwerken binnen het model lijken te worden geactiveerd voor verschillende soorten taken – wetenschappelijk redeneren, het genereren van codes, creatief schrijven – waardoor het model gespecialiseerde capaciteit kan inzetten waar deze het meest nodig is in plaats van het gemiddelde te nemen van alle taken.

Prijzen en beschikbaarheid

Gemini Ultra 2 is beschikbaar via Google AI Studio en de Gemini API. De prijs is vastgesteld op $0,0125 per 1.000 invoertokens en $0,0375 per 1.000 uitvoertokens voor het volledige model – ongeveer vergelijkbaar met GPT-5 Turbo, maar met een aanzienlijk groter contextvenster zonder extra kosten. Een Gemini Ultra 2 Flash-variant, geoptimaliseerd voor snelheid en kosten, kost $ 0,00375 per 1.000 invoertokens.

Voor ontwikkelaars die al deel uitmaken van het Google-ecosysteem (met behulp van Vertex AI, Google Cloud of Workspace) is de integratie eenvoudig. Voor degenen op het OpenAI-platform vereist migratie API-wijzigingen, maar de prestatiewinst kan de overstap naar latentiegevoelige of kostengevoelige applicaties rechtvaardigen.

Wat dit betekent voor de AI-race

Het AI-landschap wordt al drie jaar gedomineerd door het verhaal van OpenAI. GPT-4 zette de maatstaf in 2023; GPT-4o verfijnde het in 2024; GPT-5 breidde het uit in 2025. Gemini Ultra 2 daagt dat verhaal niet alleen uit, het draait het om. Voor het eerst is een Google-model de duidelijke leider in de benchmarks die het belangrijkst zijn voor zakelijke kopers.

De gevolgen voor de concurrentie reiken verder dan benchmarks. De distributievoordelen van Google – integratie met Search, Workspace, Android en YouTube – geven Gemini Ultra 2 een implementatieoppervlak dat OpenAI niet kan evenaren via API-toegang alleen. Als het kwaliteitsvoordeel van het model standhoudt, is Google in de positie om zijn distributieschaal om te zetten in AI-marktaandeel op een manier die bij eerdere Gemini-generaties niet mogelijk was.

Voor bedrijven die de AI-infrastructuur evalueren, is de berekening fundamenteel veranderd. De vraag is niet langer of OpenAI moet worden gebruikt, maar of de ecosysteemvoordelen van OpenAI opwegen tegen de mogelijkheden en kostenvoordelen van Gemini Ultra 2. Dat is een veel moeilijkere vraag dan zes maanden geleden.

Bronnen en verder lezen