Google DeepMind lanzó Gemini Ultra 2 y los resultados de las pruebas comparativas son inequívocos: por primera vez desde el lanzamiento de GPT-4 en 2023, un modelo que no es OpenAI ocupa la primera posición en todos los principales conjuntos de evaluaciones. El lanzamiento marca un verdadero punto de inflexión en la carrera de la IA y tiene importantes implicaciones para las empresas, los desarrolladores y cualquiera que dependa de grandes modelos de lenguaje en su trabajo diario.

El barrido de referencia

En MMLU (Comprensión masiva del lenguaje multitarea), Gemini Ultra 2 obtiene una puntuación del 92,1%, en comparación con el 90,8% de GPT-5. En MATEMÁTICAS, la brecha es aún mayor: 87,4% frente a 84,2%. Lo más significativo es que en el nuevo punto de referencia GPQA Diamond, diseñado para evaluar el razonamiento científico de posgrado en física, química y biología, Gemini Ultra 2 logra un 71,3%, 4 puntos por delante de su competidor más cercano.

Estas no son mejoras marginales. GPQA Diamond es ampliamente considerado como el punto de referencia más riguroso disponible públicamente para el razonamiento científico, y una ventaja de 4 puntos representa una brecha de capacidad significativa. Investigadores independientes del CRFM (Centro de Investigación sobre Modelos de Fundamentos) de Stanford que realizaron sus propias evaluaciones confirmaron los resultados y señalaron que Gemini Ultra 2 mostró una fortaleza particular en tareas de razonamiento de varios pasos que requieren la integración de información en contextos prolongados.

Dominio multimodal

Donde realmente se distingue Gemini Ultra 2 es en tareas multimodales. El modelo puede procesar video, audio, imágenes y texto simultáneamente con una ventana de contexto de 2 millones de tokens, la más grande de cualquier modelo disponible públicamente. En las pruebas internas publicadas en el informe técnico de Google, respondió correctamente preguntas detalladas sobre un documental de 3 horas después de verlo en tiempo real, manteniendo una comprensión coherente del arco narrativo, el desarrollo de los personajes y las afirmaciones fácticas en todo momento.

Para aplicaciones prácticas, esto significa que Gemini Ultra 2 puede analizar una base de código completa, revisar un documento legal completo o procesar informes financieros de un año en una única ventana de contexto. Las implicaciones para los casos de uso empresarial (diligencia debida, revisión del cumplimiento, síntesis de investigaciones) son sustanciales.

La Arquitectura

Google no ha revelado todos los detalles arquitectónicos, pero ha confirmado que Gemini Ultra 2 utiliza un enfoque de mezcla de expertos (MoE) con 1,8 billones de parámetros totales, de los cuales aproximadamente 280 mil millones están activos en cualquier inferencia determinada. Esta arquitectura, similar en principio a la que se cree que utiliza GPT-4, permite que el modelo alcance una alta calidad a un costo de inferencia significativamente menor que un modelo denso de capacidad equivalente.

El enfoque del MoE también permite una especialización más eficiente. Diferentes redes de expertos dentro del modelo parecen activarse para diferentes tipos de tareas (razonamiento científico, generación de códigos, escritura creativa), lo que permite que el modelo aplique capacidad especializada donde más se necesita en lugar de promediar todas las tareas.

Precios y disponibilidad

Gemini Ultra 2 está disponible a través de Google AI Studio y la API de Gemini. El precio se establece en $ 0,0125 por 1000 tokens de entrada y $ 0,0375 por 1000 tokens de salida para el modelo completo, aproximadamente comparable al GPT-5 Turbo pero con una ventana de contexto significativamente más grande incluida sin costo adicional. Una variante Gemini Ultra 2 Flash, optimizada en cuanto a velocidad y costo, tiene un precio de $0,00375 por cada 1000 tokens de entrada.

Para los desarrolladores que ya están en el ecosistema de Google (que utilizan Vertex AI, Google Cloud o Workspace), la integración es sencilla. Para aquellos en la plataforma OpenAI, la migración requiere cambios de API, pero las ganancias de rendimiento pueden justificar el cambio para aplicaciones sensibles a la latencia o al costo.

Qué significa esto para la carrera de la IA

El panorama de la IA ha estado dominado por la narrativa de OpenAI durante tres años. GPT-4 marcó el punto de referencia en 2023; GPT-4o lo refinó en 2024; GPT-5 lo amplió en 2025. Gemini Ultra 2 no solo desafía esa narrativa, sino que la invierte. Por primera vez, un modelo de Google es el líder indiscutible en los puntos de referencia que más importan a los compradores empresariales.

Las implicaciones competitivas se extienden más allá de los puntos de referencia. Las ventajas de distribución de Google (integración con Search, Workspace, Android y YouTube) le dan a Gemini Ultra 2 una superficie de implementación que OpenAI no puede igualar solo mediante el acceso API. Si la ventaja en la calidad del modelo se mantiene, Google está posicionado para convertir su escala de distribución en participación de mercado de IA de una manera que no ha sido posible con las generaciones anteriores de Gemini.

Para las empresas que evalúan la infraestructura de IA, el cálculo ha cambiado fundamentalmente. La pregunta ya no es si usar OpenAI, sino si las ventajas del ecosistema de OpenAI superan las ventajas de capacidad y costos de Gemini Ultra 2. Ésta es una pregunta mucho más difícil que hace seis meses.

Fuentes y lecturas adicionales