Volver al blog

Grok 4.5 y la tentación de un cuarto laboratorio de IA, lo que debería evaluar el gerente de TI antes de sumarlo a sus agentes

julio de 2026
Enlace copiado

El 8 de julio, mientras la mayoría de los equipos de tecnología en Chile seguían de cerca los anuncios de OpenAI y Anthropic, apareció un cuarto nombre en la conversación. SpaceXAI, la compañía que hasta hace poco se llamaba simplemente xAI, lanzó Grok 4.5 y lo hizo con un argumento directo, un modelo con el nivel de un Opus, pero más rápido, más eficiente en tokens y más barato. Para un gerente de TI que ya tiene agentes corriendo en producción sobre dos o tres proveedores distintos, la pregunta que sigue no es si el anuncio suena bien. Es si vale la pena tocar algo que ya funciona.

Profesional de TI revisando servidores en un centro de datos empresarial

Elon Musk describió el modelo en una publicación en X como "un modelo de la clase de Opus, pero más rápido, más eficiente en tokens y de menor costo", en referencia directa a lo que hasta hace poco era el modelo insignia de Anthropic. Según reportó Axios, es el primer lanzamiento importante de la compañía desde que salió a bolsa y adquirió Cursor, la startup de programación asistida por IA con la que entrenó este modelo. La empresa lo presenta explícitamente como una herramienta para programación, tareas agénticas y trabajo de conocimiento, no como un chatbot de consumo masivo.

El argumento de precio es concreto. Grok 4.5 cuesta 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida. Como referencia, Claude Opus 4.8 de Anthropic cuesta 5 dólares de entrada y 25 de salida, y GPT 5.6 Luna de OpenAI cuesta 1 dólar de entrada y 6 de salida, de acuerdo con la misma nota de Axios. SpaceXAI reconoce, eso sí, que su modelo todavía no supera a los modelos más grandes y recientes de sus dos competidores en las tareas más exigentes, solo les gana en velocidad, precio y rendimiento relativo. Musk espera revertir eso pronto con un modelo de próxima generación de 2 billones de parámetros que ya estaría terminando su entrenamiento inicial.

Grok 4.5 cobra USD 2 de entrada y USD 6 de salida por millon de tokens

Hay un detalle que conviene no pasar por alto antes de entusiasmarse con el ahorro. Grok 4.5 todavía no está disponible en la Unión Europea, y las comparaciones de rendimiento que acompañan el anuncio provienen de la propia SpaceXAI, no de un benchmark independiente todavía verificado por terceros. Un gráfico publicado por la compañía muestra a Grok 4.5 superando a Opus 4.8 en varias pruebas puntuales, pero esas cifras todavía no tienen el mismo nivel de escrutinio externo que acompaña a un lanzamiento de OpenAI o Anthropic con meses en el mercado. Para un equipo de TI, la diferencia entre precio de lista y rendimiento verificado en producción es exactamente el tipo de brecha que termina costando caro si se decide migrar sin probar primero.

Hay además una capa adicional que pocas notas mencionan. El mismo cómputo que SpaceXAI usó para entrenar Grok 4.5 es, en parte, cómputo que la compañía le arrienda a Anthropic y a Google. A medida que sus propias necesidades de cómputo crezcan, SpaceXAI va a tener que decidir entre reservar esa capacidad para sus propios modelos o seguir arrendándola como fuente de ingresos a los mismos competidores que busca desplazar. Es un dato que no cambia el precio de hoy, pero sí explica por qué la carrera de precios entre laboratorios probablemente no se detenga aquí.

Comparacion de precio por millon de tokens de salida entre Grok 4.5 y Claude Opus 4.8

Para una empresa que ya corre agentes de IA todos los días, el problema real no es si Grok 4.5 es bueno. Es que ahora hay cuatro laboratorios serios compitiendo por el mismo cliente empresarial, cada uno con su propia cadencia de lanzamientos, su propia estructura de precios y sus propias promesas de rendimiento. Cambiar de modelo cada vez que aparece una cifra más barata suena razonable en una hoja de cálculo, pero en la práctica implica volver a probar cada flujo de trabajo, revisar si las respuestas mantienen la misma calidad y confirmar que ninguna integración se rompe en el camino.

Un ejemplo ayuda a ver por qué esto importa en la operación diaria y no solo en la comparación de precios. Atlas, el agente de base de conocimiento interna de AgentLayer, responde consultas de equipos completos sobre políticas, contratos y catálogos técnicos las 24 horas, con acceso segmentado según el rol de cada persona. Es exactamente el tipo de trabajo de conocimiento y razonamiento agéntico donde SpaceXAI dice que Grok 4.5 rinde mejor. Pero antes de mover un agente como Atlas a un modelo nuevo, hay que confirmar que mantiene la misma precisión citando la fuente correcta y respetando los permisos de cada equipo, no solo que responde más rápido o más barato en una demo.

Por eso, cada vez que un laboratorio lanza un modelo nuevo, en AgentLayer se evalúa contra los agentes que ya están en producción antes de decidir si conviene migrar. No se trata de subirse a cada anuncio ni de ignorarlos por rutina, sino de correr la misma suite de casos reales que ya usa cada agente y comparar resultado contra resultado. Grok 4.5 puede terminar siendo una opción válida para ciertos flujos de trabajo agénticos una vez que sus cifras de rendimiento se verifiquen de forma independiente. Hoy, para un gerente de TI con agentes funcionando bien, la disciplina de probar antes de migrar vale más que la tentación de ahorrar unos centavos por millón de tokens.