Universidades

Universidad Panamericana: Los modelos de IA compiten en inteligencia, velocidad y precio, pero los rankings muestran que el ganador cambia según la forma en que los evaluemos

La mejor inteligencia artificial no existe: todo depende de lo que necesitemos

La pregunta aparece cada vez con más frecuencia: ¿cuál es actualmente la mejor inteligencia artificial?

La respuesta corta es que no existe una sola.

Elegir una inteligencia artificial comienza a parecerse más a elegir un automóvil que a coronar a un campeón. El vehículo más potente no necesariamente es el más económico; el más rápido tampoco tiene por qué ser el más cómodo, y probablemente no elegiríamos el mismo para circular por la ciudad que para competir en una pista.

Algo parecido ocurre con los modelos de inteligencia artificial.

Actualmente existen cientos de versiones de modelos desarrollados por empresas como OpenAI, Google, Anthropic, xAI, DeepSeek y otras compañías. Para compararlos han surgido plataformas especializadas que los someten a diferentes pruebas.

Una de las más conocidas es Artificial Analysis, un sitio independiente que evalúa modelos de inteligencia artificial considerando no solamente qué tan capaces son para responder preguntas, sino también aspectos como programación, razonamiento, uso de herramientas, velocidad y costo.

En su medición del 6 de octubre de 2026, Claude Opus 5.5, desarrollado por Anthropic, aparece al frente de su índice general de inteligencia.

Pero eso no quiere decir que pueda proclamarse simplemente como “la mejor inteligencia artificial del mundo”.

El problema —o quizá la parte más interesante— es que el resultado cambia cuando modificamos lo que queremos medir.

¿Inteligencia o preferencia?

Artificial Analysis utiliza pruebas diseñadas para evaluar tareas relativamente complejas. Algunas requieren trabajar con documentos, utilizar herramientas, programar, resolver problemas científicos o completar actividades de varios pasos.

Sin embargo, existe otro conocido sistema de evaluación, Arena, que utiliza una lógica diferente: presenta respuestas de distintos modelos a los usuarios sin revelar inicialmente cuál produjo cada una y les pide elegir cuál prefieren.

Y ahí el resultado cambia.

Mientras Claude Opus encabeza las evaluaciones de Artificial Analysis, Gemini 4 Argon, de Google, aparece en primer lugar en las evaluaciones de preferencia humana de Arena.

Ninguno de los dos resultados necesariamente está equivocado.

Simplemente están contestando preguntas diferentes.

Una evaluación intenta determinar qué tan bien puede resolver un modelo una serie de tareas. La otra intenta descubrir qué respuestas agradan más a quienes las leen.

Es una diferencia importante, porque cuando una persona utiliza inteligencia artificial para redactar un correo electrónico, buscar ideas, programar una aplicación o analizar información científica, probablemente necesita cualidades distintas.

Ser un poco mejor puede costar mucho más

Otro de los datos interesantes aparece cuando se compara la capacidad de los modelos con su costo.

Los modelos que ocupan los primeros lugares no necesariamente ofrecen la mejor relación entre precio y desempeño.

Por ejemplo, Claude Opus 5.5 encabeza la clasificación general de Artificial Analysis. Sin embargo, otros modelos se acercan bastante a su desempeño por un costo mucho menor.

GPT-6.1 Sol consigue alrededor del 90 por ciento de la puntuación de Claude Opus 5.5, pero ejecutar las mismas pruebas cuesta aproximadamente una octava parte. MiMo-V2.6-Pro alcanza cerca del 80 por ciento de esa puntuación con un costo todavía menor.

La comparación deja una idea sencilla: obtener un poco más de capacidad puede resultar muy caro. Para muchas personas, universidades o empresas, quizá no sea necesario pagar por el modelo que ocupa el primer lugar si otro puede resolver casi igual de bien la tarea por una fracción del precio.

Tampoco la más rápida es necesariamente la mejor

Algo similar sucede con la velocidad.

Artificial Analysis distingue entre diferentes formas de medirla. Una cosa es la rapidez con la que un modelo comienza a contestar y otra muy diferente la velocidad con la que genera texto una vez que inicia la respuesta.

En las pruebas analizadas, Gemini 3.8 Flash destaca por la cantidad de texto que puede generar por segundo, mientras DeepSeek V4.1 Flash sobresale por comenzar a responder rápidamente y completar sus respuestas en menos tiempo.

Esto puede parecer una diferencia menor, pero cualquiera que haya utilizado recientemente herramientas de inteligencia artificial habrá experimentado esta situación: algunos modelos comienzan inmediatamente a escribir, mientras otros parecen quedarse “pensando” durante varios segundos —o incluso minutos— antes de mostrar el primer resultado.

Para una conversación cotidiana probablemente resulte más agradable un sistema que reacciona rápidamente. Para resolver un problema complejo, en cambio, quizá estemos dispuestos a esperar.

Incluso la especialización cambia el ranking

Las diferencias se vuelven todavía más evidentes cuando se analiza para qué queremos utilizar la inteligencia artificial.

Claude Opus obtiene resultados particularmente altos en evaluaciones relacionadas con finanzas, derecho, salud, ingeniería, economía y estrategia.

Pero cuando las pruebas se concentran en ciberdefensa, el orden cambia y modelos como Grok y MiMo aparecen en las primeras posiciones.

Esto demuestra que hablar de “la inteligencia” de un modelo puede ser engañoso.

Un sistema puede sobresalir en programación y no necesariamente hacerlo en escritura. Otro puede ser extraordinariamente rápido, pero menos preciso. Algunos pueden ofrecer mejores resultados, aunque sean considerablemente más caros.

¿Entonces cuál deberíamos utilizar?

Quizá la pregunta debería plantearse de otra manera.

En lugar de preguntar simplemente “¿cuál es la mejor inteligencia artificial?”, sería más útil preguntarnos:

¿Cuál es la mejor para lo que necesito hacer?

Para una persona que utiliza inteligencia artificial ocasionalmente para redactar textos o consultar información, probablemente importará la facilidad de uso y la calidad de las respuestas.

Para un programador será mucho más relevante su capacidad para escribir y corregir código.

Para una empresa que procesa miles de consultas diariamente, una pequeña diferencia en el precio puede convertirse en miles o millones de dólares.

Y para quienes trabajan con información sensible quizá la privacidad, las políticas de seguridad o la posibilidad de utilizar modelos con pesos abiertos resulten más importantes que ocupar el primer lugar de un ranking.

Hay además una precaución especialmente importante para quienes utilizamos estas tecnologías en México: buena parte de estas evaluaciones se realiza principalmente en inglés.

Un modelo extraordinario en un benchmark internacional no necesariamente tendrá exactamente el mismo desempeño cuando trabaja con español, mexicanismos, contextos locales o formas particulares de comunicación.

Los rankings, por tanto, deben entenderse como fotografías parciales de una competencia que cambia prácticamente cada semana.

Hoy un modelo puede aparecer primero en determinada prueba y mañana otro puede superarlo.

La verdadera transformación quizá no esté en descubrir quién ocupa temporalmente el primer lugar, sino en comprender que estamos entrando en una etapa en la que tendremos numerosas inteligencias artificiales disponibles y tendremos que aprender a elegirlas de acuerdo con cada tarea.

Tal vez por eso la pregunta del futuro no será “¿cuál es la mejor inteligencia artificial?”, sino algo mucho más cotidiano: “¿Cuál me conviene usar para esto?”

Lo más relevante en México