Skip to main content
Los benchmarks son fundamentales para medir en Phaseo la calidad y el progreso de los modelos. Ofrecen métricas objetivas y reproducibles que permiten comparar el rendimiento de los modelos entre tareas, ámbitos y proveedores, desde razonamiento y programación hasta comprensión del lenguaje y reconocimiento de imágenes.

Qué son los benchmarks

Un benchmark es un conjunto de datos o una evaluación diseñada para medir el rendimiento de un modelo en una tarea concreta. Si ejecutamos varios modelos con el mismo conjunto de datos, podemos medir sus fortalezas y debilidades relativas. Algunos ejemplos comunes:
  • 🧠 MMLU (Massive Multitask Language Understanding) — evalúa los conocimientos generales y el razonamiento.
  • 🔢 GSM8K — evalúa el razonamiento matemático y la resolución de problemas.
  • 💬 HellaSwag — evalúa el sentido común y la comprensión contextual.
  • 🧮 ARC-Challenge — mide el razonamiento científico y la lógica.
  • 💡 HumanEval — evalúa las habilidades de programación y generación de código.

Cómo gestiona Phaseo los benchmarks

Phaseo recopila datos de benchmarks de varias fuentes públicas e informes oficiales, y después los estandariza en un formato coherente. La sección de benchmarks de cada modelo incluye:
  • Valor de la puntuación — suele expresarse como porcentaje o en una escala normalizada.
  • Fuente del conjunto de datos — por ejemplo, MMLU, GSM8K, etc.
  • Método de evaluación — indica cómo se obtuvo la puntuación (informe oficial, evaluación de terceros o contribución de la comunidad).
  • Última actualización — indica cuándo se actualizaron por última vez los datos del benchmark.

Ejemplo de página de benchmark


Categorías de benchmarks

Los benchmarks se agrupan en categorías que representan la habilidad evaluada:

Cómo interpretar las puntuaciones

Ten en cuenta que algunos benchmarks usan sistemas de puntuación diferentes. Phaseo los normaliza cuando es posible para que las comparaciones sean más útiles.

Visualizar benchmarks en Phaseo

Los resultados de los benchmarks se visualizan mediante:
  • 📊 Gráficos de barras para comparar modelos dentro del mismo conjunto de datos.
  • 📈 Gráficos de tendencias que muestran las mejoras de los modelos con el tiempo.
  • 🧮 Puntuaciones agregadas para resumir el rendimiento en varios conjuntos de datos.
Cada conjunto de datos de benchmark de Phaseo incluye filtros para:
  • Tipo de modelo (chat, código, embeddings, etc.)
  • Proveedor
  • Año de lanzamiento
  • Categoría del conjunto de datos
Así puedes identificar rápidamente patrones, como qué familias dominan las tareas de razonamiento o programación.

Fuentes de datos y metodología

Phaseo reúne datos de benchmarks procedentes de:
  • Artículos de investigación e informes de modelos oficiales.
  • Páginas de evaluación de proveedores (OpenAI Evals, Anthropic Reports, etc.).
  • Conjuntos de datos abiertos de la comunidad (por ejemplo, tablas de clasificación de Hugging Face).
  • Envíos directos de usuarios a través de GitHub.
Todos los datos se estandarizan y verifican antes de publicarse. Consulta Investigación y metodología → Metodología de benchmarks para obtener todos los detalles.

Ejemplos de uso


Contribuir con datos de benchmarks

Abre una incidencia en GitHub con pruebas de resultados de benchmarks nuevos o corregidos. Cada envío se revisa antes de incluirlo para garantizar la coherencia y la precisión.

Contribuir con datos de benchmarks

Consulta qué pruebas incluir en una incidencia de benchmarks.

Siguientes pasos

Cuando comprendas cómo funcionan los datos de benchmarks, podrás explorar los proveedores de API que permiten acceder a estos modelos mediante programación.

Explorar proveedores de API

Consulta dónde se alojan los modelos, cuánto cuestan y cómo se accede a ellos.
Última modificación el 2 de octubre de 2026