> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Explorar benchmarks

> Descubre cÃ³mo se recopilan, estandarizan y visualizan en Phaseo los benchmarks de modelos de IA.

Los benchmarks son fundamentales para medir en Phaseo la calidad y el progreso de los modelos.
Ofrecen **mÃ©tricas objetivas y reproducibles** que permiten comparar el rendimiento de los modelos entre tareas, Ã¡mbitos y proveedores, desde razonamiento y programaciÃ³n hasta comprensiÃ³n del lenguaje y reconocimiento de imÃ¡genes.

***

## QuÃ© son los benchmarks

Un **benchmark** es un conjunto de datos o una evaluaciÃ³n diseÃ±ada para medir el rendimiento de un modelo en una tarea concreta.
Si ejecutamos varios modelos con el mismo conjunto de datos, podemos medir sus fortalezas y debilidades relativas.

Algunos ejemplos comunes:

* ðŸ§  **MMLU (Massive Multitask Language Understanding)** â€” evalÃºa los conocimientos generales y el razonamiento.
* ðŸ”¢ **GSM8K** â€” evalÃºa el razonamiento matemÃ¡tico y la resoluciÃ³n de problemas.
* ðŸ’¬ **HellaSwag** â€” evalÃºa el sentido comÃºn y la comprensiÃ³n contextual.
* ðŸ§® **ARC-Challenge** â€” mide el razonamiento cientÃ­fico y la lÃ³gica.
* ðŸ’¡ **HumanEval** â€” evalÃºa las habilidades de programaciÃ³n y generaciÃ³n de cÃ³digo.

***

## CÃ³mo gestiona Phaseo los benchmarks

Phaseo recopila datos de benchmarks de **varias fuentes pÃºblicas** e **informes oficiales**, y despuÃ©s los estandariza en un formato coherente.

La secciÃ³n de benchmarks de cada modelo incluye:

* **Valor de la puntuaciÃ³n** â€” suele expresarse como porcentaje o en una escala normalizada.
* **Fuente del conjunto de datos** â€” por ejemplo, MMLU, GSM8K, etc.
* **MÃ©todo de evaluaciÃ³n** â€” indica cÃ³mo se obtuvo la puntuaciÃ³n (informe oficial, evaluaciÃ³n de terceros o contribuciÃ³n de la comunidad).
* **Ãšltima actualizaciÃ³n** â€” indica cuÃ¡ndo se actualizaron por Ãºltima vez los datos del benchmark.

***

## Ejemplo de pÃ¡gina de benchmark

***

## CategorÃ­as de benchmarks

Los benchmarks se agrupan en categorÃ­as que representan la habilidad evaluada:

| CategorÃ­a | Ejemplos | DescripciÃ³n |
| - | - | - |
| **Razonamiento** | MMLU, GSM8K, ARC | EvalÃºa la lÃ³gica general, el razonamiento de varios pasos y la resoluciÃ³n de problemas. |
| **ComprensiÃ³n del lenguaje** | HellaSwag, BoolQ, PIQA | Mide la comprensiÃ³n lectora, el sentido comÃºn y la capacidad lingÃ¼Ã­stica. |
| **GeneraciÃ³n de cÃ³digo** | HumanEval, MBPP | EvalÃºa la programaciÃ³n y la precisiÃ³n en la sÃ­ntesis de cÃ³digo. |
| **MatemÃ¡ticas y ciencias** | GSM8K, MATH, SciQ | Se centra en el razonamiento numÃ©rico y cientÃ­fico. |
| **Multimodal** | MathVista, MMMU | Combina tareas de comprensiÃ³n de texto e imÃ¡genes. |

***

## CÃ³mo interpretar las puntuaciones

| Rango de valores | InterpretaciÃ³n |
| - | - |
| **90-100%** | Excepcional: rendimiento casi de vanguardia. |
| **80-89%** | Excelente: adecuado para la mayorÃ­a de los usos en producciÃ³n. |
| **60-79%** | Bueno: fiable para tareas generales, aunque puede tener dificultades con casos lÃ­mite. |
| **\< 60%** | En desarrollo: mÃ¡s adecuado para pruebas o investigaciÃ³n. |

Ten en cuenta que algunos benchmarks usan **sistemas de puntuaciÃ³n diferentes**.
Phaseo los normaliza cuando es posible para que las comparaciones sean mÃ¡s Ãºtiles.

***

## Visualizar benchmarks en Phaseo

Los resultados de los benchmarks se visualizan mediante:

* ðŸ“Š **GrÃ¡ficos de barras** para comparar modelos dentro del mismo conjunto de datos.
* ðŸ“ˆ **GrÃ¡ficos de tendencias** que muestran las mejoras de los modelos con el tiempo.
* ðŸ§® **Puntuaciones agregadas** para resumir el rendimiento en varios conjuntos de datos.

Cada conjunto de datos de benchmark de Phaseo incluye filtros para:

* Tipo de modelo (chat, cÃ³digo, embeddings, etc.)
* Proveedor
* AÃ±o de lanzamiento
* CategorÃ­a del conjunto de datos

AsÃ­ puedes identificar rÃ¡pidamente patrones, como quÃ© familias dominan las tareas de razonamiento o programaciÃ³n.

***

## Fuentes de datos y metodologÃ­a

Phaseo reÃºne datos de benchmarks procedentes de:

* ArtÃ­culos de investigaciÃ³n e informes de modelos oficiales.
* PÃ¡ginas de evaluaciÃ³n de proveedores (OpenAI Evals, Anthropic Reports, etc.).
* Conjuntos de datos abiertos de la comunidad (por ejemplo, tablas de clasificaciÃ³n de Hugging Face).
* EnvÃ­os directos de usuarios a travÃ©s de GitHub.

Todos los datos se estandarizan y verifican antes de publicarse.
Consulta [InvestigaciÃ³n y metodologÃ­a â†’ MetodologÃ­a de benchmarks](../research/benchmark-methodology.mdx) para obtener todos los detalles.

***

## Ejemplos de uso

| Objetivo | Ejemplo |
| - | - |
| Comparar modelos de razonamiento | Â«Â¿QuÃ© modelo obtiene la puntuaciÃ³n mÃ¡s alta en GSM8K?Â» |
| Evaluar la relaciÃ³n entre coste y rendimiento | Â«Â¿GPT-4o justifica su precio mÃ¡s alto frente a Claude 3.5 Sonnet?Â» |
| Seguir el progreso anual | Â«Â¿CuÃ¡nto ha mejorado la precisiÃ³n en MMLU desde 2022?Â» |
| Investigar benchmarks por categorÃ­a | Â«Â¿QuÃ© modelos destacan en razonamiento multimodal?Â» |

***

## Contribuir con datos de benchmarks

Abre una incidencia en GitHub con pruebas de resultados de benchmarks nuevos o corregidos.
Cada envÃ­o se revisa antes de incluirlo para garantizar la coherencia y la precisiÃ³n.

<Card title="Contribuir con datos de benchmarks" icon="github" href="../research/submitting-scores.mdx" horizontal>
  Consulta quÃ© pruebas incluir en una incidencia de benchmarks.
</Card>

***

## Siguientes pasos

Cuando comprendas cÃ³mo funcionan los datos de benchmarks, podrÃ¡s explorar los **proveedores de API** que permiten acceder a estos modelos mediante programaciÃ³n.

<Card title="Explorar proveedores de API" icon="network" href="./api-providers.mdx" horizontal>
  Consulta dÃ³nde se alojan los modelos, cuÃ¡nto cuestan y cÃ³mo se accede a ellos.
</Card>


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.