Cómo medimos qué motor gana
MatrixAI Studio puede elegir entre varios motores de entrenamiento para un modelo. Esta página enseña con exactitud cómo se comprueba esa elección: 40 conjuntos públicos, 7 motores, una regla sellada antes de medir un solo número.
Medido el 16 de septiembre de 2026 · 3479 intentos · 17,18 h de reloj
Qué quiere decir «el mejor motor» aquí
En cada conjunto, cada motor entrena con sus valores por omisión —sin buscar hiperparámetros— y se mide con la métrica de esa tarea. El motor con mejor media gana ese conjunto; cualquier otro que quede a menos de un número fijo de puntos del ganador cumple la regla igual en ese conjunto. Un fallo (caída o tiempo agotado) cuenta como conjunto perdido para ese motor, no como un cero.
el motor con mejor media de los ajustes en ESE dataset, excluido el baseline dummy; un fallo (timeout/crash) cuenta como dataset perdido para ese motor
| Tarea | Métrica |
|---|---|
| Clasificación binaria | AUROC |
| Clasificación multiclase | exactitud o F1 macro |
| Regresión | R² |
kc2 — Clasificación binaria
Calculado del mismo JSON que lee toda esta página — nada aquí está escrito a mano. · 522×22 · OpenML ↗
| Motor | Resultado | Distancia al mejor | ¿Cumple el listón? |
|---|---|---|---|
| scikit-learn HGB★ | 0,913 | 0 | Sí |
| Red densa de MatrixAI(nuestra) | 0,908 | 0,51 | Sí |
| CatBoost | 0,903 | 1,02 | Sí |
| XGBoost | 0,891 | 2,27 | No |
| LightGBM | 0,888 | 2,55 | No |
| scikit-learn (lineal) | 0,862 | 5,18 | No |
En kc2, el mejor motor fue scikit-learn HGB, con 0,913. De los 6 motores que compitieron, 3 se quedaron dentro de los 2 puntos del mejor y por tanto cumplen la regla en este conjunto.
40 conjuntos × 7 motores
Filtra por tarea o por tamaño del conjunto. En el móvil la tabla lleva su propio scroll horizontal — la página en sí nunca se desplaza de lado.
- ✓ cumple el listón (a menos de 2 puntos del mejor en ese conjunto)
- ★ mejor motor en ese conjunto
- — se cayó o agotó el tiempo (cuenta como conjunto perdido, no como un cero)
| Conjunto | Tarea | Tamaño | Baseline (ingenuo) | CatBoost | LightGBM | Red densa de MatrixAI | scikit-learn HGB | scikit-learn (lineal) | XGBoost |
|---|---|---|---|---|---|---|---|---|---|
| APSFailure ↗ | Clasificación binaria | Grande | 0,5 | 0,995 ✓ ★ | 0,993 ✓ | 0,992 ✓ | 0,992 ✓ | 0,978 ✓ | 0,995 ✓ |
| Allstate_Claims_Severity ↗ | Regresión | Grande | -0 | 0,561 ✓ | 0,562 ✓ | — | 0,562 ✓ | 0,509 | 0,568 ✓ ★ |
| Amazon_employee_access ↗ | Clasificación binaria | Grande | 0,5 | 0,776 | 0,823 ✓ ★ | 0,632 | 0,82 ✓ | 0,545 | 0,818 ✓ |
| Internet-Advertisements ↗ | Clasificación binaria | Mediano | 0,5 | 0,98 ✓ | 0,976 ✓ | 0,964 | 0,975 ✓ | 0,988 ✓ ★ | 0,978 ✓ |
| KDDCup09_appetency ↗ | Clasificación binaria | Grande | 0,5 | 0,817 ✓ ★ | 0,736 | — | 0,775 | 0,596 | 0,752 |
| Moneyball ↗ | Regresión | Pequeño | -0,002 | 0,933 ✓ | 0,933 ✓ | 0,752 | 0,934 ✓ ★ | 0,873 | 0,925 ✓ |
| PhishingWebsites ↗ | Clasificación binaria | Mediano | 0,5 | 0,994 ✓ | 0,994 ✓ ★ | 0,987 ✓ | 0,994 ✓ | 0,98 ✓ | 0,994 ✓ |
| SELLADOSatellite ↗ | Clasificación binaria | Mediano | 0,5 | 0,947 | 0,971 ✓ | 0,985 ✓ ★ | 0,973 ✓ | 0,976 ✓ | 0,956 |
| adult ↗ | Clasificación binaria | Grande | 0,5 | 0,924 ✓ | 0,929 ✓ | 0,892 | 0,929 ✓ ★ | 0,882 | 0,928 ✓ |
| balance-scale ↗ | Clasificación multiclase | Pequeño | 0,46 | 0,901 ✓ ★ | 0,872 | 0,892 ✓ | 0,863 | 0,865 | 0,866 |
| SELLADObanknote-authentication ↗ | Clasificación binaria | Pequeño | 0,5 | 1 ✓ | 1 ✓ | 0,999 ✓ | 1 ✓ ★ | 1 ✓ | 1 ✓ |
| breast-w ↗ | Clasificación binaria | Pequeño | 0,5 | 0,99 ✓ | 0,988 ✓ | 0,992 ✓ | 0,987 ✓ | 0,993 ✓ ★ | 0,987 ✓ |
| climate-model-simulation-crashes ↗ | Clasificación binaria | Pequeño | 0,5 | 0,96 ✓ ★ | 0,949 ✓ | 0,888 | 0,936 | 0,949 ✓ | 0,937 |
| connect-4 ↗ | Clasificación multiclase | Grande | 0,658 | 0,759 | 0,792 ✓ | 0,768 | 0,806 ✓ ★ | 0,662 | 0,78 |
| diabetes ↗ | Clasificación binaria | Pequeño | 0,5 | 0,799 ✓ | 0,764 | 0,8 ✓ ★ | 0,757 | 0,784 ✓ | 0,775 |
| SELLADOdiamonds ↗ | Regresión | Grande | -0 | 0,979 ✓ | 0,981 ✓ | 0,966 ✓ | 0,981 ✓ | 0,918 | 0,981 ✓ ★ |
| elevators ↗ | Regresión | Mediano | -0,002 | 0,845 ✓ | 0,857 ✓ ★ | 0,839 ✓ | 0,856 ✓ | 0,204 | 0,855 ✓ |
| house_16H ↗ | Regresión | Grande | -0 | 0,646 ✓ | 0,662 ✓ ★ | 0,409 | 0,662 ✓ | 0,264 | 0,658 ✓ |
| house_prices_nominal ↗ | Regresión | Pequeño | -0 | 0,916 ✓ ★ | 0,902 ✓ | -80,556 | 0,903 ✓ | 0,886 | 0,913 ✓ |
| house_sales ↗ | Regresión | Grande | -0,001 | 0,851 ✓ | 0,868 ✓ | 0,626 | 0,87 ✓ ★ | 0,681 | 0,862 ✓ |
| jm1 ↗ | Clasificación binaria | Mediano | 0,5 | 0,737 ✓ | 0,743 ✓ | 0,712 | 0,744 ✓ ★ | 0,556 | 0,742 ✓ |
| kc2 ↗ | Clasificación binaria | Pequeño | 0,5 | 0,903 ✓ | 0,888 | 0,908 ✓ | 0,913 ✓ ★ | 0,862 | 0,891 |
| SELLADOkr-vs-kp ↗ | Clasificación binaria | Mediano | 0,5 | 0,999 ✓ | 1 ✓ ★ | 0,999 ✓ | 1 ✓ | 0,994 ✓ | 1 ✓ |
| SELLADOletter ↗ | Clasificación multiclase | Mediano | 0,041 | 0,842 | 0,952 ✓ | 0,816 | 0,953 ✓ ★ | 0,761 | 0,939 ✓ |
| mfeat-factors ↗ | Clasificación multiclase | Pequeño | 0,1 | 0,958 | 0,977 ✓ | 0,962 ✓ | 0,977 ✓ | 0,979 ✓ ★ | 0,97 ✓ |
| micro-mass ↗ | Clasificación multiclase | Pequeño | 0,106 | 0,794 | 0,864 ✓ | 0,534 | 0,865 ✓ ★ | 0,815 | 0,838 |
| okcupid-stem ↗ | Clasificación multiclase | Grande | 0,716 | 0,756 ✓ ★ | 0,755 ✓ | — | 0,755 ✓ | 0,737 ✓ | 0,755 ✓ |
| optdigits ↗ | Clasificación multiclase | Mediano | 0,101 | 0,967 | 0,988 ✓ | 0,978 ✓ | 0,989 ✓ ★ | 0,969 ✓ | 0,981 ✓ |
| ozone-level-8hr ↗ | Clasificación binaria | Mediano | 0,5 | 0,917 ✓ | 0,934 ✓ | 0,911 | 0,935 ✓ | 0,918 ✓ | 0,937 ✓ ★ |
| pc1 ↗ | Clasificación binaria | Pequeño | 0,5 | 0,811 ✓ ★ | 0,781 | 0,697 | 0,78 | 0,601 | 0,781 |
| SELLADOpc3 ↗ | Clasificación binaria | Pequeño | 0,5 | 0,81 ✓ ★ | 0,802 ✓ | 0,757 | 0,802 ✓ | 0,743 | 0,807 ✓ |
| pc4 ↗ | Clasificación binaria | Pequeño | 0,5 | 0,936 ✓ ★ | 0,931 ✓ | 0,904 | 0,932 ✓ | 0,867 | 0,928 ✓ |
| pendigits ↗ | Clasificación multiclase | Mediano | 0,104 | 0,971 ✓ | 0,989 ✓ ★ | 0,983 ✓ | 0,988 ✓ | 0,941 | 0,985 ✓ |
| SELLADOpol ↗ | Regresión | Mediano | -0 | 0,974 ✓ | 0,982 ✓ ★ | 0,977 ✓ | 0,982 ✓ | 0,457 | 0,982 ✓ |
| sick ↗ | Clasificación binaria | Mediano | 0,5 | 0,995 ✓ ★ | 0,994 ✓ | 0,932 | 0,994 ✓ | 0,959 | 0,992 ✓ |
| SELLADOsplice ↗ | Clasificación multiclase | Mediano | 0,519 | 0,944 ✓ | 0,956 ✓ | 0,935 | 0,955 ✓ | 0,93 | 0,957 ✓ ★ |
| us_crime ↗ | Regresión | Pequeño | -0 | 0,722 ✓ ★ | 0,715 ✓ | 0,667 | 0,715 ✓ | 0,704 ✓ | 0,716 ✓ |
| wilt ↗ | Clasificación binaria | Mediano | 0,5 | 0,998 ✓ ★ | 0,996 ✓ | 0,728 | 0,997 ✓ | 0,984 ✓ | 0,998 ✓ |
| wine_quality ↗ | Regresión | Mediano | -0 | 0,417 ✓ | 0,43 ✓ | 0,32 | 0,429 ✓ | 0,304 | 0,431 ✓ ★ |
| yeast ↗ | Clasificación multiclase | Pequeño | 0,312 | 0,604 ✓ ★ | 0,579 | 0,565 | 0,576 | 0,551 | 0,579 |
Los conjuntos marcados SELLADO son el examen final de la cartera: nunca se usan para elegir ni ajustar nada, solo para calificar el resultado una vez, al final.
Baseline es un predictor ingenuo que se enseña solo como referencia — nunca compite por «el mejor» y queda excluido de todos los veredictos de abajo.
Un motor aprueba cuando cumple el listón en al menos el 80 % de los 40 conjuntos. El baseline queda excluido — nunca compite.
| Motor | Conjuntos cumplidos | Fracción | ¿Aprueba? |
|---|---|---|---|
| LightGBM | 34/40 | 85 % | Aprueba |
| scikit-learn HGB | 34/40 | 85 % | Aprueba |
| CatBoost | 33/40 | 82,5 % | Aprueba |
| XGBoost | 30/40 | 75 % | No aprueba |
| scikit-learn (lineal) | 15/40 | 37,5 % | No aprueba |
Colocado al lado del veredicto a propósito, con el mismo peso — no una nota al pie al final de la página.
- Los intervalos miden cuánto cambia el resultado al REENTRENAR sobre otros repartos del mismo conjunto, no cómo le iría al motor con otra muestra de datos.
- «2 puntos» no pesa lo mismo en todas las métricas: 2 puntos de R² no son 2 de AUROC.
- Cada motor corre con sus valores por omisión, sin buscar hiperparámetros: con búsqueda, el orden podría cambiar.
- Un conjunto de diferencia en el recuento no distingue a dos motores.
Todavía no cumple la regla: llega al listón en 15/40 (37,5 %) en esta pasada, y en 16/40 en la última medición. Lo que ya hace bien: fue el mejor motor en 2 conjuntos aquí, y en 4 en la última medición. La seguimos midiendo con la misma regla que a los demás, y publicamos su cifra tal cual.
No es lo que el Studio te da por defecto: un estudio la hace competir, y solo gana cuando es la mejor en ese conjunto.
¿Es esta pasada anclable a un commit exacto?
Los 3479 intentos de esta pasada se midieron con los repositorios de matrixAI y matrixai-engines LIMPIOS — cada uno viene de un commit exacto, así que la pasada es anclable entera a un punto concreto del historial.
| Medido | Intentos | Estado del repositorio |
|---|---|---|
| 15 de septiembre de 2026 | 3479 | limpio |
El protocolo y el artefacto crudo
Esta página no redistribuye los conjuntos —cada fila de la tabla enlaza a su propia página de OpenML—. Lo que sí se puede descargar aquí es el protocolo sellado y el artefacto crudo de medición del que sale toda esta página, cada uno con la huella que demuestra que no se ha tocado.
El protocolo sellado antes de medir: qué cuenta como «el mejor», el listón en puntos, la fracción de aprobado, la métrica por tarea.
Versión del protocolo: 101-C1.v1 · 6 de septiembre de 2026
SHA-256 ea50ca482a815627364b3439bfcf10e78295a13ae5f821219d0fb40329e65301protocolo_exploratorio.json ↓
El resultado crudo de la pasada: cada intento, cada motor, cada conjunto — de aquí sale el JSON que lee esta página.
SHA-256 3646af61b155c1321ad3fd71f25e9300ed9797b9b5dec0f37ed835cd835ecf48pasada_amplia_101_c5_resultado.json ↓
Nada de esta página redistribuye un conjunto — cada nombre de conjunto enlaza a su propia página de OpenML.
La medición más reciente, aparte
Todo lo de arriba —la tabla, el veredicto, las descargas— sale de la pasada que sostiene la cartera de motores vigente, porque es anclable entera a un commit exacto. Esta pasada es más reciente y fue la que decidió un cambio de cartera el 2026-09-22, pero parte de ella se midió con el árbol de trabajo sucio, así que se enseña aquí aparte en vez de mezclarse con las cifras de arriba.
Medido el 22 de septiembre de 2026 · 3479 intentos · 5,82 h de reloj
110 de los 3479 intentos de esta pasada se midieron con el árbol de matrixAI sucio al relanzar tras una caída — no vienen de un commit limpio, así que esta pasada NO es anclable entera a un punto exacto del historial.
| Motor | Conjuntos cumplidos | Fracción | ¿Aprueba? |
|---|---|---|---|
| LightGBM | 33/40 | 82,5 % | Aprueba |
| scikit-learn HGB | 33/40 | 82,5 % | Aprueba |
| CatBoost | 29/40 | 72,5 % | No aprueba |
| XGBoost | 29/40 | 72,5 % | No aprueba |
| scikit-learn (lineal) | 14/40 | 35 % | No aprueba |
Un motor aprueba cuando cumple el listón en al menos el 80 % de los 40 conjuntos. El baseline queda excluido — nunca compite.
Nuestra red densa, en desarrollo: 16/40, y el mejor motor en 4 conjuntos.
Versión del protocolo: 113-C0.v2 · 21 de septiembre de 2026
SHA-256 1b4e902e61e06edcfda8e9f4ccef1232a233d46718089c5f0a2f814feb9dc878protocolo_exploratorio_v2.json ↓
SHA-256 600ebdaad2ca206eac148e25c38b57add8ad2d64652fafca3d8226758010c0d0pasada_v2_113_resultado.json ↓
Cada cifra de esta página se lee en vivo de src/datos/fase0_publico.json, copiado byte a byte del artefacto que MatrixAI genera desde la pasada sellada de Fase 0 — nada aquí está escrito a mano.