Fase 0 — medición pública

Cómo medimos qué motor gana

MatrixAI Studio puede elegir entre varios motores de entrenamiento para un modelo. Esta página enseña con exactitud cómo se comprueba esa elección: 40 conjuntos públicos, 7 motores, una regla sellada antes de medir un solo número.

Medido el 16 de septiembre de 2026 · 3479 intentos · 17,18 h de reloj

01 · La regla

Qué quiere decir «el mejor motor» aquí

En cada conjunto, cada motor entrena con sus valores por omisión —sin buscar hiperparámetros— y se mide con la métrica de esa tarea. El motor con mejor media gana ese conjunto; cualquier otro que quede a menos de un número fijo de puntos del ganador cumple la regla igual en ese conjunto. Un fallo (caída o tiempo agotado) cuenta como conjunto perdido para ese motor, no como un cero.

Tal como consta en el artefacto:
el motor con mejor media de los ajustes en ESE dataset, excluido el baseline dummy; un fallo (timeout/crash) cuenta como dataset perdido para ese motor
El listón: quedarse a menos de 2 puntos del mejor en un conjunto.
El aprobado: cumplir el listón en al menos el 80 % de los 40 conjuntos.
Métrica usada por tarea
TareaMétrica
Clasificación binariaAUROC
Clasificación multiclaseexactitud o F1 macro
Regresión
02 · Un ejemplo real

kc2Clasificación binaria

Calculado del mismo JSON que lee toda esta página — nada aquí está escrito a mano. · 522×22 · OpenML ↗

MotorResultadoDistancia al mejor¿Cumple el listón?
scikit-learn HGB0,9130
Red densa de MatrixAI(nuestra)0,9080,51
CatBoost0,9031,02
XGBoost0,8912,27No
LightGBM0,8882,55No
scikit-learn (lineal)0,8625,18No

En kc2, el mejor motor fue scikit-learn HGB, con 0,913. De los 6 motores que compitieron, 3 se quedaron dentro de los 2 puntos del mejor y por tanto cumplen la regla en este conjunto.

03 · La tabla completa

40 conjuntos × 7 motores

Filtra por tarea o por tamaño del conjunto. En el móvil la tabla lleva su propio scroll horizontal — la página en sí nunca se desplaza de lado.

Tarea
Tamaño
  • ✓ cumple el listón (a menos de 2 puntos del mejor en ese conjunto)
  • ★ mejor motor en ese conjunto
  • — se cayó o agotó el tiempo (cuenta como conjunto perdido, no como un cero)
Media de la métrica de cierre por conjunto y motor en la pasada de Fase 0, con si cada motor cumplió el listón de la regla en ese conjunto.
ConjuntoTareaTamañoBaseline (ingenuo)CatBoostLightGBMRed densa de MatrixAIscikit-learn HGBscikit-learn (lineal)XGBoost
APSFailure Clasificación binariaGrande0,50,9950,9930,9920,9920,9780,995
Allstate_Claims_Severity RegresiónGrande-00,5610,5620,5620,5090,568
Amazon_employee_access Clasificación binariaGrande0,50,7760,8230,6320,820,5450,818
Internet-Advertisements Clasificación binariaMediano0,50,980,9760,9640,9750,9880,978
KDDCup09_appetency Clasificación binariaGrande0,50,8170,7360,7750,5960,752
Moneyball RegresiónPequeño-0,0020,9330,9330,7520,9340,8730,925
PhishingWebsites Clasificación binariaMediano0,50,9940,9940,9870,9940,980,994
SELLADOSatellite Clasificación binariaMediano0,50,9470,9710,9850,9730,9760,956
adult Clasificación binariaGrande0,50,9240,9290,8920,9290,8820,928
balance-scale Clasificación multiclasePequeño0,460,9010,8720,8920,8630,8650,866
SELLADObanknote-authentication Clasificación binariaPequeño0,5110,999111
breast-w Clasificación binariaPequeño0,50,990,9880,9920,9870,9930,987
climate-model-simulation-crashes Clasificación binariaPequeño0,50,960,9490,8880,9360,9490,937
connect-4 Clasificación multiclaseGrande0,6580,7590,7920,7680,8060,6620,78
diabetes Clasificación binariaPequeño0,50,7990,7640,80,7570,7840,775
SELLADOdiamonds RegresiónGrande-00,9790,9810,9660,9810,9180,981
elevators RegresiónMediano-0,0020,8450,8570,8390,8560,2040,855
house_16H RegresiónGrande-00,6460,6620,4090,6620,2640,658
house_prices_nominal RegresiónPequeño-00,9160,902-80,5560,9030,8860,913
house_sales RegresiónGrande-0,0010,8510,8680,6260,870,6810,862
jm1 Clasificación binariaMediano0,50,7370,7430,7120,7440,5560,742
kc2 Clasificación binariaPequeño0,50,9030,8880,9080,9130,8620,891
SELLADOkr-vs-kp Clasificación binariaMediano0,50,99910,99910,9941
SELLADOletter Clasificación multiclaseMediano0,0410,8420,9520,8160,9530,7610,939
mfeat-factors Clasificación multiclasePequeño0,10,9580,9770,9620,9770,9790,97
micro-mass Clasificación multiclasePequeño0,1060,7940,8640,5340,8650,8150,838
okcupid-stem Clasificación multiclaseGrande0,7160,7560,7550,7550,7370,755
optdigits Clasificación multiclaseMediano0,1010,9670,9880,9780,9890,9690,981
ozone-level-8hr Clasificación binariaMediano0,50,9170,9340,9110,9350,9180,937
pc1 Clasificación binariaPequeño0,50,8110,7810,6970,780,6010,781
SELLADOpc3 Clasificación binariaPequeño0,50,810,8020,7570,8020,7430,807
pc4 Clasificación binariaPequeño0,50,9360,9310,9040,9320,8670,928
pendigits Clasificación multiclaseMediano0,1040,9710,9890,9830,9880,9410,985
SELLADOpol RegresiónMediano-00,9740,9820,9770,9820,4570,982
sick Clasificación binariaMediano0,50,9950,9940,9320,9940,9590,992
SELLADOsplice Clasificación multiclaseMediano0,5190,9440,9560,9350,9550,930,957
us_crime RegresiónPequeño-00,7220,7150,6670,7150,7040,716
wilt Clasificación binariaMediano0,50,9980,9960,7280,9970,9840,998
wine_quality RegresiónMediano-00,4170,430,320,4290,3040,431
yeast Clasificación multiclasePequeño0,3120,6040,5790,5650,5760,5510,579

Los conjuntos marcados SELLADO son el examen final de la cartera: nunca se usan para elegir ni ajustar nada, solo para calificar el resultado una vez, al final.

Baseline es un predictor ingenuo que se enseña solo como referencia — nunca compite por «el mejor» y queda excluido de todos los veredictos de abajo.

Quién aprueba, en los 40 conjuntos
04 · El veredicto, por motor

Un motor aprueba cuando cumple el listón en al menos el 80 % de los 40 conjuntos. El baseline queda excluido — nunca compite.

MotorConjuntos cumplidosFracción¿Aprueba?
LightGBM34/4085 %Aprueba
scikit-learn HGB34/4085 %Aprueba
CatBoost33/4082,5 %Aprueba
XGBoost30/4075 %No aprueba
scikit-learn (lineal)15/4037,5 %No aprueba
Lo que estas cifras NO dicen

Colocado al lado del veredicto a propósito, con el mismo peso — no una nota al pie al final de la página.

  • Los intervalos miden cuánto cambia el resultado al REENTRENAR sobre otros repartos del mismo conjunto, no cómo le iría al motor con otra muestra de datos.
  • «2 puntos» no pesa lo mismo en todas las métricas: 2 puntos de R² no son 2 de AUROC.
  • Cada motor corre con sus valores por omisión, sin buscar hiperparámetros: con búsqueda, el orden podría cambiar.
  • Un conjunto de diferencia en el recuento no distingue a dos motores.
Nuestra propia red, la red densa de MatrixAI
05 · En desarrollo

Todavía no cumple la regla: llega al listón en 15/40 (37,5 %) en esta pasada, y en 16/40 en la última medición. Lo que ya hace bien: fue el mejor motor en 2 conjuntos aquí, y en 4 en la última medición. La seguimos midiendo con la misma regla que a los demás, y publicamos su cifra tal cual.

No es lo que el Studio te da por defecto: un estudio la hace competir, y solo gana cuando es la mejor en ese conjunto.

06 · Procedencia

¿Es esta pasada anclable a un commit exacto?

Los 3479 intentos de esta pasada se midieron con los repositorios de matrixAI y matrixai-engines LIMPIOS — cada uno viene de un commit exacto, así que la pasada es anclable entera a un punto concreto del historial.

MedidoIntentosEstado del repositorio
15 de septiembre de 20263479limpio
07 · Descargas

El protocolo y el artefacto crudo

Esta página no redistribuye los conjuntos —cada fila de la tabla enlaza a su propia página de OpenML—. Lo que sí se puede descargar aquí es el protocolo sellado y el artefacto crudo de medición del que sale toda esta página, cada uno con la huella que demuestra que no se ha tocado.

protocolo_exploratorio.json

El protocolo sellado antes de medir: qué cuenta como «el mejor», el listón en puntos, la fracción de aprobado, la métrica por tarea.

Versión del protocolo: 101-C1.v1 · 6 de septiembre de 2026

SHA-256  ea50ca482a815627364b3439bfcf10e78295a13ae5f821219d0fb40329e65301
protocolo_exploratorio.json
pasada_amplia_101_c5_resultado.json

El resultado crudo de la pasada: cada intento, cada motor, cada conjunto — de aquí sale el JSON que lee esta página.

SHA-256  3646af61b155c1321ad3fd71f25e9300ed9797b9b5dec0f37ed835cd835ecf48
pasada_amplia_101_c5_resultado.json

Nada de esta página redistribuye un conjunto — cada nombre de conjunto enlaza a su propia página de OpenML.

08 · Última medición

La medición más reciente, aparte

Todo lo de arriba —la tabla, el veredicto, las descargas— sale de la pasada que sostiene la cartera de motores vigente, porque es anclable entera a un commit exacto. Esta pasada es más reciente y fue la que decidió un cambio de cartera el 2026-09-22, pero parte de ella se midió con el árbol de trabajo sucio, así que se enseña aquí aparte en vez de mezclarse con las cifras de arriba.

Medido el 22 de septiembre de 2026 · 3479 intentos · 5,82 h de reloj

110 de los 3479 intentos de esta pasada se midieron con el árbol de matrixAI sucio al relanzar tras una caída — no vienen de un commit limpio, así que esta pasada NO es anclable entera a un punto exacto del historial.

Veredicto de esta pasada
MotorConjuntos cumplidosFracción¿Aprueba?
LightGBM33/4082,5 %Aprueba
scikit-learn HGB33/4082,5 %Aprueba
CatBoost29/4072,5 %No aprueba
XGBoost29/4072,5 %No aprueba
scikit-learn (lineal)14/4035 %No aprueba

Un motor aprueba cuando cumple el listón en al menos el 80 % de los 40 conjuntos. El baseline queda excluido — nunca compite.

Nuestra red densa, en desarrollo: 16/40, y el mejor motor en 4 conjuntos.

protocolo_exploratorio_v2.json

Versión del protocolo: 113-C0.v2 · 21 de septiembre de 2026

SHA-256  1b4e902e61e06edcfda8e9f4ccef1232a233d46718089c5f0a2f814feb9dc878
protocolo_exploratorio_v2.json
pasada_v2_113_resultado.json
SHA-256  600ebdaad2ca206eac148e25c38b57add8ad2d64652fafca3d8226758010c0d0
pasada_v2_113_resultado.json
Para seguir
Cómo se verifica el recibo de un modelo →Tres modelos que puedes rehacer →Trazabilidad para el Reglamento de IA →

Cada cifra de esta página se lee en vivo de src/datos/fase0_publico.json, copiado byte a byte del artefacto que MatrixAI genera desde la pasada sellada de Fase 0 — nada aquí está escrito a mano.