
Predicho frente a real: qué significa la diagonal perfecta de un modelo de Machine Learning
Cuando un modelo de Machine Learning predice ventas, la pregunta práctica no es si ha «aprendido algo» en abstracto. Es más concreta: ¿las predicciones se parecen a las ventas que realmente ocurrieron? El proyecto ML Retail Sales Predictor responde con un informe que confronta ambos mundos. La gráfica de la portada —Predicted vs Actual Sales— es la pieza más intuitiva de esa respuesta.
El punto de partida
Tenemos ventas reales. El modelo genera ventas predichas. Necesitamos saber si unas y otras se parecen.
Cada punto de la nube es una observación: una tienda, un contexto, un caso del conjunto evaluado. El eje X muestra las ventas reales. El eje Y muestra las ventas predichas. Si el modelo acierta del todo, ambos valores coinciden. Si se equivoca, el punto se aleja de esa coincidencia.
La diagonal no es una tendencia descubierta
En el código que genera el informe, la línea roja no se calcula a partir de la nube. Se dibuja haciendo que X e Y recorran los mismos valores: desde el mínimo hasta el máximo de las ventas reales. Conceptual y matemáticamente, esa línea es:
predicción = valor real
o, con la notación habitual de ejes:
y = x
Eso importa. La diagonal no es una regresión ajustada a los puntos. No es «la tendencia que el algoritmo ha descubierto». Es una referencia de predicción perfecta definida por nosotros antes de mirar cómo se dispersa la nube.
Un punto exactamente sobre la línea corresponde a una predicción perfecta. Cuanto más se separa en vertical de ella, mayor es el error de predicción en esa observación. La geometría es sencilla a propósito: la distancia a y = x se lee como fallo, no como misterio estadístico.
Qué significa que la nube siga la diagonal
Si la nube se concentra cerca de la línea, el modelo reproduce razonablemente los valores reales. Si se abre en abanico, los errores crecen. Si aparecen franjas sistemáticas por encima o por debajo, puede haber sesgos o problemas de calibración. Los outliers marcan casos especialmente mal predichos; el propio informe lista los peores por error absoluto.
Las métricas del artefacto generado en el repositorio —verificadas sobre las mismas predicciones y ventas reales— cuantifican esa impresión visual:
- R² = 0.9458: el modelo explica una fracción alta de la variabilidad de las ventas reales. Cerca de 1 suele indicar un ajuste fuerte; no garantiza por sí solo que cada caso sea útil en negocio.
- RMSE = 868.67: error cuadrático medio en la misma unidad que las ventas. Penaliza con más fuerza los fallos grandes.
- MAE = 629.67: error absoluto medio; una lectura más directa de la magnitud típica del fallo.
La gráfica muestra la forma del error. Las métricas lo resumen en tres números. Ninguna sustituye a la otra.
La semejanza visual con Hubble
Hay una observación que motivó este artículo: una gráfica clásica de la ley de Hubble también puede mostrar dos variables, una nube de observaciones y una relación aproximadamente lineal atravesando esa nube.
A nivel introductorio, esa relación se escribe como:
v = H₀ · d
donde d es una medida de distancia, v es la velocidad de recesión y H₀ es la pendiente de la relación. NASA resume la idea central así: las galaxias más lejanas se alejan más rápido, y esa relación distancia–velocidad es lo que conocemos como ley de Hubble.
Vista de lejos, la geometría recuerda a Predicted vs Actual: puntos, ejes, una línea que organiza la lectura.
La diferencia fundamental
Aquí cambia el significado.
En nuestro gráfico de Machine Learning, y = x es una referencia de predicción perfecta fijada previamente. La línea no estima una relación física entre dos magnitudes del mundo: fija el criterio de acierto perfecto.
En Hubble, la recta representa o estima una relación entre dos magnitudes físicas observadas. La pendiente importa porque resume esa relación; no porque diga «predicción perfecta».
Se parecen geométricamente. No significan lo mismo estadísticamente. No cumplen la misma función.
Además, «parecer una línea a 45 grados» no es, por sí sola, una propiedad científica importante. El ángulo visual depende de las escalas elegidas para los ejes. Si estiras o comprimes X o Y, la misma relación matemática puede verse más tendida o más empinada. En Predicted vs Actual, la lectura correcta no es «está a cuarenta y cinco grados», sino «la referencia perfecta es y = x».
Una misma geometría, preguntas distintas
Una nube de puntos más una línea puede responder a preguntas muy diferentes: predicción frente a realidad, relación entre dos variables, ajuste de una tendencia, identificación de desviaciones o validación de un modelo. La lectura correcta depende de qué representa X, qué representa Y, cómo se obtiene la línea y qué significa la distancia de los puntos respecto a ella.
Documentar un proyecto no es solo publicar un repositorio. Es dejar explícito qué estamos midiendo cuando dibujamos. En ML Retail Sales Predictor, la diagonal perfecta no es un adorno: es el criterio visual de si el modelo se acerca a la realidad.