
Repaso y descripción de datos
Estadística multivariada
Estimación de la recta de regresión
La investigación cuantitativa requiere operacionalizar conceptos para hacerlos medibles
Los datos se organizan en casos (filas) y variables (columnas), con distintas escalas de medición
La correlación resume la fuerza y dirección de una relación lineal, pero no permite predecir ni distinguir entre variable dependiente e independiente
La regresión describe esa relación mediante una función: \(Y_i = \beta_0 + \beta_1 X_i + \epsilon_i\)
Antes de explicar, necesitamos describir: medidas de tendencia central y de dispersión
¿Por qué la varianza es la pieza central del modelo de regresión?
¿Cómo se estiman concretamente \(b_0\) y \(b_1\)?
Datos categóricos:
Datos continuos:
| Categórica | Continua | Categ.(y)/Categ.(x) | Cont.(y)/Categ.(x) | |
|---|---|---|---|---|
| Ejemplo | Estatus ocupacional | Ingreso | Estatus ocupacional (Y) / Género (X) | Ingreso (Y) / Género (X) |
| Tabla | Frecuencias / porcentajes | \(\bar{X}\) / sd, o recodificar en categorías | Tabla de contingencia | Clasificar Y |
| Gráfico | Barras | Histograma / boxplot | Gráfico de barras condicionado | Histograma o boxplot condicionado |
Variable dependiente (y): lo que quiero explicar
Variable independiente (x): lo que me permite explicar la dependiente
| Variable independiente (x) | Variable dependiente categórica | Variable dependiente continua |
|---|---|---|
| Categórica | Análisis de tabla de contingencia, Chi2 | Análisis de varianza (ANOVA), prueba t |
| Continua | Regresión logística | Correlación / regresión lineal |
Moda: valor que ocurre más frecuentemente
Mediana: valor medio de la distribución ordenada. Si N es par, es el promedio de los dos valores medios
Media o promedio aritmético: suma de los valores dividida por el total de casos
\[\bar{X} = \frac{\sum_{i=1}^{n} x_i}{n}\]




Raíz cuadrada de la varianza
Se expresa en las mismas unidades que los puntajes de la escala original
Sin variación no hay nada que explicar: si todas las personas tuvieran el mismo ingreso, no tendría sentido preguntarse qué lo determina
El modelo de regresión trabaja precisamente sobre la variación de la variable dependiente
Como veremos, el coeficiente de regresión se construye a partir de la varianza de \(X\) y de su covariación con \(Y\)

Conocer: la variación de la variable dependiente de acuerdo a la variación de otra(s) variable(s) independiente(s)
Predecir: estimar el valor de una variable (dependiente) de acuerdo al valor de otra(s)
Inferir: establecer en qué medida esta asociación es estadísticamente significativa
Conocer: ¿en qué medida el puntaje de la PAES influye en el éxito académico en la universidad?
Predecir: si una persona obtiene 600 puntos en la PAES, ¿qué promedio de notas es probable que obtenga en la universidad? (atención: predicción no implica explicación)
Inferir: ¿se puede generalizar a la población? ¿Con qué nivel de confianza?
\[Y = a + bX\]
Una función asigna a cada valor de \(X\) un único valor de \(Y\)
\(a\): valor de \(Y\) cuando \(X = 0\) (intercepto u ordenada en el origen)
\(b\): cuánto cambia \(Y\) cuando \(X\) aumenta en una unidad (pendiente)
En regresión escribimos \(\widehat{Y} = b_0 + b_1X\), pero la lógica es exactamente la misma
Figure 1
Figure 2
descriptivos <- data.frame(
Variable = c("Juegos previos (X)", "Puntos obtenidos (Y)"),
N = c(nrow(datos), nrow(datos)),
Media = c(mean(datos$juegos_x), mean(datos$puntos_y)),
DE = c(sd(datos$juegos_x), sd(datos$puntos_y)),
Min = c(min(datos$juegos_x), min(datos$puntos_y)),
Max = c(max(datos$juegos_x), max(datos$puntos_y))
)| Variable | N | Media | DE | Min | Max |
|---|---|---|---|---|---|
| Juegos previos (X) | 23 | 3 | 1.76 | 1 | 5 |
| Puntos obtenidos (Y) | 23 | 4 | 1.13 | 2 | 6 |
Para los casos con \(X = 1\) hay tres valores distintos de \(Y\): 2, 3 y 4. La media condicional de \(Y\) dado \(X = 1\) es 3
La (co)variación general de \(Y\) respecto de \(X\) se puede expresar en una ecuación de la recta = modelo de regresión
\[\widehat{Y} = b_{0} + b_{1}X\]
Donde:
\(\widehat{Y}\) es el valor estimado de \(Y\)
\(b_{0}\) es el intercepto de la recta (el valor de \(Y\) cuando \(X\) es 0)
\(b_{1}\) es el coeficiente de regresión, que indica cuánto aumenta \(Y\) por cada unidad que aumenta \(X\)
\[b_{1}=\frac{Cov(XY)}{Var(X)}\]
\[b_{1}=\frac{\frac{\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})} {n-1}}{\frac{\sum_{i=1}^{n}(x_i - \bar{x})(x_i - \bar{x})} {n-1}}\]
Y simplificando:
\[b_{1}=\frac{\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})} {\sum_{i=1}^{n}(x_i - \bar{x})^2}\]
Una vez estimada la pendiente, se despeja el intercepto:
\[b_{0}=\bar{Y}-b_{1}\bar{X}\]
Esto implica que la recta de regresión siempre pasa por el punto \((\bar{X}, \bar{Y})\)
La base de todos estos cálculos es la diferencia de cada valor respecto de su promedio:
\[difx = x-\bar{x} \qquad dify = y-\bar{y}\]
Con ellas construimos los productos cruzados y las diferencias al cuadrado:
\[difcru = (x-\bar{x})(y-\bar{y}) \qquad difx2 = (x-\bar{x})^2\]
| juegos_x | puntos_y | difx | dify | dif_cru | difx2 |
|---|---|---|---|---|---|
| 1 | 2 | -2 | -2 | 4 | 4 |
| 1 | 2 | -2 | -2 | 4 | 4 |
| 1 | 3 | -2 | -1 | 2 | 4 |
| 1 | 3 | -2 | -1 | 2 | 4 |
| 1 | 3 | -2 | -1 | 2 | 4 |
| 1 | 3 | -2 | -1 | 2 | 4 |
| 1 | 4 | -2 | 0 | 0 | 4 |
| 1 | 4 | -2 | 0 | 0 | 4 |
| 2 | 3 | -1 | -1 | 1 | 1 |
| 2 | 4 | -1 | 0 | 0 | 1 |
Primeros 10 casos de 23
\[b_{1}=\frac{\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})} {\sum_{i=1}^{n}(x_i - \bar{x})^2}=\frac{34}{68}=0.5\]
Y con la pendiente ya estimada:
\[b_{0}=\bar{Y}-b_{1}\bar{X} = 4-(0.5 \times 3)=2.5\]
\[\widehat{Y}=2.5+0.5X\]
Intercepto: una persona sin juegos previos obtiene, en promedio, 2,5 puntos
Pendiente: por cada juego previo adicional, los puntos obtenidos aumentan en 0,5
\[\widehat{Y}=2.5+0.5X\]
La ecuación permite estimar el valor de \(Y\) (o su media condicional) para un valor dado de \(X\). Por ejemplo, ¿cuál es el valor estimado de \(Y\) dado \(X=3\)?
\[\widehat{Y}=2.5+(0.5 \times 3)=4\]
El valor estimado de puntos para una persona que ha jugado 3 veces es 4
Los mismos valores que calculamos a mano
Figure 4
Al igual que con la correlación:
Y además:
Wooldridge, Introducción a la econometría: apéndices A1 y A2, y sección 2.1
Moore, Estadística aplicada básica: sección 2.4.1

![]()