Regresión lineal simple

Cobertura de objetivos de aprendizaje

OA1: Describe un modelo de regresión lineal simple, cómo se utiliza el criterio de mínimos cuadrados para estimar los coeficientes de regresión y la interpretación de estos coeficientes.

Concepto central

La regresión lineal simple extiende el análisis de correlación del Tema 9 a un marco predictivo. Mientras que la correlación nos dice si dos variables están relacionadas y en qué medida, la regresión nos dice la naturaleza específica de esa relación y nos permite hacer predicciones. El modelo Y = b₀ + b₁X + ε forma la base para la estimación beta en análisis de acciones, modelos factoriales en gestión de carteras y modelado de curva de rendimiento en renta fija.

Componentes clave:

  • Variable dependiente (Y): El resultado que se predice
  • Variable independiente (X): La variable predictora
  • Intersección (b₀): valor de Y cuando X es igual a cero
  • Pendiente (b₁): Cambio en Y por cambio de una unidad en X
  • Término de error (ε): Variación inexplicable

Fórmulas y cálculos

  • Fórmula principal: Y = b₀ + b₁X + ε formula exam-focus
    • b₁ = Σ[(X - X̄)(Y - Ȳ)] / Σ[(X - X̄)²] formula
    • b₀ = Ȳ - b₁X̄ formula
  • Pasos HP 12C:
    1. Ingrese puntos de datos emparejados usando el modo de estadística
    2. Presione [f] [REG] para calcular los coeficientes de regresión.
    3. Mostrar b₁: [RCL] [3], Mostrar b₀: [RCL] [4]
  • Variaciones comunes: coeficientes estandarizados, transformaciones logarítmicas naturales

Ejemplos prácticos

  • Ejemplo de finanzas tradicionales: predecir los rendimientos de las acciones (Y) en función de los rendimientos del mercado (X)
    • Dado: Rentabilidad de las acciones = 2% + 1,2 × Rentabilidad del mercado
    • Si el rendimiento del mercado = 5%, el rendimiento previsto de las acciones = 2% + 1,2(5%) = 8%
  • Tutorial de cálculo: Mínimos cuadrados minimiza Σε² = Σ(Y - Ŷ)²
  • Interpretación: el coeficiente de pendiente representa el riesgo sistemático (beta), la intersección representa alfa

Aplicación DeFi

  • Ejemplo de protocolo: Predicción de Uniswap V3 TVL en función de los movimientos de precios de ETH defi-application
  • Implementación: los contratos inteligentes pueden utilizar oráculos de regresión lineal para ajustes dinámicos de tarifas
  • Ventajas/Desafíos: Disponibilidad de datos en tiempo real frente a costos de gas para cálculos en cadena

OA2: Explique los supuestos subyacentes al modelo de regresión lineal simple y describa cómo los residuos y los gráficos de residuos indican si estos supuestos pueden haber sido violados.

Concepto central

  • Definición: Se deben cumplir cuatro supuestos críticos para obtener resultados de regresión válidos: linealidad, homocedasticidad, independencia y normalidad.
  • Por qué es importante: los supuestos infringidos conducen a estimaciones sesgadas y pruebas estadísticas no válidas
  • Componentes clave:
    • Linealidad: La relación es verdaderamente lineal.
    • Homoscedasticidad: Varianza del error constante.
    • Independencia: los errores no están correlacionados
    • Normalidad: los errores siguen la distribución normal.

Fórmulas y cálculos- Cálculo residual: e = Y - Ŷ = Y - (b₀ + b₁X)

  • Prueba de Durbin-Watson: DW = Σ(eₜ - eₜ₋₁)² / Σeₜ²
  • Pasos de HP 12C: Calcule los residuos restando los valores previstos de los valores reales
  • Variaciones comunes: prueba de Breusch-Pagan para homocedasticidad, prueba de Jarque-Bera para normalidad

Ejemplos prácticos

  • Ejemplo de finanzas tradicionales: prueba de estabilidad beta en el modelo CAPM
  • Tutorial de cálculo: Trazar residuos frente a valores ajustados para comprobar si hay patrones
  • Interpretación: la dispersión aleatoria indica suposiciones válidas; los patrones sugieren violaciones

Aplicación DeFi

  • Ejemplo de protocolo: Validación de supuestos en predicciones de rendimiento agrícola
  • Implementación: Análisis residual automatizado en plataformas de análisis DeFi
  • Ventajas/Desafíos: Monitoreo continuo versus complejidad computacional

OA3: Calcular e interpretar medidas de ajuste y formular y evaluar pruebas de ajuste y de coeficientes de regresión en una regresión lineal simple

Concepto central

  • Definición: Las medidas de ajuste evalúan qué tan bien el modelo de regresión explica la variación en la variable dependiente
  • Por qué es importante: determina la confiabilidad del modelo para decisiones de inversión y gestión de riesgos.
  • Componentes clave:
    • R²: Coeficiente de determinación
    • R² ajustado: R² ajustado por grados de libertad
    • Estadística F: significación general del modelo
    • estadístico t: significación del coeficiente individual

Fórmulas y cálculos

  • Fórmula R²: R² = SSR/SST = 1 - (SSE/SST) formula exam-focus
    • SST = Σ(Y - Ȳ)² (Suma Total de Cuadrados)
    • SSR = Σ(Ŷ - Ȳ)² (Suma de Cuadrados de Regresión)
    • SSE = Σ(Y - Ŷ)² (Error de Suma de Cuadrados)
  • Estadística F: F = MSR/MSE = [SSR/1] / [SSE/(n-2)]
  • estadística t: t = (b₁ - 0) / sb₁
  • Pasos HP 12C: Utilice la función de correlación [f] [REG], resultado al cuadrado para R²

Ejemplos prácticos

  • Ejemplo de finanzas tradicionales: la beta de la cartera tiene R² = 0,64, lo que significa que el 64 % de la variación del rendimiento se explica por los movimientos del mercado.
  • Tutorial de cálculo: la prueba F determina si la relación es estadísticamente significativa
  • Interpretación: Un R² más alto indica un mejor ajuste, pero considere los riesgos de sobreajuste

Aplicación DeFi

  • Ejemplo de protocolo: Medición de la bondad de ajuste en modelos automatizados de predicción de precios de creadores de mercado
  • Implementación: Monitoreo dinámico de R² para estrategias de reequilibrio
  • Ventajas/Desafíos: Validación del modelo en tiempo real frente a optimización del gas

OA4: Describir el uso del análisis de varianza (ANOVA) en el análisis de regresión, interpretar los resultados del ANOVA y calcular e interpretar el error estándar de estimación en una regresión lineal simple.

Concepto central

  • Definición: ANOVA descompone la variación total en componentes explicados (regresión) y no explicados (error)
  • Por qué es importante: proporciona un marco para probar la importancia general del modelo y cuantificar la precisión de la predicción.
  • Componentes clave:
    • Variación total (TSM)
    • Variación explicada (SSR)
    • Variación inexplicable (SSE)
    • Error estándar de estimación (VER)

Fórmulas y cálculos- Identidad ANOVA: SST = SSR + SSE formula exam-focus

  • Error estándar de estimación: SEE = √[SSE/(n-2)] formula
  • Regresión cuadrática media: MSR = SSR/1
  • Error cuadrático medio: MSE = SSE/(n-2)
  • Pasos HP 12C: Calcule SEE usando la función de desviación estándar en residuos

Ejemplos prácticos

  • Ejemplo de finanzas tradicionales: la tabla ANOVA muestra F = 25,6, p < 0,001, lo que indica una relación significativa
  • Tutorial de cálculo: VER = $2.50 means 68% of predictions fall within ±$2.50 de valores reales
  • Interpretación: Un SEE más bajo indica predicciones más precisas

Aplicación DeFi

  • Ejemplo de protocolo: análisis ANOVA de los rendimientos de la provisión de liquidez en creadores de mercado automatizados
  • Implementación: Bandas de error estándar para predicción de pérdidas no permanentes
  • Ventajas/Desafíos: Recalibración continua versus costos de transacción

OA5: Calcular e interpretar el valor predicho para la variable dependiente, y un intervalo de predicción para la misma, dado un modelo de regresión lineal estimado y un valor para la variable independiente

Concepto central

  • Definición: Los intervalos de predicción proporcionan estimaciones de rango para observaciones futuras, teniendo en cuenta tanto la incertidumbre de los parámetros como la variabilidad inherente.
  • Por qué es importante: permite la toma de decisiones conscientes del riesgo en mercados volátiles de DeFi y tradicionales.
  • Componentes clave:
    • Predicción de puntos: mejor estimación única
    • Intervalo de predicción: rango con nivel de confianza especificado
    • Intervalo de confianza: Rango de respuesta media
    • Error estándar de predicción

Fórmulas y cálculos

  • Predicción de puntos: Ŷ = b₀ + b₁X
  • Intervalo de predicción: Ŷ ± t(α/2,n-2) × SEE × √[1 + 1/n + (X-X̄)²/Σ(X-X̄)²] formula exam-focus
  • Intervalo de confianza para la media: Ŷ ± t(α/2,n-2) × SEE × √[1/n + (X-X̄)²/Σ(X-X̄)²] formula
  • Pasos HP 12C: use distribución normal para muestras grandes, distribución t para muestras pequeñas

Ejemplos prácticos

  • Ejemplo de finanzas tradicionales: predecir el precio de las acciones con un 95% de confianza: $52,30 ± $4,20
  • Tutorial de cálculo: intervalos más amplios para valores de X alejados de la media
  • Interpretación: Los intervalos de predicción son más amplios que los intervalos de confianza.

Aplicación DeFi

  • Ejemplo de protocolo: Predicción de rangos de precios de tokens para reequilibrio automatizado
  • Implementación: Intervalos de predicción dinámicos en estrategias de optimización del rendimiento.
  • Ventajas/Desafíos: niveles de confianza adaptativos frente a sobrecarga computacional

OA6: Describir diferentes formas funcionales de regresiones lineales simples

Concepto central

  • Definición: Transformaciones de variables para capturar relaciones no lineales manteniendo el marco de regresión lineal
  • Por qué es importante: muchas relaciones financieras no son lineales, pero pueden linealizarse mediante transformaciones.
  • Componentes clave:
    • Modelos log-lineales
    • Modelos de registro lineal
    • Modelos log-log
    • Términos polinomiales

Fórmulas y cálculos- Log-lineal: ln(Y) = b₀ + b₁X (crecimiento exponencial)

  • Logaritmo lineal: Y = b₀ + b₁ln(X) (rendimientos decrecientes)
  • Log-log: ln(Y) = b₀ + b₁ln(X) (modelo de elasticidad)
  • Pasos de HP 12C: utilice la función [LN] para transformar variables antes de la regresión

Ejemplos prácticos

  • Ejemplo de finanzas tradicionales: rendimiento de las acciones versus logaritmo de la capitalización de mercado (efecto de tamaño)
  • Tutorial de cálculo: ln(Precio) = 2,5 + 0,3×El tiempo captura el crecimiento compuesto
  • Interpretación: Las transformaciones logarítmicas a menudo estabilizan la varianza y linealizan las relaciones.

Aplicación DeFi

  • Ejemplo de protocolo: modelo log-log para liquidez versus volumen de operaciones en AMM
  • Implementación: Variables transformadas en el modelado de la curva de rendimiento.
  • Ventajas/Desafíos: Mejor ajuste del modelo frente a complejidad de interpretación

Resumen de conceptos básicos (principio 80/20)

Conceptos imprescindibles

  1. Estimación de mínimos cuadrados: minimiza la suma de residuos cuadrados para encontrar la línea de mejor ajuste
  2. Interpretación R²: Proporción de variación en Y explicada por X
  3. Violaciones de supuestos: verifique los gráficos residuales para detectar patrones que indiquen problemas
  4. Importancia estadística: utilice pruebas t para coeficientes, prueba F para el modelo general
  5. Intervalos de predicción frente a intervalos de confianza: los intervalos de predicción son más amplios debido a la incertidumbre adicional

Tabla de referencia rápida

ConceptoFórmulaCuándo utilizarEquivalente DeFi
Regresión simpleY = b₀ + b₁X + εRelaciones linealesPrecio del token frente a TVL
RSS/SSTEvaluación de ajuste del modeloMétricas de eficiencia de AMM
Estadística FMSR/MSEImportancia generalModelos de riesgo de protocolo
Intervalo de predicciónŶ ± t×VER×√[…]PrevisiónPredicción del rango de rendimiento

Hoja de fórmula completa

Fórmulas esenciales

Formula 1: Simple Linear Regression
Y = b₀ + b₁X + ε
Where: Y = dependent variable, X = independent variable,
       b₀ = intercept, b₁ = slope, ε = error term
Used for: Modeling linear relationships

Formula 2: Least Squares Coefficients
b₁ = Σ[(X - X̄)(Y - Ȳ)] / Σ[(X - X̄)²]
b₀ = Ȳ - b₁X̄
Where: X̄, Ȳ = sample means
Used for: Coefficient estimation

Formula 3: Coefficient of Determination
R² = SSR/SST = 1 - (SSE/SST)
Where: SST = total sum of squares, SSR = regression sum of squares,
       SSE = error sum of squares
Used for: Measuring goodness of fit

Formula 4: F-statistic
F = MSR/MSE = [SSR/1] / [SSE/(n-2)]
Where: MSR = mean square regression, MSE = mean square error
Used for: Testing overall model significance

Formula 5: Standard Error of Estimate
SEE = √[SSE/(n-2)]
Where: n = sample size
Used for: Measuring prediction accuracy

Formula 6: Prediction Interval
Ŷ ± t(α/2,n-2) × SEE × √[1 + 1/n + (X-X̄)²/Σ(X-X̄)²]
Used for: Forecasting with uncertainty bounds

Secuencias de la calculadora HP 12C

Operation 1: Linear Regression Setup
RPN Steps: [f] [CLx], enter data pairs [ENTER] [Σ+], [f] [REG]
Example: Calculate slope and intercept from data points

Operation 2: Correlation Coefficient
RPN Steps: [f] [REG], [RCL] [7] (displays correlation)
Example: r = 0.85 indicates strong positive relationship

Operation 3: Prediction Calculation
RPN Steps: [RCL] [4], X value [ENTER], [RCL] [3], [×], [+]
Example: Predict Y when X = 10 using stored coefficients

Problemas de práctica

Nivel Básico (Comprensión)

  1. Problema: Una regresión de los rendimientos de las acciones (Y) sobre los rendimientos del mercado (X) produce: Y = 0,02 + 1,3X. El R² = 0,56.
    • Given: Regression equation and R²
    • Find: Interpret the coefficients and R²
    • Solution:
      • Intercept (0.02): Stock has 2% expected return when market return is 0%
      • Slope (1.3): For each 1% increase in market return, stock return increases 1.3%
      • R² (0.56): 56% of stock return variation is explained by market movements
    • Answer: The stock has above-market sensitivity (beta > 1) and modest explanatory power

Nivel intermedio (Aplicación)

  1. Problema: el TVL de un protocolo DeFi (Y, en millones) se compara con el precio del token (X, en dólares): Y = 50 + 15X, SEE = $25M, n = 30.
    • Given: Regression equation, standard error, sample size
    • Find: 95% prediction interval when token price = $10
    • Solution:
      • Point prediction: Ŷ = 50 + 15(10) = $200M
      • t₀.₀₂₅,₂₈ ≈ 2.048
      • Prediction interval: 200 ± 2.048 × 25 × √[1 + 1/30 + (10-X̄)²/Σ(X-X̄)²]
      • Assuming standard terms: 200 ± 51.2
    • Answer: TVL prediction ranges from $148.8M to $251.2M with 95% confidence

Nivel avanzado (Análisis)

  1. Problema: Analice un modelo de rendimiento agrícola utilizando transformaciones logarítmicas. Modelo original: ln(Rendimiento) = 2,5 + 0,8×ln(Riesgo), R² = 0,72, F = 45,6
    • Given: Log-log regression with goodness-of-fit measures
    • Find: Interpret the elasticity coefficient and evaluate model adequacy
    • Solution:
      • Elasticity interpretation: 1% increase in risk leads to 0.8% increase in yield
      • Model fit: 72% of yield variation explained by risk
      • F-test: Highly significant relationship (F = 45.6 >> F₀.₀₅,₁,₂₈ ≈ 4.2)
      • Economic meaning: Diminishing returns to risk-taking
    • Answer: Model shows strong risk-return relationship with less than proportional yield increases for additional risk, consistent with efficient market theory

Aplicaciones DeFi y ejemplos del mundo real

Contexto financiero tradicional

  • Ejemplo de institución: los bancos utilizan la regresión para modelar las tasas de incumplimiento de los préstamos en función de las calificaciones crediticias.
  • Aplicación de Mercado: Estimación Beta para la gestión de riesgos de cartera
  • Caso Histórico: Estudios de validación CAPM utilizando regresión de índices de mercado

Paralelos de DeFi- Implementación del protocolo: el protocolo Compound utiliza modelos de tasas de interés basados en regresión defi-application

  • Lógica de contrato inteligente: los creadores de mercado automatizados emplean la regresión para descubrir precios
  • Ventajas: Recalibración en tiempo real, algoritmos transparentes, funcionamiento 24 horas al día, 7 días a la semana
  • Limitaciones: Costos del gas, dependencias de Oracle, riesgo de modelo en mercados volátiles

Estudios de caso

  1. Caso 1: Predicción de liquidez Uniswap V3
    • Antecedentes: AMM necesita predecir rangos de liquidez óptimos
    • Análisis: Regresión del volumen de operaciones según la volatilidad de los precios y el TVL
    • Resultados: Mejora de la eficiencia del capital mediante el ajuste del rango dinámico
    • Lecciones aprendidas: las relaciones no lineales requieren una transformación cuidadosa

Errores comunes y consejos para los exámenes

Errores frecuentes

  • Error 1: Correlación confusa con causalidad: la regresión muestra asociación, no causalidad
  • Error 2: Ignorar las violaciones de suposiciones; siempre verifique las gráficas residuales
  • Error 3: Sobreinterpretar R²: un R² alto no garantiza buenas predicciones fuera del rango de muestra

Estrategia de examen

  • Gestión del tiempo: asigne de 4 a 5 minutos por problema de regresión
  • Patrones de preguntas: A menudo se combinan con pruebas de hipótesis e intervalos de confianza.
  • Comprobaciones rápidas: Verifique que R² esté entre 0 y 1, verifique las unidades en las predicciones

Conclusiones clave

Puntos esenciales

✓ Modelos de regresión lineal simple Y = b₀ + b₁X + ε donde b₁ representa el efecto marginal ✓ Las medidas R² explicaron la variación; los valores más altos indican un mejor ajuste del modelo ✓ Cuatro supuestos clave: linealidad, homocedasticidad, independencia, normalidad ✓ La prueba F evalúa la importancia general del modelo; Las pruebas t evalúan coeficientes individuales. ✓ Los intervalos de predicción son más amplios que los intervalos de confianza debido a la incertidumbre adicional

Ayudas para la memoria

  • Mnemónico: “LÍNEA” para supuestos (Linealidad, Independencia, Normalidad, Igual varianza)
  • Visual: diagrama de dispersión con línea de mejor ajuste y diagramas residuales
  • Analogía: La regresión es como encontrar la relación “promedio” entre variables.

Referencias cruzadas y recursos adicionales

Temas relacionados

Materiales de origen

  • Lectura principal: Volumen 1, Capítulo 10, Regresión lineal simple
  • Secciones clave: Estimación de mínimos cuadrados, prueba de supuestos, ANOVA
  • Preguntas de práctica: Problemas de final de capítulo 1-15

Recursos externos

  • Videos: Serie de estadísticas de Khan Academy sobre regresión
  • Artículos: “Análisis de regresión en finanzas” - Finance Research Foundation
  • Herramientas: análisis de regresión de Excel, software estadístico R, Python scipy

Revisar la lista de verificación

Antes de continuar, asegúrese de poder:- [ ] Explica cada objetivo de aprendizaje con tus propias palabras.

  • Calcular coeficientes de regresión utilizando el método de mínimos cuadrados.
  • Complete la tabla ANOVA e interprete la estadística F
  • Verifique los supuestos de regresión mediante análisis residual
  • Calcula e interpreta intervalos de predicción.
  • Identificar transformaciones de forma funcional apropiadas
  • Aplicar conceptos tanto a escenarios financieros tradicionales como a escenarios DeFi