Estimación e inferencia

Cobertura de objetivos de aprendizaje

OA1: Comparar y contrastar el muestreo aleatorio simple, aleatorio estratificado, de conglomerados, de conveniencia y de criterio y sus implicaciones para el error de muestreo en un problema de inversión

Concepto central

Los métodos de muestreo son técnicas para seleccionar un subconjunto de observaciones de una población para hacer inferencias sobre toda la población. Una metodología de muestreo adecuada garantiza una inferencia estadística válida y reduce el error de muestreo en el análisis de inversiones. La distinción clave es entre muestreo probabilístico (donde cada miembro de la población tiene una probabilidad de selección conocida distinta de cero) y muestreo no probabilístico (donde la selección depende del juicio del investigador).

Fórmulas y cálculos

  • Error de muestreo: Diferencia entre el valor estadístico observado y la cantidad que estima
  • Determinación del tamaño de la muestra: Las muestras más grandes reducen el error de muestreo proporcionalmente a 1/√n
  • Pasos HP 12C: No se aplica directamente para la selección del método de muestreo

Ejemplos prácticos

  • Ejemplo de finanzas tradicionales: construcción del índice de bonos mediante muestreo estratificado
    • Dividir bonos por tipo de emisor (agencia, Tesoro, corporativo)
    • Estratificar aún más por intervalos de vencimiento (10 categorías) y tasas de cupón (2 niveles)
    • Crea 60 estratos (3 × 10 × 2) que requieren un mínimo de 60 números
  • Tutorial de cálculo: seleccione muestras proporcionales de cada estrato según las ponderaciones del valor de mercado
  • Interpretación: Garantiza que todas las características de los bonos estén representadas en la cartera.

Aplicación DeFi

  • Ejemplo de protocolo: análisis del proveedor de liquidez Uniswap v3
  • Implementación: estratifique los LP por tamaño de posición, nivel de tarifas y concentración del rango de precios
  • Ventajas/Desafíos: los datos en cadena brindan acceso completo a la población frente a las limitaciones de muestreo tradicionales

OA2: Explique el teorema del límite central y su importancia para la distribución y el error estándar de la media muestral

Concepto central

El teorema del límite central (CLT) es posiblemente el resultado estadístico más importante para los analistas financieros. Afirma que para cualquier población con varianza finita, la distribución muestral de la media muestral se acerca a una distribución normal a medida que aumenta el tamaño de la muestra, independientemente de la forma de la distribución poblacional subyacente. Esto es lo que justifica el uso de pruebas z y t en pruebas de hipótesis, incluso cuando los datos originales son sesgados o curtósicos (como es típico para los rendimientos de activos analizados en Tema 3). El CLT se aplica de manera confiable cuando n >= 30. exam-focus

Fórmulas y cálculos

  • Fórmula principal: Error estándar = σ/√n (población σ conocida) o s/√n (población σ desconocida) formula exam-focus
  • Pasos HP 12C: hp12c
    Standard Error calculation:
    [σ or s] ENTER
    [n] √x ÷
    
  • Variaciones comunes: Corrección de población finita cuando se muestrea > 5% de la población

Ejemplos prácticos- Ejemplo de finanzas tradicionales: análisis del índice de acciones Euro-Asia-África

  • Población: 1.258 retornos diarios, media = 0,035%
  • Muestra de 30: Error estándar = 1,26%/√30 = 0,23%
  • Muestra de 100: Error estándar = 1,26%/√100 = 0,126%
  • Tutorial de cálculo: a medida que el tamaño de la muestra aumenta de 30 a 100, el error estándar disminuye en un 45%
  • Interpretación: Las muestras más grandes proporcionan estimaciones más precisas de los parámetros poblacionales

Aplicación DeFi

  • Ejemplo de protocolo: análisis de las tasas de interés de los préstamos Aave en diferentes condiciones del mercado defi-application
  • Implementación: calcule las tarifas promedio a partir de instantáneas horarias, aplique CLT para intervalos de confianza
  • Ventajas/Desafíos: los datos en cadena de alta frecuencia permiten tamaños de muestra grandes, lo que mejora la precisión de las estimaciones

OA3: Describir el uso del remuestreo (bootstrap, jackknife) para estimar la distribución muestral de una estadística

Concepto central

Los métodos de remuestreo son técnicas computacionales que extraen repetidamente muestras de datos originales para estimar distribuciones muestrales. El método bootstrap (tratado con más profundidad en el tema de simulación) extrae muestras con reemplazo, mientras que el método jackknife utiliza un enfoque de dejar uno afuera. Estos métodos son invaluables cuando no existen fórmulas analíticas para errores estándar o son demasiado complejas para derivarlas.

Fórmulas y cálculos

  • Error estándar de Bootstrap: sX̄ = √[1/(B-1) × Σ(θ̂b - θ̄)²]
    • B = número de remuestreos (normalmente entre 1.000 y 10.000)
    • θ̂b = estadística del remuestreo b
    • θ̄ = media de todas las estadísticas de remuestreo
  • Pasos HP 12C: No aplicable directamente; requiere métodos computacionales
  • Variaciones comunes: arranque percentil para intervalos de confianza

Ejemplos prácticos

  • Ejemplo de finanzas tradicionales: acciones que rara vez se negocian con rendimientos de 12 meses
    • Generar 1000 muestras de arranque
    • Calcular la media para cada remuestreo.
    • Error estándar de bootstrap = 0,04408
  • Tutorial de cálculo: Dibuje 12 resultados con reemplazo, calcule la media, repita 1000 veces
  • Interpretación: Proporciona una estimación del error estándar a pesar del pequeño tamaño de la muestra

Aplicación DeFi

  • Ejemplo de protocolo: estimación de intervalos de confianza para pérdidas impermanentes en grupos Uniswap defi-application
  • Implementación: Bootstrap rutas históricas de precios para simular distribuciones IL
  • Ventajas/Desafíos: Maneja distribuciones no normales comunes en los mercados criptográficos.

Resumen de conceptos básicos (principio 80/20)

Conceptos imprescindibles

  1. Teorema del límite central: Las medias muestrales se distribuyen normalmente independientemente de la distribución de la población cuando n ≥ 30
  2. Error estándar: Mide la precisión de las estimaciones de la muestra, disminuye con √n
  3. Muestreo estratificado: divide la población en grupos homogéneos para obtener muestras más representativas.
  4. Bootstrap: remuestreo con reemplazo para estimar distribuciones de estadísticas complejas

Tabla de referencia rápida| Concepto | Fórmula | Cuándo utilizar | Equivalente DeFi |

| ------------------- | ------------------------- | -------------------------------- | ---------------------------------- | | Error estándar | σ/√n o s/√n | Estimación de la precisión media muestral | Estimaciones de volatilidad de TVL | | Aplicación CLT | n ≥ 30 para normalidad | Haciendo inferencias poblacionales | Estadísticas de uso de protocolos | | Muestreo estratificado | Asignación proporcional | Poblaciones heterogéneas | Análisis de posición LP por tamaño | | Arranque | Remuestreo con reemplazo | No existe ninguna fórmula analítica | Distribuciones de rendimiento de la agricultura de rendimiento |

Hoja de fórmula completa

Fórmulas esenciales

Sample Variance:
s² = Σ(Xi - X̄)² / (n - 1)
Where: Xi = individual observations, X̄ = sample mean, n = sample size
Used for: Estimating population variance from sample data

Standard Error (known σ):
σX̄ = σ / √n
Where: σ = population standard deviation, n = sample size
Used for: Calculating precision of sample mean estimates

Standard Error (unknown σ):
sX̄ = s / √n
Where: s = sample standard deviation, n = sample size
Used for: Real-world applications where population σ is unknown

Bootstrap Standard Error:
sX̄ = √[1/(B-1) × Σ(θ̂b - θ̄)²]
Where: B = number of resamples, θ̂b = resample statistic, θ̄ = mean of resamples
Used for: Estimating standard error of complex statistics

Secuencias de la calculadora HP 12C

Standard Error Calculation:
RPN Steps: [std dev] ENTER [sample size] √x ÷
Example: 15.5 ENTER 25 √x ÷ = 3.1

Sample Variance (manual):
RPN Steps: Use Σ+ key for data entry, then g s² for variance
Example: Clear statistics (f Σ), enter each value followed by Σ+, then g s

Coefficient of Variation:
RPN Steps: [std dev] ENTER [mean] ÷ 100 ×
Example: 3.5 ENTER 25 ÷ 100 × = 14%

Problemas de práctica

Nivel Básico (Comprensión)

  1. Problema: Calcular el error estándar para una muestra de 36 observaciones con población σ = 12
    • Dado: n = 36, σ = 12
    • Buscar: Error estándar de la media muestral
    • Solución: σX̄ = σ/√n = 12/√36 = 12/6 = 2
    • Respuesta: El error estándar es 2, lo que significa que las medias muestrales normalmente se desvían en 2 unidades de la media poblacional.

Nivel Intermedio (Aplicación)

  1. Problema: los rendimientos diarios de un protocolo DeFi tienen una media del 0,5% y una desviación estándar del 3%. ¿Cuál es el error estándar para los rendimientos promedio de 50 días?
    • Given: μ = 0.5%, σ = 3%, n = 50
    • Find: Standard error of 50-day average
    • Solution:
      • σX̄ = 3%/√50 = 3%/7.07 = 0.424%
      • By CLT, distribution is approximately normal
    • Answer: 0.424% standard error; 95% of 50-day averages fall within ±0.85% of true mean

Nivel avanzado (Análisis)

  1. Problema: Compare el muestreo aleatorio simple versus el muestreo estratificado para un índice criptográfico con 60% de gran capitalización (σ = 2%), 30% de mediana capitalización (σ = 4%), 10% de pequeña capitalización (σ = 8%)
    • Given: Population proportions and volatilities by market cap
    • Find: Relative efficiency of stratified sampling
    • Solution:
      • Simple random: Uses pooled variance
      • Stratified: Weighted average of strata variances
      • Efficiency gain = reduction in standard error
    • Answer: Stratified sampling reduces standard error by approximately 25%, providing more precise estimates

Aplicaciones DeFi y ejemplos del mundo real

Contexto financiero tradicional

  • Ejemplo de institución: los bancos de inversión utilizan muestreo estratificado para la evaluación de riesgos en diversas carteras
  • Aplicación de mercado: los administradores de fondos indexados emplean técnicas de muestreo para realizar un seguimiento eficiente de los índices de referencia.
  • Caso histórico: el fallo del LTCM destacó la importancia de un muestreo adecuado en todas las condiciones del mercado

Paralelos de DeFi

  • Implementación del protocolo: el compuesto utiliza muestreo ponderado exponencialmente para modelos de tasas de interés
  • Lógica de contrato inteligente: los oráculos de Chainlink agregan muestras de precios utilizando métodos estadísticos sólidos
  • Ventajas: los datos completos en cadena eliminan el sesgo de muestreo debido a la disponibilidad de datos
  • Limitaciones: los costos del gas limitan las implementaciones complejas de remuestreo en la cadena

Estudios de caso

  1. Caso 1: Análisis de la estrategia de producción agrícola de rendimiento
    • Background: Evaluating returns across multiple DeFi protocols
    • Analysis: Bootstrap 1,000 portfolio combinations from historical yields
    • Outcomes: 95% confidence interval for expected returns: [12%, 28%] APY
    • Lessons learned: Resampling captures correlation structures missed by simple averaging

Errores comunes y consejos para los exámenes

Errores frecuentes

  • Error 1: Usar la desviación estándar de la muestra en lugar del error estándar para la inferencia - Recuerde dividir por √n
  • Error 2: Aplicar CLT con muestras pequeñas (n < 30) - Los resultados pueden no ser confiables
  • Error 3: Ignorar los beneficios de la estratificación en poblaciones heterogéneas - Puede mejorar significativamente la precisión

Estrategia de examen

  • Gestión del tiempo: 3-4 minutos por pregunta de muestra
  • Patrones de preguntas: a menudo se combinan con pruebas de hipótesis en temas posteriores
  • Comprobaciones rápidas: Verifique que el error estándar disminuya a medida que n aumenta

Conclusiones clave### Puntos esenciales

✓ El teorema del límite central permite asumir una distribución normal para muestras grandes (n ≥ 30) ✓ Error estándar = σ/√n mide la precisión del muestreo ✓ El muestreo estratificado mejora la eficiencia para poblaciones heterogéneas ✓ Bootstrap proporciona estimaciones de distribución sin fórmulas analíticas ✓ La elección del método de muestreo afecta significativamente la validez de la inferencia

Ayudas para la memoria

  • Mnemónico: “CLT en 30” - Teorema del límite central confiable en n = 30+
  • Visual: la curva de campana surge de cualquier forma de distribución a medida que n aumenta
  • Analogía: el muestreo es como probar una sopa: la agitación (aleatorización) garantiza un sabor representativo

Referencias cruzadas y recursos adicionales

Temas relacionados

Materiales de origen

  • Lectura primaria: Volumen 1, Capítulo 7, Páginas 1-28
  • Secciones clave: explicación de CLT (p.12-15), métodos Bootstrap (p.20-24)
  • Preguntas de práctica: Problemas de final de capítulo 1-15

Recursos externos

  • Videos: Serie del teorema del límite central de Khan Academy
  • Artículos: “Métodos Bootstrap y su aplicación” por Davison & Hinkley
  • Herramientas: paquete de arranque de R, scipy.stats.bootstrap de Python

Revisar la lista de verificación

Antes de continuar, asegúrese de poder:

  • Distinguir entre los cinco métodos de muestreo y sus usos apropiados
  • Calcular el error estándar dada la población o la desviación estándar de la muestra
  • Explica por qué CLT es crucial para la inferencia estadística
  • Describe cuándo usar bootstrap versus métodos analíticos
  • Aplicar conceptos de muestreo al análisis del protocolo DeFi