Este es el examen final de Calibración: saber lo que sabes. Reúne todo el curso: qué significa de verdad la calibración (calibration) (el encaje entre tu confianza declarada y tu tasa real de aciertos), la curva de fiabilidad (reliability curve) y las dos caras de la sobreconfianza (overconfidence) —la sobreestimación (overestimation) y la sobreprecisión (overprecision)—, las reglas de puntuación propias que califican tu honestidad (el Brier score y el log score), pensar en rangos en lugar de en puntos, y los hábitos prácticos que te calibran. Varias preguntas parecen fáciles hasta que descubres la trampa: un pronosticador perfectamente calibrado pero completamente inútil, una respuesta segura que debería haber sido humilde, o un Brier score leído al revés. Razona cada una con calma; recuerda que un Brier más bajo es mejor, y que la calibración no es lo mismo que la exactitud (accuracy).
Cómo funciona este examen
Lee con atención: este examen es definitivo. Cada pregunta aparece de una en una. Una vez que envías una respuesta queda bloqueada para siempre: no hay vuelta atrás, ni segundo intento, ni reinicio. Tu puntuación permanece oculta hasta el final, donde verás un veredicto de aprobado o suspenso. La nota de aprobado es el 70%. Algunas preguntas te piden que selecciones todas las respuestas correctas.
¿Qué significa estar "bien calibrado"?
Selecciona una respuesta para continuar.
Repaso del curso
Big picture
La calibración en una imagen
- Calibración: saber lo que sabes
- Qué significa la calibración
- La confianza declarada debería coincidir con la tasa real de aciertos: de todas tus llamadas al 70%, ~70% se cumplen. La curva de fiabilidad traza la confianza (x) frente a la fracción de aciertos (y); la línea de 45 grados es perfecta; por debajo = sobreconfiado, por encima = infraconfiado. La calibración no es la exactitud: los meteorólogos son el patrón oro.
- Sobreconfianza y sobreprecisión
- Dos caras: la sobreestimación (respuestas al 90% que aciertan ~75%) y la sobreprecisión (intervalos del 90% que atrapan la verdad solo el ~40-50% de las veces). El efecto fácil-difícil hace que la sobreconfianza sea peor en las preguntas difíciles. Impulsada por no buscar evidencia que desmienta, recordar los aciertos y la recompensa social por sonar seguro.
- Puntuar tus creencias
- Las reglas de puntuación propias hacen óptima la honestidad. Brier = (p − o) al cuadrado, promediado; 0 lo mejor, 1 lo peor, MÁS BAJO es mejor. El log score es brutal con los fallos seguros: nunca digas 0% ni 100%. El Brier se descompone en calibración + resolución.
- Pensar en rangos
- Estimación puntual frente a intervalo de confianza. Los primeros intervalos son demasiado estrechos: ensánchalos a propósito. Usa la disciplina del intervalo del 90% (espera ~1 fallo de cada 10); fija límites que estés un 95% seguro de que son demasiado bajo y demasiado alto. Unos márgenes de error honestos dimensionan tu margen de seguridad.
- Conseguir calibrarse
- Anota las predicciones ANTES de los resultados (combate el sesgo retrospectivo); da rangos + probabilidades explícitas; puntúa, mira la curva de fiabilidad y ajusta. Separa la calidad de la decisión de la suerte del resultado; ancla en las tasas base (se conecta con Bayes). Los superpronosticadores usan tasas base, actualizaciones pequeñas y probabilidades de grano fino. Un reloj que siempre dice 50% está calibrado pero es inútil: apunta a estar calibrado Y ser decidido.
- Qué significa la calibración
Ideas clave
La calibración es la disciplina silenciosa de hacer que tu confianza diga la verdad: de todas las veces que dices 70%, la cosa debería cumplirse alrededor del 70% de las veces; esa es la línea de 45 grados en la curva de fiabilidad, con la sobreconfianza situada por debajo y la infraconfianza por encima. No es lo mismo que la exactitud: los pronosticadores de moneda del 50%-siempre y del 99%-siempre comparten tasa de aciertos pero viven en mundos opuestos. La sobreconfianza tiene dos caras —conjeturas que se van demasiado arriba y márgenes de error demasiado estrechos— y la cura es puntuarte con honestidad. El Brier score (más bajo es mejor, de 0 a 1) y el brutal log score recompensan decir la verdad y castigan los fallos seguros, así que nunca dices 0% ni 100%. Piensa en rangos, no en puntos: ensancha tu primer intervalo, espera alrededor de 1 fallo de cada 10 en un intervalo del 90% real, y deja que unos márgenes de error honestos dimensionen tu margen de seguridad. Después construye el bucle de hábitos: anota antes de los resultados, ancla en las tasas base, actualiza en pequeños pasos como un superpronosticador, y separa la calidad de tu decisión de la suerte del resultado. Por encima de todo, recuerda la trampa del reloj que siempre dice 50%: perfectamente calibrado, absolutamente inútil. La meta no es solo la humildad: es la calibración y la decisión, juntas.