Capítulo 06a: Probabilidad: comprender y cuantificar el azar.

PARTE 1 DE 18
CAPÍTULO 6

Probabilidad: comprender y cuantificar el azar

¿Qué es la probabilidad?

Del «puede ocurrir» a una medida matemática entre 0 y 1

Idea central

Muchas situaciones de la vida, la ciencia y la tecnología no pueden predecirse con absoluta certeza. Sin embargo, eso no significa que no podamos razonar acerca de ellas. La probabilidad proporciona un lenguaje matemático para describir y cuantificar la incertidumbre. En esta parte aprenderemos la idea matemática básica y, al mismo tiempo, veremos cómo aparece en meteorología, ingeniería, control de calidad, medición, medicina, deporte y otras áreas.

Al finalizar esta parte podrás:
diferenciar certeza e incertidumbre;
explicar qué significa que un fenómeno sea aleatorio;
interpretar una probabilidad como una medida entre 0 y 1;
expresar probabilidades como fracciones, decimales y porcentajes;
distinguir posibilidad de equiprobabilidad;
diferenciar probabilidad y frecuencia relativa;
interpretar correctamente una probabilidad alta o baja;
reconocer errores intuitivos frecuentes;
reconocer aplicaciones reales de la probabilidad;
relacionar una representación matemática con el fenómeno que modela.

6.1. Hay preguntas cuya respuesta conocemos y otras que no

Observa las siguientes situaciones.

SITUACIÓN A · CERTEZA

Tenemos una caja y comprobamos que contiene exactamente 12 lápices.

Podemos afirmar con certeza cuántos lápices contiene.

SITUACIÓN B · AZAR

Lanzamos una moneda y queremos saber qué lado quedará hacia arriba.

Antes del lanzamiento no podemos conocer con certeza el resultado.

SITUACIÓN C · PRONÓSTICO

Queremos saber si lloverá mañana por la tarde.

Podemos disponer de información meteorológica, pero todavía existe incertidumbre.

La probabilidad aparece precisamente cuando queremos razonar acerca de situaciones en las que no podemos anticipar con certeza un resultado concreto.

Pregunta para conectar con el mundo real

¿Cómo puede un meteorólogo, un ingeniero, un médico o un entrenador tomar decisiones si no conoce con certeza lo que ocurrirá? Una respuesta fundamental es: cuantificando la incertidumbre.

6.2. ¿Qué significa azar?

En el lenguaje cotidiano decimos que algo ocurre «al azar» cuando no sabemos de antemano cuál será el resultado.

En probabilidad necesitamos una formulación más cuidadosa.

Un fenómeno aleatorio es aquel para el cual podemos describir los resultados posibles, pero no podemos determinar con certeza cuál de ellos ocurrirá en una realización concreta antes de observarla.

Por ejemplo, antes de lanzar un dado podemos decir que los resultados posibles son:

1
2
3
4
5
6

Pero antes de realizar el lanzamiento no sabemos cuál aparecerá.

Importante

«Aleatorio» no significa necesariamente «sin causa». Significa que, dentro del modelo utilizado y con la información disponible, el resultado individual no puede predecirse con certeza.

6.3. ¿Qué es la probabilidad?

La probabilidad es una medida matemática utilizada para expresar qué tan posible es que ocurra un determinado evento dentro de un modelo probabilístico.

Por ahora representaremos mediante la letra A aquello cuya ocurrencia nos interesa.

Su probabilidad se escribe:

P(A)

Se lee: «probabilidad de A».

6.4. La probabilidad siempre pertenece a un modelo

Cuando decimos:

P(A)=0,70,

no estamos escribiendo una propiedad aislada del mundo. Estamos trabajando dentro de un conjunto de supuestos, información y reglas que constituyen un modelo.

Un modelo probabilístico es una representación matemática de una situación de incertidumbre. Especifica qué resultados consideramos posibles y cómo asignamos probabilidad a los eventos que queremos estudiar.

IDEA FUNDAMENTAL

«Una probabilidad describe la incertidumbre de un evento dentro de un modelo. No garantiza el resultado de una realización individual.»

Esta frase contiene una de las ideas más importantes de toda la teoría de probabilidades. Conviene comprenderla lentamente.

Primera idea · La probabilidad habla de incertidumbre

Si escribimos P(A)=0,70, estamos diciendo que, dentro del modelo utilizado, el evento A recibe una probabilidad de 0,70. No estamos afirmando que A ya haya ocurrido, ni que esté «70 % ocurrido», ni que podamos observar físicamente un 70 % del evento.

Segunda idea · Una realización individual termina en un resultado concreto

Imagina un evento A cuya probabilidad es:

P(A)=0,70.

Cuando realizamos el experimento una sola vez, no obtenemos «0,70 de A». O bien A ocurre, o bien A no ocurre. El número 0,70 describe la incertidumbre antes de conocer el resultado; no describe una fracción física del resultado individual.

Tercera idea · Probabilidad alta no significa certeza

Si:

P(A)=0,90,

A tiene una probabilidad alta. Pero todavía existe:

P(no A)=0,10.

Por tanto, una realización individual en la que A no ocurra puede ser perfectamente compatible con el modelo. Un resultado poco probable no es necesariamente un resultado imposible.

Cuarta idea · Una realización no confirma ni destruye por sí sola un modelo

Supongamos que un modelo meteorológico asigna:

P(lluvia)=0,80.

Si finalmente no llueve, no podemos concluir inmediatamente:

«El modelo estaba equivocado porque decía 80 % y no llovió». ✗

El propio modelo asignaba una probabilidad de 0,20 a que no lloviera. Para evaluar científicamente un modelo necesitamos examinar su comportamiento en muchas situaciones y comparar sistemáticamente sus predicciones probabilísticas con los resultados observados.

Quinta idea · La probabilidad depende del modelo y de la información disponible

Dos personas pueden asignar probabilidades diferentes a un mismo evento si trabajan con información o modelos diferentes.

Un pronóstico meteorológico realizado hoy puede asignar:

P(lluvia mañana)=0,40,

y varias horas después, al incorporar nuevas observaciones atmosféricas, el modelo puede producir:

P(lluvia mañana)=0,70.

El evento futuro sigue siendo el mismo. Lo que cambió fue la información utilizada para cuantificar nuestra incertidumbre.

Lectura más formal

Para un lector universitario conviene expresarlo con mayor precisión: P(A) es una cantidad asociada al evento A dentro de un modelo probabilístico. Su función no es predecir determinísticamente cada realización, sino cuantificar matemáticamente la incertidumbre asignada a A.

Una realización individual produce un resultado particular. La probabilidad pertenece al modelo previo al resultado; el resultado observado pertenece a los datos. Confundir ambos niveles conduce a muchos errores de interpretación.

La misma idea en cuatro contextos
METEOROLOGÍA

P(lluvia)=0,70

Puede llover o no llover mañana. El 70 % cuantifica la incertidumbre del pronóstico; no garantiza lluvia.

INGENIERÍA

P(falla)=0,01

Un componente individual puede fallar aunque la probabilidad sea pequeña, o funcionar correctamente aunque se estudie un riesgo de falla.

SALUD

P(A)=0,20

Una probabilidad de riesgo no significa que una persona esté «20 % enferma». Describe incertidumbre sobre un evento definido dentro de un modelo.

DEPORTE

P(acierto)=0,80

Un jugador con alta probabilidad de acierto todavía puede fallar el siguiente intento. El modelo no convierte el próximo resultado en una certeza.

Una pregunta útil para comprobar que entendiste

Si un evento tiene probabilidad 0,95 y finalmente no ocurre, ¿existe necesariamente una contradicción?

No. El modelo asignaba todavía una probabilidad de 0,05 al resultado contrario. Lo observado puede ser poco frecuente bajo el modelo sin ser imposible.

Por eso debemos comenzar a distinguir:

REALIDAD

El fenómeno que queremos comprender.

MODELO

La representación matemática que construimos.

DATOS

Las observaciones obtenidas del fenómeno.

6.5. La escala fundamental de la probabilidad

Toda probabilidad se encuentra entre 0 y 1:

0 ≤ P(A) ≤ 1
Figura 6.1
Una misma escala matemática sirve para representar incertidumbres de ciencias muy diferentes
A · MODELO MATEMÁTICO 0 0,25 0,50 0,75 1 imposible en el modelo incertidumbre intermedia seguro en el modelo B · APLICACIONES DEL MUNDO REAL METEOROLOGÍA Evento: «llueve mañana» P(A)=0,70 INGENIERÍA Evento: «pieza defectuosa» P(B)=0,02 MEDICINA Y SALUD Evento: «resultado positivo» P(C)=0,08 DEPORTE Evento: «convierte el tiro» P(D)=0,75 MISMA ESCALA MATEMÁTICA DISTINTOS SIGNIFICADOS DEL EVENTO

Nota. Elaboración propia. Los contextos científicos son reales, pero los valores numéricos mostrados son hipotéticos con fines didácticos. En todos los casos la probabilidad pertenece a la misma escala matemática de 0 a 1; lo que cambia es el significado del evento.

Puente entre matemática y realidad

La recta de 0 a 1 no pertenece exclusivamente a monedas o dados. Es una estructura matemática general.

Lo que cambia de una ciencia a otra es qué representa el evento, de dónde surge la información y qué hipótesis utiliza el modelo.

6.6. Fracción, decimal y porcentaje

Una misma probabilidad puede representarse de varias maneras.

Tabla 6.1
Tres maneras de representar una misma probabilidad
FRACCIÓN

1/4

DECIMAL

0,25

PORCENTAJE

25 %

1/4 = 0,25 = 25 %

El porcentaje es especialmente útil para comunicar probabilidades, pero matemáticamente representa la misma información que el decimal correspondiente.

6.7. Ejemplo 1 · Lanzar una moneda equilibrada

FUNDAMENTAL · ●○○○

Supongamos una moneda que modelamos como equilibrada.

Los dos resultados posibles son:

CARA

P=1/2=0,50=50 %

SELLO

P=1/2=0,50=50 %

Atención

No hemos demostrado que toda moneda física produzca exactamente 50 % de caras. Estamos utilizando un modelo ideal de moneda equilibrada. Una moneda real puede presentar pequeñas diferencias físicas o experimentales.

6.8. Dos resultados posibles no significan 50 % para cada uno

Una de las intuiciones equivocadas más comunes en probabilidad consiste en pensar:

«Si solamente existen dos posibilidades, entonces cada una debe tener probabilidad 0,50». ✗

Esto es falso.

El número de resultados posibles no determina por sí solo cómo se distribuye la probabilidad entre ellos.

Figura 6.2
De «llueve o no llueve» a un verdadero modelo meteorológico
RAZONAMIENTO INCORRECTO LLUVIA MAÑANA LLUEVE NO LLUEVE ? ? «HAY DOS POSIBILIDADES» NO IMPLICA 0,50 Y 0,50 APLICACIÓN: METEOROLOGÍA radar, satélite y observaciones temperatura y humedad presión atmosférica viento y circulación MODELO DE PRONÓSTICO integra información P(lluvia) probabilidad asignada por el modelo P(llueve)+P(no llueve)=1 PERO P(llueve) NO TIENE QUE SER 0,50

Nota. Elaboración propia. El esquema representa conceptualmente una aplicación meteorológica; no reproduce un sistema de pronóstico específico ni utiliza datos meteorológicos reales.

Este error conceptual se conoce como falacia de equiprobabilidad o, en este contexto, falacia del 50/50.

El hecho de que una situación tenga solamente dos resultados posibles no significa que ambos tengan la misma probabilidad de ocurrir.

El error consiste en razonar:

«O ocurre o no ocurre; por tanto, cada posibilidad tiene probabilidad 0,50».

Que «llueve» y «no llueve» sean las dos alternativas consideradas significa que entre ambas cubren todas las posibilidades.

P(llueve)+P(no llueve)=1.

Pero esa igualdad no obliga a:

P(llueve)=P(no llueve)=0,50. ✗

Podrían ser, por ejemplo:

0,20 y 0,80;    0,65 y 0,35;    0,01 y 0,99.

Lo obligatorio es que ambas probabilidades estén entre 0 y 1 y que sumen 1.

Comparación esencial

Moneda ideal equilibrada: asignamos 0,50 a cara y 0,50 a sello porque el modelo establece equiprobabilidad.

Lluvia de mañana: la probabilidad depende de información meteorológica y del modelo. El simple hecho de tener dos alternativas no permite calcular 0,50.

Idea para recordar

Contar cuántos resultados existen responde: «¿qué puede ocurrir?». Asignar probabilidades responde: «¿qué peso probabilístico tiene cada resultado dentro del modelo?».

6.9. Ejemplo 2 · Un dado equilibrado

FUNDAMENTAL · ●○○○

Consideremos un dado de seis caras que modelamos como equilibrado.

Queremos calcular la probabilidad de obtener un 4.

Los seis resultados:

1, 2, 3, 4, 5 y 6

son equiprobables dentro del modelo.

Hay seis resultados posibles y solamente uno favorable al evento «obtener 4».

P(obtener 4)=1/6≈0,1667≈16,67 %

La regla:

casos favorables / casos posibles

puede utilizarse directamente cuando los resultados elementales considerados son equiprobables.

6.10. Ejemplo 3 · Bolas de colores

INTERMEDIO · ●●○○

Una bolsa contiene cinco bolas del mismo tamaño:

3 rojas y 2 azules.

Si mezclamos adecuadamente y suponemos que cada bola individual tiene la misma posibilidad de ser extraída:

P(roja)=3/5=0,60=60 %
P(azul)=2/5=0,40=40 %

Hay solamente dos categorías de resultado: roja o azul.

60 % ≠ 40 %.

Este ejemplo confirma nuevamente que:

dos resultados posibles no significan dos resultados equiprobables.

6.11. Probabilidad y frecuencia relativa no son lo mismo

Supongamos que repetimos muchas veces un experimento y contamos cuántas veces ocurre A.

Si:

n = número total de ensayos

f = número de veces que observamos A,

definimos la frecuencia relativa:

h=f/n
Tabla 6.2
Probabilidad y frecuencia relativa
PROBABILIDAD P(A)

Pertenece al modelo probabilístico.

Describe cómo cuantificamos la incertidumbre de A dentro de ese modelo.

FRECUENCIA RELATIVA h

Se calcula a partir de observaciones realizadas.

Describe qué proporción de los ensayos realizados produjo A.

6.12. Ejemplo 4 · Frecuencia relativa

Realizamos:

n=20 lanzamientos.

Observamos:

f=12 caras.

Entonces:

h=12/20

h=0,60=60 %

Esto significa:

En esos 20 lanzamientos observados, el 60 % produjo cara.

No significa que hayamos demostrado que la probabilidad del modelo sea exactamente 0,60.

6.13. ¿Qué ocurre cuando aumentamos el número de repeticiones?

Supongamos que simulamos 500 lanzamientos de una moneda bajo un modelo con:

P(cara)=0,50.

La frecuencia relativa de caras no tiene por qué ser 0,50 desde los primeros lanzamientos. Puede subir y bajar repetidamente.

Figura 6.3
La frecuencia relativa: del experimento matemático a aplicaciones reales
A · MODELO DIDÁCTICO: LANZAMIENTOS DE MONEDA P(cara)=0,50 0,30 0,40 0,50 0,60 0,70 1 100 250 400 500 número acumulado de ensayos B · LA MISMA IDEA EN EL MUNDO REAL CONTROL DE CALIDAD h = piezas defectuosas / piezas inspeccionadas La proporción observada ayuda a vigilar un proceso. DEPORTE × h = aciertos / intentos Describe el rendimiento observado hasta ese momento. EL COCIENTE h=f/n ES EL MISMO · CAMBIA EL SIGNIFICADO DE f Y n

Nota. Elaboración propia. La trayectoria de la moneda contiene datos simulados con fines didácticos. Los bloques de fábrica y deporte representan aplicaciones reales mediante ejemplos esquemáticos.

Puente de significado

En la moneda: f puede significar número de caras.

En una fábrica: f puede significar número de piezas defectuosas.

En deporte: f puede significar número de aciertos. La estructura matemática h=f/n permanece.

6.14. Estabilizarse no significa volverse exactamente igual

Cuando aumentamos mucho el número de repeticiones, la frecuencia relativa puede mostrar una tendencia a estabilizarse alrededor de la probabilidad del modelo.

Pero debemos evitar una interpretación incorrecta:

«Después de suficientes ensayos la frecuencia se vuelve exactamente igual a la probabilidad». ✗

No existe esa obligación.

Incluso después de muchísimos ensayos pueden continuar existiendo pequeñas diferencias.

Además, en aplicaciones reales las condiciones pueden cambiar. Una máquina puede desgastarse, un deportista puede mejorar o empeorar y el clima puede cambiar. Por eso siempre debemos preguntarnos si el mismo modelo sigue siendo razonable.

6.15. De mediciones repetidas a preguntas probabilísticas

La probabilidad no se limita a monedas, dados y urnas.

Imaginemos que medimos repetidamente el ancho de una pieza fabricada.

Las mediciones podrían no ser exactamente iguales debido a:

pequeñas variaciones de fabricación;
resolución del instrumento;
condiciones experimentales;
variabilidad asociada al procedimiento de medición.

En lugar de preguntar únicamente:

«¿Cuál fue la medida?»

podemos formular una pregunta diferente:

«¿Con qué probabilidad una futura medición estará dentro de cierto intervalo?»

Esta pregunta conecta directamente la metrología, la ingeniería y el control de calidad con la teoría de probabilidades.

6.16. Ejemplo 5 · Distribución observada de mediciones

INTERMEDIO · ●●○○

Supongamos que realizamos 100 mediciones simuladas del ancho de una pieza.

Podemos agruparlas en intervalos para visualizar dónde se concentran.

Figura 6.4
De una pieza física a una distribución de mediciones
1 · PIEZA REAL ancho de interés 2 · MEDICIÓN 10,02 calibrador digital 3 · DATOS 10,02 mm 9,98 mm 10,05 mm 10,01 mm 4 · DISTRIBUCIÓN OBSERVADA DE 100 MEDICIONES SIMULADAS 9,7–9,8 9,8–9,9 9,9–10,0 10,0–10,1 10,1–10,2 10,2–10,3 10,3–10,4 ancho medido (mm) frecuencia DATOS OBSERVADOS ≠ MODELO PROBABILÍSTICO El histograma describe cómo se distribuyeron estas mediciones. Elegir un modelo exige hipótesis, conocimiento del proceso y validación.

Nota. Elaboración propia. Datos simulados con fines didácticos. El instrumento y la pieza son representaciones esquemáticas. El histograma describe las mediciones simuladas; todavía no se está suponiendo una distribución teórica particular.

¿Dónde se aplica?

Este tipo de razonamiento aparece en metrología, manufactura, control de calidad, laboratorios experimentales y calibración de instrumentos.

La gráfica todavía describe datos. Convertirlos en probabilidades exige proponer y justificar posteriormente un modelo.

6.17. Realidad, datos, modelo e interpretación

Una distinción fundamental para todo el curso será separar cuatro niveles.

Figura 6.5
De un fenómeno real a una interpretación probabilística
REALIDAD

fenómeno que queremos estudiar

↓ observamos o medimos
DATOS

observaciones obtenidas

↓ construimos una representación
MODELO PROBABILÍSTICO

representación matemática de la incertidumbre

↓ calculamos y razonamos
INTERPRETACIÓN

conclusiones compatibles con los datos, el modelo y sus supuestos

METEOROLOGÍA

atmósfera → observaciones → modelo → pronóstico

INGENIERÍA

proceso → mediciones → modelo → riesgo de falla

SALUD

población → observaciones → modelo → evaluación de riesgo

DEPORTE

rendimiento → resultados → modelo → expectativa

Nota. Elaboración propia. Un modelo representa ciertos aspectos de la realidad; no es la realidad misma. Los cuatro contextos inferiores muestran la misma arquitectura general en diferentes campos.

6.18. Probabilidad alta no significa certeza

Supongamos:

P(A)=0,90.

Esto significa que el modelo asigna a A una probabilidad muy alta.

Sin embargo:

P(Ac)=0,10.

Una forma visual de interpretar 90 %
Imaginemos 100 situaciones comparables previstas por el mismo modelo
100 POSIBLES REALIZACIONES BAJO EL MODELO A 90 de cada 100 no A 10 de cada 100 UNA REALIZACIÓN INDIVIDUAL produce A o produce no A; nunca produce «90 % de A»

Nota. Representación didáctica. El mosaico no afirma que en cualquier conjunto real de exactamente 100 ensayos deban ocurrir 90 eventos A. Representa visualmente una probabilidad de 0,90.

Probable y seguro no son sinónimos.

Una formulación que debemos conservar

Una probabilidad describe la incertidumbre de un evento dentro de un modelo. No garantiza el resultado de una realización individual.

Por eso, incluso un evento muy probable puede no ocurrir en una realización concreta, y un evento poco probable puede ocurrir. El resultado individual debe interpretarse dentro de la estructura completa del modelo, no como una confirmación o refutación automática de este.

Aplicación

Un pronóstico de alta probabilidad de lluvia, una alta confiabilidad de un componente o una alta probabilidad de acierto deportivo siguen expresando incertidumbre. Ninguna probabilidad menor que 1 garantiza por sí sola el resultado individual.

6.19. Una frecuencia observada tampoco es una garantía

Supongamos que observamos cara en 62 % de 100 lanzamientos.

Esa cifra describe la muestra obtenida:

h=0,62.

No significa automáticamente:

P(cara)=0,62. ✗

Una frecuencia relativa puede utilizarse como evidencia, pero debemos distinguir siempre lo observado de la probabilidad asignada por un modelo.

Ejemplo de control de calidad

Si en una muestra de 100 piezas encontramos 4 defectuosas, la frecuencia observada de defecto es 0,04. Ese dato es evidencia sobre el proceso, pero por sí solo no demuestra que la probabilidad verdadera de defecto del proceso sea exactamente 0,04.

6.20. La falacia del jugador

Imagina una moneda equilibrada que produce:

C · C · C · C · C

Alguien afirma:

«Ahora tiene que salir sello porque ya salieron demasiadas caras».

Si el modelo establece lanzamientos independientes y la moneda continúa siendo equilibrada:

P(sello en el próximo lanzamiento)=0,50

Los resultados anteriores no obligan al siguiente lanzamiento a «compensar».

6.21. ¿Para qué sirve la probabilidad?

La probabilidad permite construir modelos para situaciones de incertidumbre en numerosos campos.

METEOROLOGÍA Y CLIMA

Pregunta: ¿qué probabilidad existe de precipitación?

Se combinan observaciones y modelos atmosféricos para cuantificar incertidumbre.

INGENIERÍA Y CONFIABILIDAD

Pregunta: ¿qué probabilidad existe de que un componente falle?

Se estudian fallas, vida útil, seguridad y mantenimiento.

CONTROL DE CALIDAD

Pregunta: ¿qué proporción de productos puede incumplir una especificación?

Los datos permiten vigilar y mejorar procesos industriales.

MEDICINA Y SALUD PÚBLICA

Pregunta: ¿qué probabilidad tiene determinado resultado o riesgo?

La probabilidad ayuda a interpretar evidencia y tomar decisiones bajo incertidumbre.

BIOLOGÍA Y GENÉTICA

Pregunta: ¿qué resultados son posibles en procesos de herencia o variación?

Los modelos probabilísticos permiten estudiar resultados individuales inciertos con regularidades conocidas.

DEPORTE

Pregunta: ¿qué probabilidad tiene un jugador o equipo de lograr determinado resultado?

Se analizan frecuencias históricas y modelos de rendimiento.

INFORMÁTICA

Pregunta: ¿qué probabilidad existe de error, fallo, colisión o determinada salida aleatoria?

La probabilidad interviene en algoritmos, comunicaciones, seguridad y simulación.

SEGUROS Y FINANZAS

Pregunta: ¿qué riesgos deben considerarse y cómo pueden cuantificarse?

Se modelan eventos inciertos y sus posibles consecuencias.

La idea común

Estas ciencias no utilizan «otra» probabilidad. Utilizan la misma estructura matemática, pero cambian los eventos, los datos disponibles, las hipótesis y las consecuencias de cada resultado.

6.22. Actividad experimental · Una moneda real

FUNDAMENTAL · ●○○○

Material: una moneda, papel y lápiz.

1. Antes de lanzarla, escribe cuántas caras esperas aproximadamente en 20 lanzamientos.

2. Realiza los 20 lanzamientos.

3. Registra C para cara y S para sello.

4. Cuenta el número de caras f.

5. Calcula h=f/20.

6. Expresa h como decimal y porcentaje.

7. Compara tu frecuencia con 0,50.

8. Junta tus resultados con los de otros compañeros.

9. Calcula ahora la frecuencia relativa utilizando todos los lanzamientos de la clase.

10. Explica por qué las dos frecuencias no tienen obligación de ser exactamente iguales.

6.23. Después del trabajo manual: simulación en Excel

Una vez comprendido el experimento real, podemos utilizar una hoja de cálculo para realizar muchas repeticiones rápidamente.

En Excel podemos escribir:

=SI(ALEATORIO()<0,5;»CARA»;»SELLO»)

Cada recálculo produce una simulación bajo un modelo que asigna:

P(cara)=0,50    y    P(sello)=0,50.

La computadora no sustituye el razonamiento. Antes de simular debemos comprender qué estamos simulando y cuáles son las hipótesis del modelo.

PARA PROFUNDIZAR · DEMOSTRACIÓN 1 · ●●●●

6.24. ¿Por qué una frecuencia relativa siempre está entre 0 y 1?

Sea:

n = número total de ensayos

y:

f = número de veces que ocurre el evento.

Un evento no puede ocurrir un número negativo de veces:

f≥0.

Tampoco puede ocurrir más veces que el número total de ensayos:

f≤n.

Por tanto:

0≤f≤n.

Si n>0, dividimos los tres miembros entre n:

0/n≤f/n≤n/n.

Simplificamos:

0≤f/n≤1.

Como:

h=f/n,

0≤h≤1.

Esta demostración explica por qué una frecuencia relativa siempre pertenece al intervalo [0,1]. No pretende todavía construir formalmente toda la teoría axiomática de la probabilidad.

6.25. Errores frecuentes y práctica de dificultad creciente

Error 1

«Si hay dos resultados posibles, cada uno tiene 50 %».

Solo ocurre si el modelo justifica equiprobabilidad.

Error 2

«Una probabilidad de 80 % significa que ocurrirá».

Todavía queda 20 % para el resultado complementario.

Error 3

«Después de muchas caras, ahora debe venir sello».

No, si el modelo establece lanzamientos independientes.

Error 4

«La frecuencia observada es la probabilidad exacta».

Una muestra puede fluctuar.

Error 5

«Probabilidad significa adivinar».

La probabilidad utiliza modelos, información y razonamiento matemático.

Error 6

«50 % significa exactamente cinco éxitos en diez ensayos».

Las frecuencias observadas pueden fluctuar.

Error 7

«Si ocurrió algo poco probable, el modelo necesariamente es falso».

Un resultado poco probable puede ocurrir sin contradecir automáticamente el modelo.

FUNDAMENTAL · ●○○○

Una bolsa contiene 8 bolas:

6 verdes y 2 amarillas.

Todas las bolas individuales tienen la misma posibilidad de ser extraídas.

a) Calcula P(verde).

b) Calcula P(amarilla).

Ver solución

P(verde)=6/8=3/4=0,75=75 %.

P(amarilla)=2/8=1/4=0,25=25 %.

INTERMEDIO · ●●○○

Una persona afirma:

«Mañana solamente puede llover o no llover, así que la probabilidad de lluvia es 50 %».

Explica con tus propias palabras por qué el razonamiento es incorrecto.

Ver orientación

Debes distinguir entre tener dos posibilidades y tener dos posibilidades equiprobables. El modelo meteorológico necesita información adicional para asignar las probabilidades.

AVANZADO · ●●●○

Dos modelos diferentes describen un fenómeno con los mismos dos resultados:

A y no A.

El modelo 1 asigna:

P(A)=0,50.

El modelo 2 asigna:

P(A)=0,80.

¿Puede ser correcto que ambos modelos tengan exactamente los mismos resultados posibles, pero probabilidades diferentes? Explica.

Ver orientación

Sí. Conocer cuáles resultados son posibles no determina por sí solo las probabilidades. Los modelos pueden utilizar información o hipótesis diferentes. Luego habría que evaluar cuál representa mejor el fenómeno de interés.

PARA PROFUNDIZAR · ●●●●

Un modelo asigna:

P(A)=0,99.

En una realización A no ocurre.

Responde:

a) ¿Es el resultado incompatible con el modelo?

b) ¿Podemos concluir a partir de una sola observación que el modelo es incorrecto?

c) ¿Qué tipo de evidencia adicional sería necesaria para evaluar seriamente el comportamiento del modelo?

Ver orientación

a) No. El resultado contrario tenía probabilidad 0,01 y, por tanto, no era imposible dentro del modelo.

b) No. Una sola realización no permite evaluar adecuadamente una afirmación probabilística de ese tipo.

c) Debemos observar el comportamiento del modelo en muchas situaciones comparables y analizar si las probabilidades asignadas son compatibles sistemáticamente con los resultados obtenidos.

6.26. Comprueba lo aprendido, mapa conceptual y síntesis

1. Explica con tus propias palabras qué estudia la probabilidad.

2. ¿Cuál es el menor valor posible de una probabilidad?

3. ¿Cuál es el mayor?

4. Convierte 0,35 en porcentaje.

5. Convierte 72 % en número decimal.

6. ¿Por qué tener dos resultados posibles no garantiza que cada uno tenga probabilidad 0,50?

7. ¿Qué significa equiprobabilidad?

8. ¿Qué es la falacia del 50/50?

9. ¿Qué diferencia existe entre probabilidad y frecuencia relativa?

10. Si un evento tiene probabilidad 0,90, ¿es seguro que ocurrirá?

11. ¿Qué error comete quien afirma que después de cinco caras obligatoriamente debe aparecer sello?

12. ¿Qué significa que una probabilidad pertenezca a un modelo?

13. Explica la frase: «Una probabilidad describe la incertidumbre de un evento dentro de un modelo».

14. ¿Por qué P(A)=0,80 no garantiza que A ocurra en la próxima realización?

15. Si un evento de probabilidad 0,05 ocurre, ¿significa automáticamente que el modelo era incorrecto?

16. ¿Por qué una frecuencia relativa obtenida en una muestra puede diferir de la probabilidad del modelo?

17. ¿Qué diferencia existe entre realidad, datos y modelo?

18. ¿Por qué debemos indicar cuándo unos datos son simulados?

19. Nombra cuatro ciencias o actividades donde se utilice la probabilidad.

20. En control de calidad, ¿qué podrían representar f y n en h=f/n?

21. ¿Qué diferencia existe entre un gráfico de datos experimentales y un modelo probabilístico?

22. Explica por qué una aplicación real no demuestra automáticamente que determinado modelo matemático sea correcto.

Ver respuestas breves

1. Cuantifica y analiza matemáticamente situaciones de incertidumbre.

2. 0.

3. 1.

4. 35 %.

5. 0,72.

6. Porque posibilidad y equiprobabilidad son conceptos distintos.

7. Que dos o más resultados reciben la misma probabilidad dentro del modelo.

8. Creer que dos alternativas deben tener automáticamente 50 % cada una.

9. P(A) pertenece al modelo; h se calcula a partir de observaciones.

10. No. Todavía queda probabilidad 0,10 para que no ocurra.

11. La falacia del jugador.

12. Que el valor depende de los resultados considerados, la información, las reglas y los supuestos del modelo.

13. Que P(A) cuantifica nuestra incertidumbre matemática acerca de A según el modelo utilizado.

14. Porque todavía existe probabilidad 0,20 para que A no ocurra.

15. No. Un evento poco probable puede ocurrir sin contradecir automáticamente el modelo.

16. Porque una muestra finita está sujeta a fluctuaciones aleatorias.

17. Realidad es el fenómeno, datos son observaciones y modelo es una representación matemática.

18. Para no confundir una construcción didáctica con evidencia empírica real.

19. Por ejemplo: meteorología, ingeniería, medicina, biología, deporte, informática o seguros.

20. f podría ser el número de defectuosas y n el total inspeccionado.

21. El primero describe observaciones; el segundo representa matemáticamente incertidumbre bajo supuestos.

22. Porque el fenómeno debe analizarse y los supuestos del modelo deben justificarse con información y evidencia.

Mapa conceptual de la Parte 1
INCERTIDUMBRE
FENÓMENO ALEATORIO
EVENTO A
MODELO PROBABILÍSTICO
0 ≤ P(A) ≤ 1
DATOS Y FRECUENCIAS RELATIVAS
RAZONAMOS SOBRE LA INCERTIDUMBRE Y SUS APLICACIONES
Tabla 6.3
Ideas fundamentales que conviene distinguir
POSIBILIDAD

Un resultado pertenece al conjunto de resultados considerados por el modelo.

EQUIPROBABILIDAD

Dos o más resultados reciben la misma probabilidad.

PROBABILIDAD

Medida asignada por el modelo a un evento.

FRECUENCIA RELATIVA

Proporción observada en una serie concreta de ensayos.

Síntesis

La probabilidad permite razonar matemáticamente acerca de situaciones de incertidumbre.

Un fenómeno aleatorio puede tener resultados posibles bien definidos aunque no sepamos cuál ocurrirá antes de observarlo.

La probabilidad de un evento A se representa mediante:

P(A).

Toda probabilidad cumple:

0≤P(A)≤1.

Puede expresarse como fracción, decimal o porcentaje.

Que existan dos resultados posibles no significa que sean equiprobables.

La probabilidad pertenece a un modelo; la frecuencia relativa:

h=f/n

se obtiene de observaciones.

Una probabilidad describe la incertidumbre de un evento dentro de un modelo. No garantiza el resultado de una realización individual.

Una realización produce un resultado concreto; la probabilidad cuantifica la incertidumbre que existía antes de conocerlo. Por eso un evento muy probable puede no ocurrir y uno poco probable puede ocurrir sin que, por ese solo hecho, exista una contradicción con el modelo.

Una probabilidad alta no es una certeza.

Una frecuencia observada tampoco es automáticamente la probabilidad exacta del fenómeno.

Hemos visto además que la probabilidad no es una matemática aislada de la realidad. La misma estructura:

evento → modelo → probabilidad

puede aparecer en:

meteorología · ingeniería · control de calidad · medicina · biología · deporte · informática · seguros.

La clave es comprender qué representa el evento en cada contexto, de dónde provienen los datos, qué supuestos utiliza el modelo y qué significa realmente la probabilidad calculada.

En otras palabras: la matemática proporciona una estructura general; la ciencia determina qué significa esa estructura en el mundo real.

La probabilidad no elimina la incertidumbre.

La convierte en algo que podemos representar, medir, contrastar con datos y utilizar para comprender fenómenos y tomar decisiones.

SIGUIENTE
Parte 2 de 18 · Experimentos aleatorios, resultados y espacio muestral
Antes de calcular probabilidades, aprenderemos a describir con precisión qué experimento realizamos y cuáles son todos los resultados que nuestro modelo considera posibles.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Kolmogorov, A. N. (1933). Grundbegriffe der Wahrscheinlichkeitsrechnung. Springer.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 2 DE 18
CAPÍTULO 6

Experimentos aleatorios, resultados y espacio muestral

Antes de calcular una probabilidad debemos saber exactamente qué puede ocurrir

Idea central

Antes de preguntar «¿cuál es la probabilidad?», debemos responder una pregunta más básica: «¿qué consideraremos exactamente como un resultado?». Definir correctamente el experimento, la regla de registro y el espacio muestral evita ambigüedades y permite construir modelos coherentes.

Al finalizar esta parte podrás:
diferenciar experimento, ensayo y resultado;
interpretar un resultado elemental ω;
construir espacios muestrales Ω;
comprender que Ω depende de qué decidimos registrar;
interpretar la cardinalidad |Ω|;
representar experimentos mediante árboles y pares ordenados;
reconocer espacios finitos, numerables y continuos;
conectar espacios muestrales con ingeniería, metrología, sensores y otras ciencias.

6.27. Antes de calcular probabilidades debemos definir el experimento

Imagina que alguien pregunta:

«¿Cuál es la probabilidad de obtener un buen resultado?»

La pregunta todavía está incompleta.

Necesitamos saber:

¿qué procedimiento se realizará?
¿qué observaremos?
¿qué resultados distinguiremos?
¿qué significa exactamente «buen resultado»?
Idea clave

La probabilidad necesita un experimento bien definido. Si no sabemos exactamente qué observamos y cómo lo registramos, tampoco sabemos sobre qué estamos calculando probabilidades.

6.28. Experimento aleatorio

Un experimento aleatorio es un procedimiento que puede realizarse bajo condiciones especificadas, cuyos resultados posibles pueden describirse, aunque antes de una realización concreta no sepamos con certeza cuál ocurrirá.

Ejemplos:

lanzar una moneda;
seleccionar una pieza de una producción;
medir el tiempo de funcionamiento de un dispositivo;
registrar cuántas llamadas llegan durante una hora;

6.29. Ensayo o realización

El experimento es el procedimiento general. Cada vez que lo ejecutamos realizamos un ensayo.

Experimento: lanzar una moneda.
Ensayo: realizar un lanzamiento concreto.

En ingeniería:

Experimento: someter un fusible a una prueba de funcionamiento.
Ensayo: probar una unidad específica.

6.30. Resultado

Un ensayo concreto produce un resultado particular.

Por ejemplo:

cara

puede ser el resultado de un lanzamiento de moneda.

En una prueba de calidad:

pieza rechazada

puede ser el resultado registrado.

6.31. Resultado elemental: ω

Para representar matemáticamente un resultado individual utilizaremos, cuando sea útil, la letra griega:

ω

Un resultado elemental es uno de los resultados individuales que el modelo decide distinguir.

Importante

«Elemental» no significa necesariamente «simple» en la vida real. Significa que, dentro del modelo que hemos definido, ese resultado se trata como una unidad que no necesitamos descomponer más.

6.32. Espacio muestral: Ω

Reunimos todos los resultados elementales considerados posibles en un conjunto llamado:

espacio muestral Ω

De manera informal:

El espacio muestral Ω es el conjunto de todos los resultados elementales que nuestro modelo considera posibles para el experimento definido.

Tabla 6.4
Vocabulario fundamental
EXPERIMENTO

Procedimiento general.

ENSAYO

Una realización concreta del experimento.

RESULTADO

Lo observado en un ensayo.

ω

Resultado elemental individual.

Ω

Conjunto de todos los resultados elementales posibles.

Figura 6.6
Del procedimiento real al espacio muestral
A · ESTRUCTURA MATEMÁTICA EXPERIMENTO procedimiento ENSAYO una realización RESULTADO ω Ω todos Cada ensayo produce un ω; el conjunto de todos los ω posibles forma Ω. B · APLICACIÓN: PRUEBA DE UN COMPONENTE ELECTRÓNICO probar un componente ENSAYO unidad n.º 27 resultado observado: ω = falla Ω={funciona, falla} EL SÍMBOLO ω TAMBIÉN PUEDE REPRESENTAR UN RESULTADO DE INGENIERÍA

Nota. Elaboración propia. El ejemplo electrónico es esquemático y tiene fines didácticos.

6.33. El espacio muestral depende de lo que decidimos registrar

Esta es una de las ideas más importantes de toda esta parte.

El espacio muestral no es simplemente una lista de «cosas que existen en la realidad».

Es el conjunto de resultados elementales que nuestro modelo decide distinguir de acuerdo con el experimento y con la información que hemos decidido registrar.

Una misma pieza industrial puede estudiarse de varias maneras.

Tabla 6.5
Una misma realidad física puede producir espacios muestrales diferentes
PREGUNTA 1

¿Cumple la tolerancia?

Ω={aprobada, rechazada}

PREGUNTA 2

¿Qué tipo de defecto presenta?

Ω={sin defecto, bajo, alto, superficie}

PREGUNTA 3

¿Cuál es su diámetro?

Ω=valores posibles del diámetro

Figura 6.7
La misma pieza física puede originar diferentes espacios muestrales
MISMA PIEZA REGLA DE REGISTRO 1 registrar únicamente si cumple tolerancia Ω₁ {aprobada, rechazada} REGLA DE REGISTRO 2 registrar el tipo de defecto Ω₂ {sin defecto, diámetro bajo, diámetro alto, superficie} REGLA DE REGISTRO 3 registrar el diámetro medido Ω₃ valores de diámetro MISMA REALIDAD ≠ MISMO ESPACIO MUESTRAL

Nota. Elaboración propia. La figura muestra una aplicación conceptual de control dimensional.

6.34. Dos condiciones importantes: exhaustividad y ausencia de ambigüedad

Un espacio muestral debe construirse cuidadosamente.

EXHAUSTIVIDAD

Debe incluir todos los resultados elementales que el modelo considera posibles.

No debemos olvidar un resultado posible.

AUSENCIA DE AMBIGÜEDAD

Cada observación debe poder registrarse de acuerdo con una regla clara.

Dos categorías no deberían confundirse porque fueron definidas de forma vaga.

6.35. Cardinalidad: ¿cuántos resultados contiene Ω?

Cuando un espacio muestral tiene un número finito de resultados, podemos contar cuántos elementos contiene.

Utilizaremos la notación:

|Ω|

Se lee: cardinalidad de Ω.

Por ejemplo, para un dado de seis caras:

Ω={1,2,3,4,5,6}

|Ω|=6.

6.36. Ejemplo 1 · Una moneda

FUNDAMENTAL · ●○○○

Si registramos únicamente qué lado queda hacia arriba:

Ω={C,S}

donde:

C = cara     S = sello

|Ω|=2.

6.37. Ejemplo 2 · Dos lanzamientos de moneda

Ahora realizamos dos lanzamientos y registramos el resultado de cada uno.

Debemos conservar el orden.

Tabla 6.6
Resultados elementales de dos lanzamientos
CC
CS
SC
SS

Ω={CC,CS,SC,SS}

|Ω|=4.

¿Por qué CS y SC son diferentes?

Porque hemos decidido registrar cuál fue el primer lanzamiento y cuál fue el segundo. CS significa «primero cara y luego sello»; SC significa «primero sello y luego cara».

6.38. Los árboles ayudan a no olvidar resultados

Un árbol permite representar las decisiones o resultados posibles etapa por etapa.

Para dos lanzamientos:

primer lanzamiento → segundo lanzamiento.

6.39. La misma estructura aparece en sistemas reales

Las monedas son útiles porque permiten estudiar estructuras simples. Pero esa misma estructura puede aparecer en ingeniería.

Figura 6.8
Dos monedas y dos sensores: fenómenos distintos, misma estructura matemática
A · DOS MONEDAS inicio C S CC CS SC SS Ω {CC, CS, SC, SS} cada posición indica un lanzamiento B · DOS SENSORES inicio F X FF FX XF XX Ω {FF, FX, XF, XX} F=funciona · X=falla FENÓMENOS DISTINTOS PUEDEN COMPARTIR LA MISMA ESTRUCTURA COMBINATORIA

Nota. Elaboración propia. El ejemplo de sensores es esquemático. No se están asignando todavía probabilidades a los cuatro resultados.

6.40. Ejemplo 3 · Dos dados y pares ordenados

Lanzamos dos dados y registramos:

(resultado del primer dado, resultado del segundo dado).

Un posible resultado elemental es:

ω=(2,5).

Significa:

primer dado = 2,    segundo dado = 5.

El orden conserva información

(2,5) y (5,2) son resultados diferentes, porque el primer número corresponde al primer dado y el segundo al segundo dado.

Figura 6.9
Los 36 pares ordenados posibles al lanzar dos dados
SEGUNDO DADO PRIMER DADO 1 2 3 4 5 6 1 2 3 4 5 6 (1,1) (1,2) (1,3) (1,4) (1,5) (1,6) (2,1) (2,2) (2,3) (2,4) (2,5) (2,6) (3,1) (3,2) (3,3) (3,4) (3,5) (3,6) (4,1) (4,2) (4,3) (4,4) (4,5) (4,6) (5,1) (5,2) (5,3) (5,4) (5,5) (5,6) (6,1) (6,2) (6,3) (6,4) (6,5) (6,6) (2,5) ≠ (5,2) PORQUE LA POSICIÓN CONSERVA INFORMACIÓN

Nota. Elaboración propia.

6.41. Producto cartesiano: combinar posibilidades

Si el primer dado puede producir:

Ω₁={1,2,3,4,5,6}

y el segundo:

Ω₂={1,2,3,4,5,6},

el espacio de pares ordenados puede escribirse:

Ω = Ω₁ × Ω₂

El símbolo × indica aquí un producto cartesiano: todas las combinaciones ordenadas posibles entre un elemento de Ω₁ y uno de Ω₂.

Figura 6.10
Producto cartesiano: cada resultado del primer sistema se combina con cada resultado del segundo
Ω₁ a b c Ω₂ 1 2 Ω₁ × Ω₂ (a,1) (a,2) (b,1) (b,2) (c,1) (c,2) 3 POSIBILIDADES × 2 POSIBILIDADES = 6 PARES |Ω₁ × Ω₂| = 3 × 2 = 6

Nota. Elaboración propia.

6.42. Dos dados: ¿por qué hay 36 resultados?

Cada uno de los 6 resultados del primer dado puede combinarse con cada uno de los 6 resultados del segundo.

6×6=36.

Por tanto:

|Ω|=36.

PARA PROFUNDIZAR · DEMOSTRACIÓN 2 · ●●●●

6.43. ¿Por qué se multiplican las cardinalidades en un producto cartesiano finito?

Supongamos que:

|Ω₁|=m

y:

|Ω₂|=n.

Tomemos el primer elemento de Ω₁. Puede formar un par con cada uno de los n elementos de Ω₂. Por tanto, produce n pares.

El segundo elemento de Ω₁ también produce n pares. Lo mismo ocurre con cada uno de los m elementos de Ω₁.

Tenemos entonces m grupos, cada uno con n pares:

n+n+…+n

donde n aparece m veces.

|Ω₁×Ω₂|=m·n.

Esta propiedad explica por qué dos dados con seis resultados posibles cada uno generan 6×6=36 pares ordenados.

6.44. Si registramos la suma, el espacio muestral cambia

Hasta ahora registramos el par:

(primer dado, segundo dado).

Pero podríamos decidir registrar solamente:

la suma de los dos dados.

Entonces los valores posibles son:

Ω={2,3,4,5,6,7,8,9,10,11,12}.

Ahora:

|Ω|=11.

La realidad física —dos dados— es la misma. Lo que cambió fue qué decidimos registrar.

Figura 6.11
De 36 pares ordenados a 11 sumas posibles
A · PARES QUE PRODUCEN LA MISMA SUMA 2 3 4 5 6 7 3 4 5 6 7 8 4 5 6 7 8 9 5 6 7 8 9 10 6 7 8 9 10 11 7 8 9 10 11 12 B · ¿CUÁNTOS PARES PRODUCEN CADA SUMA? 2 3 4 5 6 7 8 9 10 11 12 1 2 3 4 5 6 5 4 3 2 1 suma

Nota. Elaboración propia. Cada celda superior corresponde a un par ordenado de los dos dados.

6.45. Las once sumas posibles no son equiprobables

La suma 2 solamente puede obtenerse mediante:

(1,1).

En cambio, la suma 7 puede obtenerse mediante:

(1,6), (2,5), (3,4), (4,3), (5,2), (6,1).

Por tanto, aunque haya 11 valores posibles de la suma, no debemos asignar automáticamente:

1/11 a cada suma. ✗

Tabla 6.7
Número de pares ordenados que producen cada suma
2
1
3
2
4
3
5
4
6
5
7
6
8
5
9
4
10
3
11
2
12
1
Otra aparición de la falacia de equiprobabilidad

Que varios valores sean posibles no implica que tengan la misma probabilidad. Debemos examinar la estructura que produce esos valores.

6.46. Espacios muestrales finitos

Un espacio muestral es finito cuando contiene un número finito de resultados elementales.

Ejemplos:

Ω={C,S}

Ω={1,2,3,4,5,6}.

También puede ser finito un experimento de ingeniería:

Ω={funciona, falla}.

6.47. Espacios infinitos numerables

En algunos experimentos podemos tener:

0,1,2,3,4,…

sin un último valor.

Por ejemplo:

número de llamadas que llegan a una central durante cierto período.

El espacio puede escribirse:

Ω={0,1,2,3,…}.

Es infinito, pero sus resultados pueden enumerarse uno tras otro.

6.48. Espacios continuos idealizados

En otras situaciones utilizamos un modelo en el que el resultado puede variar continuamente dentro de un intervalo.

Por ejemplo, si X representa un tiempo idealizado de duración entre 0 y 10 segundos:

Ω={x : 0≤x≤10 s}.

Entre 4 s y 5 s existen, matemáticamente, muchos valores posibles:

4,1 s; 4,01 s; 4,001 s; 4,0001 s; …

Tabla 6.8
Tres tipos de espacios muestrales y aplicaciones
FINITO

Ejemplo:

{aprobada, rechazada}

Aplicación: control de calidad.

INFINITO NUMERABLE

Ejemplo:

{0,1,2,3,…}

Aplicación: conteo de llamadas, fallas o partículas detectadas.

CONTINUO IDEALIZADO

Ejemplo:

0≤t≤10 s

Aplicación: tiempo, longitud, masa, voltaje o temperatura.

Figura 6.12
Espacios muestrales en diferentes ramas de la ciencia
FINITO pieza industrial inspección aprobada rechazada |Ω|=2 INFINITO NUMERABLE llamadas recibidas 0 1 2 3 Ω={0,1,2,3,…} CONTINUO tiempo de duración 0 s 10 s todos los valores del intervalo LA NATURALEZA DEL RESULTADO DETERMINA CÓMO CONSTRUIMOS Ω

Nota. Elaboración propia.

6.49. Fenómeno continuo y registro del instrumento no son lo mismo

Esta distinción es especialmente importante en medición.

Podemos utilizar un modelo continuo para una magnitud física, pero el instrumento registra valores con una resolución limitada.

Por ejemplo, un cronómetro digital con resolución:

0,01 s

puede mostrar:

4,26 s; 4,27 s; 4,28 s; …

pero no mostrará directamente:

4,276381… s.

Figura 6.13
Modelo continuo y registro discretizado por la resolución del instrumento
A · MODELO DE LA MAGNITUD FÍSICA 0 s 10 s idealmente pueden considerarse todos los valores intermedios B · INSTRUMENTO 4,28 s resolución = 0,01 s C · VALORES REGISTRADOS 4,25 4,26 4,27 4,28 4,29 4,30 EL MODELO DE LA MAGNITUD Y LOS VALORES QUE EL INSTRUMENTO PUEDE MOSTRAR NO SON LO MISMO

Nota. Elaboración propia. El ejemplo es conceptual. La representación continua pertenece al modelo de la magnitud; el registro depende de la resolución del instrumento.

Puente con metrología

Esta distinción evita una confusión frecuente: que una variable se modele como continua no significa que un instrumento real pueda registrar infinitos decimales.

El instrumento transforma el fenómeno en datos con una determinada resolución.

6.50. ¿Dónde se utiliza el concepto de espacio muestral?

INGENIERÍA

Ω puede representar estados de funcionamiento, tipos de falla o resultados de ensayos.

TELECOMUNICACIONES

Ω puede representar símbolos recibidos, errores o estados de transmisión.

METROLOGÍA

Ω puede representar valores posibles de una medición según el modelo utilizado.

MEDICINA

Ω puede representar resultados de pruebas o estados clínicos definidos para un estudio.

FÍSICA

Ω puede representar tiempos, posiciones, conteos o resultados de detección.

INFORMÁTICA

Ω puede representar salidas posibles de un algoritmo, estados o eventos del sistema.

La pregunta científica detrás de Ω

¿Qué información necesitamos conservar para responder la pregunta que estamos investigando? La respuesta a esa pregunta ayuda a decidir qué consideraremos un resultado elemental.

6.51. Actividad de modelación y exploración con hoja de cálculo

INTERMEDIO · ●●○○

Una máquina produce piezas cuyo diámetro se mide al finalizar el proceso.

Diseña tres experimentos diferentes:

A. registrar únicamente «aceptada» o «rechazada».

B. registrar cuál tipo de defecto aparece.

C. registrar el diámetro medido.

Para cada caso:

1. Describe el experimento.

2. Define un ensayo.

3. Da un ejemplo de ω.

4. Propón Ω.

5. Decide si Ω es finito, numerable o se modelaría como continuo.

6. Explica por qué los tres espacios muestrales son distintos aunque se estudie la misma producción.

También podemos usar una hoja de cálculo para generar pares de dados.

En Excel:

=ALEATORIO.ENTRE(1;6)

primer dado

=ALEATORIO.ENTRE(1;6)

segundo dado

Después podemos calcular la suma de ambas celdas y observar qué valores aparecen con mayor frecuencia.

La simulación debe realizarse después de haber construido manualmente Ω. El software acelera la experimentación; no sustituye la definición del modelo.

6.52. Comprueba lo aprendido, mapa conceptual y síntesis

1. ¿Qué es un experimento aleatorio?

2. ¿Qué diferencia existe entre experimento y ensayo?

3. ¿Qué representa ω?

4. ¿Qué representa Ω?

5. ¿Por qué el espacio muestral depende de la regla de registro?

6. ¿Qué significa que Ω sea exhaustivo?

7. ¿Qué significa |Ω|?

8. Construye Ω para un lanzamiento de un dado.

9. Construye Ω para dos lanzamientos de moneda.

10. ¿Por qué CS y SC son resultados diferentes?

11. ¿Cuántos pares ordenados produce el lanzamiento de dos dados?

12. Explica qué significa Ω₁×Ω₂.

13. Si dos dados producen 36 pares, ¿por qué solamente existen 11 sumas posibles?

14. ¿Por qué las 11 sumas no son equiprobables?

15. Da un ejemplo de espacio muestral finito.

16. Da un ejemplo de espacio infinito numerable.

17. Da un ejemplo de espacio continuo idealizado.

18. ¿Puede una magnitud modelarse como continua aunque el instrumento registre dos decimales?

19. Explica la diferencia entre fenómeno físico, resultado registrado y espacio muestral.

20. Una pieza puede clasificarse como aprobada/rechazada o medirse en milímetros. ¿Por qué esos experimentos generan Ω diferentes?

21. ¿Qué información conserva un par ordenado?

22. Explica con tus palabras la frase: «El espacio muestral no está dentro del objeto; pertenece al experimento y al modelo que hemos definido».

Ver respuestas breves

1. Procedimiento con resultados posibles definidos cuyo resultado concreto no conocemos de antemano.

2. El experimento es el procedimiento general; el ensayo es una realización concreta.

3. Un resultado elemental.

4. El conjunto de todos los resultados elementales considerados posibles.

5. Porque cambiar lo que registramos cambia qué resultados decidimos distinguir.

6. Que incluye todos los resultados considerados posibles.

7. Número de elementos de Ω cuando tiene sentido contarlos.

8. {1,2,3,4,5,6}.

9. {CC,CS,SC,SS}.

10. Porque se conserva el orden de los lanzamientos.

11. 36.

12. Todos los pares ordenados formados tomando un elemento de Ω₁ y uno de Ω₂.

13. Diferentes pares pueden producir la misma suma.

14. Porque no todas las sumas pueden obtenerse mediante el mismo número de pares.

15. Por ejemplo {funciona,falla}.

16. Número de llamadas: {0,1,2,3,…}.

17. Tiempo idealizado dentro de un intervalo.

18. Sí. El modelo de la magnitud y la resolución del instrumento son cuestiones diferentes.

19. El fenómeno ocurre en la realidad; el instrumento u observador registra información; Ω describe matemáticamente los resultados que el modelo decide distinguir.

20. Porque una regla registra categorías y la otra registra una magnitud.

21. Conserva qué resultado corresponde a cada posición o etapa.

22. Ω depende de cómo definimos el experimento y qué información decidimos conservar, no simplemente de todas las propiedades físicas del objeto.

Mapa conceptual de la Parte 2
PREGUNTA SOBRE LA REALIDAD
DEFINIMOS EL EXPERIMENTO
DECIDIMOS QUÉ REGISTRAR
CADA ENSAYO PRODUCE UN RESULTADO ω
REUNIMOS TODOS LOS ω POSIBLES EN Ω
YA PODEMOS COMENZAR A DEFINIR EVENTOS Y PROBABILIDADES

Síntesis

Antes de calcular probabilidades debemos definir con precisión el experimento.

Cada realización concreta del experimento es un ensayo.

Un resultado elemental puede representarse mediante:

ω.

El conjunto de todos los resultados elementales considerados posibles forma:

Ω.

El espacio muestral no es simplemente una colección de todas las propiedades que existen en un objeto o fenómeno.

Es el conjunto de resultados que hemos decidido distinguir según la pregunta científica, el procedimiento experimental y la regla de registro.

Por eso una misma realidad física puede originar diferentes espacios muestrales.

Un espacio muestral puede ser:

finito · infinito numerable · continuo idealizado.

Cuando combinamos dos conjuntos finitos de posibilidades, el producto cartesiano permite construir todos los pares ordenados:

Ω=Ω₁×Ω₂.

Si:

|Ω₁|=m    y    |Ω₂|=n,

entonces:

|Ω₁×Ω₂|=m·n.

Los pares ordenados conservan información sobre qué resultado corresponde a cada etapa.

Cuando transformamos esa información —por ejemplo, registrando solamente la suma de dos dados— diferentes resultados elementales pueden producir el mismo valor registrado.

En medición debemos además distinguir entre una magnitud modelada como continua y los valores que un instrumento real puede registrar debido a su resolución.

En síntesis: definir correctamente Ω es decidir qué información del fenómeno conservará nuestro modelo.

Antes de preguntar «¿qué probabilidad tiene?»

debemos poder responder con precisión: «¿cuáles son los resultados que nuestro experimento considera posibles?»

SIGUIENTE
Parte 3 de 18 · Eventos o sucesos
Una vez construido Ω, aprenderemos a formar conjuntos de resultados que representan preguntas de interés: los eventos.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 3 DE 18
CAPÍTULO 6

Eventos o sucesos

De todos los resultados posibles a las preguntas que realmente queremos responder

Idea central

El espacio muestral Ω nos dice qué resultados pueden ocurrir. Sin embargo, muchas preguntas no se refieren a un único resultado. Podemos preguntar si salió un número par, si una medición quedó fuera de tolerancia, si una temperatura superó cierto límite o si ocurrió al menos una de varias condiciones. Cada pregunta selecciona dentro de Ω los resultados que la hacen verdadera. Ese conjunto de resultados constituye un evento.

Al finalizar esta parte podrás:
diferenciar un resultado elemental de un evento;
expresar un evento como subconjunto de Ω;
interpretar correctamente ∈ y ⊆;
reconocer eventos simples, compuestos, seguros e imposibles;
construir complementos, uniones, intersecciones y diferencias;
identificar eventos incompatibles y exhaustivos;
reconocer y construir particiones;
aplicar las leyes de De Morgan;
relacionar operaciones entre eventos con situaciones científicas y tecnológicas;
determinar cuántos eventos pueden construirse en un espacio muestral finito.

6.53. Del resultado al evento

Consideremos nuevamente un dado de seis caras.

Ω={1,2,3,4,5,6}

Supongamos que realizamos un lanzamiento y obtenemos:

4.

El número 4 es el resultado observado.

Pero quizá nuestra pregunta no era simplemente:

«¿Qué número salió?»

Tal vez queríamos responder:

«¿Se obtuvo un número par?»

Los resultados del dado que hacen verdadera esta afirmación son:

2, 4 y 6.

Por tanto, la pregunta selecciona dentro de Ω el conjunto:

{2,4,6}.

Primera intuición

Un evento puede imaginarse como una pregunta que actúa como filtro: de todos los resultados posibles conserva únicamente aquellos que responden «sí».

Figura 6.14
Un evento selecciona dentro de Ω los resultados que responden «sí» a una pregunta
A · MODELO MATEMÁTICO

Ω={1,2,3,4,5,6}

Pregunta: ¿el resultado es par?

1
no
2
3
no
4
5
no
6
A={2,4,6}
B · APLICACIÓN EN CONTROL DIMENSIONAL

Ω={bajo, dentro, alto}

Pregunta: ¿está fuera de tolerancia?

bajo
dentro
no
alto
A={bajo, alto}
Puente de significado. En ambos casos Ω contiene todos los resultados que el modelo distingue. El evento A conserva solamente aquellos que satisfacen la pregunta planteada. El fenómeno cambia; la estructura matemática es la misma.

Nota. Elaboración propia. La aplicación de control dimensional es esquemática y tiene fines didácticos.

6.54. Definición de evento

Un evento o suceso es un conjunto de resultados elementales del espacio muestral. En lenguaje matemático, un evento es un subconjunto de Ω.

Si:

Ω={1,2,3,4,5,6}

y definimos:

A = «obtener un número par»,

entonces:

A={2,4,6}.

Todos los elementos de A pertenecen a Ω. Por ello escribimos:

A ⊆ Ω
«A es subconjunto de Ω»

6.55. ¿Cuándo ocurre un evento?

Sea:

A={2,4,6}.

Lanzamos el dado y observamos:

ω=4.

Como 4 pertenece al conjunto A:

4 ∈ A,

decimos que el evento A ocurrió.

Si en cambio observamos:

ω=5,

entonces:

5 ∉ A,

y A no ocurrió.

Regla conceptual

Un evento A ocurre en una realización concreta exactamente cuando el resultado elemental observado ω pertenece a A.

Figura 6.15
Pertenecer a un evento y ser subconjunto de Ω son relaciones diferentes
Ω EVENTO A 4 otros resultados de A 4 ∈ A A ⊆ Ω
4 ∈ A

Relaciona un elemento con un conjunto.

A ⊆ Ω

Relaciona un conjunto con otro conjunto.

Nota. Elaboración propia. Un resultado pertenece a un evento; un evento es subconjunto del espacio muestral.

No confundas las dos expresiones

Es correcto escribir:

4 ∈ A     y     A ⊆ Ω.

Un resultado elemental es un elemento; un evento es un conjunto de resultados.

6.56. Evento simple

Un evento simple contiene un único resultado elemental.

Por ejemplo:

A = «obtener 5».

Entonces:

A={5}.

5

resultado elemental

{5}

evento simple

6.57. Evento compuesto

Un evento compuesto contiene dos o más resultados elementales.

En el dado, definamos:

B = «obtener un número mayor que 3».

Entonces:

B={4,5,6}.

Tabla 6.9
Primeros tipos de eventos en el lanzamiento de un dado
Obtener 3

{3}

simple
Obtener un número par

{2,4,6}

compuesto
Obtener menos de 3

{1,2}

compuesto
Obtener cualquier resultado permitido

Ω

seguro
Obtener 9

imposible

6.58. Evento seguro

Consideremos:

Ω={1,2,3,4,5,6}.

El evento:

«obtener un número entre 1 y 6»

contiene todos los resultados posibles.

evento seguro = Ω

Se llama seguro porque, cualquiera que sea el resultado del ensayo, pertenecerá a este evento.

6.59. Evento imposible

Si lanzamos un dado ordinario de seis caras, consideremos:

«obtener 9».

Ningún resultado de Ω satisface esa condición.

evento imposible = ∅

El símbolo representa el conjunto vacío: un conjunto que no contiene ningún resultado.

Dentro del modelo

«Seguro» e «imposible» siempre deben interpretarse respecto del experimento y del espacio muestral que hemos definido.

6.60. Complemento de un evento: Ac

Supongamos:

Ω={1,2,3,4,5,6}

y:

A={2,4,6}.

El complemento de A contiene todos los resultados de Ω que no pertenecen a A.

Ac={1,3,5}.

Podemos leer:

Ac = «no A».

Figura 6.16
El complemento reúne todo lo que está en Ω pero no pertenece a A
A · MODELO CON UN DADO
Ω={1,2,3,4,5,6}
A
{2,4,6}
Ac
{1,3,5}
B · APLICACIÓN EN MEDICIÓN

Clasificamos una medición respecto de sus límites de tolerancia.

A
dentro de tolerancia
Ac
fuera de tolerancia
Puente de significado. Si el modelo clasifica cada medición únicamente como «dentro» o «fuera» de tolerancia, ambos conjuntos se complementan dentro de Ω. Cambiar la definición del experimento podría cambiar también el complemento.

Nota. Elaboración propia. La clasificación metrológica es esquemática y se usa para mostrar la estructura de complemento.

6.61. Unión de eventos: A ∪ B

Sean:

A={2,4,6}

B={4,5,6}.

La unión reúne todos los resultados que pertenecen a A, a B o a ambos.

A ∪ B={2,4,5,6}.

Se lee:

«A unión B»

o, en lenguaje cotidiano:

«A o B».

El «o» matemático normalmente es inclusivo

A ∪ B incluye los resultados que pertenecen solo a A, solo a B y también los que pertenecen simultáneamente a ambos.

Figura 6.17
La unión representa «A o B o ambos»
Ω A B A ∪ B APLICACIÓN: SISTEMA DE SUPERVISIÓN A = temperatura supera el límite B = vibración supera el límite A ∪ B = al menos una de las dos condiciones aparece

Nota. Elaboración propia. El sistema de supervisión es un ejemplo hipotético con fines didácticos.

6.62. Intersección de eventos: A ∩ B

Utilicemos los mismos eventos:

A={2,4,6}

B={4,5,6}.

La intersección contiene solamente los resultados que pertenecen simultáneamente a A y a B.

A ∩ B={4,6}.

Puede leerse:

«A y B».

Figura 6.18
La intersección conserva únicamente la parte común de A y B
Ω A B A ∩ B APLICACIÓN: DOS CONDICIONES SIMULTÁNEAS A = temperatura alta B = vibración alta A ∩ B = aparecen ambas condiciones

Nota. Elaboración propia. La región central representa simultaneidad lógica, no una magnitud física adicional.

6.63. Diferencia de eventos: A \ B

La diferencia:

A \ B

contiene los resultados que pertenecen a A pero no pertenecen a B.

Con:

A={2,4,6}     B={4,5,6},

obtenemos:

A \ B={2}.

Puede leerse:

«A pero no B»

o:

«A y no B».

Figura 6.19
A \ B conserva la parte de A que queda fuera de B
A \ B B A = temperatura alta B = vibración alta A \ B = temperatura alta pero vibración no alta

Nota. Elaboración propia. Aplicación hipotética con fines didácticos.

6.64. Traducir entre lenguaje cotidiano y lenguaje de eventos

Una habilidad fundamental consiste en transformar una frase en una operación entre conjuntos.

A o B, incluyendo ambos

A ∪ B

A y B

A ∩ B

No A

Ac

A pero no B

A \ B

A y B no pueden ocurrir juntos

A ∩ B=∅

A o B cubren todo Ω

A ∪ B=Ω

6.65. Ejemplo guiado · Un sistema de supervisión industrial

INTERMEDIO · ●●○○

Consideremos un modelo hipotético de supervisión de una máquina.

Definimos:

A

la temperatura supera el límite establecido.

B

la vibración supera el límite establecido.

Entonces:

A ∪ B

al menos una de las dos variables supera su límite.

A ∩ B

ambas variables superan sus límites.

Ac

la temperatura no supera el límite.

A \ B

la temperatura supera el límite, pero la vibración no.

Puente entre matemática y sistema físico

A y B no son la temperatura ni la vibración mismas. Son eventos definidos a partir de criterios sobre esas magnitudes. Cambiar el umbral de alarma cambiaría qué observaciones pertenecen a cada evento.

6.66. Eventos mutuamente excluyentes, disjuntos o incompatibles

Consideremos:

A = «obtener un número par» = {2,4,6}

B = «obtener un número impar» = {1,3,5}.

No existe ningún resultado que pertenezca simultáneamente a los dos.

A ∩ B=∅.

Dos eventos son mutuamente excluyentes, disjuntos o incompatibles cuando no pueden ocurrir simultáneamente. Matemáticamente, su intersección es vacía.

Figura 6.20
Dos eventos incompatibles no comparten resultados, pero no necesariamente cubren Ω
Ω A B quedan otros resultados de Ω fuera de A y B EJEMPLO DE CLASIFICACIÓN A = defecto eléctrico · B = defecto mecánico pueden existir además otras categorías
Lección visual. Que A y B no se superpongan no significa automáticamente que entre ambos cubran todo Ω.

Nota. Elaboración propia. La clasificación de defectos es hipotética.

6.67. Eventos exhaustivos

Un conjunto de eventos es exhaustivo cuando entre todos cubren completamente el espacio muestral.

Por ejemplo:

A={1,2}

B={3,4}

C={5,6}.

Entonces:

A ∪ B ∪ C=Ω.

Entre A, B y C no queda ningún resultado de Ω sin clasificar.

6.68. Partición del espacio muestral

Una partición de Ω divide el espacio muestral en partes que cumplen simultáneamente dos condiciones:

CONDICIÓN 1 · NO SE SUPERPONEN

Ningún resultado pertenece simultáneamente a dos partes distintas.

CONDICIÓN 2 · CUBREN TODO Ω

Todo resultado del espacio muestral pertenece a alguna de las partes.

En forma conceptual:

incompatibles entre sí + exhaustivos = partición.

Figura 6.21
Una partición divide Ω sin superposiciones y sin dejar resultados fuera
NORMAL
ADVERTENCIA
CRÍTICO
Ω = todos los estados que el modelo de supervisión distingue
Puente de significado. Si el sistema define reglas inequívocas de modo que cada estado observado se clasifica exactamente en una de las tres categorías y ningún estado queda sin clasificar, las categorías forman una partición de Ω.

Nota. Elaboración propia. Clasificación hipotética para mostrar el concepto de partición.

6.69. Incompatibles, exhaustivos y partición no significan lo mismo

INCOMPATIBLES

No comparten resultados.

intersección vacía

EXHAUSTIVOS

Entre todos cubren Ω.

unión = Ω

PARTICIÓN

Cumple ambas propiedades.

no se superponen + cubren Ω

Dos errores que debemos evitar

Error 1: creer que si dos eventos son incompatibles, necesariamente son complementarios.

Error 2: creer que si varios eventos son exhaustivos, necesariamente son incompatibles.

6.70. Aplicación · Clasificar mediciones mediante una partición

INTERMEDIO · ●●○○

Supongamos que en un proceso industrial una magnitud se compara con dos límites:

Linf y Lsup.

Podemos clasificar cada resultado x mediante:

A · BAJO

x<Linf

B · DENTRO

Linf≤x≤Lsup

C · ALTO

x>Lsup

Bajo estas definiciones:

ningún valor puede pertenecer a dos categorías al mismo tiempo,

y todo valor pertenece a una de las tres.

Por tanto:

{A,B,C}

forma una partición del espacio muestral definido por el modelo.

La regla de frontera importa

Debemos definir con precisión qué ocurre exactamente en Linf y Lsup. Si las fronteras se asignaran ambiguamente a dos categorías, dejaríamos de tener una partición bien definida.

6.71. ¿Qué ocurre cuando negamos una unión o una intersección?

Consideremos la afirmación:

«ocurre A o B».

Para que esta afirmación sea falsa, no debe ocurrir A y tampoco debe ocurrir B.

(A ∪ B)c=Ac ∩ Bc.

Ahora consideremos:

«ocurren A y B».

Para que esta afirmación sea falsa basta con que no ocurra A, no ocurra B o no ocurra ninguno.

(A ∩ B)c=Ac ∪ Bc.

Estas dos relaciones reciben el nombre de leyes de De Morgan.

Figura 6.22
Al negar «o» aparece «y»; al negar «y» aparece «o»
NEGAR «A O B»
no ocurre A
Y
no ocurre B
(A ∪ B)c=Ac∩Bc
NEGAR «A Y B»
no ocurre A
O
no ocurre B
(A ∩ B)c=Ac∪Bc

Nota. Elaboración propia. Las dos leyes describen equivalencias entre conjuntos, no reglas aproximadas.

PARA PROFUNDIZAR · DEMOSTRACIÓN 3 · ●●●●

6.72. Demostración de las leyes de De Morgan

Demostraremos las dos igualdades examinando un resultado elemental cualquiera ω.

Primera ley

(A ∪ B)c=Ac∩Bc

Supongamos:

ω ∈ (A ∪ B)c.

Esto significa que ω no pertenece a A ∪ B.

La unión contiene todo resultado que pertenece a A, a B o a ambos. Por tanto, quedar fuera de la unión significa simultáneamente:

ω ∉ A    y    ω ∉ B.

Por definición de complemento:

ω ∈ Ac    y    ω ∈ Bc.

Por tanto:

ω ∈ Ac ∩ Bc.

Como este razonamiento vale para cualquier resultado ω, ambos conjuntos contienen exactamente los mismos resultados. Así:

(A ∪ B)c=Ac∩Bc.

Segunda ley

(A ∩ B)c=Ac∪Bc

Supongamos:

ω ∈ (A ∩ B)c.

Esto significa que ω no pertenece simultáneamente a A y a B.

En consecuencia, al menos una de las siguientes afirmaciones debe cumplirse:

ω ∉ A    o    ω ∉ B.

Equivalentemente:

ω ∈ Ac    o    ω ∈ Bc.

Es decir:

ω ∈ Ac ∪ Bc.

Como el razonamiento vale para cualquier resultado elemental:

(A ∩ B)c=Ac∪Bc.

6.73. Ejemplo · De Morgan en un sistema de alarmas

INTERMEDIO · ●●○○

Definamos:

A: la temperatura supera el límite.

B: la vibración supera el límite.

El evento:

A ∪ B

significa que aparece al menos una de las dos condiciones.

Su complemento:

(A ∪ B)c

significa:

«no hay temperatura alta y tampoco hay vibración alta».

De Morgan nos permite escribir:

(A ∪ B)c=Ac∩Bc.

Interpretación

La identidad matemática coincide con la lógica del sistema: negar «alguna alarma está activa» equivale a afirmar «ninguna de las dos alarmas está activa».

6.74. ¿Cuántos eventos pueden construirse?

Supongamos que un espacio muestral finito contiene:

n resultados elementales.

Para construir un evento debemos decidir, para cada resultado:

INCLUIRLO
NO INCLUIRLO

Cada uno de los n resultados ofrece dos decisiones. Por tanto, el número total de subconjuntos es:

2n

Como cada subconjunto puede representar un evento, un espacio muestral finito con n resultados puede formar:

2n eventos distintos.

Este conteo incluye:

∅ y Ω.

6.75. Ejemplo · Un espacio muestral con tres resultados

FUNDAMENTAL · ●○○○

Sea:

Ω={a,b,c}.

Como:

|Ω|=3,

podemos construir:

23=8

subconjuntos:

{a}
{b}
{c}
{a,b}
{a,c}
{b,c}
{a,b,c}

6.76. Actividad de modelación · Control de calidad

INTERMEDIO · ●●○○

Una empresa clasifica el resultado de la inspección de una pieza mediante:

Ω={correcta, defecto dimensional, defecto superficial, defecto eléctrico}.

Define:

A: la pieza presenta un defecto dimensional o superficial.

B: la pieza presenta un defecto eléctrico.

Responde:

1. Escribe A como conjunto.

2. Escribe B como conjunto.

3. Construye A ∪ B.

4. Construye A ∩ B.

5. Construye Ac.

6. ¿Son A y B incompatibles bajo esta regla de clasificación?

7. ¿A y B son exhaustivos?

8. Explica qué información adicional necesitarías para que varias categorías formen una partición completa.

Ver orientación

A={defecto dimensional, defecto superficial}.

B={defecto eléctrico}.

A∪B contiene los tres tipos de defecto.

A∩B=∅ bajo este modelo, porque cada resultado se está registrando en una única categoría.

Ac={correcta, defecto eléctrico}.

A y B son incompatibles, pero no exhaustivos porque no incluyen «correcta».

Para formar una partición completa debemos cubrir todas las categorías de Ω sin permitir superposición.

6.77. Práctica fundamental · Un dado

FUNDAMENTAL · ●○○○

Sea:

Ω={1,2,3,4,5,6}.

Define:

A = «obtener un número par».

B = «obtener un número mayor que 3».

Resuelve:

1. Escribe A.

2. Escribe B.

3. Construye A ∪ B.

4. Construye A ∩ B.

5. Construye Ac.

6. Construye Bc.

7. Construye A \ B.

8. Construye B \ A.

9. ¿Son A y B incompatibles?

10. Comprueba una ley de De Morgan.

Ver respuestas

A={2,4,6}.

B={4,5,6}.

A∪B={2,4,5,6}.

A∩B={4,6}.

Ac={1,3,5}.

Bc={1,2,3}.

A\B={2}.

B\A={5}.

No son incompatibles porque A∩B={4,6}.

Por ejemplo: (A∪B)c={1,3} y Ac∩Bc={1,3}.

6.78. Reto · Dos dados

AVANZADO · ●●●○

Se lanzan dos dados y cada resultado elemental se representa mediante:

(dado 1, dado 2).

Define:

A: «la suma es menor que 6».

B: «al menos uno de los dados muestra 1».

Responde:

1. Escribe todos los resultados de A.

2. Escribe todos los resultados de B.

3. Obtén A ∩ B.

4. Obtén A ∪ B.

5. Expresa Ac en palabras.

6. Expresa Bc en palabras.

7. ¿Son A y B incompatibles?

8. Explica con palabras qué significa A ∩ B.

9. Explica por qué para resolver correctamente el problema debemos conservar el orden de los dos dados.

6.79. ¿Dónde se utilizan los eventos?

El lenguaje de eventos permite transformar preguntas científicas y tecnológicas en conjuntos bien definidos.

INGENIERÍA

«ocurre una falla», «se supera un límite», «se activan dos alarmas».

METROLOGÍA

«la medición queda dentro del intervalo establecido» o «queda fuera».

INFORMÁTICA

«el sistema responde», «aparece un error», «se cumplen simultáneamente dos condiciones».

SALUD

«una prueba cumple un criterio definido» o «aparecen determinadas características».

METEOROLOGÍA

«se registra precipitación», «la temperatura supera cierto valor» o «ocurren ambas condiciones».

CONTROL DE CALIDAD

«la pieza cumple», «presenta defecto» o «pertenece a determinada categoría».

Idea transversal

En cada aplicación, el evento debe definirse mediante una regla suficientemente clara para decidir si un resultado observado pertenece o no pertenece a él.

6.80. Errores frecuentes

ERROR 1

Confundir un resultado con un evento.

4 es un resultado; {2,4,6} es un evento.

ERROR 2

Confundir ∈ con ⊆.

Un resultado pertenece a un evento; un evento es subconjunto de Ω.

ERROR 3

Interpretar «A o B» como si excluyera automáticamente «ambos».

A ∪ B incluye también A ∩ B.

ERROR 4

Confundir unión e intersección.

Unión = al menos uno. Intersección = ambos.

ERROR 5

Creer que incompatible significa complementario.

Dos eventos pueden no compartir resultados y, aun así, no cubrir todo Ω.

ERROR 6

Creer que exhaustivo significa necesariamente incompatible.

Para formar una partición deben cumplirse ambas condiciones.

6.81. Comprueba lo aprendido

1. ¿Qué es un evento?

2. ¿Qué significa A ⊆ Ω?

3. ¿Qué diferencia existe entre ω ∈ A y A ⊆ Ω?

4. ¿Qué es un evento simple?

5. ¿Qué es un evento compuesto?

6. ¿Cuál es el evento seguro?

7. ¿Cuál es el evento imposible?

8. ¿Qué contiene Ac?

9. ¿Qué significa A ∪ B?

10. ¿Qué significa A ∩ B?

11. ¿Qué contiene A \ B?

12. ¿Cuándo dos eventos son incompatibles?

13. ¿Qué significa que varios eventos sean exhaustivos?

14. ¿Qué dos condiciones debe cumplir una partición?

15. Escribe las dos leyes de De Morgan.

16. Si |Ω|=5, ¿cuántos eventos distintos pueden construirse?

17. Explica por qué dos eventos incompatibles no tienen que ser complementarios.

18. Explica por qué eventos exhaustivos pueden superponerse.

19. En un sistema de sensores, A significa «temperatura alta» y B «vibración alta». Traduce A \ B al lenguaje del contexto.

20. En el mismo sistema, traduce (A ∪ B)c.

21. Una medición se clasifica como «baja», «dentro» o «alta». ¿Qué condiciones deben cumplir esas categorías para constituir una partición?

22. Explica con tus palabras por qué un evento puede considerarse una pregunta formulada sobre Ω.

Ver respuestas breves

1. Un subconjunto del espacio muestral formado por los resultados que satisfacen una condición.

2. Todos los elementos de A pertenecen a Ω.

3. ω∈A relaciona un elemento con un conjunto; A⊆Ω relaciona dos conjuntos.

4. Evento con un único resultado elemental.

5. Evento que contiene dos o más resultados.

6. Ω.

7. ∅.

8. Los resultados de Ω que no pertenecen a A.

9. Ocurre A, B o ambos.

10. Ocurren simultáneamente A y B.

11. Los resultados que están en A pero no en B.

12. Cuando A∩B=∅.

13. Que entre todos cubren Ω.

14. No superponerse y cubrir completamente Ω.

15. (A∪B)c=Ac∩Bc y (A∩B)c=Ac∪Bc.

16. 25=32.

17. Porque pueden existir resultados de Ω que no pertenezcan a ninguno de los dos.

18. Exhaustividad solamente exige cubrir Ω; no exige que las partes sean disjuntas.

19. Temperatura alta pero vibración no alta.

20. No hay temperatura alta y tampoco vibración alta.

21. Cada resultado debe caer exactamente en una de las tres categorías, sin superposición y sin quedar fuera.

22. Porque la pregunta selecciona precisamente los resultados de Ω que hacen verdadera una condición.

6.82. Mapa conceptual y síntesis

Figura 6.23
Del espacio muestral a las preguntas y operaciones entre eventos
ESPACIO MUESTRAL Ω
todos los resultados elementales posibles
FORMULAMOS UNA PREGUNTA
seleccionamos los resultados que responden «sí»
EVENTO A ⊆ Ω
UNIÓN
A ∪ B
«A o B»
INTERSECCIÓN
A ∩ B
«A y B»
COMPLEMENTO
Ac
«no A»
DIFERENCIA
A \ B
«A pero no B»
INCOMPATIBLES
no se superponen
EXHAUSTIVOS
cubren Ω
PARTICIÓN
cumple ambas condiciones
YA PODEMOS FORMULAR CON PRECISIÓN LOS EVENTOS CUYA PROBABILIDAD DESEAMOS ESTUDIAR

Nota. Elaboración propia.

Síntesis

El espacio muestral Ω contiene todos los resultados elementales que nuestro modelo considera posibles.

Un evento selecciona algunos de esos resultados de acuerdo con una pregunta o condición:

A ⊆ Ω.

Un resultado observado pertenece o no pertenece al evento:

ω ∈ A    o    ω ∉ A.

Un evento simple contiene un único resultado; un evento compuesto contiene varios.

El evento seguro es:

Ω,

mientras que el evento imposible es:

∅.

El complemento Ac contiene los resultados que no pertenecen a A.

La unión:

A ∪ B

representa que ocurre A, B o ambos.

La intersección:

A ∩ B

representa que ocurren simultáneamente A y B.

La diferencia:

A \ B

contiene los resultados que están en A pero no en B.

Los eventos incompatibles no comparten resultados. Los eventos exhaustivos cubren todo Ω. Una partición cumple simultáneamente ambas propiedades.

Las leyes de De Morgan establecen:

(A ∪ B)c=Ac∩Bc

(A ∩ B)c=Ac∪Bc.

Si un espacio muestral finito contiene n resultados elementales, puede formar:

2n

subconjuntos y, por tanto, 2n eventos posibles.

El espacio muestral responde: «¿qué puede ocurrir?»

El evento responde: «¿cuáles de esos resultados satisfacen la condición que me interesa?»

Esta distinción transforma preguntas del mundo real en objetos matemáticos que podemos describir y analizar con precisión.

Ω contiene las posibilidades.

Los eventos convierten esas posibilidades en preguntas matemáticamente precisas.

SIGUIENTE
Parte 4 de 18 · ¿De dónde sale una probabilidad?
Ya sabemos qué resultados puede producir un experimento y cómo formular los eventos que nos interesan. El siguiente paso será comprender de qué maneras puede construirse o justificarse una asignación de probabilidad.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 4 DE 18
CAPÍTULO 6

¿De dónde sale una probabilidad?

Equiprobabilidad · evidencia experimental · modelos

Calcular una probabilidad no consiste simplemente en contar posibilidades

Idea central

En las partes anteriores aprendimos a definir un experimento, construir su espacio muestral y describir eventos. Ahora aparece una pregunta fundamental:

¿qué justifica el número que asignamos como probabilidad?

A veces podemos apoyarnos en resultados igualmente probables; otras veces necesitamos observar repetidamente el fenómeno; y en situaciones más complejas debemos construir un modelo utilizando conocimiento científico, datos e hipótesis. El mismo símbolo P(A) puede surgir de caminos distintos.

Al finalizar esta parte podrás:
explicar por qué una probabilidad necesita una justificación;
reconocer cuándo puede suponerse equiprobabilidad;
aplicar correctamente la regla clásica de probabilidad;
distinguir resultados posibles de resultados equiprobables;
calcular e interpretar frecuencias relativas;
diferenciar datos observados y probabilidad del modelo;
evaluar cuándo los datos históricos siguen siendo relevantes;
comprender qué puede y qué no puede demostrar una simulación;
reconocer probabilidades justificadas mediante modelos científicos;
auditar críticamente afirmaciones probabilísticas.

6.83. El mismo símbolo P(A), tres preguntas diferentes

Observa estas tres afirmaciones:

DADO EQUILIBRADO

Evento A: obtener un 4.

P(A)=1/6

PROCESO INDUSTRIAL

Evento B: pieza defectuosa.

P(B)≈0,027

PRONÓSTICO

Evento C: lluvia mañana.

P(C)=0,70

Los tres números están en la escala de 0 a 1. Sin embargo, la pregunta importante es:

¿Por qué 1/6?   ·   ¿Por qué 0,027?   ·   ¿Por qué 0,70?

Una respuesta científica no puede limitarse a decir:

«Porque esa es la probabilidad».

Debemos poder explicar de dónde salió el número.

6.84. Toda asignación de probabilidad necesita un fundamento

Una probabilidad no aparece simplemente porque escribimos P(A).

Necesitamos alguna razón que justifique la asignación.

En esta parte distinguiremos tres caminos especialmente importantes:

1. La estructura del modelo justifica resultados equiprobables.

2. Las observaciones repetidas proporcionan evidencia empírica.

3. Un modelo científico combina mecanismo, conocimiento, datos e hipótesis.

Figura 6.24
El mismo objeto matemático P(A) puede estar justificado por caminos diferentes
¿DE DÓNDE SALE P(A)? CAMINO 1 EQUIPROBABILIDAD 1 2 3 4 5 6 modelo: seis resultados igualmente probables P(4)=1/6 fundamento: simetría CAMINO 2 EVIDENCIA EMPÍRICA 1.000 piezas 27 defectuosas dato observado: 27 / 1.000 h=0,027 evidencia para modelar CAMINO 3 MODELO CIENTÍFICO observaciones mecanismo físico hipótesis + datos P(A) salida del modelo MISMA ESCALA 0–1 · DISTINTA JUSTIFICACIÓN siempre debemos explicitar los supuestos

Nota. Elaboración propia. Los datos industriales son hipotéticos con fines didácticos. El tercer camino representa de manera conceptual la construcción de un modelo científico.

6.85. Primer camino: equiprobabilidad

Decimos que varios resultados elementales son equiprobables cuando el modelo les asigna la misma probabilidad.

Por ejemplo, en un dado ideal equilibrado:

Ω={1,2,3,4,5,6}.

El modelo supone que ninguna cara está privilegiada.

Por tanto:

P(1)=P(2)=P(3)=P(4)=P(5)=P(6)=1/6.

La palabra decisiva

No basta con que los resultados sean:

posibles.

Para usar directamente la regla clásica necesitamos que sean:

igualmente probables.

Tabla 6.10
Posibilidad y equiprobabilidad son ideas diferentes
POSIBLE

El resultado pertenece a Ω.

No dice todavía qué probabilidad tiene.

EQUIPROBABLE

Dos o más resultados reciben exactamente el mismo peso probabilístico.

Es una condición adicional del modelo.

CONSECUENCIA

Contar resultados solo permite calcular probabilidades directamente cuando esa equiprobabilidad está justificada.

6.86. La regla clásica de probabilidad

Si tenemos un espacio muestral finito y todos sus resultados elementales son equiprobables, podemos calcular la probabilidad de un evento A contando resultados.

P(A)=|A| / |Ω|
|A|

número de resultados elementales que hacen ocurrir A.

|Ω|

número total de resultados elementales posibles.

Esta regla suele expresarse como:

probabilidad = casos favorables / casos posibles.

Condición indispensable

Los casos posibles que estamos contando deben ser equiprobables. Sin esa condición, la división puede producir una respuesta incorrecta.

PARA PROFUNDIZAR · DEMOSTRACIÓN 4 · ●●●●

¿Por qué aparece |A| / |Ω| en un modelo finito equiprobable?

Supongamos que Ω contiene:

N resultados elementales.

Como son equiprobables, cada uno recibe la misma probabilidad. Llamemos q a ese valor común.

Entre todos los resultados de Ω deben reunir la totalidad de la probabilidad:

Nq=1.

Por tanto:

q=1/N.

Ahora supongamos que el evento A contiene:

m resultados elementales.

Como cada uno aporta 1/N:

P(A)=m·(1/N).

P(A)=m/N=|A|/|Ω|.

La división no aparece porque «probabilidad significa dividir». Aparece porque estamos trabajando con un conjunto finito de resultados que reciben el mismo peso probabilístico.

6.87. Ejemplo 1 · Obtener un número impar

FUNDAMENTAL · ●○○○

Lanzamos un dado ideal equilibrado.

Ω={1,2,3,4,5,6}.

Definimos:

A = «obtener un número impar».

Entonces:

A={1,3,5}.

Tenemos:

|A|=3    y    |Ω|=6.

Como los seis resultados son equiprobables:

P(A)=3/6=1/2=0,50=50 %
Figura 6.25
Contar funciona cuando cada resultado tiene el mismo peso; falla cuando los pesos son diferentes
A · RESULTADOS EQUIPROBABLES dado ideal equilibrado 1 2 3 4 5 6 1/6 1/6 1/6 1/6 1/6 1/6 CONTAR ES SUFICIENTE B · PESOS DIFERENTES cuatro resultados posibles A · 0,40 B · 0,30 C · 0,20 D · 0,10 1 DE 4 NO IMPLICA 1/4 NÚMERO DE RESULTADOS ≠ DISTRIBUCIÓN DE PROBABILIDAD

Nota. Elaboración propia. El panel derecho es un modelo hipotético construido expresamente para mostrar resultados posibles con probabilidades diferentes.

6.88. «Resultado favorable» no significa «resultado deseable»

En la expresión:

casos favorables / casos posibles,

la palabra favorable puede producir una confusión.

No significa:

bueno · deseable · beneficioso · conveniente.

Significa únicamente:

resultado que pertenece al evento que estamos estudiando.

Si A significa:

«la máquina falla»,

una falla es matemáticamente «favorable a A» porque hace ocurrir el evento, aunque evidentemente no sea deseable en ingeniería.

6.89. Ejemplo 2 · Dos dados y suma 7

INTERMEDIO · ●●○○

Lanzamos dos dados ideales equilibrados y registramos pares ordenados.

Existen:

6×6=36

pares ordenados equiprobables.

Definimos:

A = «la suma de los dos dados es 7».

Los resultados que hacen ocurrir A son:

(1,6)
(2,5)
(3,4)
(4,3)
(5,2)
(6,1)

Así:

|A|=6    y    |Ω|=36.

P(A)=6/36=1/6≈0,1667≈16,67 %

Observa que contamos pares ordenados equiprobables, no simplemente las once sumas posibles.

6.90. Un cálculo aparentemente correcto puede partir de un modelo incorrecto

Supongamos que alguien razona:

«Las sumas posibles son 2, 3, 4, …, 12. Son 11 valores, así que P(suma 7)=1/11».

La división:

1/11

está aritméticamente bien calculada.

El problema está antes de la división: las once sumas no son equiprobables.

Lección científica

Un procedimiento matemático puede ejecutarse sin errores y producir, sin embargo, una conclusión equivocada si el modelo o los supuestos iniciales no son adecuados.

6.91. ¿Qué puede justificar la equiprobabilidad?

En modelos sencillos, la simetría puede ser una razón importante para asignar probabilidades iguales.

Una moneda ideal se modela como equilibrada cuando suponemos, entre otras condiciones relevantes:

que su geometría no favorece deliberadamente un lado;
que el procedimiento de lanzamiento no privilegia sistemáticamente un resultado;
que utilizamos un modelo estable para representar las repeticiones;
que ignoramos pequeñas irregularidades que no consideramos relevantes para el propósito del modelo.

Bajo esas hipótesis:

P(cara)=P(sello)=0,50.

Modelo ideal ≠ objeto perfecto

No estamos demostrando que toda moneda física existente produzca exactamente 50 % de caras. Estamos construyendo una idealización útil bajo determinados supuestos.

6.92. Si no podemos usar 50/50 automáticamente, necesitamos otra fuente de información

Ya sabemos que tener dos posibilidades:

A    o    no A

no implica:

0,50 y 0,50. ✗

En esta parte esa observación cumple una función nueva.

Nos obliga a preguntar:

Si no podemos asignar la probabilidad contando alternativas, ¿qué información podemos utilizar?

Una respuesta es:

observar repetidamente el fenómeno.

6.93. Segundo camino: evidencia empírica

Supongamos que encontramos una moneda física y no queremos asumir de antemano que está equilibrada.

No escribiremos automáticamente:

P(cara)=0,50.

Podemos realizar muchos ensayos concretos y registrar los resultados.

De esta manera obtenemos datos.

Idea central

Las observaciones repetidas pueden proporcionarnos evidencia acerca del comportamiento del fenómeno, pero los datos observados y la probabilidad del modelo siguen siendo conceptos distintos.

6.94. Frecuencia relativa

Si el evento A ocurre:

fA

veces en:

n

ensayos, definimos su frecuencia relativa:

hn(A)=fA/n

donde:

n

número total de ensayos realizados.

fA

número de ensayos en los que ocurrió A.

hn(A)

proporción de los n ensayos en los que observamos A.

6.95. Ejemplo 3 · Una moneda cuya probabilidad desconocemos

INTERMEDIO · ●●○○

Lanzamos una moneda física:

n=200 veces.

Observamos:

fC=118 caras.

Entonces:

h200(C)=118/200

h200(C)=0,59=59 %

Podemos afirmar con exactitud:

En esos 200 ensayos concretos, 59 % produjo cara.

Pero no hemos demostrado:

P(cara)=0,59 exactamente. ✗

Figura 6.26
Un dato observado y una probabilidad del modelo pertenecen a niveles diferentes
DATOS 200 lanzamientos 118 caras RESUMEN h=0,59 hecho sobre la muestra MODELACIÓN ¿es estable? ¿hay sesgo? ¿son comparables? PROBABILIDAD DEL MODELO P(C)=? NO SALTAMOS DIRECTAMENTE h=0,59 no demuestra P(C)=0,59 exacto DATOS → EVIDENCIA → MODELACIÓN → PROBABILIDAD

Nota. Elaboración propia. Los 200 lanzamientos y las 118 caras constituyen un ejemplo hipotético.

6.96. ¿Por qué escribimos hn(A) y no simplemente P(A)?

La notación recuerda que ambas cantidades responden preguntas diferentes.

hn(A)

¿Qué proporción de los n ensayos observados produjo A?

Es una cantidad calculada a partir de los datos.

P(A)

¿Qué probabilidad asigna el modelo al evento A?

Es una cantidad perteneciente al modelo.

6.97. ¿Qué observamos cuando aumentamos el número de ensayos?

Si un proceso se comporta de forma suficientemente estable y repetimos el experimento muchas veces, suele resultar útil examinar cómo evoluciona la frecuencia relativa acumulada.

Para ilustrar la idea, supongamos un modelo simulado con:

P(A)=0,55.

Tabla 6.11
Ejemplo simulado de frecuencias relativas acumuladas
n=20
0,65
n=50
0,58
n=100
0,52
n=200
0,565
n=500
0,542
n=1.000
0,553

Datos simulados con fines didácticos.

Figura 6.27
La frecuencia acumulada puede fluctuar mientras se mantiene alrededor del valor del modelo
P(A)=0,55 0,40 0,45 0,50 0,55 0,60 0,65 20 200 500 750 1.000 número acumulado de ensayos frecuencia relativa acumulada ESTABILIZARSE NO SIGNIFICA ACERCARSE EN CADA ENSAYO

Nota. Elaboración propia. Datos simulados con fines didácticos. La trayectoria se construyó para mostrar fluctuaciones; no representa un experimento real.

6.98. Más ensayos no significan acercamiento obligatorio en cada paso

Observa la Figura 6.27.

La frecuencia puede:

acercarse;
alejarse temporalmente;
volver a acercarse;
continuar fluctuando.

Por tanto, es incorrecto pensar:

«Cada nuevo ensayo tiene que hacer que la frecuencia quede más cerca de P(A)».

Lo importante aquí es comprender la idea de comportamiento de largo plazo, sin convertirla todavía en una garantía sobre cada paso individual.

6.99. Los datos históricos necesitan una condición esencial: comparabilidad

Supongamos que durante varios meses una máquina produjo aproximadamente:

2 % de piezas defectuosas.

Esa información puede resultar útil para estudiar el futuro solamente si las condiciones actuales siguen siendo suficientemente comparables.

Debemos preguntarnos:

¿es la misma máquina?
¿cambió la materia prima?
¿hubo mantenimiento?
¿cambió la velocidad de operación?
¿cambió el método de inspección?
¿cambiaron las condiciones ambientales?

Si el proceso cambia, una frecuencia histórica puede dejar de representar adecuadamente la situación actual.

Figura 6.28
Los datos pertenecen a unas condiciones; cuando las condiciones cambian debemos revisar el modelo
CAMBIO DEL PROCESO mantenimiento nuevo proveedor otra velocidad alrededor de 2 % comportamiento diferente 0 % 1 % 2 % 3 % 4 % 5 % periodo de observación porcentaje de piezas defectuosas EL 2 % HISTÓRICO NO SE TRANSFIERE AUTOMÁTICAMENTE primero debemos preguntar si seguimos estudiando el mismo proceso

Nota. Elaboración propia. Datos hipotéticos con fines didácticos. La figura no representa una fábrica específica.

6.100. Ejemplo 4 · Evidencia en control de calidad

INTERMEDIO · ●●○○

En una inspección hipotética se examinan:

1.000 piezas.

Se encuentran:

27 defectuosas.

La frecuencia relativa observada es:

h(defecto)=27/1.000=0,027=2,7 %.

Este valor constituye evidencia acerca del proceso observado.

Si deseamos utilizarlo para hablar de piezas futuras, necesitamos examinar cuestiones como:

¿las 1.000 piezas son representativas del proceso?

¿la inspección fue coherente?

¿el proceso permanece estable?

¿las futuras piezas serán producidas bajo condiciones comparables?

6.101. Ejemplo 5 · Aplicación en metrología

AVANZADO · ●●●○

Se realizan 500 mediciones hipotéticas de piezas producidas bajo unas mismas condiciones de operación.

De ellas:

470 quedan dentro del intervalo de tolerancia.

La frecuencia observada es:

h=470/500=0,94=94 %

Esto significa exactamente:

94 % de esas 500 mediciones quedaron dentro de tolerancia.

Pero si queremos afirmar:

«la próxima medición tiene aproximadamente 94 % de probabilidad de quedar dentro»,

estamos realizando un paso adicional: utilizamos los datos como evidencia para representar el comportamiento futuro mediante un modelo.

Condición

Ese paso es más razonable cuando las condiciones de medición y del proceso permanecen suficientemente comparables.

Figura 6.29
De las mediciones observadas a una afirmación probabilística sobre futuras mediciones
DATOS 500 mediciones 470 dentro FRECUENCIA h=0,94 describe esos datos ¿SON COMPARABLES? mismo proceso mismo método condiciones estables medición coherente MODELO PARA UNA MEDICIÓN FUTURA P(dentro de tolerancia)≈? inferencia respaldada por evidencia ERROR «observé 94 %» «la probabilidad exacta es 94 %» REALIDAD → MEDICIONES → DATOS → EVIDENCIA → MODELO cada flecha representa una decisión científica, no una igualdad automática

Nota. Elaboración propia. Ejemplo hipotético con fines didácticos.

6.102. Tercer recurso: simulación computacional

Una simulación permite realizar virtualmente una gran cantidad de ensayos bajo un modelo previamente especificado.

Por ejemplo, podemos programar una simulación utilizando:

P(cara)=0,50.

El computador genera resultados de acuerdo con ese supuesto y podemos estudiar sus frecuencias.

La dirección lógica es fundamental

Primero introducimos el modelo. Después la simulación genera consecuencias de ese modelo.

Figura 6.30
Una simulación comienza con un modelo; no descubre automáticamente el modelo del mundo real
SUPUESTO INTRODUCIDO P(cara)=0,50 SIMULACIÓN COMPUTACIONAL miles o millones de ensayos virtuales RESULTADOS SIMULADOS C · S · C · C · S · C · … datos virtuales FRECUENCIA SIMULADA h≈0,50 consecuencia del modelo ¿DESCRIBE UNA MONEDA FÍSICA PARTICULAR? para responder necesitamos además evidencia sobre la moneda real

Nota. Elaboración propia.

6.103. Diez millones de simulaciones no corrigen un modelo equivocado

Supongamos que programamos:

P(cara)=0,50

y realizamos:

10.000.000 de ensayos virtuales.

La frecuencia simulada puede quedar extraordinariamente cerca de 0,50.

Eso demuestra que la simulación está reproduciendo las consecuencias del supuesto introducido.

No demuestra que una moneda física desconocida tenga necesariamente:

P(cara)=0,50.

Muchísima precisión computacional aplicada a un modelo inadecuado puede producir una respuesta muy estable… sobre el modelo equivocado.

6.104. Cuando necesitamos un modelo científico o matemático

Muchas situaciones no pueden resolverse contando caras de un dado ni observando únicamente una frecuencia histórica.

Pensemos en preguntas como:

¿qué probabilidad existe de lluvia mañana?
¿qué probabilidad existe de falla de un sistema?
¿qué probabilidad existe de superar un límite de medición?
¿qué probabilidad tiene determinado resultado bajo ciertas condiciones?

En estos casos pueden combinarse:

conocimiento del mecanismo;

observaciones;

mediciones;

datos históricos;

hipótesis científicas;

representaciones matemáticas.

La probabilidad resulta entonces de un modelo construido, no de una simple división entre resultados contados.

6.105. Tres caminos habituales para justificar una probabilidad

Tabla 6.12
Formas de justificar probabilidades en diferentes problemas
MODELO EQUIPROBABLE

Fundamento: simetría o hipótesis de resultados igualmente probables.

Ejemplo: dado ideal equilibrado.

Debemos verificar: que la equiprobabilidad esté justificada.

No permite: aplicar la regla a resultados con pesos diferentes.

EVIDENCIA EMPÍRICA

Fundamento: observaciones repetidas y frecuencias relativas.

Ejemplo: proporción histórica de piezas defectuosas.

Debemos verificar: representatividad y estabilidad.

No permite: identificar automáticamente frecuencia observada con probabilidad exacta.

MODELO CIENTÍFICO O MATEMÁTICO

Fundamento: mecanismo + datos + hipótesis.

Ejemplo: meteorología, confiabilidad o riesgo.

Debemos verificar: supuestos, calidad de datos y adecuación del modelo.

No permite: confundir el modelo con el fenómeno real.

Figura 6.31
El método adecuado depende de la naturaleza del problema
¿QUÉ FUNDAMENTO TENEMOS PARA ASIGNAR P(A)?
SIMETRÍA JUSTIFICADA
equiprobabilidad
P(A)=|A|/|Ω|
REPETICIÓN Y DATOS
evidencia empírica
hn(A)
MECANISMO + DATOS
modelo científico
P(A)
EN TODOS LOS CASOS: EXPLICITAR SUPUESTOS · EXAMINAR DATOS · INTERPRETAR EN CONTEXTO

Nota. Elaboración propia.

6.106. La matemática y el mundo real cumplen funciones diferentes

Esta distinción es esencial.

DENTRO DEL MODELO MATEMÁTICO

Las hipótesis están establecidas.

Aplicamos reglas matemáticas.

Si los supuestos están dados, los cálculos pueden realizarse exactamente.

EN EL MUNDO REAL

Debemos decidir si las hipótesis son razonables.

Necesitamos datos y conocimiento del fenómeno.

El modelo debe evaluarse respecto del propósito para el cual se utiliza.

6.107. El mismo número puede significar cosas diferentes

Supongamos que en tres modelos diferentes aparece:

P(A)=0,70.

METEOROLOGÍA

A podría ser «llueve mañana».

CONFIABILIDAD

A podría ser «el componente supera cierto tiempo de operación».

MEDICIÓN

A podría ser «la medición queda dentro de un intervalo definido».

El número:

0,70

ocupa la misma posición en la escala matemática, pero el significado del evento, los datos disponibles y la construcción del modelo son diferentes.

6.108. Modelo adecuado, cálculo correcto e interpretación correcta

Resolver bien un problema probabilístico exige distinguir tres niveles.

Tabla 6.13
Tres condiciones diferentes para una buena solución probabilística
1 · MODELO

¿Representa razonablemente el problema?

¿Los supuestos están justificados?

2 · CÁLCULO

¿Utilizamos correctamente las reglas matemáticas?

¿La aritmética es correcta?

3 · INTERPRETACIÓN

¿Qué significa el resultado en el contexto?

¿Estamos afirmando más de lo que permite el modelo?

Figura 6.32
Una fórmula correcta no rescata un supuesto equivocado
CAMINO PROBLEMÁTICO
supuesto injustificado
fórmula correcta
aritmética perfecta
conclusión equivocada sobre la realidad
CAMINO CIENTÍFICO
pregunta bien definida
modelo y supuestos justificados
cálculo correcto
interpretación compatible con el modelo y los datos

Nota. Elaboración propia.

6.109. Antes de aceptar una probabilidad, haz estas preguntas

Cuando leas una afirmación como:

P(A)=0,72,

no te limites a mirar el número.

Pregunta:

1. ¿Cuál es exactamente el experimento?
2. ¿Cuál es exactamente el evento A?
3. ¿De dónde proviene 0,72?
4. ¿Qué datos respaldan la asignación?
5. ¿Qué supuestos se están haciendo?
6. ¿Siguen vigentes las condiciones bajo las cuales se construyó el modelo?
7. ¿Se está confundiendo una frecuencia observada con una probabilidad?
8. ¿Qué significa realmente el resultado en el contexto?
Figura 6.33
Auditoría rápida de una afirmación probabilística
«LA PROBABILIDAD ES 72 %»
¿72 % DE QUÉ?
define el evento
¿DE DÓNDE SALIÓ?
modelo, datos o ambos
¿BAJO QUÉ SUPUESTOS?
condiciones de validez
¿QUÉ EVIDENCIA?
datos y comparabilidad
¿SIGUE VIGENTE?
¿cambiaron las condiciones?
¿QUÉ SIGNIFICA?
interpretación, no garantía
AHORA PODEMOS EVALUAR LA AFIRMACIÓN

Nota. Elaboración propia. La figura propone un procedimiento de lectura crítica, no una fórmula adicional de probabilidad.

6.110. Errores frecuentes

ERROR 1

Aplicar casos favorables/casos posibles sin comprobar equiprobabilidad.

La regla clásica necesita resultados equiprobables.

ERROR 2

Creer que dos posibilidades significan 50 % y 50 %.

El número de alternativas no determina sus pesos.

ERROR 3

Confundir frecuencia relativa con probabilidad exacta.

hn(A) describe una serie observada.

ERROR 4

Pensar que aumentar n obliga a acercarse en cada paso.

Las frecuencias pueden fluctuar.

ERROR 5

Creer que una simulación descubre automáticamente la probabilidad real.

La simulación ejecuta el modelo que introducimos.

ERROR 6

Confundir modelo ideal con objeto físico.

Una moneda ideal y una moneda física no son idénticas.

ERROR 7

Usar datos antiguos sin preguntar si el proceso cambió.

Los datos históricos pertenecen a determinadas condiciones.

ERROR 8

Pensar que un cálculo correcto garantiza una conclusión científica correcta.

También deben ser adecuados el modelo y la interpretación.

6.111. Práctica de dificultad creciente

FUNDAMENTAL · ●○○○

Un dado ideal equilibrado se lanza una vez.

A = «obtener un número mayor que 4».

Calcula P(A) y explica por qué puedes utilizar la regla clásica.

Ver solución

A={5,6}, por tanto |A|=2 y |Ω|=6.

Como el modelo establece seis resultados equiprobables:

P(A)=2/6=1/3≈0,3333≈33,33 %.

INTERMEDIO · ●●○○

En una inspección se observan 600 piezas y 18 son defectuosas.

a) Calcula la frecuencia relativa de defecto.

b) ¿Puedes afirmar que la probabilidad exacta de defecto del proceso es ese mismo número?

c) ¿Qué preguntas adicionales deberías hacer?

Ver orientación

h=18/600=0,03=3 %.

Este valor describe las 600 piezas observadas. No demuestra por sí solo que P(defecto)=0,03 exactamente.

Conviene preguntar por selección de piezas, estabilidad del proceso, método de inspección y comparabilidad con futuras condiciones.

AVANZADO · ●●●○

Durante seis meses un proceso mostró aproximadamente 1,8 % de defectos. Después se cambia la materia prima y se ajusta la velocidad de producción.

Un analista continúa utilizando 1,8 % como probabilidad de defecto para el mes siguiente.

Evalúa críticamente esa decisión.

Ver orientación

El 1,8 % histórico pertenece al proceso anterior. Como cambiaron variables potencialmente relevantes, no puede transferirse automáticamente al nuevo proceso. Deben reunirse datos posteriores al cambio y justificar si el mismo modelo sigue siendo apropiado.

PARA PROFUNDIZAR · ●●●●

Una simulación de 5.000.000 de ensayos produce:

h(A)=0,73498.

El programa fue configurado inicialmente con:

P(A)=0,735.

Explica qué evidencia proporciona la simulación y qué afirmación no permite hacer acerca de un fenómeno real externo al programa.

Ver orientación

La simulación muestra que el procedimiento computacional reproduce de manera muy cercana las consecuencias del modelo P(A)=0,735. No demuestra que un fenómeno físico real tenga esa probabilidad; para eso necesitamos justificar que el modelo representa adecuadamente dicho fenómeno.

6.112. Exploración con hoja de cálculo

Después de comprender la diferencia entre modelo y datos, podemos utilizar Excel para estudiar experimentalmente un modelo.

Para simular un evento con:

P(A)=0,70,

podemos utilizar:

=SI(ALEATORIO()<0,7;»A»;»NO A»)

Podemos copiar la fórmula en muchas filas, contar cuántas veces aparece A y calcular:

hn(A)=fA/n.

Interpretación correcta

Estamos comprobando cómo se comportan datos simulados cuando el modelo ya contiene P(A)=0,70. No estamos descubriendo 0,70 a partir de un fenómeno real.

6.113. Comprueba lo aprendido

1. ¿Por qué una probabilidad necesita una justificación?

2. ¿Qué significa que varios resultados sean equiprobables?

3. ¿Bajo qué condiciones puede utilizarse P(A)=|A|/|Ω|?

4. ¿Qué significa «resultado favorable» en la regla clásica?

5. ¿Por qué «posible» y «equiprobable» no significan lo mismo?

6. ¿Por qué las once sumas posibles de dos dados no pueden tratarse como equiprobables?

7. ¿Qué papel puede cumplir la simetría en un modelo probabilístico?

8. ¿Qué es una frecuencia relativa?

9. ¿Qué diferencia existe entre P(A) y hn(A)?

10. Si observamos 59 caras en 100 lanzamientos, ¿hemos demostrado P(cara)=0,59?

11. ¿Por qué aumentar n no obliga a que la frecuencia se acerque en cada paso?

12. ¿Qué significa que unos datos históricos pertenezcan a determinadas condiciones?

13. ¿Por qué un cambio de materia prima puede hacer menos útil una frecuencia histórica?

14. ¿Qué función cumple una simulación?

15. ¿Por qué millones de simulaciones no corrigen un modelo equivocado?

16. ¿Qué diferencia existe entre un modelo equiprobable y un modelo científico?

17. Menciona tres fuentes posibles para justificar una probabilidad.

18. ¿Qué diferencia existe entre modelo adecuado y cálculo correcto?

19. ¿Por qué también necesitamos una interpretación correcta?

20. ¿Qué preguntas harías si una noticia afirma que «la probabilidad es 72 %»?

21. ¿Por qué una frecuencia de 94 % dentro de tolerancia no demuestra automáticamente una probabilidad exacta de 94 % para la próxima pieza?

22. Explica con tus propias palabras la frase: «No basta con saber calcular una probabilidad; también debemos poder defender de dónde salió».

Ver respuestas breves

1. Porque P(A) pertenece a un modelo y debe existir alguna razón para asignarle ese valor.

2. Que el modelo les asigna la misma probabilidad.

3. Cuando Ω es finito y los resultados elementales contados son equiprobables.

4. Resultado que pertenece al evento A; no significa resultado deseable.

5. Que algo pueda ocurrir no determina cuánto peso probabilístico recibe.

6. Porque distintos números de pares ordenados producen cada suma.

7. Puede justificar una asignación equiprobable cuando constituye una hipótesis razonable del modelo.

8. La proporción de ensayos observados en los que ocurrió A: hn(A)=fA/n.

9. P(A) pertenece al modelo; hn(A) se calcula a partir de los datos.

10. No. Hemos observado h=0,59 en esa serie concreta.

11. Porque cada nuevo resultado puede producir fluctuaciones temporales.

12. Que describen un proceso bajo las condiciones en que fueron obtenidos.

13. Porque puede haberse modificado el mecanismo generador de los resultados.

14. Explorar experimentalmente las consecuencias de un modelo previamente especificado.

15. Porque más repeticiones reducen fluctuación de simulación, pero no cambian los supuestos del modelo.

16. El primero se apoya en resultados igualmente probables; el segundo puede combinar mecanismo, datos e hipótesis más complejas.

17. Equiprobabilidad, evidencia empírica y modelo científico o matemático.

18. El modelo decide qué representación usamos; el cálculo ejecuta correctamente las reglas dentro de esa representación.

19. Porque debemos traducir el número obtenido al contexto sin afirmar más de lo que permiten los supuestos.

20. Evento, fuente del valor, datos, supuestos, condiciones de validez e interpretación.

21. Porque 94 % describe los datos observados; utilizarlo para una pieza futura requiere un paso de modelación y condiciones comparables.

22. Significa que una respuesta probabilística necesita tanto cálculo como una justificación del modelo que produce ese número.

6.114. Mapa conceptual y síntesis

QUEREMOS ASIGNAR P(A)
¿QUÉ JUSTIFICA ESA ASIGNACIÓN?
EQUIPROBABILIDAD
simetría o estructura

P(A)=|A|/|Ω|
EVIDENCIA EMPÍRICA
observaciones repetidas

hn(A)=fA/n
MODELO CIENTÍFICO
mecanismo + datos + hipótesis

P(A)
CÁLCULO CORRECTO
INTERPRETACIÓN BAJO LOS SUPUESTOS DEL MODELO

Síntesis

En esta parte aprendimos que una probabilidad necesita un fundamento.

Cuando un espacio muestral es finito y sus resultados elementales son equiprobables, podemos utilizar:

P(A)=|A|/|Ω|.

Esta regla no es universal. Contar posibilidades sin comprobar equiprobabilidad puede producir resultados incorrectos.

La simetría puede justificar un modelo equiprobable, pero continúa siendo una hipótesis acerca de cómo representamos la situación.

Cuando observamos un proceso repetidamente obtenemos frecuencias relativas:

hn(A)=fA/n.

Una frecuencia observada proporciona evidencia, pero no debe confundirse automáticamente con una probabilidad exacta.

Los datos históricos son más útiles cuando las condiciones del proceso permanecen suficientemente comparables.

Si la máquina, la materia prima, el método de medición, el ambiente o cualquier aspecto relevante cambia, debemos reconsiderar si el modelo anterior continúa siendo apropiado.

Una simulación permite estudiar las consecuencias de un modelo, pero no demuestra por sí sola que ese modelo describa correctamente un objeto físico.

En problemas más complejos pueden combinarse:

conocimiento científico · datos · mecanismos · hipótesis

para construir un modelo probabilístico.

Finalmente, debemos distinguir tres cuestiones:

modelo adecuado
cálculo correcto
interpretación correcta

Las tres son necesarias.

Pregunta final que debe quedar en la mente del lector

«P(A)=0,73… ¿por qué 0,73?»

Saber hacer esa pregunta es tan importante como saber utilizar una fórmula.

No basta con calcular una probabilidad.

También debemos poder explicar qué modelo, qué datos y qué supuestos justifican ese número.

SIGUIENTE
Parte 5 de 18 · Axiomas y reglas fundamentales de probabilidad
Ya sabemos qué significa asignar una probabilidad y por qué esa asignación necesita una justificación. Ahora estudiaremos las reglas matemáticas fundamentales que toda probabilidad debe satisfacer.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 5 DE 18
CAPÍTULO 6

Axiomas y reglas fundamentales de probabilidad

De tres principios fundamentales a muchas reglas útiles

Idea central

En la parte anterior estudiamos de dónde puede surgir una probabilidad: equiprobabilidad justificada, evidencia empírica o un modelo científico. Ahora planteamos otra pregunta. Una vez asignadas probabilidades, ¿qué condiciones deben cumplir para formar un modelo matemáticamente coherente? La respuesta comienza con unos pocos principios fundamentales llamados axiomas.

Al finalizar esta parte podrás:
explicar qué es un axioma matemático;
interpretar los tres axiomas fundamentales de probabilidad;
diferenciar axiomas de propiedades demostradas;
justificar las reglas del complemento, diferencia y unión;
comprender la monotonía de la probabilidad;
reconocer y corregir el doble conteo;
traducir expresiones como «al menos uno» y «ninguno»;
transferir estas reglas a situaciones científicas y tecnológicas.

6.115. ¿Por qué necesitamos axiomas?

Imagina tres afirmaciones:

P(A)=−0,08

«probabilidad de falla»

P(Ω)=1,17

«probabilidad de todos los resultados»

0,60+0,55=1,15

sin revisar superposición

Las tres situaciones deben hacernos sospechar. No basta con escribir números junto a eventos y llamarlos probabilidades. Las asignaciones deben obedecer una estructura coherente.

Los axiomas establecen las condiciones mínimas que debe cumplir cualquier función de probabilidad.

Esta distinción es fundamental:

Pregunta sobre el modelo

¿Por qué asignamos determinada probabilidad a un evento? Esta pregunta pertenece al origen y justificación del modelo.

Pregunta sobre coherencia

¿Las probabilidades asignadas cumplen las reglas fundamentales de la teoría? Esta es la pregunta central de esta parte.

6.116. ¿Qué es un axioma?

Un axioma es una afirmación fundamental que se adopta como punto de partida de una teoría matemática.

A partir de los axiomas utilizamos definiciones y razonamiento lógico para demostrar nuevas propiedades.

Esto evita tratar cada fórmula como una receta aislada. Podemos comprender por qué funciona una regla y bajo qué condiciones puede utilizarse.

Figura 6.34
De unos pocos axiomas a muchas reglas de probabilidad
AXIOMAS

principios fundamentales

RAZONAMIENTO LÓGICO
PROPIEDADES DEMOSTRADAS
REGLAS PARA INTERPRETAR Y RESOLVER PROBLEMAS

Nota. Elaboración propia.

6.117. Para profundizar · La estructura formal de un modelo probabilístico

PROFUNDIZACIÓN · ●●●●

Para comprender el recorrido principal de esta parte no necesitas dominar todavía toda la formulación abstracta de la teoría. Sin embargo, un lector que quiera ver su estructura formal puede representar un espacio de probabilidad mediante:

(Ω, 𝔽, P)
Tabla 6.14
Componentes de un espacio de probabilidad
Ω

Espacio muestral. Contiene los resultados que el modelo ha decidido distinguir.

𝔽

Familia de eventos. Contiene los eventos a los que el modelo asignará probabilidad.

P

Función de probabilidad. Asigna a cada evento considerado un número que satisface los axiomas.

Para el desarrollo principal bastará trabajar con eventos A, B, C, … dentro de Ω. La estructura con 𝔽 se incluye como capa formal. En espacios finitos elementales suele ser posible considerar todos los subconjuntos de Ω; en modelos más generales se requiere una estructura más cuidadosa.

6.118. Primer axioma · No negatividad

Pensemos primero en el significado. Una probabilidad cuantifica la posibilidad asignada a un evento dentro de un modelo. No tendría sentido que esa cantidad fuese negativa.

P(A) ≥ 0

Esto debe cumplirse para cualquier evento A al que el modelo asigne probabilidad.

P(A)=0,20

valor permitido

P(A)=−0,20

no puede ser una probabilidad

Aplicación tecnológica · riesgo de falla

Supongamos que A representa: «un componente falla durante una prueba de funcionamiento».

Un modelo podría asignar P(A)=0,02 o P(A)=0,15. Pero P(A)=−0,02 no describe un riesgo extraordinariamente pequeño: simplemente viola el axioma.

Puente de significado. El evento A representa la condición física que nos interesa; P(A) representa la probabilidad que el modelo asigna a esa condición. La no negatividad es una exigencia del modelo matemático, no una medición directa del componente.

6.119. Segundo axioma · Normalización

El espacio muestral Ω representa que ocurre alguno de los resultados contemplados por el modelo.

Si Ω contiene todos los resultados que el modelo considera posibles, alguno de ellos necesariamente pertenece a Ω.

P(Ω)=1

1 = 100 %

Esto significa que la totalidad de la probabilidad disponible en el modelo es 1.

Aplicación · estados de un sistema de monitoreo

Un sistema clasifica su estado operativo en tres categorías:

NORMAL
ADVERTENCIA
CRÍTICO

Si las categorías son mutuamente excluyentes y exhaustivas:

P(normal)+P(advertencia)+P(crítico)=1.

Puente de significado. Ω es aquí el conjunto de estados que el modelo permite registrar. P(Ω)=1 no afirma que el modelo incluya toda la complejidad física imaginable; afirma que, dentro de las categorías definidas por el modelo, la probabilidad total es 1.

6.120. Tercer axioma · Versión operacional para eventos disjuntos

Supongamos que A y B son eventos incompatibles:

A ∩ B=∅.

Como no comparten ningún resultado, sus probabilidades pueden reunirse sin contar ninguna posibilidad dos veces.

si A ∩ B=∅, entonces P(A ∪ B)=P(A)+P(B)

Esta es la versión operacional que utilizaremos con frecuencia. En la sección siguiente veremos la formulación completa.

Aplicación · clasificación exclusiva de piezas

Supongamos que un protocolo de inspección obliga a asignar a cada pieza rechazada una sola causa principal:

A = «rechazo por defecto dimensional»
B = «rechazo por defecto eléctrico».

Si el procedimiento de registro hace que una pieza no pueda aparecer simultáneamente en ambas categorías, A y B son disjuntos.

Si:

P(A)=0,04    y    P(B)=0,03,

P(A ∪ B)=0,07=7 %.

Puente de significado. La suma es válida porque la regla de registro hace exclusivas las dos categorías. Si una pieza pudiera clasificarse simultáneamente en ambos tipos de defecto, el modelo de eventos sería diferente y no podríamos sumar directamente.

6.121. La formulación rigurosa del tercer axioma

PROFUNDIZACIÓN · ●●●●

En la formulación moderna completa, el tercer axioma no se limita a dos eventos.

Si:

A₁, A₂, A₃, …

son eventos disjuntos dos a dos, entonces:

P(A₁ ∪ A₂ ∪ A₃ ∪ ···) = P(A₁)+P(A₂)+P(A₃)+···

Esta propiedad recibe el nombre de aditividad numerable. La suma para dos o para un número finito de eventos disjuntos se obtiene como caso particular.

Figura 6.35
Los tres pilares fundamentales de la probabilidad
AXIOMA 1

P(A) ≥ 0

no negatividad

AXIOMA 2

P(Ω)=1

normalización

AXIOMA 3

disjuntos → sumamos

aditividad numerable

Nota. Elaboración propia. La figura resume la interpretación operacional de los tres axiomas.

6.122. Ejemplo 1 · Los seis resultados de un dado

FUNDAMENTAL · ●○○○

Consideremos un dado ideal equilibrado:

Ω={1,2,3,4,5,6}.

Los seis resultados elementales son mutuamente excluyentes y, juntos, forman Ω.

Debido a la simetría asumida por el modelo ideal, asignamos:

P({1})=P({2})=···=P({6})=1/6.

1/6+1/6+1/6+1/6+1/6+1/6=1

Esto es coherente con:

P(Ω)=1.

Atención. Los axiomas no demuestran que cada cara tenga probabilidad 1/6. Esa asignación procede de la simetría del modelo de dado ideal. Los axiomas establecen qué propiedades debe cumplir la asignación una vez definida.

6.123. Lo importante: muchas reglas no son axiomas

Quizá ya reconoces expresiones como:

P(∅)=0
P(Ac)=1−P(A)
0 ≤ P(A) ≤ 1
P(A ∪ B)=P(A)+P(B)−P(A ∩ B)

No necesitamos convertir cada una en un axioma independiente.

Podemos demostrarlas a partir de los tres principios fundamentales.

PARA PROFUNDIZAR · DEMOSTRACIÓN 5 · ●●●●

6.124. Demostración de P(∅)=0

Sabemos que:

Ω ∪ ∅=Ω.

Además, Ω y ∅ son disjuntos porque el conjunto vacío no contiene ningún resultado.

Por aditividad:

P(Ω ∪ ∅)=P(Ω)+P(∅).

Pero Ω ∪ ∅=Ω, por lo que:

P(Ω)=P(Ω)+P(∅).

Como P(Ω)=1:

1=1+P(∅).

Restamos 1 a ambos lados:

P(∅)=0.

El evento imposible tiene probabilidad cero como consecuencia de los axiomas; no necesitamos introducir esta propiedad como un cuarto axioma.

6.125. La regla del complemento

Un evento A y su complemento Ac poseen dos propiedades:

A ∩ Ac=∅

no pueden ocurrir simultáneamente

A ∪ Ac

entre ambos cubren todo Ω

Por eso sus probabilidades deben completar la totalidad 1.

P(Ac)=1−P(A)
Figura 6.36
Modelo matemático y aplicación del complemento
MODELO MATEMÁTICO
Ω A Aᶜ A ∪ Aᶜ = Ω
APLICACIÓN · METROLOGÍA
A
medición clasificada dentro de tolerancia
Ac
medición clasificada fuera de tolerancia

Puente de significado. La región A del modelo representa todas las mediciones que satisfacen el criterio de tolerancia; el resto de Ω representa las que no lo satisfacen. La figura ilustra una estructura matemática; no afirma que cualquier proceso de medición tenga una probabilidad determinada de conformidad.

Nota. Elaboración propia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 6 · ●●●●

6.126. Demostración de la regla del complemento

Como A y Ac son disjuntos:

P(A ∪ Ac) = P(A)+P(Ac).

Pero:

A ∪ Ac=Ω.

Entonces:

P(Ω)=P(A)+P(Ac).

Como P(Ω)=1:

1=P(A)+P(Ac).

Despejamos:

P(Ac)=1−P(A).

6.127. De los axiomas obtenemos 0 ≤ P(A) ≤ 1

El primer axioma ya nos proporciona:

P(A) ≥ 0.

La regla del complemento nos da:

P(Ac)=1−P(A).

Como el primer axioma también se aplica a Ac:

P(Ac) ≥ 0.

Entonces:

1−P(A) ≥ 0,

de donde:

0 ≤ P(A) ≤ 1

La conocida escala de probabilidad entre 0 y 1 aparece así como una consecuencia de los axiomas.

6.128. Ejemplo 2 · Calcular por complemento

FUNDAMENTAL · ●○○○

Un modelo de confiabilidad asigna:

P(falla)=0,08.

Queremos calcular la probabilidad de que no ocurra la falla.

P(no falla)=1−P(falla).

P(no falla)=1−0,08=0,92=92 %

Interpretación. Dentro de ese modelo, la probabilidad asignada a que no ocurra la falla es 92 %. La afirmación no garantiza el comportamiento de un dispositivo concreto.

6.129. Monotonía · Si un evento está contenido en otro

Supongamos:

A ⊆ B.

Esto significa que cada resultado que hace ocurrir A también hace ocurrir B.

B contiene todas las posibilidades de A y quizá algunas adicionales. Por ello, A no puede tener mayor probabilidad que B.

A ⊆ B ⇒ P(A) ≤ P(B)

Esta propiedad recibe el nombre de monotonía de la probabilidad.

Figura 6.37
Monotonía: un umbral más exigente produce un evento contenido
ESTRUCTURA MATEMÁTICA
B A A ⊆ B
APLICACIÓN · TEMPERATURA
B
temperatura superior a 80 °C
A
temperatura superior a 90 °C

Puente de significado. Toda temperatura superior a 90 °C también supera 80 °C. Por tanto, el evento A está contenido en B y necesariamente P(A)≤P(B).

Nota. Elaboración propia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 7 · ●●●●

6.130. Demostración de la monotonía

Supongamos:

A ⊆ B.

Podemos dividir B en dos partes disjuntas:

A    y    B\A.

Por tanto:

B=A ∪ (B\A).

Como las dos partes son disjuntas, por aditividad:

P(B)=P(A)+P(B\A).

Por no negatividad:

P(B\A) ≥ 0.

Entonces:

P(B) ≥ P(A).

A ⊆ B ⇒ P(A) ≤ P(B).

6.131. Probabilidad de una diferencia

La demostración anterior mostró que, si A⊆B:

B=A ∪ (B\A),

con partes disjuntas.

P(B)=P(A)+P(B\A).

Despejando:

P(B\A)=P(B)−P(A), si A⊆B

Condición importante. La forma P(B\A)=P(B)−P(A) exige que A esté contenido en B. No debe aplicarse automáticamente a dos eventos cualesquiera.

6.132. Ejemplo 3 · Probabilidad entre dos umbrales

INTERMEDIO · ●●○○

En un modelo de temperatura definimos:

A = «temperatura superior a 90 °C»

B = «temperatura superior a 80 °C».

Como A⊆B, el evento B\A significa:

temperatura superior a 80 °C, pero no superior a 90 °C

Supongamos que el modelo asigna:

P(B)=0,18    y    P(A)=0,05.

Entonces:

P(B\A)=0,18−0,05=0,13.

Interpretación. En ese modelo, la probabilidad de encontrarse en el intervalo de temperaturas superior a 80 °C pero no superior a 90 °C es 13 %.

6.133. ¿Por qué no siempre podemos sumar P(A)+P(B)?

Si A y B se superponen, la región:

A ∩ B

pertenece simultáneamente a ambos eventos.

Al sumar:

P(A)+P(B),

la intersección queda contada dos veces.

Figura 6.38
El doble conteo al sumar dos eventos superpuestos
A B A ∩ B contada dos veces Para corregir el doble conteo, restamos P(A ∩ B) una vez.

Nota. Elaboración propia. Las áreas del dibujo representan relaciones entre conjuntos, no magnitudes proporcionales de probabilidad.

PARA PROFUNDIZAR · DEMOSTRACIÓN 8 · ●●●●

6.134. Demostración de la regla general de la unión

Queremos calcular:

P(A ∪ B).

Podemos dividir A ∪ B en tres regiones disjuntas:

A\B,    A ∩ B,    B\A.

Al sumar P(A)+P(B), la región A∩B aparece dos veces.

Para que aparezca una sola vez debemos restar una copia:

P(A ∪ B) = P(A)+P(B)−P(A ∩ B).

6.135. Ejemplo 4 · Dos alarmas de una máquina

INTERMEDIO · ●●○○

En un ejemplo hipotético de monitoreo industrial definimos:

A = «se activa la alarma de temperatura»

B = «se activa la alarma de vibración».

El modelo asigna:

P(A)=0,12    P(B)=0,09    P(A∩B)=0,04.

Queremos la probabilidad de que se active al menos una de las dos alarmas.

P(A∪B)=0,12+0,09−0,04

P(A∪B)=0,17=17 %

Puente de significado. La intersección representa los casos en los que ambas alarmas están activas simultáneamente. Si sumáramos 12 % y 9 % sin restarla, esos casos aparecerían dos veces.

Nota. Datos hipotéticos creados exclusivamente con fines didácticos.

6.136. Caso especial · Eventos disjuntos

Si A y B son incompatibles:

A ∩ B=∅.

Como:

P(∅)=0,

la regla general:

P(A ∪ B)=P(A)+P(B)−P(A ∩ B)

se transforma en:

P(A ∪ B)=P(A)+P(B)

Así recuperamos la versión operacional de la aditividad para dos eventos disjuntos.

6.137. Incompatibles no significa complementarios

Dos eventos complementarios cumplen simultáneamente:

A ∩ Ac=∅

A ∪ Ac=Ω.

Por eso los complementarios siempre son incompatibles. Pero la afirmación inversa no siempre es cierta.

En un dado:

A={1}    y    B={2}.

Son incompatibles porque:

A ∩ B=∅.

Sin embargo:

A ∪ B={1,2} ≠ Ω.

Tabla 6.15
Eventos incompatibles y complementarios
INCOMPATIBLES

A∩B=∅.

No se superponen, pero no necesariamente cubren Ω.

COMPLEMENTARIOS

A∩Ac=∅.

Además, A∪Ac=Ω.

6.138. Probabilidades de una partición

Supongamos que:

A₁, A₂, …, Aₖ

forman una partición de Ω.

Eso significa que:

  • no se superponen entre sí;
  • reunidos cubren todo Ω.

Por aditividad y normalización:

P(A₁)+P(A₂)+···+P(Aₖ)=1
Figura 6.39
Una partición aplicada a los estados de un sistema
NORMAL

A₁

ADVERTENCIA

A₂

CRÍTICO

A₃

mutuamente excluyentes + exhaustivos ⇒ P(A₁)+P(A₂)+P(A₃)=1

Puente de significado. Las tres regiones representan categorías de registro, no necesariamente tres estados fundamentales de la naturaleza. La partición depende de cómo se haya definido el sistema de clasificación.

Nota. Elaboración propia.

6.139. «Al menos uno»

Si tenemos dos eventos A y B, la frase:

«ocurre al menos uno»

significa:

A ∪ B.

Por tanto:

P(al menos uno)=P(A)+P(B)−P(A ∩ B)

Atención. En esta parte no calcularemos P(A∩B) multiplicando automáticamente P(A) por P(B). Esa operación requiere condiciones adicionales que todavía no hemos estudiado.

6.140. «Ninguno»

Si A ∪ B significa que ocurre al menos uno, su complemento significa que no ocurre ninguno.

(A ∪ B)c

Por la regla del complemento:

P(ninguno)=1−P(A ∪ B)

De forma equivalente:

P(al menos uno)=1−P(ninguno)

6.141. Exactamente uno de dos eventos

AVANZADO · ●●●○

«Exactamente uno» significa:

  • ocurre A sin B, o
  • ocurre B sin A.

Es decir:

(A\B) ∪ (B\A).

Las dos regiones son disjuntas. Puede demostrarse que:

P(exactamente uno) = P(A)+P(B)−2P(A ∩ B)

El factor 2 aparece porque, para conservar solamente las regiones exclusivas, la intersección debe eliminarse por completo.

6.142. Subaditividad

AVANZADO · ●●●○

De la regla general:

P(A ∪ B)=P(A)+P(B)−P(A ∩ B),

y como:

P(A ∩ B) ≥ 0,

concluimos:

P(A ∪ B) ≤ P(A)+P(B)

Esta propiedad recibe el nombre de subaditividad.

Aplicación · límite superior de riesgo

Si A y B representan dos tipos de eventos adversos y no conocemos exactamente cuánto se superponen, P(A)+P(B) proporciona un límite superior sencillo para la probabilidad de que ocurra al menos uno.

El resultado no afirma que la unión sea igual a la suma. Afirma únicamente que no puede superarla.

6.143. ¿Qué ocurre con tres eventos?

AVANZADO · ●●●○

Para tres eventos comenzamos sumando:

P(A)+P(B)+P(C).

Pero las intersecciones por parejas quedan contadas más de una vez. Debemos restar:

P(A ∩ B),   P(A ∩ C),   P(B ∩ C).

Aparece entonces un nuevo detalle: la región A∩B∩C fue sumada tres veces y luego restada tres veces. Terminó sin contarse.

Debemos agregarla nuevamente una vez.

PARA PROFUNDIZAR · DEMOSTRACIÓN 9 · ●●●●

6.144. Inclusión-exclusión para tres eventos

Primero incluimos los tres eventos:

P(A)+P(B)+P(C).

Restamos una copia de cada intersección por parejas:

−P(A ∩ B)−P(A ∩ C)−P(B ∩ C).

La región común a los tres eventos fue sumada tres veces y restada tres veces. Para que aparezca exactamente una vez debemos recuperarla:

+P(A ∩ B ∩ C).

P(A ∪ B ∪ C) = P(A)+P(B)+P(C) −P(A ∩ B) −P(A ∩ C) −P(B ∩ C) +P(A ∩ B ∩ C)

Figura 6.40
Lógica de inclusión-exclusión para tres eventos
1 · INCLUIR

P(A)+P(B)+P(C)

2 · EXCLUIR EL DOBLE CONTEO

restar las tres intersecciones por parejas

3 · RECUPERAR LA INTERSECCIÓN TRIPLE

sumar P(A ∩ B ∩ C)

Nota. Elaboración propia. La figura muestra la lógica del conteo, no áreas proporcionales a probabilidades.

6.145. Ejemplo 5 · Dos actividades de una población

AVANZADO · ●●●○

En un ejemplo hipotético se selecciona al azar una persona de una población y se consideran:

A = «practica ciclismo»

B = «practica natación».

El modelo asigna:

P(A)=0,40

P(B)=0,35

P(A ∩ B)=0,15.

La probabilidad de que la persona practique al menos una de las dos actividades es:

P(A ∪ B)=0,40+0,35−0,15

P(A ∪ B)=0,60=60 %

Interpretación. Según el modelo hipotético, la probabilidad de seleccionar una persona que practique ciclismo, natación o ambas actividades es 60 %.

Nota. Datos hipotéticos creados exclusivamente con fines didácticos.

6.146. Principales reglas obtenidas hasta ahora

Tabla 6.16
Axiomas y consecuencias fundamentales
No negatividad

P(A) ≥ 0

Evento seguro

P(Ω)=1

Evento imposible

P(∅)=0

Rango

0 ≤ P(A) ≤ 1

Complemento

P(Ac)=1−P(A)

Monotonía

A⊆B ⇒ P(A)≤P(B)

Diferencia si A⊆B

P(B\A)=P(B)−P(A)

Unión general

P(A∪B)=P(A)+P(B)−P(A∩B)

Unión disjunta

A∩B=∅ ⇒ P(A∪B)=P(A)+P(B)

Subaditividad

P(A∪B)≤P(A)+P(B)

6.147. Errores frecuentes

Error 1

Creer que todas las reglas son axiomas.

Muchas propiedades se demuestran a partir de los tres axiomas.

Error 2

Sumar P(A)+P(B) aunque los eventos se superpongan.

Debemos corregir el doble conteo.

Error 3

Confundir incompatibles con complementarios.

Los complementarios, además de no superponerse, deben cubrir todo Ω.

Error 4

Aplicar P(B\A)=P(B)−P(A) sin verificar A⊆B.

Esa forma necesita la relación de inclusión.

Error 5

Olvidar que «al menos uno» incluye la posibilidad de que ocurran ambos.

«Al menos uno» corresponde a una unión.

Error 6

Confundir una probabilidad del modelo con una frecuencia observada.

Modelo y datos son niveles distintos.

Figura 6.41
Secuencia para auditar un problema de probabilidad
1 · EVENTOS

¿qué representan?

2 · RELACIÓN

∪, ∩, ⊆, complemento

3 · REGLA

¿cuál corresponde?

4 · INTERPRETAR

¿qué significa el resultado?

No comenzar por la fórmula: primero hay que comprender la estructura del problema.

Nota. Elaboración propia.

6.148. Práctica de dificultad creciente

FUNDAMENTAL · ●○○○

Si:

P(A)=0,37,

calcula P(Ac).

Ver solución

Aplicamos la regla del complemento:

P(Ac)=1−0,37=0,63.

Por tanto, P(Ac)=63 %.

INTERMEDIO · ●●○○

Supongamos:

P(A)=0,45

P(B)=0,40

P(A∩B)=0,18.

Calcula:

a) P(A∪B);
b) P(ninguno);
c) P(exactamente uno).

Ver solución

a) P(A∪B)=0,45+0,40−0,18=0,67.

b) P(ninguno)=1−0,67=0,33.

c) P(exactamente uno)=0,45+0,40−2(0,18)=0,49.

AVANZADO · ●●●○

Tres eventos tienen:

P(A)=0,50,   P(B)=0,40,   P(C)=0,30

P(A∩B)=0,20,   P(A∩C)=0,15,   P(B∩C)=0,10

P(A∩B∩C)=0,05.

Calcula P(A∪B∪C).

Ver solución

P(A∪B∪C) =0,50+0,40+0,30−0,20−0,15−0,10+0,05.

P(A∪B∪C)=0,80=80 %.

PROFUNDIZACIÓN · ●●●●

Supón que A⊆B y que P(A)=P(B). Demuestra que:

P(B\A)=0.

¿Podemos concluir únicamente a partir de esto que B\A=∅?

Ver orientación

Como A⊆B:

P(B\A)=P(B)−P(A)=0.

Que un evento tenga probabilidad cero no permite, en toda teoría probabilística, concluir automáticamente que sea el conjunto vacío. Esta precisión se comprenderá plenamente cuando estudiemos modelos continuos.

6.149. Actividad · ¿Axioma o consecuencia?

Clasifica cada afirmación como axioma, forma operacional de un axioma o consecuencia demostrada.

A. P(A)≥0.

B. P(Ω)=1.

C. P(∅)=0.

D. P(Ac)=1−P(A).

E. Para dos eventos disjuntos, sus probabilidades se suman.

F. Si A⊆B, entonces P(A)≤P(B).

Ver respuesta

A. Axioma.

B. Axioma.

C. Consecuencia demostrada.

D. Consecuencia demostrada.

E. Forma operacional finita de la aditividad.

F. Consecuencia demostrada.

6.150. Comprueba lo aprendido

1. ¿Qué es un axioma?

2. ¿Qué establece el axioma de no negatividad?

3. ¿Qué significa P(Ω)=1?

4. ¿Qué condición permite sumar directamente P(A)+P(B)?

5. ¿Por qué P(∅)=0 es una consecuencia y no un cuarto axioma?

6. Explica con palabras la regla del complemento.

7. ¿Cómo se obtiene 0≤P(A)≤1?

8. ¿Qué significa A⊆B?

9. ¿Qué implica A⊆B para P(A) y P(B)?

10. ¿Cuándo puede usarse P(B\A)=P(B)−P(A)?

11. Escribe la regla general de la unión.

12. ¿Por qué debemos restar P(A∩B)?

13. ¿Cuál es la diferencia entre incompatibles y complementarios?

14. ¿Qué significa que varios eventos formen una partición?

15. ¿Qué representa «al menos uno»?

16. ¿Cómo se calcula «ninguno» mediante complemento?

17. ¿Qué significa subaditividad?

18. Explica con tus propias palabras la lógica de inclusión-exclusión para tres eventos.

Ver respuestas breves

1. Una afirmación fundamental adoptada como punto de partida de una teoría.

2. P(A)≥0 para todo evento A considerado.

3. Que la probabilidad total del espacio muestral es 1.

4. Que A y B sean disjuntos.

5. Porque se deduce de normalización y aditividad.

6. La probabilidad de que no ocurra A es lo que falta a P(A) para completar 1.

7. La cota inferior viene de no negatividad y la superior de aplicarla al complemento.

8. Todo resultado de A pertenece también a B.

9. P(A)≤P(B).

10. Cuando A⊆B.

11. P(A∪B)=P(A)+P(B)−P(A∩B).

12. Porque la intersección aparece dos veces al sumar P(A)+P(B).

13. Los incompatibles no se superponen; los complementarios además cubren todo Ω.

14. Que son mutuamente excluyentes y conjuntamente exhaustivos.

15. A∪B.

16. P(ninguno)=1−P(A∪B).

17. Que P(A∪B)≤P(A)+P(B).

18. Se suman los eventos individuales, se restan las intersecciones por parejas y se recupera una vez la intersección triple.

6.151. Mapa conceptual

Figura 6.42
Cómo crece la teoría a partir de los axiomas
TRES AXIOMAS
P(∅)=0
complemento
0≤P(A)≤1
monotonía
REGLA GENERAL DE LA UNIÓN

P(A∪B)=P(A)+P(B)−P(A∩B)

particiones
al menos uno / ninguno
inclusión-exclusión

Nota. Elaboración propia.

6.152. Síntesis

La teoría moderna de la probabilidad se organiza a partir de tres axiomas fundamentales:

P(A)≥0

P(Ω)=1

aditividad numerable para eventos disjuntos.

A partir de ellos obtuvimos:

P(∅)=0;

P(Ac)=1−P(A);

0≤P(A)≤1;

si A⊆B, entonces P(A)≤P(B);

si A⊆B, entonces P(B\A)=P(B)−P(A);

para eventos cualesquiera:

P(A∪B)=P(A)+P(B)−P(A∩B);

para eventos disjuntos:

P(A∪B)=P(A)+P(B);

y para tres eventos construimos el principio de inclusión-exclusión.

La lección más importante no consiste en memorizar una colección de fórmulas. Consiste en reconocer la relación entre los eventos, seleccionar la regla apropiada y comprender qué representa el resultado dentro del modelo.

Transferencia al mundo real

En esta parte la misma estructura matemática apareció en contextos distintos: fallas de componentes, clasificación industrial, metrología, temperatura, alarmas, estados de sistemas y actividades de una población.

Los fenómenos son diferentes, pero pueden compartir relaciones matemáticas entre eventos. Esa es precisamente una de las fuerzas de un modelo: permite reconocer una estructura común sin afirmar que realidades diferentes sean idénticas.

6.153. De las reglas de probabilidad al problema de contar

Ya podemos combinar probabilidades de forma coherente cuando conocemos las probabilidades de los eventos involucrados.

Sin embargo, muchos problemas presentan un obstáculo anterior:

¿cuántos resultados posibles existen y cuántos hacen ocurrir el evento?

Cuando el número de resultados crece, escribirlos uno por uno deja de ser práctico. Necesitamos técnicas sistemáticas para contarlos.

Y debemos recordar una condición esencial: contar resultados solo permite convertir directamente ese conteo en probabilidad cuando el modelo justifica que los resultados contados son equiprobables.

Tres axiomas permiten construir una parte sorprendentemente amplia de la teoría elemental de la probabilidad.

Comprender de dónde proviene una regla es más poderoso que memorizarla sin saber por qué funciona.

SIGUIENTE
Parte 6 de 18 · Contar antes de calcular probabilidades
Principios de conteo, factoriales, permutaciones y combinaciones nos permitirán trabajar con espacios muestrales que ya no es práctico enumerar uno por uno.
La numeración continuará en 6.154.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Kolmogorov, A. N. (1950). Foundations of the theory of probability (2nd English ed.). Chelsea Publishing Company.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 6 DE 18
CAPÍTULO 6

Contar antes de calcular probabilidades

Árboles · principios de conteo · factorial · permutaciones · variaciones · combinaciones

Cuando el espacio muestral crece, escribir todos sus resultados deja de ser práctico

Idea central

En un dado podemos escribir seis resultados. En dos dados podemos construir 36 pares ordenados. Pero muchos experimentos producen cientos, miles o millones de posibilidades. En esos casos necesitamos aprender a contar sin enumerar. Las técnicas combinatorias permiten determinar cuántos resultados existen y, cuando el modelo justifica la equiprobabilidad, utilizar después ese conteo para calcular probabilidades.

Al finalizar esta parte podrás:
explicar por qué contar es necesario en muchos problemas de probabilidad;
aplicar el principio de la suma;
aplicar el principio multiplicativo;
interpretar correctamente n! y comprender por qué 0!=1;
distinguir permutaciones, variaciones y combinaciones;
reconocer cuándo el orden cambia el resultado;
analizar qué cambia cuando se permite repetición;
conectar un conteo correcto con la regla clásica de probabilidad.

6.154. Un problema que crece demasiado rápido

Imagina que lanzamos una moneda cinco veces y queremos escribir todas las secuencias posibles.

Algunas serían:

CCCCC
CCCCS
CCCSC
CCCSS
CCSCC
CCSCS

y todavía faltarían muchas.

En realidad hay:

2⁵=32 secuencias

Con diez lanzamientos habría:

2¹⁰=1.024.

Con veinte:

2²⁰=1.048.576.

Necesitamos contar sin tener que escribir cada resultado.

6.155. Contar no es todavía calcular una probabilidad

Si descubrimos que existen 120 resultados posibles, hemos resuelto un problema de conteo.

Para utilizar después:

P(A)=|A|/|Ω|,

todavía debemos comprobar que los resultados elementales que contamos son equiprobables dentro del modelo.

Conteo correcto + equiprobabilidad justificada permite utilizar la regla clásica. El conteo por sí solo no garantiza esa condición.

Figura 6.43
Contar es un paso anterior al cálculo de probabilidades
DEFINIR LOS RESULTADOS
CONTAR |Ω| Y |A|
¿LOS RESULTADOS ELEMENTALES SON EQUIPROBABLES?
SI LA RESPUESTA ES SÍ: P(A)=|A|/|Ω|

Nota. Elaboración propia.

6.156. Principio de la suma · alternativas que no se superponen

Supongamos que para llegar a un lugar podemos escoger 3 rutas en autobús o 2 rutas en metro.

Si estamos contando una sola ruta y las cinco rutas son diferentes:

3+2=5 formas

Principio de la suma: cuando las posibilidades se dividen en alternativas que no se superponen, el número total se obtiene sumando las cantidades de cada alternativa.

6.157. Principio multiplicativo · decisiones por etapas

Supongamos que podemos escoger 3 camisas y después 2 pantalones. Cada camisa puede combinarse con cada pantalón.

3×2=6 conjuntos diferentes
Figura 6.44
Un árbol permite ver por qué 3 opciones seguidas de 2 opciones producen 6 caminos
3 camisas
cada camisa permite 2 pantalones
3×2=6 caminos

Nota. Elaboración propia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 10 · ●●●●

6.158. ¿Por qué funciona el principio multiplicativo?

Si la primera etapa tiene m posibilidades y para cada una de ellas existen n posibilidades en la segunda:

n+n+···+n

con m sumandos.

m×n.

Multiplicar caminos es una operación de conteo. No significa multiplicar automáticamente probabilidades.

6.159. Más de dos etapas

Si existen n₁, n₂, …, nₖ posibilidades en etapas sucesivas:

n₁×n₂×···×nₖ

6.160. Ejemplo 1 · Un código de tres dígitos

FUNDAMENTAL · ●○○○

Utilizamos los dígitos 0, 1, 2, …, 9. Los dígitos pueden repetirse y 000 es válido.

10 opciones × 10 opciones × 10 opciones

10³=1.000 códigos

6.161. Factorial

Para escribir productos de enteros positivos consecutivos utilizamos el factorial:

n!=n(n−1)(n−2)···3·2·1
3!
6
4!
24
5!
120
6!
720

6.162. ¿Por qué 0!=1?

La expresión 0!=1 puede parecer extraña, pero es coherente algebraica y combinatoriamente.

PARA PROFUNDIZAR · DEMOSTRACIÓN 11 · ●●●●

Como:

1!=1·0!

y 1!=1:

0!=1.

Además, existe exactamente una manera de ordenar cero objetos: la disposición vacía.

6.163. Permutaciones · usamos todos los objetos y el orden importa

Tenemos tres libros distintos: A, B y C.

3×2×1=3!=6.

ABC
ACB
BAC
BCA
CAB
CBA

6.164. Número de permutaciones de n objetos distintos

número de permutaciones=n!

Algunos textos escriben Pn=n!. Aquí evitaremos esa notación principal para no confundirla con P(A).

6.165. Ejemplo 2 · Ordenar cinco fotografías

Utilizamos las cinco fotografías y el orden importa:

5!=120

6.166. Variaciones sin repetición · escogemos algunos y el orden importa

Ocho participantes compiten por:

oro · plata · bronce.

El orden cambia el resultado.

8×7×6=336.

V(n,r)=n!/(n−r)!

donde n y r son enteros no negativos y 0≤r≤n.

PARA PROFUNDIZAR · DEMOSTRACIÓN 12 · ●●●●

6.167. Derivación de V(n,r)

V(n,r)=n(n−1)(n−2)···(n−r+1).

V(n,r)=n!/(n−r)!.

6.168. La pregunta decisiva: ¿importa el orden?

¿Cambiar el orden produce un resultado diferente?
Figura 6.45
La misma selección puede representar resultados distintos o el mismo resultado
EL ORDEN SÍ IMPORTA

Ana · Luis · Carlos

oro · plata · bronce

Carlos · Luis · Ana

EL ORDEN NO IMPORTA

{Ana, Luis, Carlos}

comité

=

{Carlos, Ana, Luis}

Nota. Elaboración propia.

6.169. Combinaciones · escogemos algunos y el orden no importa

Una combinación es una selección de r objetos entre n cuando cambiar el orden no produce una selección nueva.

C(n,r)=n!/[r!(n−r)!]

donde 0≤r≤n.

PARA PROFUNDIZAR · DEMOSTRACIÓN 13 · ●●●●

6.170. ¿Por qué dividimos entre r!?

Si el orden no importa, cada grupo de r elementos aparece r! veces en el conteo ordenado.

C(n,r)=n!/[r!(n−r)!].

6.171. Ejemplo 3 · Escoger 3 estudiantes entre 10

Como no existen cargos, cambiar el orden de los nombres no crea un nuevo grupo.

C(10,3)=(10×9×8)/(3×2×1).

C(10,3)=120

6.172. Una identidad importante de las combinaciones

Escoger r elementos determina automáticamente cuáles n−r quedan por fuera.

C(n,r)=C(n,n−r)
PARA PROFUNDIZAR · DEMOSTRACIÓN 14 · ●●●●

6.173. Demostración de C(n,r)=C(n,n−r)

C(n,n−r)=n!/[(n−r)!r!].

C(n,n−r)=C(n,r).

6.174. Guía rápida de las herramientas estudiadas hasta aquí

Tabla 6.17
Situaciones básicas de conteo estudiadas
Alternativas exclusivas

Sumar.

Varias etapas

n₁n₂···nₖ.

Usamos todos + orden

n!.

Algunos + orden + sin repetición

V(n,r).

Algunos + sin orden + sin repetición

C(n,r).

6.175. Con repetición y sin repetición

¿un objeto elegido puede volver a utilizarse?
CON REPETICIÓN

La misma opción puede volver a estar disponible.

SIN REPETICIÓN

Un elemento utilizado deja de estar disponible.

Figura 6.46
Árbol de decisión básico para escoger una técnica de conteo
¿QUÉ CONSTITUYE UN RESULTADO DIFERENTE?
¿SE PERMITE REPETICIÓN?
¿IMPORTA EL ORDEN?

Nota. Elaboración propia.

6.176. Si se permite repetición y el orden importa

Si tenemos n símbolos y construimos una secuencia de r posiciones, pudiendo reutilizar cualquiera de los n símbolos en cada posición:

Aplicación tecnológica · cadenas digitales

Con dos símbolos, 0 y 1, podemos construir cadenas de ocho posiciones:

2⁸=256.

El conteo indica cuántas cadenas distintas pueden construirse; no afirma que todas aparezcan con la misma frecuencia en un sistema real.

6.177. Volvamos a la moneda: n lanzamientos

En cada lanzamiento existen dos resultados: C o S.

|Ω|=2ⁿ
Tabla 6.18
Crecimiento del número de secuencias al lanzar una moneda
1
2
2
4
3
8
5
32
10
1.024
20
1.048.576
Figura 6.47
Cada lanzamiento duplica el número de secuencias posibles
2 → 4 → 8 → 16 → 32

Cada nueva etapa multiplica por 2 el número de secuencias.

Nota. Elaboración propia.

6.178. Ejemplo 4 · Exactamente dos caras en cinco lanzamientos

AVANZADO · ●●●○

Debemos escoger qué dos de las cinco posiciones contienen caras.

C(5,2)=10.

Figura 6.48
«Exactamente dos caras» equivale a escoger dos posiciones entre cinco
C
S
S
C
S

escoger 2 posiciones entre 5 → C(5,2)=10

Nota. Elaboración propia.

6.179. Ahora sí: del conteo a la probabilidad

|Ω|=2⁵=32

|A|=C(5,2)=10.

Si la moneda se modela como equilibrada, las 32 secuencias son equiprobables.

P(A)=10/32=0,3125=31,25 %

Interpretación. Bajo el modelo de moneda equilibrada, la probabilidad de obtener exactamente dos caras en cinco lanzamientos es 31,25 %.

Figura 6.49
Del conteo de resultados a la probabilidad
TODOS

|Ω|=32

FAVORABLES

|A|=10

P(A)=10/32=31,25 %

Nota. Elaboración propia.

6.180. El mismo conjunto de objetos puede exigir fórmulas diferentes

Tabla 6.19
La pregunta determina qué estamos contando
Ordenar 10 personas

Usamos todos.

El orden importa.

10!

Presidente, secretario y tesorero

Escogemos 3.

El orden importa.

V(10,3)

Comité de tres

Escogemos 3.

El orden no importa.

C(10,3)

6.181. Ejemplo 5 · Podio o comité

De ocho personas escogemos tres.

Podio: V(8,3)=336

Comité: C(8,3)=56.

La diferencia aparece porque en el podio los puestos distinguen resultados; en un comité sin cargos, no.

6.182. Un razonamiento eficiente con factoriales

No siempre conviene desarrollar factoriales completos:

C(20,2)=20!/[2!18!]

=(20×19)/(2×1)

C(20,2)=190

6.183. Cinco preguntas antes de utilizar una fórmula

No preguntes primero «¿qué fórmula uso?». Pregunta primero «¿qué constituye un resultado diferente?».
1.
¿Qué estoy contando?
2.
¿Hay etapas o alternativas?
3.
¿Se permite repetición?
4.
¿Importa el orden?
5.
¿Cuento todos los resultados o los favorables?
Figura 6.50
Ruta para resolver un problema de conteo dentro de probabilidad
DEFINIR EL RESULTADO
IDENTIFICAR ETAPAS, REPETICIÓN Y ORDEN
CONTAR |Ω| Y |A|
VERIFICAR EQUIPROBABILIDAD

Nota. Elaboración propia.

6.184. Después del cálculo manual: hoja de cálculo

Una hoja de cálculo puede facilitar operaciones grandes, pero primero debemos identificar correctamente el tipo de conteo.

=FACT(8)

6.185. Errores frecuentes

Error 1

Elegir una fórmula antes de analizar la estructura.

Error 2

Confundir podio con comité.

Error 3

Olvidar si puede repetirse un elemento.

Error 4

Confundir multiplicar caminos con multiplicar probabilidades.

Error 5

Desarrollar factoriales enormes antes de simplificar.

Error 6

Usar |A|/|Ω| sin justificar equiprobabilidad.

6.186. Práctica de dificultad creciente

FUNDAMENTAL · ●○○○

Un restaurante ofrece 4 platos y 3 bebidas. ¿Cuántos menús formados por un plato y una bebida pueden construirse?

Ver solución

4×3=12.

INTERMEDIO · ●●○○

De siete estudiantes se escogerán presidente, vicepresidente y secretario.

Ver solución

V(7,3)=7×6×5=210.

AVANZADO · ●●●○

Se lanzan seis veces una moneda equilibrada. Calcula la probabilidad de obtener exactamente tres caras.

Ver solución

|Ω|=2⁶=64. |A|=C(6,3)=20. P(A)=20/64=0,3125=31,25 %.

PROFUNDIZACIÓN · ●●●●

Justifica sin utilizar factoriales por qué:

C(n,r)=C(n,n−r).

Ver orientación

Escoger r objetos determina exactamente cuáles n−r quedan fuera.

6.187. Reto de clasificación · ¿qué herramienta usarías?

A. Ordenar 6 libros distintos.

B. Escoger 4 personas entre 12 para formar un equipo.

C. Escoger oro, plata y bronce entre 10 atletas.

D. Crear una secuencia de cuatro dígitos permitiendo repetición.

E. Escoger una camisa entre 5 y un pantalón entre 4.

F. Contar secuencias de ocho lanzamientos de una moneda.

Ver orientación

A. 6!.

B. C(12,4).

C. V(10,3).

D. 10⁴.

E. 5×4.

F. 2⁸.

6.188. Comprueba lo aprendido

1. ¿Qué afirma el principio de la suma?

2. ¿Qué afirma el principio multiplicativo?

3. ¿Por qué contar caminos no es multiplicar probabilidades?

4. ¿Qué significa n!?

5. ¿Por qué 0!=1?

6. ¿Cuándo utilizamos V(n,r)?

7. ¿Cuándo utilizamos C(n,r)?

8. ¿Cuál es la pregunta principal para distinguir variaciones de combinaciones?

9. ¿Cuántas secuencias existen al lanzar una moneda n veces?

10. ¿Por qué contar correctamente no garantiza que podamos utilizar P(A)=|A|/|Ω|?

6.189. Mapa conceptual

Figura 6.51
El mapa general del conteo desarrollado en esta parte
PROBLEMA DE CONTEO
¿QUÉ CUENTA COMO RESULTADO DIFERENTE?
¿SE USAN TODOS? · ¿IMPORTA EL ORDEN? · ¿HAY REPETICIÓN?
OBTENER |Ω| Y |A|
SI HAY EQUIPROBABILIDAD: P(A)=|A|/|Ω|

Nota. Elaboración propia.

6.190. Síntesis

En esta parte aprendimos que contar es fundamental cuando el espacio muestral contiene demasiados resultados para enumerarlos uno por uno.

El principio de la suma se utiliza para alternativas que no se superponen.

El principio multiplicativo se utiliza en procesos formados por varias etapas.

n₁n₂···nₖ.

Cuando existen n opciones en cada una de r posiciones y se permite repetir:

nʳ.

Para ordenar todos los n objetos distintos:

n!.

Para escoger r entre n, sin repetición y cuando el orden importa:

V(n,r)=n!/(n−r)!.

Cuando el orden no importa:

C(n,r)=n!/[r!(n−r)!].

Y, sobre todo, contar correctamente no basta para convertir un cociente de casos favorables y casos posibles en probabilidad: también debemos justificar la equiprobabilidad.

Resumen visual final · De las preguntas a la técnica de conteo

Hemos estudiado las ideas por separado. Ahora podemos reunirlas en un único recorrido de decisión.

Ante un nuevo problema, no conviene comenzar buscando una fórmula. Primero debemos determinar:

¿Se usan todos los elementos?
¿Importa el orden?
¿Se permite repetición?

La siguiente infografía reúne estas preguntas y funciona como recurso permanente de referencia. Puedes regresar a ella cada vez que necesites decidir qué técnica de conteo corresponde.

Figura 6.52
Esquema de decisión para técnicas de conteo
Esquema de decisión para técnicas de conteo: permutaciones, variaciones y combinaciones con repetición y sin repetición

Nota. Elaboración propia. Recurso de referencia para identificar la estructura de un problema antes de elegir una técnica de conteo.

Cómo leer la infografía

Comienza siempre en la parte superior y sigue las preguntas en orden. No saltes directamente a las fórmulas.

La infografía incorpora también dos extensiones que permiten completar el mapa: permutaciones con elementos repetidos y combinaciones con repetición.

No es necesario dominar todavía esas dos expresiones. Su presencia permite que la imagen funcione como recurso de referencia más allá de los ejemplos básicos de esta parte.

Contar bien no consiste en recordar muchas fórmulas.

Consiste en comprender la estructura del problema antes de calcular.

SIGUIENTE
Parte 7 de 18 · Probabilidad condicional
Estudiaremos cómo cambia una probabilidad cuando disponemos de información adicional que restringe los resultados que seguimos considerando posibles.
La numeración continuará en 6.191.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Graham, R. L., Knuth, D. E., & Patashnik, O. (1994). Concrete mathematics: A foundation for computer science (2nd ed.). Addison-Wesley.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 7 DE 18
CAPÍTULO 6

Probabilidad condicional

¿Cómo cambia una probabilidad cuando recibimos nueva información?

La condición no cambia lo que ocurrió: cambia las posibilidades compatibles con lo que sabemos

Idea central

Una probabilidad puede cambiar cuando disponemos de información adicional. Si sabemos que ocurrió un evento B, el espacio muestral original continúa siendo Ω, pero para responder la nueva pregunta solamente consideramos los resultados compatibles con B. Por eso B funciona como un nuevo universo de referencia. La probabilidad condicional formaliza exactamente esta idea.

Al finalizar esta parte podrás:
explicar cómo nueva información puede modificar una probabilidad;
interpretar B como universo de referencia condicionado;
leer correctamente P(A|B);
calcular probabilidades condicionales mediante conteo;
utilizar P(A|B)=P(A∩B)/P(B);
distinguir P(A|B), P(B|A) y P(A∩B);
interpretar probabilidades condicionales en tablas y datos;
reconocer cuándo una asociación probabilística no implica causalidad.

6.191. Una información nueva cambia la pregunta

Lanzamos un dado equilibrado.

Antes de conocer el resultado:

Ω={1,2,3,4,5,6}.

Definimos:

A = «obtener un número mayor que 3».

Entonces:

A={4,5,6}.

Sin información adicional:

P(A)=3/6=1/2=0,50=50 %

Ahora recibimos una información:

«El número obtenido fue par».

Esa información elimina de nuestra consideración los resultados incompatibles con ella.

6.192. El universo de referencia condicionado

Sea:

B = «obtener un número par».

B={2,4,6}.

Como sabemos que B ocurrió, 1, 3 y 5 ya no son compatibles con la información disponible.

Para esta nueva pregunta, B funciona como universo de referencia.

Precisión conceptual. El espacio muestral original no desaparece: sigue siendo Ω. Lo que cambia es el conjunto de resultados relevantes para responder la pregunta bajo la información B.

Figura 6.53
Condicionar significa enfocar la atención en los resultados compatibles con la información conocida
ESPACIO ORIGINAL Ω={1,2,3,4,5,6}
1
2
3
4
5
6
SABEMOS QUE B OCURRIÓ

B={2,4,6}

DENTRO DE B, LOS RESULTADOS QUE TAMBIÉN PERTENECEN A A SON {4,6}

Nota. Elaboración propia. El azul identifica resultados compatibles con B; el verde destaca los que además pertenecen a A.

6.193. La notación P(A|B)

La probabilidad de que ocurra A sabiendo que ocurrió B se representa mediante:

P(A|B)

«probabilidad de A dado B»

o

«probabilidad de A sabiendo que B ocurrió».

La barra vertical | no significa división. Separa el evento cuya probabilidad buscamos de la información que suponemos conocida.

6.194. Probabilidad condicional mediante conteo

En un espacio finito equiprobable, cuando sabemos que B ocurrió, los casos posibles dejan de ser todos los elementos de Ω.

Los casos posibles para la nueva pregunta son los elementos de B.

Entre ellos, los favorables a A son:

A∩B.

P(A|B)=|A∩B|/|B|
Figura 6.54
La condición cambia el denominador
SIN CONDICIÓN

P(A)=|A|/|Ω|

El denominador representa todo Ω.

DADO B

P(A|B)=|A∩B|/|B|

El denominador representa el universo condicionado B.

Nota. Elaboración propia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 15 · ●●●●

6.195. Del conteo equiprobable a la fórmula general

En un espacio finito equiprobable:

P(A|B)=|A∩B|/|B|.

Multiplicamos numerador y denominador por 1/|Ω|:

P(A|B) = [|A∩B|/|Ω|] / [|B|/|Ω|].

Pero:

|A∩B|/|Ω|=P(A∩B)

y:

|B|/|Ω|=P(B).

Por tanto:

P(A|B)=P(A∩B)/P(B).

siempre que P(B)>0.

6.196. Definición general de probabilidad condicional

Para un evento B con:

P(B)>0,

definimos:

P(A|B)=P(A∩B)/P(B)
Numerador · P(A∩B)

Probabilidad de que A y B ocurran conjuntamente.

Denominador · P(B)

Probabilidad del evento que estamos suponiendo conocido.

Dividir entre P(B) reajusta la escala de probabilidades dentro del universo condicionado B.

6.197. ¿Por qué necesitamos P(B)>0?

La fórmula contiene una división entre P(B).

Si:

P(B)=0,

la expresión:

P(A∩B)/P(B)

exigiría dividir entre cero.

En el nivel desarrollado en esta parte trabajaremos únicamente con condiciones B para las que P(B)>0.

6.198. Ejemplo 1 · Mayor que 3 sabiendo que es par

FUNDAMENTAL · ●○○○

Recordemos:

A={4,5,6}

B={2,4,6}.

Entonces:

A∩B={4,6}.

Dentro de B existen tres resultados posibles y dos son favorables a A.

P(A|B)=2/3

≈0,6667≈66,67 %

Antes de conocer B:

P(A)=50 %.

Después de conocer B:

P(A|B)≈66,67 %.

Interpretación. La información «el resultado es par» aumenta la probabilidad de que el número sea mayor que 3 dentro de este modelo.

6.199. La información no cambia lo que ocurrió

Si el dado ya fue lanzado, existe un resultado particular.

Saber después que ese resultado fue par no modifica físicamente el resultado producido.

Lo que cambia es nuestra información y, con ella, el conjunto de resultados que siguen siendo compatibles con lo que sabemos.

Un ensayo concreto produce un resultado particular. La probabilidad pertenece al modelo previo al resultado; el resultado observado pertenece a los datos. Cuando recibimos información adicional, actualizamos la pregunta probabilística, no el acontecimiento físico que ya ocurrió.

6.200. Condicionar no significa «ocurrió antes»

Los ejemplos de extracciones sucesivas pueden dar una impresión equivocada: que el evento escrito después de la barra siempre ocurrió primero en el tiempo.

No es así.

En P(A|B), la expresión «dado B» significa «bajo la información de que B es verdadero», no necesariamente «después de que B ocurrió».

Por ejemplo, una carta puede ser simultáneamente:

corazón

y

figura.

Preguntar P(figura | corazón) no significa que primero la carta «se volvió corazón» y después «se volvió figura». Estamos simplemente restringiendo nuestra atención a las cartas de corazones.

Figura 6.55
La barra vertical expresa información, no necesariamente orden temporal
INTERPRETACIÓN CORRECTA

P(A|B)

probabilidad de A bajo la información B

INTERPRETACIÓN INCORRECTA

B → A

pensar que B necesariamente ocurrió antes que A

Nota. Elaboración propia.

6.201. P(A|B) y P(B|A) preguntan cosas diferentes

Intercambiar A y B cambia cuál evento funciona como condición.

P(A|B)

probabilidad de A sabiendo que B

P(B|A)

probabilidad de B sabiendo que A

En general, P(A|B)≠P(B|A)

6.202. Ejemplo 2 · Figuras y corazones de una baraja

INTERMEDIO · ●●○○

Consideremos una baraja estándar de 52 cartas.

Hay 12 figuras:

J, Q y K de los cuatro palos.

Tres de esas figuras son corazones.

P(corazón | figura)=3/12=1/4=25 %

Ahora invertimos la condición.

Existen 13 corazones y tres son figuras.

P(figura | corazón)=3/13≈23,08 %
Figura 6.56
Invertir la condición cambia el universo de referencia
P(corazón | figura)

universo condicionado

12 figuras

3 son corazones

3/12

P(figura | corazón)

universo condicionado

13 corazones

3 son figuras

3/13

Nota. Elaboración propia.

6.203. Probabilidad condicional en una tabla de contingencia

Consideremos datos hipotéticos de 100 estudiantes.

Registramos si realizaron una actividad de preparación y si aprobaron una prueba.

Tabla 6.20
Preparación y resultado de una prueba
Con preparación

Aprobaron: 42

No aprobaron: 18

Total: 60

Sin preparación

Aprobaron: 20

No aprobaron: 20

Total: 40

Totales

Aprobaron: 62

No aprobaron: 38

Total general: 100

Nota. Datos hipotéticos creados exclusivamente con fines didácticos.

6.204. La condición indica el denominador

Preguntemos:

¿Cuál es la probabilidad de que un estudiante haya realizado preparación, sabiendo que aprobó?

La condición es:

«aprobó».

Por tanto, el nuevo universo contiene solamente los:

62 estudiantes que aprobaron.

De esos 62, 42 realizaron preparación.

P(preparación | aprobó)=42/62

≈0,6774≈67,74 %

Figura 6.57
Una estrategia para localizar el denominador condicionado
P(preparación | aprobó)
MIRA LO QUE ESTÁ DESPUÉS DE |

aprobó

NUEVO TOTAL = 62
42 DE ESOS 62 REALIZARON PREPARACIÓN

Nota. Elaboración propia con datos hipotéticos de la Tabla 6.20.

6.205. La condición inversa produce otra pregunta

Ahora buscamos:

P(aprobó | preparación).

La condición es «realizó preparación».

Nuestro universo condicionado tiene:

60 estudiantes.

De ellos aprobaron 42.

P(aprobó | preparación)=42/60

=0,70=70 %

Comparemos:

P(preparación | aprobó)≈67,74 %

P(aprobó | preparación)=70 %.

Las cifras son cercanas en este ejemplo, pero representan preguntas completamente diferentes.

6.206. Asociación probabilística no significa causalidad

En los datos anteriores existe una diferencia entre probabilidades condicionadas.

Sin embargo, una tabla como esta no demuestra que realizar la preparación haya causado la aprobación.

Una probabilidad condicional puede describir asociación. Establecer causalidad exige información adicional sobre el diseño del estudio, posibles variables de confusión y otras explicaciones.

Una diferencia entre P(A|B) y P(A|Bc) puede ser informativa, pero por sí sola no identifica la causa de esa diferencia.

6.207. Experimentos sin reemplazo: la información cambia el siguiente estado

La probabilidad condicional aparece de manera natural en experimentos desarrollados por etapas.

Consideremos una urna con:

5 bolas rojas y 3 bolas azules.

Extraemos una bola y no la devolvemos. Después realizamos una segunda extracción.

Antes de comenzar:

P(primera roja)=5/8.

6.208. Ejemplo 3 · ¿Qué ocurre después de la primera extracción?

INTERMEDIO · ●●○○

Si sabemos que la primera bola fue roja, quedan:

4 rojas + 3 azules = 7 bolas.

P(segunda roja | primera roja)=4/7

En cambio, si sabemos que la primera bola fue azul, quedan:

5 rojas + 2 azules = 7 bolas.

P(segunda roja | primera azul)=5/7

La primera extracción modifica la composición de la urna. Por eso la información sobre el primer resultado modifica la probabilidad correspondiente a la segunda extracción.

Figura 6.58
Sin reemplazo, resultados diferentes en la primera etapa producen universos condicionados diferentes
INICIO · 5 rojas + 3 azules
PRIMERA ROJA
quedan 4 rojas + 3 azules
P(R₂|R₁)=4/7
PRIMERA AZUL
quedan 5 rojas + 2 azules
P(R₂|A₁)=5/7

Nota. Elaboración propia.

6.209. El complemento dentro de una condición

Una vez sabemos que B ocurrió, dentro de B solamente tenemos dos posibilidades respecto de A:

A ocurre

o

A no ocurre.

P(Ac|B)=1−P(A|B)

La regla del complemento continúa funcionando, pero ahora dentro del universo condicionado B.

6.210. Una probabilidad condicional sigue siendo una probabilidad

PARA PROFUNDIZAR · ●●●●

Si fijamos un evento B con P(B)>0, la asignación:

A → P(A|B)

conserva las propiedades fundamentales de una probabilidad.

P(A|B)≥0
P(B|B)=1
P(∅|B)=0

Conceptualmente, podemos pensar que estamos construyendo una nueva perspectiva probabilística cuyo universo relevante es B.

6.211. Una identidad que abre la siguiente puerta

Partimos de:

P(A|B)=P(A∩B)/P(B).

Si P(B)>0, multiplicamos ambos lados por P(B):

P(A∩B)=P(B)P(A|B)

También:

P(A∩B)=P(A)P(B|A)

No desarrollaremos todavía esta identidad como regla de cálculo. En la Parte 8 veremos por qué se convierte en la regla de multiplicación y qué ocurre cuando conocer A no modifica la probabilidad de B.

6.212. «Dado B» no significa «A y B»

Estas expresiones están relacionadas, pero no representan lo mismo.

Tabla 6.21
Cuatro expresiones que conviene distinguir
P(A)

probabilidad de A sin condición adicional

P(A∩B)

probabilidad de que A y B ocurran conjuntamente

P(A|B)

probabilidad de A bajo la información B

P(B|A)

probabilidad de B bajo la información A

6.213. Aplicación · Monitoreo de temperatura y vibración

AVANZADO · ●●●○

Supongamos que un sistema industrial registra 500 intervalos de funcionamiento.

En 80 intervalos:

la temperatura superó 80 °C.

De esos 80 intervalos, en 18 también se registró una alarma de vibración.

Si definimos:

T = «temperatura superior a 80 °C»

V = «alarma de vibración»,

entonces:

P(V|T)=18/80=0,225=22,5 %

Interpretación. Entre los intervalos con temperatura superior a 80 °C, el 22,5 % presentó también alarma de vibración.

Este resultado no demuestra que la temperatura alta cause la vibración. Describe una asociación en los datos hipotéticos.

Nota. Datos hipotéticos creados exclusivamente con fines didácticos.

6.214. Actividad guiada · Leer antes de calcular

Una población hipotética de 120 personas se clasifica así:

72 utilizan transporte público.

De esas 72, 45 llegan antes de las 8:00.

Entre las 48 que no utilizan transporte público, 36 llegan antes de las 8:00.

1. ¿Cuál es P(llegar antes de las 8 | transporte público)?

2. ¿Cuál es P(llegar antes de las 8 | no transporte público)?

3. ¿Qué denominador corresponde en cada caso?

4. ¿Estos resultados demuestran que el medio de transporte causa la diferencia observada?

Ver solución

1. 45/72=0,625=62,5 %.

2. 36/48=0,75=75 %.

3. Los denominadores son 72 y 48 porque cada condición define su propio universo de referencia.

4. No. Los resultados describen una asociación, no prueban causalidad.

Nota. Datos hipotéticos creados exclusivamente con fines didácticos.

6.215. Errores frecuentes

Error 1

Usar todo Ω como denominador después de conocer B.

La condición B define el universo relevante para esa pregunta.

Error 2

Confundir P(A|B) con P(B|A).

Invertir la condición cambia la pregunta y el denominador.

Error 3

Confundir P(A|B) con P(A∩B).

Una es condicional; la otra es una probabilidad conjunta.

Error 4

Pensar que la barra vertical indica orden temporal.

Indica información condicionante.

Error 5

Ignorar si existe reemplazo.

Sin reemplazo, el estado del experimento puede cambiar.

Error 6

Interpretar una asociación condicional como prueba causal.

Asociación y causalidad son conceptos diferentes.

6.216. Práctica de dificultad creciente

FUNDAMENTAL · ●○○○

En un dado equilibrado:

A = «obtener 6»

B = «obtener un número par».

Calcula P(A|B).

Ver solución

B={2,4,6}.

A∩B={6}.

P(A|B)=1/3≈33,33 %.

INTERMEDIO · ●●○○

Se sabe que:

P(B)=0,40

P(A∩B)=0,18.

Calcula P(A|B).

Ver solución

P(A|B)=P(A∩B)/P(B).

P(A|B)=0,18/0,40=0,45=45 %.

AVANZADO · ●●●○

Una urna contiene 6 bolas blancas y 4 negras.

Se extrae una bola sin reemplazo. Sabemos que la primera fue blanca.

¿Cuál es la probabilidad de que la segunda sea blanca?

Ver solución

Después de retirar una blanca quedan 5 blancas y 4 negras: 9 bolas en total.

P(segunda blanca | primera blanca)=5/9≈55,56 %.

PARA PROFUNDIZAR · ●●●●

Para un evento B con P(B)>0, explica por qué:

P(B|B)=1.

Ver orientación

P(B|B)=P(B∩B)/P(B).

Como B∩B=B:

P(B|B)=P(B)/P(B)=1.

6.217. Comprueba lo aprendido

1. ¿Qué significa condicionar a un evento B?

2. ¿Cómo se lee P(A|B)?

3. ¿Qué representa la barra vertical?

4. En un espacio finito equiprobable, ¿cómo se calcula P(A|B)?

5. Escribe la definición general de P(A|B).

6. ¿Qué condición debe cumplir P(B)?

7. ¿Por qué P(A|B) y P(B|A) pueden ser diferentes?

8. ¿Qué significa P(A∩B)?

9. Explica la diferencia entre P(A|B) y P(A∩B).

10. ¿Condicionar significa necesariamente que B ocurrió antes que A?

11. ¿Cómo se calcula P(Ac|B)?

12. ¿Por qué un experimento sin reemplazo suele producir probabilidades condicionales diferentes?

13. ¿Una asociación observada mediante probabilidades condicionales demuestra causalidad?

14. ¿Qué significa que B funcione como nuevo universo de referencia?

15. ¿Qué identidad se obtiene al despejar P(A∩B) de la definición de P(A|B)?

Ver respuestas breves

1. Trabajar bajo la información de que B ocurrió.

2. Probabilidad de A dado B.

3. Separa el evento buscado de la condición conocida.

4. |A∩B|/|B|.

5. P(A|B)=P(A∩B)/P(B).

6. P(B)>0.

7. Porque utilizan universos condicionados diferentes.

8. Probabilidad de que A y B ocurran conjuntamente.

9. Una es condicional y la otra es una probabilidad de intersección.

10. No. La condición expresa información, no necesariamente orden temporal.

11. 1−P(A|B).

12. Porque retirar un elemento cambia las posibilidades restantes.

13. No. La asociación no constituye por sí sola una demostración causal.

14. Que solamente los resultados compatibles con B se consideran para la nueva pregunta.

15. P(A∩B)=P(B)P(A|B).

6.218. Mapa conceptual

Figura 6.59
Cómo pensar una probabilidad condicional
ESPACIO ORIGINAL Ω
RECIBIMOS LA INFORMACIÓN: B
B FUNCIONA COMO NUEVO UNIVERSO DE REFERENCIA
FAVORABLES DENTRO DE B

A∩B

P(A|B)=P(A∩B)/P(B)
INTERPRETAR EL RESULTADO EN EL CONTEXTO DE LA CONDICIÓN

Nota. Elaboración propia.

6.219. Síntesis

La probabilidad condicional incorpora información conocida.

Cuando sabemos que B ocurrió, el espacio original continúa siendo Ω, pero B funciona como nuevo universo de referencia para la pregunta condicionada.

La notación:

P(A|B)

significa «probabilidad de A dado B».

En un espacio finito equiprobable:

P(A|B)=|A∩B|/|B|.

En general, para P(B)>0:

P(A|B)=P(A∩B)/P(B).

Invertir la condición cambia la pregunta:

P(A|B)≠P(B|A)

en general.

Una condición tampoco representa necesariamente una secuencia temporal. Expresa la información bajo la cual evaluamos la probabilidad.

En experimentos sin reemplazo, las posibilidades posteriores pueden cambiar porque cambia el estado del sistema.

Dentro de una condición sigue funcionando la regla del complemento:

P(Ac|B)=1−P(A|B).

Además, de la definición se obtiene:

P(A∩B)=P(B)P(A|B).

Finalmente, una asociación observada mediante probabilidades condicionales no demuestra por sí sola una relación causal.

6.220. Una pregunta nueva aparece

Hemos visto situaciones en las que conocer A modifica la probabilidad de B.

Es decir, puede suceder que:

P(B|A)≠P(B).

Pero aparece ahora una posibilidad especialmente importante:

¿Qué significa que P(B|A)=P(B)?

Es decir:

¿qué ocurre cuando conocer A no cambia nuestra probabilidad de B?

Esa relación recibe un nombre fundamental:

independencia.

Y será precisamente el punto de partida de la siguiente parte.

Condicionar no cambia el acontecimiento.

Cambia la información desde la cual construimos la pregunta probabilística.

SIGUIENTE
Parte 8 de 18 · Independencia y regla de multiplicación
Estudiaremos qué significa que conocer un evento no modifique la probabilidad del otro y cómo la probabilidad condicional conduce naturalmente a la regla de multiplicación.
La numeración continuará en 6.221.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 8 DE 18
CAPÍTULO 6

Independencia y regla de multiplicación

¿Cuándo conocer un evento cambia la probabilidad de otro?

De la probabilidad condicional a una de las relaciones más importantes de la teoría de probabilidad

Idea central

La probabilidad condicional nos permite describir cómo cambia una probabilidad cuando conocemos información adicional. Esa misma idea conduce a la regla de multiplicación. Además, existe una situación especial: conocer que ocurrió A puede no modificar en absoluto la probabilidad de B. Cuando esto sucede, decimos que los eventos son independientes. La independencia no debe suponerse por comodidad: es una propiedad del modelo que debe justificarse.

Al finalizar esta parte podrás:
derivar la regla de multiplicación a partir de la probabilidad condicional;
calcular probabilidades de intersecciones mediante probabilidades condicionales;
explicar qué significa que dos eventos sean independientes;
distinguir independencia e incompatibilidad;
reconocer cuándo no es válido multiplicar probabilidades marginales;
utilizar la regla de la cadena en varias etapas;
interpretar independencia en contextos científicos y tecnológicos;
diferenciar evidencia empírica de independencia y una hipótesis de independencia del modelo.

6.221. Volvamos a una identidad de la Parte 7

En la parte anterior definimos, para P(A)>0:

P(B|A)=P(A∩B)/P(A).

Ahora multiplicamos ambos lados por P(A):

P(A∩B)=P(A)P(B|A)

Si comenzamos en cambio con P(A|B), obtenemos:

P(A∩B)=P(B)P(A|B)

Ambas expresiones calculan exactamente la misma probabilidad: la probabilidad de que ocurran A y B.

PARA PROFUNDIZAR · DEMOSTRACIÓN 16 · ●●●●

6.222. Derivación de la regla de multiplicación

Partimos de la definición:

P(B|A)=P(A∩B)/P(A),

donde P(A)>0.

Multiplicamos ambos lados por P(A):

P(A)P(B|A)=P(A∩B).

Reordenando:

P(A∩B)=P(A)P(B|A).

De manera análoga:

P(A∩B)=P(B)P(A|B).

Esta regla es general. No requiere que A y B sean independientes.

6.223. La regla general de multiplicación

P(A∩B)=P(A)P(B|A)

=P(B)P(A|B).

Podemos leer la primera expresión así:

Primer factor

P(A)

probabilidad de que ocurra A.

Segundo factor

P(B|A)

probabilidad de B bajo la información de que A ocurrió.

La multiplicación representa entonces un recorrido:

primero A,

y dentro de esa situación,

también B.

Figura 6.60
La regla de multiplicación construye la intersección por etapas
PRIMERA ETAPA · A

P(A)

SEGUNDA ETAPA · B SABIENDO A

P(B|A)

A Y B

P(A∩B)=P(A)P(B|A)

Nota. Elaboración propia.

6.224. Ejemplo 1 · Dos bolas rojas sin reemplazo

FUNDAMENTAL · ●○○○

Una urna contiene:

5 bolas rojas y 3 azules.

Extraemos dos bolas sin reemplazo.

Sea:

R₁ = «la primera bola es roja»

R₂ = «la segunda bola es roja».

Tenemos:

P(R₁)=5/8.

Si la primera fue roja, quedan cuatro rojas entre siete bolas:

P(R₂|R₁)=4/7.

Por la regla de multiplicación:

P(R₁∩R₂)=(5/8)(4/7)

=20/56=5/14≈35,71 %

El segundo factor no es 5/8 porque la primera extracción modificó la composición de la urna.

6.225. Multiplicar no significa multiplicar siempre P(A) por P(B)

Un error muy frecuente consiste en escribir automáticamente:

P(A∩B)=P(A)P(B).

Esa expresión no es válida para cualquier par de eventos.

La regla general es: P(A∩B)=P(A)P(B|A). Solo en una situación especial podremos sustituir P(B|A) por P(B).

Esa situación especial es la independencia.

6.226. ¿Qué significa independencia?

En la Parte 7 terminamos con una pregunta:

¿Qué significa que P(B|A)=P(B)?

Significa que conocer que A ocurrió no modifica la probabilidad de B.

En ese caso, A no aporta información probabilística sobre B.

P(B|A)=P(B)

cuando P(A)>0.

6.227. Definición matemática de independencia

La definición fundamental de independencia entre A y B es:

P(A∩B)=P(A)P(B)

Esta definición es especialmente importante porque sigue teniendo sentido incluso si alguno de los eventos tiene probabilidad cero.

Si P(A)>0 y A y B son independientes:

P(B|A)=P(B).

Si P(B)>0:

P(A|B)=P(A).

Figura 6.61
Dependencia e independencia vistas desde la información
EVENTOS DEPENDIENTES

conocer A cambia la probabilidad de B

P(B|A)≠P(B)

usamos P(A)P(B|A)

EVENTOS INDEPENDIENTES

conocer A no cambia la probabilidad de B

P(B|A)=P(B)

usamos P(A)P(B)

Nota. Elaboración propia.

6.228. Ejemplo 2 · Un dado y una moneda

INTERMEDIO · ●●○○

Lanzamos una moneda equilibrada y un dado equilibrado.

Definimos:

A = «obtener cara»

B = «obtener un 6».

Tenemos:

P(A)=1/2

P(B)=1/6.

Hay 12 pares equiprobables posibles entre el resultado de la moneda y el dado. Solamente uno corresponde a:

(cara,6).

Por tanto:

P(A∩B)=1/12

P(A)P(B)=(1/2)(1/6)=1/12.

Se cumple:

P(A∩B)=P(A)P(B).

En este modelo, A y B son independientes.

6.229. Ejemplo 3 · Sin reemplazo produce dependencia

Volvamos a la urna con cinco bolas rojas y tres azules.

Antes de extraer la primera bola:

P(R₂)=5/8.

Pero si sabemos que la primera fue roja:

P(R₂|R₁)=4/7.

Como:

4/7 ≠ 5/8,

conocer R₁ modifica la probabilidad de R₂.

Por tanto, las dos extracciones no son independientes.

6.230. Independencia no significa incompatibilidad

Estos dos conceptos suelen confundirse, pero expresan ideas muy diferentes.

Tabla 6.22
Independencia e incompatibilidad
INDEPENDENCIA

Saber que A ocurrió no cambia la probabilidad de B.

P(A∩B)=P(A)P(B)

A y B pueden ocurrir simultáneamente.

INCOMPATIBILIDAD

A y B no pueden ocurrir simultáneamente.

A∩B=∅

P(A∩B)=0.

Si A y B son incompatibles y ambos tienen probabilidad positiva, saber que A ocurrió hace imposible B.

P(B|A)=0,

mientras que:

P(B)>0.

Por tanto, no son independientes.

Matiz avanzado. Dos eventos incompatibles pueden satisfacer formalmente la condición de independencia si al menos uno tiene probabilidad cero. En los ejemplos elementales con probabilidades positivas, incompatibilidad e independencia son claramente diferentes.

6.231. Si A y B son independientes, también lo son ciertos complementos

Si A y B son independientes:

P(A∩B)=P(A)P(B).

También resultan independientes:

Ac y B
A y Bc
Ac y Bc

Por ejemplo:

P(Ac∩B)=P(Ac)P(B).

6.232. Aplicación · Confiabilidad de dos componentes

AVANZADO · ●●●○

Supongamos un modelo hipotético en el que dos componentes A y B pueden fallar durante cierto intervalo.

El modelo asigna:

P(falla A)=0,02

P(falla B)=0,03.

Si el modelo justifica que las fallas son independientes:

P(fallan ambos)=(0,02)(0,03)

=0,0006=0,06 %

La frase decisiva es «si el modelo justifica independencia». Si ambos componentes pueden verse afectados por una misma temperatura, vibración, alimentación eléctrica o defecto de fabricación, sus fallas podrían estar relacionadas.

Nota. Valores hipotéticos creados exclusivamente con fines didácticos.

6.233. Independencia es una propiedad del modelo, no una comodidad de cálculo

La expresión:

P(A∩B)=P(A)P(B)

es muy sencilla.

Precisamente por eso existe la tentación de utilizarla siempre.

Una fórmula cómoda no convierte dos eventos dependientes en independientes.

La independencia debe provenir de:

estructura del experimento
conocimiento del mecanismo
supuesto explícito del modelo
evidencia empírica compatible

Incluso cuando los datos parecen compatibles con independencia, eso no significa que la independencia haya sido demostrada de manera absoluta.

6.234. Datos compatibles con independencia

Supongamos que observamos 1.000 ensayos hipotéticos.

Registramos:

A ocurrió 100 veces

B ocurrió 200 veces

A∩B ocurrió 20 veces.

Las frecuencias relativas son:

f(A)=0,10

f(B)=0,20

f(A∩B)=0,02.

Además:

0,10×0,20=0,02.

Estos datos son compatibles con un modelo de independencia.

Las frecuencias observadas pertenecen a los datos. La independencia pertenece al modelo. Una coincidencia empírica puede apoyar el modelo, pero no convierte una muestra finita en una demostración exacta de independencia.

Nota. Datos simulados con fines didácticos.

6.235. Tres eventos sucesivos

Ahora queremos que ocurran:

A, B y C.

Podemos construir la probabilidad paso a paso:

primero A;

después B bajo la información A;

finalmente C bajo la información de que A y B ya ocurrieron.

P(A∩B∩C)=P(A)P(B|A)P(C|A∩B)
PARA PROFUNDIZAR · DEMOSTRACIÓN 17 · ●●●●

6.236. Derivación de la regla de la cadena para tres eventos

Comenzamos con:

P(A∩B)=P(A)P(B|A).

Consideramos ahora A∩B como el evento que ya ocurrió.

P(A∩B∩C)=P(A∩B)P(C|A∩B).

Sustituimos:

P(A∩B)=P(A)P(B|A).

Así obtenemos:

P(A∩B∩C)=P(A)P(B|A)P(C|A∩B).

Figura 6.62
La regla de la cadena incorpora la información acumulada
A

P(A)

B SABIENDO A

P(B|A)

C SABIENDO A∩B

P(C|A∩B)

MULTIPLICAMOS LOS FACTORES DEL RECORRIDO

Nota. Elaboración propia.

6.237. Ejemplo 4 · Tres bolas blancas sin reemplazo

Una urna contiene:

6 bolas blancas y 4 negras.

Extraemos tres bolas sin reemplazo.

La probabilidad de obtener tres blancas es:

6/10

por

5/9

por

4/8.

P=(6/10)(5/9)(4/8)

=1/6≈16,67 %

Cada factor cambia porque no existe reemplazo.

6.238. Si varios eventos son independientes

Si varios eventos son independientes en el sentido apropiado, la regla de la cadena se simplifica.

Para tres eventos mutuamente independientes:

P(A∩B∩C)=P(A)P(B)P(C)

Para n eventos independientes:

P(A₁∩A₂∩···∩Aₙ) = P(A₁)P(A₂)···P(Aₙ).

6.239. Ejemplo 5 · Cinco lanzamientos de una moneda equilibrada

Modelamos los lanzamientos como independientes.

La probabilidad de obtener cara en cada lanzamiento es:

1/2.

Para obtener cinco caras:

(1/2)⁵

=1/32=0,03125=3,125 %

La independencia permite conservar 1/2 como probabilidad en cada etapa del modelo.

6.240. Independencia por pares no siempre significa independencia conjunta

PARA PROFUNDIZAR · ●●●●

Con tres o más eventos aparece una distinción más sutil.

Tres eventos pueden ser independientes por pares sin ser independientes en conjunto.

Lanzamos dos monedas equilibradas y definimos:

A = «la primera es cara»

B = «la segunda es cara»

C = «las dos monedas muestran el mismo resultado».

Cada evento tiene probabilidad:

1/2.

Además, cada intersección de dos eventos tiene probabilidad 1/4, que coincide con:

(1/2)(1/2)=1/4.

Por tanto, son independientes por pares.

Sin embargo:

P(A∩B∩C)=1/4,

mientras que:

P(A)P(B)P(C)=1/8.

Para tres o más eventos, verificar solamente las parejas no siempre basta para establecer independencia mutua.

6.241. «Al menos uno» cuando existe independencia

En la Parte 5 aprendimos que:

P(al menos uno)=1−P(ninguno).

Ahora podemos completar esta herramienta cuando los eventos son independientes.

Supongamos dos dispositivos independientes con probabilidades hipotéticas de alarma:

P(A)=0,10

P(B)=0,05.

La probabilidad de que A no active alarma es 0,90 y la de que B no active alarma es 0,95.

Bajo independencia:

P(ninguna alarma)=(0,90)(0,95)=0,855.

P(al menos una alarma)=1−0,855

=0,145=14,5 %

En un sistema real, dos sensores pueden responder a una misma perturbación. Por tanto, la independencia debe verificarse o justificarse antes de utilizar esta multiplicación.

Nota. Valores hipotéticos creados exclusivamente con fines didácticos.

6.242. Tabla de lectura rápida

Tabla 6.23
Regla general e independencia
Regla general

P(A∩B)=P(A)P(B|A)

funciona aunque exista dependencia.

Independencia

P(A∩B)=P(A)P(B)

conocer A no modifica B.

Dependencia

P(B|A)≠P(B)

debemos conservar la probabilidad condicionada.

Incompatibilidad

P(A∩B)=0

los eventos no pueden ocurrir juntos.

6.243. Errores frecuentes

Error 1

Escribir P(A∩B)=P(A)P(B) automáticamente.

Esa simplificación requiere independencia.

Error 2

Confundir independencia con incompatibilidad.

Son conceptos diferentes.

Error 3

Suponer independencia porque facilita el cálculo.

La independencia debe justificarse en el modelo.

Error 4

Olvidar actualizar la probabilidad en un experimento sin reemplazo.

Las posibilidades posteriores pueden cambiar.

Error 5

Confundir igualdad empírica aproximada con prueba absoluta de independencia.

Datos y modelo pertenecen a niveles diferentes.

Error 6

Usar probabilidades marginales en cada etapa de una cadena dependiente.

Debemos condicionar a la información acumulada.

6.244. Práctica de dificultad creciente

FUNDAMENTAL · ●○○○

Se sabe que:

P(A)=0,40

P(B|A)=0,30.

Calcula P(A∩B).

Ver solución

P(A∩B)=(0,40)(0,30)=0,12=12 %.

INTERMEDIO · ●●○○

A y B son independientes.

P(A)=0,25

P(B)=0,60.

Calcula P(A∩B).

Ver solución

P(A∩B)=(0,25)(0,60)=0,15=15 %.

AVANZADO · ●●●○

Una urna contiene 7 bolas verdes y 3 amarillas. Se extraen dos bolas sin reemplazo.

Calcula la probabilidad de obtener dos verdes.

Ver solución

P(V₁)=7/10.

P(V₂|V₁)=6/9.

P(V₁∩V₂)=(7/10)(6/9)=42/90=7/15≈46,67 %.

PARA PROFUNDIZAR · ●●●●

Supón que A y B son independientes. Demuestra que:

Ac y B también son independientes.

Ver orientación

Como:

P(B)=P(A∩B)+P(Ac∩B),

entonces:

P(Ac∩B)=P(B)−P(A)P(B).

Factorizamos:

P(Ac∩B) = [1−P(A)]P(B) = P(Ac)P(B).

6.245. Actividad · ¿Independientes, dependientes o incompatibles?

Clasifica cada situación antes de realizar cualquier cálculo.

A. Lanzar una moneda y un dado; A = «cara», B = «6».

B. Extraer dos cartas sin reemplazo; A = «primera es as», B = «segunda es as».

C. En un solo dado; A = «sale 2», B = «sale 5».

D. Dos componentes de un sistema afectados por una misma fuente de sobrecalentamiento.

E. Dos lanzamientos de una moneda que el modelo considera independientes.

Ver orientación

A. Independientes en el modelo usual.

B. Dependientes porque no existe reemplazo.

C. Incompatibles: en un solo lanzamiento no pueden ocurrir ambos.

D. No conviene suponer independencia: existe una posible causa común.

E. Independientes bajo el modelo indicado.

6.246. Comprueba lo aprendido

1. Escribe la regla general de multiplicación para dos eventos.

2. ¿Necesita esa regla que los eventos sean independientes?

3. ¿Qué significa que P(B|A)=P(B)?

4. Escribe la definición fundamental de independencia de A y B.

5. ¿Por qué P(A)P(B) no puede utilizarse automáticamente?

6. ¿Cuál es la diferencia entre independencia e incompatibilidad?

7. Si A y B son independientes y tienen probabilidad positiva, ¿qué relación existe entre P(A|B) y P(A)?

8. ¿Por qué dos extracciones sin reemplazo suelen ser dependientes?

9. Escribe la regla de la cadena para tres eventos.

10. ¿Cómo se simplifica esa regla si los tres eventos son mutuamente independientes?

11. ¿Qué significa independencia por pares?

12. ¿Independencia por pares garantiza siempre independencia mutua?

13. ¿Por qué la independencia debe considerarse una propiedad del modelo?

14. ¿Una coincidencia exacta de frecuencias en una muestra demuestra independencia?

15. Si A y B son independientes, ¿qué puede afirmarse sobre Ac y B?

Ver respuestas breves

1. P(A∩B)=P(A)P(B|A).

2. No.

3. Que conocer A no modifica la probabilidad de B.

4. P(A∩B)=P(A)P(B).

5. Porque esa simplificación requiere independencia.

6. Independencia significa ausencia de cambio probabilístico; incompatibilidad significa que no pueden ocurrir juntos.

7. P(A|B)=P(A).

8. Porque la primera extracción modifica las posibilidades restantes.

9. P(A∩B∩C)=P(A)P(B|A)P(C|A∩B).

10. P(A)P(B)P(C).

11. Que cada pareja de eventos satisface la condición de independencia.

12. No.

13. Porque debe representar adecuadamente cómo se relacionan los eventos en el fenómeno estudiado.

14. No. Puede ser evidencia compatible, pero no una demostración absoluta.

15. También son independientes.

6.247. Mapa conceptual

Figura 6.63
De la probabilidad condicional a la independencia
PROBABILIDAD CONDICIONAL

P(B|A)

REGLA GENERAL DE MULTIPLICACIÓN

P(A∩B)=P(A)P(B|A)

¿CONOCER A CAMBIA LA PROBABILIDAD DE B?

P(B|A)≠P(B)

dependencia

NO

P(B|A)=P(B)

independencia

SI SON INDEPENDIENTES: P(A∩B)=P(A)P(B)

Nota. Elaboración propia.

6.248. Síntesis

La regla general de multiplicación se obtiene directamente de la definición de probabilidad condicional:

P(A∩B)=P(A)P(B|A).

También puede escribirse:

P(A∩B)=P(B)P(A|B).

Estas expresiones son válidas incluso cuando los eventos son dependientes.

Dos eventos A y B son independientes cuando:

P(A∩B)=P(A)P(B).

Si las probabilidades condicionantes son positivas, esto equivale a afirmar que:

P(B|A)=P(B)

y:

P(A|B)=P(A).

Independencia no significa incompatibilidad. Los eventos independientes pueden ocurrir simultáneamente.

Para tres eventos:

P(A∩B∩C)=P(A)P(B|A)P(C|A∩B).

Si existe independencia mutua:

P(A∩B∩C)=P(A)P(B)P(C).

Finalmente, la independencia no debe suponerse porque simplifique una fórmula. Debe formar parte de un modelo razonablemente justificado por la estructura del experimento, el conocimiento del fenómeno o evidencia compatible.

6.249. Una nueva pregunta: varios caminos hacia el mismo evento

Hasta ahora hemos seguido recorridos concretos:

ocurre A

y después

ocurre B.

Pero muchos problemas pueden alcanzar un mismo resultado por varios caminos diferentes.

Por ejemplo, una alarma puede producirse bajo distintos estados del sistema; una persona puede pertenecer a diferentes grupos de origen; o un resultado puede alcanzarse después de distintas primeras etapas.

¿Cómo combinamos las probabilidades de varios caminos que conducen al mismo evento?

Para responder necesitaremos dos herramientas:

particiones del espacio muestral

y

árboles de probabilidad.

Multiplicar probabilidades no es una receta automática.

Primero debemos comprender qué información cambia y si el modelo realmente justifica independencia.

SIGUIENTE
Parte 9 de 18 · Probabilidad total y árboles
Estudiaremos cómo dividir un problema en caminos mutuamente excluyentes, calcular la probabilidad de cada recorrido y reunirlos para obtener una probabilidad total.
La numeración continuará en 6.250.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 9 DE 18
CAPÍTULO 6

Probabilidad total y árboles de probabilidad

Multiplicar dentro de cada camino · sumar entre caminos

Particiones · rutas · ponderaciones · probabilidad total

Idea central

Un mismo evento puede alcanzarse por caminos diferentes. Si esos caminos representan casos mutuamente excluyentes, podemos calcular la probabilidad de cada ruta y después reunirlas mediante una suma. De esta estructura nace el teorema de la probabilidad total. La regla práctica que guiará toda esta parte es: multiplicar a lo largo de cada camino y sumar entre caminos disjuntos.

Al finalizar esta parte podrás:
reconocer cuándo una colección de eventos forma una partición;
construir y leer árboles de probabilidad;
multiplicar probabilidades correctamente dentro de una ruta;
sumar rutas disjuntas que conducen al mismo evento;
interpretar y aplicar el teorema de la probabilidad total;
comprender la probabilidad total como un promedio ponderado;
reconocer que el teorema no exige independencia;
preparar el razonamiento necesario para el teorema de Bayes.

6.250. Un acontecimiento puede tener varios caminos

EJEMPLO 1 · FUNDAMENTAL · ●○○○

Imaginemos una empresa que fabrica una misma pieza utilizando dos máquinas.

MÁQUINA 1
60 %
de la producción
MÁQUINA 2
40 %
de la producción

Una pieza defectuosa podría provenir de la máquina 1 o de la máquina 2.

Aparecen entonces dos caminos diferentes hacia un mismo evento:

M₁ → defectuosa

o

M₂ → defectuosa.

¿Cómo calculamos la probabilidad de cada camino y cómo los reunimos sin contar ninguno dos veces?

Nota. Todos los datos de este ejemplo son hipotéticos y se utilizan exclusivamente con fines didácticos.

6.251. Antes del árbol: necesitamos una partición

Una colección de eventos:

A₁, A₂, …, Aₙ

forma una partición del espacio muestral Ω cuando cumple simultáneamente dos condiciones.

1. NO SE SUPERPONEN

Dos partes diferentes no pueden contener simultáneamente el mismo resultado.

Aᵢ∩Aⱼ=∅, si i≠j

2. NO DEJAN HUECOS

Entre todas deben cubrir completamente el espacio muestral.

A₁∪A₂∪···∪Aₙ=Ω

Una partición divide Ω en categorías mutuamente excluyentes y exhaustivas: cada resultado pertenece a una sola parte y ningún resultado queda por fuera.

Figura 6.64
Una partición divide Ω sin superposiciones ni huecos
Ω A₁ A₂ A₃ Cada resultado pertenece a una sola región A₁ ∪ A₂ ∪ A₃ = Ω

Nota. Elaboración propia. Las regiones están diferenciadas mediante etiquetas y no únicamente por color.

6.252. Las dos máquinas forman una partición

Definimos:

M₁ = «la pieza proviene de la máquina 1»

M₂ = «la pieza proviene de la máquina 2».

Si cada pieza es fabricada exactamente por una de las dos máquinas:

M₁∩M₂=∅

M₁∪M₂=Ω

{M₁,M₂} es una partición de Ω.

Además:

P(M₁)+P(M₂)=0,60+0,40=1.

6.253. Añadimos las probabilidades dentro de cada máquina

Sea:

D = «la pieza es defectuosa».

Supongamos:

P(M₁)=0,60
P(M₂)=0,40
P(D|M₁)=0,02
P(D|M₂)=0,05

La expresión:

P(D|M₁)=0,02

significa que, dentro de las piezas producidas por M₁, la probabilidad de defecto del modelo es 2 %.

De manera análoga:

P(D|M₂)=0,05

significa que entre las piezas provenientes de M₂ la probabilidad de defecto es 5 %.

6.254. Construimos el árbol de probabilidad

El árbol organiza el problema por etapas.

En la primera etapa identificamos qué máquina produjo la pieza. En la segunda consideramos si la pieza es defectuosa o no defectuosa.

Figura 6.65
Árbol de probabilidad para el ejemplo de las dos máquinas
PIEZA SELECCIONADA
M₁
P(M₁)=0,60
D
P(D|M₁)=0,02
Dc
0,98
M₂
P(M₂)=0,40
D
P(D|M₂)=0,05
Dc
0,95

Nota. Elaboración propia. D = defectuosa; Dc = no defectuosa. Datos hipotéticos.

6.255. Regla 1 · Las ramas que salen de un nodo suman 1

Desde el nodo inicial solamente hay dos posibilidades:

M₁ o M₂.

0,60+0,40=1.

Si sabemos que la pieza procede de M₁:

0,02+0,98=1.

Si procede de M₂:

0,05+0,95=1.

Las ramas que salen de un nodo deben representar alternativas mutuamente excluyentes y exhaustivas desde ese punto. Por eso sus probabilidades suman 1.

6.256. Regla 2 · A lo largo de un camino multiplicamos

Consideremos la ruta:

M₁ → D.

Representa el acontecimiento:

«la pieza procede de M₁ y es defectuosa».

Por tanto:

M₁∩D.

Aplicamos la regla de multiplicación estudiada en la Parte 8:

P(M₁∩D)=P(M₁)P(D|M₁)

=0,60×0,02

=0,012=1,2 %

Ahora calculamos la segunda ruta:

P(M₂∩D)=P(M₂)P(D|M₂)

=0,40×0,05

=0,020=2,0 %

6.257. Regla 3 · Entre caminos disjuntos sumamos

Una pieza defectuosa puede llegar al evento D mediante:

M₁∩D

o mediante

M₂∩D.

Esos caminos son mutuamente excluyentes porque una misma pieza, dentro de este modelo, no puede provenir simultáneamente de las dos máquinas.

Por tanto:

P(D)=0,012+0,020

P(D)=0,032=3,2 %

Figura 6.66
La regla práctica fundamental de los árboles de probabilidad
DENTRO DE UNA RUTA

MULTIPLICAMOS

0,60×0,02=0,012
obtenemos la probabilidad de una ruta completa
ENTRE RUTAS DISJUNTAS HACIA EL MISMO EVENTO

SUMAMOS

0,012+0,020=0,032
reunimos todos los caminos disjuntos que producen D

Nota. Elaboración propia.

6.258. El cálculo completo como suma de contribuciones

Tabla 6.24
Contribución de cada camino a la probabilidad total de defecto
CAMINO M₁→D

0,60×0,02

0,012

CAMINO M₂→D

0,40×0,05

0,020

TOTAL

0,012+0,020

0,032

La máquina 2 produce menos piezas que la máquina 1, pero aporta una mayor cantidad probabilística al evento D porque su tasa condicional de defecto es mayor.

6.259. De los caminos al teorema

Supongamos que A₁ y A₂ forman una partición de Ω.

Todo resultado perteneciente a B debe encontrarse dentro de A₁ o dentro de A₂.

Por tanto:

B=(B∩A₁)∪(B∩A₂)

Además, B∩A₁ y B∩A₂ son disjuntos.

Esa descomposición contiene la idea esencial del teorema de la probabilidad total.

PARA PROFUNDIZAR · DEMOSTRACIÓN 18 · ●●●●

6.260. Teorema de la probabilidad total para dos casos

Sean A₁ y A₂ una partición de Ω:

A₁∩A₂=∅

A₁∪A₂=Ω.

Como todo resultado de B pertenece a una de las dos partes:

B=(B∩A₁)∪(B∩A₂).

Las dos intersecciones son disjuntas. Por aditividad:

P(B)=P(B∩A₁)+P(B∩A₂).

Aplicamos la regla de multiplicación:

P(B∩A₁)=P(A₁)P(B|A₁)

P(B∩A₂)=P(A₂)P(B|A₂).

Sustituimos:

P(B)=P(A₁)P(B|A₁)+P(A₂)P(B|A₂).

6.261. Teorema general de la probabilidad total

Supongamos que:

A₁,A₂,…,Aₙ

forman una partición de Ω y que, para utilizar las probabilidades condicionales en la forma elemental desarrollada aquí:

P(Aᵢ)>0.

Entonces, para cualquier evento B:

P(B)=P(A₁)P(B|A₁)+P(A₂)P(B|A₂)+···+P(Aₙ)P(B|Aₙ)

P(B)=Σ P(Aᵢ)P(B|Aᵢ)

La suma se realiza para:

i=1,2,…,n.

PARA PROFUNDIZAR · DEMOSTRACIÓN 19 · ●●●●

6.262. Demostración general del teorema

Como A₁,A₂,…,Aₙ forman una partición:

Ω=A₁∪A₂∪···∪Aₙ.

Intersectamos ambos lados con B:

B∩Ω=B∩(A₁∪A₂∪···∪Aₙ).

Como B∩Ω=B y la intersección se distribuye sobre la unión:

B=(B∩A₁)∪(B∩A₂)∪···∪(B∩Aₙ).

Debido a que los Aᵢ son mutuamente excluyentes, también lo son:

B∩A₁, B∩A₂, …, B∩Aₙ.

Aplicamos aditividad:

P(B)=ΣP(B∩Aᵢ).

Para cada término:

P(B∩Aᵢ)=P(Aᵢ)P(B|Aᵢ).

Sustituimos:

P(B)=ΣP(Aᵢ)P(B|Aᵢ).

6.263. ¿Qué significa realmente «probabilidad total»?

La expresión probabilidad total no designa una nueva clase de probabilidad.

Significa que calculamos P(B) reuniendo todas las formas disjuntas mediante las cuales B puede ocurrir.

Estrategia

1. Dividimos el problema en casos que formen una partición.

2. Calculamos P(B|Aᵢ) dentro de cada caso.

3. Multiplicamos por el peso P(Aᵢ) correspondiente.

4. Sumamos las contribuciones de todos los casos.

6.264. La probabilidad total es un promedio ponderado

En el ejemplo de las máquinas:

P(D|M₁)=0,02

P(D|M₂)=0,05.

Podríamos sentir la tentación de calcular:

(0,02+0,05)/2=0,035

Pero ese promedio simple supone implícitamente que las dos máquinas tienen el mismo peso.

No es nuestro caso:

P(M₁)=0,60   y   P(M₂)=0,40.

0,60(0,02)+0,40(0,05)

=0,012+0,020

=0,032.

La probabilidad total es un promedio ponderado de las probabilidades condicionales P(B|Aᵢ), donde los pesos son las probabilidades P(Aᵢ).

Figura 6.67
Cada probabilidad condicional aporta según el peso de su grupo
PESO M₁

0,60

×

0,02

contribución = 0,012

PESO M₂

0,40

×

0,05

contribución = 0,020

0,012+0,020=0,032

Nota. Elaboración propia.

6.265. Comprenderlo mediante 10.000 piezas

Podemos visualizar el mismo modelo utilizando frecuencias naturales hipotéticas.

Imaginemos:

10.000 piezas.

Tabla 6.25
Interpretación del modelo mediante frecuencias naturales hipotéticas
MÁQUINA 1

Producción: 6.000

Tasa de defecto: 2 %

Defectuosas: 120

MÁQUINA 2

Producción: 4.000

Tasa de defecto: 5 %

Defectuosas: 200

TOTAL

Producción: 10.000

Defectuosas: 320

Proporción: 320/10.000

320/10.000=0,032=3,2 %

Obtenemos exactamente el mismo valor del modelo calculado mediante el árbol.

Nota. Las 10.000 piezas son una representación hipotética para visualizar el modelo; no son observaciones de una fábrica real.

6.266. Ejemplo 2 · Forma de llegar al colegio

INTERMEDIO · ●●○○

Supongamos que los estudiantes llegan al colegio mediante:

Bus
50 %
Caminando
30 %
Bicicleta
20 %

Además:

P(retardo | bus)=0,12

P(retardo | caminando)=0,04

P(retardo | bicicleta)=0,08.

Nota. Datos hipotéticos creados exclusivamente con fines didácticos.

6.267. Calculamos el retardo por caminos

Camino 1

bus y retardo

0,50×0,12=0,060

Camino 2

caminando y retardo

0,30×0,04=0,012

Camino 3

bicicleta y retardo

0,20×0,08=0,016

Los tres caminos son disjuntos dentro del modelo porque cada estudiante ha sido clasificado en una sola forma de llegada.

Sumamos:

P(retardo)=0,060+0,012+0,016

P(retardo)=0,088=8,8 %

6.268. Comprobación mediante el complemento

Si:

P(retardo)=0,088,

entonces:

P(no retardo)=1−0,088.

P(no retardo)=0,912=91,2 %

También podríamos obtener 91,2 % sumando los tres caminos correspondientes a una llegada sin retardo.

6.269. La probabilidad total no requiere independencia

Después de estudiar independencia en la Parte 8, podría surgir una confusión:

¿Podemos utilizar el teorema de probabilidad total solamente si B es independiente de los Aᵢ?

La respuesta es:

No.

Precisamente utilizamos:

P(B|Aᵢ)

porque la probabilidad de B puede ser diferente en cada parte.

El teorema de la probabilidad total utiliza probabilidades condicionales. No necesita que B sea independiente de los eventos de la partición.

6.270. Los árboles pueden tener más de dos etapas

Un árbol puede extenderse a tres, cuatro o más etapas.

En la Parte 8 estudiamos la regla de la cadena. Aquí solo necesitamos recordar su interpretación:

P(A∩B∩C)=P(A)P(B|A)P(C|A∩B)

Lo nuevo en esta parte no es volver a demostrar esa multiplicación, sino aprender a reunir diferentes rutas completas cuando desembocan en un mismo evento final.

6.271. No se suman directamente caminos que se superponen

La regla «sumar caminos» funciona directamente cuando las rutas representan eventos mutuamente excluyentes.

Si dos supuestas rutas pudieran contener el mismo resultado, aparecería un problema de doble conteo.

Un árbol correctamente construido evita este problema: las alternativas que salen de cada nodo deben definirse de forma mutuamente excluyente y exhaustiva.

6.272. ¿Qué ocurre si una parte tiene probabilidad cero?

PARA PROFUNDIZAR · ●●●●

La descomposición:

P(B)=ΣP(B∩Aᵢ)

continúa teniendo sentido aunque alguna parte tenga probabilidad cero.

Sin embargo, la definición elemental:

P(B|Aᵢ)=P(B∩Aᵢ)/P(Aᵢ)

requiere:

P(Aᵢ)>0.

En el tratamiento elemental de P(B)=ΣP(Aᵢ)P(B|Aᵢ) trabajaremos con partes condicionantes de probabilidad positiva.

6.273. Tres reglas para leer correctamente un árbol

Tabla 6.26
Operaciones fundamentales en un árbol de probabilidad
RAMAS DE UN MISMO NODO

SUMAN 1

porque representan todas las alternativas posibles y disjuntas desde ese nodo.

A LO LARGO DE UNA RUTA

MULTIPLICAMOS

mediante la regla de multiplicación y las probabilidades condicionadas apropiadas.

RUTAS DISJUNTAS HACIA EL MISMO EVENTO

SUMAMOS

porque aplicamos la aditividad a eventos mutuamente excluyentes.

6.274. Errores frecuentes

Error 1

Sumar probabilidades a lo largo de una ruta.

A lo largo de una ruta multiplicamos.

Error 2

Multiplicar rutas alternativas que conducen al mismo evento.

Si son disjuntas, se suman.

Error 3

Construir ramas de un nodo cuyas probabilidades no suman 1.

Las ramas deben cubrir todas las posibilidades de ese nivel.

Error 4

Confundir P(B|Aᵢ) con P(Aᵢ|B).

Invertir la condición cambia la pregunta.

Error 5

Aplicar probabilidad total a categorías que no forman una partición.

Los casos deben ser disjuntos y exhaustivos.

Error 6

Promediar sin ponderar P(B|Aᵢ).

Cada valor debe ponderarse mediante P(Aᵢ).

Error 7

Creer que el teorema necesita independencia.

No la necesita.

Error 8

Leer el árbol al revés.

P(B|A) no es automáticamente P(A|B).

6.275. Actividad guiada · Tres máquinas

AVANZADO · ●●●○

Una fábrica hipotética utiliza tres máquinas:

M₁: 50 %   ·   M₂: 30 %   ·   M₃: 20 %.

Las probabilidades de defecto son:

P(D|M₁)=0,01

P(D|M₂)=0,03

P(D|M₃)=0,06.

1. Comprueba que M₁, M₂ y M₃ forman una partición.

2. Representa la situación mediante un árbol.

3. Calcula P(M₁∩D).

4. Calcula P(M₂∩D).

5. Calcula P(M₃∩D).

6. Suma los tres caminos.

7. Obtén P(D).

8. Calcula P(Dc).

9. Comprueba que P(D)+P(Dc)=1.

Ver solución

Las probabilidades iniciales suman:

0,50+0,30+0,20=1.

M₁→D: 0,50×0,01=0,005.

M₂→D: 0,30×0,03=0,009.

M₃→D: 0,20×0,06=0,012.

Sumamos:

P(D)=0,005+0,009+0,012=0,026.

P(D)=2,6 %.

Por complemento:

P(Dc)=1−0,026=0,974=97,4 %.

Comprobación: 0,026+0,974=1.

Nota. Datos hipotéticos creados con fines didácticos.

6.276. Reto · Elegir y reunir caminos

INTERMEDIO · ●●○○

Una persona utiliza uno de tres medios de transporte:

automóvil: 0,40   ·   metro: 0,35   ·   bicicleta: 0,25.

La probabilidad de llegar antes de las 7:00 es:

0,70 si usa automóvil,
0,90 si usa metro,
0,80 si usa bicicleta.

1. Representa la situación mediante un árbol.

2. Calcula el camino automóvil y llegada antes de las 7:00.

3. Calcula el camino correspondiente al metro.

4. Calcula el camino correspondiente a la bicicleta.

5. Obtén la probabilidad total de llegar antes de las 7:00.

6. Obtén la probabilidad de no llegar antes de las 7:00.

Ver solución

Automóvil: 0,40×0,70=0,280.

Metro: 0,35×0,90=0,315.

Bicicleta: 0,25×0,80=0,200.

Sumamos:

P(antes de las 7)=0,280+0,315+0,200=0,795.

P(antes de las 7)=79,5 %.

P(no antes de las 7)=1−0,795=0,205=20,5 %.

Nota. Datos hipotéticos creados con fines didácticos.

6.277. Después del cálculo manual: hoja de cálculo

Una vez comprendida la estructura, una hoja de cálculo puede automatizar las operaciones.

COLUMNA 1

pesos P(Aᵢ)

COLUMNA 2

probabilidades P(B|Aᵢ)

COLUMNA 3

productos P(Aᵢ)P(B|Aᵢ)

La suma de la tercera columna produce P(B).

La hoja de cálculo automatiza operaciones. No decide si los grupos forman una partición, si las condiciones fueron interpretadas correctamente ni si dos rutas pueden sumarse.

6.278. Comprueba lo aprendido

1. ¿Qué dos condiciones debe cumplir una colección de eventos para formar una partición?

2. ¿Por qué las ramas que salen de un mismo nodo deben sumar 1?

3. ¿Por qué multiplicamos probabilidades dentro de una ruta?

4. ¿Por qué sumamos rutas alternativas cuando son mutuamente excluyentes?

5. Escribe el teorema de probabilidad total para una partición formada por A₁ y A₂.

6. Escribe la fórmula general.

7. Explica por qué B=(B∩A₁)∪···∪(B∩Aₙ).

8. ¿Por qué los eventos B∩Aᵢ son mutuamente excluyentes?

9. ¿Qué papel desempeña P(Aᵢ) en la fórmula?

10. ¿Por qué no debemos promediar simplemente P(B|Aᵢ)?

11. ¿Necesita independencia el teorema de probabilidad total?

12. ¿Qué diferencia existe entre P(B|A) y P(A|B)?

13. ¿Qué problema aparece si dos rutas que sumamos se superponen?

14. ¿Qué ocurre con la definición elemental de P(B|Aᵢ) si P(Aᵢ)=0?

15. Explica con tus propias palabras: «multiplicar dentro de cada camino y sumar entre caminos disjuntos».

Ver respuestas breves

1. Deben ser mutuamente excluyentes y cubrir completamente Ω.

2. Porque representan todas las alternativas posibles y disjuntas desde ese nodo.

3. Porque una ruta completa representa una intersección y aplicamos la regla de multiplicación.

4. Porque la aditividad permite sumar probabilidades de eventos mutuamente excluyentes.

5. P(B)=P(A₁)P(B|A₁)+P(A₂)P(B|A₂).

6. P(B)=ΣP(Aᵢ)P(B|Aᵢ).

7. Porque todo resultado de B pertenece exactamente a una parte de la partición.

8. Porque si los Aᵢ no se superponen, sus intersecciones con B tampoco.

9. P(Aᵢ) funciona como el peso del caso Aᵢ.

10. Porque los grupos pueden tener pesos diferentes.

11. No.

12. Responden preguntas condicionadas en direcciones diferentes.

13. Aparece doble conteo.

14. No puede utilizarse la división P(B∩Aᵢ)/P(Aᵢ).

15. Calculamos la probabilidad conjunta dentro de cada ruta mediante multiplicación y después reunimos mediante suma las rutas completas que son disjuntas.

6.279. Mapa conceptual

Figura 6.68
Del espacio muestral a la probabilidad total
ESPACIO MUESTRAL Ω
PARTICIÓN A₁,A₂,…,Aₙ

casos disjuntos y exhaustivos

EN CADA CASO EVALUAMOS P(B|Aᵢ)
MULTIPLICAMOS DENTRO DE CADA CAMINO

P(Aᵢ)P(B|Aᵢ)

SUMAMOS LOS CAMINOS DISJUNTOS
P(B)=ΣP(Aᵢ)P(B|Aᵢ)

Nota. Elaboración propia.

6.280. Síntesis

Una partición divide Ω en eventos mutuamente excluyentes y exhaustivos.

Los árboles de probabilidad permiten organizar un problema por casos y por etapas.

Las ramas que salen de un mismo nodo suman 1 cuando representan todas las alternativas posibles de ese punto.

Dentro de una ruta multiplicamos:

P(Aᵢ∩B)=P(Aᵢ)P(B|Aᵢ).

Entre rutas completas y disjuntas que conducen al mismo evento, sumamos.

Si A₁,…,Aₙ forman una partición:

B=(B∩A₁)∪···∪(B∩Aₙ).

De esta descomposición se obtiene:

P(B)=ΣP(Aᵢ)P(B|Aᵢ).

Las probabilidades P(Aᵢ) funcionan como ponderaciones. Por eso la probabilidad total es, en este sentido, un promedio ponderado de las probabilidades condicionales.

El teorema no necesita que B sea independiente de los Aᵢ.

Y nunca debemos olvidar que:

P(B|A) y P(A|B)

responden preguntas diferentes.

6.281. Una nueva pregunta: invertir la condición

En el ejemplo de las máquinas conocemos:

P(D|M₁)=0,02.

Esto responde:

Si sabemos que la pieza proviene de M₁, ¿qué probabilidad hay de que sea defectuosa?

Pero podríamos formular la pregunta inversa:

Si sabemos que la pieza es defectuosa, ¿qué probabilidad hay de que provenga de M₁?

Esa nueva pregunta se escribe:

P(M₁|D).

¿Cómo podemos pasar correctamente de P(D|M₁) a P(M₁|D)?

Ahora disponemos de una pieza esencial para responder:

P(D)=0,032.

En la siguiente parte utilizaremos precisamente la probabilidad total para construir una de las fórmulas más importantes de la teoría de probabilidad.

el teorema de Bayes.

Un mismo acontecimiento puede alcanzarse por varios caminos.

La probabilidad total consiste en calcular correctamente cada camino y reunirlos sin contar ninguno dos veces.

SIGUIENTE
Parte 10 de 18 · Teorema de Bayes: invertir la condición
Aprenderemos a pasar correctamente de una probabilidad como P(B|A) a una pregunta en la dirección P(A|B), utilizando la probabilidad total como pieza fundamental.
La numeración continuará en 6.282.

Referencias

Kolmogorov, A. N. (1933). Grundbegriffe der Wahrscheinlichkeitsrechnung. Springer.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 10 DE 18
CAPÍTULO 6

Teorema de Bayes: invertir la condición

De P(B|A) a P(A|B)

Probabilidad previa · evidencia · verosimilitud · tasa base · probabilidad posterior

Idea central

Con frecuencia conocemos qué tan probable es observar una evidencia B cuando se cumple una condición A:

P(B|A).

Pero después de observar B puede interesarnos la pregunta en la dirección contraria:

P(A|B).

El Teorema de Bayes permite realizar correctamente esa actualización. No consiste en intercambiar dos letras alrededor de una barra: compara el camino asociado con A con todos los caminos capaces de producir la evidencia observada.

Al finalizar esta parte podrás:
distinguir P(A|B) de P(B|A);
comprender Bayes mediante caminos y frecuencias naturales;
deducir formalmente el Teorema de Bayes;
interpretar probabilidad previa y posterior;
interpretar correctamente la verosimilitud;
utilizar probabilidad total en el denominador;
aplicar Bayes a una partición completa;
comprender la importancia de las tasas base;
analizar falsos positivos mediante frecuencias naturales;
utilizar momios y razones de verosimilitudes en nivel avanzado;
comprender actualizaciones sucesivas;
distinguir el Teorema de Bayes de la inferencia bayesiana.

6.282. Una pregunta que cambia de dirección

Retomemos el ejemplo de las dos máquinas estudiado en la Parte 9.

El modelo establecía:

P(M₁)=0,60
P(M₂)=0,40
P(D|M₁)=0,02
P(D|M₂)=0,05

donde:

D = «la pieza es defectuosa».

En la Parte 9 calculamos:

P(D)=0,032=3,2 %.

Ahora cambia la pregunta:

Si encontramos una pieza defectuosa, ¿qué probabilidad hay de que provenga de la máquina 2?

P(M₂|D).

Nota. Datos hipotéticos creados exclusivamente con fines didácticos.

6.283. Invertir la condición no significa intercambiar símbolos

Sabemos:

P(D|M₂)=0,05.

Esto responde:

Si sabemos que la pieza proviene de M₂, ¿cuál es la probabilidad de que sea defectuosa?

En cambio:

P(M₂|D)

responde:

Si sabemos que la pieza es defectuosa, ¿cuál es la probabilidad de que haya sido producida por M₂?
P(D|M₂) ≠ P(M₂|D)
Figura 6.69
Cambiar la condición cambia la pregunta
P(D|M₂)

dentro de M₂ preguntamos por defectos

P(M₂|D)

dentro de los defectos preguntamos por su origen

Nota. Elaboración propia.

6.284. Comprendamos primero la respuesta con 10.000 piezas

FUNDAMENTAL · ●○○○

Antes de introducir una nueva fórmula, hagamos visible el razonamiento mediante frecuencias naturales.

Imaginemos 10.000 piezas producidas exactamente según las proporciones del modelo.

Tabla 6.27
Frecuencias naturales del ejemplo de las dos máquinas
MÁQUINA 1

60 % de 10.000: 6.000 piezas

2 % defectuosas: 120 piezas

MÁQUINA 2

40 % de 10.000: 4.000 piezas

5 % defectuosas: 200 piezas

Entre las 10.000 piezas existen:

120+200=320 defectuosas.

De esas 320 piezas defectuosas:

200 proceden de M₂.

200/320=0,625=62,5 %

Ya hemos resuelto intuitivamente el problema:

P(M₂|D)=62,5 %.

La fórmula de Bayes que estudiaremos a continuación no hará algo distinto: expresará algebraicamente este mismo razonamiento.

6.285. ¿Qué significa el 62,5 %?

Antes de observar el estado de la pieza:

P(M₂)=40 %.

Después de observar que es defectuosa:

P(M₂|D)=62,5 %.

La evidencia D aumentó la probabilidad asignada a M₂ porque el defecto es más frecuente entre las piezas de M₂ que entre las de M₁.

La evidencia no produjo certeza. Una pieza defectuosa todavía puede proceder de M₁. Lo que cambió fue la distribución de probabilidades sobre los posibles orígenes.

Figura 6.70
Entre todos los defectos preguntamos qué fracción procede de M₂
M₁ → D

0,60×0,02

0,012

M₂ → D

0,40×0,05

0,020

TODOS LOS DEFECTOS

0,012+0,020=0,032

PARTE DE LOS DEFECTOS QUE PROVIENE DE M₂

0,020/0,032=0,625

Nota. Elaboración propia con datos hipotéticos.

6.286. Del razonamiento por caminos a una fórmula

En el numerador del cálculo anterior apareció:

0,40×0,05.

Esto es:

P(M₂)P(D|M₂)=P(M₂∩D).

En el denominador apareció:

P(D)=0,032.

Por tanto:

P(M₂|D)=P(D|M₂)P(M₂)/P(D)

Esta estructura es el Teorema de Bayes aplicado al ejemplo.

6.287. Dos fórmulas conocidas contienen todo Bayes

Por definición de probabilidad condicional, si P(B)>0:

P(A|B)=P(A∩B)/P(B)

También conocemos la regla de multiplicación:

P(A∩B)=P(A)P(B|A)

Sustituir la segunda expresión dentro de la primera produce inmediatamente Bayes.

PARA PROFUNDIZAR · DEMOSTRACIÓN 20 · ●●●●

6.288. Demostración del Teorema de Bayes

Partimos de:

P(A|B)=P(A∩B)/P(B).

Por la regla de multiplicación:

P(A∩B)=P(A)P(B|A).

Sustituimos:

P(A|B) = [P(A)P(B|A)]/P(B).

Reordenamos los factores:

P(A|B)=P(B|A)P(A)/P(B).

Esta expresión requiere:

P(B)>0.

6.289. Fórmula básica del Teorema de Bayes

P(A|B)=P(B|A)P(A)/P(B)

Bayes no afirma:

P(A|B)=P(B|A).

Utiliza P(B|A), pero también incorpora:

P(A)

y normaliza el resultado mediante:

P(B).

6.290. ¿Qué representa cada componente?

Tabla 6.28
Componentes habituales de una aplicación del Teorema de Bayes
P(A)

Probabilidad previa

Probabilidad asignada a A antes de incorporar la evidencia B.

P(B|A)

Evidencia bajo A

Describe qué tan compatible es observar B cuando A se cumple.

P(B)

Probabilidad de la evidencia

Reúne todas las maneras consideradas por el modelo mediante las cuales B puede aparecer.

P(A|B)

Probabilidad posterior

Probabilidad de A después de incorporar la información B.

Los términos previa y posterior son especialmente útiles al interpretar Bayes como actualización. El teorema, sin embargo, sigue siendo una identidad matemática de probabilidades condicionadas.

6.291. Una precisión universitaria: probabilidad y verosimilitud no son lo mismo

PROFUNDIZACIÓN · ●●●●

La expresión:

P(B|A)

es una probabilidad de B cuando A se considera fijado.

Pero si la evidencia B ya fue observada y ahora comparamos diferentes posibilidades para A, la misma expresión, considerada como función de A, desempeña el papel de verosimilitud.

Probabilidad: fijamos A y preguntamos qué resultados B podrían aparecer.

Verosimilitud: fijamos la evidencia observada B y comparamos qué valores o hipótesis A hacen esa evidencia más compatible.

En general, una función de verosimilitud no es una distribución de probabilidad sobre las hipótesis y no tiene por qué sumar 1 al variar A. Bayes combina esa verosimilitud con la probabilidad previa y después normaliza el resultado.

6.292. La estructura conceptual de una actualización

Figura 6.71
De una probabilidad previa a una probabilidad posterior
PROBABILIDAD PREVIA

P(A)

OBSERVAMOS B
COMPATIBILIDAD DE B CON A

P(B|A)

TODOS LOS CAMINOS QUE PRODUCEN B

P(B)

PROBABILIDAD POSTERIOR

P(A|B)

Nota. Elaboración propia.

6.293. El denominador no es un detalle administrativo

En:

P(A|B)=P(B|A)P(A)/P(B),

el denominador:

P(B)

cumple una función esencial.

El numerador representa el camino:

A → B.

Pero B puede aparecer también por otros caminos.

Bayes no compara A con la nada. Compara el camino que contiene A con todos los caminos que el modelo reconoce como capaces de producir B.
NUMERADOR

P(B|A)P(A)

camino de interés

DENOMINADOR

P(B)

todos los caminos hacia la evidencia

6.294. Bayes con una partición completa

Supongamos que:

A₁,A₂,…,Aₙ

forman una partición del espacio muestral.

Queremos determinar:

P(Aⱼ|B).

La fórmula básica proporciona:

P(Aⱼ|B)=P(B|Aⱼ)P(Aⱼ)/P(B).

Y la Parte 9 nos enseñó a obtener el denominador:

P(B)=ΣP(Aᵢ)P(B|Aᵢ).

PARA PROFUNDIZAR · DEMOSTRACIÓN 21 · ●●●●

6.295. Fórmula general de Bayes para una partición

Partimos de:

P(Aⱼ|B)=P(B|Aⱼ)P(Aⱼ)/P(B).

Por probabilidad total:

P(B)=ΣP(Aᵢ)P(B|Aᵢ).

Sustituimos:

P(Aⱼ|B) = P(B|Aⱼ)P(Aⱼ) / [ΣP(Aᵢ)P(B|Aᵢ)]

El denominador reúne todos los caminos de la partición compatibles con la evidencia B.

6.296. Fórmula general

P(Aⱼ|B) = P(B|Aⱼ)P(Aⱼ) / [ΣP(Aᵢ)P(B|Aᵢ)]

Posterior de Aⱼ = probabilidad del camino «Aⱼ y B» dividida entre la probabilidad total de todos los caminos que producen B.

6.297. Las probabilidades posteriores forman una nueva distribución

Si A₁,…,Aₙ forman una partición y observamos B, cada probabilidad:

P(Aᵢ|B)

redistribuye la probabilidad entre las posibilidades Aᵢ bajo la nueva información B.

ΣP(Aᵢ|B)=1

Esto no es solo una comprobación aritmética: expresa que, después de condicionar a B, las posibilidades de la partición siguen cubriendo todo el universo de hipótesis considerado.

PARA PROFUNDIZAR · DEMOSTRACIÓN 22 · ●●●●

6.298. ¿Por qué las probabilidades posteriores suman 1?

Por Bayes:

P(Aᵢ|B)=P(Aᵢ)P(B|Aᵢ)/P(B).

Sumamos sobre todos los valores de i:

ΣP(Aᵢ|B) = [ΣP(Aᵢ)P(B|Aᵢ)]/P(B).

Por probabilidad total:

ΣP(Aᵢ)P(B|Aᵢ)=P(B).

Entonces:

ΣP(Aᵢ|B)=P(B)/P(B).

Como P(B)>0:

ΣP(Aᵢ|B)=1.

6.299. La tasa base importa

Una evidencia no debe interpretarse aislada de la frecuencia inicial del fenómeno que estamos estudiando.

Esa frecuencia previa recibe habitualmente el nombre de:

tasa base

En una aplicación de Bayes suele aparecer en:

P(A).

Una evidencia puede ser muy compatible con A y, aun así, la probabilidad posterior de A puede no ser grande si A era inicialmente muy poco frecuente o si la evidencia también es frecuente bajo alternativas.

6.300. Ejemplo 2 · Un sistema de detección hipotético

INTERMEDIO · ●●○○

Ejemplo exclusivamente matemático. Los porcentajes fueron elegidos para enseñar Bayes y no describen ningún sistema médico o tecnológico real.

Sea:

A = «la condición está presente»

+ = «el sistema produce una señal positiva».

Supongamos:

P(A)=0,01
tasa base 1 %
P(+|A)=0,95
95 % si A está presente
P(+|Ac)=0,10
10 % si A está ausente

Por complemento:

P(Ac)=0,99.

6.301. Primero calculamos la probabilidad total de una señal positiva

Una señal positiva puede aparecer por dos caminos:

A y positivo

o

Ac y positivo.

P(+)=P(A)P(+|A)+P(Ac)P(+|Ac)

=(0,01)(0,95)+(0,99)(0,10)

=0,0095+0,099

P(+)=0,1085=10,85 %

6.302. Ahora actualizamos mediante Bayes

Queremos:

P(A|+).

P(A|+)=P(+|A)P(A)/P(+)

=(0,95)(0,01)/0,1085

=0,0095/0,1085

≈0,0876≈8,76 %

P(+|A)=95 %, pero P(A|+)≈8,76 %.
Figura 6.72
Una tasa base pequeña puede cambiar radicalmente la interpretación de una evidencia
PROBABILIDAD PREVIA

P(A)=1 %

OBSERVAMOS UNA SEÑAL POSITIVA
PROBABILIDAD POSTERIOR

P(A|+)≈8,76 %

Nota. Elaboración propia con datos hipotéticos.

6.303. Frecuencias naturales: imaginemos 10.000 casos

Sustituyamos porcentajes abstractos por cantidades.

10.000 casos.

Como P(A)=1 %:

100 pertenecen a A
y
9.900 pertenecen a Ac.

Tabla 6.29
Frecuencias naturales del ejemplo hipotético
A PRESENTE

Total: 100

Positivos: 95

Negativos: 5

A AUSENTE

Total: 9.900

Positivos: 990

Negativos: 8.910

TOTAL

Casos: 10.000

Positivos: 1.085

Negativos: 8.915

Entre los 1.085 positivos:

95 pertenecen realmente al grupo A.

95/1.085≈0,0876≈8,76 %
Figura 6.73
Una señal positiva puede tener distintos orígenes
POSITIVO PROCEDENTE DE A

A está presente

+

se observa positivo

A∩+

POSITIVO PROCEDENTE DE Ac

A está ausente

+

se observa positivo

Ac∩+

Nota. Elaboración propia. Las etiquetas, y no únicamente los colores, distinguen los dos orígenes.

6.304. La falacia de la tasa base

La falacia de la tasa base consiste en ignorar o subestimar la frecuencia inicial de un fenómeno cuando interpretamos nueva evidencia.

«P(+|A)=95 %, por tanto P(A|+)=95 %».

Ese razonamiento es incorrecto porque confunde:

P(+|A)

con:

P(A|+).

También ignora cuántos casos pertenecen inicialmente a A y cuántos positivos pueden aparecer fuera de A.

6.305. P(B|A) alta no garantiza P(A|B) alta

Una evidencia muy frecuente cuando A ocurre puede seguir siendo poco concluyente si también aparece con frecuencia cuando A no ocurre o si A tiene una tasa base muy pequeña.

En otras palabras, no basta preguntar:

«¿qué tan compatible es B con A?»

También debemos preguntar:

«¿qué tan compatible es B con las alternativas a A?»

6.306. La evidencia debe compararse con alternativas

Saber únicamente:

P(B|A)=0,80

no determina cuánto debería aumentar nuestra probabilidad de A.

También necesitamos información como:

P(B|Ac).

Si ambas probabilidades son casi iguales, observar B discrimina muy poco entre A y Ac.

Si P(B|A) es mucho mayor, la evidencia favorece relativamente a A.

Una evidencia adquiere significado inferencial al compararse con explicaciones alternativas, no solo al examinar cuánto concuerda con una explicación particular.

6.307. Ejemplo 3 · Clasificación de un mensaje de correo

AVANZADO · ●●●○

Consideremos una aplicación no relacionada con sistemas de detección física.

Sea:

S = «el mensaje es correo no deseado»

W = «el mensaje contiene determinada palabra».

El modelo hipotético indica:

P(S)=0,20
P(Sc)=0,80
P(W|S)=0,60
P(W|Sc)=0,05

Nota. Modelo hipotético creado exclusivamente con fines didácticos.

6.308. Probabilidad total de observar la palabra

La palabra W puede aparecer en un mensaje no deseado o en uno que no pertenece a esa categoría.

P(W)=P(S)P(W|S)+P(Sc)P(W|Sc)

=(0,20)(0,60)+(0,80)(0,05)

=0,12+0,04

P(W)=0,16.

6.309. Actualizamos la clasificación mediante Bayes

Queremos:

P(S|W).

P(S|W)=P(W|S)P(S)/P(W)

=(0,60)(0,20)/0,16

P(S|W)=0,75=75 %

Antes de observar W:

P(S)=20 %.

Después de observar W:

P(S|W)=75 %.

W es mucho más frecuente bajo S que bajo Sc, por lo que constituye evidencia relativamente fuerte a favor de S en este modelo.

Figura 6.74
Una evidencia puede aumentar o disminuir la probabilidad de una hipótesis
ANTES DE OBSERVAR W

P(S)=20 %

OBSERVAMOS W
DESPUÉS DE OBSERVAR W

P(S|W)=75 %

Nota. Elaboración propia con datos hipotéticos.

6.310. Bayes no crea información

Una fórmula matemáticamente correcta no puede compensar información de entrada deficiente.

El resultado posterior depende de:

la probabilidad previa P(A);
la verosimilitud o P(B|A);
el comportamiento de B bajo las alternativas;
la estructura y los supuestos del modelo.

Bayes reorganiza cuantitativamente la información que recibe; no mejora automáticamente la calidad de esa información. Datos poco representativos, tasas base incorrectas o modelos mal especificados pueden producir una posterior poco útil aunque la aritmética sea impecable.

6.311. Razón de verosimilitudes: ¿cuánto discrimina la evidencia?

PROFUNDIZACIÓN · ●●●●

Cuando comparamos dos posibilidades complementarias A y Ac, podemos comparar directamente qué tan compatible es B con cada una:

razón de verosimilitudes = P(B|A) / P(B|Ac)

Si esta razón es:

>1
B favorece relativamente a A frente a Ac.
=1
B no discrimina entre ambas posibilidades.
<1
B favorece relativamente a Ac.

La razón de verosimilitudes mide la fuerza relativa de la evidencia, pero no sustituye la tasa base. Para obtener una probabilidad posterior todavía necesitamos combinar evidencia e información previa.

6.312. Otra representación: los momios

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Para una probabilidad p entre 0 y 1 definimos los momios:

momios = p/(1−p)

Si:

p=0,75,

entonces:

momios=0,75/0,25=3.

Esto puede leerse como:

3 a 1 a favor.

PARA PROFUNDIZAR · DEMOSTRACIÓN 23 · ●●●●

6.313. Bayes mediante momios

Para dos posibilidades complementarias A y Ac:

P(A|B)=P(B|A)P(A)/P(B)

y:

P(Ac|B) = P(B|Ac) P(Ac) /P(B).

Dividimos la primera expresión entre la segunda:

P(A|B)/P(Ac|B) = [P(B|A)P(A)] / [P(B|Ac)P(Ac)].

Reagrupando:

momios posteriores

=

momios previos

×

razón de verosimilitudes

momios posteriores = momios previos × P(B|A)/P(B|Ac)

6.314. El Teorema de Bayes y la inferencia bayesiana no son lo mismo

Tabla 6.30
Teorema de Bayes e inferencia bayesiana
TEOREMA DE BAYES

Es una identidad matemática entre probabilidades condicionadas.

Puede utilizarse en problemas elementales sin desarrollar un modelo estadístico bayesiano completo.

INFERENCIA BAYESIANA

Es un marco más amplio de modelación e inferencia estadística.

Puede involucrar parámetros, distribuciones previas, funciones de verosimilitud, distribuciones posteriores, predicción y decisiones.

En esta parte estudiamos principalmente el Teorema de Bayes, pero introducimos vocabulario que servirá más adelante para comprender la inferencia bayesiana universitaria.

6.315. Actualizaciones sucesivas

Supongamos que comenzamos con:

P(A).

Observamos una primera evidencia B₁:

P(A|B₁).

Si después aparece una segunda evidencia B₂, la nueva pregunta debe considerar la información acumulada:

P(A|B₁,B₂)

La posterior obtenida después de B₁ puede actuar como nueva previa para una etapa posterior, siempre que el modelo represente correctamente cómo se relacionan las evidencias.

Figura 6.75
Una actualización puede convertirse en el punto de partida de la siguiente
P(A)

probabilidad inicial

↓ B₁
P(A|B₁)

primera actualización

↓ B₂
P(A|B₁,B₂)

actualización con información acumulada

Nota. Elaboración propia.

Varias evidencias no pueden multiplicarse automáticamente como si fueran independientes. Sus relaciones de dependencia deben formar parte del modelo.

6.316. Probabilidad posterior no significa causalidad

Si después de observar B obtenemos:

P(A|B)=0,80,

hemos cuantificado la probabilidad de A bajo la información B.

Esto no demuestra automáticamente que:

A causó B

ni que:

B causó A.

Bayes actualiza probabilidades dentro de un modelo. Las afirmaciones causales requieren estructura causal, supuestos y evidencia adicionales.

6.317. Procedimiento práctico para una partición

Tabla 6.31
Procedimiento general para una actualización bayesiana
PASO 1

Identificar una partición A₁,…,Aₙ y registrar P(Aᵢ).

PASO 2

Registrar P(B|Aᵢ) para cada caso.

PASO 3

Calcular cada camino P(Aᵢ)P(B|Aᵢ).

PASO 4

Sumar los caminos para obtener P(B).

PASO 5

Dividir el camino de interés entre P(B).

PASO 6

Interpretar la posterior en el contexto y revisar los supuestos del modelo.

6.318. Dos comprobaciones muy útiles

Después de una actualización sobre una partición:

ΣP(Aᵢ|B)=1.

Además, cada probabilidad posterior debe satisfacer:

0≤P(Aᵢ|B)≤1.

Estas condiciones permiten detectar muchos errores de cálculo.

6.319. Errores frecuentes

Error 1

Confundir P(A|B) con P(B|A).

Responden preguntas diferentes.

Error 2

Ignorar la tasa base.

P(A) puede modificar radicalmente la posterior.

Error 3

Utilizar únicamente P(B|A).

Debemos considerar las alternativas capaces de producir B.

Error 4

Olvidar P(B).

El denominador normaliza todos los caminos compatibles con la evidencia.

Error 5

Promediar verosimilitudes sin ponderarlas.

Los pesos provienen de las probabilidades previas.

Error 6

Creer que evidencia favorable significa certeza.

Una posterior puede continuar muy por debajo de 1.

Error 7

Suponer independencia entre evidencias sin justificarla.

La dependencia debe incorporarse al modelo.

Error 8

Interpretar la posterior como prueba causal.

Bayes actualiza probabilidades; no establece causalidad por sí solo.

Error 9

Confundir verosimilitud con probabilidad posterior.

P(B|A) y P(A|B) cumplen funciones distintas.

6.320. Práctica de dificultad creciente

FUNDAMENTAL · ●○○○

Supongamos:

P(A)=0,30

P(B|A)=0,80

P(B)=0,40.

Calcula P(A|B).

Ver solución

P(A|B)=P(B|A)P(A)/P(B).

=(0,80)(0,30)/0,40.

P(A|B)=0,60=60 %.

INTERMEDIO · ●●○○

P(A)=0,25

P(B|A)=0,70

P(B|Ac)=0,20.

Calcula:
a) P(Ac);
b) P(B);
c) P(A|B).

Ver solución

a) P(Ac)=0,75.

b) P(B)=0,25(0,70)+0,75(0,20)=0,325.

c) P(A|B)=0,175/0,325≈0,5385≈53,85 %.

AVANZADO · ●●●○

Tres posibles fuentes A₁, A₂ y A₃ tienen probabilidades previas:

0,50; 0,30; 0,20.

La evidencia B aparece con probabilidades:

0,10; 0,30; 0,60,

respectivamente.

Calcula P(A₃|B).

Ver solución

P(B)=0,50(0,10)+0,30(0,30)+0,20(0,60)=0,26.

P(A₃|B)=0,20(0,60)/0,26≈0,4615≈46,15 %.

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Supón dos posibilidades complementarias A y Ac con:

P(A)=0,20, P(B|A)=0,60, P(B|Ac)=0,05.

Calcula:

a) los momios previos de A;
b) la razón de verosimilitudes;
c) los momios posteriores;
d) transforma los momios posteriores nuevamente en probabilidad.

Ver solución

a) momios previos=0,20/0,80=0,25.

b) razón de verosimilitudes=0,60/0,05=12.

c) momios posteriores=0,25×12=3.

d) si los momios son 3, p=3/(1+3)=0,75=75 %.

6.321. Actividad guiada · Las tres máquinas

Una fábrica hipotética utiliza:

M₁: 50 %   ·   M₂: 30 %   ·   M₃: 20 %.

Sus probabilidades de defecto son:

P(D|M₁)=0,01

P(D|M₂)=0,03

P(D|M₃)=0,06.

1. Calcula P(M₁∩D).

2. Calcula P(M₂∩D).

3. Calcula P(M₃∩D).

4. Calcula P(D).

5. Calcula P(M₁|D).

6. Calcula P(M₂|D).

7. Calcula P(M₃|D).

8. Comprueba que las posteriores suman 1.

9. ¿Qué máquina aumenta más su representación entre las piezas defectuosas?

Ver solución

P(M₁∩D)=0,50(0,01)=0,005.

P(M₂∩D)=0,30(0,03)=0,009.

P(M₃∩D)=0,20(0,06)=0,012.

P(D)=0,005+0,009+0,012=0,026.

P(M₁|D)=0,005/0,026≈19,23 %.

P(M₂|D)=0,009/0,026≈34,62 %.

P(M₃|D)=0,012/0,026≈46,15 %.

0,1923+0,3462+0,4615=1,0000.

M₃ pasa de representar 20 % de la producción a aproximadamente 46,15 % de las piezas defectuosas.

Nota. Datos hipotéticos creados exclusivamente con fines didácticos.

6.322. Reto de tasa base

P(A)=0,05

P(B|A)=0,90

P(B|Ac)=0,20.

1. Calcula P(Ac).

2. Calcula P(B).

3. Calcula P(A|B).

4. Compara P(B|A)=90 % con P(A|B).

5. Explica por qué las cantidades son tan diferentes.

Ver solución

P(Ac)=0,95.

P(B)=0,05(0,90)+0,95(0,20)=0,235.

P(A|B)=0,045/0,235≈0,1915.

P(A|B)≈19,15 %.

Aunque B es muy frecuente cuando A ocurre, A tiene una tasa base pequeña y B también aparece con una probabilidad considerable bajo Ac.

6.323. Comprueba lo aprendido

1. ¿Qué problema permite resolver el Teorema de Bayes?

2. Explica la diferencia entre P(A|B) y P(B|A).

3. ¿Por qué «invertir la condición» no significa intercambiar A y B?

4. Escribe la fórmula básica de Bayes.

5. Demuestra la fórmula a partir de la probabilidad condicional.

6. ¿Qué representa P(A)?

7. ¿Qué representa P(B|A)?

8. ¿En qué sentido P(B|A) puede funcionar como verosimilitud?

9. ¿Por qué una verosimilitud no es necesariamente una distribución de probabilidad sobre A?

10. ¿Qué representa P(B)?

11. ¿Qué representa P(A|B)?

12. ¿Por qué la probabilidad total aparece en el denominador?

13. Escribe la fórmula general de Bayes para una partición.

14. ¿Por qué las posteriores de una partición suman 1?

15. ¿Qué es una tasa base?

16. ¿Qué es la falacia de la tasa base?

17. ¿Por qué P(B|A) alta no garantiza P(A|B) alta?

18. ¿Qué utilidad tienen las frecuencias naturales?

19. ¿Qué es una razón de verosimilitudes?

20. ¿Qué son los momios?

21. Explica la relación entre momios previos, razón de verosimilitudes y momios posteriores.

22. ¿Qué diferencia existe entre el Teorema de Bayes y la inferencia bayesiana?

23. ¿Cómo deben tratarse dos evidencias sucesivas B₁ y B₂?

24. ¿Puede una probabilidad posterior demostrar causalidad?

25. ¿Por qué la calidad de los datos y de los supuestos es tan importante como la fórmula?

Ver respuestas breves

1. Permite calcular una probabilidad condicionada en una dirección utilizando información disponible en la dirección contraria, probabilidades previas y la probabilidad de la evidencia.

2. Cambia cuál evento actúa como condición.

3. Porque la inversión correcta requiere ponderar por P(A) y normalizar mediante P(B).

4. P(A|B)=P(B|A)P(A)/P(B).

5. Sustituimos P(A∩B)=P(A)P(B|A) en P(A|B)=P(A∩B)/P(B).

6. La probabilidad previa de A.

7. La probabilidad de la evidencia B bajo A.

8. Cuando B está fijado y comparamos diferentes posibilidades para A.

9. Porque al variar A sus valores no tienen por qué sumar o integrar 1.

10. La probabilidad total de observar B mediante todos los caminos considerados.

11. La probabilidad posterior de A después de incorporar B.

12. Porque reúne y normaliza todos los caminos que pueden producir B.

13. P(Aⱼ|B)=P(B|Aⱼ)P(Aⱼ)/[ΣP(Aᵢ)P(B|Aᵢ)].

14. Porque forman una nueva distribución sobre la partición condicionada a B.

15. La frecuencia o probabilidad previa de una posibilidad antes de incorporar la evidencia.

16. Ignorar o subestimar la tasa base al interpretar evidencia.

17. Porque B puede aparecer también bajo alternativas y A puede ser inicialmente poco frecuente.

18. Transforman porcentajes en cantidades y hacen visibles los distintos orígenes de la evidencia.

19. P(B|A)/P(B|Ac) en el caso de dos alternativas complementarias.

20. La razón p/(1−p).

21. Momios posteriores = momios previos × razón de verosimilitudes.

22. Bayes es una identidad matemática; la inferencia bayesiana es un marco estadístico más amplio.

23. La segunda actualización debe considerar la información acumulada y la dependencia entre evidencias.

24. No. Una posterior no demuestra causalidad.

25. Porque Bayes reorganiza las cantidades introducidas; no corrige automáticamente datos o supuestos deficientes.

6.324. Mapa conceptual

Figura 6.76
El camino completo hacia el Teorema de Bayes
PROBABILIDAD PREVIA

P(Aᵢ)

EVIDENCIA BAJO CADA POSIBILIDAD

P(B|Aᵢ)

CAMINOS HACIA B

P(Aᵢ)P(B|Aᵢ)

PROBABILIDAD TOTAL DE LA EVIDENCIA

P(B)=ΣP(Aᵢ)P(B|Aᵢ)

P(Aⱼ|B) = P(B|Aⱼ)P(Aⱼ) / [ΣP(Aᵢ)P(B|Aᵢ)]

Nota. Elaboración propia.

6.325. Síntesis

El Teorema de Bayes permite cambiar correctamente la dirección de una probabilidad condicionada.

En general:

P(A|B)≠P(B|A).

La fórmula básica es:

P(A|B)=P(B|A)P(A)/P(B),

para P(B)>0.

Esta relación nace directamente de:

P(A|B)=P(A∩B)/P(B)

y:

P(A∩B)=P(A)P(B|A).

Si A₁,…,Aₙ forman una partición:

P(B)=ΣP(Aᵢ)P(B|Aᵢ),

de modo que:

P(Aⱼ|B) = P(B|Aⱼ)P(Aⱼ) / [ΣP(Aᵢ)P(B|Aᵢ)].

P(A) representa la probabilidad previa; P(B|A) describe la compatibilidad de la evidencia con A; P(B) reúne todos los caminos hacia la evidencia; y P(A|B) es la probabilidad posterior.

Cuando B se considera fijo y comparamos distintos valores o hipótesis A, P(B|A) desempeña el papel de verosimilitud. Esa verosimilitud no es, en general, una distribución de probabilidad sobre A.

La tasa base es fundamental. Una P(B|A) alta no implica necesariamente una P(A|B) alta.

Las frecuencias naturales permiten visualizar este fenómeno contando directamente los casos compatibles con la evidencia.

En el nivel avanzado:

momios posteriores = momios previos × razón de verosimilitudes.

Para una partición:

ΣP(Aᵢ|B)=1.

Las actualizaciones pueden realizarse sucesivamente, pero las dependencias entre evidencias deben incorporarse correctamente al modelo.

El Teorema de Bayes es una identidad de probabilidad; la inferencia bayesiana es un marco estadístico más amplio.

Finalmente, Bayes no crea información ni demuestra causalidad. Su resultado depende de los datos, probabilidades y supuestos utilizados.

La pregunta central no es solamente: «¿qué tan compatible es la evidencia con mi explicación?», sino también: «¿qué otras explicaciones podrían haber producido esa misma evidencia?»

Bayes no consiste en invertir dos letras alrededor de una barra.

Consiste en comparar el camino que nos interesa con todos los caminos capaces de producir la evidencia observada.

SIGUIENTE
Parte 11 de 18 · Variables aleatorias
Pasaremos de describir resultados mediante eventos a construir funciones que asignan valores numéricos a los resultados de un experimento aleatorio.
La numeración continuará en 6.326.

Referencias

Bayes, T. (1763). An essay towards solving a problem in the doctrine of chances. Philosophical Transactions of the Royal Society of London, 53, 370–418.

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 11 DE 18
CAPÍTULO 6

Variables aleatorias

Convertir resultados aleatorios en números que podamos estudiar

resultado ω · regla X · valor X(ω) · eventos numéricos · distribuciones discretas y continuas

Idea central

Un experimento aleatorio produce un resultado. Una variable aleatoria toma ese resultado y le asigna un número.

Esta transformación permite pasar de:

resultados y eventos

a

valores numéricos y probabilidades sobre esos valores.

Este paso constituye el puente entre la teoría elemental de eventos y el estudio de distribuciones de probabilidad, esperanza, varianza y modelos estadísticos.

Al finalizar esta parte podrás:
explicar qué es una variable aleatoria;
interpretar X: Ω → ℝ;
distinguir ω, X(ω), X y x;
comprender la idea universitaria de medibilidad;
distinguir espacio muestral, imagen y soporte;
interpretar eventos mediante preimágenes de X;
reconocer variables discretas, absolutamente continuas y mixtas;
distinguir magnitud, modelo, instrumento y dato registrado;
construir variables indicadoras;
construir transformaciones Y=g(X);
distinguir una variable aleatoria de sus realizaciones observadas;
comprender cómo X induce una distribución de probabilidad sobre sus valores.

6.326. Del resultado al número

Supongamos que lanzamos dos monedas equilibradas.

Utilizaremos:

C = cara    y    S = sello.

El espacio muestral es:

Ω={CC,CS,SC,SS}

Cada resultado conserva toda la información sobre el orden de los dos lanzamientos.

Pero imaginemos que nuestra pregunta es:

¿Cuántas caras aparecieron?

6.327. Una regla: contar las caras

Podemos asignar un número a cada resultado:

CC
2
CS
1
SC
1
SS
0

Hemos construido una regla que transforma cada resultado del experimento en un número.

Llamaremos X a esa regla:

X = número de caras obtenidas
Figura 6.77
Una variable aleatoria transforma un resultado en un valor numérico
RESULTADO DEL EXPERIMENTO

ω=CS

REGLA X

contar el número de caras

VALOR NUMÉRICO

X(CS)=1

Nota. Elaboración propia. La regla X es fija; lo incierto es qué resultado ω ocurrirá.

6.328. Definición de variable aleatoria

Una variable aleatoria es una función que asigna un número real a cada resultado del espacio muestral.

En el nivel elemental se representa mediante:

X: Ω → ℝ

X es el nombre de la variable aleatoria.

Ω es el espacio muestral.

es el conjunto de los números reales.

6.329. Definición universitaria: una variable aleatoria debe ser medible

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

En un curso universitario riguroso no trabajamos únicamente con Ω, sino con un espacio de probabilidad:

(Ω, 𝓕, P)

donde:

Ω contiene los resultados posibles;

𝓕 contiene los eventos a los que podemos asignar probabilidad;

P asigna probabilidades a esos eventos.

Formalmente, una variable aleatoria real es una función:

X:(Ω,𝓕) → (ℝ,𝓑(ℝ))

que es medible.

Sin desarrollar todavía toda la teoría de conjuntos de Borel, la idea esencial es esta:

Si formulamos una condición numérica sobre X, los resultados de Ω que satisfacen esa condición deben formar un evento al que podamos asignar probabilidad.

En particular, para todo número real a debe tener sentido probabilístico:

{ω∈Ω : X(ω)≤a}.

Esta condición técnica es la que permite escribir rigurosamente:

P(X≤a).

6.330. ¿Qué significa X(ω)?

El símbolo:

ω

representa un resultado elemental del experimento.

La expresión:

X(ω)

representa el número que X asigna a ese resultado.

Por ejemplo:

ω=CS

resultado elemental

X(ω)=1

valor de la variable

Tabla 6.32
Resultado elemental y valor de una variable aleatoria
ω

Resultado elemental

Conserva la descripción del resultado del experimento.

Ejemplo: CS.

X(ω)

Valor de la variable

Es el número asignado por la regla X.

Ejemplo: 1.

6.331. X y x: variable aleatoria y valor observado

En probabilidad y estadística es habitual utilizar:

X

mayúscula

representa la variable aleatoria como objeto del modelo.

x

minúscula

puede representar un valor posible o un valor concreto observado.

Por ejemplo:

X = número de caras en dos lanzamientos.

Si realizamos el experimento y obtenemos CS:

X(CS)=1.

Podemos registrar esa realización como:

x=1.

Tabla 6.33
Notación del modelo y de los valores observados
X

variable aleatoria

ω

resultado elemental

X(ω)

valor producido por X

x

valor posible o realización observada

6.332. ¿Por qué se llama «aleatoria» si la regla es fija?

La función:

X = «contar caras»

no cambia al azar.

Si ocurre CS:

X(CS)=1.

Si ocurre SS:

X(SS)=0.

Lo aleatorio no es la regla X. Lo incierto es qué resultado ω ocurrirá y, como consecuencia, qué valor X(ω) observaremos.

6.333. Resultados diferentes pueden producir el mismo valor

En nuestro ejemplo:

X(CS)=1

y

X(SC)=1.

CS y SC son resultados diferentes. Sin embargo, ambos contienen exactamente una cara.

Figura 6.78
Una variable aleatoria puede reunir varios resultados bajo un mismo valor
SS
0
CS
1
SC
1
CC
2
Cuatro resultados elementales producen solamente tres valores de X: 0, 1 y 2.

Nota. Elaboración propia.

6.334. Una variable aleatoria selecciona la información que necesitamos

El resultado elemental puede contener más información de la necesaria para nuestra pregunta.

Por ejemplo:

ω=CS

informa que primero apareció cara y luego sello.

En cambio:

X(ω)=1

conserva únicamente la información necesaria para contar caras.

Una variable aleatoria puede entenderse como una forma de resumir numéricamente un resultado según la pregunta que queremos estudiar.

6.335. Un mismo experimento puede producir muchas variables aleatorias

EJEMPLO 1 · INTERMEDIO · ●●○○

Lanzamos un dado equilibrado:

Ω={1,2,3,4,5,6}.

A partir del mismo resultado podemos definir variables diferentes.

Variable X

número obtenido

Si sale 4: X=4.

Variable Y

1 si el número es par y 0 si es impar

Si sale 4: Y=1.

Variable Z

cuadrado del número obtenido

Si sale 4: Z=16.

El experimento es el mismo. Lo que cambia es la pregunta matemática que queremos responder.

6.336. El nombre X no tiene significado por sí solo

Escribir solamente:

X

no basta.

Debemos definir qué representa la variable.

Buena definición:

X = número de caras obtenidas en dos lanzamientos.

Definición insuficiente:

X = resultado.

Una variable bien definida debe permitir determinar sin ambigüedad qué número corresponde a cada resultado.

6.337. Los valores posibles de una variable

Para:

X = número de caras en dos lanzamientos,

los únicos valores posibles son:

{0,1,2}

No puede ocurrir X=3 porque solamente hay dos lanzamientos.

Tampoco puede ocurrir X=1,5, porque el número de caras es un conteo entero.

6.338. Espacio muestral, imagen de X y soporte

Conviene distinguir cuidadosamente varios conjuntos.

ESPACIO MUESTRAL Ω

Contiene los resultados elementales.

{CC,CS,SC,SS}

IMAGEN X(Ω)

Contiene todos los valores realmente producidos por X.

{0,1,2}

Formalmente:

X(Ω)={X(ω):ω∈Ω}

En una variable discreta resulta también útil definir:

soporte discreto = {x : P(X=x)>0}

En nuestro ejemplo:

soporte={0,1,2}.

Imagen y soporte no son conceptos idénticos en toda la teoría. Para variables discretas elementales suelen coincidir. En distribuciones más generales, el soporte posee una definición probabilística y topológica más amplia.

6.339. De un valor numérico nuevamente a un evento

Una variable aleatoria lleva resultados hacia números.

Pero cuando queremos calcular probabilidades, hacemos conceptualmente el recorrido inverso.

Por ejemplo:

X=1

significa:

«obtener exactamente una cara».

Los resultados que producen ese valor son:

{CS,SC}.

6.340. La preimagen: el camino de los números hacia Ω

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Si B es un conjunto de valores numéricos, la preimagen de B mediante X es:

X−1(B)={ω∈Ω : X(ω)∈B}

El símbolo X−1 aquí indica preimagen; no significa necesariamente que X posea una función inversa.

Si:

B={1},

entonces:

X−1({1})={CS,SC}.

Figura 6.79
Para calcular probabilidades buscamos la preimagen de una condición numérica
CONJUNTO DE VALORES

B={1}

↓ preimagen
X−1(B)
{CS,SC}
P(X∈B)=P({CS,SC})

Nota. Elaboración propia.

6.341. La notación P(X=1)

Podemos escribir:

P(X=1)

Esto significa:

P({ω∈Ω : X(ω)=1}).

En nuestro ejemplo:

P(X=1)=P({CS,SC}).

Como los cuatro resultados son equiprobables:

P(X=1)=2/4=1/2=0,50

6.342. Podemos construir muchos eventos mediante X

Con:

X = número de caras,

podemos formular:

X=0

ninguna cara

X=1

exactamente una cara

X≥1

al menos una cara

X<2

menos de dos caras

PARA PROFUNDIZAR · DEMOSTRACIÓN 24 · ●●●●

6.343. Una condición sobre X representa un evento

Sea:

X = número de caras en dos lanzamientos.

Consideremos:

X≥1.

Revisamos cada resultado:

CC → X=2 → cumple

CS → X=1 → cumple

SC → X=1 → cumple

SS → X=0 → no cumple.

Por tanto:

{X≥1}={CC,CS,SC}.

En consecuencia:

P(X≥1)=3/4.

Esta es también la intuición detrás de la medibilidad: las condiciones numéricas que planteamos sobre X deben corresponder a eventos probabilísticamente válidos en Ω.

6.344. Ejemplo 2 · La suma de dos dados

INTERMEDIO · ●●○○

Lanzamos dos dados equilibrados.

Un resultado elemental se representa mediante:

ω=(dado 1,dado 2).

Definimos:

X = suma de los dos dados

X(2,5)=7

X(3,4)=7

X(6,1)=7.

Muchos resultados diferentes pueden producir el mismo valor.

6.345. Los valores posibles de la suma

El menor valor es:

1+1=2.

El mayor:

6+6=12.

Por tanto:

X∈{2,3,4,5,6,7,8,9,10,11,12}

Que X tenga once valores posibles no significa que sean igualmente probables. Saber qué valores puede tomar X es distinto de saber cómo se reparte la probabilidad entre ellos.

Figura 6.80
Seis resultados diferentes producen la suma 7
(1,6)

7
(2,5)

7
(3,4)

7
(4,3)

7
(5,2)

7
(6,1)

7

Nota. Elaboración propia.

6.346. Variable aleatoria discreta

En el nivel elemental, una variable aleatoria es discreta cuando sus valores relevantes forman un conjunto finito o numerable.

Ejemplos:

número de caras;
número de estudiantes ausentes;
número de llamadas recibidas;
suma de dos dados.

Definición probabilística

X es discreta si existe un conjunto finito o numerable S tal que:

P(X∈S)=1.

En la siguiente parte estudiaremos cómo asignar una probabilidad P(X=x) a cada uno de esos valores.

6.347. Discreta no significa necesariamente «pocos valores»

Una variable discreta puede tener infinitos valores posibles.

Por ejemplo:

X = número de lanzamientos necesarios hasta obtener la primera cara.

Sus valores son:

1,2,3,4,5,…

No existe un último valor. Aun así, pueden enumerarse uno por uno.

6.348. Variable aleatoria continua: primera aproximación

En los modelos elementales, una variable continua suele representar una magnitud cuyos valores pueden recorrer intervalos de los números reales.

Ejemplos frecuentes:

tiempo
longitud
masa
temperatura
Figura 6.81
Valores enumerables frente a una escala modelada continuamente
DISCRETA
● ● ● ● ●
0   1   2   3   4
MODELO CONTINUO
12 13 14 15

Nota. Elaboración propia.

6.349. Precisión universitaria: «continua» y «con densidad»

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

En cursos introductorios, la expresión variable continua suele utilizarse para variables que poseen una función de densidad.

El término matemático más preciso en ese caso es:

variable absolutamente continua

Existe entonces una función f tal que:

P(a<X≤b)

se obtiene mediante el área bajo f entre a y b.

Más adelante escribiremos formalmente esta idea mediante integrales.

Una consecuencia importante es:

P(X=x)=0

para cualquier valor individual x en una distribución absolutamente continua.

La teoría completa es más rica que la división «discreta o con densidad». Existen también distribuciones mixtas y distribuciones continuas singulares.

6.350. No todas las distribuciones son puramente discretas o puramente continuas

PROFUNDIZACIÓN · ●●●●

Imaginemos una máquina.

Con probabilidad 0,10 se detiene inmediatamente:

P(X=0)=0,10.

Si no se detiene inmediatamente, su tiempo de funcionamiento se modela continuamente para X>0.

Esta variable posee:

componente discreta

una masa de probabilidad en X=0

componente continua

valores positivos modelados mediante una densidad

Decimos que se trata de una distribución mixta.

Figura 6.82
Una distribución mixta combina masa puntual y componente continua
X=0

P(X=0)=0,10

X>0

componente continua

Nota. Elaboración propia. Esquema conceptual, no gráfico de una densidad específica.

6.351. Modelo continuo e instrumento de medición no son lo mismo

Supongamos:

T = tiempo empleado en recorrer una distancia.

Podemos construir un modelo matemático continuo para T.

Pero un cronómetro real posee resolución finita. Podría mostrar:

12,34 s.

El instrumento no registra infinitas cifras decimales.

Modelo matemático y registro instrumental son objetos distintos. Una magnitud puede modelarse continuamente aunque los datos observados aparezcan cuantizados por la resolución del instrumento.

Figura 6.83
Una magnitud continua puede registrarse mediante valores separados
MAGNITUD MODELADA CONTINUAMENTE
RESOLUCIÓN DEL INSTRUMENTO: 0,01 s
12,32
12,33
12,34
12,35
12,36

Nota. Elaboración propia. Los números ilustran una resolución de 0,01 s.

6.352. La clasificación depende del modelo y de lo que registramos

Consideremos la edad.

Si registramos:

12, 13, 14, 15 años,

los datos aparecen como enteros.

Pero la edad como magnitud temporal puede tomar valores intermedios:

12,5 años;   12,51 años;   etc.

Que una magnitud se registre mediante enteros no demuestra que la magnitud subyacente sea discreta.

Podemos distinguir:

MAGNITUD

edad exacta

MODELO

variable X continua

REGLA DE REGISTRO

años cumplidos

DATO

por ejemplo, 12

Si Y representa la edad en años cumplidos, podemos pensar conceptualmente en una transformación de X:

Y=⌊X⌋,

donde ⌊X⌋ representa la parte entera inferior.

Tabla 6.34
Diferencia conceptual entre modelos discretos y absolutamente continuos
DISCRETA

La probabilidad se concentra en valores finitos o numerables.

Ejemplo: número de estudiantes ausentes.

0,1,2,3,…

ABSOLUTAMENTE CONTINUA

La probabilidad se describe mediante una densidad.

Ejemplo: tiempo de espera.

t≥0

6.353. Ejemplo 3 · Tiempo de espera

AVANZADO · ●●●○

Una persona espera la llegada de un autobús.

Definimos:

T = tiempo de espera, en minutos

Si utilizamos un modelo continuo:

T≥0.

Podemos formular eventos:

T≤5

esperar como máximo 5 minutos

T>10

esperar más de 10 minutos

3<T≤8

esperar más de 3 y como máximo 8 minutos

Todavía no hemos definido cuánto vale la probabilidad de esos intervalos. Primero definimos la variable y los eventos.

6.354. Un número asignado a una categoría no siempre representa una magnitud cuantitativa

Supongamos:

rojo → 1
azul → 2
verde → 3.

Matemáticamente hemos definido una codificación numérica.

Pero esto no significa que:

verde sea «tres veces» rojo

ni que:

3−1=2

tenga automáticamente una interpretación física respecto del color.

Codificar categorías mediante números puede producir formalmente una variable real-valuada, pero no convierte por sí sola la categoría en una escala cuantitativa. Promedios, distancias y cocientes deben tener significado en el contexto.

6.355. Una variable de 0 y 1: la variable indicadora

Sea A un evento cualquiera.

Definimos:

IA(ω)=1 si ω∈A

IA(ω)=0 si ω∉A

Esta variable recibe el nombre de variable indicadora del evento A.

También puede escribirse:

1A.

Convierte una pregunta de «sí o no» en una variable numérica.

Más adelante aparecerá una identidad especialmente importante: E(IA)=P(A). La estudiaremos cuando introduzcamos esperanza matemática.

6.356. Ejemplo 4 · Variable indicadora en un dado

Lanzamos un dado.

Sea:

A = «el resultado es par».

Entonces:

IA=1 si sale 2, 4 o 6

IA=0 si sale 1, 3 o 5.

Esta variable no conserva cuál número exacto apareció. Solo conserva si ocurrió A.

6.357. Transformar una variable aleatoria

Una vez definida X, podemos construir una nueva variable aplicando una función g:

Y=g(X)

Más explícitamente:

Y(ω)=g(X(ω)).

En el tratamiento universitario, si X es medible y g es una función medible apropiada —como las funciones usuales que empleamos en cálculo—, entonces Y=g(X) también es una variable aleatoria.

6.358. Ejemplo 5 · De Celsius a Fahrenheit

Sea:

X = temperatura en grados Celsius.

Definimos:

Y=1,8X+32

Y representa la misma temperatura en grados Fahrenheit.

Si:

X=20 °C,

entonces:

Y=1,8(20)+32=68 °F.

La incertidumbre pertenece al valor que tomará X; la transformación es determinista.

Figura 6.84
Una variable puede transformarse mediante una regla matemática
X

temperatura en °C

g(x)=1,8x+32
Y=g(X)

temperatura en °F

Nota. Elaboración propia.

6.359. La cuantización también puede verse como una transformación

AVANZADO · ●●●○

Retomemos el tiempo T modelado continuamente.

Si un instrumento registra centésimas de segundo, podemos definir:

Y = tiempo registrado por el instrumento.

Entonces Y puede entenderse como una transformación de T mediante una regla de redondeo.

Por ejemplo:

T=12,3437… s

puede registrarse como

Y=12,34 s.

Una variable continua puede producir, después de redondeo o cuantización, una variable observada cuyos valores pertenezcan a un conjunto discreto. Esto no cambia retrospectivamente la naturaleza del modelo original T.

6.360. Variable aleatoria y datos observados no son lo mismo

Sea:

X = número de caras en dos lanzamientos.

X está definida antes de realizar el experimento.

Repetimos el experimento diez veces y observamos:

1, 0, 2, 1, 1, 2, 0, 1, 2, 1

Estos números son realizaciones observadas de X.

En notación estadística podríamos representarlos como:

x₁,x₂,…,x₁₀.

Tabla 6.35
Modelo probabilístico y datos observados
VARIABLE ALEATORIA X

Pertenece al modelo.

Describe los valores posibles antes de conocer la realización concreta.

DATOS x₁,…,xₙ

Son valores efectivamente observados.

Constituyen realizaciones de las variables del modelo.

Modelo ≠ datos. La variable aleatoria describe posibilidades y probabilidades; los datos indican qué valores se observaron realmente.

6.361. Una variable aleatoria induce su propia distribución de probabilidad

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Esta es una de las ideas más importantes de toda la teoría.

El espacio original Ω posee probabilidades. La variable X agrupa los resultados según los números que produce.

De esta manera, X transporta la probabilidad de Ω hacia los números reales.

Para un conjunto B de números reales definimos:

PX(B)=P(X∈B)

=P(X−1(B))

PX recibe el nombre de:

distribución o ley de X
Figura 6.85
La variable X transporta la probabilidad desde Ω hacia sus valores
ESPACIO MUESTRAL Ω

resultados + probabilidades

↓ X
VALORES NUMÉRICOS
DISTRIBUCIÓN DE X

PX(B)=P(X∈B)

Nota. Elaboración propia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 25 · ●●●●

6.362. Construimos la distribución de X a partir de Ω

En dos lanzamientos de monedas equilibradas:

Ω={CC,CS,SC,SS}.

Cada resultado tiene probabilidad:

1/4.

Si X cuenta el número de caras:

X=0 ← {SS}

X=1 ← {CS,SC}

X=2 ← {CC}.

Sumamos las probabilidades de los resultados pertenecientes a cada preimagen:

P(X=0)=1/4

P(X=1)=2/4=1/2

P(X=2)=1/4.

Comprobamos:

1/4+1/2+1/4=1.

Esta es precisamente la pregunta que desarrollaremos en la Parte 12: ¿cómo describimos sistemáticamente la probabilidad asociada a cada valor de una variable discreta?

6.363. Errores frecuentes

Error 1

Confundir ω con X(ω).

ω es un resultado; X(ω) es un número.

Error 2

Creer que X cambia aleatoriamente su regla.

La regla es fija; el resultado es incierto.

Error 3

Creer que resultados distintos deben dar valores distintos.

Una variable puede agrupar resultados.

Error 4

Confundir Ω con X(Ω).

Uno contiene resultados y el otro valores numéricos.

Error 5

Confundir imagen con soporte en todos los contextos.

Coinciden en muchos ejemplos discretos, pero no son conceptos idénticos en general.

Error 6

Pensar que toda variable numérica es continua.

Un conteo puede ser discreto.

Error 7

Pensar que un instrumento con pocos decimales hace discreta la magnitud subyacente.

Modelo y registro son diferentes.

Error 8

Creer que asignar 1, 2 y 3 a categorías crea una escala métrica.

La interpretación de las operaciones debe justificarse.

Error 9

Confundir X con los datos x₁,…,xₙ.

X pertenece al modelo; los x observados son realizaciones.

Error 10

Creer que toda distribución es solamente discreta o con densidad.

Existen distribuciones mixtas y otras formas más generales.

Error 11

Interpretar X−1(B) como una división.

Aquí representa una preimagen.

Error 12

Creer que los valores posibles son automáticamente equiprobables.

La distribución debe determinarse por separado.

6.364. Práctica de dificultad creciente

FUNDAMENTAL · ●○○○

Se lanzan tres monedas y se define:

X = número de caras.

a) ¿Cuál es el menor valor de X?
b) ¿Cuál es el mayor?
c) Escribe todos los valores posibles.

Ver solución

Menor: 0.

Mayor: 3.

X(Ω)={0,1,2,3}.

INTERMEDIO · ●●○○

Se lanzan dos dados y definimos:

X = máximo de los dos resultados.

1. Calcula X(2,5).
2. Calcula X(6,3).
3. Determina X(Ω).
4. Enumera la preimagen de {2}.

Ver solución

X(2,5)=5.

X(6,3)=6.

X(Ω)={1,2,3,4,5,6}.

X−1({2})={(1,2),(2,1),(2,2)}.

AVANZADO · ●●●○

Se lanzan dos dados y:

X=|dado 1−dado 2|.

1. Calcula X(2,5).
2. Calcula X(6,1).
3. Determina X(Ω).
4. Encuentra {X=0}.
5. Encuentra {X=5}.

Ver solución

X(2,5)=3.

X(6,1)=5.

X(Ω)={0,1,2,3,4,5}.

{X=0}={(1,1),(2,2),(3,3),(4,4),(5,5),(6,6)}.

{X=5}={(1,6),(6,1)}.

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Sea X una variable aleatoria y B⊂ℝ.

Explica con tus palabras la diferencia entre:

X(B)

y

X−1(B).

Ver orientación

X lleva elementos del dominio Ω hacia valores reales.

La preimagen X−1(B) busca todos los resultados ω de Ω cuyos valores X(ω) pertenecen al conjunto B.

6.365. Actividad de modelación · Una misma realidad, distintas variables

Seleccionamos al azar un día escolar y registramos el número de estudiantes ausentes de un grupo.

Propón una variable para cada pregunta:

1. ¿Cuántos estudiantes faltaron?

2. ¿Faltó al menos un estudiante?

3. ¿La cantidad de ausentes superó 5?

4. ¿Qué variable utilizarías para representar el porcentaje de estudiantes presentes?

Ver una posible respuesta

X = número de estudiantes ausentes.

Y = 1 si X≥1 y 0 si X=0.

Z = 1 si X>5 y 0 si X≤5.

W = porcentaje de estudiantes presentes. Su definición debe especificar el total de estudiantes del grupo.

6.366. Después del razonamiento manual: simulación en Excel

Podemos simular dos lanzamientos de una moneda equilibrada utilizando 1 para cara y 0 para sello.

En A2:

=SI(ALEATORIO()<0,5;1;0)

En B2:

=SI(ALEATORIO()<0,5;1;0)

En C2:

=A2+B2

C2 es una realización de:

X = número de caras.

ALEATORIO() es una función volátil: al recalcular la hoja, los valores pueden cambiar.

Si deseamos conservar una simulación concreta, podemos copiar las celdas y pegarlas como valores.

La hoja de cálculo genera realizaciones del modelo; no define por nosotros cuál debe ser X.

6.367. Comprueba lo aprendido

1. ¿Qué es una variable aleatoria?

2. ¿Qué significa X: Ω → ℝ?

3. ¿Qué representa ω?

4. ¿Qué representa X(ω)?

5. ¿Qué diferencia existe entre X y x?

6. ¿Por qué X se llama aleatoria si su regla es fija?

7. ¿Pueden dos resultados diferentes producir el mismo valor?

8. ¿Qué es X(Ω)?

9. ¿Qué es el soporte de una variable discreta?

10. ¿Por qué imagen y soporte no deben identificarse siempre?

11. ¿Qué representa X−1(B)?

12. ¿Qué significa P(X=2)?

13. ¿Qué significa P(X≤a)?

14. ¿Qué relación existe entre estas condiciones y la medibilidad?

15. ¿Qué caracteriza a una variable discreta?

16. ¿Puede una variable discreta tener infinitos valores?

17. ¿Qué entendemos por variable absolutamente continua?

18. ¿Qué ocurre con P(X=x) en una distribución absolutamente continua?

19. ¿Qué es una distribución mixta?

20. ¿Por qué la resolución instrumental no determina por sí sola la naturaleza del modelo?

21. ¿Por qué registrar edades enteras no demuestra que la edad sea discreta?

22. ¿Qué es una variable indicadora?

23. ¿Qué significa Y=g(X)?

24. ¿Cómo puede el redondeo transformar una variable continua en una variable registrada discreta?

25. ¿Qué diferencia existe entre X y los datos x₁,…,xₙ?

26. ¿Por qué codificar colores mediante números no crea necesariamente una escala cuantitativa?

27. ¿Qué significa PX(B)=P(X∈B)?

28. ¿Cómo induce X una distribución de probabilidad?

29. ¿Qué pregunta natural aparece después de conocer los valores posibles de X?

Ver respuestas breves

1. Una función medible que asigna números reales a resultados del experimento.

2. Que X lleva resultados de Ω a números reales.

3. Un resultado elemental.

4. El número asignado por X al resultado ω.

5. X es la variable; x representa un valor posible o observado.

6. Porque lo incierto es qué resultado ocurrirá y qué valor de X observaremos.

7. Sí; CS y SC producen X=1 si X cuenta caras.

8. El conjunto de valores producidos por X.

9. En el caso discreto, {x:P(X=x)>0}.

10. Porque el soporte es un concepto probabilístico más general.

11. El conjunto de resultados ω cuyos valores pertenecen a B.

12. La probabilidad del evento formado por los resultados que producen el valor 2.

13. La probabilidad de los resultados para los cuales X(ω)≤a.

14. La medibilidad garantiza que condiciones numéricas apropiadas sobre X correspondan a eventos.

15. Su probabilidad está concentrada en un conjunto finito o numerable.

16. Sí; puede tener valores 1,2,3,… sin último valor.

17. Una variable cuya distribución puede representarse mediante una densidad.

18. P(X=x)=0 para cada valor individual.

19. Una distribución con componentes de diferentes tipos, por ejemplo masa puntual y parte continua.

20. Porque el instrumento y el modelo matemático son objetos diferentes.

21. Porque el registro puede haber redondeado o truncado una magnitud temporal continua.

22. Una variable que vale 1 si ocurre A y 0 en caso contrario.

23. Que Y se obtiene aplicando g al valor de X.

24. Mediante una regla de redondeo o cuantización.

25. X pertenece al modelo; los xᵢ son realizaciones observadas.

26. Porque los números pueden funcionar solamente como etiquetas.

27. La probabilidad que la distribución de X asigna al conjunto B.

28. Agrupa en cada conjunto de valores la probabilidad de todos los resultados que producen esos valores.

29. ¿Cómo se reparte la probabilidad entre los distintos valores de X?

6.368. Mapa conceptual

Figura 6.86
Del experimento aleatorio a la distribución de una variable
EXPERIMENTO ALEATORIO
RESULTADO ω∈Ω
VARIABLE ALEATORIA

X:Ω→ℝ

VALOR X(ω)
DISCRETA
ABSOLUTAMENTE CONTINUA
MIXTA / MÁS GENERAL
DISTRIBUCIÓN DE X

PX(B)=P(X∈B)

¿CÓMO SE REPARTE LA PROBABILIDAD ENTRE LOS VALORES?

Nota. Elaboración propia.

Tabla 6.36
Símbolos fundamentales de esta parte
Ω

espacio muestral

ω

resultado elemental

X

variable aleatoria

X(ω)

valor asignado

x

valor posible u observado

X(Ω)

imagen de X

X−1(B)

preimagen de B

P(X∈B)

probabilidad del evento asociado

PX

distribución o ley de X

Y=g(X)

transformación de X

6.369. Síntesis

Una variable aleatoria transforma resultados de un experimento en números:

X:Ω→ℝ.

En el tratamiento universitario, X debe ser una función medible respecto de la estructura probabilística definida sobre Ω.

El símbolo ω representa un resultado elemental; X(ω) es el número asignado a ese resultado.

La letra mayúscula X suele representar la variable aleatoria, mientras que x representa un valor posible o una realización concreta.

La regla X es fija. Lo aleatorio es qué ω ocurrirá y, por tanto, qué valor de X observaremos.

Resultados distintos pueden producir el mismo valor.

Debemos distinguir:

Ω   ≠   X(Ω).

Ω contiene resultados; X(Ω) contiene los valores numéricos producidos por X.

En variables discretas, el soporte puede describirse mediante:

{x:P(X=x)>0}.

Cuando formulamos una condición sobre los valores de X, buscamos su preimagen en Ω:

X−1(B) = {ω∈Ω:X(ω)∈B}.

Por eso:

P(X∈B) = P(X−1(B)).

Una variable discreta concentra su probabilidad en un conjunto finito o numerable.

En el caso absolutamente continuo, la distribución se describe mediante una densidad y cada punto individual tiene probabilidad cero.

Existen también distribuciones mixtas y otras distribuciones más generales.

Debemos distinguir cuidadosamente:

magnitud → modelo → instrumento → dato registrado.

La resolución de un instrumento no determina por sí sola la naturaleza del modelo.

Una variable indicadora transforma un evento en 0 o 1.

Una nueva variable puede construirse mediante:

Y=g(X).

La variable X pertenece al modelo; los valores x₁,…,xₙ son realizaciones observadas.

Finalmente, X induce una nueva distribución de probabilidad sobre ℝ:

PX(B)=P(X∈B).

Ahora que sabemos qué es una variable aleatoria, qué valores puede tomar y cómo transporta la probabilidad desde Ω, aparece la siguiente pregunta: ¿cómo describimos matemáticamente la distribución de esos valores?

El experimento produce un resultado.

La variable aleatoria lo convierte en un número.

Y la distribución de X nos dice cómo se reparte la probabilidad entre esos números.

SIGUIENTE
Parte 12 de 18 · Distribuciones de probabilidad discretas
Estudiaremos cómo se reparte la probabilidad entre los valores de una variable discreta y construiremos su función de masa, su función de distribución acumulada, su esperanza y su varianza.
La numeración continuará en 6.370.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Kolmogorov, A. N. (1933). Grundbegriffe der Wahrscheinlichkeitsrechnung. Springer.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 12 DE 18
CAPÍTULO 6

Distribuciones de probabilidad discretas

¿Cómo se reparte la probabilidad entre los valores de una variable?

función de masa · función acumulada · esperanza · momentos · varianza · desviación estándar · simulación

Idea central

En la Parte 11 aprendimos que una variable aleatoria X transforma resultados de Ω en números y, al hacerlo, induce una distribución de probabilidad.

Ahora estudiaremos esa distribución cuando X es discreta. No basta conocer:

qué valores puede tomar X.

Necesitamos saber también:

qué probabilidad corresponde a cada valor.

A partir de esa información construiremos la función de masa, la función acumulada y medidas globales como esperanza, varianza y desviación estándar.

Al finalizar esta parte podrás:
interpretar la distribución o ley de una variable discreta;
construir y utilizar una función de masa;
identificar correctamente el soporte;
comprobar si una función de masa es válida;
calcular probabilidades de conjuntos de valores;
construir e interpretar una función acumulada;
recuperar masas a partir de los saltos de la acumulada;
calcular probabilidades de intervalos mediante F;
calcular e interpretar esperanza matemática;
utilizar E[g(X)] y momentos;
calcular varianza y desviación estándar;
simular distribuciones mediante el método de transformación inversa.

6.370. De una variable aleatoria a su distribución

Retomemos:

X = número de caras obtenidas en dos lanzamientos

Sabemos:

X(Ω)={0,1,2}.

Pero conocer la imagen de X todavía no nos dice cómo se encuentra distribuida la probabilidad.

¿Con qué probabilidad toma X cada uno de esos valores?

6.371. Una distribución discreta responde dos preguntas

¿QUÉ VALORES PUEDE TOMAR X?

0, 1 y 2

¿QUÉ PROBABILIDAD TIENE CADA VALOR?

1/4, 1/2 y 1/4

Ambas informaciones forman parte de la distribución de X.

6.372. De la ley PX a la función de masa

En la Parte 11 definimos la distribución o ley de X mediante:

PX(B)=P(X∈B).

Si X es discreta podemos preguntar por un conjunto que contiene un solo valor:

B={x}.

Entonces:

PX({x})=P(X=x).

Definimos la función de masa de probabilidad:

pX(x)=P(X=x).

Cuando no exista riesgo de confusión escribiremos:

p(x)=P(X=x).

La función pX puede definirse para todo x∈ℝ. Si x no pertenece al soporte de X, entonces: pX(x)=0.

Figura 6.87
Una distribución discreta reparte la probabilidad entre valores separados
VARIABLE ALEATORIA DISCRETA X
x₁

p(x₁)

x₂

p(x₂)

x₃

p(x₃)

TODA LA MASA DE PROBABILIDAD DEBE SUMAR 1

Nota. Elaboración propia.

6.373. Condiciones fundamentales de una función de masa

Para que pX represente una distribución discreta debe cumplir:

NO NEGATIVIDAD

Ninguna masa de probabilidad puede ser negativa.

pX(x)≥0

NORMALIZACIÓN

Entre todos los valores del soporte debe reunirse toda la probabilidad.

Σ pX(x)=1

PARA PROFUNDIZAR · DEMOSTRACIÓN 26 · ●●●●

6.374. ¿Por qué las masas deben sumar 1?

Supongamos que el soporte de X es:

S={x₁,x₂,…}.

Los eventos:

{X=x₁}, {X=x₂}, …

son mutuamente excluyentes. Una realización de X no puede tomar simultáneamente dos valores diferentes.

Además:

P(X∈S)=1.

Por aditividad numerable:

P(X∈S)=ΣP(X=x).

Como pX(x)=P(X=x):

ΣpX(x)=1.

6.375. El soporte de una distribución discreta

Definimos el soporte discreto mediante:

SX={x∈ℝ : pX(x)>0}.

Es decir, contiene los valores que poseen masa de probabilidad positiva.

Si:

pX(5)=0,

el número 5 puede pertenecer al dominio de la función pX, pero no pertenece al soporte efectivo de la distribución.

6.376. Ejemplo 1 · Número de clientes

FUNDAMENTAL · ●○○○

Consideremos un modelo hipotético:

X = número de clientes que llegan a una pequeña tienda durante cierto intervalo
Tabla 6.37
Distribución hipotética del número de clientes
X=0

p(0)=0,10

X=1

p(1)=0,25

X=2

p(2)=0,35

X=3

p(3)=0,20

X=4

p(4)=0,10

0,10+0,25+0,35+0,20+0,10=1.

Nota. Datos hipotéticos creados exclusivamente con fines didácticos.

6.377. Representación gráfica de la función de masa

Figura 6.88
Función de masa del número hipotético de clientes
0,10 0,25 0,35 0,20 0,10 0 1 2 3 4 número de clientes, X pX(x)

Nota. Elaboración propia con datos hipotéticos. La altura de cada barra representa pX(x).

6.378. ¿Por qué las barras están separadas?

Los valores:

0,1,2,3,4

son valores individuales y separados.

Por eso una función de masa suele representarse mediante barras separadas o un diagrama de bastones.

No confundir función de masa con histograma. En la función de masa cada altura representa P(X=x). Un histograma estadístico representa frecuencias, densidades o cantidades asociadas con intervalos de datos.

6.379. Probabilidad de un conjunto de valores

Para cualquier conjunto A de valores:

P(X∈A)=Σ pX(x),

sumando sobre los valores x∈A.

Por ejemplo:

P(X≥3)=p(3)+p(4)

=0,20+0,10=0,30.

6.380. El complemento también simplifica cálculos

Queremos:

P(X≥1).

Su complemento es:

X=0.

P(X≥1)=1−P(X=0)

=1−0,10=0,90.

6.381. Ejemplo 2 · Construir una distribución desde Ω

INTERMEDIO · ●●○○

Lanzamos dos dados equilibrados y definimos:

X = suma de los dos resultados

Los 36 pares ordenados son equiprobables, pero producen solo once sumas.

Tabla 6.38
Función de masa de la suma de dos dados equilibrados
2
1/36
3
2/36
4
3/36
5
4/36
6
5/36
7
6/36
8
5/36
9
4/36
10
3/36
11
2/36
12
1/36
Figura 6.89
Función de masa de la suma de dos dados equilibrados
23456789101112

Nota. Elaboración propia. La altura es proporcional al número de pares ordenados que producen cada suma.

6.382. Los valores de X no tienen por qué ser equiprobables

Aunque los 36 pares ordenados son equiprobables:

P(X=2)=1/36
P(X=7)=6/36=1/6

La transformación X agrupa cantidades distintas de resultados elementales bajo cada valor numérico.

6.383. Función de distribución acumulada

La función de masa responde:

P(X=x).

Para acumular toda la probabilidad hasta un punto definimos, para cualquier variable aleatoria:

FX(x)=P(X≤x).

Cuando no exista ambigüedad escribiremos simplemente F(x).

6.384. Construimos la acumulada del ejemplo de clientes

Tabla 6.39
De la masa individual a la probabilidad acumulada
x=0

p(0)=0,10

F(0)=0,10

x=1

p(1)=0,25

F(1)=0,35

x=2

p(2)=0,35

F(2)=0,70

x=3

p(3)=0,20

F(3)=0,90

x=4

p(4)=0,10

F(4)=1,00

6.385. Propiedades fundamentales de toda función acumulada

1. Valores entre 0 y 1

0≤F(x)≤1.

2. No decreciente

a<b ⇒ F(a)≤F(b).

3. Extremo izquierdo

F(x)→0 cuando x→−∞.

4. Extremo derecho

F(x)→1 cuando x→+∞.

5. Continuidad por la derecha

F(x)=lim F(t) cuando t↓x.

6.386. La acumulada discreta es una función escalonada

Figura 6.90
Función acumulada correcta del ejemplo de clientes
0 1 2 3 4 0,10 0,35 0,70 0,90 1,00 x

Nota. Elaboración propia. El punto cerrado pertenece al escalón situado a su derecha; esto hace visible la continuidad por la derecha de F.

PARA PROFUNDIZAR · DEMOSTRACIÓN 27 · ●●●●

6.387. El tamaño del salto de F es P(X=x)

Definimos el límite por la izquierda:

F(x)=P(X<x).

Como:

{X≤x}={X<x}∪{X=x},

y los dos eventos son disjuntos:

F(x)=F(x)+P(X=x).

Por tanto:

pX(x) = F(x)−F(x).

6.388. Probabilidades de intervalos mediante F

Para a<b:

P(a<X≤b)=F(b)−F(a).

En el modelo de clientes:

P(1<X≤3)=F(3)−F(1)

=0,90−0,35=0,55.

6.389. Los extremos abiertos y cerrados importan

Tabla 6.40
Cálculo de intervalos a partir de la función acumulada
a<X≤b

F(b)−F(a)

a≤X≤b

F(b)−F(a)

a<X<b

F(b)−F(a)

a≤X<b

F(b)−F(a)

En variables discretas, incluir o excluir un extremo puede cambiar la probabilidad, porque un punto individual puede tener masa positiva.

PARA PROFUNDIZAR · DEMOSTRACIÓN 28 · ●●●●

6.390. Derivación de P(a<X≤b)

Para a<b:

{X≤b} = {X≤a}∪{a<X≤b}.

Los eventos son disjuntos.

F(b)=F(a)+P(a<X≤b).

Despejando:

P(a<X≤b)=F(b)−F(a).

6.391. La acumulada determina completamente la distribución

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

La función F no es solamente una herramienta auxiliar.

Si conocemos F(x) para todo número real x, conocemos completamente la distribución de X.

En el caso discreto recuperamos cada masa mediante:

pX(x)=F(x)−F(x).

Así, la función de masa y la función acumulada contienen la misma distribución expresada de dos maneras distintas.

6.392. Esperanza matemática: un centro probabilístico

Para resumir la posición de una distribución utilizamos un promedio ponderado por probabilidades:

E[X]=Σx pX(x).

Esta cantidad recibe también los nombres:

valor esperado   ·   media de la distribución.

6.393. Esperanza del número de clientes

E[X] = 0(0,10)+1(0,25)+2(0,35)+3(0,20)+4(0,10)

=0+0,25+0,70+0,60+0,40

E[X]=1,95.

Figura 6.91
El valor esperado como centro probabilístico
|
0
|
1
|
2
|
3
|
4
E[X]=1,95

Nota. Elaboración propia. La esperanza es una característica global de la distribución.

6.394. E[X]=1,95 no significa que observaremos 1,95 clientes

X solamente puede tomar:

0,1,2,3 o 4.

El valor 1,95 ni siquiera pertenece al soporte.

La esperanza no es una predicción de la próxima realización. Es una propiedad de toda la distribución y puede no ser un valor posible de X.

6.395. Esperanza y promedio observado no son el mismo objeto

Tabla 6.41
Media del modelo y promedio de datos observados
E[X]

Media teórica

Pertenece al modelo probabilístico.

Media muestral

Se calcula con datos observados.

Bajo condiciones apropiadas y con muchas observaciones, x̄ puede aproximarse a E[X]. Esa conexión será formalizada posteriormente mediante leyes de los grandes números.

6.396. ¿Cuándo existe una esperanza finita?

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Para una distribución con soporte infinito, no basta escribir formalmente:

Σx p(x).

Para que E[X] sea un número real finito exigimos:

Σ|x|p(x)<∞.

Esta condición garantiza convergencia absoluta y evita que el supuesto «promedio» dependa de reordenamientos de una serie.

6.397. Linealidad de la esperanza

Si las esperanzas involucradas existen:

E[aX+b]=aE[X]+b.

Más generalmente:

E[aX+bY+c]=aE[X]+bE[Y]+c.

La linealidad de la esperanza no requiere independencia. Esta será una herramienta muy poderosa al estudiar sumas de variables.

PARA PROFUNDIZAR · DEMOSTRACIÓN 29 · ●●●●

6.398. Demostración de E[aX+b]=aE[X]+b

E[aX+b]=Σ(ax+b)p(x).

Distribuimos:

=aΣxp(x)+bΣp(x).

Como:

Σp(x)=1

y:

Σxp(x)=E[X],

obtenemos:

E[aX+b]=aE[X]+b.

6.399. Esperanza de una función de X

PROFUNDIZACIÓN · ●●●●

Si:

Y=g(X),

no necesitamos encontrar primero la distribución de Y para calcular su esperanza.

E[g(X)]=Σg(x)pX(x),

siempre que:

Σ|g(x)|pX(x)<∞.

Este resultado suele conocerse como ley del estadístico inconsciente o por sus siglas inglesas LOTUS (Law of the Unconscious Statistician).

6.400. Momentos de una distribución

Las potencias de X permiten construir cantidades que resumen distintos aspectos de una distribución.

Tabla 6.42
Algunos momentos importantes
Primer momento

E[X]

Relacionada con el centro de la distribución.

Segundo momento

E[X²]

Interviene en el cálculo de la varianza.

Segundo momento central

E[(X−μ)²]

Es la varianza.

6.401. Varianza: la media no cuenta toda la historia

Sea:

μ=E[X].

La varianza mide la desviación cuadrática media respecto de μ:

Var(X)=E[(X−μ)²]

Para una variable discreta:

Var(X)=Σ(x−μ)²p(x),

siempre que E[X²] sea finita.

PARA PROFUNDIZAR · DEMOSTRACIÓN 30 · ●●●●

6.402. Fórmula alternativa de la varianza

Var(X)=E[(X−μ)²].

Expandimos:

(X−μ)²=X²−2μX+μ².

Aplicamos esperanza:

Var(X)=E[X²]−2μE[X]+μ².

Como μ=E[X]:

Var(X)=E[X²]−E[X]².

6.403. Varianza del número de clientes

E[X]=1,95.

Calculamos:

E[X²] = 0²(0,10)+1²(0,25)+2²(0,35)+3²(0,20)+4²(0,10)

=5,05.

Var(X)=5,05−(1,95)²

Var(X)=1,2475.

6.404. Desviación estándar

Como la varianza está expresada en unidades al cuadrado, calculamos:

σX=√Var(X).

Para los clientes:

σX=√1,2475≈1,1169 clientes.

La desviación estándar vuelve a expresarse en las mismas unidades de X.

6.405. Misma esperanza, diferente dispersión

DISTRIBUCIÓN A

P(X=1)=0,25

P(X=2)=0,50

P(X=3)=0,25

E[X]=2

Var(X)=0,5

DISTRIBUCIÓN B

P(X=0)=0,25

P(X=2)=0,50

P(X=4)=0,25

E[X]=2

Var(X)=2

Figura 6.92
Dos distribuciones pueden compartir el centro y diferir en dispersión
A · MÁS CONCENTRADA

E[X]=2

Var=0,5

B · MÁS DISPERSA

E[X]=2

Var=2

Nota. Elaboración propia. La igualdad de las medias no implica igualdad de las distribuciones.

6.406. Cambiar el origen y la escala

Si:

Y=aX+b,

entonces:

E[Y]=aE[X]+b
Var(Y)=a²Var(X)

Por tanto:

σY=|a|σX.

PARA PROFUNDIZAR · DEMOSTRACIÓN 31 · ●●●●

6.407. Demostración de Var(aX+b)=a²Var(X)

Y=aX+b.

Sabemos:

E[Y]=aE[X]+b.

Entonces:

Y−E[Y]=a(X−E[X]).

Elevamos al cuadrado y aplicamos esperanza:

Var(Y)=a²Var(X).

6.408. Propiedades estructurales de la varianza

PROFUNDIZACIÓN · ●●●●

Como una cantidad al cuadrado nunca es negativa:

Var(X)≥0.

Además:

Var(X)=0

si y solo si X es constante con probabilidad 1.

La expresión «con probabilidad 1» es importante: en teoría de probabilidad se dice que X es constante casi seguramente.

6.409. Cómo reconocer una función de masa válida

Tabla 6.43
Ejemplos de distribuciones válidas e inválidas
VÁLIDA

0,20 · 0,30 · 0,50

No negativas y suma 1.

INVÁLIDA

0,30 · −0,10 · 0,80

Contiene una masa negativa.

INVÁLIDA

0,20 · 0,20 · 0,20

La suma es 0,60.

VÁLIDA

0 · 0,40 · 0,60

Una masa puede ser 0.

6.410. Simular una distribución discreta

Para el ejemplo de los clientes las probabilidades acumuladas son:

0,10 · 0,35 · 0,70 · 0,90 · 1,00.

Tomamos un número pseudoaleatorio U en [0,1) y dividimos ese intervalo en regiones cuya longitud coincide con las probabilidades de X.

Figura 6.93
Partición de [0,1) para simular X
X=0
X=1
X=2
X=3
X=4
00,100,350,700,901
Si U=0,58, entonces 0,35≤U<0,70 y obtenemos X=2.

Nota. Elaboración propia.

6.411. Método de transformación inversa

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

El procedimiento anterior puede escribirse de manera general.

Sea U una variable uniforme en [0,1). Definimos la inversa generalizada de F:

F−1(u)=inf{x∈ℝ : F(x)≥u}.

Entonces podemos generar:

X=F−1(U).

Esta idea no está limitada a cinco valores: constituye uno de los procedimientos fundamentales para simular distribuciones a partir de números uniformes.

PARA PROFUNDIZAR · DEMOSTRACIÓN 32 · ●●●●

6.412. ¿Por qué los intervalos de simulación producen las probabilidades correctas?

Para un valor xᵢ asignamos un intervalo de [0,1) cuya longitud es:

p(xᵢ).

Como U es uniforme en [0,1), la probabilidad de caer en un intervalo es exactamente igual a la longitud de ese intervalo.

Por tanto:

P(X=xᵢ)=p(xᵢ).

Y como las longitudes suman 1, los intervalos cubren todo [0,1).

6.413. Simulación en Excel

En A2:

=ALEATORIO()

En B2:

=SI(A2<0,10;0;SI(A2<0,35;1;SI(A2<0,70;2;SI(A2<0,90;3;4))))

Copiamos las fórmulas hacia abajo para generar muchas realizaciones.

ALEATORIO() es volátil: al recalcular la hoja genera nuevos valores.

Si deseamos conservar una simulación concreta, podemos copiar los resultados y pegarlos como valores.

6.414. Distribución teórica y distribución simulada

Una simulación finita no reproduce exactamente:

0,10 · 0,25 · 0,35 · 0,20 · 0,10.

Obtendremos frecuencias relativas próximas, pero fluctuantes.

Al aumentar el número de simulaciones, bajo las condiciones habituales de repetición independiente, las frecuencias relativas tienden a estabilizarse alrededor de las probabilidades teóricas. Esta es una manifestación de la ley de los grandes números.

6.415. Errores frecuentes

Error 1

Suponer que todos los valores son equiprobables.

Error 2

Permitir p(x)<0.

Error 3

Olvidar Σp(x)=1.

Error 4

Confundir p(x) con F(x).

Error 5

Interpretar E[X] como la próxima observación.

Error 6

Confundir varianza con desviación estándar.

Error 7

Confundir función de masa e histograma.

Error 8

Creer que una simulación finita debe coincidir exactamente con el modelo.

Error 9

Olvidar la continuidad por la derecha de F.

Error 10

Usar F(b)−F(a) sin revisar qué extremos están incluidos.

Error 11

Calcular una esperanza infinita sin comprobar convergencia.

Error 12

Creer que igual esperanza implica igual distribución.

6.416. Práctica de dificultad creciente

FUNDAMENTAL · ●○○○

p(0)=0,20,   p(1)=0,50,   p(2)=0,30.

Calcula P(X≥1), F(0) y F(1).

Ver solución

P(X≥1)=0,80.

F(0)=0,20.

F(1)=0,70.

INTERMEDIO · ●●○○

X toma 0, 2 y 4 con probabilidades:

0,20; 0,50; 0,30.

Calcula E[X].

Ver solución

E[X]=0(0,20)+2(0,50)+4(0,30)=2,20.

AVANZADO · ●●●○

Para la misma distribución calcula:

a) E[X²];
b) Var(X);
c) σ.

Ver solución

E[X²]=6,80.

Var(X)=6,80−(2,20)²=1,96.

σ=1,40.

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Una variable tiene soporte {1,2,3,…} y:

p(k)=2−k.

Comprueba que es una función de masa y analiza si E[X] es finita.

Ver orientación

Σ2−k=1.

Además Σk/2k=2, por lo que E[X]=2.

6.417. Actividad integradora · La suma de dos dados

1. Calcula P(X=7).

2. Calcula P(X=12).

3. Calcula P(X≤5).

4. Calcula P(X≥10).

5. Calcula P(5≤X≤9).

6. Construye F(x).

7. Identifica los saltos de F.

8. Calcula E[X].

9. Calcula E[X²].

10. Calcula Var(X).

11. Explica por qué la distribución es simétrica alrededor de 7.

Ver resultados principales

P(X=7)=1/6≈0,1667.

P(X=12)=1/36≈0,0278.

P(X≤5)=10/36=5/18≈0,2778.

P(X≥10)=6/36=1/6.

P(5≤X≤9)=24/36=2/3.

E[X]=7.

E[X²]=329/6≈54,8333.

Var(X)=329/6−49=35/6≈5,8333.

La simetría se debe a que las cantidades de pares ordenados para 7−d y 7+d son iguales.

6.418. Comprueba lo aprendido

1. ¿Qué relación existe entre PX y pX?

2. ¿Qué significa pX(x)?

3. ¿Qué condiciones debe cumplir una función de masa?

4. ¿Qué es el soporte SX?

5. ¿Por qué los valores posibles no tienen que ser equiprobables?

6. ¿Cómo calculamos P(X∈A)?

7. Define FX(x).

8. Enumera las propiedades fundamentales de una CDF.

9. ¿Qué representa el salto de F en x?

10. ¿Por qué F es continua por la derecha?

11. ¿Cómo calculamos P(a<X≤b)?

12. ¿Cómo cambia la fórmula si incluimos a?

13. ¿Por qué F determina completamente la distribución?

14. ¿Qué representa E[X]?

15. ¿Por qué E[X] puede no pertenecer al soporte?

16. ¿Qué condición garantiza una esperanza finita?

17. ¿La linealidad de E requiere independencia?

18. ¿Qué expresa E[g(X)]?

19. ¿Qué es un momento?

20. Define Var(X).

21. Escribe la fórmula alternativa de la varianza.

22. ¿Qué representa σ?

23. ¿Qué sucede con Var(X+b)?

24. ¿Qué sucede con Var(aX)?

25. ¿Cuándo vale Var(X)=0?

26. ¿En qué consiste la transformación inversa?

27. ¿Por qué una simulación finita fluctúa?

28. ¿Qué diferencia conceptual existe entre distribución teórica y frecuencias simuladas?

6.419. Síntesis

Figura 6.94
Anatomía de una distribución discreta
VARIABLE ALEATORIA DISCRETA X
SOPORTE SX
FUNCIÓN DE MASA

pX(x)=P(X=x)

FUNCIÓN ACUMULADA

FX(x)=P(X≤x)

ESPERANZA

E[X]

VARIANZA

Var(X)

DESVIACIÓN

σX

SIMULACIÓN

U → F−1(U)

Nota. Elaboración propia.

Una variable discreta posee una distribución concentrada en un conjunto finito o numerable de valores.

Su función de masa:

pX(x)=P(X=x)

satisface:

pX(x)≥0   y   ΣpX(x)=1.

La función acumulada:

FX(x)=P(X≤x)

es no decreciente, continua por la derecha y determina completamente la distribución.

En una distribución discreta:

pX(x)=F(x)−F(x).

La esperanza:

E[X]=Σxp(x)

es un promedio probabilístico y requiere convergencia apropiada cuando el soporte es infinito.

Para una transformación:

E[g(X)]=Σg(x)p(x).

La varianza:

Var(X)=E[(X−E[X])²]

mide dispersión cuadrática y también puede calcularse como:

Var(X)=E[X²]−E[X]².

La desviación estándar:

σX=√Var(X)

se expresa en las mismas unidades de X.

Finalmente, una distribución discreta puede simularse transformando una variable uniforme mediante la inversa generalizada de F.

Ya disponemos de las herramientas generales. Ahora podremos estudiar familias específicas de distribuciones y reconocer las estructuras que las generan.

La variable aleatoria nos dice qué valores pueden aparecer.

Su distribución nos dice cuánto peso probabilístico posee cada valor y cómo se comporta el conjunto completo.

SIGUIENTE
Parte 13 de 18 · Bernoulli y distribución binomial
Aplicaremos la función de masa, la esperanza y la varianza a uno de los modelos discretos fundamentales: un ensayo con dos resultados y el número de éxitos en varios ensayos.
La numeración continuará en 6.420.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 13 DE 18
CAPÍTULO 6

Bernoulli y distribución binomial

De un ensayo con dos resultados al conteo de éxitos en muchos ensayos

Bernoulli · indicadores · ensayos i.i.d. · binomial · C(n,k) · acumuladas · media · varianza · forma · simulación · inferencia

Idea central

Muchas situaciones pueden formularse mediante una pregunta binaria: ocurre o no ocurre determinada característica. Un solo ensayo puede modelarse mediante una variable de Bernoulli.

Si realizamos n ensayos independientes con la misma probabilidad p de éxito y contamos cuántos éxitos aparecen, obtenemos uno de los modelos discretos más importantes de la probabilidad:

X ~ Binomial(n,p).

La fórmula binomial no es una receta aislada. Surge de combinar tres ideas ya estudiadas: independencia, multiplicación de probabilidades y combinaciones.

Al finalizar esta parte podrás:
reconocer un ensayo de Bernoulli;
construir una variable Bernoulli mediante 0 y 1;
interpretar p y 1−p;
relacionar Bernoulli con variables indicadoras;
interpretar el concepto de ensayos i.i.d.;
comprobar las condiciones del modelo binomial;
deducir y aplicar la función de masa binomial;
utilizar la distribución acumulada binomial;
distinguir exactamente, a lo sumo y al menos;
calcular esperanza, varianza y desviación estándar;
estudiar simetría, asimetría y moda;
reconocer situaciones que no son binomiales;
simular una distribución binomial;
comprender la primera conexión entre p y su estimación a partir de datos.

6.420. Muchas preguntas pueden formularse como «sí» o «no»

Consideremos algunas situaciones.

Moneda

¿apareció cara?

Examen

¿la respuesta fue correcta?

Control de calidad

¿la pieza es defectuosa?

Comercio

¿el cliente realizó una compra?

En cada caso elegimos una característica que queremos registrar.

6.421. «Éxito» no significa necesariamente algo bueno

ÉXITO

la categoría que decidimos contar

FRACASO

la categoría complementaria

Si estudiamos defectos podemos definir:

éxito = «la pieza es defectuosa».

Éxito y fracaso son etiquetas matemáticas. No expresan una valoración positiva o negativa.

6.422. Ensayo de Bernoulli

Un ensayo de Bernoulli es un experimento aleatorio en el que distinguimos, respecto de la característica estudiada, exactamente dos categorías complementarias: éxito y fracaso.

Si:

P(éxito)=p,

entonces:

P(fracaso)=1−p.

Naturalmente:

0≤p≤1.

Figura 6.95
Anatomía de un ensayo de Bernoulli
REALIZAMOS UN ENSAYO
ÉXITO

X=1

P(X=1)=p

FRACASO

X=0

P(X=0)=1−p

Nota. Elaboración propia.

6.423. Variable aleatoria de Bernoulli

Definimos:

X=1 si ocurre el éxito

X=0 si ocurre el fracaso.

Escribimos:

X ~ Bernoulli(p).
Tabla 6.44
Función de masa de una variable Bernoulli
x=0

fracaso

pX(0)=1−p

x=1

éxito

pX(1)=p

6.424. Una sola fórmula para la función de masa de Bernoulli

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Para 0<p<1 y x∈{0,1} podemos escribir:

pX(x)=px(1−p)1−x.

Si x=1:

p¹(1−p)⁰=p.

Si x=0:

p⁰(1−p)¹=1−p.

Fuera de {0,1}:

pX(x)=0.

6.425. Ejemplo 1 · Una respuesta correcta o incorrecta

FUNDAMENTAL · ●○○○

En un modelo hipotético:

P(respuesta correcta)=0,70.

Definimos éxito = respuesta correcta.

P(X=1)=0,70
P(X=0)=0,30

Nota. Probabilidades hipotéticas utilizadas exclusivamente con fines didácticos.

Figura 6.96
Función de masa de Bernoulli para p=0,70
0,30
0
0,70
1

Nota. Elaboración propia.

6.426. Media y varianza de Bernoulli

E[X]=p
Var(X)=p(1−p)
PARA PROFUNDIZAR · DEMOSTRACIÓN 33 · ●●●●

6.427. Demostración de E[X]=p y Var(X)=p(1−p)

Por definición:

E[X]=0(1−p)+1(p)=p.

Además, como X solo toma 0 y 1:

X²=X.

Entonces:

E[X²]=E[X]=p.

Utilizando:

Var(X)=E[X²]−E[X]²,

Var(X)=p−p²=p(1−p).

6.428. Bernoulli y las variables indicadoras

Sea A un evento. Su variable indicadora:

IA=1 si ocurre A,   IA=0 si no ocurre A,

es una variable Bernoulli con:

p=P(A).

Por tanto:

E[IA]=P(A).

Esta identidad convierte probabilidades en esperanzas y será útil repetidamente en teoría de probabilidad.

6.429. De un ensayo a muchos ensayos

Supongamos que repetimos un ensayo Bernoulli cinco veces.

Una realización podría ser:

1 · 0 · 1 · 1 · 0

El número total de éxitos es:

1+0+1+1+0=3.

Figura 6.97
De variables Bernoulli al conteo binomial
X₁, X₂, …, Xₙ

cada una vale 0 o 1

↓ sumamos
X=X₁+X₂+···+Xₙ
X = NÚMERO TOTAL DE ÉXITOS

Nota. Elaboración propia.

6.430. Definición universitaria de una variable binomial

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Sean:

X₁,X₂,…,Xₙ

variables Bernoulli independientes con el mismo parámetro p:

Xᵢ ~ Bernoulli(p).

Definimos:

X=X₁+X₂+···+Xₙ.

Entonces:

X ~ Binomial(n,p).

La expresión i.i.d., frecuente en textos universitarios, significa:

independientes e idénticamente distribuidas.

6.431. Las cuatro condiciones del modelo binomial

Tabla 6.45
Condiciones estructurales del modelo binomial
1. n FIJO

Se realizan exactamente n ensayos.

2. DOS CATEGORÍAS

Cada ensayo se registra como éxito o fracaso.

3. MISMA p

La probabilidad de éxito es p en todos los ensayos.

4. INDEPENDENCIA

Los resultados de unos ensayos no alteran las probabilidades de los otros.

6.432. Cada condición justifica una parte de la fórmula

n fijo

determina cuántas posiciones existen.

dos categorías

permite representar cada ensayo mediante 0 o 1.

misma p

hace iguales las probabilidades de las secuencias con el mismo número de éxitos.

independencia

permite multiplicar las probabilidades de los ensayos dentro de una secuencia.

6.433. No todo conteo binario es binomial

La existencia de dos categorías no basta.

Si las probabilidades cambian entre ensayos, si existe dependencia o si n no está fijado, el conteo puede seguir otra distribución.

Una fórmula binomial aplicada a un mecanismo no binomial puede producir un número perfectamente calculado, pero científicamente incorrecto como modelo.

6.434. Primero: la probabilidad de una secuencia concreta

Supongamos n=5 y queremos una secuencia particular con tres éxitos:

É · É · F · É · F

Si los ensayos son independientes:

P(ÉÉFÉF)=p³(1−p)².

En general, una secuencia particular con k éxitos y n−k fracasos tiene:

pk(1−p)n−k.

6.435. ¿Cuántas secuencias producen k éxitos?

Debemos escoger las k posiciones que contendrán éxito entre las n posiciones disponibles.

C(n,k)=n!/[k!(n−k)!].
Figura 6.98
Una secuencia concreta y el evento «X=k» no son la misma cosa
UN ORDEN CONCRETO

É É F É F

probabilidad p³(1−p)²

X=3

todos los órdenes con tres éxitos

C(5,3)=10 órdenes

Nota. Elaboración propia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 34 · ●●●●

6.436. Derivación de la función de masa binomial

Una secuencia determinada con k éxitos posee probabilidad:

pk(1−p)n−k.

Existen:

C(n,k)

secuencias diferentes con k éxitos. Son eventos mutuamente excluyentes.

Sumamos sus probabilidades:

P(X=k)=C(n,k)pk(1−p)n−k.

6.437. Función de masa de la distribución binomial

pX(k)=C(n,k)pk(1−p)n−k

k=0,1,2,…,n.

Tabla 6.46
Significado de cada componente de la fórmula binomial
n

número de ensayos

k

número de éxitos

p

probabilidad de éxito

1−p

probabilidad de fracaso

C(n,k)

formas de ubicar k éxitos

PARA PROFUNDIZAR · DEMOSTRACIÓN 35 · ●●●●

6.438. ¿Por qué las probabilidades binomiales suman 1?

Sumamos para k=0,1,…,n:

ΣC(n,k)pk(1−p)n−k.

Por el teorema del binomio:

(a+b)n = ΣC(n,k)akbn−k.

Tomamos a=p y b=1−p:

ΣP(X=k)=[p+(1−p)]n.

ΣP(X=k)=1.

6.439. Ejemplo 2 · Exactamente 3 caras en 5 lanzamientos

INTERMEDIO · ●●○○

Para cinco lanzamientos independientes de una moneda equilibrada:

n=5,   k=3,   p=0,50.

C(5,3)=10.

P(X=3)=10(0,50)³(0,50)²

=10(0,50)⁵ =10/32

=0,3125=31,25 %.

6.440. La distribución completa para n=5 y p=0,50

k=0
1/32
3,125 %
k=1
5/32
15,625 %
k=2
10/32
31,25 %
k=3
10/32
31,25 %
k=4
5/32
15,625 %
k=5
1/32
3,125 %
Figura 6.99
Distribución Binomial(5;0,50)
0
1
2
3
4
5

Nota. Elaboración propia. Las alturas son proporcionales a las probabilidades.

6.441. Traducir correctamente el lenguaje

Tabla 6.47
Del lenguaje cotidiano a una condición matemática
exactamente k

X=k

a lo sumo k

X≤k

menos de k

X<k

al menos k

X≥k

más de k

X>k

entre a y b inclusive

a≤X≤b

6.442. Función acumulada de una binomial

Si:

X ~ Binomial(n,p),

entonces, para un entero k:

F(k)=P(X≤k)=Σj=0kC(n,j)pj(1−p)n−j.

En general esta suma no se reduce a una expresión elemental sencilla, por lo que para n grandes suele evaluarse mediante software.

6.443. «Al menos un éxito»: el complemento

El evento:

X≥1

es el complemento de X=0.

P(X=0)=(1−p)n

P(X≥1)=1−(1−p)n.

6.444. Ejemplo · Al menos una pieza defectuosa

Supongamos:

n=20,   p=0,02,

donde éxito significa «pieza defectuosa».

P(X=0)=(0,98)²⁰≈0,6676.

P(X≥1)≈1−0,6676=0,3324=33,24 %.

6.445. Exactamente k y al menos k son preguntas diferentes

P(X=3)

incluye únicamente el valor 3.

P(X≥3)

incluye:

3,4,5,…,n.

La traducción del lenguaje debe hacerse antes de seleccionar la fórmula.

6.446. Esperanza de una binomial

E[X]=np.

np es el número esperado de éxitos, no una predicción obligatoria para una realización concreta.

6.447. Varianza y desviación estándar

Var(X)=np(1−p)
σ=√[np(1−p)]
PARA PROFUNDIZAR · DEMOSTRACIÓN 36 · ●●●●

6.448. E[X]=np y Var(X)=np(1−p) mediante indicadores

Escribimos:

X=X₁+X₂+···+Xₙ,

con Xᵢ ~ Bernoulli(p).

Por linealidad:

E[X]=ΣE[Xᵢ]=np.

Para la varianza:

Var(X)=Var(X₁+···+Xₙ).

Debido a la independencia:

Var(X)=ΣVar(Xᵢ).

Como cada término vale p(1−p):

Var(X)=np(1−p).

La independencia no es necesaria para sumar esperanzas, pero sí es esencial para sumar directamente las varianzas sin términos de covarianza.

6.449. Ejemplo · Centro y dispersión

X ~ Binomial(100;0,30).

E[X]

30

Var(X)

21

σ

√21≈4,58

6.450. ¿Cómo cambia la distribución cuando cambia p?

Mantengamos n=10.

p=0,20

la masa se concentra hacia valores pequeños.

p=0,50

la distribución es simétrica.

p=0,80

la masa se concentra hacia valores grandes.

Figura 6.100
Efecto de p sobre una Binomial(10,p)
p=0,20

E[X]=2

▆ █ ▇ ▅ ▂ ▁
p=0,50

E[X]=5

▁ ▃ ▆ █ ▆ ▃ ▁
p=0,80

E[X]=8

▁ ▂ ▅ ▇ █ ▆

Nota. Elaboración propia. Representación esquemática de la forma de las tres distribuciones.

6.451. ¿Por qué p=0,50 produce simetría?

Cuando p=0,50:

P(X=k)=C(n,k)(0,50)n.

Como:

C(n,k)=C(n,n−k),

obtenemos:

P(X=k)=P(X=n−k).

6.452. Asimetría de una distribución binomial

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

La forma puede cuantificarse mediante el coeficiente de asimetría:

γ₁=(1−2p)/√[np(1−p)].

Para 0<p<1:

p<0,50: asimetría positiva;
p=0,50: asimetría cero;
p>0,50: asimetría negativa.

6.453. Relación entre probabilidades consecutivas

Para 0<p<1:

P(X=k+1)/P(X=k) = [(n−k)/(k+1)]·[p/(1−p)].

Esta relación permite calcular probabilidades sucesivas sin evaluar repetidamente factoriales.

Tabla 6.48
Interpretación de la razón entre probabilidades consecutivas
razón > 1

las probabilidades están aumentando.

razón = 1

dos probabilidades consecutivas son iguales.

razón < 1

las probabilidades están disminuyendo.

PARA PROFUNDIZAR · DEMOSTRACIÓN 37 · ●●●●

6.454. La moda de una binomial

La distribución aumenta mientras:

P(X=k+1)≥P(X=k).

Usando la razón anterior:

[(n−k)/(k+1)]·[p/(1−p)]≥1.

Al reorganizar:

k≤(n+1)p−1.

Por ello, para 0<p<1:

Si (n+1)p no es entero, existe una sola moda:

moda=⌊(n+1)p⌋.

Si (n+1)p=m es entero, existen dos modas:

m−1 y m.

Por ejemplo, con n=5 y p=0,50:

(5+1)(0,50)=3.

Las modas son 2 y 3.

6.455. Función generadora de momentos

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Para una variable aleatoria X definimos, cuando existe alrededor de t=0:

MX(t)=E[etX].

Para una Bernoulli:

M(t)=(1−p)+pet.

PARA PROFUNDIZAR · DEMOSTRACIÓN 38 · ●●●●

6.456. Función generadora de momentos de la binomial

Como:

X=X₁+···+Xₙ

y las Xᵢ son independientes:

MX(t) = ∏MXᵢ(t).

Cada factor es:

(1−p)+pet.

MX(t) = [1−p+pet]n.

Sus derivadas en t=0 permiten recuperar momentos como E[X] y E[X²].

6.457. Sumar binomiales con la misma p

Si:

X ~ Binomial(n,p)

y:

Y ~ Binomial(m,p),

y X e Y son independientes, entonces:

X+Y ~ Binomial(n+m,p).

La condición de tener la misma p es esencial.

PARA PROFUNDIZAR · DEMOSTRACIÓN 39 · ●●●●

6.458. Demostración mediante funciones generadoras

Debido a la independencia:

MX+Y(t) = MX(t) MY(t).

=[1−p+pet]n [1−p+pet]m.

=[1−p+pet]n+m.

Esta es la función generadora de una Binomial(n+m,p).

6.459. p pertenece al modelo; k/n pertenece a los datos

Supongamos que el modelo utiliza:

p=0,30.

Realizamos n=10 ensayos y observamos k=5 éxitos.

La frecuencia observada es:

k/n=5/10=0,50.

p=0,30 y k/n=0,50 no se contradicen. p describe el modelo; k/n describe una realización observada.

6.460. De probabilidad a inferencia: la verosimilitud de p

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Hasta ahora hemos supuesto conocido p y hemos calculado probabilidades sobre X.

En estadística suele ocurrir lo contrario: observamos k éxitos en n ensayos y queremos aprender algo sobre p.

Para unos datos observados k, la función:

L(p)=C(n,k)pk(1−p)n−k

se interpreta ahora como función del parámetro p y recibe el nombre de verosimilitud.

PARA PROFUNDIZAR · DEMOSTRACIÓN 40 · ●●●●

6.461. ¿Por qué p̂=k/n es el estimador de máxima verosimilitud?

Para 0<k<n tomamos logaritmos:

ℓ(p)=constante+k ln(p)+(n−k)ln(1−p).

Derivamos:

ℓ′(p)=k/p−(n−k)/(1−p).

Igualamos a cero:

k(1−p)=(n−k)p.

Despejamos:

p̂=k/n.

Si k=0, el máximo ocurre en p̂=0; si k=n, ocurre en p̂=1. Aquí solo estamos anticipando una idea de inferencia estadística.

6.462. Muestrear sin reemplazo puede romper el modelo binomial

Supongamos una caja con cinco bolas rojas y cinco azules.

Antes de extraer:

P(roja)=5/10=0,50.

Si extraemos una roja y no la devolvemos:

P(roja en la siguiente)=4/9≈0,4444.

La probabilidad cambia y las extracciones son dependientes.

Para muestreo sin reemplazo en una población finita, el modelo exacto correspondiente al conteo de éxitos suele ser la distribución hipergeométrica, que estudiaremos en la siguiente parte.

6.463. Ensayos independientes con probabilidades diferentes

Supongamos:

Xᵢ ~ Bernoulli(pᵢ),

y las variables son independientes, pero:

p₁,p₂,…,pₙ

no son todas iguales.

Entonces:

X=X₁+···+Xₙ

no tiene en general una Binomial(n,p).

El conteo sigue una distribución denominada Poisson-binomial. La binomial ordinaria es el caso especial p₁=p₂=···=pₙ=p.

6.464. Dependencia y sobredispersión

Para una Binomial(n,p):

Var(X)=np(1−p).

En datos reales puede observarse una variabilidad mucho mayor que la prevista por esta expresión.

Esto puede indicar, entre otras posibilidades:

heterogeneidad entre probabilidades de éxito;
dependencia positiva entre ensayos;
variables omitidas en el modelo;
agrupamiento de observaciones.

Cuando la varianza observada supera sistemáticamente la que predice el modelo hablamos de sobredispersión.

6.465. Bernoulli, binomial y modelos cercanos

Tabla 6.49
Qué modelo corresponde a distintas estructuras de conteo
Bernoulli

un solo ensayo: 0 o 1.

Binomial

n ensayos independientes con la misma p.

Hipergeométrica

muestreo sin reemplazo en población finita.

Poisson-binomial

Bernoulli independientes con pᵢ diferentes.

Figura 6.101
Decidir si un conteo puede modelarse mediante una binomial
¿CONTAMOS ÉXITOS EN n ENSAYOS?
¿Cada ensayo tiene dos categorías?
¿La probabilidad p es constante?
¿Los ensayos son independientes?
SI TODO SE CUMPLE → MODELO BINOMIAL

Nota. Elaboración propia.

6.466. Cálculo y simulación en Excel

Para n=5, k=3 y p=0,50 podemos comprobar manualmente:

=10*(0,5^3)*(0,5^2)

El resultado es:

0,3125.

Para simular un ensayo Bernoulli con p=0,30:

=SI(ALEATORIO()<0,3;1;0)

Copiamos la fórmula en n celdas y sumamos los resultados.

Figura 6.102
Simulación de una Binomial(5;0,30)
0
1
0
1
1
↓ sumar
X=3

Nota. Datos simulados con fines didácticos.

6.467. Aplicación · Control de calidad

Supongamos:

X ~ Binomial(12;0,05),

donde X es el número de piezas defectuosas.

Ninguna defectuosa: P(X=0)=(0,95)¹²≈0,5404.

Exactamente una: P(X=1)=12(0,05)(0,95)¹¹≈0,3413.

Al menos una: P(X≥1)≈0,4596.

A lo sumo dos: P(X≤2)≈0,9804.

Nota. Modelo hipotético utilizado exclusivamente con fines didácticos.

6.468. Errores frecuentes

Error 1

Creer que «éxito» significa un resultado deseable.

Error 2

Usar binomial únicamente porque existen dos categorías.

Error 3

Olvidar el factor C(n,k).

Error 4

Confundir exactamente k con al menos k.

Error 5

Confundir p con la frecuencia observada k/n.

Error 6

Aplicar binomial exacta a muestreo sin reemplazo.

Error 7

Interpretar np como un resultado obligatorio.

Error 8

Suponer independencia sin justificarla.

Error 9

Creer que probabilidades pᵢ diferentes todavía producen una Binomial(n,p).

Error 10

Creer que igual media implica igual distribución.

6.469. Práctica de dificultad creciente

FUNDAMENTAL · ●○○○

X ~ Bernoulli(0,65). Calcula P(X=1), P(X=0), E[X] y Var(X).

Ver solución

P(X=1)=0,65.

P(X=0)=0,35.

E[X]=0,65.

Var(X)=0,65(0,35)=0,2275.

INTERMEDIO · ●●○○

X ~ Binomial(6;0,40). Calcula P(X=2).

Ver solución

C(6,2)=15.

P(X=2)=15(0,40)²(0,60)⁴.

=0,31104≈31,10 %.

AVANZADO · ●●●○

X ~ Binomial(10;0,20).

a) Calcula P(X=2).
b) Calcula P(X≤2).
c) Calcula P(X≥1).
d) Determina E[X] y Var(X).
e) Determina la moda.

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Sean X ~ Binomial(8;0,40) y Y ~ Binomial(12;0,40), independientes.

1. Determina la distribución de X+Y.
2. Calcula E[X+Y].
3. Calcula Var(X+Y).
4. Explica por qué la respuesta cambiaría si Y tuviera p=0,60.

Ver orientación

X+Y ~ Binomial(20;0,40).

E[X+Y]=20(0,40)=8.

Var(X+Y)=20(0,40)(0,60)=4,8.

Con probabilidades diferentes, la suma ya no es una binomial ordinaria.

6.470. Actividad guiada · Ocho lanzamientos

Se lanza una moneda equilibrada ocho veces:

X = número de caras.

1. Identifica n y p.

2. Escribe la distribución de X.

3. Calcula P(X=0).

4. Calcula P(X=1).

5. Calcula P(X=4).

6. Calcula P(X=8).

7. Calcula P(X≥1).

8. Calcula E[X].

9. Calcula Var(X).

10. Calcula σ.

11. Determina la moda o modas.

6.471. Actividad · Control de calidad

Para X ~ Binomial(12;0,05):

1. Define qué representa éxito.

2. Calcula P(X=0).

3. Calcula P(X=1).

4. Calcula P(X≥1).

5. Calcula P(X≤2).

6. Calcula E[X].

7. Calcula Var(X).

8. Calcula σ.

9. Interpreta E[X] en contexto.

10. Explica qué hipótesis reales tendrían que verificarse para justificar la independencia entre piezas.

6.472. Reto de modelación · ¿Binomial o no?

Tabla 6.50
Diagnóstico de diferentes mecanismos aleatorios

1. Contar caras en 20 lanzamientos independientes con p constante.

2. Contar cartas rojas en 10 extracciones sin reemplazo.

3. Contar respuestas correctas en 15 preguntas independientes con igual probabilidad de acierto.

4. Contar compras entre 100 clientes independientes cuando cada cliente posee una probabilidad pᵢ diferente.

5. Contar defectos cuando la tasa de defecto aumenta durante el turno.

6. Contar respuestas positivas cuando la decisión de un participante puede influir sobre el siguiente.

Ver orientación

1. Binomial.

2. No binomial exacta. Corresponde al marco hipergeométrico.

3. Binomial, bajo las hipótesis indicadas.

4. No binomial ordinaria. Puede aparecer una Poisson-binomial.

5. No. p no permanece constante.

6. No en general. Puede existir dependencia.

6.473. Comprueba lo aprendido

1. ¿Qué es un ensayo de Bernoulli?

2. ¿Qué significan éxito y fracaso?

3. ¿Qué valores toma una Bernoulli?

4. Escribe su función de masa.

5. ¿Cuál es E[X] para Bernoulli(p)?

6. ¿Cuál es Var(X)?

7. ¿Qué relación existe entre Bernoulli e indicadores?

8. ¿Qué significa i.i.d.?

9. ¿Cómo se construye X binomial a partir de X₁,…,Xₙ?

10. ¿Cuáles son las cuatro condiciones binomiales?

11. ¿Por qué aparece C(n,k)?

12. Escribe la función de masa binomial.

13. ¿Qué significa exactamente k?

14. ¿Qué significa a lo sumo k?

15. ¿Qué significa al menos k?

16. ¿Cómo se calcula F(k)?

17. ¿Cómo se calcula P(X≥1)?

18. ¿Cuál es E[X] para una binomial?

19. ¿Cuál es Var(X)?

20. ¿Cuál es σ?

21. ¿Por qué la linealidad de la esperanza no necesita independencia?

22. ¿Por qué sí aparece independencia al sumar varianzas?

23. ¿Cuándo una binomial es simétrica?

24. ¿Qué indica el signo de su asimetría?

25. ¿Cómo se determina su moda?

26. ¿Qué es la función generadora de momentos?

27. ¿Cuándo la suma de dos binomiales sigue siendo binomial?

28. ¿Por qué p y k/n son conceptos distintos?

29. ¿Qué es la verosimilitud de p?

30. ¿Por qué aparece p̂=k/n?

31. ¿Por qué el muestreo sin reemplazo no suele ser binomial exacto?

32. ¿Qué es una distribución Poisson-binomial?

33. ¿Qué entendemos por sobredispersión?

34. ¿Por qué reconocer el mecanismo del experimento es más importante que reconocer una fórmula?

6.474. Mapa conceptual

Figura 6.103
Del ensayo Bernoulli al modelo binomial y sus extensiones
UN ENSAYO BINARIO
BERNOULLI(p)

0 o 1

↓ repetir n veces
n fijo · misma p · independencia
↓ sumar indicadores
X ~ Binomial(n,p)
FUNCIÓN DE MASA

C(n,k)pk(1−p)n−k

CENTRO

E[X]=np

DISPERSIÓN

Var=np(1−p)

↓ si fallan las condiciones
sin reemplazo → hipergeométrica
pᵢ diferentes → Poisson-binomial
dependencia → otro modelo

Nota. Elaboración propia.

6.475. Síntesis

Un ensayo Bernoulli produce dos categorías complementarias.

X ~ Bernoulli(p)

significa:

P(X=1)=p,   P(X=0)=1−p.

Su esperanza y varianza son:

E[X]=p,   Var(X)=p(1−p).

Si X₁,…,Xₙ son Bernoulli independientes e idénticamente distribuidas con parámetro p:

X=X₁+···+Xₙ

tiene distribución:

X ~ Binomial(n,p).

Su función de masa es:

P(X=k)=C(n,k)pk(1−p)n−k.

C(n,k) aparece porque varios órdenes distintos pueden producir exactamente k éxitos.

La función acumulada se obtiene sumando las masas:

F(k)=P(X≤k).

Para al menos un éxito:

P(X≥1)=1−(1−p)n.

La media y la dispersión son:

E[X]=np,

Var(X)=np(1−p),

σ=√[np(1−p)].

Cuando p=0,50 la distribución es simétrica. Cuando p se aleja de 0,50 aparece asimetría.

La moda puede determinarse mediante (n+1)p y las probabilidades sucesivas mediante una relación recursiva.

La función generadora de momentos es:

MX(t)=[1−p+pet]n.

La suma de binomiales independientes con la misma p sigue siendo binomial.

Si las probabilidades de éxito difieren entre ensayos, puede aparecer la distribución Poisson-binomial. Si muestreamos sin reemplazo de una población finita, el modelo exacto suele ser hipergeométrico.

También debemos distinguir:

p = parámetro del modelo
k/n = frecuencia observada.

A partir de los datos, la verosimilitud conduce naturalmente al estimador:

p̂=k/n.

La lección central no consiste en memorizar una expresión con factoriales: consiste en reconocer qué mecanismo probabilístico hace legítimo utilizar esa expresión.

Bernoulli registra si el éxito ocurrió.

La binomial cuenta cuántas veces ocurrió después de repetir el ensayo bajo condiciones probabilísticas precisas.

SIGUIENTE
Parte 14 de 18 · Distribuciones geométrica, hipergeométrica y Poisson
Cambiaremos la estructura del experimento: esperaremos hasta que ocurra un éxito, muestrearemos sin reemplazo y contaremos eventos dentro de intervalos de tiempo o espacio.
La numeración continuará en 6.476.

Referencias

Bernoulli, J. (1713). Ars conjectandi. Thurneysen.

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 14 DE 18
CAPÍTULO 6

Distribuciones geométrica, hipergeométrica y Poisson

Esperar · muestrear · contar: tres mecanismos diferentes, tres modelos diferentes

primer éxito · sin reemplazo · población finita · tasa · proceso de Poisson · aproximaciones · conexiones

Idea central

Una distribución de probabilidad no se elige porque su fórmula contenga números parecidos a los del problema. Primero debemos identificar qué mecanismo aleatorio genera la variable X.

Si repetimos ensayos hasta observar el primer éxito, aparece la distribución geométrica.

Si seleccionamos una muestra sin reemplazo de una población finita y contamos éxitos, aparece la distribución hipergeométrica.

Si contamos eventos que ocurren dentro de un intervalo bajo un mecanismo compatible con una tasa estable e incrementos independientes, aparece la distribución de Poisson.

mecanismo → variable → distribución → cálculo → interpretación

Al finalizar esta parte podrás:
reconocer un experimento geométrico;
calcular probabilidades de espera hasta el primer éxito;
interpretar supervivencia y ausencia de memoria;
interpretar el riesgo constante de una geométrica;
reconocer un problema hipergeométrico;
determinar correctamente el soporte hipergeométrico;
explicar la dependencia causada por el muestreo sin reemplazo;
interpretar la corrección por población finita;
reconocer cuándo un conteo puede modelarse mediante Poisson;
interpretar correctamente el parámetro λ;
trabajar con un proceso homogéneo de Poisson;
utilizar propiedades de suma y adelgazamiento de Poisson;
comprender aproximaciones entre modelos;
elegir entre Bernoulli, binomial, geométrica, hipergeométrica y Poisson.

6.476. La pregunta determina el modelo

Compare las siguientes preguntas.

PREGUNTA A

¿En qué intento aparecerá el primer éxito?

GEOMÉTRICA

PREGUNTA B

¿Cuántos éxitos aparecerán en una muestra tomada sin reemplazo?

HIPERGEOMÉTRICA

PREGUNTA C

¿Cuántos eventos ocurrirán durante cierto intervalo?

POISSON

Figura 6.104
Tres acciones probabilísticas: esperar, muestrear y contar
¿QUÉ ESTÁ HACIENDO LA VARIABLE X?
ESPERA

registra cuándo aparece el primer éxito

GEOMÉTRICA
MUESTREA

cuenta éxitos en una muestra sin reemplazo

HIPERGEOMÉTRICA
CUENTA

registra eventos en un intervalo

POISSON

Nota. Elaboración propia.

6.477. Antes de calcular: identifica el mecanismo

Tabla 6.51
Comparación inicial de los tres modelos
GEOMÉTRICA

X: ensayo del primer éxito.

Soporte: 1,2,3,…

Clave: p constante e independencia.

HIPERGEOMÉTRICA

X: éxitos encontrados en una muestra.

Población: finita.

Clave: selección sin reemplazo.

POISSON

X: número de eventos en una región.

Soporte: 0,1,2,…

Clave: tasa e incrementos compatibles con Poisson.

I
DISTRIBUCIÓN GEOMÉTRICA
¿Cuándo aparecerá el primer éxito?

6.478. El experimento continúa hasta que aparece el primer éxito

Lanzamos una moneda repetidamente y llamamos éxito a obtener cara.

C

X=1

S · C

X=2

S · S · C

X=3

S · S · S · C

X=4

A diferencia de una binomial, el número total de ensayos no está fijado previamente.

Figura 6.105
Una realización geométrica que termina en el cuarto ensayo
F
1
F
2
F
3
ÉXITO
4

X=4

Nota. Elaboración propia.

6.479. Condiciones del modelo geométrico

DOS CATEGORÍAS

éxito o fracaso.

p CONSTANTE

la probabilidad de éxito no cambia.

INDEPENDENCIA

los ensayos se modelan como independientes.

REGLA DE PARADA

terminamos al aparecer el primer éxito.

6.480. La convención que utilizaremos

X = número del ensayo en el que ocurre el primer éxito

X∈{1,2,3,…}.

Atención. Algunos libros definen una geométrica como el número de fracasos anteriores al primer éxito. En esa convención el soporte comienza en 0. Aquí utilizaremos siempre el número del ensayo del primer éxito.

6.481. Función de masa geométrica

Para que X=k deben producirse:

k−1 fracasos seguidos de un éxito.

P(X=k)=(1−p)k−1p
k=1,2,3,…
PARA PROFUNDIZAR · DEMOSTRACIÓN 41 · ●●●●

6.482. Derivación de la función de masa geométrica

El evento X=k tiene la estructura:

F · F · … · F · E.

Hay k−1 fracasos. Su probabilidad conjunta es:

(1−p)k−1.

El ensayo k debe ser un éxito de probabilidad p.

P(X=k)=(1−p)k−1p.

6.483. Ejemplo · Primer éxito en el cuarto intento

FUNDAMENTAL · ●○○○

Si p=0,25:

P(X=4)=(0,75)³(0,25).

=0,10546875

≈10,55 %

6.484. Cola, supervivencia y función acumulada

El evento:

X>k

significa que los primeros k ensayos fueron fracasos. Por tanto:

SUPERVIVENCIA

P(X>k)=(1−p)k

ACUMULADA

P(X≤k)=1−(1−p)k

6.485. Ejemplo · Éxito durante los primeros tres intentos

Con p=0,25:

P(X>3)=(0,75)³=0,421875.

P(X≤3)=1−0,421875

=0,578125=57,8125 %.

6.486. La forma de una distribución geométrica

Figura 6.106
Función de masa geométrica para p=0,25
1
2
3
4
5
6
7

Nota. Elaboración propia. Cada probabilidad es el 75 % de la anterior.

6.487. Media, varianza y desviación estándar geométricas

E[X]=1/p
Var(X)=(1−p)/p²
σ=√(1−p)/p

Si p=0,25:

E[X]=4.

E[X]=4 no significa que el primer éxito tenga que aparecer en el cuarto ensayo. Es la media de toda la distribución de tiempos de espera.

PARA PROFUNDIZAR · DEMOSTRACIÓN 42 · ●●●●

6.488. ¿Por qué E[X]=1/p?

Para una variable entera positiva:

E[X]=Σk≥0P(X>k).

En la geométrica:

P(X>k)=(1−p)k.

E[X]=1+(1−p)+(1−p)²+···

Es una serie geométrica de razón 1−p.

E[X]=1/p.

PARA PROFUNDIZAR · DEMOSTRACIÓN 43 · ●●●●

6.489. Derivación de la varianza geométrica

Sea q=1−p. La función generadora de probabilidades es:

G(s)=E[sX] = ps/(1−qs).

Derivando y evaluando en s=1:

G′(1)=E[X]=1/p,

G″(1)=E[X(X−1)]=2q/p².

Como:

X²=X(X−1)+X,

E[X²]=2q/p²+1/p.

Finalmente:

Var(X)=E[X²]−E[X]²=(1−p)/p².

6.490. La geométrica no tiene memoria

P(X>s+t | X>s)=P(X>t)

Haber esperado s ensayos sin éxito no modifica la distribución de la espera adicional.

La ausencia de memoria no es una propiedad de cualquier fenómeno real. Es una consecuencia matemática de los supuestos de p constante e independencia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 44 · ●●●●

6.491. Demostración de la propiedad sin memoria

P(X>k)=(1−p)k.

Entonces:

P(X>s+t | X>s) = P(X>s+t)/P(X>s).

=(1−p)s+t/ (1−p)s

=(1−p)t=P(X>t).

6.492. Riesgo constante: otra forma de entender la ausencia de memoria

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Supongamos que hemos llegado al ensayo k sin éxito. La probabilidad de que precisamente el ensayo k sea el primero exitoso es:

P(X=k | X≥k)=p.

A esta probabilidad condicional puede interpretársela como una tasa de riesgo discreta.

En la geométrica es constante:

h(k)=p.

El tiempo transcurrido no aumenta ni disminuye el riesgo del éxito siguiente dentro del modelo.

6.493. Función generadora de probabilidades

Para |(1−p)s|<1:

GX(s)=ps/[1−(1−p)s].

Esta función codifica todas las probabilidades de la distribución y permite obtener momentos mediante derivadas.

6.494. Binomial y geométrica: mismos ensayos, preguntas distintas

BINOMIAL

Fijamos primero n ensayos.

X cuenta cuántos éxitos aparecen.

GEOMÉTRICA

No fijamos cuántos ensayos serán necesarios.

X registra cuándo aparece el primer éxito.

6.495. Del primer éxito al éxito número r

PROFUNDIZACIÓN · ●●●●

La geométrica espera hasta el primer éxito. Podemos generalizar la pregunta:

¿en qué ensayo ocurrirá el éxito número r?

Si T es el número del ensayo donde aparece el éxito r:

P(T=k)=C(k−1,r−1)pr(1−p)k−r,

k=r,r+1,…

Esta es una forma de la distribución binomial negativa. La geométrica corresponde al caso r=1.

II
DISTRIBUCIÓN HIPERGEOMÉTRICA
Contar éxitos cuando muestreamos sin reemplazo

6.496. El problema que la binomial no resuelve exactamente

Consideremos una población hipotética de 20 piezas:

6 defectuosas y 14 no defectuosas.

Seleccionamos cinco piezas sin reemplazo y definimos:

X = número de piezas defectuosas en la muestra.

Figura 6.107
Población finita y selección sin reemplazo
POBLACIÓN N=20
seleccionamos n=5 sin devolver las piezas

Nota. Elaboración propia. Datos hipotéticos.

6.497. Parámetros de la distribución hipergeométrica

N

tamaño de la población

K

éxitos existentes en la población

N−K

fracasos existentes

n

tamaño de muestra

X

éxitos encontrados en la muestra

N=20,   K=6,   n=5.

6.498. ¿Por qué no es una binomial exacta?

En la primera extracción:

P(defectuosa)=6/20=0,30.

Si la primera fue defectuosa y no la devolvemos:

P(defectuosa en la segunda | primera defectuosa)=5/19≈0,2632.

La extracción modifica la población restante. Por ello cambian las probabilidades y las selecciones son dependientes.

Figura 6.108
Binomial e hipergeométrica difieren por el mecanismo
BINOMIAL

p permanece constante.

Ensayos independientes.

HIPERGEOMÉTRICA

No hay reemplazo.

La composición cambia.

Nota. Elaboración propia.

6.499. Contemos las muestras posibles

El número total de muestras de tamaño n tomadas de N elementos, cuando el orden no importa, es:

C(N,n).

Para obtener exactamente k éxitos necesitamos:

C(K,k)

elegir los k éxitos

C(N−K,n−k)

elegir los n−k fracasos

6.500. Función de masa hipergeométrica

P(X=k)= [C(K,k)C(N−K,n−k)]/C(N,n)
PARA PROFUNDIZAR · DEMOSTRACIÓN 45 · ●●●●

6.501. Derivación combinatoria de la función hipergeométrica

Suponemos que todas las muestras de tamaño n son equiprobables.

total=C(N,n).

Una muestra con exactamente k éxitos puede formarse de:

C(K,k)C(N−K,n−k)

maneras.

P(X=k)= [C(K,k)C(N−K,n−k)]/C(N,n).

6.502. Ejemplo · Exactamente dos defectuosas

AVANZADO · ●●●○

N=20,   K=6,   n=5,   k=2.

P(X=2)=[C(6,2)C(14,3)]/C(20,5)

=(15·364)/15.504

≈0,3522≈35,22 %.

Tabla 6.52
Construcción combinatoria de P(X=2)
Éxitos

elegir 2 entre 6

C(6,2)=15

Fracasos

elegir 3 entre 14

C(14,3)=364

Total

elegir 5 entre 20

C(20,5)=15.504

6.503. El soporte hipergeométrico tiene límites

No cualquier valor de k es posible.

max[0,n−(N−K)]≤k≤min(n,K).

En el ejemplo:

0≤k≤5.

6.504. Media de la distribución hipergeométrica

La proporción de éxitos de la población es K/N.

E[X]=nK/N.
PARA PROFUNDIZAR · DEMOSTRACIÓN 46 · ●●●●

6.505. E[X]=nK/N mediante variables indicadoras

Sea Iᵢ=1 si la posición i de la muestra contiene un éxito y 0 en caso contrario.

X=I₁+···+Iₙ.

Por simetría:

E[Iᵢ]=K/N.

La linealidad de la esperanza da:

E[X]=nK/N.

No necesitamos independencia para esta suma de esperanzas.

6.506. Varianza y corrección por población finita

Para N>1:

Var(X)=n(K/N)(1−K/N)(N−n)/(N−1).

El factor:

(N−n)/(N−1)

se denomina aquí factor de corrección por población finita dentro de la varianza.

PARA PROFUNDIZAR · DEMOSTRACIÓN 47 · ●●●●

6.507. La corrección finita aparece por dependencia negativa

Definimos nuevamente indicadores Iᵢ. Sea:

p=K/N.

Para i≠j:

P(Iᵢ=1,Iⱼ=1) = (K/N)((K−1)/(N−1)).

Entonces:

Cov(Iᵢ,Iⱼ) = −p(1−p)/(N−1).

La covarianza es negativa: observar un éxito reduce ligeramente la probabilidad de otro éxito en la selección siguiente.

Como X=ΣIᵢ:

Var(X) = n p(1−p) + n(n−1)Cov(Iᵢ,Iⱼ).

Var(X)=np(1−p)(N−n)/(N−1).

Figura 6.109
Sin reemplazo: cada selección aporta información sobre la siguiente
ANTES

K/N

proporción de éxitos

EXTRAEMOS UN ÉXITO

no lo devolvemos

DESPUÉS

(K−1)/(N−1)

la probabilidad cambió

Nota. Elaboración propia.

6.508. Media y dispersión del ejemplo

N=20,   K=6,   n=5.

E[X]

5(6/20)

1,5

Var(X)

5(0,30)(0,70)(15/19)

≈0,8289

σ

√0,8289

≈0,9105

6.509. ¿Cuándo puede aproximarse por una binomial?

Cuando N es grande y la fracción de muestreo n/N es pequeña, cada extracción modifica poco la composición de la población.

En esas circunstancias una:

Binomial(n,K/N)

puede aproximar la hipergeométrica. Una regla práctica frecuente es considerar pequeña una fracción de muestreo cercana o inferior al 5 %, pero no es una frontera matemática universal. La precisión requerida debe guiar la decisión.

III
DISTRIBUCIÓN DE POISSON
Contar eventos dentro de un intervalo o región

6.510. Una pregunta diferente: contar eventos

Supongamos que una central telefónica se modela con una media de:

3 llamadas por minuto.

Nos preguntamos:

¿cuál es la probabilidad de recibir exactamente dos llamadas durante el próximo minuto?

Aquí X no cuenta éxitos dentro de un número fijo de ensayos. Cuenta eventos dentro de una región.

Figura 6.110
Un conteo de Poisson sobre un intervalo temporal
0 s 60 s
X=3 eventos

Nota. Elaboración propia. El intervalo también podría representar longitud, área o volumen.

6.511. El parámetro λ

En:

X ~ Poisson(λ),

λ es el número medio esperado de eventos en la región estudiada.

Si r es la tasa media por unidad y t es la longitud del intervalo:

λ=rt.

λ no es una probabilidad. Puede ser mayor que 1. Lo que debe ser no negativo es λ≥0.

Tabla 6.53
Tasa e intervalo determinan el parámetro de Poisson
r=3/min

t=0,5 min

λ=1,5

r=3/min

t=1 min

λ=3

r=3/min

t=2 min

λ=6

6.512. Del modelo Poisson a un proceso de Poisson

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Podemos estudiar no solo un conteo aislado, sino toda una colección:

{N(t): t≥0},

donde N(t) cuenta cuántos eventos han ocurrido desde el instante 0 hasta el instante t.

Un proceso homogéneo de Poisson de tasa r satisface:

N(t) ~ Poisson(rt).

Así, la distribución de Poisson describe los conteos del proceso sobre intervalos.

6.513. Condiciones del proceso homogéneo de Poisson

N(0)=0

el conteo comienza en cero.

INCREMENTOS INDEPENDIENTES

regiones disjuntas producen conteos independientes.

ESTACIONARIEDAD

la distribución de un incremento depende de la longitud del intervalo, no de su ubicación.

INTERVALOS PEQUEÑOS

un solo evento tiene probabilidad aproximadamente proporcional a la longitud del intervalo.

Más formalmente, para h pequeño:

P(N(h)=1)=rh+o(h),

P(N(h)≥2)=o(h).

La notación o(h) representa cantidades que, comparadas con h, se vuelven despreciables cuando h→0.

6.514. Función de masa de Poisson

P(X=k)=e−λλk/k!
k=0,1,2,…   y   λ>0

6.515. Ejemplo · Exactamente dos llamadas

INTERMEDIO · ●●○○

X ~ Poisson(3).

P(X=2)=e−33²/2!

≈0,2240≈22,40 %.

6.516. Forma de una distribución Poisson

Figura 6.111
Forma aproximada de Poisson(3)
0
1
2
3
4
5
6
7

Nota. Elaboración propia. Las alturas son proporcionales a las probabilidades teóricas.

6.517. Probabilidades acumuladas y de cola

Para un entero k:

P(X≤k)=Σj=0k e−λλj/j!

Y:

P(X>k)=1−P(X≤k).

Para valores grandes de k estas sumas suelen evaluarse con software.

6.518. «Al menos un evento» mediante el complemento

Para Poisson(λ):

P(X=0)=e−λ.

P(X≥1)=1−e−λ.

Para λ=3:

P(X≥1)≈0,9502=95,02 %.

6.519. Cambiar el intervalo cambia λ

Figura 6.112
Una tasa constante produce λ proporcional a la longitud del intervalo
30 segundos

t=0,5 min

λ=1,5

1 minuto

t=1 min

λ=3

2 minutos

t=2 min

λ=6

Nota. Elaboración propia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 48 · ●●●●

6.520. ¿Por qué las probabilidades de Poisson suman 1?

Σ e−λλk/k! = e−λ Σλk/k!.

La serie exponencial cumple:

eλ = Σλk/k!.

e−λ eλ=1.

6.521. Media, varianza y desviación estándar de Poisson

E[X]=λ
Var(X)=λ
σ=√λ

La igualdad media = varianza es una propiedad del modelo Poisson. En datos reales puede utilizarse como una señal diagnóstica, pero no como una prueba definitiva de que los datos sean Poisson.

PARA PROFUNDIZAR · DEMOSTRACIÓN 49 · ●●●●

6.522. Demostración de E[X]=λ y Var(X)=λ

E[X]=Σ k e−λλk/k!.

Para k≥1:

k/k!=1/(k−1)!.

E[X] = λΣe−λ λk−1/(k−1)!.

E[X]=λ.

De forma análoga:

E[X(X−1)]=λ².

E[X²]=λ²+λ.

Var(X)=(λ²+λ)−λ²=λ.

6.523. Una recurrencia muy útil y la moda de Poisson

Dividamos dos probabilidades consecutivas:

P(X=k+1)/P(X=k)=λ/(k+1).

Por tanto:

P(X=k+1)=P(X=k)·λ/(k+1).

Las probabilidades aumentan mientras λ/(k+1)>1 y disminuyen después.

Si λ no es entero, la moda es:

⌊λ⌋.

Si λ es un entero positivo m, hay dos modas:

m−1 y m.

6.524. La suma de Poisson independientes sigue siendo Poisson

Sean:

X ~ Poisson(λ₁),   Y ~ Poisson(λ₂),

independientes.

X+Y ~ Poisson(λ₁+λ₂).

Esta propiedad permite combinar fuentes independientes de eventos.

PARA PROFUNDIZAR · DEMOSTRACIÓN 50 · ●●●●

6.525. Demostración de la propiedad de suma

Para Z=X+Y:

P(Z=k) = Σj=0k P(X=j)P(Y=k−j).

Sustituimos las funciones de masa:

= e−(λ₁+λ₂) Σ λ₁j λ₂k−j /[j!(k−j)!].

Utilizando el teorema del binomio:

P(Z=k) = e−(λ₁+λ₂) (λ₁+λ₂)k/k!.

6.526. Adelgazamiento de un proceso de Poisson

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Supongamos que los eventos forman un proceso de Poisson con media λ en cierta región.

Clasificamos cada evento de forma independiente como tipo A con probabilidad a.

Entonces el número de eventos A sigue:

Poisson(aλ),

mientras que los demás siguen:

Poisson((1−a)λ).

Además, ambos conteos son independientes.

Figura 6.113
Adelgazamiento de un proceso de Poisson
PROCESO ORIGINAL · λ
↓ clasificar cada evento
TIPO A

probabilidad a

Poisson(aλ)

OTROS

probabilidad 1−a

Poisson((1−a)λ)

Nota. Elaboración propia.

6.527. Poisson no significa simplemente «evento raro»

Fallas, defectos, llamadas y accidentes aparecen frecuentemente en ejemplos de Poisson, pero la rareza no define el modelo.

Un fenómeno frecuente puede ser compatible con Poisson, y un fenómeno muy raro puede no serlo. Lo importante es la estructura probabilística del mecanismo.

6.528. Poisson como aproximación de una binomial

Considere:

X ~ Binomial(n,p),

con n grande y p pequeña, mientras:

np≈λ.

Bajo este régimen:

Binomial(n,p) ≈ Poisson(np).

«n grande» y «p pequeña» no poseen un único punto de corte universal. La calidad de la aproximación depende de la precisión requerida.

PARA PROFUNDIZAR · DEMOSTRACIÓN 51 · ●●●●

6.529. Límite binomial → Poisson

Mantengamos:

np=λ,   p=λ/n.

La función binomial es:

C(n,k)(λ/n)k (1−λ/n)n−k.

Para k fijo y n→∞:

n(n−1)···(n−k+1)/nk→1,

(1−λ/n)n→e−λ.

P(X=k)→e−λλk/k!.

6.530. Del conteo Poisson al tiempo de espera

PUENTE HACIA VARIABLES CONTINUAS · ●●●●

Sea T el tiempo hasta el primer evento en un proceso de Poisson de tasa r.

El evento:

T>t

significa que en el intervalo [0,t] no ocurrió ningún evento.

P(T>t)=P(N(t)=0).

Como N(t)~Poisson(rt):

P(T>t)=e−rt

P(T≤t)=1−e−rt.

Esta es la función acumulada de una distribución exponencial. Así aparece una conexión profunda:

Poisson cuenta eventos;
exponencial mide el tiempo entre eventos.

Figura 6.114
Dos perspectivas del mismo proceso
POISSON

fijamos un intervalo

contamos eventos

EXPONENCIAL

fijamos un evento

medimos cuánto esperamos

Nota. Elaboración propia.

6.531. Cinco modelos discretos: elige por mecanismo

Tabla 6.54
Guía para elegir un modelo discreto
BERNOULLI

un ensayo

¿ocurrió el éxito?

BINOMIAL

n ensayos fijos

¿cuántos éxitos?

GEOMÉTRICA

ensayos hasta éxito

¿cuándo ocurre el primero?

HIPERGEOMÉTRICA

población finita

¿cuántos éxitos sin reemplazo?

POISSON

eventos en una región

¿cuántos ocurren?

6.532. Errores frecuentes

Error 1

Usar geométrica aunque p cambie entre intentos.

Error 2

Olvidar qué convención se usa para la geométrica.

Error 3

Interpretar la ausencia de memoria como una ley de la realidad.

Error 4

Usar binomial exacta en muestreo sin reemplazo de una población pequeña.

Error 5

Ignorar los límites posibles de k en una hipergeométrica.

Error 6

Confundir λ con una probabilidad.

Error 7

Aplicar Poisson a cualquier variable de conteo.

Error 8

Cambiar el intervalo pero conservar el mismo λ.

Error 9

Creer que media=varianza demuestra que los datos son Poisson.

Error 10

Usar una aproximación sin evaluar si su error es aceptable.

6.533. Práctica de dificultad creciente

FUNDAMENTAL · ●○○○

En ensayos independientes con p=0,20: calcula la probabilidad de que el primer éxito ocurra en el cuarto intento.

Ver solución

P(X=4)=(0,80)³(0,20)=0,1024=10,24 %.

INTERMEDIO · ●●○○

En una población de N=30 elementos, K=8 son éxitos. Se seleccionan n=6 sin reemplazo. Calcula P(X=2).

Ver orientación

P(X=2)=[C(8,2)C(22,4)]/C(30,6).

AVANZADO · ●●●○

Una central recibe en promedio 4 llamadas cada 10 minutos.

a) Calcula la probabilidad de cero llamadas en 5 minutos.
b) Calcula la probabilidad de al menos una.
c) Calcula E[X] y Var(X) para 30 minutos.

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Sean X ~ Poisson(2) y Y ~ Poisson(5), independientes.

1. Determina la distribución de X+Y.
2. Calcula P(X+Y=4).
3. Si cada evento se clasifica independientemente como tipo A con probabilidad 0,30, determina la distribución del número de eventos A.

Ver orientación

X+Y ~ Poisson(7).

P(X+Y=4)=e−77⁴/4!.

El conteo tipo A es Poisson(0,30·7)=Poisson(2,1).

6.534. Simulación y hoja de cálculo

Las tres distribuciones pueden simularse, pero el algoritmo debe respetar el mecanismo.

Tabla 6.55
Qué debe reproducir una simulación
GEOMÉTRICA

repetir Bernoulli hasta el primer éxito.

HIPERGEOMÉTRICA

seleccionar elementos sin devolverlos a la población.

POISSON

generar conteos según una Poisson con el λ correspondiente.

Los nombres de funciones estadísticas en Excel pueden cambiar según idioma y versión. La herramienta debe emplearse después de identificar correctamente el modelo.

6.535. Comprueba lo aprendido

1. ¿Qué variable cuenta una distribución geométrica?

2. ¿Cuál es su soporte bajo nuestra convención?

3. Escribe su función de masa.

4. ¿Qué significa P(X>k)?

5. Escribe F(k).

6. ¿Cuál es E[X]?

7. ¿Cuál es Var(X)?

8. ¿Qué significa que una geométrica no tenga memoria?

9. ¿Por qué su tasa de riesgo es constante?

10. ¿Qué relación existe entre geométrica y binomial negativa?

11. ¿Qué mecanismo produce una hipergeométrica?

12. ¿Qué significan N, K y n?

13. Escribe la función de masa hipergeométrica.

14. ¿Cuáles son los límites posibles de k?

15. ¿Cuál es E[X]?

16. ¿Cuál es su varianza?

17. ¿Qué representa la corrección por población finita?

18. ¿Por qué las selecciones sin reemplazo presentan dependencia negativa?

19. ¿Qué representa λ en una distribución Poisson?

20. ¿Por qué λ no es una probabilidad?

21. Escribe la función de masa de Poisson.

22. ¿Cuál es E[X]?

23. ¿Cuál es Var(X)?

24. ¿Qué significa que un proceso tenga incrementos independientes?

25. ¿Qué significa que sea homogéneo?

26. Escribe la recurrencia entre P(X=k+1) y P(X=k).

27. ¿Dónde se encuentra la moda de una Poisson?

28. ¿Qué ocurre al sumar Poisson independientes?

29. ¿Qué es el adelgazamiento de un proceso de Poisson?

30. ¿Por qué «evento raro» no define una Poisson?

31. ¿Cuándo Poisson puede aproximar una binomial?

32. ¿Qué distribución aparece para el tiempo hasta el primer evento de un proceso Poisson?

33. Explica por qué identificar el mecanismo debe preceder al cálculo.

6.536. Síntesis y mapa de modelos discretos

Figura 6.115
Mapa de los principales modelos discretos estudiados
¿QUÉ MECANISMO GENERA X?
BERNOULLI

un ensayo

0 o 1

BINOMIAL

n ensayos

contar éxitos

GEOMÉTRICA

esperar

primer éxito

HIPERGEOMÉTRICA

sin reemplazo

éxitos en muestra

POISSON

región fija

contar eventos

Nota. Elaboración propia.

La distribución geométrica modela el número de ensayos necesarios para observar el primer éxito:

P(X=k)=(1−p)k−1p.

E[X]=1/p,   Var(X)=(1−p)/p².

Su función de supervivencia es:

P(X>k)=(1−p)k,

y posee la propiedad sin memoria:

P(X>s+t | X>s)=P(X>t).

La distribución hipergeométrica modela el número de éxitos obtenidos al muestrear sin reemplazo:

P(X=k)= [C(K,k)C(N−K,n−k)]/C(N,n).

E[X]=nK/N.

Para N>1:

Var(X)=n(K/N)(1−K/N)(N−n)/(N−1).

El último factor aparece porque las selecciones sin reemplazo presentan dependencia negativa.

La distribución de Poisson modela conteos de eventos dentro de una región:

P(X=k)=e−λλk/k!.

E[X]=Var(X)=λ.

En un proceso homogéneo de tasa r:

N(t)~Poisson(rt).

Los conteos Poisson independientes pueden sumarse, y un proceso puede dividirse mediante adelgazamiento.

Además:

Binomial(n,p) → Poisson(λ) cuando n→∞, p→0 y np→λ.

Y el tiempo T hasta el primer evento de un proceso Poisson satisface:

P(T≤t)=1−e−rt.

La gran idea de esta parte no es memorizar tres fórmulas: es reconocer que esperar, muestrear y contar representan estructuras probabilísticas diferentes.

Una distribución no se elige por la apariencia de su fórmula.

Se elige porque representa razonablemente el mecanismo que genera la variable aleatoria.

SIGUIENTE
Parte 15 de 18 · Variables aleatorias continuas y densidad
Pasaremos de probabilidades concentradas en valores separados a distribuciones cuya probabilidad se representa mediante áreas. La conexión Poisson–exponencial nos servirá como puente natural.
La numeración continuará en 6.537.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Feller, W. (1968). An introduction to probability theory and its applications (Vol. 1, 3rd ed.). Wiley.

Poisson, S. D. (1837). Recherches sur la probabilité des jugements en matière criminelle et en matière civile. Bachelier.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 15 DE 18
CAPÍTULO 6

Variables aleatorias continuas y densidad

De probabilidades concentradas en puntos a probabilidades distribuidas sobre regiones

soporte · densidad f(x) · área · integral · F(x) · cuantiles · esperanza · varianza · transformaciones

Idea central

En una distribución discreta podemos asignar una cantidad positiva de probabilidad a determinados valores individuales:

P(X=0),   P(X=1),   P(X=2), …

En una variable aleatoria cuya distribución posee densidad, la representación cambia: la probabilidad se distribuye sobre regiones de la escala y se obtiene mediante áreas.

Por eso una altura f(x) no debe confundirse con P(X=x). La densidad describe concentración local de probabilidad; la probabilidad de un intervalo aparece al integrar esa densidad.

densidad → área → probabilidad

Al finalizar esta parte podrás:
distinguir modelos discretos y continuos;
reconocer el concepto de soporte;
interpretar correctamente una densidad f(x);
comprobar si una función puede ser una densidad;
calcular probabilidades mediante integrales;
explicar por qué P(X=a)=0;
interpretar la función acumulada F(x);
utilizar cuantiles, mediana y percentiles;
calcular esperanza y varianza;
interpretar las unidades de una densidad;
transformar variables continuas;
comprender el método de transformación inversa;
conectar Poisson con la distribución exponencial;
distinguir histograma, datos, instrumento y densidad teórica.

6.537. De valores separados a un continuo de posibilidades

Comparemos dos variables.

X = número de estudiantes que llegan tarde

X puede tomar valores:

0,1,2,3,…

Es un conteo. No tiene sentido observar 2,47 estudiantes.

Consideremos ahora:

T = tiempo necesario para recorrer cierta distancia

Un modelo continuo podría admitir:

12,4 s · 12,41 s · 12,413 s · 12,4137 s · …

Matemáticamente, entre dos valores distintos existen siempre otros valores.

Figura 6.116
Valores discretos frente a una escala continua
DISCRETA
●   ●   ●   ●   ●
0    1    2    3    4

valores separados

CONTINUA
12 13 14 15

intervalo continuo

Nota. Elaboración propia. Se representan dos estructuras matemáticas diferentes.

6.538. Alcance: distribuciones continuas que poseen densidad

Estudiaremos principalmente variables aleatorias cuya distribución puede describirse mediante una función:

f(x).

En lenguaje más avanzado, estas distribuciones se denominan absolutamente continuas respecto de la longitud.

Precisión importante. No toda distribución que carece de masas puntuales tiene necesariamente una densidad ordinaria. En esta parte estudiaremos la clase, muy amplia e importante, de distribuciones que sí pueden representarse mediante f(x).

6.539. Modelo continuo y medición real no son lo mismo

Supongamos que una balanza muestra:

72,35 kg.

El instrumento posee una resolución finita: no puede mostrar infinitas cifras.

Sin embargo, podemos representar matemáticamente la magnitud física mediante una variable continua.

Modelo ≠ registro. La resolución determina cómo observamos o registramos una magnitud; no determina por sí sola la naturaleza del modelo probabilístico.

6.540. El soporte: dónde puede vivir la variable

El soporte describe la región de valores donde la distribución concentra su probabilidad.

Algunos ejemplos son:

[0,1]

proporciones

[0,∞)

tiempos de espera

(−∞,∞)

modelos sin límite teórico

El soporte no tiene que ser necesariamente toda la recta real ni siquiera un único intervalo.

6.541. Función de densidad de probabilidad

f(x)

Una densidad describe cómo se concentra localmente la probabilidad a lo largo de la escala.

f(x) no es P(X=x).

Figura 6.117
Masa discreta frente a densidad continua
DISCRETA

cada masa puede ser P(X=x)

CONTINUA CON DENSIDAD

la probabilidad es un área

Nota. Elaboración propia.

6.542. Las dos condiciones fundamentales de una densidad

NO NEGATIVIDAD

f(x)≥0

NORMALIZACIÓN

−∞f(x)dx=1

PARA PROFUNDIZAR · DEMOSTRACIÓN 52 · ●●●●

6.543. ¿Por qué el área total debe ser 1?

X debe tomar algún valor dentro de su espacio de posibilidades.

P(−∞<X<∞)=1.

En una distribución con densidad, la probabilidad de una región se calcula integrando.

−∞ f(x)dx=1.

Es el análogo continuo de Σp(x)=1.

6.544. La probabilidad de un intervalo es un área

P(a≤X≤b)=∫abf(x)dx

probabilidad = área bajo f sobre el intervalo

Figura 6.118
La probabilidad entre a y b es el área bajo la densidad
a b probabilidad

Nota. Elaboración propia.

6.545. ¿Qué significa localmente la altura f(x)?

PROFUNDIZACIÓN · ●●●●

Aunque f(x) no es una probabilidad, sí informa sobre la concentración local de probabilidad.

Para un intervalo muy pequeño de ancho Δx alrededor de x, si f cambia poco dentro de él:

P(x<X≤x+Δx) ≈ f(x)Δx.

Por eso una densidad grande significa más probabilidad por unidad de longitud alrededor de esa región.

6.546. La altura de la curva no es una probabilidad

Si:

f(4)=0,3,

no podemos concluir:

P(X=4)=0,3 ✗

0,3 es una densidad, no una probabilidad puntual.

6.547. Una densidad puede ser mayor que 1

Considere una distribución uniforme sobre:

0≤X≤0,5.

Para obtener área total 1:

0,5 × altura=1.

f(x)=2.

Esto no viola ninguna regla: la restricción 0≤P(A)≤1 se aplica a probabilidades, no a alturas de densidad.

Figura 6.119
Una densidad de altura 2 puede tener área total 1
0,5 × 2 = 1 0 0,5 2

Nota. Elaboración propia.

6.548. ¿Por qué P(X=a)=0?

Un único punto tiene ancho cero.

Como la probabilidad se obtiene mediante área:

P(X=a)=0.
Figura 6.120
Un punto tiene altura, pero no ancho
a ancho = 0 área = 0

Nota. Elaboración propia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 53 · ●●●●

6.549. Demostración mediante integral de que P(X=a)=0

Para una variable con densidad:

P(a≤X≤b)=∫abf(x)dx.

Tomamos b=a:

P(X=a)=∫aaf(x)dx.

Una integral cuyos límites coinciden vale cero.

P(X=a)=0.

6.550. Probabilidad cero no significa imposibilidad lógica

Sea X uniforme entre 0 y 1.

El valor 0,5 pertenece perfectamente al intervalo de valores permitidos.

P(X=0,5)=0.

Una realización del experimento tendrá algún valor concreto, aunque cada valor individual posea probabilidad cero. Probabilidad cero e imposibilidad lógica no son conceptos equivalentes.

6.551. Abrir o cerrar los extremos no cambia la probabilidad

P(a<X<b)

=P(a≤X<b)

=P(a<X≤b)

=P(a≤X≤b).

La razón es que cada extremo individual posee probabilidad cero.

6.552. Función de distribución acumulada

F(x)=P(X≤x).

Si X posee densidad:

F(x)=∫−∞xf(t)dt.

F(x) representa toda la probabilidad acumulada a la izquierda de x.

6.553. Propiedades generales de una función acumulada

NO DECRECE

si x₁<x₂, entonces F(x₁)≤F(x₂).

LÍMITES

F(x)→0 a la izquierda y F(x)→1 a la derecha.

RANGO

0≤F(x)≤1.

CONTINUIDAD

si la distribución posee densidad, F es continua.

Figura 6.121
Una función acumulada crece desde 0 hasta 1
1 x

Nota. Elaboración propia. Una acumulada no tiene que tener esta forma particular; la figura ilustra sus propiedades generales.

6.554. Densidad y acumulada contienen la misma información

DE f A F

integrar

F(x)=∫−∞xf(t)dt

DE F A f

derivar

f(x)=F′(x)

Para una distribución absolutamente continua, la igualdad f(x)=F′(x) es válida en los puntos donde la derivada existe; en formulación más avanzada, se cumple casi en todas partes.

PARA PROFUNDIZAR · DEMOSTRACIÓN 54 · ●●●●

6.555. De la acumulada a la densidad

F(x)=∫−∞xf(t)dt.

Bajo las condiciones del Teorema Fundamental del Cálculo, derivamos con respecto a x:

F′(x)=f(x).

Integración y derivación conectan dos representaciones de la misma distribución.

6.556. Calcular probabilidades mediante F

P(a<X≤b)=F(b)−F(a).

Para una distribución con densidad, podemos utilizar la misma expresión aunque cambiemos los extremos abiertos por cerrados.

Tabla 6.56
Paralelo entre distribuciones discretas y distribuciones con densidad
DISCRETA

Objeto: p(x)=P(X=x)

Total: Σp(x)=1

Punto: puede tener masa positiva

Intervalo: suma de probabilidades

Esperanza: Σx p(x)

CON DENSIDAD

Objeto: f(x)

Total: ∫f(x)dx=1

Punto: P(X=x)=0

Intervalo: integral / área

Esperanza: ∫x f(x)dx

6.557. Distribución uniforme continua sobre [a,b]

Una variable uniforme distribuye la densidad de manera constante sobre el intervalo [a,b].

f(x)=1/(b−a)

para a≤x≤b

Fuera de [a,b]:

f(x)=0.

Figura 6.122
Densidad uniforme continua sobre [a,b]
a b altura = 1/(b−a)

Nota. Elaboración propia.

6.558. Ejemplo · Probabilidad entre 2 y 5

FUNDAMENTAL · ●○○○

Sea X uniforme sobre [0,10].

f(x)=0,1.

P(2≤X≤5)=∫250,1 dx

=(5−2)(0,1)

=0,30=30 %.

6.559. Función acumulada de una uniforme general

F(x)=0, si x<a

F(x)=(x−a)/(b−a), si a≤x≤b

F(x)=1, si x>b.

6.560. Cuantiles, mediana y percentiles

Un cuantil de orden q es un valor xq que deja aproximadamente una proporción q de probabilidad a su izquierda.

F(xq)=q.

En una uniforme sobre [a,b]:

xq=a+q(b−a).

En particular, la mediana corresponde a q=0,5:

mediana=(a+b)/2.

6.561. Esperanza de una variable continua con densidad

E[X]=∫−∞x f(x)dx.

La fórmula se utiliza cuando la esperanza existe.

Para una esperanza finita se exige normalmente: ∫|x|f(x)dx<∞. No todas las distribuciones poseen media finita.

6.562. Esperanza de una función de X

Si Y=g(X):

E[g(X)]=∫−∞g(x)f(x)dx.

Esta regla suele llamarse ley del estadístico inconsciente o, en textos en inglés, LOTUS.

Por ejemplo:

E[X²]=∫x²f(x)dx.

6.563. Media de una uniforme

Para X uniforme sobre [a,b]:

E[X]=(a+b)/2.

Para [0,10]:

E[X]=5.

Figura 6.123
El valor esperado de una uniforme está en el centro del intervalo
0 5 10 E[X]=5

Nota. Elaboración propia.

6.564. Varianza de una variable continua

Sea μ=E[X].

Var(X)=∫−∞(x−μ)²f(x)dx.

Cuando el segundo momento es finito:

Var(X)=E[X²]−E[X]².
PARA PROFUNDIZAR · DEMOSTRACIÓN 55 · ●●●●

6.565. Derivación de Var(X)=E[X²]−E[X]²

Var(X)=E[(X−μ)²].

(X−μ)²=X²−2μX+μ².

Var(X)=E[X²]−2μE[X]+μ².

Como E[X]=μ:

Var(X)=E[X²]−E[X]².

6.566. Varianza de una uniforme

Para X uniforme sobre [a,b]:

Var(X)=(b−a)²/12.

Por tanto:

σ=(b−a)/√12.

Para [0,10]:

Var(X)=100/12=25/3≈8,3333,

σ≈2,8868.

6.567. La densidad tiene unidades

Una probabilidad es adimensional.

En:

f(x)dx,

las unidades de f(x) deben cancelar las unidades de dx.

unidades de f = 1 / unidades de X.
Tabla 6.57
Unidades de una densidad
Tiempo

X en s

f en s⁻¹

Longitud

X en m

f en m⁻¹

Masa

X en kg

f en kg⁻¹

Probabilidad

∫f(x)dx

sin unidad

6.568. Una densidad no tiene que ser constante

Considere:

f(x)=cx,   0≤x≤2,

y f(x)=0 fuera de ese intervalo.

La constante c debe escogerse para que el área total sea 1.

PARA PROFUNDIZAR · DEMOSTRACIÓN 56 · ●●●●

6.569. Normalización de f(x)=cx sobre [0,2]

Exigimos:

02cx dx=1.

c[x²/2]02=1.

2c=1.

c=1/2.

Por tanto:

f(x)=x/2,   0≤x≤2.

Figura 6.124
Una densidad creciente: f(x)=x/2 sobre [0,2]
0 2 1

Nota. Elaboración propia. El área triangular es 1.

6.570. Acumulada y probabilidades de la densidad creciente

Para 0≤x≤2:

F(x)=∫0xt/2 dt=x²/4.

Así:

P(0,5≤X≤1,5)

=F(1,5)−F(0,5)

=0,5625−0,0625=0,50.

6.571. Mediana de una distribución no uniforme

La mediana m satisface:

F(m)=0,5.

Para F(x)=x²/4:

m²/4=0,5.

m=√2≈1,4142.

La mediana no tiene que coincidir con el punto medio geométrico del soporte.

6.572. Función de supervivencia

Muchas aplicaciones preguntan por la probabilidad de superar cierto valor.

S(x)=P(X>x)=1−F(x).

En confiabilidad, medicina, ingeniería y análisis de tiempos de espera, esta función es especialmente importante.

6.573. Del conteo Poisson al tiempo de espera continuo

En la parte anterior vimos que, para un proceso de Poisson de tasa r, el número de eventos hasta el instante t cumple:

N(t) ~ Poisson(rt).

Sea ahora T el tiempo hasta el primer evento.

El evento T>t significa que durante [0,t] no ocurrió ningún evento:

P(T>t)=P(N(t)=0)=e−rt.

Figura 6.125
Dos preguntas sobre el mismo proceso
POISSON

fijamos un intervalo

¿cuántos eventos?

EXPONENCIAL

esperamos al primer evento

¿cuánto tiempo?

Nota. Elaboración propia.

6.574. Distribución exponencial

A partir de:

P(T>t)=e−rt,

obtenemos:

F(t)=1−e−rt,   t≥0,

f(t)=re−rt.

Este es un segundo ejemplo de densidad continua, ahora no constante.

PARA PROFUNDIZAR · DEMOSTRACIÓN 57 · ●●●●

6.575. Tiempo medio de espera exponencial

Para T con densidad:

f(t)=re−rt,   t≥0,

se obtiene:

E[T]=∫0 t r e−rtdt.

Mediante integración por partes:

E[T]=1/r.

Una tasa mayor implica, en promedio, tiempos de espera menores.

6.576. Cambiar de escala modifica la densidad

Sea:

Y=a+bX,   b≠0.

La transformación desplaza y escala los valores. Como las probabilidades deben conservarse, la altura de la densidad también debe ajustarse.

PARA PROFUNDIZAR · DEMOSTRACIÓN 58 · ●●●●

6.577. Densidad bajo una transformación lineal

Para Y=a+bX:

x=(y−a)/b.

La conservación de probabilidad conduce a:

fY(y) = [1/|b|] fX((y−a)/b).

El factor 1/|b| compensa el cambio de escala horizontal para que el área total continúe siendo 1.

6.578. Simulación mediante transformación inversa

La acumulada también permite generar variables aleatorias.

Si:

U ~ Uniforme(0,1)

y F es continua y estrictamente creciente, entonces:

X=F−1(U)

posee la distribución determinada por F.

En formulaciones más generales se utiliza la inversa generalizada o función cuantil.

Figura 6.126
Método de transformación inversa
U ~ Uniforme(0,1)
aplicar F⁻¹
X con acumulada F

Nota. Elaboración propia.

6.579. Histograma y densidad teórica no son lo mismo

HISTOGRAMA

Se construye con datos.

Agrupa observaciones en intervalos.

Cambia de una muestra a otra.

DENSIDAD TEÓRICA

Pertenece al modelo.

Describe probabilidades mediante áreas.

No es producida automáticamente por un histograma.

Figura 6.127
Datos simulados y modelo teórico son objetos distintos
modelo datos

Nota. Elaboración propia. Datos simulados con fines didácticos.

6.580. En un histograma de densidad, la altura depende del ancho

Si una clase contiene una proporción r de observaciones y tiene ancho w:

altura=r/w.

Entonces:

área=w(r/w)=r.

Con anchos de clase diferentes, las alturas por sí solas no representan correctamente las proporciones. Debemos comparar áreas.

Tabla 6.58
Histograma de frecuencias e histograma de densidad
Frecuencia

altura relacionada con conteos.

Útil especialmente con clases de igual ancho.

Densidad

altura=proporción/ancho.

El área representa la proporción.

6.581. Realidad, instrumento, datos y modelo

REALIDAD

fenómeno físico

INSTRUMENTO

resolución y procedimiento

DATOS

valores observados

MODELO

representación probabilística

realidad → medición → datos → modelación

6.582. Continua no significa normal

Una variable continua puede seguir una distribución uniforme, exponencial, triangular, gamma, beta, normal u otros muchos modelos.

Continuidad describe el tipo de valores; normalidad describe una forma probabilística particular. No son conceptos equivalentes.

6.583. Más observaciones no cambian automáticamente la distribución original

Si X tiene cierta distribución, recoger más observaciones de X no transforma por sí solo esa distribución en otra.

Lo que aumenta es nuestra información acerca de ella.

Esta idea debe distinguirse del Teorema Central del Límite, que estudia la distribución de determinadas estadísticas, como promedios o sumas, y no afirma que los datos originales se vuelvan normales.

6.584. Simular una distribución uniforme

En una hoja de cálculo, una función que produzca U uniforme entre 0 y 1 puede transformarse mediante:

X=a+(b−a)U.

Por ejemplo, si la versión en español de Excel utiliza ALEATORIO():

=2+(7-2)*ALEATORIO()

genera valores pseudoaleatorios entre 2 y 7.

6.585. Actividad guiada · Uniforme entre 0 y 20

INTERMEDIO · ●●○○

Sea X uniforme sobre [0,20].

1. Determina f(x).

2. Comprueba que el área total es 1.

3. Calcula P(0≤X≤5).

4. Calcula P(5≤X≤15).

5. Calcula P(X>18).

6. Calcula P(X=10).

7. Construye F(x).

8. Calcula F(7).

9. Determina la mediana.

10. Determina el percentil 75.

11. Calcula E[X].

12. Calcula Var(X).

13. Calcula σ.

Ver solución

1. f(x)=1/20=0,05.

2. 20(0,05)=1.

3. 0,25=25 %.

4. 0,50=50 %.

5. 0,10=10 %.

6. 0.

7. F(x)=0 si x<0; x/20 si 0≤x≤20; 1 si x>20.

8. F(7)=0,35.

9. 10.

10. 15.

11. 10.

12. 100/3≈33,3333.

13. ≈5,7735.

6.586. Reto · ¿Puede ser una densidad?

AVANZADO · ●●●○

Decide si cada propuesta puede ser una densidad.

A. f(x)=0,5 para 0≤x≤2.

B. f(x)=−0,2 para 0≤x≤5.

C. f(x)=2 para 0≤x≤0,5.

D. f(x)=0,2 para 0≤x≤4.

E. f(x)=cx para 0≤x≤3. Determina c.

Ver solución

A. Sí: 2(0,5)=1.

B. No: toma valores negativos.

C. Sí: 0,5(2)=1.

D. No: 4(0,2)=0,8.

E. ∫₀³cx dx=9c/2=1, por lo que c=2/9.

6.587. Reto universitario · Exponencial y transformación

PROFUNDIZACIÓN · ●●●●

Sea T exponencial con tasa r=0,5 por minuto.

1. Escribe f(t) y F(t).
2. Calcula P(T>3).
3. Calcula P(2<T≤5).
4. Determina E[T].
5. Determina la mediana.
6. Si Y=60T convierte minutos en segundos, indica cómo cambia la densidad.

Ver orientación

f(t)=0,5e−0,5t,   F(t)=1−e−0,5t.

P(T>3)=e−1,5.

P(2<T≤5)=F(5)−F(2).

E[T]=2 minutos.

La mediana resuelve 1−e−0,5m=0,5.

Para Y=60T: fY(y) =(1/60)fT(y/60).

6.588. Errores frecuentes

Error 1

Confundir f(x) con P(X=x).

Error 2

Creer que f(x) debe ser ≤1.

Error 3

Interpretar P(X=a)=0 como imposibilidad.

Error 4

Confundir densidad teórica con histograma.

Error 5

Creer que continua significa normal.

Error 6

Creer que muchos datos vuelven normal la variable original.

Error 7

Ignorar las unidades de f(x).

Error 8

Creer que abrir o cerrar extremos cambia la probabilidad.

Error 9

Olvidar verificar que una densidad integre 1.

Error 10

Confundir altura de histograma con proporción cuando las clases tienen anchos distintos.

Tabla 6.59
Fórmulas fundamentales para variables con densidad
Normalización

∫f(x)dx=1

Intervalo

P(a≤X≤b)=∫ₐᵇf(x)dx

Acumulada

F(x)=∫₋∞ˣf(t)dt

Densidad

f(x)=F′(x), donde corresponda

Esperanza

E[X]=∫x f(x)dx

Varianza

Var(X)=E[X²]−E[X]²

Supervivencia

S(x)=1−F(x)

Cuantil

F(xq)=q

6.589. Comprueba lo aprendido

1. ¿Qué diferencia existe entre una variable discreta y una continua?

2. ¿Qué significa que una distribución posea densidad?

3. ¿Qué es el soporte?

4. ¿Por qué la resolución del instrumento no determina por sí sola el modelo?

5. ¿Cuáles son las dos condiciones fundamentales de una densidad?

6. ¿Por qué f(x) no es P(X=x)?

7. ¿Qué interpretación local puede darse a f(x)Δx?

8. ¿Puede f(x)>1?

9. ¿Por qué P(X=a)=0?

10. ¿Por qué probabilidad cero no implica imposibilidad lógica?

11. ¿Por qué los extremos abiertos y cerrados dan la misma probabilidad?

12. ¿Qué representa F(x)?

13. Menciona tres propiedades generales de F.

14. ¿Cómo se obtiene F desde f?

15. ¿Cómo se recupera f desde F cuando es posible?

16. ¿Qué es un cuantil?

17. ¿Cómo se obtiene la mediana desde F?

18. ¿Cómo se calcula E[X]?

19. ¿Qué condición garantiza una esperanza finita?

20. ¿Qué es E[g(X)]?

21. ¿Cómo se calcula Var(X)?

22. ¿Cuáles son E[X] y Var(X) para una uniforme [a,b]?

23. Si X se mide en segundos, ¿qué unidades posee f(x)?

24. ¿Qué es la función de supervivencia?

25. ¿Qué relación existe entre Poisson y exponencial?

26. ¿Qué ocurre con una densidad bajo Y=a+bX?

27. ¿Qué es el método de transformación inversa?

28. ¿Qué diferencia existe entre histograma y densidad teórica?

29. ¿Por qué el área es esencial en un histograma de densidad?

30. ¿Por qué continua no significa normal?

31. ¿Por qué aumentar n no cambia automáticamente la distribución de X?

6.590. Mapa conceptual

Figura 6.128
Anatomía de una distribución con densidad
VARIABLE ALEATORIA CON DENSIDAD
DENSIDAD f(x)

f(x)≥0 · área total=1

INTERVALOS

probabilidad = área

PUNTOS

P(X=a)=0

ACUMULADA

F(x)

CUANTILES

F(xq)=q

E[X]

centro probabilístico

Var(X)

dispersión

S(x)

supervivencia

Nota. Elaboración propia.

6.591. Síntesis

Una distribución absolutamente continua puede describirse mediante una densidad f(x) no negativa cuya integral total vale 1.

−∞f(x)dx=1.

Las probabilidades de intervalos son áreas:

P(a≤X≤b)=∫abf(x)dx.

La densidad no es una probabilidad puntual:

f(a)≠P(X=a),   P(X=a)=0.

La acumulada es:

F(x)=P(X≤x)=∫−∞xf(t)dt.

Cuando corresponde:

f(x)=F′(x).

Los cuantiles satisfacen:

F(xq)=q.

La esperanza y la varianza se calculan mediante:

E[X]=∫x f(x)dx

Var(X)=E[X²]−E[X]².

Para una uniforme [a,b]:

E[X]=(a+b)/2,   Var(X)=(b−a)²/12.

También introdujimos:

S(x)=1−F(x),

transformaciones de variables, simulación mediante F⁻¹ y la conexión:

proceso de Poisson ↔ tiempo exponencial.

Finalmente, distinguimos de manera explícita: fenómeno, instrumento, datos, histograma y modelo probabilístico.

6.592. Puente hacia la distribución normal

Todo lo desarrollado en esta parte será necesario para estudiar la distribución normal.

Cuando encontremos una curva con forma de campana, no interpretaremos su altura como probabilidad.

Seguiremos utilizando exactamente la misma idea:

probabilidad normal = área bajo una densidad normal
Figura 6.129
La idea de área permanece; cambia la forma de la densidad
densidad general densidad normal en ambos casos: probabilidad = área

Nota. Elaboración propia.

Tabla 6.60
Ideas que llevamos a la distribución normal
Densidad

altura ≠ probabilidad

Área

representa probabilidad

F(x)

acumula probabilidad

Media y σ

posición y dispersión

En una distribución con densidad, la probabilidad no reside en la altura de un punto.

Surge del área acumulada sobre una región de valores posibles.

SIGUIENTE
Parte 16 de 18 · Distribución normal y puntuación z
Aplicaremos densidad, área, acumulada, media, desviación estándar y cuantiles a una de las distribuciones continuas más importantes de la probabilidad y la estadística.
La numeración continuará en 6.593.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Feller, W. (1971). An introduction to probability theory and its applications (Vol. 2, 2nd ed.). Wiley.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 16 DE 18
CAPÍTULO 6

Distribución normal y puntuación z

De la campana de Gauss a una escala común de posición y probabilidad

μ · σ · densidad · áreas · integral gaussiana · estandarización · Φ · cuantiles · transformaciones · aproximaciones

Idea central

La distribución normal es una familia de modelos continuos, simétricos y unimodales. Su posición está determinada por la media μ y su dispersión por la desviación estándar σ.

Como toda distribución con densidad, sus probabilidades se representan mediante áreas, no mediante la altura de puntos individuales.

La transformación:

z=(x−μ)/σ

convierte una distancia expresada en las unidades originales en una distancia medida en desviaciones estándar.

Cuando el modelo es normal, esta estandarización permite convertir cualquier N(μ,σ²) en una única distribución:

Z ~ N(0,1).

posición → estandarización → área → probabilidad → interpretación

Al finalizar esta parte podrás:
interpretar μ y σ;
comprender la densidad normal;
explicar cómo μ desplaza la distribución;
explicar cómo σ modifica su dispersión;
interpretar probabilidades como áreas;
comprender de dónde surge √(2π);
demostrar E[X]=μ y Var(X)=σ²;
deducir la regla 68–95–99,7;
calcular e interpretar puntuaciones z;
distinguir z de probabilidad;
utilizar Φ(z);
trabajar con Φ⁻¹ y percentiles;
transformar variables normales;
sumar normales independientes;
comprender la aproximación normal a una binomial;
evitar interpretaciones incorrectas sobre normalidad.

6.593. ¿Por qué estudiar la distribución normal?

La distribución normal ocupa una posición central en probabilidad y estadística, pero no porque todo fenómeno real tenga forma de campana.

Su importancia procede de varias razones diferentes.

MODELACIÓN

algunos fenómenos presentan variación aproximadamente simétrica alrededor de un centro.

COMBINACIÓN

muchos efectos pequeños pueden producir comportamientos aproximadamente normales.

INFERENCIA

sumas y medias aparecen estrechamente relacionadas con la normal mediante resultados límite.

Figura 6.130
Anatomía visual de una distribución normal
μ−3σ μ−2σ μ−σ μ μ+σ μ+2σ μ+3σ centro y máxima densidad las colas continúan indefinidamente

Nota. Elaboración propia.

6.594. La campana es un modelo, no una obligación de los datos

Que una variable sea continua no demuestra que sea normal.

Tampoco lo demuestra:

tener muchos datos;
observar una figura aproximadamente acampanada;
trabajar con mediciones;
calcular media y desviación estándar.

La normalidad es una hipótesis de modelación. Su pertinencia debe justificarse por el mecanismo, el contexto y, cuando corresponda, por el comportamiento de los datos.

6.595. Función de densidad normal

Una variable X sigue una distribución normal con media μ y varianza σ² si su densidad es:

f(x)= 1/[σ√(2π)] · exp{−½[(x−μ)/σ]²}

−∞<x<∞

σ>0.

Escribiremos:

X ~ N(μ,σ²).

6.596. Los parámetros μ y σ

Tabla 6.61
Los parámetros de una distribución normal
μ

Nombre: media.

Efecto: posición horizontal.

Centro de simetría: μ.

Unidades: las mismas de X.

σ

Nombre: desviación estándar.

Efecto: dispersión y anchura.

Varianza: σ².

Condición: σ>0.

6.597. La altura máxima de la densidad

La densidad alcanza su máximo en:

x=μ.

Sustituyendo x=μ:

f(μ)=1/[σ√(2π)].

Esto permite ver directamente que, cuando σ aumenta, la altura máxima disminuye.

Una campana más alta no tiene «más probabilidad». Todas las normales tienen área total 1. Cambiar σ redistribuye esa misma área.

6.598. μ desplaza la distribución

Si σ permanece fija y μ cambia, la curva se desplaza horizontalmente sin cambiar de forma.

Figura 6.131
Cambiar μ desplaza la campana
μ₁ μ₂ μ₃ misma σ · distinta μ

Nota. Elaboración propia.

6.599. σ abre o cierra la campana

Mantengamos μ fija.

Una σ pequeña concentra la densidad cerca de μ. Una σ grande distribuye la misma área sobre una región más amplia.

Figura 6.132
La desviación estándar controla la dispersión
μ común área total = 1 en las tres distribuciones

Nota. Elaboración propia.

6.600. Simetría alrededor de μ

Dos puntos situados a la misma distancia d de μ poseen la misma densidad:

f(μ−d)=f(μ+d).
PARA PROFUNDIZAR · DEMOSTRACIÓN 59 · ●●●●

6.601. ¿Por qué la densidad normal es simétrica?

Consideremos:

x₁=μ−d    y    x₂=μ+d.

El exponente depende de:

[(x−μ)/σ]².

[(μ−d−μ)/σ]²=(−d/σ)²=d²/σ²

[(μ+d−μ)/σ]²=(d/σ)²=d²/σ².

Los exponentes son iguales.

f(μ−d)=f(μ+d).

6.602. La probabilidad sigue siendo un área

P(a≤X≤b)=∫abf(x)dx.

Además:

P(X=a)=0.

Por eso:

P(a<X<b)=P(a≤X≤b).

Figura 6.133
Probabilidad normal como área
a b P(a≤X≤b)

Nota. Elaboración propia.

6.603. La densidad en un punto no es la probabilidad del punto

En la normal estándar:

φ(0)=1/√(2π)≈0,3989.

Esto no significa:

P(Z=0)=0,3989 ✗

Como Z es continua:

P(Z=0)=0.

6.604. ¿Por qué aparece √(2π)?

Para que la densidad normal sea válida, su área total debe ser 1.

El problema matemático central es evaluar:

−∞e−x²/2dx.

Esta integral no se resuelve mediante una antiderivada elemental ordinaria.

Figura 6.134
Ruta matemática hacia √(2π)
1

integral I

2

3

integral doble

4

coordenadas polares

5

jacobiano r

6

I=√(2π)

Nota. Elaboración propia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 60 · ●●●●

6.605. La integral gaussiana mediante coordenadas polares

Definimos:

I=∫−∞ e−x²/2dx.

Como el integrando es positivo, I>0.

Paso 1 · Elevamos al cuadrado

I²= ∬ e−(x²+y²)/2 dxdy.

En un tratamiento universitario, el paso al producto como integral doble queda justificado por la no negatividad del integrando; formalmente puede apoyarse en el teorema de Tonelli.

Paso 2 · Coordenadas polares

x=r cosθ,   y=r senθ.

x²+y²=r².

dxdy=r dr dθ.

Paso 3 · Integramos sobre todo el plano

I²= ∫00 e−r²/2r dr dθ.

Con:

u=r²/2,   du=rdr,

0 e−r²/2rdr=1.

0dθ=2π.

I²=2π.

Como I>0:

I=√(2π).

6.606. De la normal estándar a toda la familia normal

Introducimos:

z=(x−μ)/σ.

Entonces:

x=μ+σz

dx=σdz.

PARA PROFUNDIZAR · DEMOSTRACIÓN 61 · ●●●●

6.607. Normalización de N(μ,σ²)

Partimos de:

∫ [1/(σ√(2π))] exp{−½[(x−μ)/σ]²} dx.

Sustituimos z=(x−μ)/σ y dx=σdz.

∫ [1/√(2π)] e−z²/2dz.

La integral sobre toda la recta vale 1.

−∞ f(x)dx=1.

6.608. ¿Por qué μ es realmente la esperanza?

La notación N(μ,σ²) no es simplemente un convenio gráfico.

Podemos demostrar que:

E[X]=μ.
PARA PROFUNDIZAR · DEMOSTRACIÓN 62 · ●●●●

6.609. Demostración de E[X]=μ

Escribimos:

X=μ+σZ,

donde Z posee la densidad normal estándar, simétrica alrededor de 0.

Por simetría:

E[Z]=0.

Entonces:

E[X]=E[μ+σZ] =μ+σE[Z].

E[X]=μ.

6.610. ¿Por qué σ² es realmente la varianza?

Var(X)=σ².
PARA PROFUNDIZAR · DEMOSTRACIÓN 63 · ●●●●

6.611. Demostración de Var(X)=σ²

Como:

X=μ+σZ,

tenemos:

Var(X)=Var(μ+σZ).

=σ²Var(Z).

Para la normal estándar:

Var(Z)=1.

Var(X)=σ².

6.612. La regla 68–95–99,7

±1σ

≈68,27 %

±2σ

≈95,45 %

±3σ

≈99,73 %

Figura 6.135
Regiones centrales de una distribución normal
−3σ −2σ −σ μ +2σ +3σ 68,27 % 95,45 % 99,73 %

Nota. Elaboración propia.

6.613. La regla 68–95–99,7 no debe memorizarse aislada

Para cualquier k>0:

P(μ−kσ≤X≤μ+kσ)=P(−k≤Z≤k).

Utilizando simetría:

P(−k≤Z≤k)=2Φ(k)−1.

Por ejemplo:

2Φ(1)−1≈0,6827.

2Φ(2)−1≈0,9545.

2Φ(3)−1≈0,9973.

6.614. ¿Cómo se distribuye el área entre las desviaciones estándar?

Tabla 6.62
Área aproximada en una mitad de la distribución
μ a μ+σ

34,13 %

μ+σ a μ+2σ

13,59 %

μ+2σ a μ+3σ

≈2,14 %

más allá de μ+3σ

≈0,135 %

Cada intervalo μ+kσ a μ+(k+1)σ posee el mismo ancho horizontal σ. Lo que cambia es el área bajo la curva, no el ancho del intervalo.

6.615. La puntuación z

¿A cuántas desviaciones estándar se encuentra x de la media?
z=(x−μ)/σ.

z es una posición estandarizada.

No es una probabilidad.

Figura 6.136
z como regla graduada en desviaciones estándar
−3 −2 −1 0 1 2 3 z=0 ↔ x=μ una unidad z = una desviación estándar

Nota. Elaboración propia.

6.616. Signo, magnitud y unidades de z

Tabla 6.63
Cómo interpretar una puntuación z
z=0

x=μ.

z>0

x está por encima de μ.

z<0

x está por debajo de μ.

|z|

distancia estandarizada al centro.

Como x−μ y σ poseen las mismas unidades, estas se cancelan.

z es adimensional.

6.617. Ejemplo · Interpretar una puntuación z

FUNDAMENTAL · ●○○○

Supongamos:

μ=100,   σ=15,   x=130.

z=(130−100)/15

z=2.

El valor 130 está dos desviaciones estándar por encima de la media.

6.618. Comparar escalas diferentes

Consideremos dos pruebas hipotéticas.

PRUEBA A

μ=75

σ=5

x=85

z=2

PRUEBA B

μ=80

σ=10

x=90

z=1

Aunque 90>85, el valor de la Prueba A se encuentra más lejos por encima de la media de su propia escala.

Figura 6.137
Valor bruto y posición relativa no son lo mismo
85 puntos

Prueba A

z=2

90 puntos

Prueba B

z=1

Nota. Elaboración propia con valores hipotéticos.

6.619. Mismo z no significa siempre la misma rareza

Esta es una distinción fundamental.

Supongamos que dos variables poseen:

z=2.

En ambas podemos afirmar:

«el valor se encuentra dos desviaciones estándar por encima de su media».

Pero si las dos distribuciones tienen formas diferentes, eso no implica necesariamente el mismo percentil ni la misma probabilidad de cola.

z es una medida universal de distancia estandarizada, no una medida universal de rareza. En la familia normal, la forma común de todas las distribuciones sí permite convertir z en una probabilidad común mediante Φ.

6.620. Dos fórmulas parecidas que no deben confundirse

MODELO POBLACIONAL

Z=(X−μ)/σ

μ y σ son parámetros del modelo.

DATOS OBSERVADOS

zᵢ=(xᵢ−x̄)/s

x̄ y s se calculan a partir de una muestra.

Ambas expresiones estandarizan, pero conceptualmente utilizan cantidades distintas.

6.621. La distribución normal estándar

μ=0
σ=1
Z ~ N(0,1).

Su densidad es:

φ(z)=[1/√(2π)]e−z²/2.

6.622. Estandarizar cambia la escala, no la posición probabilística

Si:

X ~ N(μ,σ²),

definimos:

Z=(X−μ)/σ.

Figura 6.138
Correspondencia entre la escala X y la escala Z
μ−2σ
−2
μ−σ
−1
μ
0
μ+σ
1
μ+2σ
2

Nota. Elaboración propia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 64 · ●●●●

6.623. Demostración completa de que Z~N(0,1)

Sea:

Z=(X−μ)/σ.

La transformación inversa es:

x=μ+σz,

dx/dz=σ.

La regla de transformación de densidades da:

fZ(z) = fX(μ+σz)·σ.

Sustituyendo la densidad normal:

fZ(z) = [1/√(2π)]e−z²/2.

Esta es exactamente la densidad normal estándar.

Z ~ N(0,1).

Calcular solamente E[Z]=0 y Var(Z)=1 no habría sido suficiente: muchas distribuciones no normales poseen media 0 y varianza 1.

6.624. La función Φ

Φ(z)=P(Z≤z).

Φ(z) = área acumulada a la izquierda de z.

Figura 6.139
Φ(z) acumula el área desde −∞ hasta z
z Φ(z)

Nota. Elaboración propia. Φ siempre acumula hacia la izquierda.

6.625. Izquierda, derecha y entre dos valores

IZQUIERDA

P(Z≤z)=Φ(z)

DERECHA

P(Z>z)=1−Φ(z)

INTERVALO

P(z₁≤Z≤z₂)=Φ(z₂)−Φ(z₁)

Figura 6.140
La región debe identificarse antes del cálculo
← z

Φ(z)

z →

1−Φ(z)

z₁ ↔ z₂

Φ(z₂)−Φ(z₁)

Nota. Elaboración propia.

6.626. Simetría de la normal estándar

Φ(−z)=1−Φ(z)

P(Z>z)=P(Z<−z).

PARA PROFUNDIZAR · DEMOSTRACIÓN 65 · ●●●●

6.627. Demostración de Φ(−z)=1−Φ(z)

La densidad estándar satisface:

φ(−t)=φ(t).

El área a la izquierda de −z coincide con el área a la derecha de z.

P(Z≤−z)=P(Z≥z).

P(Z≥z)=1−P(Z≤z).

Φ(−z)=1−Φ(z).

6.628. El problema inverso: Φ⁻¹

Hasta ahora conocemos z y buscamos un área.

También podemos conocer el área p y preguntar:

¿qué valor z deja una proporción p a su izquierda?

Definimos el cuantil normal:

zp=Φ⁻¹(p).

6.629. Algunos cuantiles importantes

Tabla 6.64
Algunos cuantiles de la normal estándar
p=0,90

z≈1,2816

p=0,95

z≈1,6449

p=0,975

z≈1,9600

p=0,995

z≈2,5758

Estos números no son fronteras mágicas. Cada uno corresponde a un área acumulada específica.

6.630. Ejemplo · Percentil 90

Queremos encontrar el valor que deja 90 % de la distribución a su izquierda.

Φ(z)=0,90.

z≈1,2816.

Para una normal N(μ,σ²):

x=μ+1,2816σ.
Figura 6.141
Del área acumulada al valor de la variable
90 % DE ÁREA A LA IZQUIERDA
z=Φ⁻¹(0,90)≈1,2816
x=μ+1,2816σ

Nota. Elaboración propia.

6.631. ¿|z|>1,96 significa automáticamente «dato atípico»?

No.

En una normal:

P(−1,96≤Z≤1,96)≈0,95.

Eso explica de dónde surge 1,96: aproximadamente el 95 % central del modelo normal queda entre −1,96 y 1,96.

No existe una regla universal que indique «si |z|>1,96, eliminar el dato». La evaluación de una observación depende del contexto, del mecanismo de medición, del modelo y del objetivo del análisis.

6.632. Muy improbable no significa imposible

Considere:

z=6,67.

Bajo el modelo normal estándar, la cola derecha es del orden de:

10−11.

Es extraordinariamente pequeña, pero no exactamente cero.

Figura 6.142
Una observación extrema continúa dentro del soporte normal
0
1
2
3
4
5
6
6,67

Nota. Elaboración propia. La escala está expresada en desviaciones estándar.

6.633. Media, mediana y moda coinciden

media = mediana = moda = μ.

Esto ocurre porque la distribución es simétrica, μ divide el área total en dos mitades y la densidad alcanza allí su máximo.

6.634. Los puntos de inflexión

La curva cambia de curvatura en:

μ−σ    y    μ+σ.

La distancia entre esos dos puntos es:

2σ.

Así, σ también tiene una interpretación geométrica visible en la campana.

Figura 6.143
Los puntos de inflexión se encuentran a una desviación estándar del centro
μ−σ μ μ+σ

Nota. Elaboración propia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 66 · ●●●●

6.635. Localización matemática de los puntos de inflexión

Definimos:

u=(x−μ)/σ.

Al derivar dos veces:

f″(x) ∝ (u²−1)e−u²/2.

El factor exponencial nunca es cero. Por tanto:

u²−1=0

u=±1.

x=μ−σ    y    x=μ+σ.

6.636. Transformaciones lineales de una normal

Sea:

X ~ N(μ,σ²)

y:

Y=a+bX.

Entonces Y también es normal:

Y ~ N(a+bμ,b²σ²).
Figura 6.144
Una transformación lineal conserva la familia normal
X

N(μ,σ²)


Y=a+bX
Y

N(a+bμ,b²σ²)

Nota. Elaboración propia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 67 · ●●●●

6.637. Media y varianza después de una transformación lineal

Y=a+bX.

Para la esperanza:

E[Y]=a+bE[X]=a+bμ.

Para la varianza:

Var(Y)=b²Var(X)=b²σ².

Como una transformación lineal de una normal sigue siendo normal:

Y~N(a+bμ,b²σ²).

6.638. La suma de normales independientes también es normal

Sean:

X ~ N(μ₁,σ₁²)

Y ~ N(μ₂,σ₂²),

independientes.

X+Y ~ N(μ₁+μ₂,σ₁²+σ₂²).

Esta estabilidad bajo sumas es una de las razones de la enorme importancia matemática de la familia normal.

Figura 6.145
Sumar normales independientes produce otra normal
X

normal

+
Y

normal

X+Y

normal

Nota. Elaboración propia. Se supone independencia.

6.639. Función generadora de momentos de una normal

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Para X~N(μ,σ²):

MX(t)=exp(μt+σ²t²/2).

Esta función resume todos los momentos cuando existe en un entorno de 0.

En particular:

M′(0)=E[X]=μ.

Var(X)=σ².

PARA PROFUNDIZAR · DEMOSTRACIÓN 68 · ●●●●

6.640. La función generadora explica la suma de normales

Si X e Y son independientes:

MX+Y(t) = MX(t) MY(t).

= exp(μ₁t+σ₁²t²/2) exp(μ₂t+σ₂²t²/2).

= exp[(μ₁+μ₂)t+(σ₁²+σ₂²)t²/2].

Esta es la función generadora de una normal con:

media μ₁+μ₂
varianza σ₁²+σ₂².

6.641. La normal como aproximación de una binomial

Considere:

X ~ Binomial(n,p).

Su media y varianza son:

μ=np

σ²=np(1−p).

Cuando la distribución binomial no está demasiado concentrada cerca de 0 o n y n es suficientemente grande, una normal puede proporcionar una buena aproximación.

Binomial(n,p) ≈ N[np, np(1−p)].

No existe un único corte universal que determine cuándo la aproximación es «suficientemente buena». Depende de n, p y de la precisión requerida.

6.642. Corrección por continuidad

Una binomial es discreta:

0,1,2,3,…

La normal es continua.

Para aproximar mejor una probabilidad discreta, desplazamos la frontera medio punto.

Por ejemplo:

P(X≤20)

se aproxima mediante

P(Y≤20,5).

Figura 6.146
De una frontera discreta a una frontera continua
BINOMIAL

X≤20

último valor incluido: 20

NORMAL APROXIMANTE

Y≤20,5

frontera continua

Nota. Elaboración propia.

6.643. ¿Por qué aparece tantas veces la distribución normal?

No existe una única explicación.

MECANISMOS

algunos procesos generan variación aproximadamente simétrica.

SUMAS

la suma de variables normales independientes sigue siendo normal.

LÍMITES

muchas sumas y medias se aproximan a una normal bajo condiciones apropiadas.

frecuente ≠ universal

6.644. Datos observados y modelo normal no son lo mismo

Tabla 6.65
Histograma y distribución normal
HISTOGRAMA

Se construye con observaciones.

Depende de la muestra.

Depende de los intervalos.

Es empírico.

NORMAL

Es una función matemática.

Está determinada por μ y σ.

Describe probabilidades del modelo.

No es un histograma suavizado por definición.

Figura 6.147
Datos y modelo son objetos diferentes
DATOS
MODELO

Nota. Elaboración propia. Datos simulados.

6.645. Muchos datos no vuelven normal a la variable original

Supongamos que X sigue una distribución uniforme.

Podemos observar:

100 datos,   10.000 datos   o   1.000.000 de datos.

La distribución generadora sigue siendo uniforme.

Una muestra mayor puede permitirnos observar mejor la distribución de origen; no obliga a esa distribución a convertirse en normal.

6.646. Una aclaración necesaria sobre el Teorema Central del Límite

«Cuando n es grande, todos los datos se vuelven normales». ✗

El Teorema Central del Límite estudia, bajo determinadas condiciones, la distribución de ciertos estadísticos construidos con muchas observaciones, especialmente sumas y medias.

No afirma que la variable original cambie de distribución.

Esta distinción será central en la siguiente parte del capítulo.

6.647. La normal como modelo de fluctuaciones de medición

En algunos experimentos, un modelo normal puede resultar razonable cuando las fluctuaciones aleatorias alrededor de un centro son aproximadamente:

simétricas;
más concentradas cerca del centro;
progresivamente menos frecuentes al alejarnos.

Esto no significa que «todo error de medición sea normal». El modelo depende de las fuentes físicas de variabilidad, del instrumento y del procedimiento experimental.

6.648. Tecnología: primero comprende la región

Tablas, calculadoras y software pueden obtener Φ(z) y Φ⁻¹(p) con gran precisión.

Pero la tecnología no decide cuál es la pregunta probabilística.

Figura 6.148
Ruta recomendada para resolver problemas normales
1 · IDENTIFICA X, μ Y σ
2 · DIBUJA LA REGIÓN
3 · ESTANDARIZA

z=(x−μ)/σ

4 · CALCULA Φ O Φ⁻¹
5 · AJUSTA EL ÁREA
6 · INTERPRETA EN EL CONTEXTO ORIGINAL

Nota. Elaboración propia.

6.649. Actividad guiada · X ~ N(50,4²)

INTERMEDIO · ●●○○

1. Identifica μ.

2. Identifica σ.

3. Identifica la varianza.

4. ¿Dónde está la máxima densidad?

5. Calcula f(50).

6. Aproxima P(46≤X≤54).

7. Aproxima P(42≤X≤58).

8. Calcula z para x=58.

9. Interpreta ese z.

10. Calcula z para x=44.

11. Si z=1,5, encuentra x.

12. Explica por qué P(X=50)=0.

13. ¿Dónde están los puntos de inflexión?

14. Encuentra el percentil 90.

Ver solución

1. μ=50.

2. σ=4.

3. σ²=16.

4. En x=50.

5. f(50)=1/[4√(2π)]≈0,0997.

6. ≈68,27 %.

7. ≈95,45 %.

8. z=2.

9. Dos desviaciones estándar por encima de μ.

10. z=−1,5.

11. x=50+1,5(4)=56.

12. Porque la probabilidad de un punto individual es cero.

13. 46 y 54.

14. x=50+1,2816(4)≈55,1264.

6.650. Reto universitario · Suma y transformación

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Sean X~N(10,4) y Y~N(20,9), independientes.

1. Determina la distribución de X+Y.
2. Determina la distribución de 2X−3.
3. Calcula la media y la varianza de X−Y.
4. Estandariza X+Y.

Ver solución

X+Y~N(30,13).

2X−3~N(17,16).

X−Y~N(−10,13).

Z=[(X+Y)−30]/√13 ~ N(0,1).

6.651. Errores frecuentes

Tabla 6.66
Errores conceptuales frecuentes sobre la distribución normal
Error 1

Creer que toda variable continua es normal.

Error 2

Creer que muchos datos producen normalidad automática.

Error 3

Confundir f(x) con P(X=x).

Error 4

Interpretar z como probabilidad.

Error 5

Creer que mismo z siempre implica igual rareza.

Error 6

Confundir σ con σ².

Error 7

Usar Φ(z) directamente para una cola derecha.

Error 8

Eliminar automáticamente todo |z|>1,96.

Error 9

Creer que las colas terminan en ±3σ.

Error 10

Olvidar la corrección por continuidad al aproximar una variable discreta.

Error 11

Creer que media 0 y varianza 1 implican necesariamente normalidad.

Error 12

Confundir z poblacional con estandarización basada en x̄ y s.

6.652. Comprueba lo aprendido

1. ¿Qué representa μ?

2. ¿Qué representa σ?

3. Escribe la densidad normal.

4. ¿Dónde alcanza su máximo?

5. ¿Cuál es el valor de f(μ)?

6. ¿Qué ocurre al modificar μ?

7. ¿Qué ocurre al aumentar σ?

8. ¿Por qué la normal es simétrica?

9. ¿Por qué P(X=x)=0?

10. ¿Qué función cumple √(2π)?

11. ¿Por qué se eleva la integral gaussiana al cuadrado?

12. ¿Por qué aparece el jacobiano r?

13. ¿Por qué E[X]=μ?

14. ¿Por qué Var(X)=σ²?

15. ¿Qué expresa la regla 68–95–99,7?

16. ¿Cómo se obtiene esa regla mediante Φ?

17. ¿Qué significa z=−2?

18. ¿Por qué z es adimensional?

19. ¿Puede calcularse z para una variable no normal?

20. ¿Por qué mismo z no siempre implica la misma rareza?

21. ¿Qué diferencia hay entre (x−μ)/σ y (x−x̄)/s?

22. ¿Qué es N(0,1)?

23. ¿Qué representa Φ(z)?

24. ¿Cómo calculamos una cola derecha?

25. ¿Cómo calculamos un intervalo?

26. ¿Qué relación existe entre Φ(−z) y Φ(z)?

27. ¿Qué representa Φ⁻¹(p)?

28. ¿Por qué aparece 1,96?

29. ¿Por qué |z|>1,96 no obliga a eliminar un dato?

30. ¿Dónde están los puntos de inflexión?

31. ¿Qué ocurre con Y=a+bX si X es normal?

32. ¿Qué ocurre al sumar normales independientes?

33. Escribe la función generadora de una normal.

34. ¿Cuándo puede una normal aproximar una binomial?

35. ¿Qué es la corrección por continuidad?

36. ¿Por qué una muestra grande no vuelve normal a X?

37. ¿Qué estudia realmente el Teorema Central del Límite?

6.653. Mapa conceptual

Figura 6.149
Arquitectura conceptual de la distribución normal
X ~ N(μ,σ²)
μ

centro · posición

σ

dispersión · escala

PROBABILIDADES = ÁREAS
z=(x−μ)/σ

posición en desviaciones estándar

Z ~ N(0,1)
Φ(z)

z → probabilidad

Φ⁻¹(p)

probabilidad → z

VERIFICA SI EL MODELO NORMAL ES RAZONABLE

Nota. Elaboración propia.

6.654. Síntesis y puente hacia las leyes límite

La distribución normal es una familia continua:

X~N(μ,σ²).

Su densidad es:

f(x)=1/[σ√(2π)]·exp{−½[(x−μ)/σ]²}.

μ determina el centro y:

E[X]=μ.

σ determina la escala de dispersión y:

Var(X)=σ².

La curva es simétrica:

f(μ−d)=f(μ+d).

Las probabilidades son áreas, mientras que un punto individual posee probabilidad cero.

La constante √(2π) surge de la integral gaussiana y permite normalizar la densidad.

La estandarización:

Z=(X−μ)/σ

transforma una normal general en:

Z~N(0,1).

La función:

Φ(z)=P(Z≤z)

transforma una posición z en un área acumulada, mientras:

zp=Φ⁻¹(p)

resuelve el problema inverso.

La regla:

68,27 % · 95,45 % · 99,73 %

no es una regla universal de los datos; es una propiedad de la distribución normal.

Además:

Y=a+bX → normal,

X+Y → normal si X e Y son normales independientes.

Estas propiedades ayudan a explicar por qué la normal aparece repetidamente en probabilidad y estadística.

Pero queda una pregunta aún más profunda:

¿por qué sumas, promedios y frecuencias parecen estabilizarse cuando repetimos muchas veces un experimento?

Esa pregunta nos llevará a la Ley de los Grandes Números, la simulación Monte Carlo y posteriormente a comprender con mayor profundidad el papel del Teorema Central del Límite.

La puntuación z no convierte cualquier distribución en normal.

Expresa posiciones relativas en una escala común de desviaciones estándar. Cuando el modelo es normal, Φ convierte además esa posición en una escala probabilística común.

SIGUIENTE
Parte 17 de 18 · Ley de los Grandes Números y simulación Monte Carlo
Estudiaremos por qué frecuencias relativas y promedios pueden estabilizarse al aumentar el número de repeticiones y cómo esa regularidad permite aproximar probabilidades mediante simulación.
La numeración continuará en 6.655.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Casella, G., & Berger, R. L. (2002). Statistical inference (2nd ed.). Duxbury.

Feller, W. (1971). An introduction to probability theory and its applications (Vol. 2, 2nd ed.). Wiley.

Gauss, C. F. (1809). Theoria motus corporum coelestium in sectionibus conicis solem ambientium. Friedrich Perthes & I. H. Besser.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 17 DE 18
CAPÍTULO 6

Ley de los Grandes Números y simulación Monte Carlo

¿Cómo emerge regularidad a partir de muchos resultados aleatorios?

frecuencia relativa · promedios · convergencia · error estándar · simulación · pseudoaleatoriedad · Monte Carlo

Idea central

Un resultado individual puede ser impredecible. Sin embargo, cuando repetimos muchas veces un experimento bajo condiciones apropiadas, determinados promedios y frecuencias relativas presentan una regularidad cada vez más visible.

La Ley de los Grandes Números explica hacia qué cantidad tienden esos promedios. La simulación Monte Carlo utiliza precisamente esa regularidad para aproximar probabilidades, esperanzas e integrales mediante experimentos virtuales repetidos.

modelo → simulación → datos virtuales → estimador → incertidumbre → interpretación

Al finalizar esta parte podrás:
distinguir probabilidad y frecuencia relativa;
interpretar la Ley de los Grandes Números;
comprender convergencia en probabilidad;
reconocer la convergencia casi segura;
demostrar la Ley Débil mediante Chebyshev;
generalizar la ley a promedios;
interpretar el comportamiento 1/√n;
diferenciar LGN y TCL;
construir estimadores Monte Carlo;
calcular su error estándar;
estimar π mediante simulación;
estimar valores esperados e integrales;
comprender la pseudoaleatoriedad;
utilizar semillas reproducibles;
distinguir diferentes fuentes de error;
conocer estrategias de reducción de varianza.

6.655. Un experimento sencillo que esconde una idea profunda

Lancemos una moneda equilibrada.

El modelo establece:

P(cara)=0,5.

Esto no significa que cada grupo de diez lanzamientos tenga que contener exactamente cinco caras.

Una realización concreta podría ser:

C · C · S · C · C · C · S · S · C · S

Aparecen:

6 caras de 10 lanzamientos.

La frecuencia relativa observada es:

h10=6/10

h10=0,60.

El modelo dice 0,50. Los datos de esta realización dicen 0,60.

No existe contradicción.

6.656. La frecuencia relativa acumulada

Sea:

Sn = número de éxitos obtenidos en los primeros n ensayos.

Definimos:

hn=Sn/n.

hn cambia a medida que aparecen nuevos resultados.

Figura 6.150
Trayectoria ilustrativa de una frecuencia relativa alrededor de p=0,50
1,0 0,75 0,50 0,25 0 número acumulado de ensayos n → p=0,50

Nota. Elaboración propia. Trayectoria simulada con fines didácticos.

6.657. Converger no significa acercarse en cada paso

«Cada nuevo lanzamiento debe acercar hn a 0,50». ✗

Una frecuencia relativa puede:

acercarse;
alejarse temporalmente;
cruzar muchas veces p;
continuar fluctuando.

La convergencia es una propiedad del comportamiento de largo plazo, no una obligación sobre cada nuevo ensayo.

6.658. ¿Cuánto puede cambiar hₙ con un nuevo ensayo?

Si Xn+1 vale 1 cuando ocurre un éxito y 0 cuando ocurre un fracaso:

hn+1 = [nhn+Xn+1]/(n+1).

Restando hn:

hn+1−hn = [Xn+1−hn]/(n+1).

PARA PROFUNDIZAR · DEMOSTRACIÓN 69 · ●●●○

6.659. El efecto máximo de un nuevo resultado

Como:

0≤Xn+1≤1

y:

0≤hn≤1,

entonces:

|Xn+1−hn|≤1.

Por tanto:

|hn+1−hn| ≤1/(n+1).

Los saltos individuales se hacen pequeños al aumentar n. Sin embargo, esto por sí solo no demuestra que hn converja hacia p. Para establecer el límite necesitamos la estructura probabilística de los ensayos.

6.660. Ley de los Grandes Números: versión intuitiva

Si repetimos muchas veces un experimento en condiciones apropiadas, la frecuencia relativa de un evento tiende a estabilizarse alrededor de su probabilidad.

hn → p   cuando   n → ∞.

n→∞ es un límite matemático.

Ningún experimento físico necesita ejecutar literalmente infinitos ensayos. La afirmación describe qué ocurre al considerar tamaños de muestra cada vez mayores.

6.661. Variables indicadoras: convertir un evento en un promedio

Para el ensayo i definimos:

Xi=1   si ocurre A

Xi=0   si no ocurre A.

Si:

P(A)=p,

entonces:

E[Xi]=p

Var(Xi)=p(1−p).

Además:

hn = (X₁+X₂+···+Xn)/n.

Una frecuencia relativa es un promedio de ceros y unos.

PARA PROFUNDIZAR · DEMOSTRACIÓN 70 · ●●●●

6.662. Ley Débil de los Grandes Números para Bernoulli

Supongamos que X₁,X₂,…,Xn son variables Bernoulli independientes con la misma probabilidad p.

hn = (X₁+···+Xn)/n.

Paso 1 · Esperanza

E[hn] = [np]/n = p.

Paso 2 · Varianza

Por independencia:

Var(X₁+···+Xn) = np(1−p).

Var(hn) = p(1−p)/n.

Paso 3 · Chebyshev

Para cualquier ε>0:

P(|hn−p|≥ε) ≤ p(1−p)/(nε²).

Paso 4 · Hacemos crecer n

p(1−p)/(nε²) → 0.

P(|hn−p|≥ε) → 0.

Equivalentemente:

P(|hn−p|<ε) → 1.

6.663. ¿Qué significa converger en probabilidad?

Elegimos cualquier tolerancia:

ε>0.

Decimos que Yn converge en probabilidad hacia Y si:

P(|Yn−Y|≥ε) → 0.

En la moneda:

P(|hn−0,50|≥ε) → 0.

Figura 6.151
Banda de tolerancia alrededor de p
p+ε p p−ε n aumenta →

Nota. Elaboración propia. Trayectoria ilustrativa.

6.664. La Ley Débil no es solamente una ley para monedas

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Sean X₁,X₂,… variables independientes e idénticamente distribuidas, con:

E[Xi]=μ

Var(Xi)=σ²<∞.

Definimos el promedio:

n = (X₁+···+Xn)/n.

La Ley Débil establece:

n → μ   en probabilidad.

PARA PROFUNDIZAR · DEMOSTRACIÓN 71 · ●●●●

6.665. Ley Débil general mediante Chebyshev

Para:

n = (X₁+···+Xn)/n,

tenemos:

E[X̄n]=μ.

Por independencia:

Var(X̄n) = σ²/n.

Chebyshev da:

P(|X̄n−μ|≥ε) ≤ σ²/(nε²).

Cuando n→∞:

P(|X̄n−μ|≥ε) → 0.

6.666. Ley Fuerte de los Grandes Números

Existe una forma aún más intensa de convergencia.

Bajo condiciones apropiadas, X̄n converge hacia μ casi seguramente.

Una formulación clásica para variables i.i.d. establece que, si:

E[|X₁|]<∞,

entonces:

n → μ   casi seguramente.

«Casi seguramente» no significa necesidad lógica.

Significa que el conjunto de trayectorias para las cuales la convergencia falla tiene probabilidad cero dentro del modelo.

6.667. Diferentes formas de convergencia

Tabla 6.67
Tres formas de convergencia relevantes
EN PROBABILIDAD

La probabilidad de una desviación mayor que ε tiende a cero.

P(|X̄ₙ−μ|≥ε)→0

CASI SEGURA

Para casi toda trayectoria infinita, el promedio termina convergiendo a μ.

X̄ₙ→μ c.s.

MEDIA CUADRÁTICA

El error cuadrático esperado tiende a cero.

E[(X̄ₙ−μ)²]→0

Cuando Var(X)<∞:

E[(X̄n−μ)²]=σ²/n → 0.

6.668. Lo que la Ley de los Grandes Números NO dice

No dice:

que hn sea exactamente igual a p a partir de cierto n.

No dice:

que cada nuevo ensayo acerque la frecuencia a p.

No dice:

que el próximo resultado compense los anteriores.

No dice:

que cualquier dependencia entre observaciones sea irrelevante.

6.669. Error absoluto y error relativo pueden comportarse de manera distinta

La Ley de los Grandes Números afirma que:

Sn/n → p.

No afirma:

Sn−np → 0. ✗

Por ejemplo, una diferencia absoluta de 50 éxitos respecto de np puede parecer grande.

Pero si:

n=10.000,

la diferencia relativa es:

50/10.000=0,005.

La regularidad de largo plazo se refiere principalmente a proporciones y promedios, no a una obligación de compensar diferencias absolutas.

6.670. La dispersión de un promedio disminuye como 1/√n

Para Bernoulli:

Var(hn)=p(1−p)/n.

Por tanto:

σh = √[p(1−p)]/√n.

Para p fija, la dependencia con 1/√n es exacta.

Tabla 6.68
Desviación estándar de hₙ para una moneda equilibrada
n=10

≈0,1581

n=100

0,0500

n=1.000

≈0,0158

n=10.000

0,0050

n=1.000.000

0,0005

Figura 6.152
Reducir el error típico exige muchas más repeticiones
n
error base
4n
≈1/2
16n
≈1/4
64n
≈1/8

Para reducir a la mitad la escala típica del error, necesitamos aproximadamente cuatro veces más observaciones.

Nota. Elaboración propia.

PARA PROFUNDIZAR · DEMOSTRACIÓN 72 · ●●●●

6.671. ¿Por qué σ=σ/√n?

Sean X₁,…,Xn independientes, con:

Var(Xi)=σ².

X̄=(X₁+···+Xn)/n.

Entonces:

Var(X̄) = (1/n²)Var(X₁+···+Xn).

Var(X̄) = (1/n²)(nσ²) = σ²/n.

Tomando raíz cuadrada:

σ=σ/√n.

6.672. Ley de los Grandes Números y Teorema Central del Límite no dicen lo mismo

LEY DE LOS GRANDES NÚMEROS

Responde:

¿hacia dónde va el promedio?

n→μ.

TEOREMA CENTRAL DEL LÍMITE

Responde:

¿cómo fluctúa el promedio alrededor de μ?

después de estandarizar, aparece aproximadamente una normal.

Bajo condiciones habituales:

(X̄n−μ)/(σ/√n) ≈ N(0,1)   para n grande.
Figura 6.153
Dos preguntas distintas sobre el promedio muestral
n
LGN

localiza el límite μ

TCL

describe fluctuaciones a escala 1/√n

Nota. Elaboración propia.

6.673. Probabilidad teórica y frecuencia observada siguen siendo objetos distintos

PROBABILIDAD p

Pertenece al modelo probabilístico.

Para una moneda equilibrada: p=0,5.

FRECUENCIA hn

Se obtiene de una realización experimental.

Puede ser 0,47; 0,51; 0,5037…

La Ley de los Grandes Números establece una relación entre ambas, pero no las convierte en idénticas para una muestra finita.

SIMULACIÓN MONTE CARLO
Convertir un problema matemático en un experimento virtual repetido

6.674. ¿Qué es una simulación Monte Carlo?

Una simulación Monte Carlo utiliza números aleatorios o pseudoaleatorios para reproducir muchas veces un experimento o un modelo matemático.

Después utilizamos:

frecuencias · promedios · proporciones · indicadores · funciones de los resultados

para estimar una cantidad de interés.

Monte Carlo reemplaza parte del cálculo analítico por un gran experimento probabilístico virtual.
Figura 6.154
Estructura general de una simulación Monte Carlo
1 · DEFINIR EL MODELO
2 · GENERAR VARIABLES ALEATORIAS
3 · EJECUTAR EL EXPERIMENTO VIRTUAL
4 · REPETIR N VECES

100 · 1.000 · 100.000 · …

5 · CALCULAR EL ESTIMADOR
6 · CUANTIFICAR SU INCERTIDUMBRE
7 · INTERPRETAR

Nota. Elaboración propia.

6.675. El estimador Monte Carlo general

Supongamos que queremos calcular:

θ=E[Y].

Simulamos valores independientes:

Y₁,Y₂,…,YN.

Definimos:

θ̂N = (Y₁+···+YN)/N.

Por la Ley de los Grandes Números:

θ̂N → θ.

6.676. Esperanza, varianza y error estándar del estimador

Si:

E[Y]=θ   y   Var(Y)=σ²<∞,

entonces:

ESPERANZA

E[θ̂N]=θ

VARIANZA

Var(θ̂N)=σ²/N

ERROR ESTÁNDAR

SE=σ/√N

Tabla 6.69
Arquitectura de una estimación Monte Carlo
θ

cantidad teórica de interés

θ̂

estimación obtenida

σ²/N

varianza del estimador

σ/√N

escala típica de fluctuación

6.677. Estimar el error estándar a partir de la simulación

Normalmente σ es desconocida.

Calculamos la desviación estándar muestral s de los valores simulados Y₁,…,YN.

Entonces:

SE estimado = s/√N.

Utilizando la aproximación normal del Teorema Central del Límite, un intervalo Monte Carlo aproximado del 95 % es:

θ̂N ± 1,96·s/√N.

Este intervalo cuantifica incertidumbre debida a la simulación finita. No corrige automáticamente errores del modelo.

6.678. ¿Cuántas simulaciones hacen falta?

Como:

SE ∝1/√N,

para dividir el error estándar por un factor k necesitamos aproximadamente multiplicar N por:

k².

Por ejemplo:

error /2

≈4 veces N

error /5

≈25 veces N

error /10

≈100 veces N

6.679. Una cota más potente para frecuencias Bernoulli

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

Chebyshev es muy general, pero para variables Bernoulli existen cotas más fuertes.

Una de ellas es la desigualdad de Hoeffding:

P(|hn−p|≥ε) ≤ 2e−2nε².

Esta desigualdad permite convertir una tolerancia deseada en un número mínimo de observaciones.

PARA PROFUNDIZAR · DEMOSTRACIÓN 73 · ●●●●

6.680. De Hoeffding a un tamaño de simulación

Queremos garantizar:

P(|hn−p|≥ε)≤δ.

Basta imponer:

2e−2nε²≤δ.

Tomando logaritmos y despejando n:

n ≥ ln(2/δ)/(2ε²).

Esta cota no dice que sea necesario exactamente ese número; establece una garantía suficiente bajo las hipótesis del resultado.

6.681. Ejemplo 1 · Una moneda virtual

FUNDAMENTAL · ●○○○

Generamos:

U ~ Uniforme(0,1).

Definimos:

0≤U<0,5 → cara

0,5≤U<1 → sello

Supongamos que una simulación hipotética de 10.000 ensayos produce:

5.037 caras.

Entonces:

p̂=5.037/10.000

p̂=0,5037.

Nota. Resultado hipotético utilizado con fines didácticos.

6.682. Simular una moneda en una hoja de cálculo

Una hoja de cálculo puede generar números uniformes mediante:

=ALEATORIO()

Podemos transformar el resultado en 1 para cara y 0 para sello:

=SI(ALEATORIO()<0,5;1;0)

El promedio de los ceros y unos es la frecuencia relativa de caras.

Las hojas de cálculo suelen recalcular sus números aleatorios. Para investigaciones donde la reproducibilidad exacta sea importante, conviene utilizar software que permita controlar explícitamente la semilla.

6.683. Ejemplo 2 · Estimar π mediante puntos aleatorios

Generamos puntos:

(U,V)

uniformemente en el cuadrado:

0≤U≤1,   0≤V≤1.

El punto pertenece al cuarto de círculo de radio 1 cuando:

U²+V²≤1.

Figura 6.155
Geometría de la estimación Monte Carlo de π
U V 0 1 1 cuadrado unidad: área = 1
dentro fuera

Nota. Elaboración propia. Los puntos son ilustrativos.

6.684. ¿De dónde sale la fórmula para π?

El área del cuadrado es:

1.

El área del cuarto de círculo es:

π/4.

Por uniformidad:

P(dentro) = (π/4)/1

P(dentro)=π/4.

Si M de N puntos quedan dentro:

M/N ≈ π/4.

Por tanto:

π̂=4M/N.

PARA PROFUNDIZAR · DEMOSTRACIÓN 74 · ●●●●

6.685. π, Ley de los Grandes Números e incertidumbre

Definimos:

Ii=1   si   Ui²+Vi²≤1,

Ii=0   en caso contrario.

Entonces:

P(Ii=1)=π/4.

M/N = (I₁+···+IN)/N.

Por la Ley de los Grandes Números:

M/N → π/4.

4M/N → π.

Además:

Var(π̂) = 16(π/4)(1−π/4)/N.

Esto demuestra que la aproximación converge, pero también que la precisión mejora lentamente, a escala 1/√N.

6.686. Ejemplo 3 · Dos dados

Queremos estimar:

P(suma de dos dados ≥10).

En cada simulación:

  1. generamos el primer dado;
  2. generamos el segundo;
  3. sumamos;
  4. registramos 1 si la suma es 10, 11 o 12;
  5. registramos 0 en caso contrario.

Después:

P̂ = número de éxitos/N.

En este caso también conocemos el valor exacto:

P=(3+2+1)/36 = 6/36 = 1/6 ≈0,1667.

Esto permite verificar el comportamiento de la simulación.

6.687. Monte Carlo puede estimar valores esperados

Queremos calcular:

E[g(X)].

Simulamos:

X₁,…,XN.

Y calculamos:

E[g(X)] ≈ [g(X₁)+···+g(XN)]/N.

promedio simulado → esperanza del modelo.

6.688. Monte Carlo como método de integración

Sea:

U ~ Uniforme(a,b).

Entonces:

f(u)=1/(b−a).

Por definición de esperanza:

E[g(U)] = [1/(b−a)] ∫abg(u)du.

Despejando:

abg(u)du = (b−a)E[g(U)].

Sustituyendo la esperanza por un promedio simulado:

abg(u)du ≈ [(b−a)/N] Σg(Ui).
PARA PROFUNDIZAR · DEMOSTRACIÓN 75 · ●●●●

6.689. ¿Por qué funciona la integración Monte Carlo?

Simulamos independientemente:

U₁,…,UN ~ Uniforme(a,b).

La Ley de los Grandes Números establece:

[g(U₁)+···+g(UN)]/N → E[g(U)].

Pero:

(b−a)E[g(U)] = ∫abg(u)du.

Por tanto:

[(b−a)/N]Σg(Ui) → ∫abg(u)du.

6.690. ¿Por qué Monte Carlo resulta especialmente valioso?

Para problemas sencillos, una fórmula exacta suele ser preferible.

Monte Carlo se vuelve especialmente útil cuando:

el espacio tiene muchas dimensiones;
la integral es difícil;
el sistema tiene muchas fuentes de incertidumbre;
existe un simulador del sistema;

La tasa básica 1/√N no contiene explícitamente la dimensión del problema. Esta característica explica parte de su utilidad en problemas de alta dimensión.

Esto no significa que Monte Carlo sea siempre eficiente. Una varianza muy grande o eventos extremadamente raros pueden requerir técnicas especializadas.

6.691. Más simulaciones no garantizan una respuesta correcta

Aumentar N reduce el ruido aleatorio de simulación.

Pero un modelo incorrecto puede producir una estimación extremadamente estable del valor equivocado.

Figura 6.156
Precisión computacional no sustituye validez del modelo
MODELO ADECUADO

más simulaciones

menor error Monte Carlo

estimación más precisa

MODELO INADECUADO

más simulaciones

resultado más estable

alrededor del valor incorrecto

Nota. Elaboración propia.

6.692. No todos los errores son el mismo error

Tabla 6.70
Fuentes distintas de error en simulación
ERROR MONTE CARLO

Fluctuación debida a utilizar N finito.

SESGO DEL ESTIMADOR

Bias(θ̂)=E[θ̂]−θ.

ERROR DE MODELACIÓN

El modelo no representa adecuadamente el fenómeno.

ERROR NUMÉRICO

Redondeo, discretización o aproximaciones computacionales.

ERROR DE IMPLEMENTACIÓN

Algoritmo o código incorrectos.

GENERADOR INADECUADO

La secuencia pseudoaleatoria introduce patrones problemáticos.

6.693. Números aleatorios y pseudoaleatorios

Una computadora convencional utiliza habitualmente números pseudoaleatorios.

Son producidos por un algoritmo determinista, pero están diseñados para imitar propiedades estadísticas útiles de secuencias aleatorias.

Determinista no significa inútil. La pseudoaleatoriedad es una herramienta fundamental de la simulación científica moderna.

6.694. La semilla y la reproducibilidad

Muchos generadores comienzan a partir de un valor llamado:

semilla.

Si utilizamos:

misma semilla + mismo algoritmo + implementación compatible,

podemos reproducir la misma secuencia pseudoaleatoria.

Figura 6.157
La semilla facilita reproducir una simulación
SEMILLA = 2026
0,183 · 0,724 · 0,411 · 0,956 · 0,302 · …
EJECUCIÓN A

misma secuencia

EJECUCIÓN B

misma secuencia

Nota. Elaboración propia. Los valores son ilustrativos.

6.695. ¿Qué esperamos de un buen generador pseudoaleatorio?

PERIODO LARGO

la secuencia no debe repetirse demasiado pronto.

BUENA UNIFORMIDAD

los valores deben cubrir adecuadamente el espacio previsto.

DEPENDENCIA CONTROLADA

deben evitarse patrones indeseados relevantes.

6.696. Aumentar N no es la única estrategia

Podemos mejorar una simulación no solamente repitiendo más, sino construyendo un estimador de menor varianza.

Tabla 6.71
Algunas técnicas de reducción de varianza
MUESTREO ESTRATIFICADO

Divide el espacio en regiones y controla cuántas simulaciones se realizan en cada una.

VARIABLES ANTITÉTICAS

Combina simulaciones negativamente relacionadas para estabilizar el promedio.

VARIABLES DE CONTROL

Utiliza una cantidad relacionada cuyo valor esperado conocemos.

MUESTREO DE IMPORTANCIA

Genera con mayor frecuencia observaciones relevantes para el cálculo.

mejor diseño del estimador → menor varianza → mayor eficiencia

6.697. Los eventos raros pueden ser difíciles para Monte Carlo ingenuo

Supongamos que:

P(A)=0,000001.

En un millón de simulaciones, el número esperado de ocurrencias es apenas:

1.

Podríamos incluso observar cero.

Para eventos extremadamente raros, simplemente aumentar N puede ser muy costoso. Técnicas como el muestreo de importancia pueden resultar mucho más eficientes.

6.698. Falacia del jugador: la ley no compensa el pasado

Supongamos que una moneda equilibrada produce:

C · C · C · C · C · C

Sería incorrecto afirmar:

«Ahora tiene que salir sello para compensar». ✗

Si los lanzamientos son independientes:

P(sello en el siguiente lanzamiento)=0,5.

La Ley de los Grandes Números describe proporciones de largo plazo. No crea una fuerza que recuerde y corrija los resultados pasados.

6.699. Actividad manual · 100 lanzamientos

  1. Lanza una moneda 100 veces.
  2. Registra 1 para cara y 0 para sello.
  3. Calcula hn para n=1,5,10,20,50 y 100.
  4. Construye una gráfica de hn contra n.
  5. Dibuja una línea horizontal en p=0,5.
  6. Describe las oscilaciones.
  7. Compara tu gráfica con la de otro grupo.
  8. ¿Son iguales las trayectorias?
  9. ¿Alguna trayectoria se acerca siempre de forma monotónica?
  10. Explica qué observas usando la Ley de los Grandes Números.

6.700. Actividad digital · 10, 100, 1.000 y 10.000 ensayos

Simula una moneda equilibrada y completa:

N
caras
h
|h−0,5|

Realiza la comparación para:

10 · 100 · 1.000 · 10.000.

Repite el experimento completo tres veces.

No esperes que la ejecución con mayor N sea obligatoriamente la mejor en cada comparación individual.

6.701. Actividad Monte Carlo · Estima π

  1. Genera U y V uniformes entre 0 y 1.
  2. Calcula D=U²+V².
  3. Registra 1 si D≤1 y 0 en caso contrario.
  4. Realiza 100 simulaciones.
  5. Calcula M/N.
  6. Calcula π̂=4M/N.
  7. Repite con 1.000 puntos.
  8. Repite con 10.000 puntos.
  9. Compara con π≈3,14159.
  10. Calcula el error absoluto |π̂−π|.
  11. ¿10.000 puntos garantizan una mejor estimación que 1.000 en toda ejecución?
  12. Explica tu respuesta.

6.702. Reto · Resultado exacto frente a resultado simulado

Se lanzan dos dados equilibrados.

Estudia:

  1. P(suma=7).
  2. P(suma≥10).
  3. P(al menos un 6).
  4. P(los dos dados muestran el mismo número).

Para cada evento:

  1. calcula la probabilidad exacta;
  2. simula 100 repeticiones;
  3. simula 1.000;
  4. simula 10.000;
  5. calcula el error respecto del valor exacto;
  6. compara las ejecuciones;
  7. explica por qué no producen exactamente el mismo resultado.

6.703. Errores frecuentes

Error 1

Confundir frecuencia observada con probabilidad del modelo.

Error 2

Interpretar n→∞ como un experimento físicamente infinito.

Error 3

Esperar convergencia monotónica.

Error 4

Usar la LGN para predecir el siguiente resultado.

Error 5

Creer que Monte Carlo entrega siempre el valor exacto.

Error 6

Creer que duplicar N reduce el error a la mitad.

Error 7

Creer que muchas simulaciones corrigen un modelo equivocado.

Error 8

Creer que pseudoaleatorio significa inútil o defectuoso.

Error 9

Confundir LGN con TCL.

Error 10

Ignorar el error estándar de una estimación Monte Carlo.

Error 11

Llamar «sesgo» a cualquier tipo de error.

Error 12

Pensar que aumentar N es la única manera de mejorar Monte Carlo.

6.704. Mapa conceptual

Figura 6.158
De la repetición aleatoria a la estimación Monte Carlo
EXPERIMENTO ALEATORIO
repetir N veces
FRECUENCIA

SN/N

PROMEDIO

ΣYi/N

LEY DE LOS GRANDES NÚMEROS

promedio → esperanza

TEOREMA CENTRAL DEL LÍMITE

fluctuaciones ≈ normales · escala 1/√N

MONTE CARLO

estimador + error estándar + interpretación

Nota. Elaboración propia.

6.705. Comprueba lo aprendido

  1. ¿Qué es una frecuencia relativa?
  2. ¿Por qué puede diferir de p en una muestra finita?
  3. ¿Qué significa hn→p?
  4. ¿Por qué la convergencia no tiene que ser monotónica?
  5. ¿Cuánto puede cambiar como máximo hn al agregar un nuevo ensayo?
  6. ¿Qué es una variable indicadora?
  7. ¿Por qué una frecuencia puede escribirse como un promedio?
  8. ¿Cuánto vale E[hn] para Bernoulli?
  9. ¿Cuánto vale Var(hn)?
  10. ¿Qué papel cumple Chebyshev en la Ley Débil?
  11. ¿Qué significa convergencia en probabilidad?
  12. ¿Qué significa convergencia casi segura?
  13. ¿Qué es convergencia en media cuadrática?
  14. ¿Cuál es una condición clásica para la Ley Fuerte i.i.d.?
  15. ¿Por qué Sn/n→p no implica Sn−np→0?
  16. ¿Cómo cambia la desviación estándar de un promedio con n?
  17. ¿Por qué dividir el error entre dos exige aproximadamente cuadruplicar N?
  18. ¿Qué diferencia conceptual existe entre LGN y TCL?
  19. ¿Qué es una simulación Monte Carlo?
  20. ¿Qué es un estimador Monte Carlo?
  21. ¿Por qué E[θ̂]=θ en el promedio simple?
  22. ¿Cuál es Var(θ̂)?
  23. ¿Qué es el error estándar Monte Carlo?
  24. ¿Cómo se estima cuando σ es desconocida?
  25. ¿Qué expresa un intervalo θ̂±1,96·SE?
  26. ¿Qué garantiza la desigualdad de Hoeffding?
  27. ¿Por qué π puede estimarse con puntos aleatorios?
  28. ¿Cómo se obtiene π̂=4M/N?
  29. ¿Por qué Monte Carlo puede estimar una esperanza?
  30. ¿Cómo puede estimar una integral?
  31. ¿Por qué Monte Carlo es útil en alta dimensión?
  32. ¿Por qué más simulaciones no corrigen un modelo equivocado?
  33. ¿Qué diferencia hay entre error Monte Carlo y sesgo?
  34. ¿Qué son números pseudoaleatorios?
  35. ¿Qué es una semilla?
  36. ¿Qué condiciones permiten reproducir una secuencia?
  37. ¿Qué características esperamos de un buen generador?
  38. ¿Qué significa reducción de varianza?
  39. Nombra dos técnicas de reducción de varianza.
  40. ¿Por qué los eventos extremadamente raros pueden ser difíciles de simular?
  41. ¿Por qué la Ley de los Grandes Números no justifica la falacia del jugador?

6.706. Síntesis y puente hacia la integración final

Una realización individual puede ser impredecible.

Pero una frecuencia relativa puede escribirse como:

hn = (X₁+···+Xn)/n.

Para Bernoulli:

E[hn]=p

Var(hn)=p(1−p)/n.

Por la Ley Débil:

hn→p   en probabilidad.

Y, bajo condiciones adecuadas, promedios más generales satisfacen:

n→μ.

La Ley de los Grandes Números nos dice hacia dónde se dirige el promedio.

El Teorema Central del Límite ayuda a describir cómo fluctúa alrededor de ese límite, normalmente a una escala:

1/√N.

Monte Carlo aprovecha esta estructura.

Si:

θ=E[Y],

podemos estimar:

θ̂N = ΣYi/N.

Y cuantificar la incertidumbre mediante:

SE≈s/√N.

Monte Carlo puede estimar probabilidades, valores esperados e integrales, pero la precisión computacional no sustituye la validez conceptual del modelo.

También aprendimos que:

aumentar N no es la única estrategia; una mejor construcción del estimador puede reducir sustancialmente su varianza.

Ya poseemos casi todas las piezas del capítulo: eventos, condicionalidad, Bayes, conteo, variables aleatorias, distribuciones, esperanza, normalidad, convergencia y simulación.

Falta reunirlas en una sola estrategia para resolver problemas reales de probabilidad.

El azar puede dominar cada ensayo individual.

Pero cuando observamos muchos ensayos, los promedios pueden revelar progresivamente la estructura probabilística que estaba escondida detrás del ruido.

SIGUIENTE
Parte 18 de 18 · Integración: resolver problemas reales de probabilidad
Elegir el modelo correcto · resolver · verificar · interpretar · comunicar
espacio muestral · condicional · Bayes · conteo · variables aleatorias · distribuciones · simulación · decisión
La numeración continuará en 6.707.

Referencias

Bernoulli, J. (1713). Ars conjectandi.

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Feller, W. (1968). An introduction to probability theory and its applications (Vol. 1, 3rd ed.). Wiley.

Fishman, G. S. (1996). Monte Carlo: Concepts, algorithms, and applications. Springer.

Robert, C. P., & Casella, G. (2004). Monte Carlo statistical methods (2nd ed.). Springer.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

PARTE 18 DE 18
CAPÍTULO 6

Integración: resolver problemas reales de probabilidad

Del fenómeno al modelo, del modelo al cálculo y del cálculo a una interpretación razonada

preguntar · modelar · calcular · simular · verificar · interpretar · comunicar · decidir

Idea central

Resolver un problema de probabilidad no consiste en reconocer una palabra y buscar una fórmula.

Consiste en comprender qué fenómeno estamos representando, formular con precisión la pregunta, identificar las condiciones relevantes, construir o seleccionar un modelo, calcular o simular, comprobar la coherencia del resultado e interpretar qué significa ese número dentro del contexto.

Una solución probabilística completa es una cadena de razonamiento.
Al finalizar esta parte podrás:
reconocer la estructura probabilística de un problema;
justificar el modelo antes de calcular;
distinguir modelos exactos de aproximaciones;
utilizar combinatoria, condicional, Bayes y distribuciones;
relacionar Poisson y exponencial;
comparar cálculo exacto y Monte Carlo;
cuantificar el error Monte Carlo;
verificar supuestos y resultados;
distinguir probabilidad de consecuencia;
introducir pérdida y utilidad esperadas;
construir un modelo probabilístico completo;
comunicar incertidumbre sin exagerar conclusiones.

6.707. El verdadero problema no es recordar una fórmula

Considera las siguientes preguntas:

¿Cuántos grupos diferentes pueden formarse?
¿Cuál es la probabilidad de obtener 7 éxitos en 10 intentos?
¿Qué probabilidad tiene una causa después de observar una evidencia?
¿Cuántos eventos aparecerán durante los próximos 5 minutos?
¿Cuánto tiempo transcurrirá hasta el próximo evento?
¿Qué probabilidad corresponde a un intervalo de una medición continua?
¿Cómo se comportará un promedio de muchas observaciones?
¿Cómo aproximamos una probabilidad cuando el cálculo exacto es difícil?

Todas son preguntas de probabilidad, pero no requieren la misma herramienta.

Antes de preguntar «¿qué fórmula uso?», pregunta «¿qué estructura tiene este problema?»

6.708. Una ruta general para resolver problemas probabilísticos

Las herramientas estudiadas a lo largo del capítulo pueden organizarse dentro de una estrategia común.

Figura 6.159
Ruta completa de una solución probabilística
1 · COMPRENDER LA SITUACIÓN

¿Qué ocurre? · ¿qué se desconoce? · ¿qué queremos responder?

2 · DEFINIR EXPERIMENTO, EVENTO O VARIABLE
3 · IDENTIFICAR LA ESTRUCTURA

orden · reemplazo · independencia · información nueva · tasa · continuidad

4 · ELEGIR Y JUSTIFICAR EL MODELO

combinatoria · condicional · Bayes · distribuciones · límites · simulación

5 · CALCULAR O SIMULAR

razonamiento primero · herramienta después

6 · VERIFICAR

supuestos · rango · unidades · extremos · simulación · orden de magnitud

7 · INTERPRETAR

¿qué significa exactamente el número obtenido?

8 · COMUNICAR

conclusión · supuestos · limitaciones · incertidumbre

9 · DECIDIR, CUANDO CORRESPONDA

consecuencias · objetivos · restricciones · tolerancia al riesgo

Nota. Elaboración propia. Si la verificación revela que el modelo no es adecuado, debemos regresar a etapas anteriores.

6.709. Tabla maestra de selección

Tabla 6.72
¿Qué herramienta responde mejor a cada estructura?
Resultados posibles

¿Qué puede ocurrir?

Herramienta: espacio muestral.

Número de posibilidades

¿Cuántas configuraciones existen?

Herramienta: combinatoria.

Información nueva

¿Qué cambia sabiendo B?

Herramienta: P(A|B).

Relación entre eventos

¿Conocer A modifica la probabilidad de B?

Concepto: independencia.

Invertir una condición

¿Qué causa es probable después de la evidencia?

Herramienta: Bayes.

Un ensayo, éxito o fracaso

Resultado 0 o 1.

Modelo: Bernoulli.

Éxitos en n ensayos

n fijo, independencia, p constante.

Modelo: binomial.

Hasta el primer éxito

Número de ensayos hasta el primer éxito.

Modelo: geométrica.

Muestreo sin reemplazo

Población finita con K éxitos.

Modelo: hipergeométrica.

Eventos por intervalo

Conteo asociado a una tasa.

Modelo: Poisson.

Valores equiprobables en un intervalo

Densidad constante.

Modelo: uniforme continua.

Tiempo hasta el próximo evento

Proceso Poisson con tasa constante.

Modelo: exponencial.

Magnitud aproximadamente normal

Distancias respecto de μ.

Herramienta: z y Φ.

Promedios de muchas observaciones

¿Hacia dónde se estabilizan?

Herramienta: Ley de los Grandes Números.

Fluctuaciones de promedios

¿Cómo se distribuyen aproximadamente?

Herramienta: Teorema Central del Límite.

Cálculo exacto difícil

Podemos reproducir correctamente el modelo.

Herramienta: Monte Carlo.

CASO INTEGRADOR 1
Control de calidad: modelo exacto y aproximación

6.710. Situación

INTERMEDIO · ●●○○

Consideremos un ejemplo hipotético con fines didácticos.

Un lote contiene:

100

componentes

8

defectuosos

92

no defectuosos

Un inspector selecciona 10 componentes sin reemplazo.

¿Cuál es la probabilidad de encontrar exactamente 2 defectuosos?

6.711. Reconocer el mecanismo antes de calcular

Las características decisivas son:

población finita + selección sin reemplazo.

Cada componente retirado modifica la composición de la población restante.

Modelo exacto: distribución hipergeométrica

N=100,   K=8,   n=10,   k=2.

Figura 6.160
El reemplazo puede cambiar el modelo
¿SE DEVUELVE CADA ELEMENTO ANTES DE LA SIGUIENTE EXTRACCIÓN?

La composición se restablece.

p puede permanecer constante.

BINOMIAL
NO

La composición cambia.

La población es finita.

HIPERGEOMÉTRICA

Nota. Elaboración propia.

6.712. Cálculo exacto

Para obtener exactamente 2 defectuosos debemos seleccionar:

2 de los 8 defectuosos

y

8 de los 92 no defectuosos.

El número total de muestras posibles de tamaño 10 es:

C(100,10).

P(X=2)=C(8,2)C(92,8)/C(100,10)

P(X=2)≈0,1506.

P(X=2)≈15,06 %.

6.713. ¿Qué ocurre si aproximamos mediante una binomial?

La proporción inicial de defectuosos es:

p=8/100=0,08.

Si utilizáramos:

X ~ Binomial(10;0,08),

obtendríamos:

P(X=2)=C(10,2)(0,08)²(0,92)⁸

≈0,1478≈14,78 %.

6.714. Medir el error de una aproximación

Los dos resultados son:

exacto = 15,06 %

aproximado = 14,78 %.

La diferencia absoluta es aproximadamente:

15,06 %−14,78 %=0,28 puntos porcentuales.

La aproximación es cercana en este caso, pero los modelos siguen representando mecanismos distintos.

Que una aproximación funcione bien para un evento concreto no demuestra que el modelo aproximado sea intercambiable con el modelo exacto en todas las preguntas.

PARA PROFUNDIZAR · DEMOSTRACIÓN 76 · ●●●●

¿Por qué el muestreo sin reemplazo reduce la varianza?

Para una hipergeométrica:

Var(X)=np(1−p)·(N−n)/(N−1).

El factor:

(N−n)/(N−1)

recibe el nombre de corrección por población finita.

Como n>1:

(N−n)/(N−1)<1.

Por tanto:

Var(hipergeométrica)<Var(binomial comparable).

La razón intuitiva es que extraer sin reemplazo introduce dependencia: lo que observamos modifica la composición de lo que queda.

Tabla 6.73
Modelo exacto y aproximación
HIPERGEOMÉTRICA

Resultado: 15,06 %.

Mecanismo: sin reemplazo.

Papel: modelo exacto.

BINOMIAL

Resultado: 14,78 %.

Supuesto aproximado: p≈0,08 constante.

Papel: aproximación.

6.715. Interpretar dentro del modelo

Bajo el modelo del lote especificado y una selección aleatoria de 10 componentes sin reemplazo, la probabilidad de encontrar exactamente 2 defectuosos es aproximadamente 15,06 %.

La estructura de una buena conclusión es:

condiciones del modelo + evento + probabilidad.

CASO INTEGRADOR 2
Una alarma automática: tasa base, probabilidad total y Bayes

6.716. El problema

AVANZADO · ●●●○

Consideremos un ejemplo hipotético con fines didácticos.

Una máquina puede presentar una falla F o funcionar normalmente Fc.

P(F)=0,02

2 % presentan falla.

P(A|F)=0,95

Alarma cuando existe falla.

P(A|Fc)=0,04

Alarma aun sin falla.

La alarma se activa.

¿Cuál es ahora la probabilidad de que realmente exista una falla?
Figura 6.161
Los dos caminos que pueden producir una alarma
MÁQUINA
FALLA · 0,02
alarma · 0,95

Camino hacia alarma: 0,02×0,95=0,019

SIN FALLA · 0,98
alarma · 0,04

Camino hacia alarma: 0,98×0,04=0,0392

Nota. Elaboración propia. Ejemplo hipotético.

6.717. Primero calculamos la probabilidad total de alarma

La alarma puede producirse por dos caminos mutuamente excluyentes:

falla y alarma

o

no falla y alarma.

P(A)=P(F)P(A|F)+P(Fc)P(A|Fc)

P(A)=0,02(0,95)+0,98(0,04)

P(A)=0,019+0,0392=0,0582.

6.718. Ahora actualizamos mediante Bayes

Queremos:

P(F|A).

P(F|A)=P(F)P(A|F)/P(A)

P(F|A)=0,02(0,95)/0,0582

P(F|A)≈0,3265≈32,65 %

6.719. El mismo razonamiento con 10.000 máquinas

Las frecuencias naturales permiten ver el mecanismo sin comenzar por la fórmula.

Tabla 6.74
Representación mediante frecuencias naturales
200

máquinas con falla

190 activan alarma

9.800

máquinas sin falla

392 activan alarma

582

alarmas totales

190+392

Entre las 582 máquinas que activan alarma, 190 tienen falla.

190/582≈0,3265≈32,65 %.

6.720. La trampa de invertir una probabilidad

P(alarma | falla)=95 %

Sabemos que existe falla y preguntamos por la alarma.

P(falla | alarma)≈32,65 %

Sabemos que apareció alarma y preguntamos por la falla.

Cambiar la condición cambia la pregunta.

CASO INTEGRADOR 3
El mismo proceso puede generar preguntas distintas

6.721. Llegadas a un servicio: situación y tasa

INTERMEDIO · ●●○○

Ejemplo hipotético: un servicio recibe, bajo un modelo Poisson que suponemos adecuado:

6 solicitudes cada 10 minutos.

Queremos:

P(exactamente 2 solicitudes durante los próximos 5 minutos).

La tasa por minuto es:

6/10=0,6 solicitudes por minuto.

Para cinco minutos:

λ=0,6×5=3.

Figura 6.162
La tasa puede permanecer constante mientras λ cambia con el intervalo
1 minuto

λ=0,6

5 minutos

λ=3

10 minutos

λ=6

30 minutos

λ=18

Nota. Elaboración propia. Ejemplo hipotético.

6.722. Aplicar Poisson

Para X ~ Poisson(3):

P(X=2)=e−33²/2!

P(X=2)≈0,2240≈22,40 %

6.723. Las unidades forman parte del modelo

Sería incorrecto utilizar:

λ=6

para una pregunta referida a cinco minutos, porque 6 es el número esperado en diez minutos.

Una tasa sin sus unidades y sin su intervalo de referencia está incompleta.

6.724. El mismo fenómeno, otra pregunta: tiempo de espera

Ahora no preguntamos cuántas solicitudes llegarán.

Preguntamos:

¿Cuánto tiempo transcurrirá hasta la próxima solicitud?

Bajo un proceso Poisson de tasa:

r=0,6 por minuto,

el tiempo T hasta el próximo evento puede modelarse mediante:

T ~ Exponencial(0,6).

Por ejemplo:

P(T≤5)=1−e−0,6·5

=1−e−3

P(T≤5)≈0,9502≈95,02 %.

Mismo fenómeno, variable diferente: Poisson cuenta eventos; exponencial modela tiempos de espera.

CASO INTEGRADOR 4
Una medición continua: normal, áreas y puntuación z

6.725. Situación

AVANZADO · ●●●○

Supongamos, como ejemplo hipotético, que existe justificación suficiente para utilizar un modelo normal:

μ=50 unidades

σ=4 unidades.

Queremos calcular:

P(46≤X≤58).

6.726. Transformar ambos límites

Para x=46:

z₁=(46−50)/4=−1.

Para x=58:

z₂=(58−50)/4=2.

Figura 6.163
De la escala original a la escala estandarizada
X=46

z=−1

X=50

z=0

X=54

z=1

X=58

z=2

Nota. Elaboración propia. Cada 4 unidades corresponden a una desviación estándar.

P(46≤X≤58)=P(−1≤Z≤2)

=Φ(2)−Φ(−1)

≈0,9772−0,1587

P≈0,8185≈81,85 %

6.727. Una comprobación antes de confiar en el decimal

El intervalo:

−1≤Z≤2

contiene completamente:

−1≤Z≤1,

cuya probabilidad es aproximadamente:

68,27 %.

Y está contenido en:

−2≤Z≤2,

cuya probabilidad es aproximadamente:

95,45 %.

Por tanto, antes de consultar cualquier tabla, esperamos:

68,27 % < P(−1≤Z≤2) < 95,45 %.

El resultado 81,85 % supera esta prueba de coherencia.

6.728. Dos comprobaciones conceptuales

1 · NORMALIDAD

Que X sea continua no demuestra que X sea normal. La normalidad es una hipótesis que debe justificarse.

2 · PROBABILIDAD PEQUEÑA

Un valor muy alejado puede tener probabilidad muy pequeña sin ser matemáticamente imposible.

CASO INTEGRADOR 5
Contar antes de calcular

6.729. Seleccionar un comité

FUNDAMENTAL · ●○○○

Un grupo tiene 12 estudiantes.

Se seleccionan 4 para formar un comité.

No existen cargos distintos.

Por tanto:

el orden no importa.

C(12,4)=495.

6.730. Si aparecen cargos, la pregunta cambia

Ahora seleccionamos:

presidente
vicepresidente
secretario
tesorero

Ahora sí importa quién ocupa cada posición.

12×11×10×9=11.880.

6.731. Combinaciones y ordenamientos están relacionados

Podemos obtener las 11.880 asignaciones de otra manera.

Primero escogemos las cuatro personas:

C(12,4)=495.

Después ordenamos esas cuatro personas en los cuatro cargos:

4!=24.

Por tanto:

495×24=11.880.

elegir las personas × asignar las posiciones.

Figura 6.164
La pregunta «¿importa el orden?» separa dos estructuras
¿IMPORTA QUIÉN OCUPA CADA POSICIÓN?
NO

Seleccionar un grupo.

COMBINACIÓN

Cargos o posiciones distintas.

ORDENAMIENTO

Nota. Elaboración propia.

CASO INTEGRADOR 6
Exacto y simulado: dos caminos para el mismo problema

6.732. Dos dados

INTERMEDIO · ●●○○

Lanzamos dos dados equilibrados e suponemos independencia.

Queremos:

P(suma≥10).

suma 10

3 resultados

suma 11

2 resultados

suma 12

1 resultado

6 casos favorables de 36 equiprobables.

P=6/36=1/6≈0,1667.

6.733. Resolver el mismo problema mediante Monte Carlo

En cada repetición:

  1. generamos el primer dado;
  2. generamos el segundo;
  3. sumamos;
  4. registramos 1 si la suma es al menos 10;
  5. registramos 0 en caso contrario.

Después de N repeticiones:

p̂=número de éxitos/N.
Figura 6.165
Una simulación fluctúa alrededor de la probabilidad exacta
N=100

p̂=0,1700

N=1.000

p̂=0,1600

N=10.000

p̂=0,1664

EXACTA

p≈0,1667

Nota. Elaboración propia. Datos simulados con fines didácticos. Una ejecución individual no tiene que mejorar de forma monotónica al aumentar N.

6.734. ¿Es razonable la diferencia observada?

Para N=10.000 obtuvimos:

p̂=0,1664.

El error estándar estimado es:

SE≈√[0,1664(1−0,1664)/10.000]

SE≈0,00372.

Un intervalo Monte Carlo aproximado del 95 % es:

0,1664 ± 1,96(0,00372)

≈0,1664 ± 0,0073.

intervalo aproximado: 0,1591 a 0,1737.

El valor exacto:

1/6≈0,1667

se encuentra dentro de ese intervalo.

6.735. ¿Qué aprendemos al comparar ambos métodos?

Tabla 6.75
Solución exacta y simulación
MÉTODO EXACTO

Usa la estructura matemática.

P=1/6.

No presenta error Monte Carlo.

MONTE CARLO

Reproduce virtualmente el modelo.

p̂≈P.

Presenta fluctuación porque N es finito.

Una solución exacta puede carecer de error Monte Carlo y aun así contener error de modelación o de implementación.

DE LA PROBABILIDAD A LA DECISIÓN
Una probabilidad informa; no decide por nosotros

6.736. La misma probabilidad puede acompañar consecuencias diferentes

Imagina dos eventos con:

P=0,01.

En el primer caso, la consecuencia es una interrupción breve.

En el segundo, la consecuencia puede ser muy grave.

La probabilidad es la misma.

La decisión razonable puede ser diferente.

Figura 6.166
Una decisión requiere más información que una probabilidad aislada
PROBABILIDAD

¿Qué tan probable es?

CONSECUENCIA

¿Qué ocurre si sucede?

OBJETIVOS

¿Qué queremos proteger u obtener?

RESTRICCIONES

¿Qué opciones son posibles?

DECISIÓN INFORMADA

Nota. Elaboración propia.

6.737. Valor esperado de una consecuencia

Si una variable X puede tomar:

x₁,x₂,…,xm

con probabilidades:

p₁,p₂,…,pm,

entonces:

E[X]=Σxᵢpᵢ.

El valor esperado puede ayudar a comparar alternativas, pero no constituye una regla universal de decisión.

6.738. Una introducción a la pérdida esperada

PROFUNDIZACIÓN UNIVERSITARIA · ●●●●

En un problema de decisión distinguimos:

ACCIÓN

lo que decidimos hacer

ESTADO

lo que realmente ocurre

CONSECUENCIA

resultado de acción y estado

PÉRDIDA

costo asociado a la consecuencia

Si L(a,sᵢ) representa la pérdida de tomar la acción a cuando ocurre el estado sᵢ:

pérdida esperada(a)=ΣP(sᵢ)L(a,sᵢ).

Una posible regla de decisión consiste en elegir la acción con menor pérdida esperada.

Tabla 6.76
Probabilidad y decisión cumplen funciones diferentes
PROBABILIDAD

cuantifica incertidumbre sobre estados o eventos.

PÉRDIDA / UTILIDAD

representa cómo valoramos las consecuencias.

DECISIÓN

combina incertidumbre, consecuencias y objetivos.

PARA PROFUNDIZAR · DEMOSTRACIÓN 77 · ●●●●

6.739. El valor esperado como promedio de largo plazo

Supongamos repeticiones independientes con la misma distribución de una variable discreta e integrable X.

Si xᵢ apareció nᵢ veces en n realizaciones:

X̄=x₁(n₁/n)+···+xm(nm/n).

Por la Ley de los Grandes Números:

nᵢ/n → pᵢ.

Por tanto:

X̄ → Σxᵢpᵢ=E[X].

Esta interpretación depende de las condiciones del modelo; no convierte E[X] en el resultado que deba observarse en una realización individual.

6.740. Riesgo no significa destino

Supongamos que un modelo asigna:

70 %

a un evento.

Eso no significa que un caso individual esté:

«70 % ocurrido». ✗

Significa que, bajo el modelo y la información utilizados, ese evento recibe probabilidad 0,70.

La probabilidad cuantifica incertidumbre. No transforma una estimación en certeza, sentencia o destino individual.

VERIFICAR ANTES DE ACEPTAR LA RESPUESTA
Un cálculo correcto puede responder mal un problema mal modelado

6.741. Nueve pruebas rápidas de coherencia

Tabla 6.77
Lista mínima para revisar una solución probabilística
1 · RANGO

¿La probabilidad está entre 0 y 1?

2 · COMPLEMENTO

¿P(A)+P(Ac)=1?

3 · TOTAL

¿La distribución suma o integra 1?

4 · UNIDADES

¿Tasas, tiempos e intervalos son compatibles?

5 · EXTREMOS

¿El modelo se comporta razonablemente en casos límite?

6 · SUPUESTOS

¿Se justifican realmente las condiciones del modelo?

7 · SIMULACIÓN

¿Una simulación independiente es compatible con el resultado?

8 · ORDEN DE MAGNITUD

¿El tamaño del resultado parece plausible?

9 · INTERPRETACIÓN

¿El número responde exactamente a la pregunta?

6.742. Tres condiciones para confiar en una solución

Figura 6.167
Tres pilares de una solución probabilística confiable
MODELO ADECUADO

representa razonablemente el fenómeno y sus condiciones

CÁLCULO CORRECTO

aplica correctamente la estructura matemática

INTERPRETACIÓN CORRECTA

traduce adecuadamente el resultado al contexto

Nota. Elaboración propia.

Un cálculo impecable no salva un modelo inadecuado.

Un modelo adecuado tampoco salva un error de cálculo.

Y ambos pueden conducir a una conclusión engañosa si interpretamos incorrectamente el resultado.

6.743. Mapa maestro de modelos y herramientas

Figura 6.168
Árbol conceptual para seleccionar herramientas probabilísticas
¿QUÉ TIPO DE PREGUNTA TENGO?
RESULTADOS Y EVENTOS

espacio muestral

operaciones con eventos

combinatoria

INFORMACIÓN NUEVA

condicional

independencia

probabilidad total

Bayes

VARIABLE ALEATORIA

discreta

continua

Bernoulli
un ensayo
Binomial
éxitos en n
Geométrica
hasta éxito
Hipergeométrica
sin reemplazo
Poisson
conteo
Uniforme
intervalo
Exponencial
espera
Normal
z y Φ
MUCHAS REPETICIONES

LGN · TCL

CÁLCULO DIFÍCIL

Monte Carlo

VERIFICAR · INTERPRETAR · COMUNICAR

Nota. Elaboración propia. El nombre de una distribución nunca sustituye la comprobación de sus condiciones.

6.744. Doce preguntas antes de comenzar a calcular

1. ¿Qué exactamente me están preguntando?

2. ¿Cuál es el experimento o fenómeno aleatorio?

3. ¿Cuáles son los resultados posibles?

4. ¿Qué evento o variable debo definir?

5. ¿Existe información condicionante?

6. ¿Los ensayos pueden considerarse independientes?

7. ¿Existe reemplazo?

8. ¿La probabilidad permanece constante?

9. ¿Qué unidades tienen las tasas y los intervalos?

10. ¿Qué hipótesis necesita el modelo?

11. ¿Qué datos o evidencia justifican esas hipótesis?

12. ¿Cómo comprobaré que la respuesta tiene sentido?

PROYECTO FINAL DEL CAPÍTULO
Construir, resolver, verificar y comunicar un modelo probabilístico

6.745. Elige una situación

Individualmente o en equipo, selecciona una situación donde exista incertidumbre.

tiempos de espera
control de calidad
dados o cartas
llegadas a un servicio
encuestas
mediciones experimentales

Los datos reales deben indicar fuente y contexto. Los datos inventados deben identificarse como hipotéticos o simulados.

6.746. Fase 1 · Formulación

1. Describe la situación con tus propias palabras.

2. Explica qué parte del fenómeno es aleatoria.

3. Define el experimento.

4. Define el espacio muestral cuando sea posible.

5. Define los eventos relevantes.

6. Define la variable aleatoria, si corresponde.

7. Formula una pregunta probabilística precisa.

6.747. Fase 2 · Construcción del modelo

1. Decide si la variable es discreta o continua.

2. Determina si existen ensayos repetidos.

3. Examina si pueden considerarse independientes.

4. Determina si existe reemplazo.

5. Decide si p permanece constante.

6. Si cuentas eventos, identifica tasa e intervalo.

7. Si estudias tiempos de espera, examina si un modelo exponencial es razonable.

8. Si utilizas normal, justifica por qué.

9. Selecciona el modelo probabilístico.

10. Explica por qué responde a la estructura.

11. Identifica al menos una limitación.

6.748. Fase 3 · Solución

1. Explica la estructura del razonamiento.

2. Escribe la fórmula utilizada.

3. Identifica cada parámetro.

4. Sustituye los valores.

5. Realiza el cálculo.

6. Expresa el resultado como decimal.

7. Cuando corresponda, exprésalo como porcentaje.

8. Interpreta el resultado en una oración completa.

6.749. Fase 4 · Verificación

1. ¿La respuesta está entre 0 y 1 si es una probabilidad?

2. ¿El complemento es coherente?

3. ¿La distribución suma o integra 1?

4. ¿Las unidades son correctas?

5. ¿Los parámetros corresponden al intervalo adecuado?

6. ¿Los supuestos del modelo son razonables?

7. ¿Una simulación produce aproximadamente el mismo resultado?

8. ¿El orden de magnitud tiene sentido?

9. ¿Qué podría hacer fallar el modelo en el mundo real?

6.750. Fase 5 · Comunicación

Presenta claramente:

1. la pregunta;

2. los datos y su procedencia;

3. el modelo y sus supuestos;

4. una figura, tabla o esquema útil;

5. el cálculo;

6. una simulación cuando sea pertinente;

7. la interpretación;

8. las limitaciones;

9. la conclusión final.

6.751. Fase 6 · Reproducibilidad y uso responsable de los datos

Si otra persona quisiera repetir tu análisis, debería poder comprender:

1. de dónde salieron los datos;

2. cómo fueron preparados;

3. qué supuestos utilizaste;

4. qué fórmula o algoritmo aplicaste;

5. qué semilla utilizaste, si la simulación requiere reproducibilidad;

6. qué decisiones metodológicas tomaste;

7. cuáles son las limitaciones del estudio.

Cuando los datos pertenecen a personas, también deben considerarse privacidad, anonimización y uso responsable de la información.

Figura 6.169
Ciclo completo de investigación probabilística
1

preguntar

2

modelar

3

calcular

4

simular

5

verificar

6

interpretar

7

comunicar

Si la evidencia contradice el modelo, debemos revisarlo y regresar a etapas anteriores.

Nota. Elaboración propia.

6.752. Rúbrica del proyecto final

Tabla 6.78
Criterios para evaluar un modelo probabilístico completo
PLANTEAMIENTO

Excelente: pregunta precisa y variables claramente definidas.

Adecuado: pequeñas ambigüedades.

Por mejorar: no queda claro qué se desea calcular.

MODELO

Excelente: modelo y supuestos justificados.

Adecuado: justificación parcial.

Por mejorar: distribución elegida por apariencia.

SUPUESTOS Y LIMITACIONES

Excelente: explícitos y críticamente examinados.

Adecuado: menciona los principales.

Por mejorar: se presentan conclusiones sin condiciones.

CÁLCULO

Excelente: correcto, claro y reproducible.

Adecuado: esencialmente correcto.

Por mejorar: errores modifican la respuesta.

VERIFICACIÓN

Excelente: varias comprobaciones independientes.

Adecuado: al menos una comprobación.

Por mejorar: acepta el resultado sin examinarlo.

INTERPRETACIÓN

Excelente: traduce correctamente y reconoce límites.

Adecuado: interpretación esencialmente correcta.

Por mejorar: confunde probabilidad con certeza.

REPRODUCIBILIDAD

Excelente: datos, método y decisiones pueden reconstruirse.

Adecuado: información suficiente con omisiones menores.

Por mejorar: no puede repetirse el análisis.

COMUNICACIÓN

Excelente: solución ordenada, argumentada y visualmente clara.

Adecuado: solución comprensible.

Por mejorar: presenta números sin razonamiento.

EVALUACIÓN FINAL DEL CAPÍTULO
Comprender, seleccionar, justificar, verificar e interpretar

6.753. Comprueba tu dominio del capítulo

1. ¿Qué es un experimento aleatorio?

2. ¿Qué diferencia existe entre resultado y evento?

3. ¿Qué representa Ω?

4. ¿Qué significa que dos eventos sean mutuamente excluyentes?

5. ¿Qué significa independencia?

6. ¿Por qué incompatibilidad e independencia no son sinónimos?

7. ¿Qué representa P(A|B)?

8. ¿Qué cambia cuando condicionamos por B?

9. Escribe la regla general de multiplicación.

10. ¿Cuándo resulta útil la probabilidad total?

11. ¿Qué problema resuelve Bayes?

12. ¿Por qué P(A|B) y P(B|A) pueden diferir mucho?

13. ¿Cuándo se utiliza una combinación?

14. ¿Cuándo importa el orden?

15. ¿Qué es una variable aleatoria?

16. ¿Qué diferencia existe entre variable discreta y continua?

17. ¿Qué es una función de masa?

18. ¿Qué es una densidad?

19. ¿Por qué f(x) no suele ser P(X=x)?

20. ¿Por qué P(X=x)=0 en una variable con densidad no significa imposibilidad lógica?

21. ¿Qué representa E[X]?

22. ¿Qué representa Var(X)?

23. ¿Cuáles son las condiciones de una binomial?

24. ¿Qué pregunta caracteriza una geométrica?

25. ¿Por qué la hipergeométrica aparece sin reemplazo?

26. ¿Qué representa λ en Poisson?

27. ¿Por qué λ debe ajustarse al intervalo?

28. ¿Qué relación existe entre Poisson y exponencial?

29. ¿Qué caracteriza una uniforme continua?

30. ¿Qué representan μ y σ en una normal?

31. ¿Qué significa una puntuación z?

32. ¿Qué representa Φ(z)?

33. ¿Qué representa Φ−1(p)?

34. ¿Por qué una variable continua no tiene que ser normal?

35. ¿Por qué una muestra grande no vuelve normales los datos originales?

36. Explica la Ley de los Grandes Números.

37. ¿Por qué una frecuencia relativa no converge necesariamente de forma monotónica?

38. ¿Qué diferencia conceptual existe entre LGN y TCL?

39. ¿Qué es una simulación Monte Carlo?

40. ¿Por qué el error estándar de un promedio Monte Carlo es de orden 1/√N?

41. ¿Cómo se estima el error estándar Monte Carlo?

42. ¿Qué significa un intervalo Monte Carlo?

43. ¿Por qué aumentar N no corrige un modelo equivocado?

44. ¿Qué significa reducción de varianza?

45. ¿Qué diferencia existe entre modelo adecuado, cálculo correcto e interpretación correcta?

46. ¿Por qué una probabilidad no determina por sí sola una decisión?

47. ¿Qué es una pérdida esperada?

48. ¿Qué papel cumplen los supuestos en un modelo?

49. ¿Por qué la reproducibilidad es importante?

50. Describe el procedimiento completo que utilizarías ante un problema probabilístico nuevo.

6.754. El viaje completo del capítulo

Figura 6.170
Las 18 partes forman una sola historia
1. Medir la incertidumbre entre 0 y 1
2. Experimentos y Ω
3. Eventos
4. Origen de las probabilidades
5. Axiomas y reglas
6. Combinatoria
7. Probabilidad condicional
8. Independencia
9. Probabilidad total y árboles
10. Bayes
11. Variables aleatorias
12. Distribuciones discretas
13. Bernoulli y binomial
14. Geométrica, hipergeométrica y Poisson
15. Variables continuas y densidad
16. Normal y puntuación z
17. Grandes números y Monte Carlo
18. Integrar, verificar y decidir

Nota. Elaboración propia.

6.755. Doce errores que ya debemos ser capaces de detectar

1

Confundir P(A|B) con P(B|A).

2

Confundir independencia con incompatibilidad.

3

Usar binomial cuando p cambia.

4

Ignorar el muestreo sin reemplazo.

5

Usar Poisson para cualquier conteo.

6

Confundir densidad con probabilidad puntual.

7

Creer que continua significa normal.

8

Creer que z es una probabilidad.

9

Confundir LGN con TCL.

10

Creer que Monte Carlo elimina el error de modelo.

11

Confundir una probabilidad precisa con certeza científica.

12

Tomar una decisión sin considerar consecuencias ni objetivos.

6.756. El modelo no es la realidad

Una moneda matemática puede ser perfectamente equilibrada.

Una moneda física puede presentar asimetrías.

Una máquina real puede deteriorarse.

Una tasa de llegadas puede variar con la hora.

Una medición puede contener errores sistemáticos.

Una distribución observada puede no ser normal.

Por eso debemos separar cuidadosamente varios niveles.

Figura 6.171
Realidad, datos, modelo, cálculo e interpretación
REALIDAD

fenómeno complejo

↓ observamos y medimos
DATOS

evidencia obtenida

↓ proponemos y contrastamos
MODELO

representación matemática bajo hipótesis

↓ calculamos y simulamos
CÁLCULO / SIMULACIÓN

obtenemos consecuencias cuantitativas del modelo

↓ traducimos al contexto
INTERPRETACIÓN

qué significa y qué no significa el resultado

↓ cuando corresponde
DECISIÓN

acción informada bajo incertidumbre

Nota. Elaboración propia. El modelo no sustituye la realidad; permite razonar sobre ella bajo supuestos explícitos.

6.757. Síntesis final del capítulo

Comenzamos comprendiendo que una probabilidad es una medida matemática de incertidumbre entre 0 y 1.

Construimos experimentos, resultados, espacios muestrales y eventos.

Aprendimos que muchas reglas de probabilidad se derivan de unos pocos axiomas fundamentales.

Utilizamos combinatoria para contar posibilidades.

Incorporamos nueva información mediante:

P(A|B).

Diferenciamos independencia e incompatibilidad.

Construimos árboles, aplicamos probabilidad total y actualizamos probabilidades mediante Bayes.

Convertimos resultados aleatorios en números mediante variables aleatorias.

Estudiamos esperanza y varianza.

Analizamos modelos discretos:

Bernoulli · binomial · geométrica · hipergeométrica · Poisson.

Pasamos a variables continuas y comprendimos la función de densidad y la función acumulada.

Estudiamos modelos:

uniforme · exponencial · normal.

Transformamos observaciones mediante:

z=(x−μ)/σ.

Comprendimos que una puntuación z es una distancia estandarizada, no una probabilidad.

Estudiamos la Ley de los Grandes Números para comprender hacia dónde se dirigen los promedios.

Utilizamos el Teorema Central del Límite para comprender cómo fluctúan muchos promedios alrededor de su centro.

Convertimos la repetición aleatoria en una herramienta computacional mediante Monte Carlo.

Y finalmente reunimos todo:

realidad → datos → modelo → cálculo o simulación → verificación → interpretación → comunicación

Cuando existe una decisión:

probabilidad + consecuencias + objetivos + restricciones → decisión informada.

Y llegamos a la lección que resume todo el capítulo: una buena solución probabilística no termina cuando aparece un número.

Figura 6.172
La probabilidad como puente entre incertidumbre y decisión
INCERTIDUMBRE DEL MUNDO REAL
OBSERVAMOS · MEDIMOS · REUNIMOS EVIDENCIA
MODELO PROBABILÍSTICO
CALCULAR · SIMULAR · COMPARAR · ACTUALIZAR
INCERTIDUMBRE CUANTIFICADA
DECISIONES MÁS INFORMADAS

sin confundir probabilidad con certeza

Nota. Elaboración propia. La probabilidad no elimina la incertidumbre: permite describirla, analizarla y utilizarla racionalmente.

FIN DE LA PARTE 18 · FIN DEL CAPÍTULO

La probabilidad no promete decirnos exactamente qué ocurrirá.

Nos ofrece algo diferente y profundamente valioso:

una manera rigurosa de pensar cuando el futuro no puede conocerse con certeza.

Preguntar bien, modelar con cuidado, calcular correctamente, simular cuando sea útil, verificar, reconocer los límites y comunicar la incertidumbre con precisión: ese es el pensamiento probabilístico.

Referencias

Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.

Casella, G., & Berger, R. L. (2002). Statistical inference (2nd ed.). Duxbury.

Feller, W. (1968). An introduction to probability theory and its applications (Vol. 1, 3rd ed.). Wiley.

Kolmogorov, A. N. (1933). Grundbegriffe der Wahrscheinlichkeitsrechnung. Springer.

Robert, C. P., & Casella, G. (2004). Monte Carlo statistical methods (2nd ed.). Springer.

Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.

Deja un comentario