Probabilidad: comprender y cuantificar el azar
¿Qué es la probabilidad?
Del «puede ocurrir» a una medida matemática entre 0 y 1
Muchas situaciones de la vida, la ciencia y la tecnología no pueden predecirse con absoluta certeza. Sin embargo, eso no significa que no podamos razonar acerca de ellas. La probabilidad proporciona un lenguaje matemático para describir y cuantificar la incertidumbre. En esta parte aprenderemos la idea matemática básica y, al mismo tiempo, veremos cómo aparece en meteorología, ingeniería, control de calidad, medición, medicina, deporte y otras áreas.
6.1. Hay preguntas cuya respuesta conocemos y otras que no
Observa las siguientes situaciones.
Tenemos una caja y comprobamos que contiene exactamente 12 lápices.
Podemos afirmar con certeza cuántos lápices contiene.
Lanzamos una moneda y queremos saber qué lado quedará hacia arriba.
Antes del lanzamiento no podemos conocer con certeza el resultado.
Queremos saber si lloverá mañana por la tarde.
Podemos disponer de información meteorológica, pero todavía existe incertidumbre.
La probabilidad aparece precisamente cuando queremos razonar acerca de situaciones en las que no podemos anticipar con certeza un resultado concreto.
¿Cómo puede un meteorólogo, un ingeniero, un médico o un entrenador tomar decisiones si no conoce con certeza lo que ocurrirá? Una respuesta fundamental es: cuantificando la incertidumbre.
6.2. ¿Qué significa azar?
En el lenguaje cotidiano decimos que algo ocurre «al azar» cuando no sabemos de antemano cuál será el resultado.
En probabilidad necesitamos una formulación más cuidadosa.
Un fenómeno aleatorio es aquel para el cual podemos describir los resultados posibles, pero no podemos determinar con certeza cuál de ellos ocurrirá en una realización concreta antes de observarla.
Por ejemplo, antes de lanzar un dado podemos decir que los resultados posibles son:
Pero antes de realizar el lanzamiento no sabemos cuál aparecerá.
«Aleatorio» no significa necesariamente «sin causa». Significa que, dentro del modelo utilizado y con la información disponible, el resultado individual no puede predecirse con certeza.
6.3. ¿Qué es la probabilidad?
La probabilidad es una medida matemática utilizada para expresar qué tan posible es que ocurra un determinado evento dentro de un modelo probabilístico.
Por ahora representaremos mediante la letra A aquello cuya ocurrencia nos interesa.
Su probabilidad se escribe:
Se lee: «probabilidad de A».
6.4. La probabilidad siempre pertenece a un modelo
Cuando decimos:
P(A)=0,70,
no estamos escribiendo una propiedad aislada del mundo. Estamos trabajando dentro de un conjunto de supuestos, información y reglas que constituyen un modelo.
Un modelo probabilístico es una representación matemática de una situación de incertidumbre. Especifica qué resultados consideramos posibles y cómo asignamos probabilidad a los eventos que queremos estudiar.
«Una probabilidad describe la incertidumbre de un evento dentro de un modelo. No garantiza el resultado de una realización individual.»
Esta frase contiene una de las ideas más importantes de toda la teoría de probabilidades. Conviene comprenderla lentamente.
Si escribimos P(A)=0,70, estamos diciendo que, dentro del modelo utilizado, el evento A recibe una probabilidad de 0,70. No estamos afirmando que A ya haya ocurrido, ni que esté «70 % ocurrido», ni que podamos observar físicamente un 70 % del evento.
Imagina un evento A cuya probabilidad es:
P(A)=0,70.
Cuando realizamos el experimento una sola vez, no obtenemos «0,70 de A». O bien A ocurre, o bien A no ocurre. El número 0,70 describe la incertidumbre antes de conocer el resultado; no describe una fracción física del resultado individual.
Si:
P(A)=0,90,
A tiene una probabilidad alta. Pero todavía existe:
P(no A)=0,10.
Por tanto, una realización individual en la que A no ocurra puede ser perfectamente compatible con el modelo. Un resultado poco probable no es necesariamente un resultado imposible.
Supongamos que un modelo meteorológico asigna:
P(lluvia)=0,80.
Si finalmente no llueve, no podemos concluir inmediatamente:
«El modelo estaba equivocado porque decía 80 % y no llovió». ✗
El propio modelo asignaba una probabilidad de 0,20 a que no lloviera. Para evaluar científicamente un modelo necesitamos examinar su comportamiento en muchas situaciones y comparar sistemáticamente sus predicciones probabilísticas con los resultados observados.
Dos personas pueden asignar probabilidades diferentes a un mismo evento si trabajan con información o modelos diferentes.
Un pronóstico meteorológico realizado hoy puede asignar:
P(lluvia mañana)=0,40,
y varias horas después, al incorporar nuevas observaciones atmosféricas, el modelo puede producir:
P(lluvia mañana)=0,70.
El evento futuro sigue siendo el mismo. Lo que cambió fue la información utilizada para cuantificar nuestra incertidumbre.
Para un lector universitario conviene expresarlo con mayor precisión: P(A) es una cantidad asociada al evento A dentro de un modelo probabilístico. Su función no es predecir determinísticamente cada realización, sino cuantificar matemáticamente la incertidumbre asignada a A.
Una realización individual produce un resultado particular. La probabilidad pertenece al modelo previo al resultado; el resultado observado pertenece a los datos. Confundir ambos niveles conduce a muchos errores de interpretación.
P(lluvia)=0,70
Puede llover o no llover mañana. El 70 % cuantifica la incertidumbre del pronóstico; no garantiza lluvia.
P(falla)=0,01
Un componente individual puede fallar aunque la probabilidad sea pequeña, o funcionar correctamente aunque se estudie un riesgo de falla.
P(A)=0,20
Una probabilidad de riesgo no significa que una persona esté «20 % enferma». Describe incertidumbre sobre un evento definido dentro de un modelo.
P(acierto)=0,80
Un jugador con alta probabilidad de acierto todavía puede fallar el siguiente intento. El modelo no convierte el próximo resultado en una certeza.
Si un evento tiene probabilidad 0,95 y finalmente no ocurre, ¿existe necesariamente una contradicción?
No. El modelo asignaba todavía una probabilidad de 0,05 al resultado contrario. Lo observado puede ser poco frecuente bajo el modelo sin ser imposible.
Por eso debemos comenzar a distinguir:
El fenómeno que queremos comprender.
La representación matemática que construimos.
Las observaciones obtenidas del fenómeno.
6.5. La escala fundamental de la probabilidad
Toda probabilidad se encuentra entre 0 y 1:
Nota. Elaboración propia. Los contextos científicos son reales, pero los valores numéricos mostrados son hipotéticos con fines didácticos. En todos los casos la probabilidad pertenece a la misma escala matemática de 0 a 1; lo que cambia es el significado del evento.
La recta de 0 a 1 no pertenece exclusivamente a monedas o dados. Es una estructura matemática general.
Lo que cambia de una ciencia a otra es qué representa el evento, de dónde surge la información y qué hipótesis utiliza el modelo.
6.6. Fracción, decimal y porcentaje
Una misma probabilidad puede representarse de varias maneras.
1/4
0,25
25 %
1/4 = 0,25 = 25 %
El porcentaje es especialmente útil para comunicar probabilidades, pero matemáticamente representa la misma información que el decimal correspondiente.
6.7. Ejemplo 1 · Lanzar una moneda equilibrada
Supongamos una moneda que modelamos como equilibrada.
Los dos resultados posibles son:
P=1/2=0,50=50 %
P=1/2=0,50=50 %
No hemos demostrado que toda moneda física produzca exactamente 50 % de caras. Estamos utilizando un modelo ideal de moneda equilibrada. Una moneda real puede presentar pequeñas diferencias físicas o experimentales.
6.8. Dos resultados posibles no significan 50 % para cada uno
Una de las intuiciones equivocadas más comunes en probabilidad consiste en pensar:
Esto es falso.
El número de resultados posibles no determina por sí solo cómo se distribuye la probabilidad entre ellos.
Nota. Elaboración propia. El esquema representa conceptualmente una aplicación meteorológica; no reproduce un sistema de pronóstico específico ni utiliza datos meteorológicos reales.
Este error conceptual se conoce como falacia de equiprobabilidad o, en este contexto, falacia del 50/50.
El hecho de que una situación tenga solamente dos resultados posibles no significa que ambos tengan la misma probabilidad de ocurrir.
El error consiste en razonar:
«O ocurre o no ocurre; por tanto, cada posibilidad tiene probabilidad 0,50».
Que «llueve» y «no llueve» sean las dos alternativas consideradas significa que entre ambas cubren todas las posibilidades.
P(llueve)+P(no llueve)=1.
Pero esa igualdad no obliga a:
P(llueve)=P(no llueve)=0,50. ✗
Podrían ser, por ejemplo:
0,20 y 0,80; 0,65 y 0,35; 0,01 y 0,99.
Lo obligatorio es que ambas probabilidades estén entre 0 y 1 y que sumen 1.
Moneda ideal equilibrada: asignamos 0,50 a cara y 0,50 a sello porque el modelo establece equiprobabilidad.
Lluvia de mañana: la probabilidad depende de información meteorológica y del modelo. El simple hecho de tener dos alternativas no permite calcular 0,50.
Contar cuántos resultados existen responde: «¿qué puede ocurrir?». Asignar probabilidades responde: «¿qué peso probabilístico tiene cada resultado dentro del modelo?».
6.9. Ejemplo 2 · Un dado equilibrado
Consideremos un dado de seis caras que modelamos como equilibrado.
Queremos calcular la probabilidad de obtener un 4.
Los seis resultados:
1, 2, 3, 4, 5 y 6
son equiprobables dentro del modelo.
Hay seis resultados posibles y solamente uno favorable al evento «obtener 4».
La regla:
casos favorables / casos posibles
puede utilizarse directamente cuando los resultados elementales considerados son equiprobables.
6.10. Ejemplo 3 · Bolas de colores
Una bolsa contiene cinco bolas del mismo tamaño:
3 rojas y 2 azules.
Si mezclamos adecuadamente y suponemos que cada bola individual tiene la misma posibilidad de ser extraída:
Hay solamente dos categorías de resultado: roja o azul.
60 % ≠ 40 %.
Este ejemplo confirma nuevamente que:
6.11. Probabilidad y frecuencia relativa no son lo mismo
Supongamos que repetimos muchas veces un experimento y contamos cuántas veces ocurre A.
Si:
n = número total de ensayos
f = número de veces que observamos A,
definimos la frecuencia relativa:
Pertenece al modelo probabilístico.
Describe cómo cuantificamos la incertidumbre de A dentro de ese modelo.
Se calcula a partir de observaciones realizadas.
Describe qué proporción de los ensayos realizados produjo A.
6.12. Ejemplo 4 · Frecuencia relativa
Realizamos:
n=20 lanzamientos.
Observamos:
f=12 caras.
Entonces:
h=12/20
h=0,60=60 %
Esto significa:
En esos 20 lanzamientos observados, el 60 % produjo cara.
No significa que hayamos demostrado que la probabilidad del modelo sea exactamente 0,60.
6.13. ¿Qué ocurre cuando aumentamos el número de repeticiones?
Supongamos que simulamos 500 lanzamientos de una moneda bajo un modelo con:
P(cara)=0,50.
La frecuencia relativa de caras no tiene por qué ser 0,50 desde los primeros lanzamientos. Puede subir y bajar repetidamente.
Nota. Elaboración propia. La trayectoria de la moneda contiene datos simulados con fines didácticos. Los bloques de fábrica y deporte representan aplicaciones reales mediante ejemplos esquemáticos.
En la moneda: f puede significar número de caras.
En una fábrica: f puede significar número de piezas defectuosas.
En deporte: f puede significar número de aciertos. La estructura matemática h=f/n permanece.
6.14. Estabilizarse no significa volverse exactamente igual
Cuando aumentamos mucho el número de repeticiones, la frecuencia relativa puede mostrar una tendencia a estabilizarse alrededor de la probabilidad del modelo.
Pero debemos evitar una interpretación incorrecta:
No existe esa obligación.
Incluso después de muchísimos ensayos pueden continuar existiendo pequeñas diferencias.
Además, en aplicaciones reales las condiciones pueden cambiar. Una máquina puede desgastarse, un deportista puede mejorar o empeorar y el clima puede cambiar. Por eso siempre debemos preguntarnos si el mismo modelo sigue siendo razonable.
6.15. De mediciones repetidas a preguntas probabilísticas
La probabilidad no se limita a monedas, dados y urnas.
Imaginemos que medimos repetidamente el ancho de una pieza fabricada.
Las mediciones podrían no ser exactamente iguales debido a:
En lugar de preguntar únicamente:
«¿Cuál fue la medida?»
podemos formular una pregunta diferente:
«¿Con qué probabilidad una futura medición estará dentro de cierto intervalo?»
Esta pregunta conecta directamente la metrología, la ingeniería y el control de calidad con la teoría de probabilidades.
6.16. Ejemplo 5 · Distribución observada de mediciones
Supongamos que realizamos 100 mediciones simuladas del ancho de una pieza.
Podemos agruparlas en intervalos para visualizar dónde se concentran.
Nota. Elaboración propia. Datos simulados con fines didácticos. El instrumento y la pieza son representaciones esquemáticas. El histograma describe las mediciones simuladas; todavía no se está suponiendo una distribución teórica particular.
Este tipo de razonamiento aparece en metrología, manufactura, control de calidad, laboratorios experimentales y calibración de instrumentos.
La gráfica todavía describe datos. Convertirlos en probabilidades exige proponer y justificar posteriormente un modelo.
6.17. Realidad, datos, modelo e interpretación
Una distinción fundamental para todo el curso será separar cuatro niveles.
fenómeno que queremos estudiar
observaciones obtenidas
representación matemática de la incertidumbre
conclusiones compatibles con los datos, el modelo y sus supuestos
atmósfera → observaciones → modelo → pronóstico
proceso → mediciones → modelo → riesgo de falla
población → observaciones → modelo → evaluación de riesgo
rendimiento → resultados → modelo → expectativa
Nota. Elaboración propia. Un modelo representa ciertos aspectos de la realidad; no es la realidad misma. Los cuatro contextos inferiores muestran la misma arquitectura general en diferentes campos.
6.18. Probabilidad alta no significa certeza
Supongamos:
P(A)=0,90.
Esto significa que el modelo asigna a A una probabilidad muy alta.
Sin embargo:
P(Ac)=0,10.
Nota. Representación didáctica. El mosaico no afirma que en cualquier conjunto real de exactamente 100 ensayos deban ocurrir 90 eventos A. Representa visualmente una probabilidad de 0,90.
Probable y seguro no son sinónimos.
Una probabilidad describe la incertidumbre de un evento dentro de un modelo. No garantiza el resultado de una realización individual.
Por eso, incluso un evento muy probable puede no ocurrir en una realización concreta, y un evento poco probable puede ocurrir. El resultado individual debe interpretarse dentro de la estructura completa del modelo, no como una confirmación o refutación automática de este.
Un pronóstico de alta probabilidad de lluvia, una alta confiabilidad de un componente o una alta probabilidad de acierto deportivo siguen expresando incertidumbre. Ninguna probabilidad menor que 1 garantiza por sí sola el resultado individual.
6.19. Una frecuencia observada tampoco es una garantía
Supongamos que observamos cara en 62 % de 100 lanzamientos.
Esa cifra describe la muestra obtenida:
h=0,62.
No significa automáticamente:
P(cara)=0,62. ✗
Una frecuencia relativa puede utilizarse como evidencia, pero debemos distinguir siempre lo observado de la probabilidad asignada por un modelo.
Si en una muestra de 100 piezas encontramos 4 defectuosas, la frecuencia observada de defecto es 0,04. Ese dato es evidencia sobre el proceso, pero por sí solo no demuestra que la probabilidad verdadera de defecto del proceso sea exactamente 0,04.
6.20. La falacia del jugador
Imagina una moneda equilibrada que produce:
C · C · C · C · C
Alguien afirma:
«Ahora tiene que salir sello porque ya salieron demasiadas caras».
Si el modelo establece lanzamientos independientes y la moneda continúa siendo equilibrada:
Los resultados anteriores no obligan al siguiente lanzamiento a «compensar».
6.21. ¿Para qué sirve la probabilidad?
La probabilidad permite construir modelos para situaciones de incertidumbre en numerosos campos.
Pregunta: ¿qué probabilidad existe de precipitación?
Se combinan observaciones y modelos atmosféricos para cuantificar incertidumbre.
Pregunta: ¿qué probabilidad existe de que un componente falle?
Se estudian fallas, vida útil, seguridad y mantenimiento.
Pregunta: ¿qué proporción de productos puede incumplir una especificación?
Los datos permiten vigilar y mejorar procesos industriales.
Pregunta: ¿qué probabilidad tiene determinado resultado o riesgo?
La probabilidad ayuda a interpretar evidencia y tomar decisiones bajo incertidumbre.
Pregunta: ¿qué resultados son posibles en procesos de herencia o variación?
Los modelos probabilísticos permiten estudiar resultados individuales inciertos con regularidades conocidas.
Pregunta: ¿qué probabilidad tiene un jugador o equipo de lograr determinado resultado?
Se analizan frecuencias históricas y modelos de rendimiento.
Pregunta: ¿qué probabilidad existe de error, fallo, colisión o determinada salida aleatoria?
La probabilidad interviene en algoritmos, comunicaciones, seguridad y simulación.
Pregunta: ¿qué riesgos deben considerarse y cómo pueden cuantificarse?
Se modelan eventos inciertos y sus posibles consecuencias.
Estas ciencias no utilizan «otra» probabilidad. Utilizan la misma estructura matemática, pero cambian los eventos, los datos disponibles, las hipótesis y las consecuencias de cada resultado.
6.22. Actividad experimental · Una moneda real
Material: una moneda, papel y lápiz.
1. Antes de lanzarla, escribe cuántas caras esperas aproximadamente en 20 lanzamientos.
2. Realiza los 20 lanzamientos.
3. Registra C para cara y S para sello.
4. Cuenta el número de caras f.
5. Calcula h=f/20.
6. Expresa h como decimal y porcentaje.
7. Compara tu frecuencia con 0,50.
8. Junta tus resultados con los de otros compañeros.
9. Calcula ahora la frecuencia relativa utilizando todos los lanzamientos de la clase.
10. Explica por qué las dos frecuencias no tienen obligación de ser exactamente iguales.
6.23. Después del trabajo manual: simulación en Excel
Una vez comprendido el experimento real, podemos utilizar una hoja de cálculo para realizar muchas repeticiones rápidamente.
En Excel podemos escribir:
Cada recálculo produce una simulación bajo un modelo que asigna:
P(cara)=0,50 y P(sello)=0,50.
La computadora no sustituye el razonamiento. Antes de simular debemos comprender qué estamos simulando y cuáles son las hipótesis del modelo.
6.24. ¿Por qué una frecuencia relativa siempre está entre 0 y 1?
Sea:
n = número total de ensayos
y:
f = número de veces que ocurre el evento.
Un evento no puede ocurrir un número negativo de veces:
f≥0.
Tampoco puede ocurrir más veces que el número total de ensayos:
f≤n.
Por tanto:
0≤f≤n.
Si n>0, dividimos los tres miembros entre n:
0/n≤f/n≤n/n.
Simplificamos:
0≤f/n≤1.
Como:
h=f/n,
0≤h≤1.
Esta demostración explica por qué una frecuencia relativa siempre pertenece al intervalo [0,1]. No pretende todavía construir formalmente toda la teoría axiomática de la probabilidad.
6.25. Errores frecuentes y práctica de dificultad creciente
«Si hay dos resultados posibles, cada uno tiene 50 %».
Solo ocurre si el modelo justifica equiprobabilidad.
«Una probabilidad de 80 % significa que ocurrirá».
Todavía queda 20 % para el resultado complementario.
«Después de muchas caras, ahora debe venir sello».
No, si el modelo establece lanzamientos independientes.
«La frecuencia observada es la probabilidad exacta».
Una muestra puede fluctuar.
«Probabilidad significa adivinar».
La probabilidad utiliza modelos, información y razonamiento matemático.
«50 % significa exactamente cinco éxitos en diez ensayos».
Las frecuencias observadas pueden fluctuar.
«Si ocurrió algo poco probable, el modelo necesariamente es falso».
Un resultado poco probable puede ocurrir sin contradecir automáticamente el modelo.
Una bolsa contiene 8 bolas:
6 verdes y 2 amarillas.
Todas las bolas individuales tienen la misma posibilidad de ser extraídas.
a) Calcula P(verde).
b) Calcula P(amarilla).
Ver solución
P(verde)=6/8=3/4=0,75=75 %.
P(amarilla)=2/8=1/4=0,25=25 %.
Una persona afirma:
«Mañana solamente puede llover o no llover, así que la probabilidad de lluvia es 50 %».
Explica con tus propias palabras por qué el razonamiento es incorrecto.
Ver orientación
Debes distinguir entre tener dos posibilidades y tener dos posibilidades equiprobables. El modelo meteorológico necesita información adicional para asignar las probabilidades.
Dos modelos diferentes describen un fenómeno con los mismos dos resultados:
A y no A.
El modelo 1 asigna:
P(A)=0,50.
El modelo 2 asigna:
P(A)=0,80.
¿Puede ser correcto que ambos modelos tengan exactamente los mismos resultados posibles, pero probabilidades diferentes? Explica.
Ver orientación
Sí. Conocer cuáles resultados son posibles no determina por sí solo las probabilidades. Los modelos pueden utilizar información o hipótesis diferentes. Luego habría que evaluar cuál representa mejor el fenómeno de interés.
Un modelo asigna:
P(A)=0,99.
En una realización A no ocurre.
Responde:
a) ¿Es el resultado incompatible con el modelo?
b) ¿Podemos concluir a partir de una sola observación que el modelo es incorrecto?
c) ¿Qué tipo de evidencia adicional sería necesaria para evaluar seriamente el comportamiento del modelo?
Ver orientación
a) No. El resultado contrario tenía probabilidad 0,01 y, por tanto, no era imposible dentro del modelo.
b) No. Una sola realización no permite evaluar adecuadamente una afirmación probabilística de ese tipo.
c) Debemos observar el comportamiento del modelo en muchas situaciones comparables y analizar si las probabilidades asignadas son compatibles sistemáticamente con los resultados obtenidos.
6.26. Comprueba lo aprendido, mapa conceptual y síntesis
1. Explica con tus propias palabras qué estudia la probabilidad.
2. ¿Cuál es el menor valor posible de una probabilidad?
3. ¿Cuál es el mayor?
4. Convierte 0,35 en porcentaje.
5. Convierte 72 % en número decimal.
6. ¿Por qué tener dos resultados posibles no garantiza que cada uno tenga probabilidad 0,50?
7. ¿Qué significa equiprobabilidad?
8. ¿Qué es la falacia del 50/50?
9. ¿Qué diferencia existe entre probabilidad y frecuencia relativa?
10. Si un evento tiene probabilidad 0,90, ¿es seguro que ocurrirá?
11. ¿Qué error comete quien afirma que después de cinco caras obligatoriamente debe aparecer sello?
12. ¿Qué significa que una probabilidad pertenezca a un modelo?
13. Explica la frase: «Una probabilidad describe la incertidumbre de un evento dentro de un modelo».
14. ¿Por qué P(A)=0,80 no garantiza que A ocurra en la próxima realización?
15. Si un evento de probabilidad 0,05 ocurre, ¿significa automáticamente que el modelo era incorrecto?
16. ¿Por qué una frecuencia relativa obtenida en una muestra puede diferir de la probabilidad del modelo?
17. ¿Qué diferencia existe entre realidad, datos y modelo?
18. ¿Por qué debemos indicar cuándo unos datos son simulados?
19. Nombra cuatro ciencias o actividades donde se utilice la probabilidad.
20. En control de calidad, ¿qué podrían representar f y n en h=f/n?
21. ¿Qué diferencia existe entre un gráfico de datos experimentales y un modelo probabilístico?
22. Explica por qué una aplicación real no demuestra automáticamente que determinado modelo matemático sea correcto.
Ver respuestas breves
1. Cuantifica y analiza matemáticamente situaciones de incertidumbre.
2. 0.
3. 1.
4. 35 %.
5. 0,72.
6. Porque posibilidad y equiprobabilidad son conceptos distintos.
7. Que dos o más resultados reciben la misma probabilidad dentro del modelo.
8. Creer que dos alternativas deben tener automáticamente 50 % cada una.
9. P(A) pertenece al modelo; h se calcula a partir de observaciones.
10. No. Todavía queda probabilidad 0,10 para que no ocurra.
11. La falacia del jugador.
12. Que el valor depende de los resultados considerados, la información, las reglas y los supuestos del modelo.
13. Que P(A) cuantifica nuestra incertidumbre matemática acerca de A según el modelo utilizado.
14. Porque todavía existe probabilidad 0,20 para que A no ocurra.
15. No. Un evento poco probable puede ocurrir sin contradecir automáticamente el modelo.
16. Porque una muestra finita está sujeta a fluctuaciones aleatorias.
17. Realidad es el fenómeno, datos son observaciones y modelo es una representación matemática.
18. Para no confundir una construcción didáctica con evidencia empírica real.
19. Por ejemplo: meteorología, ingeniería, medicina, biología, deporte, informática o seguros.
20. f podría ser el número de defectuosas y n el total inspeccionado.
21. El primero describe observaciones; el segundo representa matemáticamente incertidumbre bajo supuestos.
22. Porque el fenómeno debe analizarse y los supuestos del modelo deben justificarse con información y evidencia.
Un resultado pertenece al conjunto de resultados considerados por el modelo.
Dos o más resultados reciben la misma probabilidad.
Medida asignada por el modelo a un evento.
Proporción observada en una serie concreta de ensayos.
Síntesis
La probabilidad permite razonar matemáticamente acerca de situaciones de incertidumbre.
Un fenómeno aleatorio puede tener resultados posibles bien definidos aunque no sepamos cuál ocurrirá antes de observarlo.
La probabilidad de un evento A se representa mediante:
P(A).
Toda probabilidad cumple:
0≤P(A)≤1.
Puede expresarse como fracción, decimal o porcentaje.
Que existan dos resultados posibles no significa que sean equiprobables.
La probabilidad pertenece a un modelo; la frecuencia relativa:
h=f/n
se obtiene de observaciones.
Una probabilidad describe la incertidumbre de un evento dentro de un modelo. No garantiza el resultado de una realización individual.
Una realización produce un resultado concreto; la probabilidad cuantifica la incertidumbre que existía antes de conocerlo. Por eso un evento muy probable puede no ocurrir y uno poco probable puede ocurrir sin que, por ese solo hecho, exista una contradicción con el modelo.
Una probabilidad alta no es una certeza.
Una frecuencia observada tampoco es automáticamente la probabilidad exacta del fenómeno.
Hemos visto además que la probabilidad no es una matemática aislada de la realidad. La misma estructura:
evento → modelo → probabilidad
puede aparecer en:
meteorología · ingeniería · control de calidad · medicina · biología · deporte · informática · seguros.
La clave es comprender qué representa el evento en cada contexto, de dónde provienen los datos, qué supuestos utiliza el modelo y qué significa realmente la probabilidad calculada.
En otras palabras: la matemática proporciona una estructura general; la ciencia determina qué significa esa estructura en el mundo real.
La probabilidad no elimina la incertidumbre.
La convierte en algo que podemos representar, medir, contrastar con datos y utilizar para comprender fenómenos y tomar decisiones.
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Kolmogorov, A. N. (1933). Grundbegriffe der Wahrscheinlichkeitsrechnung. Springer.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Experimentos aleatorios, resultados y espacio muestral
Antes de calcular una probabilidad debemos saber exactamente qué puede ocurrir
Antes de preguntar «¿cuál es la probabilidad?», debemos responder una pregunta más básica: «¿qué consideraremos exactamente como un resultado?». Definir correctamente el experimento, la regla de registro y el espacio muestral evita ambigüedades y permite construir modelos coherentes.
6.27. Antes de calcular probabilidades debemos definir el experimento
Imagina que alguien pregunta:
«¿Cuál es la probabilidad de obtener un buen resultado?»
La pregunta todavía está incompleta.
Necesitamos saber:
La probabilidad necesita un experimento bien definido. Si no sabemos exactamente qué observamos y cómo lo registramos, tampoco sabemos sobre qué estamos calculando probabilidades.
6.28. Experimento aleatorio
Un experimento aleatorio es un procedimiento que puede realizarse bajo condiciones especificadas, cuyos resultados posibles pueden describirse, aunque antes de una realización concreta no sepamos con certeza cuál ocurrirá.
Ejemplos:
6.29. Ensayo o realización
El experimento es el procedimiento general. Cada vez que lo ejecutamos realizamos un ensayo.
Experimento: lanzar una moneda.
Ensayo: realizar un lanzamiento concreto.
En ingeniería:
Experimento: someter un fusible a una prueba de funcionamiento.
Ensayo: probar una unidad específica.
6.30. Resultado
Un ensayo concreto produce un resultado particular.
Por ejemplo:
cara
puede ser el resultado de un lanzamiento de moneda.
En una prueba de calidad:
pieza rechazada
puede ser el resultado registrado.
6.31. Resultado elemental: ω
Para representar matemáticamente un resultado individual utilizaremos, cuando sea útil, la letra griega:
Un resultado elemental es uno de los resultados individuales que el modelo decide distinguir.
«Elemental» no significa necesariamente «simple» en la vida real. Significa que, dentro del modelo que hemos definido, ese resultado se trata como una unidad que no necesitamos descomponer más.
6.32. Espacio muestral: Ω
Reunimos todos los resultados elementales considerados posibles en un conjunto llamado:
De manera informal:
El espacio muestral Ω es el conjunto de todos los resultados elementales que nuestro modelo considera posibles para el experimento definido.
Procedimiento general.
Una realización concreta del experimento.
Lo observado en un ensayo.
Resultado elemental individual.
Conjunto de todos los resultados elementales posibles.
Nota. Elaboración propia. El ejemplo electrónico es esquemático y tiene fines didácticos.
6.33. El espacio muestral depende de lo que decidimos registrar
Esta es una de las ideas más importantes de toda esta parte.
El espacio muestral no es simplemente una lista de «cosas que existen en la realidad».
Es el conjunto de resultados elementales que nuestro modelo decide distinguir de acuerdo con el experimento y con la información que hemos decidido registrar.
Una misma pieza industrial puede estudiarse de varias maneras.
¿Cumple la tolerancia?
Ω={aprobada, rechazada}
¿Qué tipo de defecto presenta?
Ω={sin defecto, bajo, alto, superficie}
¿Cuál es su diámetro?
Ω=valores posibles del diámetro
Nota. Elaboración propia. La figura muestra una aplicación conceptual de control dimensional.
6.34. Dos condiciones importantes: exhaustividad y ausencia de ambigüedad
Un espacio muestral debe construirse cuidadosamente.
Debe incluir todos los resultados elementales que el modelo considera posibles.
No debemos olvidar un resultado posible.
Cada observación debe poder registrarse de acuerdo con una regla clara.
Dos categorías no deberían confundirse porque fueron definidas de forma vaga.
6.35. Cardinalidad: ¿cuántos resultados contiene Ω?
Cuando un espacio muestral tiene un número finito de resultados, podemos contar cuántos elementos contiene.
Utilizaremos la notación:
Se lee: cardinalidad de Ω.
Por ejemplo, para un dado de seis caras:
Ω={1,2,3,4,5,6}
|Ω|=6.
6.36. Ejemplo 1 · Una moneda
Si registramos únicamente qué lado queda hacia arriba:
Ω={C,S}
donde:
C = cara S = sello
|Ω|=2.
6.37. Ejemplo 2 · Dos lanzamientos de moneda
Ahora realizamos dos lanzamientos y registramos el resultado de cada uno.
Debemos conservar el orden.
Ω={CC,CS,SC,SS}
|Ω|=4.
Porque hemos decidido registrar cuál fue el primer lanzamiento y cuál fue el segundo. CS significa «primero cara y luego sello»; SC significa «primero sello y luego cara».
6.38. Los árboles ayudan a no olvidar resultados
Un árbol permite representar las decisiones o resultados posibles etapa por etapa.
Para dos lanzamientos:
primer lanzamiento → segundo lanzamiento.
6.39. La misma estructura aparece en sistemas reales
Las monedas son útiles porque permiten estudiar estructuras simples. Pero esa misma estructura puede aparecer en ingeniería.
Nota. Elaboración propia. El ejemplo de sensores es esquemático. No se están asignando todavía probabilidades a los cuatro resultados.
6.40. Ejemplo 3 · Dos dados y pares ordenados
Lanzamos dos dados y registramos:
(resultado del primer dado, resultado del segundo dado).
Un posible resultado elemental es:
ω=(2,5).
Significa:
primer dado = 2, segundo dado = 5.
(2,5) y (5,2) son resultados diferentes, porque el primer número corresponde al primer dado y el segundo al segundo dado.
Nota. Elaboración propia.
6.41. Producto cartesiano: combinar posibilidades
Si el primer dado puede producir:
Ω₁={1,2,3,4,5,6}
y el segundo:
Ω₂={1,2,3,4,5,6},
el espacio de pares ordenados puede escribirse:
El símbolo × indica aquí un producto cartesiano: todas las combinaciones ordenadas posibles entre un elemento de Ω₁ y uno de Ω₂.
Nota. Elaboración propia.
6.42. Dos dados: ¿por qué hay 36 resultados?
Cada uno de los 6 resultados del primer dado puede combinarse con cada uno de los 6 resultados del segundo.
6×6=36.
Por tanto:
|Ω|=36.
6.43. ¿Por qué se multiplican las cardinalidades en un producto cartesiano finito?
Supongamos que:
|Ω₁|=m
y:
|Ω₂|=n.
Tomemos el primer elemento de Ω₁. Puede formar un par con cada uno de los n elementos de Ω₂. Por tanto, produce n pares.
El segundo elemento de Ω₁ también produce n pares. Lo mismo ocurre con cada uno de los m elementos de Ω₁.
Tenemos entonces m grupos, cada uno con n pares:
n+n+…+n
donde n aparece m veces.
|Ω₁×Ω₂|=m·n.
Esta propiedad explica por qué dos dados con seis resultados posibles cada uno generan 6×6=36 pares ordenados.
6.44. Si registramos la suma, el espacio muestral cambia
Hasta ahora registramos el par:
(primer dado, segundo dado).
Pero podríamos decidir registrar solamente:
la suma de los dos dados.
Entonces los valores posibles son:
Ω={2,3,4,5,6,7,8,9,10,11,12}.
Ahora:
|Ω|=11.
La realidad física —dos dados— es la misma. Lo que cambió fue qué decidimos registrar.
Nota. Elaboración propia. Cada celda superior corresponde a un par ordenado de los dos dados.
6.45. Las once sumas posibles no son equiprobables
La suma 2 solamente puede obtenerse mediante:
(1,1).
En cambio, la suma 7 puede obtenerse mediante:
(1,6), (2,5), (3,4), (4,3), (5,2), (6,1).
Por tanto, aunque haya 11 valores posibles de la suma, no debemos asignar automáticamente:
1/11 a cada suma. ✗
1
2
3
4
5
6
5
4
3
2
1
Que varios valores sean posibles no implica que tengan la misma probabilidad. Debemos examinar la estructura que produce esos valores.
6.46. Espacios muestrales finitos
Un espacio muestral es finito cuando contiene un número finito de resultados elementales.
Ejemplos:
Ω={C,S}
Ω={1,2,3,4,5,6}.
También puede ser finito un experimento de ingeniería:
Ω={funciona, falla}.
6.47. Espacios infinitos numerables
En algunos experimentos podemos tener:
0,1,2,3,4,…
sin un último valor.
Por ejemplo:
número de llamadas que llegan a una central durante cierto período.
El espacio puede escribirse:
Ω={0,1,2,3,…}.
Es infinito, pero sus resultados pueden enumerarse uno tras otro.
6.48. Espacios continuos idealizados
En otras situaciones utilizamos un modelo en el que el resultado puede variar continuamente dentro de un intervalo.
Por ejemplo, si X representa un tiempo idealizado de duración entre 0 y 10 segundos:
Ω={x : 0≤x≤10 s}.
Entre 4 s y 5 s existen, matemáticamente, muchos valores posibles:
4,1 s; 4,01 s; 4,001 s; 4,0001 s; …
Ejemplo:
{aprobada, rechazada}
Aplicación: control de calidad.
Ejemplo:
{0,1,2,3,…}
Aplicación: conteo de llamadas, fallas o partículas detectadas.
Ejemplo:
0≤t≤10 s
Aplicación: tiempo, longitud, masa, voltaje o temperatura.
Nota. Elaboración propia.
6.49. Fenómeno continuo y registro del instrumento no son lo mismo
Esta distinción es especialmente importante en medición.
Podemos utilizar un modelo continuo para una magnitud física, pero el instrumento registra valores con una resolución limitada.
Por ejemplo, un cronómetro digital con resolución:
0,01 s
puede mostrar:
4,26 s; 4,27 s; 4,28 s; …
pero no mostrará directamente:
4,276381… s.
Nota. Elaboración propia. El ejemplo es conceptual. La representación continua pertenece al modelo de la magnitud; el registro depende de la resolución del instrumento.
Esta distinción evita una confusión frecuente: que una variable se modele como continua no significa que un instrumento real pueda registrar infinitos decimales.
El instrumento transforma el fenómeno en datos con una determinada resolución.
6.50. ¿Dónde se utiliza el concepto de espacio muestral?
Ω puede representar estados de funcionamiento, tipos de falla o resultados de ensayos.
Ω puede representar símbolos recibidos, errores o estados de transmisión.
Ω puede representar valores posibles de una medición según el modelo utilizado.
Ω puede representar resultados de pruebas o estados clínicos definidos para un estudio.
Ω puede representar tiempos, posiciones, conteos o resultados de detección.
Ω puede representar salidas posibles de un algoritmo, estados o eventos del sistema.
¿Qué información necesitamos conservar para responder la pregunta que estamos investigando? La respuesta a esa pregunta ayuda a decidir qué consideraremos un resultado elemental.
6.51. Actividad de modelación y exploración con hoja de cálculo
Una máquina produce piezas cuyo diámetro se mide al finalizar el proceso.
Diseña tres experimentos diferentes:
A. registrar únicamente «aceptada» o «rechazada».
B. registrar cuál tipo de defecto aparece.
C. registrar el diámetro medido.
Para cada caso:
1. Describe el experimento.
2. Define un ensayo.
3. Da un ejemplo de ω.
4. Propón Ω.
5. Decide si Ω es finito, numerable o se modelaría como continuo.
6. Explica por qué los tres espacios muestrales son distintos aunque se estudie la misma producción.
También podemos usar una hoja de cálculo para generar pares de dados.
En Excel:
primer dado
segundo dado
Después podemos calcular la suma de ambas celdas y observar qué valores aparecen con mayor frecuencia.
La simulación debe realizarse después de haber construido manualmente Ω. El software acelera la experimentación; no sustituye la definición del modelo.
6.52. Comprueba lo aprendido, mapa conceptual y síntesis
1. ¿Qué es un experimento aleatorio?
2. ¿Qué diferencia existe entre experimento y ensayo?
3. ¿Qué representa ω?
4. ¿Qué representa Ω?
5. ¿Por qué el espacio muestral depende de la regla de registro?
6. ¿Qué significa que Ω sea exhaustivo?
7. ¿Qué significa |Ω|?
8. Construye Ω para un lanzamiento de un dado.
9. Construye Ω para dos lanzamientos de moneda.
10. ¿Por qué CS y SC son resultados diferentes?
11. ¿Cuántos pares ordenados produce el lanzamiento de dos dados?
12. Explica qué significa Ω₁×Ω₂.
13. Si dos dados producen 36 pares, ¿por qué solamente existen 11 sumas posibles?
14. ¿Por qué las 11 sumas no son equiprobables?
15. Da un ejemplo de espacio muestral finito.
16. Da un ejemplo de espacio infinito numerable.
17. Da un ejemplo de espacio continuo idealizado.
18. ¿Puede una magnitud modelarse como continua aunque el instrumento registre dos decimales?
19. Explica la diferencia entre fenómeno físico, resultado registrado y espacio muestral.
20. Una pieza puede clasificarse como aprobada/rechazada o medirse en milímetros. ¿Por qué esos experimentos generan Ω diferentes?
21. ¿Qué información conserva un par ordenado?
22. Explica con tus palabras la frase: «El espacio muestral no está dentro del objeto; pertenece al experimento y al modelo que hemos definido».
Ver respuestas breves
1. Procedimiento con resultados posibles definidos cuyo resultado concreto no conocemos de antemano.
2. El experimento es el procedimiento general; el ensayo es una realización concreta.
3. Un resultado elemental.
4. El conjunto de todos los resultados elementales considerados posibles.
5. Porque cambiar lo que registramos cambia qué resultados decidimos distinguir.
6. Que incluye todos los resultados considerados posibles.
7. Número de elementos de Ω cuando tiene sentido contarlos.
8. {1,2,3,4,5,6}.
9. {CC,CS,SC,SS}.
10. Porque se conserva el orden de los lanzamientos.
11. 36.
12. Todos los pares ordenados formados tomando un elemento de Ω₁ y uno de Ω₂.
13. Diferentes pares pueden producir la misma suma.
14. Porque no todas las sumas pueden obtenerse mediante el mismo número de pares.
15. Por ejemplo {funciona,falla}.
16. Número de llamadas: {0,1,2,3,…}.
17. Tiempo idealizado dentro de un intervalo.
18. Sí. El modelo de la magnitud y la resolución del instrumento son cuestiones diferentes.
19. El fenómeno ocurre en la realidad; el instrumento u observador registra información; Ω describe matemáticamente los resultados que el modelo decide distinguir.
20. Porque una regla registra categorías y la otra registra una magnitud.
21. Conserva qué resultado corresponde a cada posición o etapa.
22. Ω depende de cómo definimos el experimento y qué información decidimos conservar, no simplemente de todas las propiedades físicas del objeto.
Síntesis
Antes de calcular probabilidades debemos definir con precisión el experimento.
Cada realización concreta del experimento es un ensayo.
Un resultado elemental puede representarse mediante:
ω.
El conjunto de todos los resultados elementales considerados posibles forma:
Ω.
El espacio muestral no es simplemente una colección de todas las propiedades que existen en un objeto o fenómeno.
Es el conjunto de resultados que hemos decidido distinguir según la pregunta científica, el procedimiento experimental y la regla de registro.
Por eso una misma realidad física puede originar diferentes espacios muestrales.
Un espacio muestral puede ser:
finito · infinito numerable · continuo idealizado.
Cuando combinamos dos conjuntos finitos de posibilidades, el producto cartesiano permite construir todos los pares ordenados:
Ω=Ω₁×Ω₂.
Si:
|Ω₁|=m y |Ω₂|=n,
entonces:
|Ω₁×Ω₂|=m·n.
Los pares ordenados conservan información sobre qué resultado corresponde a cada etapa.
Cuando transformamos esa información —por ejemplo, registrando solamente la suma de dos dados— diferentes resultados elementales pueden producir el mismo valor registrado.
En medición debemos además distinguir entre una magnitud modelada como continua y los valores que un instrumento real puede registrar debido a su resolución.
En síntesis: definir correctamente Ω es decidir qué información del fenómeno conservará nuestro modelo.
Antes de preguntar «¿qué probabilidad tiene?»
debemos poder responder con precisión: «¿cuáles son los resultados que nuestro experimento considera posibles?»
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Eventos o sucesos
De todos los resultados posibles a las preguntas que realmente queremos responder
El espacio muestral Ω nos dice qué resultados pueden ocurrir. Sin embargo, muchas preguntas no se refieren a un único resultado. Podemos preguntar si salió un número par, si una medición quedó fuera de tolerancia, si una temperatura superó cierto límite o si ocurrió al menos una de varias condiciones. Cada pregunta selecciona dentro de Ω los resultados que la hacen verdadera. Ese conjunto de resultados constituye un evento.
6.53. Del resultado al evento
Consideremos nuevamente un dado de seis caras.
Ω={1,2,3,4,5,6}
Supongamos que realizamos un lanzamiento y obtenemos:
4.
El número 4 es el resultado observado.
Pero quizá nuestra pregunta no era simplemente:
«¿Qué número salió?»
Tal vez queríamos responder:
«¿Se obtuvo un número par?»
Los resultados del dado que hacen verdadera esta afirmación son:
2, 4 y 6.
Por tanto, la pregunta selecciona dentro de Ω el conjunto:
{2,4,6}.
Un evento puede imaginarse como una pregunta que actúa como filtro: de todos los resultados posibles conserva únicamente aquellos que responden «sí».
Ω={1,2,3,4,5,6}
Pregunta: ¿el resultado es par?
no
sí
no
sí
no
sí
Ω={bajo, dentro, alto}
Pregunta: ¿está fuera de tolerancia?
sí
no
sí
Nota. Elaboración propia. La aplicación de control dimensional es esquemática y tiene fines didácticos.
6.54. Definición de evento
Un evento o suceso es un conjunto de resultados elementales del espacio muestral. En lenguaje matemático, un evento es un subconjunto de Ω.
Si:
Ω={1,2,3,4,5,6}
y definimos:
A = «obtener un número par»,
entonces:
A={2,4,6}.
Todos los elementos de A pertenecen a Ω. Por ello escribimos:
6.55. ¿Cuándo ocurre un evento?
Sea:
A={2,4,6}.
Lanzamos el dado y observamos:
ω=4.
Como 4 pertenece al conjunto A:
4 ∈ A,
decimos que el evento A ocurrió.
Si en cambio observamos:
ω=5,
entonces:
5 ∉ A,
y A no ocurrió.
Un evento A ocurre en una realización concreta exactamente cuando el resultado elemental observado ω pertenece a A.
Relaciona un elemento con un conjunto.
Relaciona un conjunto con otro conjunto.
Nota. Elaboración propia. Un resultado pertenece a un evento; un evento es subconjunto del espacio muestral.
Es correcto escribir:
4 ∈ A y A ⊆ Ω.
Un resultado elemental es un elemento; un evento es un conjunto de resultados.
6.56. Evento simple
Un evento simple contiene un único resultado elemental.
Por ejemplo:
A = «obtener 5».
Entonces:
A={5}.
resultado elemental
evento simple
6.57. Evento compuesto
Un evento compuesto contiene dos o más resultados elementales.
En el dado, definamos:
B = «obtener un número mayor que 3».
Entonces:
B={4,5,6}.
{3}
{2,4,6}
{1,2}
Ω
∅
6.58. Evento seguro
Consideremos:
Ω={1,2,3,4,5,6}.
El evento:
«obtener un número entre 1 y 6»
contiene todos los resultados posibles.
Se llama seguro porque, cualquiera que sea el resultado del ensayo, pertenecerá a este evento.
6.59. Evento imposible
Si lanzamos un dado ordinario de seis caras, consideremos:
«obtener 9».
Ningún resultado de Ω satisface esa condición.
El símbolo ∅ representa el conjunto vacío: un conjunto que no contiene ningún resultado.
«Seguro» e «imposible» siempre deben interpretarse respecto del experimento y del espacio muestral que hemos definido.
6.60. Complemento de un evento: Ac
Supongamos:
Ω={1,2,3,4,5,6}
y:
A={2,4,6}.
El complemento de A contiene todos los resultados de Ω que no pertenecen a A.
Ac={1,3,5}.
Podemos leer:
Ac = «no A».
{2,4,6}
{1,3,5}
Clasificamos una medición respecto de sus límites de tolerancia.
dentro de tolerancia
fuera de tolerancia
Nota. Elaboración propia. La clasificación metrológica es esquemática y se usa para mostrar la estructura de complemento.
6.61. Unión de eventos: A ∪ B
Sean:
A={2,4,6}
B={4,5,6}.
La unión reúne todos los resultados que pertenecen a A, a B o a ambos.
A ∪ B={2,4,5,6}.
Se lee:
«A unión B»
o, en lenguaje cotidiano:
«A o B».
A ∪ B incluye los resultados que pertenecen solo a A, solo a B y también los que pertenecen simultáneamente a ambos.
Nota. Elaboración propia. El sistema de supervisión es un ejemplo hipotético con fines didácticos.
6.62. Intersección de eventos: A ∩ B
Utilicemos los mismos eventos:
A={2,4,6}
B={4,5,6}.
La intersección contiene solamente los resultados que pertenecen simultáneamente a A y a B.
A ∩ B={4,6}.
Puede leerse:
«A y B».
Nota. Elaboración propia. La región central representa simultaneidad lógica, no una magnitud física adicional.
6.63. Diferencia de eventos: A \ B
La diferencia:
A \ B
contiene los resultados que pertenecen a A pero no pertenecen a B.
Con:
A={2,4,6} B={4,5,6},
obtenemos:
A \ B={2}.
Puede leerse:
«A pero no B»
o:
«A y no B».
Nota. Elaboración propia. Aplicación hipotética con fines didácticos.
6.64. Traducir entre lenguaje cotidiano y lenguaje de eventos
Una habilidad fundamental consiste en transformar una frase en una operación entre conjuntos.
A ∪ B
A ∩ B
Ac
A \ B
A ∩ B=∅
A ∪ B=Ω
6.65. Ejemplo guiado · Un sistema de supervisión industrial
Consideremos un modelo hipotético de supervisión de una máquina.
Definimos:
la temperatura supera el límite establecido.
la vibración supera el límite establecido.
Entonces:
al menos una de las dos variables supera su límite.
ambas variables superan sus límites.
la temperatura no supera el límite.
la temperatura supera el límite, pero la vibración no.
A y B no son la temperatura ni la vibración mismas. Son eventos definidos a partir de criterios sobre esas magnitudes. Cambiar el umbral de alarma cambiaría qué observaciones pertenecen a cada evento.
6.66. Eventos mutuamente excluyentes, disjuntos o incompatibles
Consideremos:
A = «obtener un número par» = {2,4,6}
B = «obtener un número impar» = {1,3,5}.
No existe ningún resultado que pertenezca simultáneamente a los dos.
A ∩ B=∅.
Dos eventos son mutuamente excluyentes, disjuntos o incompatibles cuando no pueden ocurrir simultáneamente. Matemáticamente, su intersección es vacía.
Nota. Elaboración propia. La clasificación de defectos es hipotética.
6.67. Eventos exhaustivos
Un conjunto de eventos es exhaustivo cuando entre todos cubren completamente el espacio muestral.
Por ejemplo:
A={1,2}
B={3,4}
C={5,6}.
Entonces:
A ∪ B ∪ C=Ω.
Entre A, B y C no queda ningún resultado de Ω sin clasificar.
6.68. Partición del espacio muestral
Una partición de Ω divide el espacio muestral en partes que cumplen simultáneamente dos condiciones:
Ningún resultado pertenece simultáneamente a dos partes distintas.
Todo resultado del espacio muestral pertenece a alguna de las partes.
En forma conceptual:
incompatibles entre sí + exhaustivos = partición.
Nota. Elaboración propia. Clasificación hipotética para mostrar el concepto de partición.
6.69. Incompatibles, exhaustivos y partición no significan lo mismo
No comparten resultados.
intersección vacía
Entre todos cubren Ω.
unión = Ω
Cumple ambas propiedades.
no se superponen + cubren Ω
Error 1: creer que si dos eventos son incompatibles, necesariamente son complementarios.
Error 2: creer que si varios eventos son exhaustivos, necesariamente son incompatibles.
6.70. Aplicación · Clasificar mediciones mediante una partición
Supongamos que en un proceso industrial una magnitud se compara con dos límites:
Linf y Lsup.
Podemos clasificar cada resultado x mediante:
x<Linf
Linf≤x≤Lsup
x>Lsup
Bajo estas definiciones:
ningún valor puede pertenecer a dos categorías al mismo tiempo,
y todo valor pertenece a una de las tres.
Por tanto:
{A,B,C}
forma una partición del espacio muestral definido por el modelo.
Debemos definir con precisión qué ocurre exactamente en Linf y Lsup. Si las fronteras se asignaran ambiguamente a dos categorías, dejaríamos de tener una partición bien definida.
6.71. ¿Qué ocurre cuando negamos una unión o una intersección?
Consideremos la afirmación:
«ocurre A o B».
Para que esta afirmación sea falsa, no debe ocurrir A y tampoco debe ocurrir B.
(A ∪ B)c=Ac ∩ Bc.
Ahora consideremos:
«ocurren A y B».
Para que esta afirmación sea falsa basta con que no ocurra A, no ocurra B o no ocurra ninguno.
(A ∩ B)c=Ac ∪ Bc.
Estas dos relaciones reciben el nombre de leyes de De Morgan.
Nota. Elaboración propia. Las dos leyes describen equivalencias entre conjuntos, no reglas aproximadas.
6.72. Demostración de las leyes de De Morgan
Demostraremos las dos igualdades examinando un resultado elemental cualquiera ω.
(A ∪ B)c=Ac∩Bc
Supongamos:
ω ∈ (A ∪ B)c.
Esto significa que ω no pertenece a A ∪ B.
La unión contiene todo resultado que pertenece a A, a B o a ambos. Por tanto, quedar fuera de la unión significa simultáneamente:
ω ∉ A y ω ∉ B.
Por definición de complemento:
ω ∈ Ac y ω ∈ Bc.
Por tanto:
ω ∈ Ac ∩ Bc.
Como este razonamiento vale para cualquier resultado ω, ambos conjuntos contienen exactamente los mismos resultados. Así:
(A ∪ B)c=Ac∩Bc.
(A ∩ B)c=Ac∪Bc
Supongamos:
ω ∈ (A ∩ B)c.
Esto significa que ω no pertenece simultáneamente a A y a B.
En consecuencia, al menos una de las siguientes afirmaciones debe cumplirse:
ω ∉ A o ω ∉ B.
Equivalentemente:
ω ∈ Ac o ω ∈ Bc.
Es decir:
ω ∈ Ac ∪ Bc.
Como el razonamiento vale para cualquier resultado elemental:
(A ∩ B)c=Ac∪Bc.
6.73. Ejemplo · De Morgan en un sistema de alarmas
Definamos:
A: la temperatura supera el límite.
B: la vibración supera el límite.
El evento:
A ∪ B
significa que aparece al menos una de las dos condiciones.
Su complemento:
(A ∪ B)c
significa:
«no hay temperatura alta y tampoco hay vibración alta».
De Morgan nos permite escribir:
(A ∪ B)c=Ac∩Bc.
La identidad matemática coincide con la lógica del sistema: negar «alguna alarma está activa» equivale a afirmar «ninguna de las dos alarmas está activa».
6.74. ¿Cuántos eventos pueden construirse?
Supongamos que un espacio muestral finito contiene:
n resultados elementales.
Para construir un evento debemos decidir, para cada resultado:
Cada uno de los n resultados ofrece dos decisiones. Por tanto, el número total de subconjuntos es:
Como cada subconjunto puede representar un evento, un espacio muestral finito con n resultados puede formar:
2n eventos distintos.
Este conteo incluye:
∅ y Ω.
6.75. Ejemplo · Un espacio muestral con tres resultados
Sea:
Ω={a,b,c}.
Como:
|Ω|=3,
podemos construir:
23=8
subconjuntos:
6.76. Actividad de modelación · Control de calidad
Una empresa clasifica el resultado de la inspección de una pieza mediante:
Ω={correcta, defecto dimensional, defecto superficial, defecto eléctrico}.
Define:
A: la pieza presenta un defecto dimensional o superficial.
B: la pieza presenta un defecto eléctrico.
Responde:
1. Escribe A como conjunto.
2. Escribe B como conjunto.
3. Construye A ∪ B.
4. Construye A ∩ B.
5. Construye Ac.
6. ¿Son A y B incompatibles bajo esta regla de clasificación?
7. ¿A y B son exhaustivos?
8. Explica qué información adicional necesitarías para que varias categorías formen una partición completa.
Ver orientación
A={defecto dimensional, defecto superficial}.
B={defecto eléctrico}.
A∪B contiene los tres tipos de defecto.
A∩B=∅ bajo este modelo, porque cada resultado se está registrando en una única categoría.
Ac={correcta, defecto eléctrico}.
A y B son incompatibles, pero no exhaustivos porque no incluyen «correcta».
Para formar una partición completa debemos cubrir todas las categorías de Ω sin permitir superposición.
6.77. Práctica fundamental · Un dado
Sea:
Ω={1,2,3,4,5,6}.
Define:
A = «obtener un número par».
B = «obtener un número mayor que 3».
Resuelve:
1. Escribe A.
2. Escribe B.
3. Construye A ∪ B.
4. Construye A ∩ B.
5. Construye Ac.
6. Construye Bc.
7. Construye A \ B.
8. Construye B \ A.
9. ¿Son A y B incompatibles?
10. Comprueba una ley de De Morgan.
Ver respuestas
A={2,4,6}.
B={4,5,6}.
A∪B={2,4,5,6}.
A∩B={4,6}.
Ac={1,3,5}.
Bc={1,2,3}.
A\B={2}.
B\A={5}.
No son incompatibles porque A∩B={4,6}.
Por ejemplo: (A∪B)c={1,3} y Ac∩Bc={1,3}.
6.78. Reto · Dos dados
Se lanzan dos dados y cada resultado elemental se representa mediante:
(dado 1, dado 2).
Define:
A: «la suma es menor que 6».
B: «al menos uno de los dados muestra 1».
Responde:
1. Escribe todos los resultados de A.
2. Escribe todos los resultados de B.
3. Obtén A ∩ B.
4. Obtén A ∪ B.
5. Expresa Ac en palabras.
6. Expresa Bc en palabras.
7. ¿Son A y B incompatibles?
8. Explica con palabras qué significa A ∩ B.
9. Explica por qué para resolver correctamente el problema debemos conservar el orden de los dos dados.
6.79. ¿Dónde se utilizan los eventos?
El lenguaje de eventos permite transformar preguntas científicas y tecnológicas en conjuntos bien definidos.
«ocurre una falla», «se supera un límite», «se activan dos alarmas».
«la medición queda dentro del intervalo establecido» o «queda fuera».
«el sistema responde», «aparece un error», «se cumplen simultáneamente dos condiciones».
«una prueba cumple un criterio definido» o «aparecen determinadas características».
«se registra precipitación», «la temperatura supera cierto valor» o «ocurren ambas condiciones».
«la pieza cumple», «presenta defecto» o «pertenece a determinada categoría».
En cada aplicación, el evento debe definirse mediante una regla suficientemente clara para decidir si un resultado observado pertenece o no pertenece a él.
6.80. Errores frecuentes
Confundir un resultado con un evento.
4 es un resultado; {2,4,6} es un evento.
Confundir ∈ con ⊆.
Un resultado pertenece a un evento; un evento es subconjunto de Ω.
Interpretar «A o B» como si excluyera automáticamente «ambos».
A ∪ B incluye también A ∩ B.
Confundir unión e intersección.
Unión = al menos uno. Intersección = ambos.
Creer que incompatible significa complementario.
Dos eventos pueden no compartir resultados y, aun así, no cubrir todo Ω.
Creer que exhaustivo significa necesariamente incompatible.
Para formar una partición deben cumplirse ambas condiciones.
6.81. Comprueba lo aprendido
1. ¿Qué es un evento?
2. ¿Qué significa A ⊆ Ω?
3. ¿Qué diferencia existe entre ω ∈ A y A ⊆ Ω?
4. ¿Qué es un evento simple?
5. ¿Qué es un evento compuesto?
6. ¿Cuál es el evento seguro?
7. ¿Cuál es el evento imposible?
8. ¿Qué contiene Ac?
9. ¿Qué significa A ∪ B?
10. ¿Qué significa A ∩ B?
11. ¿Qué contiene A \ B?
12. ¿Cuándo dos eventos son incompatibles?
13. ¿Qué significa que varios eventos sean exhaustivos?
14. ¿Qué dos condiciones debe cumplir una partición?
15. Escribe las dos leyes de De Morgan.
16. Si |Ω|=5, ¿cuántos eventos distintos pueden construirse?
17. Explica por qué dos eventos incompatibles no tienen que ser complementarios.
18. Explica por qué eventos exhaustivos pueden superponerse.
19. En un sistema de sensores, A significa «temperatura alta» y B «vibración alta». Traduce A \ B al lenguaje del contexto.
20. En el mismo sistema, traduce (A ∪ B)c.
21. Una medición se clasifica como «baja», «dentro» o «alta». ¿Qué condiciones deben cumplir esas categorías para constituir una partición?
22. Explica con tus palabras por qué un evento puede considerarse una pregunta formulada sobre Ω.
Ver respuestas breves
1. Un subconjunto del espacio muestral formado por los resultados que satisfacen una condición.
2. Todos los elementos de A pertenecen a Ω.
3. ω∈A relaciona un elemento con un conjunto; A⊆Ω relaciona dos conjuntos.
4. Evento con un único resultado elemental.
5. Evento que contiene dos o más resultados.
6. Ω.
7. ∅.
8. Los resultados de Ω que no pertenecen a A.
9. Ocurre A, B o ambos.
10. Ocurren simultáneamente A y B.
11. Los resultados que están en A pero no en B.
12. Cuando A∩B=∅.
13. Que entre todos cubren Ω.
14. No superponerse y cubrir completamente Ω.
15. (A∪B)c=Ac∩Bc y (A∩B)c=Ac∪Bc.
16. 25=32.
17. Porque pueden existir resultados de Ω que no pertenezcan a ninguno de los dos.
18. Exhaustividad solamente exige cubrir Ω; no exige que las partes sean disjuntas.
19. Temperatura alta pero vibración no alta.
20. No hay temperatura alta y tampoco vibración alta.
21. Cada resultado debe caer exactamente en una de las tres categorías, sin superposición y sin quedar fuera.
22. Porque la pregunta selecciona precisamente los resultados de Ω que hacen verdadera una condición.
6.82. Mapa conceptual y síntesis
A ∪ B
«A o B»
A ∩ B
«A y B»
Ac
«no A»
A \ B
«A pero no B»
no se superponen
cubren Ω
cumple ambas condiciones
Nota. Elaboración propia.
Síntesis
El espacio muestral Ω contiene todos los resultados elementales que nuestro modelo considera posibles.
Un evento selecciona algunos de esos resultados de acuerdo con una pregunta o condición:
A ⊆ Ω.
Un resultado observado pertenece o no pertenece al evento:
ω ∈ A o ω ∉ A.
Un evento simple contiene un único resultado; un evento compuesto contiene varios.
El evento seguro es:
Ω,
mientras que el evento imposible es:
∅.
El complemento Ac contiene los resultados que no pertenecen a A.
La unión:
A ∪ B
representa que ocurre A, B o ambos.
La intersección:
A ∩ B
representa que ocurren simultáneamente A y B.
La diferencia:
A \ B
contiene los resultados que están en A pero no en B.
Los eventos incompatibles no comparten resultados. Los eventos exhaustivos cubren todo Ω. Una partición cumple simultáneamente ambas propiedades.
Las leyes de De Morgan establecen:
(A ∪ B)c=Ac∩Bc
(A ∩ B)c=Ac∪Bc.
Si un espacio muestral finito contiene n resultados elementales, puede formar:
2n
subconjuntos y, por tanto, 2n eventos posibles.
El espacio muestral responde: «¿qué puede ocurrir?»
El evento responde: «¿cuáles de esos resultados satisfacen la condición que me interesa?»
Esta distinción transforma preguntas del mundo real en objetos matemáticos que podemos describir y analizar con precisión.
Ω contiene las posibilidades.
Los eventos convierten esas posibilidades en preguntas matemáticamente precisas.
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
¿De dónde sale una probabilidad?
Equiprobabilidad · evidencia experimental · modelos
Calcular una probabilidad no consiste simplemente en contar posibilidades
En las partes anteriores aprendimos a definir un experimento, construir su espacio muestral y describir eventos. Ahora aparece una pregunta fundamental:
¿qué justifica el número que asignamos como probabilidad?
A veces podemos apoyarnos en resultados igualmente probables; otras veces necesitamos observar repetidamente el fenómeno; y en situaciones más complejas debemos construir un modelo utilizando conocimiento científico, datos e hipótesis. El mismo símbolo P(A) puede surgir de caminos distintos.
6.83. El mismo símbolo P(A), tres preguntas diferentes
Observa estas tres afirmaciones:
Evento A: obtener un 4.
P(A)=1/6
Evento B: pieza defectuosa.
P(B)≈0,027
Evento C: lluvia mañana.
P(C)=0,70
Los tres números están en la escala de 0 a 1. Sin embargo, la pregunta importante es:
¿Por qué 1/6? · ¿Por qué 0,027? · ¿Por qué 0,70?
Una respuesta científica no puede limitarse a decir:
«Porque esa es la probabilidad».
Debemos poder explicar de dónde salió el número.
6.84. Toda asignación de probabilidad necesita un fundamento
Una probabilidad no aparece simplemente porque escribimos P(A).
Necesitamos alguna razón que justifique la asignación.
En esta parte distinguiremos tres caminos especialmente importantes:
1. La estructura del modelo justifica resultados equiprobables.
2. Las observaciones repetidas proporcionan evidencia empírica.
3. Un modelo científico combina mecanismo, conocimiento, datos e hipótesis.
Nota. Elaboración propia. Los datos industriales son hipotéticos con fines didácticos. El tercer camino representa de manera conceptual la construcción de un modelo científico.
6.85. Primer camino: equiprobabilidad
Decimos que varios resultados elementales son equiprobables cuando el modelo les asigna la misma probabilidad.
Por ejemplo, en un dado ideal equilibrado:
Ω={1,2,3,4,5,6}.
El modelo supone que ninguna cara está privilegiada.
Por tanto:
P(1)=P(2)=P(3)=P(4)=P(5)=P(6)=1/6.
No basta con que los resultados sean:
posibles.
Para usar directamente la regla clásica necesitamos que sean:
igualmente probables.
El resultado pertenece a Ω.
No dice todavía qué probabilidad tiene.
Dos o más resultados reciben exactamente el mismo peso probabilístico.
Es una condición adicional del modelo.
Contar resultados solo permite calcular probabilidades directamente cuando esa equiprobabilidad está justificada.
6.86. La regla clásica de probabilidad
Si tenemos un espacio muestral finito y todos sus resultados elementales son equiprobables, podemos calcular la probabilidad de un evento A contando resultados.
número de resultados elementales que hacen ocurrir A.
número total de resultados elementales posibles.
Esta regla suele expresarse como:
probabilidad = casos favorables / casos posibles.
Los casos posibles que estamos contando deben ser equiprobables. Sin esa condición, la división puede producir una respuesta incorrecta.
¿Por qué aparece |A| / |Ω| en un modelo finito equiprobable?
Supongamos que Ω contiene:
N resultados elementales.
Como son equiprobables, cada uno recibe la misma probabilidad. Llamemos q a ese valor común.
Entre todos los resultados de Ω deben reunir la totalidad de la probabilidad:
Nq=1.
Por tanto:
q=1/N.
Ahora supongamos que el evento A contiene:
m resultados elementales.
Como cada uno aporta 1/N:
P(A)=m·(1/N).
P(A)=m/N=|A|/|Ω|.
La división no aparece porque «probabilidad significa dividir». Aparece porque estamos trabajando con un conjunto finito de resultados que reciben el mismo peso probabilístico.
6.87. Ejemplo 1 · Obtener un número impar
Lanzamos un dado ideal equilibrado.
Ω={1,2,3,4,5,6}.
Definimos:
A = «obtener un número impar».
Entonces:
A={1,3,5}.
Tenemos:
|A|=3 y |Ω|=6.
Como los seis resultados son equiprobables:
Nota. Elaboración propia. El panel derecho es un modelo hipotético construido expresamente para mostrar resultados posibles con probabilidades diferentes.
6.88. «Resultado favorable» no significa «resultado deseable»
En la expresión:
casos favorables / casos posibles,
la palabra favorable puede producir una confusión.
No significa:
bueno · deseable · beneficioso · conveniente.
Significa únicamente:
resultado que pertenece al evento que estamos estudiando.
Si A significa:
«la máquina falla»,
una falla es matemáticamente «favorable a A» porque hace ocurrir el evento, aunque evidentemente no sea deseable en ingeniería.
6.89. Ejemplo 2 · Dos dados y suma 7
Lanzamos dos dados ideales equilibrados y registramos pares ordenados.
Existen:
6×6=36
pares ordenados equiprobables.
Definimos:
A = «la suma de los dos dados es 7».
Los resultados que hacen ocurrir A son:
Así:
|A|=6 y |Ω|=36.
Observa que contamos pares ordenados equiprobables, no simplemente las once sumas posibles.
6.90. Un cálculo aparentemente correcto puede partir de un modelo incorrecto
Supongamos que alguien razona:
«Las sumas posibles son 2, 3, 4, …, 12. Son 11 valores, así que P(suma 7)=1/11».
La división:
1/11
está aritméticamente bien calculada.
El problema está antes de la división: las once sumas no son equiprobables.
Un procedimiento matemático puede ejecutarse sin errores y producir, sin embargo, una conclusión equivocada si el modelo o los supuestos iniciales no son adecuados.
6.91. ¿Qué puede justificar la equiprobabilidad?
En modelos sencillos, la simetría puede ser una razón importante para asignar probabilidades iguales.
Una moneda ideal se modela como equilibrada cuando suponemos, entre otras condiciones relevantes:
Bajo esas hipótesis:
P(cara)=P(sello)=0,50.
No estamos demostrando que toda moneda física existente produzca exactamente 50 % de caras. Estamos construyendo una idealización útil bajo determinados supuestos.
6.92. Si no podemos usar 50/50 automáticamente, necesitamos otra fuente de información
Ya sabemos que tener dos posibilidades:
A o no A
no implica:
0,50 y 0,50. ✗
En esta parte esa observación cumple una función nueva.
Nos obliga a preguntar:
Si no podemos asignar la probabilidad contando alternativas, ¿qué información podemos utilizar?
Una respuesta es:
observar repetidamente el fenómeno.
6.93. Segundo camino: evidencia empírica
Supongamos que encontramos una moneda física y no queremos asumir de antemano que está equilibrada.
No escribiremos automáticamente:
P(cara)=0,50.
Podemos realizar muchos ensayos concretos y registrar los resultados.
De esta manera obtenemos datos.
Las observaciones repetidas pueden proporcionarnos evidencia acerca del comportamiento del fenómeno, pero los datos observados y la probabilidad del modelo siguen siendo conceptos distintos.
6.94. Frecuencia relativa
Si el evento A ocurre:
fA
veces en:
n
ensayos, definimos su frecuencia relativa:
donde:
número total de ensayos realizados.
número de ensayos en los que ocurrió A.
proporción de los n ensayos en los que observamos A.
6.95. Ejemplo 3 · Una moneda cuya probabilidad desconocemos
Lanzamos una moneda física:
n=200 veces.
Observamos:
fC=118 caras.
Entonces:
h200(C)=118/200
h200(C)=0,59=59 %
Podemos afirmar con exactitud:
En esos 200 ensayos concretos, 59 % produjo cara.
Pero no hemos demostrado:
P(cara)=0,59 exactamente. ✗
Nota. Elaboración propia. Los 200 lanzamientos y las 118 caras constituyen un ejemplo hipotético.
6.96. ¿Por qué escribimos hn(A) y no simplemente P(A)?
La notación recuerda que ambas cantidades responden preguntas diferentes.
¿Qué proporción de los n ensayos observados produjo A?
Es una cantidad calculada a partir de los datos.
¿Qué probabilidad asigna el modelo al evento A?
Es una cantidad perteneciente al modelo.
6.97. ¿Qué observamos cuando aumentamos el número de ensayos?
Si un proceso se comporta de forma suficientemente estable y repetimos el experimento muchas veces, suele resultar útil examinar cómo evoluciona la frecuencia relativa acumulada.
Para ilustrar la idea, supongamos un modelo simulado con:
P(A)=0,55.
0,65
0,58
0,52
0,565
0,542
0,553
Datos simulados con fines didácticos.
Nota. Elaboración propia. Datos simulados con fines didácticos. La trayectoria se construyó para mostrar fluctuaciones; no representa un experimento real.
6.98. Más ensayos no significan acercamiento obligatorio en cada paso
Observa la Figura 6.27.
La frecuencia puede:
Por tanto, es incorrecto pensar:
«Cada nuevo ensayo tiene que hacer que la frecuencia quede más cerca de P(A)».
Lo importante aquí es comprender la idea de comportamiento de largo plazo, sin convertirla todavía en una garantía sobre cada paso individual.
6.99. Los datos históricos necesitan una condición esencial: comparabilidad
Supongamos que durante varios meses una máquina produjo aproximadamente:
2 % de piezas defectuosas.
Esa información puede resultar útil para estudiar el futuro solamente si las condiciones actuales siguen siendo suficientemente comparables.
Debemos preguntarnos:
Si el proceso cambia, una frecuencia histórica puede dejar de representar adecuadamente la situación actual.
Nota. Elaboración propia. Datos hipotéticos con fines didácticos. La figura no representa una fábrica específica.
6.100. Ejemplo 4 · Evidencia en control de calidad
En una inspección hipotética se examinan:
1.000 piezas.
Se encuentran:
27 defectuosas.
La frecuencia relativa observada es:
h(defecto)=27/1.000=0,027=2,7 %.
Este valor constituye evidencia acerca del proceso observado.
Si deseamos utilizarlo para hablar de piezas futuras, necesitamos examinar cuestiones como:
¿las 1.000 piezas son representativas del proceso?
¿la inspección fue coherente?
¿el proceso permanece estable?
¿las futuras piezas serán producidas bajo condiciones comparables?
6.101. Ejemplo 5 · Aplicación en metrología
Se realizan 500 mediciones hipotéticas de piezas producidas bajo unas mismas condiciones de operación.
De ellas:
470 quedan dentro del intervalo de tolerancia.
La frecuencia observada es:
Esto significa exactamente:
94 % de esas 500 mediciones quedaron dentro de tolerancia.
Pero si queremos afirmar:
«la próxima medición tiene aproximadamente 94 % de probabilidad de quedar dentro»,
estamos realizando un paso adicional: utilizamos los datos como evidencia para representar el comportamiento futuro mediante un modelo.
Ese paso es más razonable cuando las condiciones de medición y del proceso permanecen suficientemente comparables.
Nota. Elaboración propia. Ejemplo hipotético con fines didácticos.
6.102. Tercer recurso: simulación computacional
Una simulación permite realizar virtualmente una gran cantidad de ensayos bajo un modelo previamente especificado.
Por ejemplo, podemos programar una simulación utilizando:
P(cara)=0,50.
El computador genera resultados de acuerdo con ese supuesto y podemos estudiar sus frecuencias.
Primero introducimos el modelo. Después la simulación genera consecuencias de ese modelo.
Nota. Elaboración propia.
6.103. Diez millones de simulaciones no corrigen un modelo equivocado
Supongamos que programamos:
P(cara)=0,50
y realizamos:
10.000.000 de ensayos virtuales.
La frecuencia simulada puede quedar extraordinariamente cerca de 0,50.
Eso demuestra que la simulación está reproduciendo las consecuencias del supuesto introducido.
No demuestra que una moneda física desconocida tenga necesariamente:
P(cara)=0,50.
6.104. Cuando necesitamos un modelo científico o matemático
Muchas situaciones no pueden resolverse contando caras de un dado ni observando únicamente una frecuencia histórica.
Pensemos en preguntas como:
En estos casos pueden combinarse:
conocimiento del mecanismo;
observaciones;
mediciones;
datos históricos;
hipótesis científicas;
representaciones matemáticas.
La probabilidad resulta entonces de un modelo construido, no de una simple división entre resultados contados.
6.105. Tres caminos habituales para justificar una probabilidad
Fundamento: simetría o hipótesis de resultados igualmente probables.
Ejemplo: dado ideal equilibrado.
Debemos verificar: que la equiprobabilidad esté justificada.
No permite: aplicar la regla a resultados con pesos diferentes.
Fundamento: observaciones repetidas y frecuencias relativas.
Ejemplo: proporción histórica de piezas defectuosas.
Debemos verificar: representatividad y estabilidad.
No permite: identificar automáticamente frecuencia observada con probabilidad exacta.
Fundamento: mecanismo + datos + hipótesis.
Ejemplo: meteorología, confiabilidad o riesgo.
Debemos verificar: supuestos, calidad de datos y adecuación del modelo.
No permite: confundir el modelo con el fenómeno real.
Nota. Elaboración propia.
6.106. La matemática y el mundo real cumplen funciones diferentes
Esta distinción es esencial.
Las hipótesis están establecidas.
Aplicamos reglas matemáticas.
Si los supuestos están dados, los cálculos pueden realizarse exactamente.
Debemos decidir si las hipótesis son razonables.
Necesitamos datos y conocimiento del fenómeno.
El modelo debe evaluarse respecto del propósito para el cual se utiliza.
6.107. El mismo número puede significar cosas diferentes
Supongamos que en tres modelos diferentes aparece:
P(A)=0,70.
A podría ser «llueve mañana».
A podría ser «el componente supera cierto tiempo de operación».
A podría ser «la medición queda dentro de un intervalo definido».
El número:
0,70
ocupa la misma posición en la escala matemática, pero el significado del evento, los datos disponibles y la construcción del modelo son diferentes.
6.108. Modelo adecuado, cálculo correcto e interpretación correcta
Resolver bien un problema probabilístico exige distinguir tres niveles.
¿Representa razonablemente el problema?
¿Los supuestos están justificados?
¿Utilizamos correctamente las reglas matemáticas?
¿La aritmética es correcta?
¿Qué significa el resultado en el contexto?
¿Estamos afirmando más de lo que permite el modelo?
Nota. Elaboración propia.
6.109. Antes de aceptar una probabilidad, haz estas preguntas
Cuando leas una afirmación como:
P(A)=0,72,
no te limites a mirar el número.
Pregunta:
define el evento
modelo, datos o ambos
condiciones de validez
datos y comparabilidad
¿cambiaron las condiciones?
interpretación, no garantía
Nota. Elaboración propia. La figura propone un procedimiento de lectura crítica, no una fórmula adicional de probabilidad.
6.110. Errores frecuentes
Aplicar casos favorables/casos posibles sin comprobar equiprobabilidad.
La regla clásica necesita resultados equiprobables.
Creer que dos posibilidades significan 50 % y 50 %.
El número de alternativas no determina sus pesos.
Confundir frecuencia relativa con probabilidad exacta.
hn(A) describe una serie observada.
Pensar que aumentar n obliga a acercarse en cada paso.
Las frecuencias pueden fluctuar.
Creer que una simulación descubre automáticamente la probabilidad real.
La simulación ejecuta el modelo que introducimos.
Confundir modelo ideal con objeto físico.
Una moneda ideal y una moneda física no son idénticas.
Usar datos antiguos sin preguntar si el proceso cambió.
Los datos históricos pertenecen a determinadas condiciones.
Pensar que un cálculo correcto garantiza una conclusión científica correcta.
También deben ser adecuados el modelo y la interpretación.
6.111. Práctica de dificultad creciente
Un dado ideal equilibrado se lanza una vez.
A = «obtener un número mayor que 4».
Calcula P(A) y explica por qué puedes utilizar la regla clásica.
Ver solución
A={5,6}, por tanto |A|=2 y |Ω|=6.
Como el modelo establece seis resultados equiprobables:
P(A)=2/6=1/3≈0,3333≈33,33 %.
En una inspección se observan 600 piezas y 18 son defectuosas.
a) Calcula la frecuencia relativa de defecto.
b) ¿Puedes afirmar que la probabilidad exacta de defecto del proceso es ese mismo número?
c) ¿Qué preguntas adicionales deberías hacer?
Ver orientación
h=18/600=0,03=3 %.
Este valor describe las 600 piezas observadas. No demuestra por sí solo que P(defecto)=0,03 exactamente.
Conviene preguntar por selección de piezas, estabilidad del proceso, método de inspección y comparabilidad con futuras condiciones.
Durante seis meses un proceso mostró aproximadamente 1,8 % de defectos. Después se cambia la materia prima y se ajusta la velocidad de producción.
Un analista continúa utilizando 1,8 % como probabilidad de defecto para el mes siguiente.
Evalúa críticamente esa decisión.
Ver orientación
El 1,8 % histórico pertenece al proceso anterior. Como cambiaron variables potencialmente relevantes, no puede transferirse automáticamente al nuevo proceso. Deben reunirse datos posteriores al cambio y justificar si el mismo modelo sigue siendo apropiado.
Una simulación de 5.000.000 de ensayos produce:
h(A)=0,73498.
El programa fue configurado inicialmente con:
P(A)=0,735.
Explica qué evidencia proporciona la simulación y qué afirmación no permite hacer acerca de un fenómeno real externo al programa.
Ver orientación
La simulación muestra que el procedimiento computacional reproduce de manera muy cercana las consecuencias del modelo P(A)=0,735. No demuestra que un fenómeno físico real tenga esa probabilidad; para eso necesitamos justificar que el modelo representa adecuadamente dicho fenómeno.
6.112. Exploración con hoja de cálculo
Después de comprender la diferencia entre modelo y datos, podemos utilizar Excel para estudiar experimentalmente un modelo.
Para simular un evento con:
P(A)=0,70,
podemos utilizar:
Podemos copiar la fórmula en muchas filas, contar cuántas veces aparece A y calcular:
hn(A)=fA/n.
Estamos comprobando cómo se comportan datos simulados cuando el modelo ya contiene P(A)=0,70. No estamos descubriendo 0,70 a partir de un fenómeno real.
6.113. Comprueba lo aprendido
1. ¿Por qué una probabilidad necesita una justificación?
2. ¿Qué significa que varios resultados sean equiprobables?
3. ¿Bajo qué condiciones puede utilizarse P(A)=|A|/|Ω|?
4. ¿Qué significa «resultado favorable» en la regla clásica?
5. ¿Por qué «posible» y «equiprobable» no significan lo mismo?
6. ¿Por qué las once sumas posibles de dos dados no pueden tratarse como equiprobables?
7. ¿Qué papel puede cumplir la simetría en un modelo probabilístico?
8. ¿Qué es una frecuencia relativa?
9. ¿Qué diferencia existe entre P(A) y hn(A)?
10. Si observamos 59 caras en 100 lanzamientos, ¿hemos demostrado P(cara)=0,59?
11. ¿Por qué aumentar n no obliga a que la frecuencia se acerque en cada paso?
12. ¿Qué significa que unos datos históricos pertenezcan a determinadas condiciones?
13. ¿Por qué un cambio de materia prima puede hacer menos útil una frecuencia histórica?
14. ¿Qué función cumple una simulación?
15. ¿Por qué millones de simulaciones no corrigen un modelo equivocado?
16. ¿Qué diferencia existe entre un modelo equiprobable y un modelo científico?
17. Menciona tres fuentes posibles para justificar una probabilidad.
18. ¿Qué diferencia existe entre modelo adecuado y cálculo correcto?
19. ¿Por qué también necesitamos una interpretación correcta?
20. ¿Qué preguntas harías si una noticia afirma que «la probabilidad es 72 %»?
21. ¿Por qué una frecuencia de 94 % dentro de tolerancia no demuestra automáticamente una probabilidad exacta de 94 % para la próxima pieza?
22. Explica con tus propias palabras la frase: «No basta con saber calcular una probabilidad; también debemos poder defender de dónde salió».
Ver respuestas breves
1. Porque P(A) pertenece a un modelo y debe existir alguna razón para asignarle ese valor.
2. Que el modelo les asigna la misma probabilidad.
3. Cuando Ω es finito y los resultados elementales contados son equiprobables.
4. Resultado que pertenece al evento A; no significa resultado deseable.
5. Que algo pueda ocurrir no determina cuánto peso probabilístico recibe.
6. Porque distintos números de pares ordenados producen cada suma.
7. Puede justificar una asignación equiprobable cuando constituye una hipótesis razonable del modelo.
8. La proporción de ensayos observados en los que ocurrió A: hn(A)=fA/n.
9. P(A) pertenece al modelo; hn(A) se calcula a partir de los datos.
10. No. Hemos observado h=0,59 en esa serie concreta.
11. Porque cada nuevo resultado puede producir fluctuaciones temporales.
12. Que describen un proceso bajo las condiciones en que fueron obtenidos.
13. Porque puede haberse modificado el mecanismo generador de los resultados.
14. Explorar experimentalmente las consecuencias de un modelo previamente especificado.
15. Porque más repeticiones reducen fluctuación de simulación, pero no cambian los supuestos del modelo.
16. El primero se apoya en resultados igualmente probables; el segundo puede combinar mecanismo, datos e hipótesis más complejas.
17. Equiprobabilidad, evidencia empírica y modelo científico o matemático.
18. El modelo decide qué representación usamos; el cálculo ejecuta correctamente las reglas dentro de esa representación.
19. Porque debemos traducir el número obtenido al contexto sin afirmar más de lo que permiten los supuestos.
20. Evento, fuente del valor, datos, supuestos, condiciones de validez e interpretación.
21. Porque 94 % describe los datos observados; utilizarlo para una pieza futura requiere un paso de modelación y condiciones comparables.
22. Significa que una respuesta probabilística necesita tanto cálculo como una justificación del modelo que produce ese número.
6.114. Mapa conceptual y síntesis
simetría o estructura
P(A)=|A|/|Ω|
observaciones repetidas
hn(A)=fA/n
mecanismo + datos + hipótesis
P(A)
Síntesis
En esta parte aprendimos que una probabilidad necesita un fundamento.
Cuando un espacio muestral es finito y sus resultados elementales son equiprobables, podemos utilizar:
P(A)=|A|/|Ω|.
Esta regla no es universal. Contar posibilidades sin comprobar equiprobabilidad puede producir resultados incorrectos.
La simetría puede justificar un modelo equiprobable, pero continúa siendo una hipótesis acerca de cómo representamos la situación.
Cuando observamos un proceso repetidamente obtenemos frecuencias relativas:
hn(A)=fA/n.
Una frecuencia observada proporciona evidencia, pero no debe confundirse automáticamente con una probabilidad exacta.
Los datos históricos son más útiles cuando las condiciones del proceso permanecen suficientemente comparables.
Si la máquina, la materia prima, el método de medición, el ambiente o cualquier aspecto relevante cambia, debemos reconsiderar si el modelo anterior continúa siendo apropiado.
Una simulación permite estudiar las consecuencias de un modelo, pero no demuestra por sí sola que ese modelo describa correctamente un objeto físico.
En problemas más complejos pueden combinarse:
conocimiento científico · datos · mecanismos · hipótesis
para construir un modelo probabilístico.
Finalmente, debemos distinguir tres cuestiones:
Las tres son necesarias.
Pregunta final que debe quedar en la mente del lector
«P(A)=0,73… ¿por qué 0,73?»
Saber hacer esa pregunta es tan importante como saber utilizar una fórmula.
No basta con calcular una probabilidad.
También debemos poder explicar qué modelo, qué datos y qué supuestos justifican ese número.
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Axiomas y reglas fundamentales de probabilidad
De tres principios fundamentales a muchas reglas útiles
En la parte anterior estudiamos de dónde puede surgir una probabilidad: equiprobabilidad justificada, evidencia empírica o un modelo científico. Ahora planteamos otra pregunta. Una vez asignadas probabilidades, ¿qué condiciones deben cumplir para formar un modelo matemáticamente coherente? La respuesta comienza con unos pocos principios fundamentales llamados axiomas.
6.115. ¿Por qué necesitamos axiomas?
Imagina tres afirmaciones:
«probabilidad de falla»
«probabilidad de todos los resultados»
sin revisar superposición
Las tres situaciones deben hacernos sospechar. No basta con escribir números junto a eventos y llamarlos probabilidades. Las asignaciones deben obedecer una estructura coherente.
Esta distinción es fundamental:
¿Por qué asignamos determinada probabilidad a un evento? Esta pregunta pertenece al origen y justificación del modelo.
¿Las probabilidades asignadas cumplen las reglas fundamentales de la teoría? Esta es la pregunta central de esta parte.
6.116. ¿Qué es un axioma?
Un axioma es una afirmación fundamental que se adopta como punto de partida de una teoría matemática.
A partir de los axiomas utilizamos definiciones y razonamiento lógico para demostrar nuevas propiedades.
Esto evita tratar cada fórmula como una receta aislada. Podemos comprender por qué funciona una regla y bajo qué condiciones puede utilizarse.
principios fundamentales
Nota. Elaboración propia.
6.117. Para profundizar · La estructura formal de un modelo probabilístico
Para comprender el recorrido principal de esta parte no necesitas dominar todavía toda la formulación abstracta de la teoría. Sin embargo, un lector que quiera ver su estructura formal puede representar un espacio de probabilidad mediante:
Espacio muestral. Contiene los resultados que el modelo ha decidido distinguir.
Familia de eventos. Contiene los eventos a los que el modelo asignará probabilidad.
Función de probabilidad. Asigna a cada evento considerado un número que satisface los axiomas.
Para el desarrollo principal bastará trabajar con eventos A, B, C, … dentro de Ω. La estructura con 𝔽 se incluye como capa formal. En espacios finitos elementales suele ser posible considerar todos los subconjuntos de Ω; en modelos más generales se requiere una estructura más cuidadosa.
6.118. Primer axioma · No negatividad
Pensemos primero en el significado. Una probabilidad cuantifica la posibilidad asignada a un evento dentro de un modelo. No tendría sentido que esa cantidad fuese negativa.
Esto debe cumplirse para cualquier evento A al que el modelo asigne probabilidad.
valor permitido
no puede ser una probabilidad
Supongamos que A representa: «un componente falla durante una prueba de funcionamiento».
Un modelo podría asignar P(A)=0,02 o P(A)=0,15. Pero P(A)=−0,02 no describe un riesgo extraordinariamente pequeño: simplemente viola el axioma.
Puente de significado. El evento A representa la condición física que nos interesa; P(A) representa la probabilidad que el modelo asigna a esa condición. La no negatividad es una exigencia del modelo matemático, no una medición directa del componente.
6.119. Segundo axioma · Normalización
El espacio muestral Ω representa que ocurre alguno de los resultados contemplados por el modelo.
Si Ω contiene todos los resultados que el modelo considera posibles, alguno de ellos necesariamente pertenece a Ω.
1 = 100 %
Esto significa que la totalidad de la probabilidad disponible en el modelo es 1.
Un sistema clasifica su estado operativo en tres categorías:
Si las categorías son mutuamente excluyentes y exhaustivas:
P(normal)+P(advertencia)+P(crítico)=1.
Puente de significado. Ω es aquí el conjunto de estados que el modelo permite registrar. P(Ω)=1 no afirma que el modelo incluya toda la complejidad física imaginable; afirma que, dentro de las categorías definidas por el modelo, la probabilidad total es 1.
6.120. Tercer axioma · Versión operacional para eventos disjuntos
Supongamos que A y B son eventos incompatibles:
A ∩ B=∅.
Como no comparten ningún resultado, sus probabilidades pueden reunirse sin contar ninguna posibilidad dos veces.
Esta es la versión operacional que utilizaremos con frecuencia. En la sección siguiente veremos la formulación completa.
Supongamos que un protocolo de inspección obliga a asignar a cada pieza rechazada una sola causa principal:
A = «rechazo por defecto dimensional»
B = «rechazo por defecto eléctrico».
Si el procedimiento de registro hace que una pieza no pueda aparecer simultáneamente en ambas categorías, A y B son disjuntos.
Si:
P(A)=0,04 y P(B)=0,03,
P(A ∪ B)=0,07=7 %.
Puente de significado. La suma es válida porque la regla de registro hace exclusivas las dos categorías. Si una pieza pudiera clasificarse simultáneamente en ambos tipos de defecto, el modelo de eventos sería diferente y no podríamos sumar directamente.
6.121. La formulación rigurosa del tercer axioma
En la formulación moderna completa, el tercer axioma no se limita a dos eventos.
Si:
A₁, A₂, A₃, …
son eventos disjuntos dos a dos, entonces:
Esta propiedad recibe el nombre de aditividad numerable. La suma para dos o para un número finito de eventos disjuntos se obtiene como caso particular.
P(A) ≥ 0
no negatividad
P(Ω)=1
normalización
disjuntos → sumamos
aditividad numerable
Nota. Elaboración propia. La figura resume la interpretación operacional de los tres axiomas.
6.122. Ejemplo 1 · Los seis resultados de un dado
Consideremos un dado ideal equilibrado:
Ω={1,2,3,4,5,6}.
Los seis resultados elementales son mutuamente excluyentes y, juntos, forman Ω.
Debido a la simetría asumida por el modelo ideal, asignamos:
P({1})=P({2})=···=P({6})=1/6.
Esto es coherente con:
P(Ω)=1.
Atención. Los axiomas no demuestran que cada cara tenga probabilidad 1/6. Esa asignación procede de la simetría del modelo de dado ideal. Los axiomas establecen qué propiedades debe cumplir la asignación una vez definida.
6.123. Lo importante: muchas reglas no son axiomas
Quizá ya reconoces expresiones como:
No necesitamos convertir cada una en un axioma independiente.
Podemos demostrarlas a partir de los tres principios fundamentales.
6.124. Demostración de P(∅)=0
Sabemos que:
Ω ∪ ∅=Ω.
Además, Ω y ∅ son disjuntos porque el conjunto vacío no contiene ningún resultado.
Por aditividad:
P(Ω ∪ ∅)=P(Ω)+P(∅).
Pero Ω ∪ ∅=Ω, por lo que:
P(Ω)=P(Ω)+P(∅).
Como P(Ω)=1:
1=1+P(∅).
Restamos 1 a ambos lados:
P(∅)=0.
El evento imposible tiene probabilidad cero como consecuencia de los axiomas; no necesitamos introducir esta propiedad como un cuarto axioma.
6.125. La regla del complemento
Un evento A y su complemento Ac poseen dos propiedades:
no pueden ocurrir simultáneamente
entre ambos cubren todo Ω
Por eso sus probabilidades deben completar la totalidad 1.
medición clasificada dentro de tolerancia
medición clasificada fuera de tolerancia
Puente de significado. La región A del modelo representa todas las mediciones que satisfacen el criterio de tolerancia; el resto de Ω representa las que no lo satisfacen. La figura ilustra una estructura matemática; no afirma que cualquier proceso de medición tenga una probabilidad determinada de conformidad.
Nota. Elaboración propia.
6.126. Demostración de la regla del complemento
Como A y Ac son disjuntos:
P(A ∪ Ac) = P(A)+P(Ac).
Pero:
A ∪ Ac=Ω.
Entonces:
P(Ω)=P(A)+P(Ac).
Como P(Ω)=1:
1=P(A)+P(Ac).
Despejamos:
P(Ac)=1−P(A).
6.127. De los axiomas obtenemos 0 ≤ P(A) ≤ 1
El primer axioma ya nos proporciona:
P(A) ≥ 0.
La regla del complemento nos da:
P(Ac)=1−P(A).
Como el primer axioma también se aplica a Ac:
P(Ac) ≥ 0.
Entonces:
1−P(A) ≥ 0,
de donde:
La conocida escala de probabilidad entre 0 y 1 aparece así como una consecuencia de los axiomas.
6.128. Ejemplo 2 · Calcular por complemento
Un modelo de confiabilidad asigna:
P(falla)=0,08.
Queremos calcular la probabilidad de que no ocurra la falla.
P(no falla)=1−P(falla).
Interpretación. Dentro de ese modelo, la probabilidad asignada a que no ocurra la falla es 92 %. La afirmación no garantiza el comportamiento de un dispositivo concreto.
6.129. Monotonía · Si un evento está contenido en otro
Supongamos:
A ⊆ B.
Esto significa que cada resultado que hace ocurrir A también hace ocurrir B.
B contiene todas las posibilidades de A y quizá algunas adicionales. Por ello, A no puede tener mayor probabilidad que B.
Esta propiedad recibe el nombre de monotonía de la probabilidad.
temperatura superior a 80 °C
temperatura superior a 90 °C
Puente de significado. Toda temperatura superior a 90 °C también supera 80 °C. Por tanto, el evento A está contenido en B y necesariamente P(A)≤P(B).
Nota. Elaboración propia.
6.130. Demostración de la monotonía
Supongamos:
A ⊆ B.
Podemos dividir B en dos partes disjuntas:
A y B\A.
Por tanto:
B=A ∪ (B\A).
Como las dos partes son disjuntas, por aditividad:
P(B)=P(A)+P(B\A).
Por no negatividad:
P(B\A) ≥ 0.
Entonces:
P(B) ≥ P(A).
A ⊆ B ⇒ P(A) ≤ P(B).
6.131. Probabilidad de una diferencia
La demostración anterior mostró que, si A⊆B:
B=A ∪ (B\A),
con partes disjuntas.
P(B)=P(A)+P(B\A).
Despejando:
Condición importante. La forma P(B\A)=P(B)−P(A) exige que A esté contenido en B. No debe aplicarse automáticamente a dos eventos cualesquiera.
6.132. Ejemplo 3 · Probabilidad entre dos umbrales
En un modelo de temperatura definimos:
A = «temperatura superior a 90 °C»
B = «temperatura superior a 80 °C».
Como A⊆B, el evento B\A significa:
Supongamos que el modelo asigna:
P(B)=0,18 y P(A)=0,05.
Entonces:
Interpretación. En ese modelo, la probabilidad de encontrarse en el intervalo de temperaturas superior a 80 °C pero no superior a 90 °C es 13 %.
6.133. ¿Por qué no siempre podemos sumar P(A)+P(B)?
Si A y B se superponen, la región:
A ∩ B
pertenece simultáneamente a ambos eventos.
Al sumar:
P(A)+P(B),
la intersección queda contada dos veces.
Nota. Elaboración propia. Las áreas del dibujo representan relaciones entre conjuntos, no magnitudes proporcionales de probabilidad.
6.134. Demostración de la regla general de la unión
Queremos calcular:
P(A ∪ B).
Podemos dividir A ∪ B en tres regiones disjuntas:
A\B, A ∩ B, B\A.
Al sumar P(A)+P(B), la región A∩B aparece dos veces.
Para que aparezca una sola vez debemos restar una copia:
P(A ∪ B) = P(A)+P(B)−P(A ∩ B).
6.135. Ejemplo 4 · Dos alarmas de una máquina
En un ejemplo hipotético de monitoreo industrial definimos:
A = «se activa la alarma de temperatura»
B = «se activa la alarma de vibración».
El modelo asigna:
P(A)=0,12 P(B)=0,09 P(A∩B)=0,04.
Queremos la probabilidad de que se active al menos una de las dos alarmas.
P(A∪B)=0,12+0,09−0,04
P(A∪B)=0,17=17 %
Puente de significado. La intersección representa los casos en los que ambas alarmas están activas simultáneamente. Si sumáramos 12 % y 9 % sin restarla, esos casos aparecerían dos veces.
Nota. Datos hipotéticos creados exclusivamente con fines didácticos.
6.136. Caso especial · Eventos disjuntos
Si A y B son incompatibles:
A ∩ B=∅.
Como:
P(∅)=0,
la regla general:
P(A ∪ B)=P(A)+P(B)−P(A ∩ B)
se transforma en:
Así recuperamos la versión operacional de la aditividad para dos eventos disjuntos.
6.137. Incompatibles no significa complementarios
Dos eventos complementarios cumplen simultáneamente:
A ∩ Ac=∅
A ∪ Ac=Ω.
Por eso los complementarios siempre son incompatibles. Pero la afirmación inversa no siempre es cierta.
En un dado:
A={1} y B={2}.
Son incompatibles porque:
A ∩ B=∅.
Sin embargo:
A ∪ B={1,2} ≠ Ω.
A∩B=∅.
No se superponen, pero no necesariamente cubren Ω.
A∩Ac=∅.
Además, A∪Ac=Ω.
6.138. Probabilidades de una partición
Supongamos que:
A₁, A₂, …, Aₖ
forman una partición de Ω.
Eso significa que:
- no se superponen entre sí;
- reunidos cubren todo Ω.
Por aditividad y normalización:
Puente de significado. Las tres regiones representan categorías de registro, no necesariamente tres estados fundamentales de la naturaleza. La partición depende de cómo se haya definido el sistema de clasificación.
Nota. Elaboración propia.
6.139. «Al menos uno»
Si tenemos dos eventos A y B, la frase:
significa:
A ∪ B.
Por tanto:
Atención. En esta parte no calcularemos P(A∩B) multiplicando automáticamente P(A) por P(B). Esa operación requiere condiciones adicionales que todavía no hemos estudiado.
6.140. «Ninguno»
Si A ∪ B significa que ocurre al menos uno, su complemento significa que no ocurre ninguno.
(A ∪ B)c
Por la regla del complemento:
De forma equivalente:
6.141. Exactamente uno de dos eventos
«Exactamente uno» significa:
- ocurre A sin B, o
- ocurre B sin A.
Es decir:
(A\B) ∪ (B\A).
Las dos regiones son disjuntas. Puede demostrarse que:
El factor 2 aparece porque, para conservar solamente las regiones exclusivas, la intersección debe eliminarse por completo.
6.142. Subaditividad
De la regla general:
P(A ∪ B)=P(A)+P(B)−P(A ∩ B),
y como:
P(A ∩ B) ≥ 0,
concluimos:
Esta propiedad recibe el nombre de subaditividad.
Si A y B representan dos tipos de eventos adversos y no conocemos exactamente cuánto se superponen, P(A)+P(B) proporciona un límite superior sencillo para la probabilidad de que ocurra al menos uno.
El resultado no afirma que la unión sea igual a la suma. Afirma únicamente que no puede superarla.
6.143. ¿Qué ocurre con tres eventos?
Para tres eventos comenzamos sumando:
P(A)+P(B)+P(C).
Pero las intersecciones por parejas quedan contadas más de una vez. Debemos restar:
P(A ∩ B), P(A ∩ C), P(B ∩ C).
Aparece entonces un nuevo detalle: la región A∩B∩C fue sumada tres veces y luego restada tres veces. Terminó sin contarse.
Debemos agregarla nuevamente una vez.
6.144. Inclusión-exclusión para tres eventos
Primero incluimos los tres eventos:
P(A)+P(B)+P(C).
Restamos una copia de cada intersección por parejas:
−P(A ∩ B)−P(A ∩ C)−P(B ∩ C).
La región común a los tres eventos fue sumada tres veces y restada tres veces. Para que aparezca exactamente una vez debemos recuperarla:
+P(A ∩ B ∩ C).
P(A ∪ B ∪ C) = P(A)+P(B)+P(C) −P(A ∩ B) −P(A ∩ C) −P(B ∩ C) +P(A ∩ B ∩ C)
P(A)+P(B)+P(C)
restar las tres intersecciones por parejas
sumar P(A ∩ B ∩ C)
Nota. Elaboración propia. La figura muestra la lógica del conteo, no áreas proporcionales a probabilidades.
6.145. Ejemplo 5 · Dos actividades de una población
En un ejemplo hipotético se selecciona al azar una persona de una población y se consideran:
A = «practica ciclismo»
B = «practica natación».
El modelo asigna:
P(A)=0,40
P(B)=0,35
P(A ∩ B)=0,15.
La probabilidad de que la persona practique al menos una de las dos actividades es:
P(A ∪ B)=0,40+0,35−0,15
P(A ∪ B)=0,60=60 %
Interpretación. Según el modelo hipotético, la probabilidad de seleccionar una persona que practique ciclismo, natación o ambas actividades es 60 %.
Nota. Datos hipotéticos creados exclusivamente con fines didácticos.
6.146. Principales reglas obtenidas hasta ahora
P(A) ≥ 0
P(Ω)=1
P(∅)=0
0 ≤ P(A) ≤ 1
P(Ac)=1−P(A)
A⊆B ⇒ P(A)≤P(B)
P(B\A)=P(B)−P(A)
P(A∪B)=P(A)+P(B)−P(A∩B)
A∩B=∅ ⇒ P(A∪B)=P(A)+P(B)
P(A∪B)≤P(A)+P(B)
6.147. Errores frecuentes
Creer que todas las reglas son axiomas.
Muchas propiedades se demuestran a partir de los tres axiomas.
Sumar P(A)+P(B) aunque los eventos se superpongan.
Debemos corregir el doble conteo.
Confundir incompatibles con complementarios.
Los complementarios, además de no superponerse, deben cubrir todo Ω.
Aplicar P(B\A)=P(B)−P(A) sin verificar A⊆B.
Esa forma necesita la relación de inclusión.
Olvidar que «al menos uno» incluye la posibilidad de que ocurran ambos.
«Al menos uno» corresponde a una unión.
Confundir una probabilidad del modelo con una frecuencia observada.
Modelo y datos son niveles distintos.
¿qué representan?
∪, ∩, ⊆, complemento
¿cuál corresponde?
¿qué significa el resultado?
Nota. Elaboración propia.
6.148. Práctica de dificultad creciente
Si:
P(A)=0,37,
calcula P(Ac).
Ver solución
Aplicamos la regla del complemento:
P(Ac)=1−0,37=0,63.
Por tanto, P(Ac)=63 %.
Supongamos:
P(A)=0,45
P(B)=0,40
P(A∩B)=0,18.
Calcula:
a) P(A∪B);
b) P(ninguno);
c) P(exactamente uno).
Ver solución
a) P(A∪B)=0,45+0,40−0,18=0,67.
b) P(ninguno)=1−0,67=0,33.
c) P(exactamente uno)=0,45+0,40−2(0,18)=0,49.
Tres eventos tienen:
P(A)=0,50, P(B)=0,40, P(C)=0,30
P(A∩B)=0,20, P(A∩C)=0,15, P(B∩C)=0,10
P(A∩B∩C)=0,05.
Calcula P(A∪B∪C).
Ver solución
P(A∪B∪C) =0,50+0,40+0,30−0,20−0,15−0,10+0,05.
P(A∪B∪C)=0,80=80 %.
Supón que A⊆B y que P(A)=P(B). Demuestra que:
P(B\A)=0.
¿Podemos concluir únicamente a partir de esto que B\A=∅?
Ver orientación
Como A⊆B:
P(B\A)=P(B)−P(A)=0.
Que un evento tenga probabilidad cero no permite, en toda teoría probabilística, concluir automáticamente que sea el conjunto vacío. Esta precisión se comprenderá plenamente cuando estudiemos modelos continuos.
6.149. Actividad · ¿Axioma o consecuencia?
Clasifica cada afirmación como axioma, forma operacional de un axioma o consecuencia demostrada.
A. P(A)≥0.
B. P(Ω)=1.
C. P(∅)=0.
D. P(Ac)=1−P(A).
E. Para dos eventos disjuntos, sus probabilidades se suman.
F. Si A⊆B, entonces P(A)≤P(B).
Ver respuesta
A. Axioma.
B. Axioma.
C. Consecuencia demostrada.
D. Consecuencia demostrada.
E. Forma operacional finita de la aditividad.
F. Consecuencia demostrada.
6.150. Comprueba lo aprendido
1. ¿Qué es un axioma?
2. ¿Qué establece el axioma de no negatividad?
3. ¿Qué significa P(Ω)=1?
4. ¿Qué condición permite sumar directamente P(A)+P(B)?
5. ¿Por qué P(∅)=0 es una consecuencia y no un cuarto axioma?
6. Explica con palabras la regla del complemento.
7. ¿Cómo se obtiene 0≤P(A)≤1?
8. ¿Qué significa A⊆B?
9. ¿Qué implica A⊆B para P(A) y P(B)?
10. ¿Cuándo puede usarse P(B\A)=P(B)−P(A)?
11. Escribe la regla general de la unión.
12. ¿Por qué debemos restar P(A∩B)?
13. ¿Cuál es la diferencia entre incompatibles y complementarios?
14. ¿Qué significa que varios eventos formen una partición?
15. ¿Qué representa «al menos uno»?
16. ¿Cómo se calcula «ninguno» mediante complemento?
17. ¿Qué significa subaditividad?
18. Explica con tus propias palabras la lógica de inclusión-exclusión para tres eventos.
Ver respuestas breves
1. Una afirmación fundamental adoptada como punto de partida de una teoría.
2. P(A)≥0 para todo evento A considerado.
3. Que la probabilidad total del espacio muestral es 1.
4. Que A y B sean disjuntos.
5. Porque se deduce de normalización y aditividad.
6. La probabilidad de que no ocurra A es lo que falta a P(A) para completar 1.
7. La cota inferior viene de no negatividad y la superior de aplicarla al complemento.
8. Todo resultado de A pertenece también a B.
9. P(A)≤P(B).
10. Cuando A⊆B.
11. P(A∪B)=P(A)+P(B)−P(A∩B).
12. Porque la intersección aparece dos veces al sumar P(A)+P(B).
13. Los incompatibles no se superponen; los complementarios además cubren todo Ω.
14. Que son mutuamente excluyentes y conjuntamente exhaustivos.
15. A∪B.
16. P(ninguno)=1−P(A∪B).
17. Que P(A∪B)≤P(A)+P(B).
18. Se suman los eventos individuales, se restan las intersecciones por parejas y se recupera una vez la intersección triple.
6.151. Mapa conceptual
P(A∪B)=P(A)+P(B)−P(A∩B)
Nota. Elaboración propia.
6.152. Síntesis
La teoría moderna de la probabilidad se organiza a partir de tres axiomas fundamentales:
P(A)≥0
P(Ω)=1
aditividad numerable para eventos disjuntos.
A partir de ellos obtuvimos:
P(∅)=0;
P(Ac)=1−P(A);
0≤P(A)≤1;
si A⊆B, entonces P(A)≤P(B);
si A⊆B, entonces P(B\A)=P(B)−P(A);
para eventos cualesquiera:
P(A∪B)=P(A)+P(B)−P(A∩B);
para eventos disjuntos:
P(A∪B)=P(A)+P(B);
y para tres eventos construimos el principio de inclusión-exclusión.
La lección más importante no consiste en memorizar una colección de fórmulas. Consiste en reconocer la relación entre los eventos, seleccionar la regla apropiada y comprender qué representa el resultado dentro del modelo.
En esta parte la misma estructura matemática apareció en contextos distintos: fallas de componentes, clasificación industrial, metrología, temperatura, alarmas, estados de sistemas y actividades de una población.
Los fenómenos son diferentes, pero pueden compartir relaciones matemáticas entre eventos. Esa es precisamente una de las fuerzas de un modelo: permite reconocer una estructura común sin afirmar que realidades diferentes sean idénticas.
6.153. De las reglas de probabilidad al problema de contar
Ya podemos combinar probabilidades de forma coherente cuando conocemos las probabilidades de los eventos involucrados.
Sin embargo, muchos problemas presentan un obstáculo anterior:
Cuando el número de resultados crece, escribirlos uno por uno deja de ser práctico. Necesitamos técnicas sistemáticas para contarlos.
Y debemos recordar una condición esencial: contar resultados solo permite convertir directamente ese conteo en probabilidad cuando el modelo justifica que los resultados contados son equiprobables.
Tres axiomas permiten construir una parte sorprendentemente amplia de la teoría elemental de la probabilidad.
Comprender de dónde proviene una regla es más poderoso que memorizarla sin saber por qué funciona.
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Kolmogorov, A. N. (1950). Foundations of the theory of probability (2nd English ed.). Chelsea Publishing Company.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Contar antes de calcular probabilidades
Árboles · principios de conteo · factorial · permutaciones · variaciones · combinaciones
Cuando el espacio muestral crece, escribir todos sus resultados deja de ser práctico
En un dado podemos escribir seis resultados. En dos dados podemos construir 36 pares ordenados. Pero muchos experimentos producen cientos, miles o millones de posibilidades. En esos casos necesitamos aprender a contar sin enumerar. Las técnicas combinatorias permiten determinar cuántos resultados existen y, cuando el modelo justifica la equiprobabilidad, utilizar después ese conteo para calcular probabilidades.
6.154. Un problema que crece demasiado rápido
Imagina que lanzamos una moneda cinco veces y queremos escribir todas las secuencias posibles.
Algunas serían:
y todavía faltarían muchas.
En realidad hay:
Con diez lanzamientos habría:
2¹⁰=1.024.
Con veinte:
2²⁰=1.048.576.
6.155. Contar no es todavía calcular una probabilidad
Si descubrimos que existen 120 resultados posibles, hemos resuelto un problema de conteo.
Para utilizar después:
P(A)=|A|/|Ω|,
todavía debemos comprobar que los resultados elementales que contamos son equiprobables dentro del modelo.
Conteo correcto + equiprobabilidad justificada permite utilizar la regla clásica. El conteo por sí solo no garantiza esa condición.
Nota. Elaboración propia.
6.156. Principio de la suma · alternativas que no se superponen
Supongamos que para llegar a un lugar podemos escoger 3 rutas en autobús o 2 rutas en metro.
Si estamos contando una sola ruta y las cinco rutas son diferentes:
Principio de la suma: cuando las posibilidades se dividen en alternativas que no se superponen, el número total se obtiene sumando las cantidades de cada alternativa.
6.157. Principio multiplicativo · decisiones por etapas
Supongamos que podemos escoger 3 camisas y después 2 pantalones. Cada camisa puede combinarse con cada pantalón.
Nota. Elaboración propia.
6.158. ¿Por qué funciona el principio multiplicativo?
Si la primera etapa tiene m posibilidades y para cada una de ellas existen n posibilidades en la segunda:
n+n+···+n
con m sumandos.
m×n.
Multiplicar caminos es una operación de conteo. No significa multiplicar automáticamente probabilidades.
6.159. Más de dos etapas
Si existen n₁, n₂, …, nₖ posibilidades en etapas sucesivas:
6.160. Ejemplo 1 · Un código de tres dígitos
Utilizamos los dígitos 0, 1, 2, …, 9. Los dígitos pueden repetirse y 000 es válido.
10 opciones × 10 opciones × 10 opciones
6.161. Factorial
Para escribir productos de enteros positivos consecutivos utilizamos el factorial:
6
24
120
720
6.162. ¿Por qué 0!=1?
La expresión 0!=1 puede parecer extraña, pero es coherente algebraica y combinatoriamente.
Como:
1!=1·0!
y 1!=1:
0!=1.
Además, existe exactamente una manera de ordenar cero objetos: la disposición vacía.
6.163. Permutaciones · usamos todos los objetos y el orden importa
Tenemos tres libros distintos: A, B y C.
3×2×1=3!=6.
6.164. Número de permutaciones de n objetos distintos
Algunos textos escriben Pn=n!. Aquí evitaremos esa notación principal para no confundirla con P(A).
6.165. Ejemplo 2 · Ordenar cinco fotografías
Utilizamos las cinco fotografías y el orden importa:
6.166. Variaciones sin repetición · escogemos algunos y el orden importa
Ocho participantes compiten por:
oro · plata · bronce.
El orden cambia el resultado.
8×7×6=336.
donde n y r son enteros no negativos y 0≤r≤n.
6.167. Derivación de V(n,r)
V(n,r)=n(n−1)(n−2)···(n−r+1).
V(n,r)=n!/(n−r)!.
6.168. La pregunta decisiva: ¿importa el orden?
Ana · Luis · Carlos
oro · plata · bronce
Carlos · Luis · Ana
{Ana, Luis, Carlos}
comité
{Carlos, Ana, Luis}
Nota. Elaboración propia.
6.169. Combinaciones · escogemos algunos y el orden no importa
Una combinación es una selección de r objetos entre n cuando cambiar el orden no produce una selección nueva.
donde 0≤r≤n.
6.170. ¿Por qué dividimos entre r!?
Si el orden no importa, cada grupo de r elementos aparece r! veces en el conteo ordenado.
C(n,r)=n!/[r!(n−r)!].
6.171. Ejemplo 3 · Escoger 3 estudiantes entre 10
Como no existen cargos, cambiar el orden de los nombres no crea un nuevo grupo.
C(10,3)=(10×9×8)/(3×2×1).
6.172. Una identidad importante de las combinaciones
Escoger r elementos determina automáticamente cuáles n−r quedan por fuera.
6.173. Demostración de C(n,r)=C(n,n−r)
C(n,n−r)=n!/[(n−r)!r!].
C(n,n−r)=C(n,r).
6.174. Guía rápida de las herramientas estudiadas hasta aquí
Sumar.
n₁n₂···nₖ.
n!.
V(n,r).
C(n,r).
6.175. Con repetición y sin repetición
La misma opción puede volver a estar disponible.
Un elemento utilizado deja de estar disponible.
Nota. Elaboración propia.
6.176. Si se permite repetición y el orden importa
Si tenemos n símbolos y construimos una secuencia de r posiciones, pudiendo reutilizar cualquiera de los n símbolos en cada posición:
Con dos símbolos, 0 y 1, podemos construir cadenas de ocho posiciones:
2⁸=256.
El conteo indica cuántas cadenas distintas pueden construirse; no afirma que todas aparezcan con la misma frecuencia en un sistema real.
6.177. Volvamos a la moneda: n lanzamientos
En cada lanzamiento existen dos resultados: C o S.
2
4
8
32
1.024
1.048.576
Cada nueva etapa multiplica por 2 el número de secuencias.
Nota. Elaboración propia.
6.178. Ejemplo 4 · Exactamente dos caras en cinco lanzamientos
Debemos escoger qué dos de las cinco posiciones contienen caras.
C(5,2)=10.
escoger 2 posiciones entre 5 → C(5,2)=10
Nota. Elaboración propia.
6.179. Ahora sí: del conteo a la probabilidad
|Ω|=2⁵=32
|A|=C(5,2)=10.
Si la moneda se modela como equilibrada, las 32 secuencias son equiprobables.
Interpretación. Bajo el modelo de moneda equilibrada, la probabilidad de obtener exactamente dos caras en cinco lanzamientos es 31,25 %.
|Ω|=32
|A|=10
Nota. Elaboración propia.
6.180. El mismo conjunto de objetos puede exigir fórmulas diferentes
Usamos todos.
El orden importa.
10!
Escogemos 3.
El orden importa.
V(10,3)
Escogemos 3.
El orden no importa.
C(10,3)
6.181. Ejemplo 5 · Podio o comité
De ocho personas escogemos tres.
Podio: V(8,3)=336
Comité: C(8,3)=56.
La diferencia aparece porque en el podio los puestos distinguen resultados; en un comité sin cargos, no.
6.182. Un razonamiento eficiente con factoriales
No siempre conviene desarrollar factoriales completos:
C(20,2)=20!/[2!18!]
=(20×19)/(2×1)
6.183. Cinco preguntas antes de utilizar una fórmula
¿Qué estoy contando?
¿Hay etapas o alternativas?
¿Se permite repetición?
¿Importa el orden?
¿Cuento todos los resultados o los favorables?
Nota. Elaboración propia.
6.184. Después del cálculo manual: hoja de cálculo
Una hoja de cálculo puede facilitar operaciones grandes, pero primero debemos identificar correctamente el tipo de conteo.
6.185. Errores frecuentes
Elegir una fórmula antes de analizar la estructura.
Confundir podio con comité.
Olvidar si puede repetirse un elemento.
Confundir multiplicar caminos con multiplicar probabilidades.
Desarrollar factoriales enormes antes de simplificar.
Usar |A|/|Ω| sin justificar equiprobabilidad.
6.186. Práctica de dificultad creciente
Un restaurante ofrece 4 platos y 3 bebidas. ¿Cuántos menús formados por un plato y una bebida pueden construirse?
Ver solución
4×3=12.
De siete estudiantes se escogerán presidente, vicepresidente y secretario.
Ver solución
V(7,3)=7×6×5=210.
Se lanzan seis veces una moneda equilibrada. Calcula la probabilidad de obtener exactamente tres caras.
Ver solución
|Ω|=2⁶=64. |A|=C(6,3)=20. P(A)=20/64=0,3125=31,25 %.
Justifica sin utilizar factoriales por qué:
C(n,r)=C(n,n−r).
Ver orientación
Escoger r objetos determina exactamente cuáles n−r quedan fuera.
6.187. Reto de clasificación · ¿qué herramienta usarías?
A. Ordenar 6 libros distintos.
B. Escoger 4 personas entre 12 para formar un equipo.
C. Escoger oro, plata y bronce entre 10 atletas.
D. Crear una secuencia de cuatro dígitos permitiendo repetición.
E. Escoger una camisa entre 5 y un pantalón entre 4.
F. Contar secuencias de ocho lanzamientos de una moneda.
Ver orientación
A. 6!.
B. C(12,4).
C. V(10,3).
D. 10⁴.
E. 5×4.
F. 2⁸.
6.188. Comprueba lo aprendido
1. ¿Qué afirma el principio de la suma?
2. ¿Qué afirma el principio multiplicativo?
3. ¿Por qué contar caminos no es multiplicar probabilidades?
4. ¿Qué significa n!?
5. ¿Por qué 0!=1?
6. ¿Cuándo utilizamos V(n,r)?
7. ¿Cuándo utilizamos C(n,r)?
8. ¿Cuál es la pregunta principal para distinguir variaciones de combinaciones?
9. ¿Cuántas secuencias existen al lanzar una moneda n veces?
10. ¿Por qué contar correctamente no garantiza que podamos utilizar P(A)=|A|/|Ω|?
6.189. Mapa conceptual
Nota. Elaboración propia.
6.190. Síntesis
En esta parte aprendimos que contar es fundamental cuando el espacio muestral contiene demasiados resultados para enumerarlos uno por uno.
El principio de la suma se utiliza para alternativas que no se superponen.
El principio multiplicativo se utiliza en procesos formados por varias etapas.
n₁n₂···nₖ.
Cuando existen n opciones en cada una de r posiciones y se permite repetir:
nʳ.
Para ordenar todos los n objetos distintos:
n!.
Para escoger r entre n, sin repetición y cuando el orden importa:
V(n,r)=n!/(n−r)!.
Cuando el orden no importa:
C(n,r)=n!/[r!(n−r)!].
Y, sobre todo, contar correctamente no basta para convertir un cociente de casos favorables y casos posibles en probabilidad: también debemos justificar la equiprobabilidad.
Hemos estudiado las ideas por separado. Ahora podemos reunirlas en un único recorrido de decisión.
Ante un nuevo problema, no conviene comenzar buscando una fórmula. Primero debemos determinar:
La siguiente infografía reúne estas preguntas y funciona como recurso permanente de referencia. Puedes regresar a ella cada vez que necesites decidir qué técnica de conteo corresponde.
Nota. Elaboración propia. Recurso de referencia para identificar la estructura de un problema antes de elegir una técnica de conteo.
Comienza siempre en la parte superior y sigue las preguntas en orden. No saltes directamente a las fórmulas.
La infografía incorpora también dos extensiones que permiten completar el mapa: permutaciones con elementos repetidos y combinaciones con repetición.
No es necesario dominar todavía esas dos expresiones. Su presencia permite que la imagen funcione como recurso de referencia más allá de los ejemplos básicos de esta parte.
Contar bien no consiste en recordar muchas fórmulas.
Consiste en comprender la estructura del problema antes de calcular.
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Graham, R. L., Knuth, D. E., & Patashnik, O. (1994). Concrete mathematics: A foundation for computer science (2nd ed.). Addison-Wesley.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Probabilidad condicional
¿Cómo cambia una probabilidad cuando recibimos nueva información?
La condición no cambia lo que ocurrió: cambia las posibilidades compatibles con lo que sabemos
Una probabilidad puede cambiar cuando disponemos de información adicional. Si sabemos que ocurrió un evento B, el espacio muestral original continúa siendo Ω, pero para responder la nueva pregunta solamente consideramos los resultados compatibles con B. Por eso B funciona como un nuevo universo de referencia. La probabilidad condicional formaliza exactamente esta idea.
6.191. Una información nueva cambia la pregunta
Lanzamos un dado equilibrado.
Antes de conocer el resultado:
Ω={1,2,3,4,5,6}.
Definimos:
A = «obtener un número mayor que 3».
Entonces:
A={4,5,6}.
Sin información adicional:
Ahora recibimos una información:
Esa información elimina de nuestra consideración los resultados incompatibles con ella.
6.192. El universo de referencia condicionado
Sea:
B = «obtener un número par».
B={2,4,6}.
Como sabemos que B ocurrió, 1, 3 y 5 ya no son compatibles con la información disponible.
Precisión conceptual. El espacio muestral original no desaparece: sigue siendo Ω. Lo que cambia es el conjunto de resultados relevantes para responder la pregunta bajo la información B.
B={2,4,6}
Nota. Elaboración propia. El azul identifica resultados compatibles con B; el verde destaca los que además pertenecen a A.
6.193. La notación P(A|B)
La probabilidad de que ocurra A sabiendo que ocurrió B se representa mediante:
«probabilidad de A dado B»
o
«probabilidad de A sabiendo que B ocurrió».
La barra vertical | no significa división. Separa el evento cuya probabilidad buscamos de la información que suponemos conocida.
6.194. Probabilidad condicional mediante conteo
En un espacio finito equiprobable, cuando sabemos que B ocurrió, los casos posibles dejan de ser todos los elementos de Ω.
Los casos posibles para la nueva pregunta son los elementos de B.
Entre ellos, los favorables a A son:
A∩B.
P(A)=|A|/|Ω|
El denominador representa todo Ω.
P(A|B)=|A∩B|/|B|
El denominador representa el universo condicionado B.
Nota. Elaboración propia.
6.195. Del conteo equiprobable a la fórmula general
En un espacio finito equiprobable:
P(A|B)=|A∩B|/|B|.
Multiplicamos numerador y denominador por 1/|Ω|:
P(A|B) = [|A∩B|/|Ω|] / [|B|/|Ω|].
Pero:
|A∩B|/|Ω|=P(A∩B)
y:
|B|/|Ω|=P(B).
Por tanto:
P(A|B)=P(A∩B)/P(B).
siempre que P(B)>0.
6.196. Definición general de probabilidad condicional
Para un evento B con:
P(B)>0,
definimos:
Probabilidad de que A y B ocurran conjuntamente.
Probabilidad del evento que estamos suponiendo conocido.
Dividir entre P(B) reajusta la escala de probabilidades dentro del universo condicionado B.
6.197. ¿Por qué necesitamos P(B)>0?
La fórmula contiene una división entre P(B).
Si:
P(B)=0,
la expresión:
P(A∩B)/P(B)
exigiría dividir entre cero.
En el nivel desarrollado en esta parte trabajaremos únicamente con condiciones B para las que P(B)>0.
6.198. Ejemplo 1 · Mayor que 3 sabiendo que es par
Recordemos:
A={4,5,6}
B={2,4,6}.
Entonces:
A∩B={4,6}.
Dentro de B existen tres resultados posibles y dos son favorables a A.
P(A|B)=2/3
≈0,6667≈66,67 %
Antes de conocer B:
P(A)=50 %.
Después de conocer B:
P(A|B)≈66,67 %.
Interpretación. La información «el resultado es par» aumenta la probabilidad de que el número sea mayor que 3 dentro de este modelo.
6.199. La información no cambia lo que ocurrió
Si el dado ya fue lanzado, existe un resultado particular.
Saber después que ese resultado fue par no modifica físicamente el resultado producido.
Un ensayo concreto produce un resultado particular. La probabilidad pertenece al modelo previo al resultado; el resultado observado pertenece a los datos. Cuando recibimos información adicional, actualizamos la pregunta probabilística, no el acontecimiento físico que ya ocurrió.
6.200. Condicionar no significa «ocurrió antes»
Los ejemplos de extracciones sucesivas pueden dar una impresión equivocada: que el evento escrito después de la barra siempre ocurrió primero en el tiempo.
No es así.
En P(A|B), la expresión «dado B» significa «bajo la información de que B es verdadero», no necesariamente «después de que B ocurrió».
Por ejemplo, una carta puede ser simultáneamente:
corazón
y
figura.
Preguntar P(figura | corazón) no significa que primero la carta «se volvió corazón» y después «se volvió figura». Estamos simplemente restringiendo nuestra atención a las cartas de corazones.
P(A|B)
probabilidad de A bajo la información B
B → A
pensar que B necesariamente ocurrió antes que A
Nota. Elaboración propia.
6.201. P(A|B) y P(B|A) preguntan cosas diferentes
Intercambiar A y B cambia cuál evento funciona como condición.
probabilidad de A sabiendo que B
probabilidad de B sabiendo que A
6.202. Ejemplo 2 · Figuras y corazones de una baraja
Consideremos una baraja estándar de 52 cartas.
Hay 12 figuras:
J, Q y K de los cuatro palos.
Tres de esas figuras son corazones.
Ahora invertimos la condición.
Existen 13 corazones y tres son figuras.
universo condicionado
12 figuras
3 son corazones
3/12
universo condicionado
13 corazones
3 son figuras
3/13
Nota. Elaboración propia.
6.203. Probabilidad condicional en una tabla de contingencia
Consideremos datos hipotéticos de 100 estudiantes.
Registramos si realizaron una actividad de preparación y si aprobaron una prueba.
Aprobaron: 42
No aprobaron: 18
Total: 60
Aprobaron: 20
No aprobaron: 20
Total: 40
Aprobaron: 62
No aprobaron: 38
Total general: 100
Nota. Datos hipotéticos creados exclusivamente con fines didácticos.
6.204. La condición indica el denominador
Preguntemos:
¿Cuál es la probabilidad de que un estudiante haya realizado preparación, sabiendo que aprobó?
La condición es:
«aprobó».
Por tanto, el nuevo universo contiene solamente los:
62 estudiantes que aprobaron.
De esos 62, 42 realizaron preparación.
P(preparación | aprobó)=42/62
≈0,6774≈67,74 %
aprobó
Nota. Elaboración propia con datos hipotéticos de la Tabla 6.20.
6.205. La condición inversa produce otra pregunta
Ahora buscamos:
P(aprobó | preparación).
La condición es «realizó preparación».
Nuestro universo condicionado tiene:
60 estudiantes.
De ellos aprobaron 42.
P(aprobó | preparación)=42/60
=0,70=70 %
Comparemos:
P(preparación | aprobó)≈67,74 %
P(aprobó | preparación)=70 %.
Las cifras son cercanas en este ejemplo, pero representan preguntas completamente diferentes.
6.206. Asociación probabilística no significa causalidad
En los datos anteriores existe una diferencia entre probabilidades condicionadas.
Sin embargo, una tabla como esta no demuestra que realizar la preparación haya causado la aprobación.
Una probabilidad condicional puede describir asociación. Establecer causalidad exige información adicional sobre el diseño del estudio, posibles variables de confusión y otras explicaciones.
Una diferencia entre P(A|B) y P(A|Bc) puede ser informativa, pero por sí sola no identifica la causa de esa diferencia.
6.207. Experimentos sin reemplazo: la información cambia el siguiente estado
La probabilidad condicional aparece de manera natural en experimentos desarrollados por etapas.
Consideremos una urna con:
5 bolas rojas y 3 bolas azules.
Extraemos una bola y no la devolvemos. Después realizamos una segunda extracción.
Antes de comenzar:
P(primera roja)=5/8.
6.208. Ejemplo 3 · ¿Qué ocurre después de la primera extracción?
Si sabemos que la primera bola fue roja, quedan:
4 rojas + 3 azules = 7 bolas.
En cambio, si sabemos que la primera bola fue azul, quedan:
5 rojas + 2 azules = 7 bolas.
La primera extracción modifica la composición de la urna. Por eso la información sobre el primer resultado modifica la probabilidad correspondiente a la segunda extracción.
P(R₂|R₁)=4/7
P(R₂|A₁)=5/7
Nota. Elaboración propia.
6.209. El complemento dentro de una condición
Una vez sabemos que B ocurrió, dentro de B solamente tenemos dos posibilidades respecto de A:
A ocurre
o
A no ocurre.
La regla del complemento continúa funcionando, pero ahora dentro del universo condicionado B.
6.210. Una probabilidad condicional sigue siendo una probabilidad
Si fijamos un evento B con P(B)>0, la asignación:
A → P(A|B)
conserva las propiedades fundamentales de una probabilidad.
Conceptualmente, podemos pensar que estamos construyendo una nueva perspectiva probabilística cuyo universo relevante es B.
6.211. Una identidad que abre la siguiente puerta
Partimos de:
P(A|B)=P(A∩B)/P(B).
Si P(B)>0, multiplicamos ambos lados por P(B):
También:
No desarrollaremos todavía esta identidad como regla de cálculo. En la Parte 8 veremos por qué se convierte en la regla de multiplicación y qué ocurre cuando conocer A no modifica la probabilidad de B.
6.212. «Dado B» no significa «A y B»
Estas expresiones están relacionadas, pero no representan lo mismo.
probabilidad de A sin condición adicional
probabilidad de que A y B ocurran conjuntamente
probabilidad de A bajo la información B
probabilidad de B bajo la información A
6.213. Aplicación · Monitoreo de temperatura y vibración
Supongamos que un sistema industrial registra 500 intervalos de funcionamiento.
En 80 intervalos:
la temperatura superó 80 °C.
De esos 80 intervalos, en 18 también se registró una alarma de vibración.
Si definimos:
T = «temperatura superior a 80 °C»
V = «alarma de vibración»,
entonces:
Interpretación. Entre los intervalos con temperatura superior a 80 °C, el 22,5 % presentó también alarma de vibración.
Este resultado no demuestra que la temperatura alta cause la vibración. Describe una asociación en los datos hipotéticos.
Nota. Datos hipotéticos creados exclusivamente con fines didácticos.
6.214. Actividad guiada · Leer antes de calcular
Una población hipotética de 120 personas se clasifica así:
72 utilizan transporte público.
De esas 72, 45 llegan antes de las 8:00.
Entre las 48 que no utilizan transporte público, 36 llegan antes de las 8:00.
1. ¿Cuál es P(llegar antes de las 8 | transporte público)?
2. ¿Cuál es P(llegar antes de las 8 | no transporte público)?
3. ¿Qué denominador corresponde en cada caso?
4. ¿Estos resultados demuestran que el medio de transporte causa la diferencia observada?
Ver solución
1. 45/72=0,625=62,5 %.
2. 36/48=0,75=75 %.
3. Los denominadores son 72 y 48 porque cada condición define su propio universo de referencia.
4. No. Los resultados describen una asociación, no prueban causalidad.
Nota. Datos hipotéticos creados exclusivamente con fines didácticos.
6.215. Errores frecuentes
Usar todo Ω como denominador después de conocer B.
La condición B define el universo relevante para esa pregunta.
Confundir P(A|B) con P(B|A).
Invertir la condición cambia la pregunta y el denominador.
Confundir P(A|B) con P(A∩B).
Una es condicional; la otra es una probabilidad conjunta.
Pensar que la barra vertical indica orden temporal.
Indica información condicionante.
Ignorar si existe reemplazo.
Sin reemplazo, el estado del experimento puede cambiar.
Interpretar una asociación condicional como prueba causal.
Asociación y causalidad son conceptos diferentes.
6.216. Práctica de dificultad creciente
En un dado equilibrado:
A = «obtener 6»
B = «obtener un número par».
Calcula P(A|B).
Ver solución
B={2,4,6}.
A∩B={6}.
P(A|B)=1/3≈33,33 %.
Se sabe que:
P(B)=0,40
P(A∩B)=0,18.
Calcula P(A|B).
Ver solución
P(A|B)=P(A∩B)/P(B).
P(A|B)=0,18/0,40=0,45=45 %.
Una urna contiene 6 bolas blancas y 4 negras.
Se extrae una bola sin reemplazo. Sabemos que la primera fue blanca.
¿Cuál es la probabilidad de que la segunda sea blanca?
Ver solución
Después de retirar una blanca quedan 5 blancas y 4 negras: 9 bolas en total.
P(segunda blanca | primera blanca)=5/9≈55,56 %.
Para un evento B con P(B)>0, explica por qué:
P(B|B)=1.
Ver orientación
P(B|B)=P(B∩B)/P(B).
Como B∩B=B:
P(B|B)=P(B)/P(B)=1.
6.217. Comprueba lo aprendido
1. ¿Qué significa condicionar a un evento B?
2. ¿Cómo se lee P(A|B)?
3. ¿Qué representa la barra vertical?
4. En un espacio finito equiprobable, ¿cómo se calcula P(A|B)?
5. Escribe la definición general de P(A|B).
6. ¿Qué condición debe cumplir P(B)?
7. ¿Por qué P(A|B) y P(B|A) pueden ser diferentes?
8. ¿Qué significa P(A∩B)?
9. Explica la diferencia entre P(A|B) y P(A∩B).
10. ¿Condicionar significa necesariamente que B ocurrió antes que A?
11. ¿Cómo se calcula P(Ac|B)?
12. ¿Por qué un experimento sin reemplazo suele producir probabilidades condicionales diferentes?
13. ¿Una asociación observada mediante probabilidades condicionales demuestra causalidad?
14. ¿Qué significa que B funcione como nuevo universo de referencia?
15. ¿Qué identidad se obtiene al despejar P(A∩B) de la definición de P(A|B)?
Ver respuestas breves
1. Trabajar bajo la información de que B ocurrió.
2. Probabilidad de A dado B.
3. Separa el evento buscado de la condición conocida.
4. |A∩B|/|B|.
5. P(A|B)=P(A∩B)/P(B).
6. P(B)>0.
7. Porque utilizan universos condicionados diferentes.
8. Probabilidad de que A y B ocurran conjuntamente.
9. Una es condicional y la otra es una probabilidad de intersección.
10. No. La condición expresa información, no necesariamente orden temporal.
11. 1−P(A|B).
12. Porque retirar un elemento cambia las posibilidades restantes.
13. No. La asociación no constituye por sí sola una demostración causal.
14. Que solamente los resultados compatibles con B se consideran para la nueva pregunta.
15. P(A∩B)=P(B)P(A|B).
6.218. Mapa conceptual
A∩B
Nota. Elaboración propia.
6.219. Síntesis
La probabilidad condicional incorpora información conocida.
Cuando sabemos que B ocurrió, el espacio original continúa siendo Ω, pero B funciona como nuevo universo de referencia para la pregunta condicionada.
La notación:
P(A|B)
significa «probabilidad de A dado B».
En un espacio finito equiprobable:
P(A|B)=|A∩B|/|B|.
En general, para P(B)>0:
P(A|B)=P(A∩B)/P(B).
Invertir la condición cambia la pregunta:
P(A|B)≠P(B|A)
en general.
Una condición tampoco representa necesariamente una secuencia temporal. Expresa la información bajo la cual evaluamos la probabilidad.
En experimentos sin reemplazo, las posibilidades posteriores pueden cambiar porque cambia el estado del sistema.
Dentro de una condición sigue funcionando la regla del complemento:
P(Ac|B)=1−P(A|B).
Además, de la definición se obtiene:
P(A∩B)=P(B)P(A|B).
Finalmente, una asociación observada mediante probabilidades condicionales no demuestra por sí sola una relación causal.
6.220. Una pregunta nueva aparece
Hemos visto situaciones en las que conocer A modifica la probabilidad de B.
Es decir, puede suceder que:
Pero aparece ahora una posibilidad especialmente importante:
Es decir:
¿qué ocurre cuando conocer A no cambia nuestra probabilidad de B?
Esa relación recibe un nombre fundamental:
independencia.
Y será precisamente el punto de partida de la siguiente parte.
Condicionar no cambia el acontecimiento.
Cambia la información desde la cual construimos la pregunta probabilística.
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Independencia y regla de multiplicación
¿Cuándo conocer un evento cambia la probabilidad de otro?
De la probabilidad condicional a una de las relaciones más importantes de la teoría de probabilidad
La probabilidad condicional nos permite describir cómo cambia una probabilidad cuando conocemos información adicional. Esa misma idea conduce a la regla de multiplicación. Además, existe una situación especial: conocer que ocurrió A puede no modificar en absoluto la probabilidad de B. Cuando esto sucede, decimos que los eventos son independientes. La independencia no debe suponerse por comodidad: es una propiedad del modelo que debe justificarse.
6.221. Volvamos a una identidad de la Parte 7
En la parte anterior definimos, para P(A)>0:
P(B|A)=P(A∩B)/P(A).
Ahora multiplicamos ambos lados por P(A):
Si comenzamos en cambio con P(A|B), obtenemos:
Ambas expresiones calculan exactamente la misma probabilidad: la probabilidad de que ocurran A y B.
6.222. Derivación de la regla de multiplicación
Partimos de la definición:
P(B|A)=P(A∩B)/P(A),
donde P(A)>0.
Multiplicamos ambos lados por P(A):
P(A)P(B|A)=P(A∩B).
Reordenando:
P(A∩B)=P(A)P(B|A).
De manera análoga:
P(A∩B)=P(B)P(A|B).
Esta regla es general. No requiere que A y B sean independientes.
6.223. La regla general de multiplicación
P(A∩B)=P(A)P(B|A)
=P(B)P(A|B).
Podemos leer la primera expresión así:
P(A)
probabilidad de que ocurra A.
P(B|A)
probabilidad de B bajo la información de que A ocurrió.
La multiplicación representa entonces un recorrido:
primero A,
y dentro de esa situación,
también B.
P(A)
P(B|A)
P(A∩B)=P(A)P(B|A)
Nota. Elaboración propia.
6.224. Ejemplo 1 · Dos bolas rojas sin reemplazo
Una urna contiene:
5 bolas rojas y 3 azules.
Extraemos dos bolas sin reemplazo.
Sea:
R₁ = «la primera bola es roja»
R₂ = «la segunda bola es roja».
Tenemos:
P(R₁)=5/8.
Si la primera fue roja, quedan cuatro rojas entre siete bolas:
P(R₂|R₁)=4/7.
Por la regla de multiplicación:
P(R₁∩R₂)=(5/8)(4/7)
=20/56=5/14≈35,71 %
El segundo factor no es 5/8 porque la primera extracción modificó la composición de la urna.
6.225. Multiplicar no significa multiplicar siempre P(A) por P(B)
Un error muy frecuente consiste en escribir automáticamente:
P(A∩B)=P(A)P(B).
Esa expresión no es válida para cualquier par de eventos.
La regla general es: P(A∩B)=P(A)P(B|A). Solo en una situación especial podremos sustituir P(B|A) por P(B).
Esa situación especial es la independencia.
6.226. ¿Qué significa independencia?
En la Parte 7 terminamos con una pregunta:
Significa que conocer que A ocurrió no modifica la probabilidad de B.
En ese caso, A no aporta información probabilística sobre B.
cuando P(A)>0.
6.227. Definición matemática de independencia
La definición fundamental de independencia entre A y B es:
Esta definición es especialmente importante porque sigue teniendo sentido incluso si alguno de los eventos tiene probabilidad cero.
Si P(A)>0 y A y B son independientes:
P(B|A)=P(B).
Si P(B)>0:
P(A|B)=P(A).
conocer A cambia la probabilidad de B
P(B|A)≠P(B)
usamos P(A)P(B|A)
conocer A no cambia la probabilidad de B
P(B|A)=P(B)
usamos P(A)P(B)
Nota. Elaboración propia.
6.228. Ejemplo 2 · Un dado y una moneda
Lanzamos una moneda equilibrada y un dado equilibrado.
Definimos:
A = «obtener cara»
B = «obtener un 6».
Tenemos:
P(A)=1/2
P(B)=1/6.
Hay 12 pares equiprobables posibles entre el resultado de la moneda y el dado. Solamente uno corresponde a:
(cara,6).
Por tanto:
P(A∩B)=1/12
P(A)P(B)=(1/2)(1/6)=1/12.
Se cumple:
P(A∩B)=P(A)P(B).
En este modelo, A y B son independientes.
6.229. Ejemplo 3 · Sin reemplazo produce dependencia
Volvamos a la urna con cinco bolas rojas y tres azules.
Antes de extraer la primera bola:
P(R₂)=5/8.
Pero si sabemos que la primera fue roja:
P(R₂|R₁)=4/7.
Como:
conocer R₁ modifica la probabilidad de R₂.
Por tanto, las dos extracciones no son independientes.
6.230. Independencia no significa incompatibilidad
Estos dos conceptos suelen confundirse, pero expresan ideas muy diferentes.
Saber que A ocurrió no cambia la probabilidad de B.
P(A∩B)=P(A)P(B)
A y B pueden ocurrir simultáneamente.
A y B no pueden ocurrir simultáneamente.
A∩B=∅
P(A∩B)=0.
Si A y B son incompatibles y ambos tienen probabilidad positiva, saber que A ocurrió hace imposible B.
P(B|A)=0,
mientras que:
P(B)>0.
Por tanto, no son independientes.
Matiz avanzado. Dos eventos incompatibles pueden satisfacer formalmente la condición de independencia si al menos uno tiene probabilidad cero. En los ejemplos elementales con probabilidades positivas, incompatibilidad e independencia son claramente diferentes.
6.231. Si A y B son independientes, también lo son ciertos complementos
Si A y B son independientes:
P(A∩B)=P(A)P(B).
También resultan independientes:
Por ejemplo:
P(Ac∩B)=P(Ac)P(B).
6.232. Aplicación · Confiabilidad de dos componentes
Supongamos un modelo hipotético en el que dos componentes A y B pueden fallar durante cierto intervalo.
El modelo asigna:
P(falla A)=0,02
P(falla B)=0,03.
Si el modelo justifica que las fallas son independientes:
P(fallan ambos)=(0,02)(0,03)
=0,0006=0,06 %
La frase decisiva es «si el modelo justifica independencia». Si ambos componentes pueden verse afectados por una misma temperatura, vibración, alimentación eléctrica o defecto de fabricación, sus fallas podrían estar relacionadas.
Nota. Valores hipotéticos creados exclusivamente con fines didácticos.
6.233. Independencia es una propiedad del modelo, no una comodidad de cálculo
La expresión:
P(A∩B)=P(A)P(B)
es muy sencilla.
Precisamente por eso existe la tentación de utilizarla siempre.
La independencia debe provenir de:
Incluso cuando los datos parecen compatibles con independencia, eso no significa que la independencia haya sido demostrada de manera absoluta.
6.234. Datos compatibles con independencia
Supongamos que observamos 1.000 ensayos hipotéticos.
Registramos:
A ocurrió 100 veces
B ocurrió 200 veces
A∩B ocurrió 20 veces.
Las frecuencias relativas son:
f(A)=0,10
f(B)=0,20
f(A∩B)=0,02.
Además:
Estos datos son compatibles con un modelo de independencia.
Las frecuencias observadas pertenecen a los datos. La independencia pertenece al modelo. Una coincidencia empírica puede apoyar el modelo, pero no convierte una muestra finita en una demostración exacta de independencia.
Nota. Datos simulados con fines didácticos.
6.235. Tres eventos sucesivos
Ahora queremos que ocurran:
A, B y C.
Podemos construir la probabilidad paso a paso:
primero A;
después B bajo la información A;
finalmente C bajo la información de que A y B ya ocurrieron.
6.236. Derivación de la regla de la cadena para tres eventos
Comenzamos con:
P(A∩B)=P(A)P(B|A).
Consideramos ahora A∩B como el evento que ya ocurrió.
P(A∩B∩C)=P(A∩B)P(C|A∩B).
Sustituimos:
P(A∩B)=P(A)P(B|A).
Así obtenemos:
P(A∩B∩C)=P(A)P(B|A)P(C|A∩B).
P(A)
P(B|A)
P(C|A∩B)
Nota. Elaboración propia.
6.237. Ejemplo 4 · Tres bolas blancas sin reemplazo
Una urna contiene:
6 bolas blancas y 4 negras.
Extraemos tres bolas sin reemplazo.
La probabilidad de obtener tres blancas es:
6/10
por
5/9
por
4/8.
P=(6/10)(5/9)(4/8)
=1/6≈16,67 %
Cada factor cambia porque no existe reemplazo.
6.238. Si varios eventos son independientes
Si varios eventos son independientes en el sentido apropiado, la regla de la cadena se simplifica.
Para tres eventos mutuamente independientes:
Para n eventos independientes:
P(A₁∩A₂∩···∩Aₙ) = P(A₁)P(A₂)···P(Aₙ).
6.239. Ejemplo 5 · Cinco lanzamientos de una moneda equilibrada
Modelamos los lanzamientos como independientes.
La probabilidad de obtener cara en cada lanzamiento es:
1/2.
Para obtener cinco caras:
(1/2)⁵
=1/32=0,03125=3,125 %
La independencia permite conservar 1/2 como probabilidad en cada etapa del modelo.
6.240. Independencia por pares no siempre significa independencia conjunta
Con tres o más eventos aparece una distinción más sutil.
Tres eventos pueden ser independientes por pares sin ser independientes en conjunto.
Lanzamos dos monedas equilibradas y definimos:
A = «la primera es cara»
B = «la segunda es cara»
C = «las dos monedas muestran el mismo resultado».
Cada evento tiene probabilidad:
1/2.
Además, cada intersección de dos eventos tiene probabilidad 1/4, que coincide con:
(1/2)(1/2)=1/4.
Por tanto, son independientes por pares.
Sin embargo:
P(A∩B∩C)=1/4,
mientras que:
P(A)P(B)P(C)=1/8.
Para tres o más eventos, verificar solamente las parejas no siempre basta para establecer independencia mutua.
6.241. «Al menos uno» cuando existe independencia
En la Parte 5 aprendimos que:
P(al menos uno)=1−P(ninguno).
Ahora podemos completar esta herramienta cuando los eventos son independientes.
Supongamos dos dispositivos independientes con probabilidades hipotéticas de alarma:
P(A)=0,10
P(B)=0,05.
La probabilidad de que A no active alarma es 0,90 y la de que B no active alarma es 0,95.
Bajo independencia:
P(ninguna alarma)=(0,90)(0,95)=0,855.
P(al menos una alarma)=1−0,855
=0,145=14,5 %
En un sistema real, dos sensores pueden responder a una misma perturbación. Por tanto, la independencia debe verificarse o justificarse antes de utilizar esta multiplicación.
Nota. Valores hipotéticos creados exclusivamente con fines didácticos.
6.242. Tabla de lectura rápida
P(A∩B)=P(A)P(B|A)
funciona aunque exista dependencia.
P(A∩B)=P(A)P(B)
conocer A no modifica B.
P(B|A)≠P(B)
debemos conservar la probabilidad condicionada.
P(A∩B)=0
los eventos no pueden ocurrir juntos.
6.243. Errores frecuentes
Escribir P(A∩B)=P(A)P(B) automáticamente.
Esa simplificación requiere independencia.
Confundir independencia con incompatibilidad.
Son conceptos diferentes.
Suponer independencia porque facilita el cálculo.
La independencia debe justificarse en el modelo.
Olvidar actualizar la probabilidad en un experimento sin reemplazo.
Las posibilidades posteriores pueden cambiar.
Confundir igualdad empírica aproximada con prueba absoluta de independencia.
Datos y modelo pertenecen a niveles diferentes.
Usar probabilidades marginales en cada etapa de una cadena dependiente.
Debemos condicionar a la información acumulada.
6.244. Práctica de dificultad creciente
Se sabe que:
P(A)=0,40
P(B|A)=0,30.
Calcula P(A∩B).
Ver solución
P(A∩B)=(0,40)(0,30)=0,12=12 %.
A y B son independientes.
P(A)=0,25
P(B)=0,60.
Calcula P(A∩B).
Ver solución
P(A∩B)=(0,25)(0,60)=0,15=15 %.
Una urna contiene 7 bolas verdes y 3 amarillas. Se extraen dos bolas sin reemplazo.
Calcula la probabilidad de obtener dos verdes.
Ver solución
P(V₁)=7/10.
P(V₂|V₁)=6/9.
P(V₁∩V₂)=(7/10)(6/9)=42/90=7/15≈46,67 %.
Supón que A y B son independientes. Demuestra que:
Ac y B también son independientes.
Ver orientación
Como:
P(B)=P(A∩B)+P(Ac∩B),
entonces:
P(Ac∩B)=P(B)−P(A)P(B).
Factorizamos:
P(Ac∩B) = [1−P(A)]P(B) = P(Ac)P(B).
6.245. Actividad · ¿Independientes, dependientes o incompatibles?
Clasifica cada situación antes de realizar cualquier cálculo.
A. Lanzar una moneda y un dado; A = «cara», B = «6».
B. Extraer dos cartas sin reemplazo; A = «primera es as», B = «segunda es as».
C. En un solo dado; A = «sale 2», B = «sale 5».
D. Dos componentes de un sistema afectados por una misma fuente de sobrecalentamiento.
E. Dos lanzamientos de una moneda que el modelo considera independientes.
Ver orientación
A. Independientes en el modelo usual.
B. Dependientes porque no existe reemplazo.
C. Incompatibles: en un solo lanzamiento no pueden ocurrir ambos.
D. No conviene suponer independencia: existe una posible causa común.
E. Independientes bajo el modelo indicado.
6.246. Comprueba lo aprendido
1. Escribe la regla general de multiplicación para dos eventos.
2. ¿Necesita esa regla que los eventos sean independientes?
3. ¿Qué significa que P(B|A)=P(B)?
4. Escribe la definición fundamental de independencia de A y B.
5. ¿Por qué P(A)P(B) no puede utilizarse automáticamente?
6. ¿Cuál es la diferencia entre independencia e incompatibilidad?
7. Si A y B son independientes y tienen probabilidad positiva, ¿qué relación existe entre P(A|B) y P(A)?
8. ¿Por qué dos extracciones sin reemplazo suelen ser dependientes?
9. Escribe la regla de la cadena para tres eventos.
10. ¿Cómo se simplifica esa regla si los tres eventos son mutuamente independientes?
11. ¿Qué significa independencia por pares?
12. ¿Independencia por pares garantiza siempre independencia mutua?
13. ¿Por qué la independencia debe considerarse una propiedad del modelo?
14. ¿Una coincidencia exacta de frecuencias en una muestra demuestra independencia?
15. Si A y B son independientes, ¿qué puede afirmarse sobre Ac y B?
Ver respuestas breves
1. P(A∩B)=P(A)P(B|A).
2. No.
3. Que conocer A no modifica la probabilidad de B.
4. P(A∩B)=P(A)P(B).
5. Porque esa simplificación requiere independencia.
6. Independencia significa ausencia de cambio probabilístico; incompatibilidad significa que no pueden ocurrir juntos.
7. P(A|B)=P(A).
8. Porque la primera extracción modifica las posibilidades restantes.
9. P(A∩B∩C)=P(A)P(B|A)P(C|A∩B).
10. P(A)P(B)P(C).
11. Que cada pareja de eventos satisface la condición de independencia.
12. No.
13. Porque debe representar adecuadamente cómo se relacionan los eventos en el fenómeno estudiado.
14. No. Puede ser evidencia compatible, pero no una demostración absoluta.
15. También son independientes.
6.247. Mapa conceptual
P(B|A)
P(A∩B)=P(A)P(B|A)
P(B|A)≠P(B)
dependencia
P(B|A)=P(B)
independencia
Nota. Elaboración propia.
6.248. Síntesis
La regla general de multiplicación se obtiene directamente de la definición de probabilidad condicional:
P(A∩B)=P(A)P(B|A).
También puede escribirse:
P(A∩B)=P(B)P(A|B).
Estas expresiones son válidas incluso cuando los eventos son dependientes.
Dos eventos A y B son independientes cuando:
P(A∩B)=P(A)P(B).
Si las probabilidades condicionantes son positivas, esto equivale a afirmar que:
P(B|A)=P(B)
y:
P(A|B)=P(A).
Independencia no significa incompatibilidad. Los eventos independientes pueden ocurrir simultáneamente.
Para tres eventos:
P(A∩B∩C)=P(A)P(B|A)P(C|A∩B).
Si existe independencia mutua:
P(A∩B∩C)=P(A)P(B)P(C).
Finalmente, la independencia no debe suponerse porque simplifique una fórmula. Debe formar parte de un modelo razonablemente justificado por la estructura del experimento, el conocimiento del fenómeno o evidencia compatible.
6.249. Una nueva pregunta: varios caminos hacia el mismo evento
Hasta ahora hemos seguido recorridos concretos:
ocurre A
y después
ocurre B.
Pero muchos problemas pueden alcanzar un mismo resultado por varios caminos diferentes.
Por ejemplo, una alarma puede producirse bajo distintos estados del sistema; una persona puede pertenecer a diferentes grupos de origen; o un resultado puede alcanzarse después de distintas primeras etapas.
Para responder necesitaremos dos herramientas:
particiones del espacio muestral
y
árboles de probabilidad.
Multiplicar probabilidades no es una receta automática.
Primero debemos comprender qué información cambia y si el modelo realmente justifica independencia.
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Probabilidad total y árboles de probabilidad
Multiplicar dentro de cada camino · sumar entre caminos
Particiones · rutas · ponderaciones · probabilidad total
Un mismo evento puede alcanzarse por caminos diferentes. Si esos caminos representan casos mutuamente excluyentes, podemos calcular la probabilidad de cada ruta y después reunirlas mediante una suma. De esta estructura nace el teorema de la probabilidad total. La regla práctica que guiará toda esta parte es: multiplicar a lo largo de cada camino y sumar entre caminos disjuntos.
6.250. Un acontecimiento puede tener varios caminos
Imaginemos una empresa que fabrica una misma pieza utilizando dos máquinas.
Una pieza defectuosa podría provenir de la máquina 1 o de la máquina 2.
Aparecen entonces dos caminos diferentes hacia un mismo evento:
M₁ → defectuosa
o
M₂ → defectuosa.
Nota. Todos los datos de este ejemplo son hipotéticos y se utilizan exclusivamente con fines didácticos.
6.251. Antes del árbol: necesitamos una partición
Una colección de eventos:
A₁, A₂, …, Aₙ
forma una partición del espacio muestral Ω cuando cumple simultáneamente dos condiciones.
Dos partes diferentes no pueden contener simultáneamente el mismo resultado.
Aᵢ∩Aⱼ=∅, si i≠j
Entre todas deben cubrir completamente el espacio muestral.
A₁∪A₂∪···∪Aₙ=Ω
Una partición divide Ω en categorías mutuamente excluyentes y exhaustivas: cada resultado pertenece a una sola parte y ningún resultado queda por fuera.
Nota. Elaboración propia. Las regiones están diferenciadas mediante etiquetas y no únicamente por color.
6.252. Las dos máquinas forman una partición
Definimos:
M₁ = «la pieza proviene de la máquina 1»
M₂ = «la pieza proviene de la máquina 2».
Si cada pieza es fabricada exactamente por una de las dos máquinas:
M₁∩M₂=∅
M₁∪M₂=Ω
{M₁,M₂} es una partición de Ω.
Además:
P(M₁)+P(M₂)=0,60+0,40=1.
6.253. Añadimos las probabilidades dentro de cada máquina
Sea:
D = «la pieza es defectuosa».
Supongamos:
La expresión:
P(D|M₁)=0,02
significa que, dentro de las piezas producidas por M₁, la probabilidad de defecto del modelo es 2 %.
De manera análoga:
P(D|M₂)=0,05
significa que entre las piezas provenientes de M₂ la probabilidad de defecto es 5 %.
6.254. Construimos el árbol de probabilidad
El árbol organiza el problema por etapas.
En la primera etapa identificamos qué máquina produjo la pieza. En la segunda consideramos si la pieza es defectuosa o no defectuosa.
P(D|M₁)=0,02
0,98
P(D|M₂)=0,05
0,95
Nota. Elaboración propia. D = defectuosa; Dc = no defectuosa. Datos hipotéticos.
6.255. Regla 1 · Las ramas que salen de un nodo suman 1
Desde el nodo inicial solamente hay dos posibilidades:
M₁ o M₂.
0,60+0,40=1.
Si sabemos que la pieza procede de M₁:
0,02+0,98=1.
Si procede de M₂:
0,05+0,95=1.
Las ramas que salen de un nodo deben representar alternativas mutuamente excluyentes y exhaustivas desde ese punto. Por eso sus probabilidades suman 1.
6.256. Regla 2 · A lo largo de un camino multiplicamos
Consideremos la ruta:
M₁ → D.
Representa el acontecimiento:
«la pieza procede de M₁ y es defectuosa».
Por tanto:
M₁∩D.
Aplicamos la regla de multiplicación estudiada en la Parte 8:
P(M₁∩D)=P(M₁)P(D|M₁)
=0,60×0,02
=0,012=1,2 %
Ahora calculamos la segunda ruta:
P(M₂∩D)=P(M₂)P(D|M₂)
=0,40×0,05
=0,020=2,0 %
6.257. Regla 3 · Entre caminos disjuntos sumamos
Una pieza defectuosa puede llegar al evento D mediante:
M₁∩D
o mediante
M₂∩D.
Esos caminos son mutuamente excluyentes porque una misma pieza, dentro de este modelo, no puede provenir simultáneamente de las dos máquinas.
Por tanto:
P(D)=0,012+0,020
P(D)=0,032=3,2 %
MULTIPLICAMOS
obtenemos la probabilidad de una ruta completa
SUMAMOS
reunimos todos los caminos disjuntos que producen D
Nota. Elaboración propia.
6.258. El cálculo completo como suma de contribuciones
0,60×0,02
0,012
0,40×0,05
0,020
0,012+0,020
0,032
La máquina 2 produce menos piezas que la máquina 1, pero aporta una mayor cantidad probabilística al evento D porque su tasa condicional de defecto es mayor.
6.259. De los caminos al teorema
Supongamos que A₁ y A₂ forman una partición de Ω.
Todo resultado perteneciente a B debe encontrarse dentro de A₁ o dentro de A₂.
Por tanto:
Además, B∩A₁ y B∩A₂ son disjuntos.
Esa descomposición contiene la idea esencial del teorema de la probabilidad total.
6.260. Teorema de la probabilidad total para dos casos
Sean A₁ y A₂ una partición de Ω:
A₁∩A₂=∅
A₁∪A₂=Ω.
Como todo resultado de B pertenece a una de las dos partes:
B=(B∩A₁)∪(B∩A₂).
Las dos intersecciones son disjuntas. Por aditividad:
P(B)=P(B∩A₁)+P(B∩A₂).
Aplicamos la regla de multiplicación:
P(B∩A₁)=P(A₁)P(B|A₁)
P(B∩A₂)=P(A₂)P(B|A₂).
Sustituimos:
P(B)=P(A₁)P(B|A₁)+P(A₂)P(B|A₂).
6.261. Teorema general de la probabilidad total
Supongamos que:
A₁,A₂,…,Aₙ
forman una partición de Ω y que, para utilizar las probabilidades condicionales en la forma elemental desarrollada aquí:
P(Aᵢ)>0.
Entonces, para cualquier evento B:
P(B)=P(A₁)P(B|A₁)+P(A₂)P(B|A₂)+···+P(Aₙ)P(B|Aₙ)
P(B)=Σ P(Aᵢ)P(B|Aᵢ)
La suma se realiza para:
i=1,2,…,n.
6.262. Demostración general del teorema
Como A₁,A₂,…,Aₙ forman una partición:
Ω=A₁∪A₂∪···∪Aₙ.
Intersectamos ambos lados con B:
B∩Ω=B∩(A₁∪A₂∪···∪Aₙ).
Como B∩Ω=B y la intersección se distribuye sobre la unión:
B=(B∩A₁)∪(B∩A₂)∪···∪(B∩Aₙ).
Debido a que los Aᵢ son mutuamente excluyentes, también lo son:
B∩A₁, B∩A₂, …, B∩Aₙ.
Aplicamos aditividad:
P(B)=ΣP(B∩Aᵢ).
Para cada término:
P(B∩Aᵢ)=P(Aᵢ)P(B|Aᵢ).
Sustituimos:
P(B)=ΣP(Aᵢ)P(B|Aᵢ).
6.263. ¿Qué significa realmente «probabilidad total»?
La expresión probabilidad total no designa una nueva clase de probabilidad.
Significa que calculamos P(B) reuniendo todas las formas disjuntas mediante las cuales B puede ocurrir.
1. Dividimos el problema en casos que formen una partición.
2. Calculamos P(B|Aᵢ) dentro de cada caso.
3. Multiplicamos por el peso P(Aᵢ) correspondiente.
4. Sumamos las contribuciones de todos los casos.
6.264. La probabilidad total es un promedio ponderado
En el ejemplo de las máquinas:
P(D|M₁)=0,02
P(D|M₂)=0,05.
Podríamos sentir la tentación de calcular:
Pero ese promedio simple supone implícitamente que las dos máquinas tienen el mismo peso.
No es nuestro caso:
P(M₁)=0,60 y P(M₂)=0,40.
0,60(0,02)+0,40(0,05)
=0,012+0,020
=0,032.
La probabilidad total es un promedio ponderado de las probabilidades condicionales P(B|Aᵢ), donde los pesos son las probabilidades P(Aᵢ).
0,60
×
0,02
contribución = 0,012
0,40
×
0,05
contribución = 0,020
Nota. Elaboración propia.
6.265. Comprenderlo mediante 10.000 piezas
Podemos visualizar el mismo modelo utilizando frecuencias naturales hipotéticas.
Imaginemos:
10.000 piezas.
Producción: 6.000
Tasa de defecto: 2 %
Defectuosas: 120
Producción: 4.000
Tasa de defecto: 5 %
Defectuosas: 200
Producción: 10.000
Defectuosas: 320
Proporción: 320/10.000
Obtenemos exactamente el mismo valor del modelo calculado mediante el árbol.
Nota. Las 10.000 piezas son una representación hipotética para visualizar el modelo; no son observaciones de una fábrica real.
6.266. Ejemplo 2 · Forma de llegar al colegio
Supongamos que los estudiantes llegan al colegio mediante:
50 %
30 %
20 %
Además:
P(retardo | bus)=0,12
P(retardo | caminando)=0,04
P(retardo | bicicleta)=0,08.
Nota. Datos hipotéticos creados exclusivamente con fines didácticos.
6.267. Calculamos el retardo por caminos
bus y retardo
0,50×0,12=0,060
caminando y retardo
0,30×0,04=0,012
bicicleta y retardo
0,20×0,08=0,016
Los tres caminos son disjuntos dentro del modelo porque cada estudiante ha sido clasificado en una sola forma de llegada.
Sumamos:
P(retardo)=0,060+0,012+0,016
P(retardo)=0,088=8,8 %
6.268. Comprobación mediante el complemento
Si:
P(retardo)=0,088,
entonces:
P(no retardo)=1−0,088.
También podríamos obtener 91,2 % sumando los tres caminos correspondientes a una llegada sin retardo.
6.269. La probabilidad total no requiere independencia
Después de estudiar independencia en la Parte 8, podría surgir una confusión:
La respuesta es:
No.
Precisamente utilizamos:
P(B|Aᵢ)
porque la probabilidad de B puede ser diferente en cada parte.
El teorema de la probabilidad total utiliza probabilidades condicionales. No necesita que B sea independiente de los eventos de la partición.
6.270. Los árboles pueden tener más de dos etapas
Un árbol puede extenderse a tres, cuatro o más etapas.
En la Parte 8 estudiamos la regla de la cadena. Aquí solo necesitamos recordar su interpretación:
Lo nuevo en esta parte no es volver a demostrar esa multiplicación, sino aprender a reunir diferentes rutas completas cuando desembocan en un mismo evento final.
6.271. No se suman directamente caminos que se superponen
La regla «sumar caminos» funciona directamente cuando las rutas representan eventos mutuamente excluyentes.
Si dos supuestas rutas pudieran contener el mismo resultado, aparecería un problema de doble conteo.
Un árbol correctamente construido evita este problema: las alternativas que salen de cada nodo deben definirse de forma mutuamente excluyente y exhaustiva.
6.272. ¿Qué ocurre si una parte tiene probabilidad cero?
La descomposición:
P(B)=ΣP(B∩Aᵢ)
continúa teniendo sentido aunque alguna parte tenga probabilidad cero.
Sin embargo, la definición elemental:
P(B|Aᵢ)=P(B∩Aᵢ)/P(Aᵢ)
requiere:
P(Aᵢ)>0.
En el tratamiento elemental de P(B)=ΣP(Aᵢ)P(B|Aᵢ) trabajaremos con partes condicionantes de probabilidad positiva.
6.273. Tres reglas para leer correctamente un árbol
SUMAN 1
porque representan todas las alternativas posibles y disjuntas desde ese nodo.
MULTIPLICAMOS
mediante la regla de multiplicación y las probabilidades condicionadas apropiadas.
SUMAMOS
porque aplicamos la aditividad a eventos mutuamente excluyentes.
6.274. Errores frecuentes
Sumar probabilidades a lo largo de una ruta.
A lo largo de una ruta multiplicamos.
Multiplicar rutas alternativas que conducen al mismo evento.
Si son disjuntas, se suman.
Construir ramas de un nodo cuyas probabilidades no suman 1.
Las ramas deben cubrir todas las posibilidades de ese nivel.
Confundir P(B|Aᵢ) con P(Aᵢ|B).
Invertir la condición cambia la pregunta.
Aplicar probabilidad total a categorías que no forman una partición.
Los casos deben ser disjuntos y exhaustivos.
Promediar sin ponderar P(B|Aᵢ).
Cada valor debe ponderarse mediante P(Aᵢ).
Creer que el teorema necesita independencia.
No la necesita.
Leer el árbol al revés.
P(B|A) no es automáticamente P(A|B).
6.275. Actividad guiada · Tres máquinas
Una fábrica hipotética utiliza tres máquinas:
M₁: 50 % · M₂: 30 % · M₃: 20 %.
Las probabilidades de defecto son:
P(D|M₁)=0,01
P(D|M₂)=0,03
P(D|M₃)=0,06.
1. Comprueba que M₁, M₂ y M₃ forman una partición.
2. Representa la situación mediante un árbol.
3. Calcula P(M₁∩D).
4. Calcula P(M₂∩D).
5. Calcula P(M₃∩D).
6. Suma los tres caminos.
7. Obtén P(D).
8. Calcula P(Dc).
9. Comprueba que P(D)+P(Dc)=1.
Ver solución
Las probabilidades iniciales suman:
0,50+0,30+0,20=1.
M₁→D: 0,50×0,01=0,005.
M₂→D: 0,30×0,03=0,009.
M₃→D: 0,20×0,06=0,012.
Sumamos:
P(D)=0,005+0,009+0,012=0,026.
P(D)=2,6 %.
Por complemento:
P(Dc)=1−0,026=0,974=97,4 %.
Comprobación: 0,026+0,974=1.
Nota. Datos hipotéticos creados con fines didácticos.
6.276. Reto · Elegir y reunir caminos
Una persona utiliza uno de tres medios de transporte:
automóvil: 0,40 · metro: 0,35 · bicicleta: 0,25.
La probabilidad de llegar antes de las 7:00 es:
0,70 si usa automóvil,
0,90 si usa metro,
0,80 si usa bicicleta.
1. Representa la situación mediante un árbol.
2. Calcula el camino automóvil y llegada antes de las 7:00.
3. Calcula el camino correspondiente al metro.
4. Calcula el camino correspondiente a la bicicleta.
5. Obtén la probabilidad total de llegar antes de las 7:00.
6. Obtén la probabilidad de no llegar antes de las 7:00.
Ver solución
Automóvil: 0,40×0,70=0,280.
Metro: 0,35×0,90=0,315.
Bicicleta: 0,25×0,80=0,200.
Sumamos:
P(antes de las 7)=0,280+0,315+0,200=0,795.
P(antes de las 7)=79,5 %.
P(no antes de las 7)=1−0,795=0,205=20,5 %.
Nota. Datos hipotéticos creados con fines didácticos.
6.277. Después del cálculo manual: hoja de cálculo
Una vez comprendida la estructura, una hoja de cálculo puede automatizar las operaciones.
pesos P(Aᵢ)
probabilidades P(B|Aᵢ)
productos P(Aᵢ)P(B|Aᵢ)
La suma de la tercera columna produce P(B).
La hoja de cálculo automatiza operaciones. No decide si los grupos forman una partición, si las condiciones fueron interpretadas correctamente ni si dos rutas pueden sumarse.
6.278. Comprueba lo aprendido
1. ¿Qué dos condiciones debe cumplir una colección de eventos para formar una partición?
2. ¿Por qué las ramas que salen de un mismo nodo deben sumar 1?
3. ¿Por qué multiplicamos probabilidades dentro de una ruta?
4. ¿Por qué sumamos rutas alternativas cuando son mutuamente excluyentes?
5. Escribe el teorema de probabilidad total para una partición formada por A₁ y A₂.
6. Escribe la fórmula general.
7. Explica por qué B=(B∩A₁)∪···∪(B∩Aₙ).
8. ¿Por qué los eventos B∩Aᵢ son mutuamente excluyentes?
9. ¿Qué papel desempeña P(Aᵢ) en la fórmula?
10. ¿Por qué no debemos promediar simplemente P(B|Aᵢ)?
11. ¿Necesita independencia el teorema de probabilidad total?
12. ¿Qué diferencia existe entre P(B|A) y P(A|B)?
13. ¿Qué problema aparece si dos rutas que sumamos se superponen?
14. ¿Qué ocurre con la definición elemental de P(B|Aᵢ) si P(Aᵢ)=0?
15. Explica con tus propias palabras: «multiplicar dentro de cada camino y sumar entre caminos disjuntos».
Ver respuestas breves
1. Deben ser mutuamente excluyentes y cubrir completamente Ω.
2. Porque representan todas las alternativas posibles y disjuntas desde ese nodo.
3. Porque una ruta completa representa una intersección y aplicamos la regla de multiplicación.
4. Porque la aditividad permite sumar probabilidades de eventos mutuamente excluyentes.
5. P(B)=P(A₁)P(B|A₁)+P(A₂)P(B|A₂).
6. P(B)=ΣP(Aᵢ)P(B|Aᵢ).
7. Porque todo resultado de B pertenece exactamente a una parte de la partición.
8. Porque si los Aᵢ no se superponen, sus intersecciones con B tampoco.
9. P(Aᵢ) funciona como el peso del caso Aᵢ.
10. Porque los grupos pueden tener pesos diferentes.
11. No.
12. Responden preguntas condicionadas en direcciones diferentes.
13. Aparece doble conteo.
14. No puede utilizarse la división P(B∩Aᵢ)/P(Aᵢ).
15. Calculamos la probabilidad conjunta dentro de cada ruta mediante multiplicación y después reunimos mediante suma las rutas completas que son disjuntas.
6.279. Mapa conceptual
casos disjuntos y exhaustivos
P(Aᵢ)P(B|Aᵢ)
Nota. Elaboración propia.
6.280. Síntesis
Una partición divide Ω en eventos mutuamente excluyentes y exhaustivos.
Los árboles de probabilidad permiten organizar un problema por casos y por etapas.
Las ramas que salen de un mismo nodo suman 1 cuando representan todas las alternativas posibles de ese punto.
Dentro de una ruta multiplicamos:
P(Aᵢ∩B)=P(Aᵢ)P(B|Aᵢ).
Entre rutas completas y disjuntas que conducen al mismo evento, sumamos.
Si A₁,…,Aₙ forman una partición:
B=(B∩A₁)∪···∪(B∩Aₙ).
De esta descomposición se obtiene:
P(B)=ΣP(Aᵢ)P(B|Aᵢ).
Las probabilidades P(Aᵢ) funcionan como ponderaciones. Por eso la probabilidad total es, en este sentido, un promedio ponderado de las probabilidades condicionales.
El teorema no necesita que B sea independiente de los Aᵢ.
Y nunca debemos olvidar que:
P(B|A) y P(A|B)
responden preguntas diferentes.
6.281. Una nueva pregunta: invertir la condición
En el ejemplo de las máquinas conocemos:
P(D|M₁)=0,02.
Esto responde:
Pero podríamos formular la pregunta inversa:
Esa nueva pregunta se escribe:
P(M₁|D).
Ahora disponemos de una pieza esencial para responder:
P(D)=0,032.
En la siguiente parte utilizaremos precisamente la probabilidad total para construir una de las fórmulas más importantes de la teoría de probabilidad.
el teorema de Bayes.
Un mismo acontecimiento puede alcanzarse por varios caminos.
La probabilidad total consiste en calcular correctamente cada camino y reunirlos sin contar ninguno dos veces.
Referencias
Kolmogorov, A. N. (1933). Grundbegriffe der Wahrscheinlichkeitsrechnung. Springer.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Teorema de Bayes: invertir la condición
De P(B|A) a P(A|B)
Probabilidad previa · evidencia · verosimilitud · tasa base · probabilidad posterior
Con frecuencia conocemos qué tan probable es observar una evidencia B cuando se cumple una condición A:
P(B|A).
Pero después de observar B puede interesarnos la pregunta en la dirección contraria:
P(A|B).
El Teorema de Bayes permite realizar correctamente esa actualización. No consiste en intercambiar dos letras alrededor de una barra: compara el camino asociado con A con todos los caminos capaces de producir la evidencia observada.
6.282. Una pregunta que cambia de dirección
Retomemos el ejemplo de las dos máquinas estudiado en la Parte 9.
El modelo establecía:
donde:
D = «la pieza es defectuosa».
En la Parte 9 calculamos:
P(D)=0,032=3,2 %.
Ahora cambia la pregunta:
P(M₂|D).
Nota. Datos hipotéticos creados exclusivamente con fines didácticos.
6.283. Invertir la condición no significa intercambiar símbolos
Sabemos:
P(D|M₂)=0,05.
Esto responde:
En cambio:
P(M₂|D)
responde:
dentro de M₂ preguntamos por defectos
dentro de los defectos preguntamos por su origen
Nota. Elaboración propia.
6.284. Comprendamos primero la respuesta con 10.000 piezas
Antes de introducir una nueva fórmula, hagamos visible el razonamiento mediante frecuencias naturales.
Imaginemos 10.000 piezas producidas exactamente según las proporciones del modelo.
60 % de 10.000: 6.000 piezas
2 % defectuosas: 120 piezas
40 % de 10.000: 4.000 piezas
5 % defectuosas: 200 piezas
Entre las 10.000 piezas existen:
120+200=320 defectuosas.
De esas 320 piezas defectuosas:
200 proceden de M₂.
Ya hemos resuelto intuitivamente el problema:
P(M₂|D)=62,5 %.
La fórmula de Bayes que estudiaremos a continuación no hará algo distinto: expresará algebraicamente este mismo razonamiento.
6.285. ¿Qué significa el 62,5 %?
Antes de observar el estado de la pieza:
P(M₂)=40 %.
Después de observar que es defectuosa:
P(M₂|D)=62,5 %.
La evidencia D aumentó la probabilidad asignada a M₂ porque el defecto es más frecuente entre las piezas de M₂ que entre las de M₁.
La evidencia no produjo certeza. Una pieza defectuosa todavía puede proceder de M₁. Lo que cambió fue la distribución de probabilidades sobre los posibles orígenes.
0,60×0,02
0,012
0,40×0,05
0,020
0,012+0,020=0,032
0,020/0,032=0,625
Nota. Elaboración propia con datos hipotéticos.
6.286. Del razonamiento por caminos a una fórmula
En el numerador del cálculo anterior apareció:
0,40×0,05.
Esto es:
P(M₂)P(D|M₂)=P(M₂∩D).
En el denominador apareció:
P(D)=0,032.
Por tanto:
Esta estructura es el Teorema de Bayes aplicado al ejemplo.
6.287. Dos fórmulas conocidas contienen todo Bayes
Por definición de probabilidad condicional, si P(B)>0:
También conocemos la regla de multiplicación:
Sustituir la segunda expresión dentro de la primera produce inmediatamente Bayes.
6.288. Demostración del Teorema de Bayes
Partimos de:
P(A|B)=P(A∩B)/P(B).
Por la regla de multiplicación:
P(A∩B)=P(A)P(B|A).
Sustituimos:
P(A|B) = [P(A)P(B|A)]/P(B).
Reordenamos los factores:
P(A|B)=P(B|A)P(A)/P(B).
Esta expresión requiere:
P(B)>0.
6.289. Fórmula básica del Teorema de Bayes
Bayes no afirma:
P(A|B)=P(B|A).
Utiliza P(B|A), pero también incorpora:
P(A)
y normaliza el resultado mediante:
P(B).
6.290. ¿Qué representa cada componente?
Probabilidad previa
Probabilidad asignada a A antes de incorporar la evidencia B.
Evidencia bajo A
Describe qué tan compatible es observar B cuando A se cumple.
Probabilidad de la evidencia
Reúne todas las maneras consideradas por el modelo mediante las cuales B puede aparecer.
Probabilidad posterior
Probabilidad de A después de incorporar la información B.
Los términos previa y posterior son especialmente útiles al interpretar Bayes como actualización. El teorema, sin embargo, sigue siendo una identidad matemática de probabilidades condicionadas.
6.291. Una precisión universitaria: probabilidad y verosimilitud no son lo mismo
La expresión:
P(B|A)
es una probabilidad de B cuando A se considera fijado.
Pero si la evidencia B ya fue observada y ahora comparamos diferentes posibilidades para A, la misma expresión, considerada como función de A, desempeña el papel de verosimilitud.
Probabilidad: fijamos A y preguntamos qué resultados B podrían aparecer.
Verosimilitud: fijamos la evidencia observada B y comparamos qué valores o hipótesis A hacen esa evidencia más compatible.
En general, una función de verosimilitud no es una distribución de probabilidad sobre las hipótesis y no tiene por qué sumar 1 al variar A. Bayes combina esa verosimilitud con la probabilidad previa y después normaliza el resultado.
6.292. La estructura conceptual de una actualización
P(A)
P(B|A)
P(B)
P(A|B)
Nota. Elaboración propia.
6.293. El denominador no es un detalle administrativo
En:
P(A|B)=P(B|A)P(A)/P(B),
el denominador:
P(B)
cumple una función esencial.
El numerador representa el camino:
A → B.
Pero B puede aparecer también por otros caminos.
P(B|A)P(A)
camino de interés
P(B)
todos los caminos hacia la evidencia
6.294. Bayes con una partición completa
Supongamos que:
A₁,A₂,…,Aₙ
forman una partición del espacio muestral.
Queremos determinar:
P(Aⱼ|B).
La fórmula básica proporciona:
P(Aⱼ|B)=P(B|Aⱼ)P(Aⱼ)/P(B).
Y la Parte 9 nos enseñó a obtener el denominador:
P(B)=ΣP(Aᵢ)P(B|Aᵢ).
6.295. Fórmula general de Bayes para una partición
Partimos de:
P(Aⱼ|B)=P(B|Aⱼ)P(Aⱼ)/P(B).
Por probabilidad total:
P(B)=ΣP(Aᵢ)P(B|Aᵢ).
Sustituimos:
P(Aⱼ|B) = P(B|Aⱼ)P(Aⱼ) / [ΣP(Aᵢ)P(B|Aᵢ)]
El denominador reúne todos los caminos de la partición compatibles con la evidencia B.
6.296. Fórmula general
Posterior de Aⱼ = probabilidad del camino «Aⱼ y B» dividida entre la probabilidad total de todos los caminos que producen B.
6.297. Las probabilidades posteriores forman una nueva distribución
Si A₁,…,Aₙ forman una partición y observamos B, cada probabilidad:
P(Aᵢ|B)
redistribuye la probabilidad entre las posibilidades Aᵢ bajo la nueva información B.
Esto no es solo una comprobación aritmética: expresa que, después de condicionar a B, las posibilidades de la partición siguen cubriendo todo el universo de hipótesis considerado.
6.298. ¿Por qué las probabilidades posteriores suman 1?
Por Bayes:
P(Aᵢ|B)=P(Aᵢ)P(B|Aᵢ)/P(B).
Sumamos sobre todos los valores de i:
ΣP(Aᵢ|B) = [ΣP(Aᵢ)P(B|Aᵢ)]/P(B).
Por probabilidad total:
ΣP(Aᵢ)P(B|Aᵢ)=P(B).
Entonces:
ΣP(Aᵢ|B)=P(B)/P(B).
Como P(B)>0:
ΣP(Aᵢ|B)=1.
6.299. La tasa base importa
Una evidencia no debe interpretarse aislada de la frecuencia inicial del fenómeno que estamos estudiando.
Esa frecuencia previa recibe habitualmente el nombre de:
En una aplicación de Bayes suele aparecer en:
P(A).
Una evidencia puede ser muy compatible con A y, aun así, la probabilidad posterior de A puede no ser grande si A era inicialmente muy poco frecuente o si la evidencia también es frecuente bajo alternativas.
6.300. Ejemplo 2 · Un sistema de detección hipotético
Ejemplo exclusivamente matemático. Los porcentajes fueron elegidos para enseñar Bayes y no describen ningún sistema médico o tecnológico real.
Sea:
A = «la condición está presente»
+ = «el sistema produce una señal positiva».
Supongamos:
tasa base 1 %
95 % si A está presente
10 % si A está ausente
Por complemento:
P(Ac)=0,99.
6.301. Primero calculamos la probabilidad total de una señal positiva
Una señal positiva puede aparecer por dos caminos:
A y positivo
o
Ac y positivo.
P(+)=P(A)P(+|A)+P(Ac)P(+|Ac)
=(0,01)(0,95)+(0,99)(0,10)
=0,0095+0,099
P(+)=0,1085=10,85 %
6.302. Ahora actualizamos mediante Bayes
Queremos:
P(A|+).
P(A|+)=P(+|A)P(A)/P(+)
=(0,95)(0,01)/0,1085
=0,0095/0,1085
≈0,0876≈8,76 %
P(A)=1 %
P(A|+)≈8,76 %
Nota. Elaboración propia con datos hipotéticos.
6.303. Frecuencias naturales: imaginemos 10.000 casos
Sustituyamos porcentajes abstractos por cantidades.
10.000 casos.
Como P(A)=1 %:
100 pertenecen a A
y
9.900 pertenecen a Ac.
Total: 100
Positivos: 95
Negativos: 5
Total: 9.900
Positivos: 990
Negativos: 8.910
Casos: 10.000
Positivos: 1.085
Negativos: 8.915
Entre los 1.085 positivos:
95 pertenecen realmente al grupo A.
A está presente
se observa positivo
A∩+
A está ausente
se observa positivo
Ac∩+
Nota. Elaboración propia. Las etiquetas, y no únicamente los colores, distinguen los dos orígenes.
6.304. La falacia de la tasa base
La falacia de la tasa base consiste en ignorar o subestimar la frecuencia inicial de un fenómeno cuando interpretamos nueva evidencia.
Ese razonamiento es incorrecto porque confunde:
P(+|A)
con:
P(A|+).
También ignora cuántos casos pertenecen inicialmente a A y cuántos positivos pueden aparecer fuera de A.
6.305. P(B|A) alta no garantiza P(A|B) alta
En otras palabras, no basta preguntar:
«¿qué tan compatible es B con A?»
También debemos preguntar:
«¿qué tan compatible es B con las alternativas a A?»
6.306. La evidencia debe compararse con alternativas
Saber únicamente:
P(B|A)=0,80
no determina cuánto debería aumentar nuestra probabilidad de A.
También necesitamos información como:
P(B|Ac).
Si ambas probabilidades son casi iguales, observar B discrimina muy poco entre A y Ac.
Si P(B|A) es mucho mayor, la evidencia favorece relativamente a A.
Una evidencia adquiere significado inferencial al compararse con explicaciones alternativas, no solo al examinar cuánto concuerda con una explicación particular.
6.307. Ejemplo 3 · Clasificación de un mensaje de correo
Consideremos una aplicación no relacionada con sistemas de detección física.
Sea:
S = «el mensaje es correo no deseado»
W = «el mensaje contiene determinada palabra».
El modelo hipotético indica:
Nota. Modelo hipotético creado exclusivamente con fines didácticos.
6.308. Probabilidad total de observar la palabra
La palabra W puede aparecer en un mensaje no deseado o en uno que no pertenece a esa categoría.
P(W)=P(S)P(W|S)+P(Sc)P(W|Sc)
=(0,20)(0,60)+(0,80)(0,05)
=0,12+0,04
P(W)=0,16.
6.309. Actualizamos la clasificación mediante Bayes
Queremos:
P(S|W).
P(S|W)=P(W|S)P(S)/P(W)
=(0,60)(0,20)/0,16
P(S|W)=0,75=75 %
Antes de observar W:
P(S)=20 %.
Después de observar W:
P(S|W)=75 %.
W es mucho más frecuente bajo S que bajo Sc, por lo que constituye evidencia relativamente fuerte a favor de S en este modelo.
P(S)=20 %
P(S|W)=75 %
Nota. Elaboración propia con datos hipotéticos.
6.310. Bayes no crea información
Una fórmula matemáticamente correcta no puede compensar información de entrada deficiente.
El resultado posterior depende de:
Bayes reorganiza cuantitativamente la información que recibe; no mejora automáticamente la calidad de esa información. Datos poco representativos, tasas base incorrectas o modelos mal especificados pueden producir una posterior poco útil aunque la aritmética sea impecable.
6.311. Razón de verosimilitudes: ¿cuánto discrimina la evidencia?
Cuando comparamos dos posibilidades complementarias A y Ac, podemos comparar directamente qué tan compatible es B con cada una:
Si esta razón es:
B favorece relativamente a A frente a Ac.
B no discrimina entre ambas posibilidades.
B favorece relativamente a Ac.
La razón de verosimilitudes mide la fuerza relativa de la evidencia, pero no sustituye la tasa base. Para obtener una probabilidad posterior todavía necesitamos combinar evidencia e información previa.
6.312. Otra representación: los momios
Para una probabilidad p entre 0 y 1 definimos los momios:
Si:
p=0,75,
entonces:
momios=0,75/0,25=3.
Esto puede leerse como:
3 a 1 a favor.
6.313. Bayes mediante momios
Para dos posibilidades complementarias A y Ac:
P(A|B)=P(B|A)P(A)/P(B)
y:
P(Ac|B) = P(B|Ac) P(Ac) /P(B).
Dividimos la primera expresión entre la segunda:
P(A|B)/P(Ac|B) = [P(B|A)P(A)] / [P(B|Ac)P(Ac)].
Reagrupando:
momios posteriores
momios previos
razón de verosimilitudes
momios posteriores = momios previos × P(B|A)/P(B|Ac)
6.314. El Teorema de Bayes y la inferencia bayesiana no son lo mismo
Es una identidad matemática entre probabilidades condicionadas.
Puede utilizarse en problemas elementales sin desarrollar un modelo estadístico bayesiano completo.
Es un marco más amplio de modelación e inferencia estadística.
Puede involucrar parámetros, distribuciones previas, funciones de verosimilitud, distribuciones posteriores, predicción y decisiones.
En esta parte estudiamos principalmente el Teorema de Bayes, pero introducimos vocabulario que servirá más adelante para comprender la inferencia bayesiana universitaria.
6.315. Actualizaciones sucesivas
Supongamos que comenzamos con:
P(A).
Observamos una primera evidencia B₁:
P(A|B₁).
Si después aparece una segunda evidencia B₂, la nueva pregunta debe considerar la información acumulada:
La posterior obtenida después de B₁ puede actuar como nueva previa para una etapa posterior, siempre que el modelo represente correctamente cómo se relacionan las evidencias.
probabilidad inicial
primera actualización
actualización con información acumulada
Nota. Elaboración propia.
Varias evidencias no pueden multiplicarse automáticamente como si fueran independientes. Sus relaciones de dependencia deben formar parte del modelo.
6.316. Probabilidad posterior no significa causalidad
Si después de observar B obtenemos:
P(A|B)=0,80,
hemos cuantificado la probabilidad de A bajo la información B.
Esto no demuestra automáticamente que:
A causó B
ni que:
B causó A.
Bayes actualiza probabilidades dentro de un modelo. Las afirmaciones causales requieren estructura causal, supuestos y evidencia adicionales.
6.317. Procedimiento práctico para una partición
Identificar una partición A₁,…,Aₙ y registrar P(Aᵢ).
Registrar P(B|Aᵢ) para cada caso.
Calcular cada camino P(Aᵢ)P(B|Aᵢ).
Sumar los caminos para obtener P(B).
Dividir el camino de interés entre P(B).
Interpretar la posterior en el contexto y revisar los supuestos del modelo.
6.318. Dos comprobaciones muy útiles
Después de una actualización sobre una partición:
Además, cada probabilidad posterior debe satisfacer:
Estas condiciones permiten detectar muchos errores de cálculo.
6.319. Errores frecuentes
Confundir P(A|B) con P(B|A).
Responden preguntas diferentes.
Ignorar la tasa base.
P(A) puede modificar radicalmente la posterior.
Utilizar únicamente P(B|A).
Debemos considerar las alternativas capaces de producir B.
Olvidar P(B).
El denominador normaliza todos los caminos compatibles con la evidencia.
Promediar verosimilitudes sin ponderarlas.
Los pesos provienen de las probabilidades previas.
Creer que evidencia favorable significa certeza.
Una posterior puede continuar muy por debajo de 1.
Suponer independencia entre evidencias sin justificarla.
La dependencia debe incorporarse al modelo.
Interpretar la posterior como prueba causal.
Bayes actualiza probabilidades; no establece causalidad por sí solo.
Confundir verosimilitud con probabilidad posterior.
P(B|A) y P(A|B) cumplen funciones distintas.
6.320. Práctica de dificultad creciente
Supongamos:
P(A)=0,30
P(B|A)=0,80
P(B)=0,40.
Calcula P(A|B).
Ver solución
P(A|B)=P(B|A)P(A)/P(B).
=(0,80)(0,30)/0,40.
P(A|B)=0,60=60 %.
P(A)=0,25
P(B|A)=0,70
P(B|Ac)=0,20.
Calcula:
a) P(Ac);
b) P(B);
c) P(A|B).
Ver solución
a) P(Ac)=0,75.
b) P(B)=0,25(0,70)+0,75(0,20)=0,325.
c) P(A|B)=0,175/0,325≈0,5385≈53,85 %.
Tres posibles fuentes A₁, A₂ y A₃ tienen probabilidades previas:
0,50; 0,30; 0,20.
La evidencia B aparece con probabilidades:
0,10; 0,30; 0,60,
respectivamente.
Calcula P(A₃|B).
Ver solución
P(B)=0,50(0,10)+0,30(0,30)+0,20(0,60)=0,26.
P(A₃|B)=0,20(0,60)/0,26≈0,4615≈46,15 %.
Supón dos posibilidades complementarias A y Ac con:
P(A)=0,20, P(B|A)=0,60, P(B|Ac)=0,05.
Calcula:
a) los momios previos de A;
b) la razón de verosimilitudes;
c) los momios posteriores;
d) transforma los momios posteriores nuevamente en probabilidad.
Ver solución
a) momios previos=0,20/0,80=0,25.
b) razón de verosimilitudes=0,60/0,05=12.
c) momios posteriores=0,25×12=3.
d) si los momios son 3, p=3/(1+3)=0,75=75 %.
6.321. Actividad guiada · Las tres máquinas
Una fábrica hipotética utiliza:
M₁: 50 % · M₂: 30 % · M₃: 20 %.
Sus probabilidades de defecto son:
P(D|M₁)=0,01
P(D|M₂)=0,03
P(D|M₃)=0,06.
1. Calcula P(M₁∩D).
2. Calcula P(M₂∩D).
3. Calcula P(M₃∩D).
4. Calcula P(D).
5. Calcula P(M₁|D).
6. Calcula P(M₂|D).
7. Calcula P(M₃|D).
8. Comprueba que las posteriores suman 1.
9. ¿Qué máquina aumenta más su representación entre las piezas defectuosas?
Ver solución
P(M₁∩D)=0,50(0,01)=0,005.
P(M₂∩D)=0,30(0,03)=0,009.
P(M₃∩D)=0,20(0,06)=0,012.
P(D)=0,005+0,009+0,012=0,026.
P(M₁|D)=0,005/0,026≈19,23 %.
P(M₂|D)=0,009/0,026≈34,62 %.
P(M₃|D)=0,012/0,026≈46,15 %.
0,1923+0,3462+0,4615=1,0000.
M₃ pasa de representar 20 % de la producción a aproximadamente 46,15 % de las piezas defectuosas.
Nota. Datos hipotéticos creados exclusivamente con fines didácticos.
6.322. Reto de tasa base
P(A)=0,05
P(B|A)=0,90
P(B|Ac)=0,20.
1. Calcula P(Ac).
2. Calcula P(B).
3. Calcula P(A|B).
4. Compara P(B|A)=90 % con P(A|B).
5. Explica por qué las cantidades son tan diferentes.
Ver solución
P(Ac)=0,95.
P(B)=0,05(0,90)+0,95(0,20)=0,235.
P(A|B)=0,045/0,235≈0,1915.
P(A|B)≈19,15 %.
Aunque B es muy frecuente cuando A ocurre, A tiene una tasa base pequeña y B también aparece con una probabilidad considerable bajo Ac.
6.323. Comprueba lo aprendido
1. ¿Qué problema permite resolver el Teorema de Bayes?
2. Explica la diferencia entre P(A|B) y P(B|A).
3. ¿Por qué «invertir la condición» no significa intercambiar A y B?
4. Escribe la fórmula básica de Bayes.
5. Demuestra la fórmula a partir de la probabilidad condicional.
6. ¿Qué representa P(A)?
7. ¿Qué representa P(B|A)?
8. ¿En qué sentido P(B|A) puede funcionar como verosimilitud?
9. ¿Por qué una verosimilitud no es necesariamente una distribución de probabilidad sobre A?
10. ¿Qué representa P(B)?
11. ¿Qué representa P(A|B)?
12. ¿Por qué la probabilidad total aparece en el denominador?
13. Escribe la fórmula general de Bayes para una partición.
14. ¿Por qué las posteriores de una partición suman 1?
15. ¿Qué es una tasa base?
16. ¿Qué es la falacia de la tasa base?
17. ¿Por qué P(B|A) alta no garantiza P(A|B) alta?
18. ¿Qué utilidad tienen las frecuencias naturales?
19. ¿Qué es una razón de verosimilitudes?
20. ¿Qué son los momios?
21. Explica la relación entre momios previos, razón de verosimilitudes y momios posteriores.
22. ¿Qué diferencia existe entre el Teorema de Bayes y la inferencia bayesiana?
23. ¿Cómo deben tratarse dos evidencias sucesivas B₁ y B₂?
24. ¿Puede una probabilidad posterior demostrar causalidad?
25. ¿Por qué la calidad de los datos y de los supuestos es tan importante como la fórmula?
Ver respuestas breves
1. Permite calcular una probabilidad condicionada en una dirección utilizando información disponible en la dirección contraria, probabilidades previas y la probabilidad de la evidencia.
2. Cambia cuál evento actúa como condición.
3. Porque la inversión correcta requiere ponderar por P(A) y normalizar mediante P(B).
4. P(A|B)=P(B|A)P(A)/P(B).
5. Sustituimos P(A∩B)=P(A)P(B|A) en P(A|B)=P(A∩B)/P(B).
6. La probabilidad previa de A.
7. La probabilidad de la evidencia B bajo A.
8. Cuando B está fijado y comparamos diferentes posibilidades para A.
9. Porque al variar A sus valores no tienen por qué sumar o integrar 1.
10. La probabilidad total de observar B mediante todos los caminos considerados.
11. La probabilidad posterior de A después de incorporar B.
12. Porque reúne y normaliza todos los caminos que pueden producir B.
13. P(Aⱼ|B)=P(B|Aⱼ)P(Aⱼ)/[ΣP(Aᵢ)P(B|Aᵢ)].
14. Porque forman una nueva distribución sobre la partición condicionada a B.
15. La frecuencia o probabilidad previa de una posibilidad antes de incorporar la evidencia.
16. Ignorar o subestimar la tasa base al interpretar evidencia.
17. Porque B puede aparecer también bajo alternativas y A puede ser inicialmente poco frecuente.
18. Transforman porcentajes en cantidades y hacen visibles los distintos orígenes de la evidencia.
19. P(B|A)/P(B|Ac) en el caso de dos alternativas complementarias.
20. La razón p/(1−p).
21. Momios posteriores = momios previos × razón de verosimilitudes.
22. Bayes es una identidad matemática; la inferencia bayesiana es un marco estadístico más amplio.
23. La segunda actualización debe considerar la información acumulada y la dependencia entre evidencias.
24. No. Una posterior no demuestra causalidad.
25. Porque Bayes reorganiza las cantidades introducidas; no corrige automáticamente datos o supuestos deficientes.
6.324. Mapa conceptual
P(Aᵢ)
P(B|Aᵢ)
P(Aᵢ)P(B|Aᵢ)
P(B)=ΣP(Aᵢ)P(B|Aᵢ)
Nota. Elaboración propia.
6.325. Síntesis
El Teorema de Bayes permite cambiar correctamente la dirección de una probabilidad condicionada.
En general:
P(A|B)≠P(B|A).
La fórmula básica es:
P(A|B)=P(B|A)P(A)/P(B),
para P(B)>0.
Esta relación nace directamente de:
P(A|B)=P(A∩B)/P(B)
y:
P(A∩B)=P(A)P(B|A).
Si A₁,…,Aₙ forman una partición:
P(B)=ΣP(Aᵢ)P(B|Aᵢ),
de modo que:
P(Aⱼ|B) = P(B|Aⱼ)P(Aⱼ) / [ΣP(Aᵢ)P(B|Aᵢ)].
P(A) representa la probabilidad previa; P(B|A) describe la compatibilidad de la evidencia con A; P(B) reúne todos los caminos hacia la evidencia; y P(A|B) es la probabilidad posterior.
Cuando B se considera fijo y comparamos distintos valores o hipótesis A, P(B|A) desempeña el papel de verosimilitud. Esa verosimilitud no es, en general, una distribución de probabilidad sobre A.
La tasa base es fundamental. Una P(B|A) alta no implica necesariamente una P(A|B) alta.
Las frecuencias naturales permiten visualizar este fenómeno contando directamente los casos compatibles con la evidencia.
En el nivel avanzado:
momios posteriores = momios previos × razón de verosimilitudes.
Para una partición:
ΣP(Aᵢ|B)=1.
Las actualizaciones pueden realizarse sucesivamente, pero las dependencias entre evidencias deben incorporarse correctamente al modelo.
El Teorema de Bayes es una identidad de probabilidad; la inferencia bayesiana es un marco estadístico más amplio.
Finalmente, Bayes no crea información ni demuestra causalidad. Su resultado depende de los datos, probabilidades y supuestos utilizados.
La pregunta central no es solamente: «¿qué tan compatible es la evidencia con mi explicación?», sino también: «¿qué otras explicaciones podrían haber producido esa misma evidencia?»
Bayes no consiste en invertir dos letras alrededor de una barra.
Consiste en comparar el camino que nos interesa con todos los caminos capaces de producir la evidencia observada.
Referencias
Bayes, T. (1763). An essay towards solving a problem in the doctrine of chances. Philosophical Transactions of the Royal Society of London, 53, 370–418.
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Variables aleatorias
Convertir resultados aleatorios en números que podamos estudiar
resultado ω · regla X · valor X(ω) · eventos numéricos · distribuciones discretas y continuas
Un experimento aleatorio produce un resultado. Una variable aleatoria toma ese resultado y le asigna un número.
Esta transformación permite pasar de:
resultados y eventos
a
valores numéricos y probabilidades sobre esos valores.
Este paso constituye el puente entre la teoría elemental de eventos y el estudio de distribuciones de probabilidad, esperanza, varianza y modelos estadísticos.
6.326. Del resultado al número
Supongamos que lanzamos dos monedas equilibradas.
Utilizaremos:
C = cara y S = sello.
El espacio muestral es:
Cada resultado conserva toda la información sobre el orden de los dos lanzamientos.
Pero imaginemos que nuestra pregunta es:
6.327. Una regla: contar las caras
Podemos asignar un número a cada resultado:
Hemos construido una regla que transforma cada resultado del experimento en un número.
Llamaremos X a esa regla:
ω=CS
contar el número de caras
X(CS)=1
Nota. Elaboración propia. La regla X es fija; lo incierto es qué resultado ω ocurrirá.
6.328. Definición de variable aleatoria
Una variable aleatoria es una función que asigna un número real a cada resultado del espacio muestral.
En el nivel elemental se representa mediante:
X es el nombre de la variable aleatoria.
Ω es el espacio muestral.
ℝ es el conjunto de los números reales.
6.329. Definición universitaria: una variable aleatoria debe ser medible
En un curso universitario riguroso no trabajamos únicamente con Ω, sino con un espacio de probabilidad:
donde:
Ω contiene los resultados posibles;
𝓕 contiene los eventos a los que podemos asignar probabilidad;
P asigna probabilidades a esos eventos.
Formalmente, una variable aleatoria real es una función:
que es medible.
Sin desarrollar todavía toda la teoría de conjuntos de Borel, la idea esencial es esta:
Si formulamos una condición numérica sobre X, los resultados de Ω que satisfacen esa condición deben formar un evento al que podamos asignar probabilidad.
En particular, para todo número real a debe tener sentido probabilístico:
{ω∈Ω : X(ω)≤a}.
Esta condición técnica es la que permite escribir rigurosamente:
P(X≤a).
6.330. ¿Qué significa X(ω)?
El símbolo:
ω
representa un resultado elemental del experimento.
La expresión:
X(ω)
representa el número que X asigna a ese resultado.
Por ejemplo:
resultado elemental
valor de la variable
Resultado elemental
Conserva la descripción del resultado del experimento.
Ejemplo: CS.
Valor de la variable
Es el número asignado por la regla X.
Ejemplo: 1.
6.331. X y x: variable aleatoria y valor observado
En probabilidad y estadística es habitual utilizar:
mayúscula
representa la variable aleatoria como objeto del modelo.
minúscula
puede representar un valor posible o un valor concreto observado.
Por ejemplo:
X = número de caras en dos lanzamientos.
Si realizamos el experimento y obtenemos CS:
X(CS)=1.
Podemos registrar esa realización como:
x=1.
variable aleatoria
resultado elemental
valor producido por X
valor posible o realización observada
6.332. ¿Por qué se llama «aleatoria» si la regla es fija?
La función:
X = «contar caras»
no cambia al azar.
Si ocurre CS:
X(CS)=1.
Si ocurre SS:
X(SS)=0.
Lo aleatorio no es la regla X. Lo incierto es qué resultado ω ocurrirá y, como consecuencia, qué valor X(ω) observaremos.
6.333. Resultados diferentes pueden producir el mismo valor
En nuestro ejemplo:
X(CS)=1
y
X(SC)=1.
CS y SC son resultados diferentes. Sin embargo, ambos contienen exactamente una cara.
Nota. Elaboración propia.
6.334. Una variable aleatoria selecciona la información que necesitamos
El resultado elemental puede contener más información de la necesaria para nuestra pregunta.
Por ejemplo:
ω=CS
informa que primero apareció cara y luego sello.
En cambio:
X(ω)=1
conserva únicamente la información necesaria para contar caras.
Una variable aleatoria puede entenderse como una forma de resumir numéricamente un resultado según la pregunta que queremos estudiar.
6.335. Un mismo experimento puede producir muchas variables aleatorias
Lanzamos un dado equilibrado:
Ω={1,2,3,4,5,6}.
A partir del mismo resultado podemos definir variables diferentes.
número obtenido
Si sale 4: X=4.
1 si el número es par y 0 si es impar
Si sale 4: Y=1.
cuadrado del número obtenido
Si sale 4: Z=16.
El experimento es el mismo. Lo que cambia es la pregunta matemática que queremos responder.
6.336. El nombre X no tiene significado por sí solo
Escribir solamente:
X
no basta.
Debemos definir qué representa la variable.
Buena definición:
X = número de caras obtenidas en dos lanzamientos.
Definición insuficiente:
X = resultado.
Una variable bien definida debe permitir determinar sin ambigüedad qué número corresponde a cada resultado.
6.337. Los valores posibles de una variable
Para:
X = número de caras en dos lanzamientos,
los únicos valores posibles son:
No puede ocurrir X=3 porque solamente hay dos lanzamientos.
Tampoco puede ocurrir X=1,5, porque el número de caras es un conteo entero.
6.338. Espacio muestral, imagen de X y soporte
Conviene distinguir cuidadosamente varios conjuntos.
Contiene los resultados elementales.
{CC,CS,SC,SS}
Contiene todos los valores realmente producidos por X.
{0,1,2}
Formalmente:
En una variable discreta resulta también útil definir:
En nuestro ejemplo:
soporte={0,1,2}.
Imagen y soporte no son conceptos idénticos en toda la teoría. Para variables discretas elementales suelen coincidir. En distribuciones más generales, el soporte posee una definición probabilística y topológica más amplia.
6.339. De un valor numérico nuevamente a un evento
Una variable aleatoria lleva resultados hacia números.
Pero cuando queremos calcular probabilidades, hacemos conceptualmente el recorrido inverso.
Por ejemplo:
X=1
significa:
«obtener exactamente una cara».
Los resultados que producen ese valor son:
6.340. La preimagen: el camino de los números hacia Ω
Si B es un conjunto de valores numéricos, la preimagen de B mediante X es:
El símbolo X−1 aquí indica preimagen; no significa necesariamente que X posea una función inversa.
Si:
B={1},
entonces:
X−1({1})={CS,SC}.
B={1}
Nota. Elaboración propia.
6.341. La notación P(X=1)
Podemos escribir:
Esto significa:
P({ω∈Ω : X(ω)=1}).
En nuestro ejemplo:
P(X=1)=P({CS,SC}).
Como los cuatro resultados son equiprobables:
6.342. Podemos construir muchos eventos mediante X
Con:
X = número de caras,
podemos formular:
ninguna cara
exactamente una cara
al menos una cara
menos de dos caras
6.343. Una condición sobre X representa un evento
Sea:
X = número de caras en dos lanzamientos.
Consideremos:
X≥1.
Revisamos cada resultado:
CC → X=2 → cumple
CS → X=1 → cumple
SC → X=1 → cumple
SS → X=0 → no cumple.
Por tanto:
{X≥1}={CC,CS,SC}.
En consecuencia:
P(X≥1)=3/4.
Esta es también la intuición detrás de la medibilidad: las condiciones numéricas que planteamos sobre X deben corresponder a eventos probabilísticamente válidos en Ω.
6.344. Ejemplo 2 · La suma de dos dados
Lanzamos dos dados equilibrados.
Un resultado elemental se representa mediante:
ω=(dado 1,dado 2).
Definimos:
X(2,5)=7
X(3,4)=7
X(6,1)=7.
Muchos resultados diferentes pueden producir el mismo valor.
6.345. Los valores posibles de la suma
El menor valor es:
1+1=2.
El mayor:
6+6=12.
Por tanto:
Que X tenga once valores posibles no significa que sean igualmente probables. Saber qué valores puede tomar X es distinto de saber cómo se reparte la probabilidad entre ellos.
↓
7
↓
7
↓
7
↓
7
↓
7
↓
7
Nota. Elaboración propia.
6.346. Variable aleatoria discreta
En el nivel elemental, una variable aleatoria es discreta cuando sus valores relevantes forman un conjunto finito o numerable.
Ejemplos:
Definición probabilística
X es discreta si existe un conjunto finito o numerable S tal que:
P(X∈S)=1.
En la siguiente parte estudiaremos cómo asignar una probabilidad P(X=x) a cada uno de esos valores.
6.347. Discreta no significa necesariamente «pocos valores»
Una variable discreta puede tener infinitos valores posibles.
Por ejemplo:
X = número de lanzamientos necesarios hasta obtener la primera cara.
Sus valores son:
No existe un último valor. Aun así, pueden enumerarse uno por uno.
6.348. Variable aleatoria continua: primera aproximación
En los modelos elementales, una variable continua suele representar una magnitud cuyos valores pueden recorrer intervalos de los números reales.
Ejemplos frecuentes:
Nota. Elaboración propia.
6.349. Precisión universitaria: «continua» y «con densidad»
En cursos introductorios, la expresión variable continua suele utilizarse para variables que poseen una función de densidad.
El término matemático más preciso en ese caso es:
Existe entonces una función f tal que:
P(a<X≤b)
se obtiene mediante el área bajo f entre a y b.
Más adelante escribiremos formalmente esta idea mediante integrales.
Una consecuencia importante es:
para cualquier valor individual x en una distribución absolutamente continua.
La teoría completa es más rica que la división «discreta o con densidad». Existen también distribuciones mixtas y distribuciones continuas singulares.
6.350. No todas las distribuciones son puramente discretas o puramente continuas
Imaginemos una máquina.
Con probabilidad 0,10 se detiene inmediatamente:
P(X=0)=0,10.
Si no se detiene inmediatamente, su tiempo de funcionamiento se modela continuamente para X>0.
Esta variable posee:
una masa de probabilidad en X=0
valores positivos modelados mediante una densidad
Decimos que se trata de una distribución mixta.
P(X=0)=0,10
componente continua
Nota. Elaboración propia. Esquema conceptual, no gráfico de una densidad específica.
6.351. Modelo continuo e instrumento de medición no son lo mismo
Supongamos:
T = tiempo empleado en recorrer una distancia.
Podemos construir un modelo matemático continuo para T.
Pero un cronómetro real posee resolución finita. Podría mostrar:
12,34 s.
El instrumento no registra infinitas cifras decimales.
Modelo matemático y registro instrumental son objetos distintos. Una magnitud puede modelarse continuamente aunque los datos observados aparezcan cuantizados por la resolución del instrumento.
Nota. Elaboración propia. Los números ilustran una resolución de 0,01 s.
6.352. La clasificación depende del modelo y de lo que registramos
Consideremos la edad.
Si registramos:
12, 13, 14, 15 años,
los datos aparecen como enteros.
Pero la edad como magnitud temporal puede tomar valores intermedios:
12,5 años; 12,51 años; etc.
Que una magnitud se registre mediante enteros no demuestra que la magnitud subyacente sea discreta.
Podemos distinguir:
edad exacta
variable X continua
años cumplidos
por ejemplo, 12
Si Y representa la edad en años cumplidos, podemos pensar conceptualmente en una transformación de X:
Y=⌊X⌋,
donde ⌊X⌋ representa la parte entera inferior.
La probabilidad se concentra en valores finitos o numerables.
Ejemplo: número de estudiantes ausentes.
0,1,2,3,…
La probabilidad se describe mediante una densidad.
Ejemplo: tiempo de espera.
t≥0
6.353. Ejemplo 3 · Tiempo de espera
Una persona espera la llegada de un autobús.
Definimos:
Si utilizamos un modelo continuo:
T≥0.
Podemos formular eventos:
esperar como máximo 5 minutos
esperar más de 10 minutos
esperar más de 3 y como máximo 8 minutos
Todavía no hemos definido cuánto vale la probabilidad de esos intervalos. Primero definimos la variable y los eventos.
6.354. Un número asignado a una categoría no siempre representa una magnitud cuantitativa
Supongamos:
rojo → 1
azul → 2
verde → 3.
Matemáticamente hemos definido una codificación numérica.
Pero esto no significa que:
verde sea «tres veces» rojo
ni que:
3−1=2
tenga automáticamente una interpretación física respecto del color.
Codificar categorías mediante números puede producir formalmente una variable real-valuada, pero no convierte por sí sola la categoría en una escala cuantitativa. Promedios, distancias y cocientes deben tener significado en el contexto.
6.355. Una variable de 0 y 1: la variable indicadora
Sea A un evento cualquiera.
Definimos:
IA(ω)=1 si ω∈A
IA(ω)=0 si ω∉A
Esta variable recibe el nombre de variable indicadora del evento A.
También puede escribirse:
1A.
Convierte una pregunta de «sí o no» en una variable numérica.
Más adelante aparecerá una identidad especialmente importante: E(IA)=P(A). La estudiaremos cuando introduzcamos esperanza matemática.
6.356. Ejemplo 4 · Variable indicadora en un dado
Lanzamos un dado.
Sea:
A = «el resultado es par».
Entonces:
IA=1 si sale 2, 4 o 6
IA=0 si sale 1, 3 o 5.
Esta variable no conserva cuál número exacto apareció. Solo conserva si ocurrió A.
6.357. Transformar una variable aleatoria
Una vez definida X, podemos construir una nueva variable aplicando una función g:
Más explícitamente:
Y(ω)=g(X(ω)).
En el tratamiento universitario, si X es medible y g es una función medible apropiada —como las funciones usuales que empleamos en cálculo—, entonces Y=g(X) también es una variable aleatoria.
6.358. Ejemplo 5 · De Celsius a Fahrenheit
Sea:
X = temperatura en grados Celsius.
Definimos:
Y representa la misma temperatura en grados Fahrenheit.
Si:
X=20 °C,
entonces:
Y=1,8(20)+32=68 °F.
La incertidumbre pertenece al valor que tomará X; la transformación es determinista.
temperatura en °C
temperatura en °F
Nota. Elaboración propia.
6.359. La cuantización también puede verse como una transformación
Retomemos el tiempo T modelado continuamente.
Si un instrumento registra centésimas de segundo, podemos definir:
Y = tiempo registrado por el instrumento.
Entonces Y puede entenderse como una transformación de T mediante una regla de redondeo.
Por ejemplo:
T=12,3437… s
puede registrarse como
Y=12,34 s.
Una variable continua puede producir, después de redondeo o cuantización, una variable observada cuyos valores pertenezcan a un conjunto discreto. Esto no cambia retrospectivamente la naturaleza del modelo original T.
6.360. Variable aleatoria y datos observados no son lo mismo
Sea:
X = número de caras en dos lanzamientos.
X está definida antes de realizar el experimento.
Repetimos el experimento diez veces y observamos:
Estos números son realizaciones observadas de X.
En notación estadística podríamos representarlos como:
x₁,x₂,…,x₁₀.
Pertenece al modelo.
Describe los valores posibles antes de conocer la realización concreta.
Son valores efectivamente observados.
Constituyen realizaciones de las variables del modelo.
Modelo ≠ datos. La variable aleatoria describe posibilidades y probabilidades; los datos indican qué valores se observaron realmente.
6.361. Una variable aleatoria induce su propia distribución de probabilidad
Esta es una de las ideas más importantes de toda la teoría.
El espacio original Ω posee probabilidades. La variable X agrupa los resultados según los números que produce.
De esta manera, X transporta la probabilidad de Ω hacia los números reales.
Para un conjunto B de números reales definimos:
PX(B)=P(X∈B)
=P(X−1(B))
PX recibe el nombre de:
resultados + probabilidades
PX(B)=P(X∈B)
Nota. Elaboración propia.
6.362. Construimos la distribución de X a partir de Ω
En dos lanzamientos de monedas equilibradas:
Ω={CC,CS,SC,SS}.
Cada resultado tiene probabilidad:
1/4.
Si X cuenta el número de caras:
X=0 ← {SS}
X=1 ← {CS,SC}
X=2 ← {CC}.
Sumamos las probabilidades de los resultados pertenecientes a cada preimagen:
P(X=0)=1/4
P(X=1)=2/4=1/2
P(X=2)=1/4.
Comprobamos:
1/4+1/2+1/4=1.
Esta es precisamente la pregunta que desarrollaremos en la Parte 12: ¿cómo describimos sistemáticamente la probabilidad asociada a cada valor de una variable discreta?
6.363. Errores frecuentes
Confundir ω con X(ω).
ω es un resultado; X(ω) es un número.
Creer que X cambia aleatoriamente su regla.
La regla es fija; el resultado es incierto.
Creer que resultados distintos deben dar valores distintos.
Una variable puede agrupar resultados.
Confundir Ω con X(Ω).
Uno contiene resultados y el otro valores numéricos.
Confundir imagen con soporte en todos los contextos.
Coinciden en muchos ejemplos discretos, pero no son conceptos idénticos en general.
Pensar que toda variable numérica es continua.
Un conteo puede ser discreto.
Pensar que un instrumento con pocos decimales hace discreta la magnitud subyacente.
Modelo y registro son diferentes.
Creer que asignar 1, 2 y 3 a categorías crea una escala métrica.
La interpretación de las operaciones debe justificarse.
Confundir X con los datos x₁,…,xₙ.
X pertenece al modelo; los x observados son realizaciones.
Creer que toda distribución es solamente discreta o con densidad.
Existen distribuciones mixtas y otras formas más generales.
Interpretar X−1(B) como una división.
Aquí representa una preimagen.
Creer que los valores posibles son automáticamente equiprobables.
La distribución debe determinarse por separado.
6.364. Práctica de dificultad creciente
Se lanzan tres monedas y se define:
X = número de caras.
a) ¿Cuál es el menor valor de X?
b) ¿Cuál es el mayor?
c) Escribe todos los valores posibles.
Ver solución
Menor: 0.
Mayor: 3.
X(Ω)={0,1,2,3}.
Se lanzan dos dados y definimos:
X = máximo de los dos resultados.
1. Calcula X(2,5).
2. Calcula X(6,3).
3. Determina X(Ω).
4. Enumera la preimagen de {2}.
Ver solución
X(2,5)=5.
X(6,3)=6.
X(Ω)={1,2,3,4,5,6}.
X−1({2})={(1,2),(2,1),(2,2)}.
Se lanzan dos dados y:
X=|dado 1−dado 2|.
1. Calcula X(2,5).
2. Calcula X(6,1).
3. Determina X(Ω).
4. Encuentra {X=0}.
5. Encuentra {X=5}.
Ver solución
X(2,5)=3.
X(6,1)=5.
X(Ω)={0,1,2,3,4,5}.
{X=0}={(1,1),(2,2),(3,3),(4,4),(5,5),(6,6)}.
{X=5}={(1,6),(6,1)}.
Sea X una variable aleatoria y B⊂ℝ.
Explica con tus palabras la diferencia entre:
X(B)
y
X−1(B).
Ver orientación
X lleva elementos del dominio Ω hacia valores reales.
La preimagen X−1(B) busca todos los resultados ω de Ω cuyos valores X(ω) pertenecen al conjunto B.
6.365. Actividad de modelación · Una misma realidad, distintas variables
Seleccionamos al azar un día escolar y registramos el número de estudiantes ausentes de un grupo.
Propón una variable para cada pregunta:
1. ¿Cuántos estudiantes faltaron?
2. ¿Faltó al menos un estudiante?
3. ¿La cantidad de ausentes superó 5?
4. ¿Qué variable utilizarías para representar el porcentaje de estudiantes presentes?
Ver una posible respuesta
X = número de estudiantes ausentes.
Y = 1 si X≥1 y 0 si X=0.
Z = 1 si X>5 y 0 si X≤5.
W = porcentaje de estudiantes presentes. Su definición debe especificar el total de estudiantes del grupo.
6.366. Después del razonamiento manual: simulación en Excel
Podemos simular dos lanzamientos de una moneda equilibrada utilizando 1 para cara y 0 para sello.
En A2:
En B2:
En C2:
C2 es una realización de:
X = número de caras.
ALEATORIO() es una función volátil: al recalcular la hoja, los valores pueden cambiar.
Si deseamos conservar una simulación concreta, podemos copiar las celdas y pegarlas como valores.
La hoja de cálculo genera realizaciones del modelo; no define por nosotros cuál debe ser X.
6.367. Comprueba lo aprendido
1. ¿Qué es una variable aleatoria?
2. ¿Qué significa X: Ω → ℝ?
3. ¿Qué representa ω?
4. ¿Qué representa X(ω)?
5. ¿Qué diferencia existe entre X y x?
6. ¿Por qué X se llama aleatoria si su regla es fija?
7. ¿Pueden dos resultados diferentes producir el mismo valor?
8. ¿Qué es X(Ω)?
9. ¿Qué es el soporte de una variable discreta?
10. ¿Por qué imagen y soporte no deben identificarse siempre?
11. ¿Qué representa X−1(B)?
12. ¿Qué significa P(X=2)?
13. ¿Qué significa P(X≤a)?
14. ¿Qué relación existe entre estas condiciones y la medibilidad?
15. ¿Qué caracteriza a una variable discreta?
16. ¿Puede una variable discreta tener infinitos valores?
17. ¿Qué entendemos por variable absolutamente continua?
18. ¿Qué ocurre con P(X=x) en una distribución absolutamente continua?
19. ¿Qué es una distribución mixta?
20. ¿Por qué la resolución instrumental no determina por sí sola la naturaleza del modelo?
21. ¿Por qué registrar edades enteras no demuestra que la edad sea discreta?
22. ¿Qué es una variable indicadora?
23. ¿Qué significa Y=g(X)?
24. ¿Cómo puede el redondeo transformar una variable continua en una variable registrada discreta?
25. ¿Qué diferencia existe entre X y los datos x₁,…,xₙ?
26. ¿Por qué codificar colores mediante números no crea necesariamente una escala cuantitativa?
27. ¿Qué significa PX(B)=P(X∈B)?
28. ¿Cómo induce X una distribución de probabilidad?
29. ¿Qué pregunta natural aparece después de conocer los valores posibles de X?
Ver respuestas breves
1. Una función medible que asigna números reales a resultados del experimento.
2. Que X lleva resultados de Ω a números reales.
3. Un resultado elemental.
4. El número asignado por X al resultado ω.
5. X es la variable; x representa un valor posible o observado.
6. Porque lo incierto es qué resultado ocurrirá y qué valor de X observaremos.
7. Sí; CS y SC producen X=1 si X cuenta caras.
8. El conjunto de valores producidos por X.
9. En el caso discreto, {x:P(X=x)>0}.
10. Porque el soporte es un concepto probabilístico más general.
11. El conjunto de resultados ω cuyos valores pertenecen a B.
12. La probabilidad del evento formado por los resultados que producen el valor 2.
13. La probabilidad de los resultados para los cuales X(ω)≤a.
14. La medibilidad garantiza que condiciones numéricas apropiadas sobre X correspondan a eventos.
15. Su probabilidad está concentrada en un conjunto finito o numerable.
16. Sí; puede tener valores 1,2,3,… sin último valor.
17. Una variable cuya distribución puede representarse mediante una densidad.
18. P(X=x)=0 para cada valor individual.
19. Una distribución con componentes de diferentes tipos, por ejemplo masa puntual y parte continua.
20. Porque el instrumento y el modelo matemático son objetos diferentes.
21. Porque el registro puede haber redondeado o truncado una magnitud temporal continua.
22. Una variable que vale 1 si ocurre A y 0 en caso contrario.
23. Que Y se obtiene aplicando g al valor de X.
24. Mediante una regla de redondeo o cuantización.
25. X pertenece al modelo; los xᵢ son realizaciones observadas.
26. Porque los números pueden funcionar solamente como etiquetas.
27. La probabilidad que la distribución de X asigna al conjunto B.
28. Agrupa en cada conjunto de valores la probabilidad de todos los resultados que producen esos valores.
29. ¿Cómo se reparte la probabilidad entre los distintos valores de X?
6.368. Mapa conceptual
X:Ω→ℝ
PX(B)=P(X∈B)
Nota. Elaboración propia.
espacio muestral
resultado elemental
variable aleatoria
valor asignado
valor posible u observado
imagen de X
preimagen de B
probabilidad del evento asociado
distribución o ley de X
transformación de X
6.369. Síntesis
Una variable aleatoria transforma resultados de un experimento en números:
X:Ω→ℝ.
En el tratamiento universitario, X debe ser una función medible respecto de la estructura probabilística definida sobre Ω.
El símbolo ω representa un resultado elemental; X(ω) es el número asignado a ese resultado.
La letra mayúscula X suele representar la variable aleatoria, mientras que x representa un valor posible o una realización concreta.
La regla X es fija. Lo aleatorio es qué ω ocurrirá y, por tanto, qué valor de X observaremos.
Resultados distintos pueden producir el mismo valor.
Debemos distinguir:
Ω ≠ X(Ω).
Ω contiene resultados; X(Ω) contiene los valores numéricos producidos por X.
En variables discretas, el soporte puede describirse mediante:
{x:P(X=x)>0}.
Cuando formulamos una condición sobre los valores de X, buscamos su preimagen en Ω:
X−1(B) = {ω∈Ω:X(ω)∈B}.
Por eso:
P(X∈B) = P(X−1(B)).
Una variable discreta concentra su probabilidad en un conjunto finito o numerable.
En el caso absolutamente continuo, la distribución se describe mediante una densidad y cada punto individual tiene probabilidad cero.
Existen también distribuciones mixtas y otras distribuciones más generales.
Debemos distinguir cuidadosamente:
magnitud → modelo → instrumento → dato registrado.
La resolución de un instrumento no determina por sí sola la naturaleza del modelo.
Una variable indicadora transforma un evento en 0 o 1.
Una nueva variable puede construirse mediante:
Y=g(X).
La variable X pertenece al modelo; los valores x₁,…,xₙ son realizaciones observadas.
Finalmente, X induce una nueva distribución de probabilidad sobre ℝ:
PX(B)=P(X∈B).
Ahora que sabemos qué es una variable aleatoria, qué valores puede tomar y cómo transporta la probabilidad desde Ω, aparece la siguiente pregunta: ¿cómo describimos matemáticamente la distribución de esos valores?
El experimento produce un resultado.
La variable aleatoria lo convierte en un número.
Y la distribución de X nos dice cómo se reparte la probabilidad entre esos números.
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Kolmogorov, A. N. (1933). Grundbegriffe der Wahrscheinlichkeitsrechnung. Springer.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Distribuciones de probabilidad discretas
¿Cómo se reparte la probabilidad entre los valores de una variable?
función de masa · función acumulada · esperanza · momentos · varianza · desviación estándar · simulación
En la Parte 11 aprendimos que una variable aleatoria X transforma resultados de Ω en números y, al hacerlo, induce una distribución de probabilidad.
Ahora estudiaremos esa distribución cuando X es discreta. No basta conocer:
qué valores puede tomar X.
Necesitamos saber también:
qué probabilidad corresponde a cada valor.
A partir de esa información construiremos la función de masa, la función acumulada y medidas globales como esperanza, varianza y desviación estándar.
6.370. De una variable aleatoria a su distribución
Retomemos:
Sabemos:
X(Ω)={0,1,2}.
Pero conocer la imagen de X todavía no nos dice cómo se encuentra distribuida la probabilidad.
6.371. Una distribución discreta responde dos preguntas
0, 1 y 2
1/4, 1/2 y 1/4
Ambas informaciones forman parte de la distribución de X.
6.372. De la ley PX a la función de masa
En la Parte 11 definimos la distribución o ley de X mediante:
Si X es discreta podemos preguntar por un conjunto que contiene un solo valor:
B={x}.
Entonces:
PX({x})=P(X=x).
Definimos la función de masa de probabilidad:
Cuando no exista riesgo de confusión escribiremos:
p(x)=P(X=x).
La función pX puede definirse para todo x∈ℝ. Si x no pertenece al soporte de X, entonces: pX(x)=0.
p(x₁)
p(x₂)
p(x₃)
Nota. Elaboración propia.
6.373. Condiciones fundamentales de una función de masa
Para que pX represente una distribución discreta debe cumplir:
Ninguna masa de probabilidad puede ser negativa.
pX(x)≥0
Entre todos los valores del soporte debe reunirse toda la probabilidad.
Σ pX(x)=1
6.374. ¿Por qué las masas deben sumar 1?
Supongamos que el soporte de X es:
S={x₁,x₂,…}.
Los eventos:
{X=x₁}, {X=x₂}, …
son mutuamente excluyentes. Una realización de X no puede tomar simultáneamente dos valores diferentes.
Además:
P(X∈S)=1.
Por aditividad numerable:
P(X∈S)=ΣP(X=x).
Como pX(x)=P(X=x):
ΣpX(x)=1.
6.375. El soporte de una distribución discreta
Definimos el soporte discreto mediante:
Es decir, contiene los valores que poseen masa de probabilidad positiva.
Si:
pX(5)=0,
el número 5 puede pertenecer al dominio de la función pX, pero no pertenece al soporte efectivo de la distribución.
6.376. Ejemplo 1 · Número de clientes
Consideremos un modelo hipotético:
p(0)=0,10
p(1)=0,25
p(2)=0,35
p(3)=0,20
p(4)=0,10
0,10+0,25+0,35+0,20+0,10=1.
Nota. Datos hipotéticos creados exclusivamente con fines didácticos.
6.377. Representación gráfica de la función de masa
Nota. Elaboración propia con datos hipotéticos. La altura de cada barra representa pX(x).
6.378. ¿Por qué las barras están separadas?
Los valores:
0,1,2,3,4
son valores individuales y separados.
Por eso una función de masa suele representarse mediante barras separadas o un diagrama de bastones.
No confundir función de masa con histograma. En la función de masa cada altura representa P(X=x). Un histograma estadístico representa frecuencias, densidades o cantidades asociadas con intervalos de datos.
6.379. Probabilidad de un conjunto de valores
Para cualquier conjunto A de valores:
sumando sobre los valores x∈A.
Por ejemplo:
P(X≥3)=p(3)+p(4)
=0,20+0,10=0,30.
6.380. El complemento también simplifica cálculos
Queremos:
P(X≥1).
Su complemento es:
X=0.
P(X≥1)=1−P(X=0)
=1−0,10=0,90.
6.381. Ejemplo 2 · Construir una distribución desde Ω
Lanzamos dos dados equilibrados y definimos:
Los 36 pares ordenados son equiprobables, pero producen solo once sumas.
1/36
2/36
3/36
4/36
5/36
6/36
5/36
4/36
3/36
2/36
1/36
Nota. Elaboración propia. La altura es proporcional al número de pares ordenados que producen cada suma.
6.382. Los valores de X no tienen por qué ser equiprobables
Aunque los 36 pares ordenados son equiprobables:
La transformación X agrupa cantidades distintas de resultados elementales bajo cada valor numérico.
6.383. Función de distribución acumulada
La función de masa responde:
P(X=x).
Para acumular toda la probabilidad hasta un punto definimos, para cualquier variable aleatoria:
Cuando no exista ambigüedad escribiremos simplemente F(x).
6.384. Construimos la acumulada del ejemplo de clientes
p(0)=0,10
F(0)=0,10
p(1)=0,25
F(1)=0,35
p(2)=0,35
F(2)=0,70
p(3)=0,20
F(3)=0,90
p(4)=0,10
F(4)=1,00
6.385. Propiedades fundamentales de toda función acumulada
0≤F(x)≤1.
a<b ⇒ F(a)≤F(b).
F(x)→0 cuando x→−∞.
F(x)→1 cuando x→+∞.
F(x)=lim F(t) cuando t↓x.
6.386. La acumulada discreta es una función escalonada
Nota. Elaboración propia. El punto cerrado pertenece al escalón situado a su derecha; esto hace visible la continuidad por la derecha de F.
6.387. El tamaño del salto de F es P(X=x)
Definimos el límite por la izquierda:
F(x−)=P(X<x).
Como:
{X≤x}={X<x}∪{X=x},
y los dos eventos son disjuntos:
F(x)=F(x−)+P(X=x).
Por tanto:
pX(x) = F(x)−F(x−).
6.388. Probabilidades de intervalos mediante F
Para a<b:
En el modelo de clientes:
P(1<X≤3)=F(3)−F(1)
=0,90−0,35=0,55.
6.389. Los extremos abiertos y cerrados importan
F(b)−F(a)
F(b)−F(a−)
F(b−)−F(a)
F(b−)−F(a−)
En variables discretas, incluir o excluir un extremo puede cambiar la probabilidad, porque un punto individual puede tener masa positiva.
6.390. Derivación de P(a<X≤b)
Para a<b:
{X≤b} = {X≤a}∪{a<X≤b}.
Los eventos son disjuntos.
F(b)=F(a)+P(a<X≤b).
Despejando:
P(a<X≤b)=F(b)−F(a).
6.391. La acumulada determina completamente la distribución
La función F no es solamente una herramienta auxiliar.
Si conocemos F(x) para todo número real x, conocemos completamente la distribución de X.
En el caso discreto recuperamos cada masa mediante:
Así, la función de masa y la función acumulada contienen la misma distribución expresada de dos maneras distintas.
6.392. Esperanza matemática: un centro probabilístico
Para resumir la posición de una distribución utilizamos un promedio ponderado por probabilidades:
Esta cantidad recibe también los nombres:
valor esperado · media de la distribución.
6.393. Esperanza del número de clientes
E[X] = 0(0,10)+1(0,25)+2(0,35)+3(0,20)+4(0,10)
=0+0,25+0,70+0,60+0,40
E[X]=1,95.
0
1
2
3
4
Nota. Elaboración propia. La esperanza es una característica global de la distribución.
6.394. E[X]=1,95 no significa que observaremos 1,95 clientes
X solamente puede tomar:
0,1,2,3 o 4.
El valor 1,95 ni siquiera pertenece al soporte.
La esperanza no es una predicción de la próxima realización. Es una propiedad de toda la distribución y puede no ser un valor posible de X.
6.395. Esperanza y promedio observado no son el mismo objeto
Media teórica
Pertenece al modelo probabilístico.
Media muestral
Se calcula con datos observados.
Bajo condiciones apropiadas y con muchas observaciones, x̄ puede aproximarse a E[X]. Esa conexión será formalizada posteriormente mediante leyes de los grandes números.
6.396. ¿Cuándo existe una esperanza finita?
Para una distribución con soporte infinito, no basta escribir formalmente:
Σx p(x).
Para que E[X] sea un número real finito exigimos:
Esta condición garantiza convergencia absoluta y evita que el supuesto «promedio» dependa de reordenamientos de una serie.
6.397. Linealidad de la esperanza
Si las esperanzas involucradas existen:
Más generalmente:
La linealidad de la esperanza no requiere independencia. Esta será una herramienta muy poderosa al estudiar sumas de variables.
6.398. Demostración de E[aX+b]=aE[X]+b
E[aX+b]=Σ(ax+b)p(x).
Distribuimos:
=aΣxp(x)+bΣp(x).
Como:
Σp(x)=1
y:
Σxp(x)=E[X],
obtenemos:
E[aX+b]=aE[X]+b.
6.399. Esperanza de una función de X
Si:
Y=g(X),
no necesitamos encontrar primero la distribución de Y para calcular su esperanza.
siempre que:
Σ|g(x)|pX(x)<∞.
Este resultado suele conocerse como ley del estadístico inconsciente o por sus siglas inglesas LOTUS (Law of the Unconscious Statistician).
6.400. Momentos de una distribución
Las potencias de X permiten construir cantidades que resumen distintos aspectos de una distribución.
E[X]
Relacionada con el centro de la distribución.
E[X²]
Interviene en el cálculo de la varianza.
E[(X−μ)²]
Es la varianza.
6.401. Varianza: la media no cuenta toda la historia
Sea:
μ=E[X].
La varianza mide la desviación cuadrática media respecto de μ:
Para una variable discreta:
Var(X)=Σ(x−μ)²p(x),
siempre que E[X²] sea finita.
6.402. Fórmula alternativa de la varianza
Var(X)=E[(X−μ)²].
Expandimos:
(X−μ)²=X²−2μX+μ².
Aplicamos esperanza:
Var(X)=E[X²]−2μE[X]+μ².
Como μ=E[X]:
Var(X)=E[X²]−E[X]².
6.403. Varianza del número de clientes
E[X]=1,95.
Calculamos:
E[X²] = 0²(0,10)+1²(0,25)+2²(0,35)+3²(0,20)+4²(0,10)
=5,05.
Var(X)=5,05−(1,95)²
Var(X)=1,2475.
6.404. Desviación estándar
Como la varianza está expresada en unidades al cuadrado, calculamos:
Para los clientes:
σX=√1,2475≈1,1169 clientes.
La desviación estándar vuelve a expresarse en las mismas unidades de X.
6.405. Misma esperanza, diferente dispersión
P(X=1)=0,25
P(X=2)=0,50
P(X=3)=0,25
E[X]=2
Var(X)=0,5
P(X=0)=0,25
P(X=2)=0,50
P(X=4)=0,25
E[X]=2
Var(X)=2
E[X]=2
Var=0,5
E[X]=2
Var=2
Nota. Elaboración propia. La igualdad de las medias no implica igualdad de las distribuciones.
6.406. Cambiar el origen y la escala
Si:
Y=aX+b,
entonces:
Por tanto:
σY=|a|σX.
6.407. Demostración de Var(aX+b)=a²Var(X)
Y=aX+b.
Sabemos:
E[Y]=aE[X]+b.
Entonces:
Y−E[Y]=a(X−E[X]).
Elevamos al cuadrado y aplicamos esperanza:
Var(Y)=a²Var(X).
6.408. Propiedades estructurales de la varianza
Como una cantidad al cuadrado nunca es negativa:
Var(X)≥0.
Además:
si y solo si X es constante con probabilidad 1.
La expresión «con probabilidad 1» es importante: en teoría de probabilidad se dice que X es constante casi seguramente.
6.409. Cómo reconocer una función de masa válida
0,20 · 0,30 · 0,50
No negativas y suma 1.
0,30 · −0,10 · 0,80
Contiene una masa negativa.
0,20 · 0,20 · 0,20
La suma es 0,60.
0 · 0,40 · 0,60
Una masa puede ser 0.
6.410. Simular una distribución discreta
Para el ejemplo de los clientes las probabilidades acumuladas son:
0,10 · 0,35 · 0,70 · 0,90 · 1,00.
Tomamos un número pseudoaleatorio U en [0,1) y dividimos ese intervalo en regiones cuya longitud coincide con las probabilidades de X.
Nota. Elaboración propia.
6.411. Método de transformación inversa
El procedimiento anterior puede escribirse de manera general.
Sea U una variable uniforme en [0,1). Definimos la inversa generalizada de F:
Entonces podemos generar:
X=F−1(U).
Esta idea no está limitada a cinco valores: constituye uno de los procedimientos fundamentales para simular distribuciones a partir de números uniformes.
6.412. ¿Por qué los intervalos de simulación producen las probabilidades correctas?
Para un valor xᵢ asignamos un intervalo de [0,1) cuya longitud es:
p(xᵢ).
Como U es uniforme en [0,1), la probabilidad de caer en un intervalo es exactamente igual a la longitud de ese intervalo.
Por tanto:
P(X=xᵢ)=p(xᵢ).
Y como las longitudes suman 1, los intervalos cubren todo [0,1).
6.413. Simulación en Excel
En A2:
En B2:
Copiamos las fórmulas hacia abajo para generar muchas realizaciones.
ALEATORIO() es volátil: al recalcular la hoja genera nuevos valores.
Si deseamos conservar una simulación concreta, podemos copiar los resultados y pegarlos como valores.
6.414. Distribución teórica y distribución simulada
Una simulación finita no reproduce exactamente:
0,10 · 0,25 · 0,35 · 0,20 · 0,10.
Obtendremos frecuencias relativas próximas, pero fluctuantes.
Al aumentar el número de simulaciones, bajo las condiciones habituales de repetición independiente, las frecuencias relativas tienden a estabilizarse alrededor de las probabilidades teóricas. Esta es una manifestación de la ley de los grandes números.
6.415. Errores frecuentes
Suponer que todos los valores son equiprobables.
Permitir p(x)<0.
Olvidar Σp(x)=1.
Confundir p(x) con F(x).
Interpretar E[X] como la próxima observación.
Confundir varianza con desviación estándar.
Confundir función de masa e histograma.
Creer que una simulación finita debe coincidir exactamente con el modelo.
Olvidar la continuidad por la derecha de F.
Usar F(b)−F(a) sin revisar qué extremos están incluidos.
Calcular una esperanza infinita sin comprobar convergencia.
Creer que igual esperanza implica igual distribución.
6.416. Práctica de dificultad creciente
p(0)=0,20, p(1)=0,50, p(2)=0,30.
Calcula P(X≥1), F(0) y F(1).
Ver solución
P(X≥1)=0,80.
F(0)=0,20.
F(1)=0,70.
X toma 0, 2 y 4 con probabilidades:
0,20; 0,50; 0,30.
Calcula E[X].
Ver solución
E[X]=0(0,20)+2(0,50)+4(0,30)=2,20.
Para la misma distribución calcula:
a) E[X²];
b) Var(X);
c) σ.
Ver solución
E[X²]=6,80.
Var(X)=6,80−(2,20)²=1,96.
σ=1,40.
Una variable tiene soporte {1,2,3,…} y:
p(k)=2−k.
Comprueba que es una función de masa y analiza si E[X] es finita.
Ver orientación
Σ2−k=1.
Además Σk/2k=2, por lo que E[X]=2.
6.417. Actividad integradora · La suma de dos dados
1. Calcula P(X=7).
2. Calcula P(X=12).
3. Calcula P(X≤5).
4. Calcula P(X≥10).
5. Calcula P(5≤X≤9).
6. Construye F(x).
7. Identifica los saltos de F.
8. Calcula E[X].
9. Calcula E[X²].
10. Calcula Var(X).
11. Explica por qué la distribución es simétrica alrededor de 7.
Ver resultados principales
P(X=7)=1/6≈0,1667.
P(X=12)=1/36≈0,0278.
P(X≤5)=10/36=5/18≈0,2778.
P(X≥10)=6/36=1/6.
P(5≤X≤9)=24/36=2/3.
E[X]=7.
E[X²]=329/6≈54,8333.
Var(X)=329/6−49=35/6≈5,8333.
La simetría se debe a que las cantidades de pares ordenados para 7−d y 7+d son iguales.
6.418. Comprueba lo aprendido
1. ¿Qué relación existe entre PX y pX?
2. ¿Qué significa pX(x)?
3. ¿Qué condiciones debe cumplir una función de masa?
4. ¿Qué es el soporte SX?
5. ¿Por qué los valores posibles no tienen que ser equiprobables?
6. ¿Cómo calculamos P(X∈A)?
7. Define FX(x).
8. Enumera las propiedades fundamentales de una CDF.
9. ¿Qué representa el salto de F en x?
10. ¿Por qué F es continua por la derecha?
11. ¿Cómo calculamos P(a<X≤b)?
12. ¿Cómo cambia la fórmula si incluimos a?
13. ¿Por qué F determina completamente la distribución?
14. ¿Qué representa E[X]?
15. ¿Por qué E[X] puede no pertenecer al soporte?
16. ¿Qué condición garantiza una esperanza finita?
17. ¿La linealidad de E requiere independencia?
18. ¿Qué expresa E[g(X)]?
19. ¿Qué es un momento?
20. Define Var(X).
21. Escribe la fórmula alternativa de la varianza.
22. ¿Qué representa σ?
23. ¿Qué sucede con Var(X+b)?
24. ¿Qué sucede con Var(aX)?
25. ¿Cuándo vale Var(X)=0?
26. ¿En qué consiste la transformación inversa?
27. ¿Por qué una simulación finita fluctúa?
28. ¿Qué diferencia conceptual existe entre distribución teórica y frecuencias simuladas?
6.419. Síntesis
pX(x)=P(X=x)
FX(x)=P(X≤x)
E[X]
Var(X)
σX
U → F−1(U)
Nota. Elaboración propia.
Una variable discreta posee una distribución concentrada en un conjunto finito o numerable de valores.
Su función de masa:
pX(x)=P(X=x)
satisface:
pX(x)≥0 y ΣpX(x)=1.
La función acumulada:
FX(x)=P(X≤x)
es no decreciente, continua por la derecha y determina completamente la distribución.
En una distribución discreta:
pX(x)=F(x)−F(x−).
La esperanza:
E[X]=Σxp(x)
es un promedio probabilístico y requiere convergencia apropiada cuando el soporte es infinito.
Para una transformación:
E[g(X)]=Σg(x)p(x).
La varianza:
Var(X)=E[(X−E[X])²]
mide dispersión cuadrática y también puede calcularse como:
Var(X)=E[X²]−E[X]².
La desviación estándar:
σX=√Var(X)
se expresa en las mismas unidades de X.
Finalmente, una distribución discreta puede simularse transformando una variable uniforme mediante la inversa generalizada de F.
Ya disponemos de las herramientas generales. Ahora podremos estudiar familias específicas de distribuciones y reconocer las estructuras que las generan.
La variable aleatoria nos dice qué valores pueden aparecer.
Su distribución nos dice cuánto peso probabilístico posee cada valor y cómo se comporta el conjunto completo.
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Bernoulli y distribución binomial
De un ensayo con dos resultados al conteo de éxitos en muchos ensayos
Bernoulli · indicadores · ensayos i.i.d. · binomial · C(n,k) · acumuladas · media · varianza · forma · simulación · inferencia
Muchas situaciones pueden formularse mediante una pregunta binaria: ocurre o no ocurre determinada característica. Un solo ensayo puede modelarse mediante una variable de Bernoulli.
Si realizamos n ensayos independientes con la misma probabilidad p de éxito y contamos cuántos éxitos aparecen, obtenemos uno de los modelos discretos más importantes de la probabilidad:
X ~ Binomial(n,p).
La fórmula binomial no es una receta aislada. Surge de combinar tres ideas ya estudiadas: independencia, multiplicación de probabilidades y combinaciones.
6.420. Muchas preguntas pueden formularse como «sí» o «no»
Consideremos algunas situaciones.
¿apareció cara?
¿la respuesta fue correcta?
¿la pieza es defectuosa?
¿el cliente realizó una compra?
En cada caso elegimos una característica que queremos registrar.
6.421. «Éxito» no significa necesariamente algo bueno
la categoría que decidimos contar
la categoría complementaria
Si estudiamos defectos podemos definir:
éxito = «la pieza es defectuosa».
Éxito y fracaso son etiquetas matemáticas. No expresan una valoración positiva o negativa.
6.422. Ensayo de Bernoulli
Un ensayo de Bernoulli es un experimento aleatorio en el que distinguimos, respecto de la característica estudiada, exactamente dos categorías complementarias: éxito y fracaso.
Si:
P(éxito)=p,
entonces:
Naturalmente:
0≤p≤1.
X=1
P(X=1)=p
X=0
P(X=0)=1−p
Nota. Elaboración propia.
6.423. Variable aleatoria de Bernoulli
Definimos:
X=1 si ocurre el éxito
X=0 si ocurre el fracaso.
Escribimos:
fracaso
pX(0)=1−p
éxito
pX(1)=p
6.424. Una sola fórmula para la función de masa de Bernoulli
Para 0<p<1 y x∈{0,1} podemos escribir:
Si x=1:
p¹(1−p)⁰=p.
Si x=0:
p⁰(1−p)¹=1−p.
Fuera de {0,1}:
pX(x)=0.
6.425. Ejemplo 1 · Una respuesta correcta o incorrecta
En un modelo hipotético:
P(respuesta correcta)=0,70.
Definimos éxito = respuesta correcta.
Nota. Probabilidades hipotéticas utilizadas exclusivamente con fines didácticos.
Nota. Elaboración propia.
6.426. Media y varianza de Bernoulli
6.427. Demostración de E[X]=p y Var(X)=p(1−p)
Por definición:
E[X]=0(1−p)+1(p)=p.
Además, como X solo toma 0 y 1:
X²=X.
Entonces:
E[X²]=E[X]=p.
Utilizando:
Var(X)=E[X²]−E[X]²,
Var(X)=p−p²=p(1−p).
6.428. Bernoulli y las variables indicadoras
Sea A un evento. Su variable indicadora:
IA=1 si ocurre A, IA=0 si no ocurre A,
es una variable Bernoulli con:
p=P(A).
Por tanto:
Esta identidad convierte probabilidades en esperanzas y será útil repetidamente en teoría de probabilidad.
6.429. De un ensayo a muchos ensayos
Supongamos que repetimos un ensayo Bernoulli cinco veces.
Una realización podría ser:
El número total de éxitos es:
1+0+1+1+0=3.
cada una vale 0 o 1
Nota. Elaboración propia.
6.430. Definición universitaria de una variable binomial
Sean:
X₁,X₂,…,Xₙ
variables Bernoulli independientes con el mismo parámetro p:
Xᵢ ~ Bernoulli(p).
Definimos:
Entonces:
La expresión i.i.d., frecuente en textos universitarios, significa:
independientes e idénticamente distribuidas.
6.431. Las cuatro condiciones del modelo binomial
Se realizan exactamente n ensayos.
Cada ensayo se registra como éxito o fracaso.
La probabilidad de éxito es p en todos los ensayos.
Los resultados de unos ensayos no alteran las probabilidades de los otros.
6.432. Cada condición justifica una parte de la fórmula
determina cuántas posiciones existen.
permite representar cada ensayo mediante 0 o 1.
hace iguales las probabilidades de las secuencias con el mismo número de éxitos.
permite multiplicar las probabilidades de los ensayos dentro de una secuencia.
6.433. No todo conteo binario es binomial
La existencia de dos categorías no basta.
Si las probabilidades cambian entre ensayos, si existe dependencia o si n no está fijado, el conteo puede seguir otra distribución.
Una fórmula binomial aplicada a un mecanismo no binomial puede producir un número perfectamente calculado, pero científicamente incorrecto como modelo.
6.434. Primero: la probabilidad de una secuencia concreta
Supongamos n=5 y queremos una secuencia particular con tres éxitos:
Si los ensayos son independientes:
En general, una secuencia particular con k éxitos y n−k fracasos tiene:
pk(1−p)n−k.
6.435. ¿Cuántas secuencias producen k éxitos?
Debemos escoger las k posiciones que contendrán éxito entre las n posiciones disponibles.
É É F É F
probabilidad p³(1−p)²
todos los órdenes con tres éxitos
C(5,3)=10 órdenes
Nota. Elaboración propia.
6.436. Derivación de la función de masa binomial
Una secuencia determinada con k éxitos posee probabilidad:
pk(1−p)n−k.
Existen:
C(n,k)
secuencias diferentes con k éxitos. Son eventos mutuamente excluyentes.
Sumamos sus probabilidades:
6.437. Función de masa de la distribución binomial
k=0,1,2,…,n.
número de ensayos
número de éxitos
probabilidad de éxito
probabilidad de fracaso
formas de ubicar k éxitos
6.438. ¿Por qué las probabilidades binomiales suman 1?
Sumamos para k=0,1,…,n:
ΣC(n,k)pk(1−p)n−k.
Por el teorema del binomio:
(a+b)n = ΣC(n,k)akbn−k.
Tomamos a=p y b=1−p:
ΣP(X=k)=[p+(1−p)]n.
ΣP(X=k)=1.
6.439. Ejemplo 2 · Exactamente 3 caras en 5 lanzamientos
Para cinco lanzamientos independientes de una moneda equilibrada:
n=5, k=3, p=0,50.
C(5,3)=10.
P(X=3)=10(0,50)³(0,50)²
=10(0,50)⁵ =10/32
=0,3125=31,25 %.
6.440. La distribución completa para n=5 y p=0,50
1/32
3,125 %
5/32
15,625 %
10/32
31,25 %
10/32
31,25 %
5/32
15,625 %
1/32
3,125 %
Nota. Elaboración propia. Las alturas son proporcionales a las probabilidades.
6.441. Traducir correctamente el lenguaje
X=k
X≤k
X<k
X≥k
X>k
a≤X≤b
6.442. Función acumulada de una binomial
Si:
X ~ Binomial(n,p),
entonces, para un entero k:
En general esta suma no se reduce a una expresión elemental sencilla, por lo que para n grandes suele evaluarse mediante software.
6.443. «Al menos un éxito»: el complemento
El evento:
X≥1
es el complemento de X=0.
P(X=0)=(1−p)n
P(X≥1)=1−(1−p)n.
6.444. Ejemplo · Al menos una pieza defectuosa
Supongamos:
n=20, p=0,02,
donde éxito significa «pieza defectuosa».
P(X=0)=(0,98)²⁰≈0,6676.
6.445. Exactamente k y al menos k son preguntas diferentes
P(X=3)
incluye únicamente el valor 3.
P(X≥3)
incluye:
3,4,5,…,n.
La traducción del lenguaje debe hacerse antes de seleccionar la fórmula.
6.446. Esperanza de una binomial
np es el número esperado de éxitos, no una predicción obligatoria para una realización concreta.
6.447. Varianza y desviación estándar
6.448. E[X]=np y Var(X)=np(1−p) mediante indicadores
Escribimos:
X=X₁+X₂+···+Xₙ,
con Xᵢ ~ Bernoulli(p).
Por linealidad:
E[X]=ΣE[Xᵢ]=np.
Para la varianza:
Var(X)=Var(X₁+···+Xₙ).
Debido a la independencia:
Var(X)=ΣVar(Xᵢ).
Como cada término vale p(1−p):
Var(X)=np(1−p).
La independencia no es necesaria para sumar esperanzas, pero sí es esencial para sumar directamente las varianzas sin términos de covarianza.
6.449. Ejemplo · Centro y dispersión
X ~ Binomial(100;0,30).
30
21
√21≈4,58
6.450. ¿Cómo cambia la distribución cuando cambia p?
Mantengamos n=10.
la masa se concentra hacia valores pequeños.
la distribución es simétrica.
la masa se concentra hacia valores grandes.
E[X]=2
E[X]=5
E[X]=8
Nota. Elaboración propia. Representación esquemática de la forma de las tres distribuciones.
6.451. ¿Por qué p=0,50 produce simetría?
Cuando p=0,50:
P(X=k)=C(n,k)(0,50)n.
Como:
C(n,k)=C(n,n−k),
obtenemos:
6.452. Asimetría de una distribución binomial
La forma puede cuantificarse mediante el coeficiente de asimetría:
Para 0<p<1:
p<0,50: asimetría positiva;
p=0,50: asimetría cero;
p>0,50: asimetría negativa.
6.453. Relación entre probabilidades consecutivas
Para 0<p<1:
Esta relación permite calcular probabilidades sucesivas sin evaluar repetidamente factoriales.
las probabilidades están aumentando.
dos probabilidades consecutivas son iguales.
las probabilidades están disminuyendo.
6.454. La moda de una binomial
La distribución aumenta mientras:
P(X=k+1)≥P(X=k).
Usando la razón anterior:
[(n−k)/(k+1)]·[p/(1−p)]≥1.
Al reorganizar:
k≤(n+1)p−1.
Por ello, para 0<p<1:
Si (n+1)p no es entero, existe una sola moda:
moda=⌊(n+1)p⌋.
Si (n+1)p=m es entero, existen dos modas:
m−1 y m.
Por ejemplo, con n=5 y p=0,50:
(5+1)(0,50)=3.
Las modas son 2 y 3.
6.455. Función generadora de momentos
Para una variable aleatoria X definimos, cuando existe alrededor de t=0:
Para una Bernoulli:
M(t)=(1−p)+pet.
6.456. Función generadora de momentos de la binomial
Como:
X=X₁+···+Xₙ
y las Xᵢ son independientes:
MX(t) = ∏MXᵢ(t).
Cada factor es:
(1−p)+pet.
MX(t) = [1−p+pet]n.
Sus derivadas en t=0 permiten recuperar momentos como E[X] y E[X²].
6.457. Sumar binomiales con la misma p
Si:
X ~ Binomial(n,p)
y:
Y ~ Binomial(m,p),
y X e Y son independientes, entonces:
La condición de tener la misma p es esencial.
6.458. Demostración mediante funciones generadoras
Debido a la independencia:
MX+Y(t) = MX(t) MY(t).
=[1−p+pet]n [1−p+pet]m.
=[1−p+pet]n+m.
Esta es la función generadora de una Binomial(n+m,p).
6.459. p pertenece al modelo; k/n pertenece a los datos
Supongamos que el modelo utiliza:
p=0,30.
Realizamos n=10 ensayos y observamos k=5 éxitos.
La frecuencia observada es:
k/n=5/10=0,50.
p=0,30 y k/n=0,50 no se contradicen. p describe el modelo; k/n describe una realización observada.
6.460. De probabilidad a inferencia: la verosimilitud de p
Hasta ahora hemos supuesto conocido p y hemos calculado probabilidades sobre X.
En estadística suele ocurrir lo contrario: observamos k éxitos en n ensayos y queremos aprender algo sobre p.
Para unos datos observados k, la función:
se interpreta ahora como función del parámetro p y recibe el nombre de verosimilitud.
6.461. ¿Por qué p̂=k/n es el estimador de máxima verosimilitud?
Para 0<k<n tomamos logaritmos:
ℓ(p)=constante+k ln(p)+(n−k)ln(1−p).
Derivamos:
ℓ′(p)=k/p−(n−k)/(1−p).
Igualamos a cero:
k(1−p)=(n−k)p.
Despejamos:
p̂=k/n.
Si k=0, el máximo ocurre en p̂=0; si k=n, ocurre en p̂=1. Aquí solo estamos anticipando una idea de inferencia estadística.
6.462. Muestrear sin reemplazo puede romper el modelo binomial
Supongamos una caja con cinco bolas rojas y cinco azules.
Antes de extraer:
P(roja)=5/10=0,50.
Si extraemos una roja y no la devolvemos:
P(roja en la siguiente)=4/9≈0,4444.
La probabilidad cambia y las extracciones son dependientes.
Para muestreo sin reemplazo en una población finita, el modelo exacto correspondiente al conteo de éxitos suele ser la distribución hipergeométrica, que estudiaremos en la siguiente parte.
6.463. Ensayos independientes con probabilidades diferentes
Supongamos:
Xᵢ ~ Bernoulli(pᵢ),
y las variables son independientes, pero:
p₁,p₂,…,pₙ
no son todas iguales.
Entonces:
X=X₁+···+Xₙ
no tiene en general una Binomial(n,p).
El conteo sigue una distribución denominada Poisson-binomial. La binomial ordinaria es el caso especial p₁=p₂=···=pₙ=p.
6.464. Dependencia y sobredispersión
Para una Binomial(n,p):
Var(X)=np(1−p).
En datos reales puede observarse una variabilidad mucho mayor que la prevista por esta expresión.
Esto puede indicar, entre otras posibilidades:
Cuando la varianza observada supera sistemáticamente la que predice el modelo hablamos de sobredispersión.
6.465. Bernoulli, binomial y modelos cercanos
un solo ensayo: 0 o 1.
n ensayos independientes con la misma p.
muestreo sin reemplazo en población finita.
Bernoulli independientes con pᵢ diferentes.
Nota. Elaboración propia.
6.466. Cálculo y simulación en Excel
Para n=5, k=3 y p=0,50 podemos comprobar manualmente:
El resultado es:
0,3125.
Para simular un ensayo Bernoulli con p=0,30:
Copiamos la fórmula en n celdas y sumamos los resultados.
Nota. Datos simulados con fines didácticos.
6.467. Aplicación · Control de calidad
Supongamos:
X ~ Binomial(12;0,05),
donde X es el número de piezas defectuosas.
Ninguna defectuosa: P(X=0)=(0,95)¹²≈0,5404.
Exactamente una: P(X=1)=12(0,05)(0,95)¹¹≈0,3413.
Al menos una: P(X≥1)≈0,4596.
A lo sumo dos: P(X≤2)≈0,9804.
Nota. Modelo hipotético utilizado exclusivamente con fines didácticos.
6.468. Errores frecuentes
Creer que «éxito» significa un resultado deseable.
Usar binomial únicamente porque existen dos categorías.
Olvidar el factor C(n,k).
Confundir exactamente k con al menos k.
Confundir p con la frecuencia observada k/n.
Aplicar binomial exacta a muestreo sin reemplazo.
Interpretar np como un resultado obligatorio.
Suponer independencia sin justificarla.
Creer que probabilidades pᵢ diferentes todavía producen una Binomial(n,p).
Creer que igual media implica igual distribución.
6.469. Práctica de dificultad creciente
X ~ Bernoulli(0,65). Calcula P(X=1), P(X=0), E[X] y Var(X).
Ver solución
P(X=1)=0,65.
P(X=0)=0,35.
E[X]=0,65.
Var(X)=0,65(0,35)=0,2275.
X ~ Binomial(6;0,40). Calcula P(X=2).
Ver solución
C(6,2)=15.
P(X=2)=15(0,40)²(0,60)⁴.
=0,31104≈31,10 %.
X ~ Binomial(10;0,20).
a) Calcula P(X=2).
b) Calcula P(X≤2).
c) Calcula P(X≥1).
d) Determina E[X] y Var(X).
e) Determina la moda.
Sean X ~ Binomial(8;0,40) y Y ~ Binomial(12;0,40), independientes.
1. Determina la distribución de X+Y.
2. Calcula E[X+Y].
3. Calcula Var(X+Y).
4. Explica por qué la respuesta cambiaría si Y tuviera p=0,60.
Ver orientación
X+Y ~ Binomial(20;0,40).
E[X+Y]=20(0,40)=8.
Var(X+Y)=20(0,40)(0,60)=4,8.
Con probabilidades diferentes, la suma ya no es una binomial ordinaria.
6.470. Actividad guiada · Ocho lanzamientos
Se lanza una moneda equilibrada ocho veces:
X = número de caras.
1. Identifica n y p.
2. Escribe la distribución de X.
3. Calcula P(X=0).
4. Calcula P(X=1).
5. Calcula P(X=4).
6. Calcula P(X=8).
7. Calcula P(X≥1).
8. Calcula E[X].
9. Calcula Var(X).
10. Calcula σ.
11. Determina la moda o modas.
6.471. Actividad · Control de calidad
Para X ~ Binomial(12;0,05):
1. Define qué representa éxito.
2. Calcula P(X=0).
3. Calcula P(X=1).
4. Calcula P(X≥1).
5. Calcula P(X≤2).
6. Calcula E[X].
7. Calcula Var(X).
8. Calcula σ.
9. Interpreta E[X] en contexto.
10. Explica qué hipótesis reales tendrían que verificarse para justificar la independencia entre piezas.
6.472. Reto de modelación · ¿Binomial o no?
1. Contar caras en 20 lanzamientos independientes con p constante.
2. Contar cartas rojas en 10 extracciones sin reemplazo.
3. Contar respuestas correctas en 15 preguntas independientes con igual probabilidad de acierto.
4. Contar compras entre 100 clientes independientes cuando cada cliente posee una probabilidad pᵢ diferente.
5. Contar defectos cuando la tasa de defecto aumenta durante el turno.
6. Contar respuestas positivas cuando la decisión de un participante puede influir sobre el siguiente.
Ver orientación
1. Binomial.
2. No binomial exacta. Corresponde al marco hipergeométrico.
3. Binomial, bajo las hipótesis indicadas.
4. No binomial ordinaria. Puede aparecer una Poisson-binomial.
5. No. p no permanece constante.
6. No en general. Puede existir dependencia.
6.473. Comprueba lo aprendido
1. ¿Qué es un ensayo de Bernoulli?
2. ¿Qué significan éxito y fracaso?
3. ¿Qué valores toma una Bernoulli?
4. Escribe su función de masa.
5. ¿Cuál es E[X] para Bernoulli(p)?
6. ¿Cuál es Var(X)?
7. ¿Qué relación existe entre Bernoulli e indicadores?
8. ¿Qué significa i.i.d.?
9. ¿Cómo se construye X binomial a partir de X₁,…,Xₙ?
10. ¿Cuáles son las cuatro condiciones binomiales?
11. ¿Por qué aparece C(n,k)?
12. Escribe la función de masa binomial.
13. ¿Qué significa exactamente k?
14. ¿Qué significa a lo sumo k?
15. ¿Qué significa al menos k?
16. ¿Cómo se calcula F(k)?
17. ¿Cómo se calcula P(X≥1)?
18. ¿Cuál es E[X] para una binomial?
19. ¿Cuál es Var(X)?
20. ¿Cuál es σ?
21. ¿Por qué la linealidad de la esperanza no necesita independencia?
22. ¿Por qué sí aparece independencia al sumar varianzas?
23. ¿Cuándo una binomial es simétrica?
24. ¿Qué indica el signo de su asimetría?
25. ¿Cómo se determina su moda?
26. ¿Qué es la función generadora de momentos?
27. ¿Cuándo la suma de dos binomiales sigue siendo binomial?
28. ¿Por qué p y k/n son conceptos distintos?
29. ¿Qué es la verosimilitud de p?
30. ¿Por qué aparece p̂=k/n?
31. ¿Por qué el muestreo sin reemplazo no suele ser binomial exacto?
32. ¿Qué es una distribución Poisson-binomial?
33. ¿Qué entendemos por sobredispersión?
34. ¿Por qué reconocer el mecanismo del experimento es más importante que reconocer una fórmula?
6.474. Mapa conceptual
0 o 1
C(n,k)pk(1−p)n−k
E[X]=np
Var=np(1−p)
Nota. Elaboración propia.
6.475. Síntesis
Un ensayo Bernoulli produce dos categorías complementarias.
X ~ Bernoulli(p)
significa:
P(X=1)=p, P(X=0)=1−p.
Su esperanza y varianza son:
E[X]=p, Var(X)=p(1−p).
Si X₁,…,Xₙ son Bernoulli independientes e idénticamente distribuidas con parámetro p:
X=X₁+···+Xₙ
tiene distribución:
X ~ Binomial(n,p).
Su función de masa es:
P(X=k)=C(n,k)pk(1−p)n−k.
C(n,k) aparece porque varios órdenes distintos pueden producir exactamente k éxitos.
La función acumulada se obtiene sumando las masas:
F(k)=P(X≤k).
Para al menos un éxito:
P(X≥1)=1−(1−p)n.
La media y la dispersión son:
E[X]=np,
Var(X)=np(1−p),
σ=√[np(1−p)].
Cuando p=0,50 la distribución es simétrica. Cuando p se aleja de 0,50 aparece asimetría.
La moda puede determinarse mediante (n+1)p y las probabilidades sucesivas mediante una relación recursiva.
La función generadora de momentos es:
MX(t)=[1−p+pet]n.
La suma de binomiales independientes con la misma p sigue siendo binomial.
Si las probabilidades de éxito difieren entre ensayos, puede aparecer la distribución Poisson-binomial. Si muestreamos sin reemplazo de una población finita, el modelo exacto suele ser hipergeométrico.
También debemos distinguir:
p = parámetro del modelo
k/n = frecuencia observada.
A partir de los datos, la verosimilitud conduce naturalmente al estimador:
p̂=k/n.
La lección central no consiste en memorizar una expresión con factoriales: consiste en reconocer qué mecanismo probabilístico hace legítimo utilizar esa expresión.
Bernoulli registra si el éxito ocurrió.
La binomial cuenta cuántas veces ocurrió después de repetir el ensayo bajo condiciones probabilísticas precisas.
Referencias
Bernoulli, J. (1713). Ars conjectandi. Thurneysen.
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Distribuciones geométrica, hipergeométrica y Poisson
Esperar · muestrear · contar: tres mecanismos diferentes, tres modelos diferentes
primer éxito · sin reemplazo · población finita · tasa · proceso de Poisson · aproximaciones · conexiones
Una distribución de probabilidad no se elige porque su fórmula contenga números parecidos a los del problema. Primero debemos identificar qué mecanismo aleatorio genera la variable X.
Si repetimos ensayos hasta observar el primer éxito, aparece la distribución geométrica.
Si seleccionamos una muestra sin reemplazo de una población finita y contamos éxitos, aparece la distribución hipergeométrica.
Si contamos eventos que ocurren dentro de un intervalo bajo un mecanismo compatible con una tasa estable e incrementos independientes, aparece la distribución de Poisson.
mecanismo → variable → distribución → cálculo → interpretación
6.476. La pregunta determina el modelo
Compare las siguientes preguntas.
¿En qué intento aparecerá el primer éxito?
GEOMÉTRICA
¿Cuántos éxitos aparecerán en una muestra tomada sin reemplazo?
HIPERGEOMÉTRICA
¿Cuántos eventos ocurrirán durante cierto intervalo?
POISSON
registra cuándo aparece el primer éxito
GEOMÉTRICAcuenta éxitos en una muestra sin reemplazo
HIPERGEOMÉTRICAregistra eventos en un intervalo
POISSONNota. Elaboración propia.
6.477. Antes de calcular: identifica el mecanismo
X: ensayo del primer éxito.
Soporte: 1,2,3,…
Clave: p constante e independencia.
X: éxitos encontrados en una muestra.
Población: finita.
Clave: selección sin reemplazo.
X: número de eventos en una región.
Soporte: 0,1,2,…
Clave: tasa e incrementos compatibles con Poisson.
6.478. El experimento continúa hasta que aparece el primer éxito
Lanzamos una moneda repetidamente y llamamos éxito a obtener cara.
X=1
X=2
X=3
X=4
A diferencia de una binomial, el número total de ensayos no está fijado previamente.
X=4
Nota. Elaboración propia.
6.479. Condiciones del modelo geométrico
éxito o fracaso.
la probabilidad de éxito no cambia.
los ensayos se modelan como independientes.
terminamos al aparecer el primer éxito.
6.480. La convención que utilizaremos
X∈{1,2,3,…}.
Atención. Algunos libros definen una geométrica como el número de fracasos anteriores al primer éxito. En esa convención el soporte comienza en 0. Aquí utilizaremos siempre el número del ensayo del primer éxito.
6.481. Función de masa geométrica
Para que X=k deben producirse:
k−1 fracasos seguidos de un éxito.
6.482. Derivación de la función de masa geométrica
El evento X=k tiene la estructura:
F · F · … · F · E.
Hay k−1 fracasos. Su probabilidad conjunta es:
(1−p)k−1.
El ensayo k debe ser un éxito de probabilidad p.
P(X=k)=(1−p)k−1p.
6.483. Ejemplo · Primer éxito en el cuarto intento
Si p=0,25:
P(X=4)=(0,75)³(0,25).
=0,10546875
≈10,55 %
6.484. Cola, supervivencia y función acumulada
El evento:
X>k
significa que los primeros k ensayos fueron fracasos. Por tanto:
P(X>k)=(1−p)k
P(X≤k)=1−(1−p)k
6.485. Ejemplo · Éxito durante los primeros tres intentos
Con p=0,25:
P(X>3)=(0,75)³=0,421875.
P(X≤3)=1−0,421875
=0,578125=57,8125 %.
6.486. La forma de una distribución geométrica
Nota. Elaboración propia. Cada probabilidad es el 75 % de la anterior.
6.487. Media, varianza y desviación estándar geométricas
Si p=0,25:
E[X]=4.
E[X]=4 no significa que el primer éxito tenga que aparecer en el cuarto ensayo. Es la media de toda la distribución de tiempos de espera.
6.488. ¿Por qué E[X]=1/p?
Para una variable entera positiva:
E[X]=Σk≥0P(X>k).
En la geométrica:
P(X>k)=(1−p)k.
E[X]=1+(1−p)+(1−p)²+···
Es una serie geométrica de razón 1−p.
E[X]=1/p.
6.489. Derivación de la varianza geométrica
Sea q=1−p. La función generadora de probabilidades es:
G(s)=E[sX] = ps/(1−qs).
Derivando y evaluando en s=1:
G′(1)=E[X]=1/p,
G″(1)=E[X(X−1)]=2q/p².
Como:
X²=X(X−1)+X,
E[X²]=2q/p²+1/p.
Finalmente:
Var(X)=E[X²]−E[X]²=(1−p)/p².
6.490. La geométrica no tiene memoria
Haber esperado s ensayos sin éxito no modifica la distribución de la espera adicional.
La ausencia de memoria no es una propiedad de cualquier fenómeno real. Es una consecuencia matemática de los supuestos de p constante e independencia.
6.491. Demostración de la propiedad sin memoria
P(X>k)=(1−p)k.
Entonces:
P(X>s+t | X>s) = P(X>s+t)/P(X>s).
=(1−p)s+t/ (1−p)s
=(1−p)t=P(X>t).
6.492. Riesgo constante: otra forma de entender la ausencia de memoria
Supongamos que hemos llegado al ensayo k sin éxito. La probabilidad de que precisamente el ensayo k sea el primero exitoso es:
A esta probabilidad condicional puede interpretársela como una tasa de riesgo discreta.
En la geométrica es constante:
h(k)=p.
El tiempo transcurrido no aumenta ni disminuye el riesgo del éxito siguiente dentro del modelo.
6.493. Función generadora de probabilidades
Para |(1−p)s|<1:
Esta función codifica todas las probabilidades de la distribución y permite obtener momentos mediante derivadas.
6.494. Binomial y geométrica: mismos ensayos, preguntas distintas
Fijamos primero n ensayos.
X cuenta cuántos éxitos aparecen.
No fijamos cuántos ensayos serán necesarios.
X registra cuándo aparece el primer éxito.
6.495. Del primer éxito al éxito número r
La geométrica espera hasta el primer éxito. Podemos generalizar la pregunta:
Si T es el número del ensayo donde aparece el éxito r:
P(T=k)=C(k−1,r−1)pr(1−p)k−r,
k=r,r+1,…
Esta es una forma de la distribución binomial negativa. La geométrica corresponde al caso r=1.
6.496. El problema que la binomial no resuelve exactamente
Consideremos una población hipotética de 20 piezas:
6 defectuosas y 14 no defectuosas.
Seleccionamos cinco piezas sin reemplazo y definimos:
X = número de piezas defectuosas en la muestra.
Nota. Elaboración propia. Datos hipotéticos.
6.497. Parámetros de la distribución hipergeométrica
tamaño de la población
éxitos existentes en la población
fracasos existentes
tamaño de muestra
éxitos encontrados en la muestra
N=20, K=6, n=5.
6.498. ¿Por qué no es una binomial exacta?
En la primera extracción:
P(defectuosa)=6/20=0,30.
Si la primera fue defectuosa y no la devolvemos:
P(defectuosa en la segunda | primera defectuosa)=5/19≈0,2632.
La extracción modifica la población restante. Por ello cambian las probabilidades y las selecciones son dependientes.
p permanece constante.
Ensayos independientes.
No hay reemplazo.
La composición cambia.
Nota. Elaboración propia.
6.499. Contemos las muestras posibles
El número total de muestras de tamaño n tomadas de N elementos, cuando el orden no importa, es:
C(N,n).
Para obtener exactamente k éxitos necesitamos:
elegir los k éxitos
elegir los n−k fracasos
6.500. Función de masa hipergeométrica
6.501. Derivación combinatoria de la función hipergeométrica
Suponemos que todas las muestras de tamaño n son equiprobables.
total=C(N,n).
Una muestra con exactamente k éxitos puede formarse de:
C(K,k)C(N−K,n−k)
maneras.
P(X=k)= [C(K,k)C(N−K,n−k)]/C(N,n).
6.502. Ejemplo · Exactamente dos defectuosas
N=20, K=6, n=5, k=2.
P(X=2)=[C(6,2)C(14,3)]/C(20,5)
=(15·364)/15.504
≈0,3522≈35,22 %.
elegir 2 entre 6
C(6,2)=15
elegir 3 entre 14
C(14,3)=364
elegir 5 entre 20
C(20,5)=15.504
6.503. El soporte hipergeométrico tiene límites
No cualquier valor de k es posible.
En el ejemplo:
0≤k≤5.
6.504. Media de la distribución hipergeométrica
La proporción de éxitos de la población es K/N.
6.505. E[X]=nK/N mediante variables indicadoras
Sea Iᵢ=1 si la posición i de la muestra contiene un éxito y 0 en caso contrario.
X=I₁+···+Iₙ.
Por simetría:
E[Iᵢ]=K/N.
La linealidad de la esperanza da:
E[X]=nK/N.
No necesitamos independencia para esta suma de esperanzas.
6.506. Varianza y corrección por población finita
Para N>1:
El factor:
(N−n)/(N−1)
se denomina aquí factor de corrección por población finita dentro de la varianza.
6.507. La corrección finita aparece por dependencia negativa
Definimos nuevamente indicadores Iᵢ. Sea:
p=K/N.
Para i≠j:
P(Iᵢ=1,Iⱼ=1) = (K/N)((K−1)/(N−1)).
Entonces:
Cov(Iᵢ,Iⱼ) = −p(1−p)/(N−1).
La covarianza es negativa: observar un éxito reduce ligeramente la probabilidad de otro éxito en la selección siguiente.
Como X=ΣIᵢ:
Var(X) = n p(1−p) + n(n−1)Cov(Iᵢ,Iⱼ).
Var(X)=np(1−p)(N−n)/(N−1).
K/N
proporción de éxitos
↓
no lo devolvemos
(K−1)/(N−1)
la probabilidad cambió
Nota. Elaboración propia.
6.508. Media y dispersión del ejemplo
N=20, K=6, n=5.
5(6/20)
1,5
5(0,30)(0,70)(15/19)
≈0,8289
√0,8289
≈0,9105
6.509. ¿Cuándo puede aproximarse por una binomial?
Cuando N es grande y la fracción de muestreo n/N es pequeña, cada extracción modifica poco la composición de la población.
En esas circunstancias una:
Binomial(n,K/N)
puede aproximar la hipergeométrica. Una regla práctica frecuente es considerar pequeña una fracción de muestreo cercana o inferior al 5 %, pero no es una frontera matemática universal. La precisión requerida debe guiar la decisión.
6.510. Una pregunta diferente: contar eventos
Supongamos que una central telefónica se modela con una media de:
3 llamadas por minuto.
Nos preguntamos:
Aquí X no cuenta éxitos dentro de un número fijo de ensayos. Cuenta eventos dentro de una región.
Nota. Elaboración propia. El intervalo también podría representar longitud, área o volumen.
6.511. El parámetro λ
En:
X ~ Poisson(λ),
λ es el número medio esperado de eventos en la región estudiada.
Si r es la tasa media por unidad y t es la longitud del intervalo:
λ no es una probabilidad. Puede ser mayor que 1. Lo que debe ser no negativo es λ≥0.
t=0,5 min
λ=1,5
t=1 min
λ=3
t=2 min
λ=6
6.512. Del modelo Poisson a un proceso de Poisson
Podemos estudiar no solo un conteo aislado, sino toda una colección:
{N(t): t≥0},
donde N(t) cuenta cuántos eventos han ocurrido desde el instante 0 hasta el instante t.
Un proceso homogéneo de Poisson de tasa r satisface:
Así, la distribución de Poisson describe los conteos del proceso sobre intervalos.
6.513. Condiciones del proceso homogéneo de Poisson
el conteo comienza en cero.
regiones disjuntas producen conteos independientes.
la distribución de un incremento depende de la longitud del intervalo, no de su ubicación.
un solo evento tiene probabilidad aproximadamente proporcional a la longitud del intervalo.
Más formalmente, para h pequeño:
P(N(h)=1)=rh+o(h),
P(N(h)≥2)=o(h).
La notación o(h) representa cantidades que, comparadas con h, se vuelven despreciables cuando h→0.
6.514. Función de masa de Poisson
6.515. Ejemplo · Exactamente dos llamadas
X ~ Poisson(3).
P(X=2)=e−33²/2!
≈0,2240≈22,40 %.
6.516. Forma de una distribución Poisson
Nota. Elaboración propia. Las alturas son proporcionales a las probabilidades teóricas.
6.517. Probabilidades acumuladas y de cola
Para un entero k:
Y:
P(X>k)=1−P(X≤k).
Para valores grandes de k estas sumas suelen evaluarse con software.
6.518. «Al menos un evento» mediante el complemento
Para Poisson(λ):
P(X=0)=e−λ.
Para λ=3:
P(X≥1)≈0,9502=95,02 %.
6.519. Cambiar el intervalo cambia λ
t=0,5 min
λ=1,5
t=1 min
λ=3
t=2 min
λ=6
Nota. Elaboración propia.
6.520. ¿Por qué las probabilidades de Poisson suman 1?
Σ e−λλk/k! = e−λ Σλk/k!.
La serie exponencial cumple:
eλ = Σλk/k!.
e−λ eλ=1.
6.521. Media, varianza y desviación estándar de Poisson
La igualdad media = varianza es una propiedad del modelo Poisson. En datos reales puede utilizarse como una señal diagnóstica, pero no como una prueba definitiva de que los datos sean Poisson.
6.522. Demostración de E[X]=λ y Var(X)=λ
E[X]=Σ k e−λλk/k!.
Para k≥1:
k/k!=1/(k−1)!.
E[X] = λΣe−λ λk−1/(k−1)!.
E[X]=λ.
De forma análoga:
E[X(X−1)]=λ².
E[X²]=λ²+λ.
Var(X)=(λ²+λ)−λ²=λ.
6.523. Una recurrencia muy útil y la moda de Poisson
Dividamos dos probabilidades consecutivas:
Por tanto:
P(X=k+1)=P(X=k)·λ/(k+1).
Las probabilidades aumentan mientras λ/(k+1)>1 y disminuyen después.
Si λ no es entero, la moda es:
⌊λ⌋.
Si λ es un entero positivo m, hay dos modas:
m−1 y m.
6.524. La suma de Poisson independientes sigue siendo Poisson
Sean:
X ~ Poisson(λ₁), Y ~ Poisson(λ₂),
independientes.
Esta propiedad permite combinar fuentes independientes de eventos.
6.525. Demostración de la propiedad de suma
Para Z=X+Y:
P(Z=k) = Σj=0k P(X=j)P(Y=k−j).
Sustituimos las funciones de masa:
= e−(λ₁+λ₂) Σ λ₁j λ₂k−j /[j!(k−j)!].
Utilizando el teorema del binomio:
P(Z=k) = e−(λ₁+λ₂) (λ₁+λ₂)k/k!.
6.526. Adelgazamiento de un proceso de Poisson
Supongamos que los eventos forman un proceso de Poisson con media λ en cierta región.
Clasificamos cada evento de forma independiente como tipo A con probabilidad a.
Entonces el número de eventos A sigue:
Poisson(aλ),
mientras que los demás siguen:
Poisson((1−a)λ).
Además, ambos conteos son independientes.
probabilidad a
Poisson(aλ)
probabilidad 1−a
Poisson((1−a)λ)
Nota. Elaboración propia.
6.527. Poisson no significa simplemente «evento raro»
Fallas, defectos, llamadas y accidentes aparecen frecuentemente en ejemplos de Poisson, pero la rareza no define el modelo.
Un fenómeno frecuente puede ser compatible con Poisson, y un fenómeno muy raro puede no serlo. Lo importante es la estructura probabilística del mecanismo.
6.528. Poisson como aproximación de una binomial
Considere:
X ~ Binomial(n,p),
con n grande y p pequeña, mientras:
np≈λ.
Bajo este régimen:
«n grande» y «p pequeña» no poseen un único punto de corte universal. La calidad de la aproximación depende de la precisión requerida.
6.529. Límite binomial → Poisson
Mantengamos:
np=λ, p=λ/n.
La función binomial es:
C(n,k)(λ/n)k (1−λ/n)n−k.
Para k fijo y n→∞:
n(n−1)···(n−k+1)/nk→1,
(1−λ/n)n→e−λ.
P(X=k)→e−λλk/k!.
6.530. Del conteo Poisson al tiempo de espera
Sea T el tiempo hasta el primer evento en un proceso de Poisson de tasa r.
El evento:
T>t
significa que en el intervalo [0,t] no ocurrió ningún evento.
P(T>t)=P(N(t)=0).
Como N(t)~Poisson(rt):
P(T>t)=e−rt
P(T≤t)=1−e−rt.
Esta es la función acumulada de una distribución exponencial. Así aparece una conexión profunda:
Poisson cuenta eventos;
exponencial mide el tiempo entre eventos.
fijamos un intervalo
contamos eventos
fijamos un evento
medimos cuánto esperamos
Nota. Elaboración propia.
6.531. Cinco modelos discretos: elige por mecanismo
un ensayo
¿ocurrió el éxito?
n ensayos fijos
¿cuántos éxitos?
ensayos hasta éxito
¿cuándo ocurre el primero?
población finita
¿cuántos éxitos sin reemplazo?
eventos en una región
¿cuántos ocurren?
6.532. Errores frecuentes
Usar geométrica aunque p cambie entre intentos.
Olvidar qué convención se usa para la geométrica.
Interpretar la ausencia de memoria como una ley de la realidad.
Usar binomial exacta en muestreo sin reemplazo de una población pequeña.
Ignorar los límites posibles de k en una hipergeométrica.
Confundir λ con una probabilidad.
Aplicar Poisson a cualquier variable de conteo.
Cambiar el intervalo pero conservar el mismo λ.
Creer que media=varianza demuestra que los datos son Poisson.
Usar una aproximación sin evaluar si su error es aceptable.
6.533. Práctica de dificultad creciente
En ensayos independientes con p=0,20: calcula la probabilidad de que el primer éxito ocurra en el cuarto intento.
Ver solución
P(X=4)=(0,80)³(0,20)=0,1024=10,24 %.
En una población de N=30 elementos, K=8 son éxitos. Se seleccionan n=6 sin reemplazo. Calcula P(X=2).
Ver orientación
P(X=2)=[C(8,2)C(22,4)]/C(30,6).
Una central recibe en promedio 4 llamadas cada 10 minutos.
a) Calcula la probabilidad de cero llamadas en 5 minutos.
b) Calcula la probabilidad de al menos una.
c) Calcula E[X] y Var(X) para 30 minutos.
Sean X ~ Poisson(2) y Y ~ Poisson(5), independientes.
1. Determina la distribución de X+Y.
2. Calcula P(X+Y=4).
3. Si cada evento se clasifica independientemente como tipo A con probabilidad 0,30,
determina la distribución del número de eventos A.
Ver orientación
X+Y ~ Poisson(7).
P(X+Y=4)=e−77⁴/4!.
El conteo tipo A es Poisson(0,30·7)=Poisson(2,1).
6.534. Simulación y hoja de cálculo
Las tres distribuciones pueden simularse, pero el algoritmo debe respetar el mecanismo.
repetir Bernoulli hasta el primer éxito.
seleccionar elementos sin devolverlos a la población.
generar conteos según una Poisson con el λ correspondiente.
Los nombres de funciones estadísticas en Excel pueden cambiar según idioma y versión. La herramienta debe emplearse después de identificar correctamente el modelo.
6.535. Comprueba lo aprendido
1. ¿Qué variable cuenta una distribución geométrica?
2. ¿Cuál es su soporte bajo nuestra convención?
3. Escribe su función de masa.
4. ¿Qué significa P(X>k)?
5. Escribe F(k).
6. ¿Cuál es E[X]?
7. ¿Cuál es Var(X)?
8. ¿Qué significa que una geométrica no tenga memoria?
9. ¿Por qué su tasa de riesgo es constante?
10. ¿Qué relación existe entre geométrica y binomial negativa?
11. ¿Qué mecanismo produce una hipergeométrica?
12. ¿Qué significan N, K y n?
13. Escribe la función de masa hipergeométrica.
14. ¿Cuáles son los límites posibles de k?
15. ¿Cuál es E[X]?
16. ¿Cuál es su varianza?
17. ¿Qué representa la corrección por población finita?
18. ¿Por qué las selecciones sin reemplazo presentan dependencia negativa?
19. ¿Qué representa λ en una distribución Poisson?
20. ¿Por qué λ no es una probabilidad?
21. Escribe la función de masa de Poisson.
22. ¿Cuál es E[X]?
23. ¿Cuál es Var(X)?
24. ¿Qué significa que un proceso tenga incrementos independientes?
25. ¿Qué significa que sea homogéneo?
26. Escribe la recurrencia entre P(X=k+1) y P(X=k).
27. ¿Dónde se encuentra la moda de una Poisson?
28. ¿Qué ocurre al sumar Poisson independientes?
29. ¿Qué es el adelgazamiento de un proceso de Poisson?
30. ¿Por qué «evento raro» no define una Poisson?
31. ¿Cuándo Poisson puede aproximar una binomial?
32. ¿Qué distribución aparece para el tiempo hasta el primer evento de un proceso Poisson?
33. Explica por qué identificar el mecanismo debe preceder al cálculo.
6.536. Síntesis y mapa de modelos discretos
un ensayo
0 o 1
n ensayos
contar éxitos
esperar
primer éxito
sin reemplazo
éxitos en muestra
región fija
contar eventos
Nota. Elaboración propia.
La distribución geométrica modela el número de ensayos necesarios para observar el primer éxito:
P(X=k)=(1−p)k−1p.
E[X]=1/p, Var(X)=(1−p)/p².
Su función de supervivencia es:
P(X>k)=(1−p)k,
y posee la propiedad sin memoria:
P(X>s+t | X>s)=P(X>t).
La distribución hipergeométrica modela el número de éxitos obtenidos al muestrear sin reemplazo:
P(X=k)= [C(K,k)C(N−K,n−k)]/C(N,n).
E[X]=nK/N.
Para N>1:
Var(X)=n(K/N)(1−K/N)(N−n)/(N−1).
El último factor aparece porque las selecciones sin reemplazo presentan dependencia negativa.
La distribución de Poisson modela conteos de eventos dentro de una región:
P(X=k)=e−λλk/k!.
E[X]=Var(X)=λ.
En un proceso homogéneo de tasa r:
N(t)~Poisson(rt).
Los conteos Poisson independientes pueden sumarse, y un proceso puede dividirse mediante adelgazamiento.
Además:
Binomial(n,p) → Poisson(λ) cuando n→∞, p→0 y np→λ.
Y el tiempo T hasta el primer evento de un proceso Poisson satisface:
P(T≤t)=1−e−rt.
La gran idea de esta parte no es memorizar tres fórmulas: es reconocer que esperar, muestrear y contar representan estructuras probabilísticas diferentes.
Una distribución no se elige por la apariencia de su fórmula.
Se elige porque representa razonablemente el mecanismo que genera la variable aleatoria.
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Feller, W. (1968). An introduction to probability theory and its applications (Vol. 1, 3rd ed.). Wiley.
Poisson, S. D. (1837). Recherches sur la probabilité des jugements en matière criminelle et en matière civile. Bachelier.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Variables aleatorias continuas y densidad
De probabilidades concentradas en puntos a probabilidades distribuidas sobre regiones
soporte · densidad f(x) · área · integral · F(x) · cuantiles · esperanza · varianza · transformaciones
En una distribución discreta podemos asignar una cantidad positiva de probabilidad a determinados valores individuales:
P(X=0), P(X=1), P(X=2), …
En una variable aleatoria cuya distribución posee densidad, la representación cambia: la probabilidad se distribuye sobre regiones de la escala y se obtiene mediante áreas.
Por eso una altura f(x) no debe confundirse con P(X=x). La densidad describe concentración local de probabilidad; la probabilidad de un intervalo aparece al integrar esa densidad.
densidad → área → probabilidad
6.537. De valores separados a un continuo de posibilidades
Comparemos dos variables.
X puede tomar valores:
0,1,2,3,…
Es un conteo. No tiene sentido observar 2,47 estudiantes.
Consideremos ahora:
Un modelo continuo podría admitir:
12,4 s · 12,41 s · 12,413 s · 12,4137 s · …
Matemáticamente, entre dos valores distintos existen siempre otros valores.
valores separados
intervalo continuo
Nota. Elaboración propia. Se representan dos estructuras matemáticas diferentes.
6.538. Alcance: distribuciones continuas que poseen densidad
Estudiaremos principalmente variables aleatorias cuya distribución puede describirse mediante una función:
f(x).
En lenguaje más avanzado, estas distribuciones se denominan absolutamente continuas respecto de la longitud.
Precisión importante. No toda distribución que carece de masas puntuales tiene necesariamente una densidad ordinaria. En esta parte estudiaremos la clase, muy amplia e importante, de distribuciones que sí pueden representarse mediante f(x).
6.539. Modelo continuo y medición real no son lo mismo
Supongamos que una balanza muestra:
72,35 kg.
El instrumento posee una resolución finita: no puede mostrar infinitas cifras.
Sin embargo, podemos representar matemáticamente la magnitud física mediante una variable continua.
Modelo ≠ registro. La resolución determina cómo observamos o registramos una magnitud; no determina por sí sola la naturaleza del modelo probabilístico.
6.540. El soporte: dónde puede vivir la variable
El soporte describe la región de valores donde la distribución concentra su probabilidad.
Algunos ejemplos son:
proporciones
tiempos de espera
modelos sin límite teórico
El soporte no tiene que ser necesariamente toda la recta real ni siquiera un único intervalo.
6.541. Función de densidad de probabilidad
Una densidad describe cómo se concentra localmente la probabilidad a lo largo de la escala.
f(x) no es P(X=x).
cada masa puede ser P(X=x)
la probabilidad es un área
Nota. Elaboración propia.
6.542. Las dos condiciones fundamentales de una densidad
f(x)≥0
∫−∞∞f(x)dx=1
6.543. ¿Por qué el área total debe ser 1?
X debe tomar algún valor dentro de su espacio de posibilidades.
P(−∞<X<∞)=1.
En una distribución con densidad, la probabilidad de una región se calcula integrando.
∫−∞∞ f(x)dx=1.
Es el análogo continuo de Σp(x)=1.
6.544. La probabilidad de un intervalo es un área
probabilidad = área bajo f sobre el intervalo
Nota. Elaboración propia.
6.545. ¿Qué significa localmente la altura f(x)?
Aunque f(x) no es una probabilidad, sí informa sobre la concentración local de probabilidad.
Para un intervalo muy pequeño de ancho Δx alrededor de x, si f cambia poco dentro de él:
Por eso una densidad grande significa más probabilidad por unidad de longitud alrededor de esa región.
6.546. La altura de la curva no es una probabilidad
Si:
f(4)=0,3,
no podemos concluir:
0,3 es una densidad, no una probabilidad puntual.
6.547. Una densidad puede ser mayor que 1
Considere una distribución uniforme sobre:
0≤X≤0,5.
Para obtener área total 1:
0,5 × altura=1.
Esto no viola ninguna regla: la restricción 0≤P(A)≤1 se aplica a probabilidades, no a alturas de densidad.
Nota. Elaboración propia.
6.548. ¿Por qué P(X=a)=0?
Un único punto tiene ancho cero.
Como la probabilidad se obtiene mediante área:
Nota. Elaboración propia.
6.549. Demostración mediante integral de que P(X=a)=0
Para una variable con densidad:
P(a≤X≤b)=∫abf(x)dx.
Tomamos b=a:
P(X=a)=∫aaf(x)dx.
Una integral cuyos límites coinciden vale cero.
P(X=a)=0.
6.550. Probabilidad cero no significa imposibilidad lógica
Sea X uniforme entre 0 y 1.
El valor 0,5 pertenece perfectamente al intervalo de valores permitidos.
P(X=0,5)=0.
Una realización del experimento tendrá algún valor concreto, aunque cada valor individual posea probabilidad cero. Probabilidad cero e imposibilidad lógica no son conceptos equivalentes.
6.551. Abrir o cerrar los extremos no cambia la probabilidad
P(a<X<b)
=P(a≤X<b)
=P(a<X≤b)
=P(a≤X≤b).
La razón es que cada extremo individual posee probabilidad cero.
6.552. Función de distribución acumulada
Si X posee densidad:
F(x) representa toda la probabilidad acumulada a la izquierda de x.
6.553. Propiedades generales de una función acumulada
si x₁<x₂, entonces F(x₁)≤F(x₂).
F(x)→0 a la izquierda y F(x)→1 a la derecha.
0≤F(x)≤1.
si la distribución posee densidad, F es continua.
Nota. Elaboración propia. Una acumulada no tiene que tener esta forma particular; la figura ilustra sus propiedades generales.
6.554. Densidad y acumulada contienen la misma información
integrar
F(x)=∫−∞xf(t)dt
derivar
f(x)=F′(x)
Para una distribución absolutamente continua, la igualdad f(x)=F′(x) es válida en los puntos donde la derivada existe; en formulación más avanzada, se cumple casi en todas partes.
6.555. De la acumulada a la densidad
F(x)=∫−∞xf(t)dt.
Bajo las condiciones del Teorema Fundamental del Cálculo, derivamos con respecto a x:
F′(x)=f(x).
Integración y derivación conectan dos representaciones de la misma distribución.
6.556. Calcular probabilidades mediante F
Para una distribución con densidad, podemos utilizar la misma expresión aunque cambiemos los extremos abiertos por cerrados.
Objeto: p(x)=P(X=x)
Total: Σp(x)=1
Punto: puede tener masa positiva
Intervalo: suma de probabilidades
Esperanza: Σx p(x)
Objeto: f(x)
Total: ∫f(x)dx=1
Punto: P(X=x)=0
Intervalo: integral / área
Esperanza: ∫x f(x)dx
6.557. Distribución uniforme continua sobre [a,b]
Una variable uniforme distribuye la densidad de manera constante sobre el intervalo [a,b].
f(x)=1/(b−a)
para a≤x≤b
Fuera de [a,b]:
f(x)=0.
Nota. Elaboración propia.
6.558. Ejemplo · Probabilidad entre 2 y 5
Sea X uniforme sobre [0,10].
f(x)=0,1.
P(2≤X≤5)=∫250,1 dx
=(5−2)(0,1)
=0,30=30 %.
6.559. Función acumulada de una uniforme general
F(x)=0, si x<a
F(x)=(x−a)/(b−a), si a≤x≤b
F(x)=1, si x>b.
6.560. Cuantiles, mediana y percentiles
Un cuantil de orden q es un valor xq que deja aproximadamente una proporción q de probabilidad a su izquierda.
F(xq)=q.
En una uniforme sobre [a,b]:
En particular, la mediana corresponde a q=0,5:
mediana=(a+b)/2.
6.561. Esperanza de una variable continua con densidad
La fórmula se utiliza cuando la esperanza existe.
Para una esperanza finita se exige normalmente: ∫|x|f(x)dx<∞. No todas las distribuciones poseen media finita.
6.562. Esperanza de una función de X
Si Y=g(X):
Esta regla suele llamarse ley del estadístico inconsciente o, en textos en inglés, LOTUS.
Por ejemplo:
E[X²]=∫x²f(x)dx.
6.563. Media de una uniforme
Para X uniforme sobre [a,b]:
Para [0,10]:
E[X]=5.
Nota. Elaboración propia.
6.564. Varianza de una variable continua
Sea μ=E[X].
Cuando el segundo momento es finito:
6.565. Derivación de Var(X)=E[X²]−E[X]²
Var(X)=E[(X−μ)²].
(X−μ)²=X²−2μX+μ².
Var(X)=E[X²]−2μE[X]+μ².
Como E[X]=μ:
Var(X)=E[X²]−E[X]².
6.566. Varianza de una uniforme
Para X uniforme sobre [a,b]:
Por tanto:
σ=(b−a)/√12.
Para [0,10]:
Var(X)=100/12=25/3≈8,3333,
σ≈2,8868.
6.567. La densidad tiene unidades
Una probabilidad es adimensional.
En:
f(x)dx,
las unidades de f(x) deben cancelar las unidades de dx.
X en s
f en s⁻¹
X en m
f en m⁻¹
X en kg
f en kg⁻¹
∫f(x)dx
sin unidad
6.568. Una densidad no tiene que ser constante
Considere:
f(x)=cx, 0≤x≤2,
y f(x)=0 fuera de ese intervalo.
La constante c debe escogerse para que el área total sea 1.
6.569. Normalización de f(x)=cx sobre [0,2]
Exigimos:
∫02cx dx=1.
c[x²/2]02=1.
2c=1.
c=1/2.
Por tanto:
f(x)=x/2, 0≤x≤2.
Nota. Elaboración propia. El área triangular es 1.
6.570. Acumulada y probabilidades de la densidad creciente
Para 0≤x≤2:
F(x)=∫0xt/2 dt=x²/4.
Así:
P(0,5≤X≤1,5)
=F(1,5)−F(0,5)
=0,5625−0,0625=0,50.
6.571. Mediana de una distribución no uniforme
La mediana m satisface:
F(m)=0,5.
Para F(x)=x²/4:
m²/4=0,5.
La mediana no tiene que coincidir con el punto medio geométrico del soporte.
6.572. Función de supervivencia
Muchas aplicaciones preguntan por la probabilidad de superar cierto valor.
En confiabilidad, medicina, ingeniería y análisis de tiempos de espera, esta función es especialmente importante.
6.573. Del conteo Poisson al tiempo de espera continuo
En la parte anterior vimos que, para un proceso de Poisson de tasa r, el número de eventos hasta el instante t cumple:
N(t) ~ Poisson(rt).
Sea ahora T el tiempo hasta el primer evento.
El evento T>t significa que durante [0,t] no ocurrió ningún evento:
P(T>t)=P(N(t)=0)=e−rt.
fijamos un intervalo
¿cuántos eventos?
esperamos al primer evento
¿cuánto tiempo?
Nota. Elaboración propia.
6.574. Distribución exponencial
A partir de:
P(T>t)=e−rt,
obtenemos:
F(t)=1−e−rt, t≥0,
f(t)=re−rt.
Este es un segundo ejemplo de densidad continua, ahora no constante.
6.575. Tiempo medio de espera exponencial
Para T con densidad:
f(t)=re−rt, t≥0,
se obtiene:
E[T]=∫0∞ t r e−rtdt.
Mediante integración por partes:
E[T]=1/r.
Una tasa mayor implica, en promedio, tiempos de espera menores.
6.576. Cambiar de escala modifica la densidad
Sea:
Y=a+bX, b≠0.
La transformación desplaza y escala los valores. Como las probabilidades deben conservarse, la altura de la densidad también debe ajustarse.
6.577. Densidad bajo una transformación lineal
Para Y=a+bX:
x=(y−a)/b.
La conservación de probabilidad conduce a:
fY(y) = [1/|b|] fX((y−a)/b).
El factor 1/|b| compensa el cambio de escala horizontal para que el área total continúe siendo 1.
6.578. Simulación mediante transformación inversa
La acumulada también permite generar variables aleatorias.
Si:
U ~ Uniforme(0,1)
y F es continua y estrictamente creciente, entonces:
posee la distribución determinada por F.
En formulaciones más generales se utiliza la inversa generalizada o función cuantil.
Nota. Elaboración propia.
6.579. Histograma y densidad teórica no son lo mismo
Se construye con datos.
Agrupa observaciones en intervalos.
Cambia de una muestra a otra.
Pertenece al modelo.
Describe probabilidades mediante áreas.
No es producida automáticamente por un histograma.
Nota. Elaboración propia. Datos simulados con fines didácticos.
6.580. En un histograma de densidad, la altura depende del ancho
Si una clase contiene una proporción r de observaciones y tiene ancho w:
Entonces:
área=w(r/w)=r.
Con anchos de clase diferentes, las alturas por sí solas no representan correctamente las proporciones. Debemos comparar áreas.
altura relacionada con conteos.
Útil especialmente con clases de igual ancho.
altura=proporción/ancho.
El área representa la proporción.
6.581. Realidad, instrumento, datos y modelo
fenómeno físico
resolución y procedimiento
valores observados
representación probabilística
realidad → medición → datos → modelación
6.582. Continua no significa normal
Una variable continua puede seguir una distribución uniforme, exponencial, triangular, gamma, beta, normal u otros muchos modelos.
Continuidad describe el tipo de valores; normalidad describe una forma probabilística particular. No son conceptos equivalentes.
6.583. Más observaciones no cambian automáticamente la distribución original
Si X tiene cierta distribución, recoger más observaciones de X no transforma por sí solo esa distribución en otra.
Lo que aumenta es nuestra información acerca de ella.
Esta idea debe distinguirse del Teorema Central del Límite, que estudia la distribución de determinadas estadísticas, como promedios o sumas, y no afirma que los datos originales se vuelvan normales.
6.584. Simular una distribución uniforme
En una hoja de cálculo, una función que produzca U uniforme entre 0 y 1 puede transformarse mediante:
Por ejemplo, si la versión en español de Excel utiliza ALEATORIO():
genera valores pseudoaleatorios entre 2 y 7.
6.585. Actividad guiada · Uniforme entre 0 y 20
Sea X uniforme sobre [0,20].
1. Determina f(x).
2. Comprueba que el área total es 1.
3. Calcula P(0≤X≤5).
4. Calcula P(5≤X≤15).
5. Calcula P(X>18).
6. Calcula P(X=10).
7. Construye F(x).
8. Calcula F(7).
9. Determina la mediana.
10. Determina el percentil 75.
11. Calcula E[X].
12. Calcula Var(X).
13. Calcula σ.
Ver solución
1. f(x)=1/20=0,05.
2. 20(0,05)=1.
3. 0,25=25 %.
4. 0,50=50 %.
5. 0,10=10 %.
6. 0.
7. F(x)=0 si x<0; x/20 si 0≤x≤20; 1 si x>20.
8. F(7)=0,35.
9. 10.
10. 15.
11. 10.
12. 100/3≈33,3333.
13. ≈5,7735.
6.586. Reto · ¿Puede ser una densidad?
Decide si cada propuesta puede ser una densidad.
A. f(x)=0,5 para 0≤x≤2.
B. f(x)=−0,2 para 0≤x≤5.
C. f(x)=2 para 0≤x≤0,5.
D. f(x)=0,2 para 0≤x≤4.
E. f(x)=cx para 0≤x≤3. Determina c.
Ver solución
A. Sí: 2(0,5)=1.
B. No: toma valores negativos.
C. Sí: 0,5(2)=1.
D. No: 4(0,2)=0,8.
E. ∫₀³cx dx=9c/2=1, por lo que c=2/9.
6.587. Reto universitario · Exponencial y transformación
Sea T exponencial con tasa r=0,5 por minuto.
1. Escribe f(t) y F(t).
2. Calcula P(T>3).
3. Calcula P(2<T≤5).
4. Determina E[T].
5. Determina la mediana.
6. Si Y=60T convierte minutos en segundos,
indica cómo cambia la densidad.
Ver orientación
f(t)=0,5e−0,5t, F(t)=1−e−0,5t.
P(T>3)=e−1,5.
P(2<T≤5)=F(5)−F(2).
E[T]=2 minutos.
La mediana resuelve 1−e−0,5m=0,5.
Para Y=60T: fY(y) =(1/60)fT(y/60).
6.588. Errores frecuentes
Confundir f(x) con P(X=x).
Creer que f(x) debe ser ≤1.
Interpretar P(X=a)=0 como imposibilidad.
Confundir densidad teórica con histograma.
Creer que continua significa normal.
Creer que muchos datos vuelven normal la variable original.
Ignorar las unidades de f(x).
Creer que abrir o cerrar extremos cambia la probabilidad.
Olvidar verificar que una densidad integre 1.
Confundir altura de histograma con proporción cuando las clases tienen anchos distintos.
∫f(x)dx=1
P(a≤X≤b)=∫ₐᵇf(x)dx
F(x)=∫₋∞ˣf(t)dt
f(x)=F′(x), donde corresponda
E[X]=∫x f(x)dx
Var(X)=E[X²]−E[X]²
S(x)=1−F(x)
F(xq)=q
6.589. Comprueba lo aprendido
1. ¿Qué diferencia existe entre una variable discreta y una continua?
2. ¿Qué significa que una distribución posea densidad?
3. ¿Qué es el soporte?
4. ¿Por qué la resolución del instrumento no determina por sí sola el modelo?
5. ¿Cuáles son las dos condiciones fundamentales de una densidad?
6. ¿Por qué f(x) no es P(X=x)?
7. ¿Qué interpretación local puede darse a f(x)Δx?
8. ¿Puede f(x)>1?
9. ¿Por qué P(X=a)=0?
10. ¿Por qué probabilidad cero no implica imposibilidad lógica?
11. ¿Por qué los extremos abiertos y cerrados dan la misma probabilidad?
12. ¿Qué representa F(x)?
13. Menciona tres propiedades generales de F.
14. ¿Cómo se obtiene F desde f?
15. ¿Cómo se recupera f desde F cuando es posible?
16. ¿Qué es un cuantil?
17. ¿Cómo se obtiene la mediana desde F?
18. ¿Cómo se calcula E[X]?
19. ¿Qué condición garantiza una esperanza finita?
20. ¿Qué es E[g(X)]?
21. ¿Cómo se calcula Var(X)?
22. ¿Cuáles son E[X] y Var(X) para una uniforme [a,b]?
23. Si X se mide en segundos, ¿qué unidades posee f(x)?
24. ¿Qué es la función de supervivencia?
25. ¿Qué relación existe entre Poisson y exponencial?
26. ¿Qué ocurre con una densidad bajo Y=a+bX?
27. ¿Qué es el método de transformación inversa?
28. ¿Qué diferencia existe entre histograma y densidad teórica?
29. ¿Por qué el área es esencial en un histograma de densidad?
30. ¿Por qué continua no significa normal?
31. ¿Por qué aumentar n no cambia automáticamente la distribución de X?
6.590. Mapa conceptual
f(x)≥0 · área total=1
probabilidad = área
P(X=a)=0
F(x)
F(xq)=q
centro probabilístico
dispersión
supervivencia
Nota. Elaboración propia.
6.591. Síntesis
Una distribución absolutamente continua puede describirse mediante una densidad f(x) no negativa cuya integral total vale 1.
∫−∞∞f(x)dx=1.
Las probabilidades de intervalos son áreas:
P(a≤X≤b)=∫abf(x)dx.
La densidad no es una probabilidad puntual:
f(a)≠P(X=a), P(X=a)=0.
La acumulada es:
F(x)=P(X≤x)=∫−∞xf(t)dt.
Cuando corresponde:
f(x)=F′(x).
Los cuantiles satisfacen:
F(xq)=q.
La esperanza y la varianza se calculan mediante:
E[X]=∫x f(x)dx
Var(X)=E[X²]−E[X]².
Para una uniforme [a,b]:
E[X]=(a+b)/2, Var(X)=(b−a)²/12.
También introdujimos:
S(x)=1−F(x),
transformaciones de variables, simulación mediante F⁻¹ y la conexión:
proceso de Poisson ↔ tiempo exponencial.
Finalmente, distinguimos de manera explícita: fenómeno, instrumento, datos, histograma y modelo probabilístico.
6.592. Puente hacia la distribución normal
Todo lo desarrollado en esta parte será necesario para estudiar la distribución normal.
Cuando encontremos una curva con forma de campana, no interpretaremos su altura como probabilidad.
Seguiremos utilizando exactamente la misma idea:
Nota. Elaboración propia.
altura ≠ probabilidad
representa probabilidad
acumula probabilidad
posición y dispersión
En una distribución con densidad, la probabilidad no reside en la altura de un punto.
Surge del área acumulada sobre una región de valores posibles.
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Feller, W. (1971). An introduction to probability theory and its applications (Vol. 2, 2nd ed.). Wiley.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Distribución normal y puntuación z
De la campana de Gauss a una escala común de posición y probabilidad
μ · σ · densidad · áreas · integral gaussiana · estandarización · Φ · cuantiles · transformaciones · aproximaciones
La distribución normal es una familia de modelos continuos, simétricos y unimodales. Su posición está determinada por la media μ y su dispersión por la desviación estándar σ.
Como toda distribución con densidad, sus probabilidades se representan mediante áreas, no mediante la altura de puntos individuales.
La transformación:
z=(x−μ)/σ
convierte una distancia expresada en las unidades originales en una distancia medida en desviaciones estándar.
Cuando el modelo es normal, esta estandarización permite convertir cualquier N(μ,σ²) en una única distribución:
Z ~ N(0,1).
posición → estandarización → área → probabilidad → interpretación
6.593. ¿Por qué estudiar la distribución normal?
La distribución normal ocupa una posición central en probabilidad y estadística, pero no porque todo fenómeno real tenga forma de campana.
Su importancia procede de varias razones diferentes.
algunos fenómenos presentan variación aproximadamente simétrica alrededor de un centro.
muchos efectos pequeños pueden producir comportamientos aproximadamente normales.
sumas y medias aparecen estrechamente relacionadas con la normal mediante resultados límite.
Nota. Elaboración propia.
6.594. La campana es un modelo, no una obligación de los datos
Que una variable sea continua no demuestra que sea normal.
Tampoco lo demuestra:
La normalidad es una hipótesis de modelación. Su pertinencia debe justificarse por el mecanismo, el contexto y, cuando corresponda, por el comportamiento de los datos.
6.595. Función de densidad normal
Una variable X sigue una distribución normal con media μ y varianza σ² si su densidad es:
−∞<x<∞
σ>0.
Escribiremos:
6.596. Los parámetros μ y σ
Nombre: media.
Efecto: posición horizontal.
Centro de simetría: μ.
Unidades: las mismas de X.
Nombre: desviación estándar.
Efecto: dispersión y anchura.
Varianza: σ².
Condición: σ>0.
6.597. La altura máxima de la densidad
La densidad alcanza su máximo en:
x=μ.
Sustituyendo x=μ:
Esto permite ver directamente que, cuando σ aumenta, la altura máxima disminuye.
Una campana más alta no tiene «más probabilidad». Todas las normales tienen área total 1. Cambiar σ redistribuye esa misma área.
6.598. μ desplaza la distribución
Si σ permanece fija y μ cambia, la curva se desplaza horizontalmente sin cambiar de forma.
Nota. Elaboración propia.
6.599. σ abre o cierra la campana
Mantengamos μ fija.
Una σ pequeña concentra la densidad cerca de μ. Una σ grande distribuye la misma área sobre una región más amplia.
Nota. Elaboración propia.
6.600. Simetría alrededor de μ
Dos puntos situados a la misma distancia d de μ poseen la misma densidad:
6.601. ¿Por qué la densidad normal es simétrica?
Consideremos:
x₁=μ−d y x₂=μ+d.
El exponente depende de:
[(x−μ)/σ]².
[(μ−d−μ)/σ]²=(−d/σ)²=d²/σ²
[(μ+d−μ)/σ]²=(d/σ)²=d²/σ².
Los exponentes son iguales.
f(μ−d)=f(μ+d).
6.602. La probabilidad sigue siendo un área
Además:
P(X=a)=0.
Por eso:
P(a<X<b)=P(a≤X≤b).
Nota. Elaboración propia.
6.603. La densidad en un punto no es la probabilidad del punto
En la normal estándar:
φ(0)=1/√(2π)≈0,3989.
Esto no significa:
Como Z es continua:
P(Z=0)=0.
6.604. ¿Por qué aparece √(2π)?
Para que la densidad normal sea válida, su área total debe ser 1.
El problema matemático central es evaluar:
Esta integral no se resuelve mediante una antiderivada elemental ordinaria.
integral I
I²
integral doble
coordenadas polares
jacobiano r
I=√(2π)
Nota. Elaboración propia.
6.605. La integral gaussiana mediante coordenadas polares
Definimos:
I=∫−∞∞ e−x²/2dx.
Como el integrando es positivo, I>0.
I²= ∬ e−(x²+y²)/2 dxdy.
En un tratamiento universitario, el paso al producto como integral doble queda justificado por la no negatividad del integrando; formalmente puede apoyarse en el teorema de Tonelli.
x=r cosθ, y=r senθ.
x²+y²=r².
dxdy=r dr dθ.
I²= ∫02π ∫0∞ e−r²/2r dr dθ.
Con:
u=r²/2, du=rdr,
∫0∞ e−r²/2rdr=1.
∫02πdθ=2π.
I²=2π.
Como I>0:
I=√(2π).
6.606. De la normal estándar a toda la familia normal
Introducimos:
z=(x−μ)/σ.
Entonces:
x=μ+σz
dx=σdz.
6.607. Normalización de N(μ,σ²)
Partimos de:
∫ [1/(σ√(2π))] exp{−½[(x−μ)/σ]²} dx.
Sustituimos z=(x−μ)/σ y dx=σdz.
∫ [1/√(2π)] e−z²/2dz.
La integral sobre toda la recta vale 1.
∫−∞∞ f(x)dx=1.
6.608. ¿Por qué μ es realmente la esperanza?
La notación N(μ,σ²) no es simplemente un convenio gráfico.
Podemos demostrar que:
6.609. Demostración de E[X]=μ
Escribimos:
X=μ+σZ,
donde Z posee la densidad normal estándar, simétrica alrededor de 0.
Por simetría:
E[Z]=0.
Entonces:
E[X]=E[μ+σZ] =μ+σE[Z].
E[X]=μ.
6.610. ¿Por qué σ² es realmente la varianza?
6.611. Demostración de Var(X)=σ²
Como:
X=μ+σZ,
tenemos:
Var(X)=Var(μ+σZ).
=σ²Var(Z).
Para la normal estándar:
Var(Z)=1.
Var(X)=σ².
6.612. La regla 68–95–99,7
≈68,27 %
≈95,45 %
≈99,73 %
Nota. Elaboración propia.
6.613. La regla 68–95–99,7 no debe memorizarse aislada
Para cualquier k>0:
Utilizando simetría:
Por ejemplo:
2Φ(1)−1≈0,6827.
2Φ(2)−1≈0,9545.
2Φ(3)−1≈0,9973.
6.614. ¿Cómo se distribuye el área entre las desviaciones estándar?
34,13 %
13,59 %
≈2,14 %
≈0,135 %
Cada intervalo μ+kσ a μ+(k+1)σ posee el mismo ancho horizontal σ. Lo que cambia es el área bajo la curva, no el ancho del intervalo.
6.615. La puntuación z
z es una posición estandarizada.
No es una probabilidad.
Nota. Elaboración propia.
6.616. Signo, magnitud y unidades de z
x=μ.
x está por encima de μ.
x está por debajo de μ.
distancia estandarizada al centro.
Como x−μ y σ poseen las mismas unidades, estas se cancelan.
z es adimensional.
6.617. Ejemplo · Interpretar una puntuación z
Supongamos:
μ=100, σ=15, x=130.
z=(130−100)/15
z=2.
El valor 130 está dos desviaciones estándar por encima de la media.
6.618. Comparar escalas diferentes
Consideremos dos pruebas hipotéticas.
μ=75
σ=5
x=85
z=2
μ=80
σ=10
x=90
z=1
Aunque 90>85, el valor de la Prueba A se encuentra más lejos por encima de la media de su propia escala.
Prueba A
z=2
Prueba B
z=1
Nota. Elaboración propia con valores hipotéticos.
6.619. Mismo z no significa siempre la misma rareza
Esta es una distinción fundamental.
Supongamos que dos variables poseen:
z=2.
En ambas podemos afirmar:
«el valor se encuentra dos desviaciones estándar por encima de su media».
Pero si las dos distribuciones tienen formas diferentes, eso no implica necesariamente el mismo percentil ni la misma probabilidad de cola.
z es una medida universal de distancia estandarizada, no una medida universal de rareza. En la familia normal, la forma común de todas las distribuciones sí permite convertir z en una probabilidad común mediante Φ.
6.620. Dos fórmulas parecidas que no deben confundirse
Z=(X−μ)/σ
μ y σ son parámetros del modelo.
zᵢ=(xᵢ−x̄)/s
x̄ y s se calculan a partir de una muestra.
Ambas expresiones estandarizan, pero conceptualmente utilizan cantidades distintas.
6.621. La distribución normal estándar
Su densidad es:
φ(z)=[1/√(2π)]e−z²/2.
6.622. Estandarizar cambia la escala, no la posición probabilística
Si:
X ~ N(μ,σ²),
definimos:
Z=(X−μ)/σ.
Nota. Elaboración propia.
6.623. Demostración completa de que Z~N(0,1)
Sea:
Z=(X−μ)/σ.
La transformación inversa es:
x=μ+σz,
dx/dz=σ.
La regla de transformación de densidades da:
fZ(z) = fX(μ+σz)·σ.
Sustituyendo la densidad normal:
fZ(z) = [1/√(2π)]e−z²/2.
Esta es exactamente la densidad normal estándar.
Z ~ N(0,1).
Calcular solamente E[Z]=0 y Var(Z)=1 no habría sido suficiente: muchas distribuciones no normales poseen media 0 y varianza 1.
6.624. La función Φ
Φ(z) = área acumulada a la izquierda de z.
Nota. Elaboración propia. Φ siempre acumula hacia la izquierda.
6.625. Izquierda, derecha y entre dos valores
P(Z≤z)=Φ(z)
P(Z>z)=1−Φ(z)
P(z₁≤Z≤z₂)=Φ(z₂)−Φ(z₁)
Φ(z)
1−Φ(z)
Φ(z₂)−Φ(z₁)
Nota. Elaboración propia.
6.626. Simetría de la normal estándar
Φ(−z)=1−Φ(z)
P(Z>z)=P(Z<−z).
6.627. Demostración de Φ(−z)=1−Φ(z)
La densidad estándar satisface:
φ(−t)=φ(t).
El área a la izquierda de −z coincide con el área a la derecha de z.
P(Z≤−z)=P(Z≥z).
P(Z≥z)=1−P(Z≤z).
Φ(−z)=1−Φ(z).
6.628. El problema inverso: Φ⁻¹
Hasta ahora conocemos z y buscamos un área.
También podemos conocer el área p y preguntar:
Definimos el cuantil normal:
6.629. Algunos cuantiles importantes
z≈1,2816
z≈1,6449
z≈1,9600
z≈2,5758
Estos números no son fronteras mágicas. Cada uno corresponde a un área acumulada específica.
6.630. Ejemplo · Percentil 90
Queremos encontrar el valor que deja 90 % de la distribución a su izquierda.
Φ(z)=0,90.
z≈1,2816.
Para una normal N(μ,σ²):
Nota. Elaboración propia.
6.631. ¿|z|>1,96 significa automáticamente «dato atípico»?
No.
En una normal:
P(−1,96≤Z≤1,96)≈0,95.
Eso explica de dónde surge 1,96: aproximadamente el 95 % central del modelo normal queda entre −1,96 y 1,96.
No existe una regla universal que indique «si |z|>1,96, eliminar el dato». La evaluación de una observación depende del contexto, del mecanismo de medición, del modelo y del objetivo del análisis.
6.632. Muy improbable no significa imposible
Considere:
z=6,67.
Bajo el modelo normal estándar, la cola derecha es del orden de:
10−11.
Es extraordinariamente pequeña, pero no exactamente cero.
Nota. Elaboración propia. La escala está expresada en desviaciones estándar.
6.633. Media, mediana y moda coinciden
Esto ocurre porque la distribución es simétrica, μ divide el área total en dos mitades y la densidad alcanza allí su máximo.
6.634. Los puntos de inflexión
La curva cambia de curvatura en:
μ−σ y μ+σ.
La distancia entre esos dos puntos es:
Así, σ también tiene una interpretación geométrica visible en la campana.
Nota. Elaboración propia.
6.635. Localización matemática de los puntos de inflexión
Definimos:
u=(x−μ)/σ.
Al derivar dos veces:
f″(x) ∝ (u²−1)e−u²/2.
El factor exponencial nunca es cero. Por tanto:
u²−1=0
u=±1.
x=μ−σ y x=μ+σ.
6.636. Transformaciones lineales de una normal
Sea:
X ~ N(μ,σ²)
y:
Y=a+bX.
Entonces Y también es normal:
N(μ,σ²)
Y=a+bX
N(a+bμ,b²σ²)
Nota. Elaboración propia.
6.637. Media y varianza después de una transformación lineal
Y=a+bX.
Para la esperanza:
E[Y]=a+bE[X]=a+bμ.
Para la varianza:
Var(Y)=b²Var(X)=b²σ².
Como una transformación lineal de una normal sigue siendo normal:
Y~N(a+bμ,b²σ²).
6.638. La suma de normales independientes también es normal
Sean:
X ~ N(μ₁,σ₁²)
Y ~ N(μ₂,σ₂²),
independientes.
Esta estabilidad bajo sumas es una de las razones de la enorme importancia matemática de la familia normal.
normal
normal
normal
Nota. Elaboración propia. Se supone independencia.
6.639. Función generadora de momentos de una normal
Para X~N(μ,σ²):
Esta función resume todos los momentos cuando existe en un entorno de 0.
En particular:
M′(0)=E[X]=μ.
Var(X)=σ².
6.640. La función generadora explica la suma de normales
Si X e Y son independientes:
MX+Y(t) = MX(t) MY(t).
= exp(μ₁t+σ₁²t²/2) exp(μ₂t+σ₂²t²/2).
= exp[(μ₁+μ₂)t+(σ₁²+σ₂²)t²/2].
Esta es la función generadora de una normal con:
media μ₁+μ₂
varianza σ₁²+σ₂².
6.641. La normal como aproximación de una binomial
Considere:
X ~ Binomial(n,p).
Su media y varianza son:
μ=np
σ²=np(1−p).
Cuando la distribución binomial no está demasiado concentrada cerca de 0 o n y n es suficientemente grande, una normal puede proporcionar una buena aproximación.
No existe un único corte universal que determine cuándo la aproximación es «suficientemente buena». Depende de n, p y de la precisión requerida.
6.642. Corrección por continuidad
Una binomial es discreta:
0,1,2,3,…
La normal es continua.
Para aproximar mejor una probabilidad discreta, desplazamos la frontera medio punto.
Por ejemplo:
P(X≤20)
se aproxima mediante
P(Y≤20,5).
X≤20
último valor incluido: 20
Y≤20,5
frontera continua
Nota. Elaboración propia.
6.643. ¿Por qué aparece tantas veces la distribución normal?
No existe una única explicación.
algunos procesos generan variación aproximadamente simétrica.
la suma de variables normales independientes sigue siendo normal.
muchas sumas y medias se aproximan a una normal bajo condiciones apropiadas.
frecuente ≠ universal
6.644. Datos observados y modelo normal no son lo mismo
Se construye con observaciones.
Depende de la muestra.
Depende de los intervalos.
Es empírico.
Es una función matemática.
Está determinada por μ y σ.
Describe probabilidades del modelo.
No es un histograma suavizado por definición.
Nota. Elaboración propia. Datos simulados.
6.645. Muchos datos no vuelven normal a la variable original
Supongamos que X sigue una distribución uniforme.
Podemos observar:
100 datos, 10.000 datos o 1.000.000 de datos.
La distribución generadora sigue siendo uniforme.
Una muestra mayor puede permitirnos observar mejor la distribución de origen; no obliga a esa distribución a convertirse en normal.
6.646. Una aclaración necesaria sobre el Teorema Central del Límite
El Teorema Central del Límite estudia, bajo determinadas condiciones, la distribución de ciertos estadísticos construidos con muchas observaciones, especialmente sumas y medias.
No afirma que la variable original cambie de distribución.
Esta distinción será central en la siguiente parte del capítulo.
6.647. La normal como modelo de fluctuaciones de medición
En algunos experimentos, un modelo normal puede resultar razonable cuando las fluctuaciones aleatorias alrededor de un centro son aproximadamente:
Esto no significa que «todo error de medición sea normal». El modelo depende de las fuentes físicas de variabilidad, del instrumento y del procedimiento experimental.
6.648. Tecnología: primero comprende la región
Tablas, calculadoras y software pueden obtener Φ(z) y Φ⁻¹(p) con gran precisión.
Pero la tecnología no decide cuál es la pregunta probabilística.
z=(x−μ)/σ
Nota. Elaboración propia.
6.649. Actividad guiada · X ~ N(50,4²)
1. Identifica μ.
2. Identifica σ.
3. Identifica la varianza.
4. ¿Dónde está la máxima densidad?
5. Calcula f(50).
6. Aproxima P(46≤X≤54).
7. Aproxima P(42≤X≤58).
8. Calcula z para x=58.
9. Interpreta ese z.
10. Calcula z para x=44.
11. Si z=1,5, encuentra x.
12. Explica por qué P(X=50)=0.
13. ¿Dónde están los puntos de inflexión?
14. Encuentra el percentil 90.
Ver solución
1. μ=50.
2. σ=4.
3. σ²=16.
4. En x=50.
5. f(50)=1/[4√(2π)]≈0,0997.
6. ≈68,27 %.
7. ≈95,45 %.
8. z=2.
9. Dos desviaciones estándar por encima de μ.
10. z=−1,5.
11. x=50+1,5(4)=56.
12. Porque la probabilidad de un punto individual es cero.
13. 46 y 54.
14. x=50+1,2816(4)≈55,1264.
6.650. Reto universitario · Suma y transformación
Sean X~N(10,4) y Y~N(20,9), independientes.
1. Determina la distribución de X+Y.
2. Determina la distribución de 2X−3.
3. Calcula la media y la varianza de X−Y.
4. Estandariza X+Y.
Ver solución
X+Y~N(30,13).
2X−3~N(17,16).
X−Y~N(−10,13).
Z=[(X+Y)−30]/√13 ~ N(0,1).
6.651. Errores frecuentes
Creer que toda variable continua es normal.
Creer que muchos datos producen normalidad automática.
Confundir f(x) con P(X=x).
Interpretar z como probabilidad.
Creer que mismo z siempre implica igual rareza.
Confundir σ con σ².
Usar Φ(z) directamente para una cola derecha.
Eliminar automáticamente todo |z|>1,96.
Creer que las colas terminan en ±3σ.
Olvidar la corrección por continuidad al aproximar una variable discreta.
Creer que media 0 y varianza 1 implican necesariamente normalidad.
Confundir z poblacional con estandarización basada en x̄ y s.
6.652. Comprueba lo aprendido
1. ¿Qué representa μ?
2. ¿Qué representa σ?
3. Escribe la densidad normal.
4. ¿Dónde alcanza su máximo?
5. ¿Cuál es el valor de f(μ)?
6. ¿Qué ocurre al modificar μ?
7. ¿Qué ocurre al aumentar σ?
8. ¿Por qué la normal es simétrica?
9. ¿Por qué P(X=x)=0?
10. ¿Qué función cumple √(2π)?
11. ¿Por qué se eleva la integral gaussiana al cuadrado?
12. ¿Por qué aparece el jacobiano r?
13. ¿Por qué E[X]=μ?
14. ¿Por qué Var(X)=σ²?
15. ¿Qué expresa la regla 68–95–99,7?
16. ¿Cómo se obtiene esa regla mediante Φ?
17. ¿Qué significa z=−2?
18. ¿Por qué z es adimensional?
19. ¿Puede calcularse z para una variable no normal?
20. ¿Por qué mismo z no siempre implica la misma rareza?
21. ¿Qué diferencia hay entre (x−μ)/σ y (x−x̄)/s?
22. ¿Qué es N(0,1)?
23. ¿Qué representa Φ(z)?
24. ¿Cómo calculamos una cola derecha?
25. ¿Cómo calculamos un intervalo?
26. ¿Qué relación existe entre Φ(−z) y Φ(z)?
27. ¿Qué representa Φ⁻¹(p)?
28. ¿Por qué aparece 1,96?
29. ¿Por qué |z|>1,96 no obliga a eliminar un dato?
30. ¿Dónde están los puntos de inflexión?
31. ¿Qué ocurre con Y=a+bX si X es normal?
32. ¿Qué ocurre al sumar normales independientes?
33. Escribe la función generadora de una normal.
34. ¿Cuándo puede una normal aproximar una binomial?
35. ¿Qué es la corrección por continuidad?
36. ¿Por qué una muestra grande no vuelve normal a X?
37. ¿Qué estudia realmente el Teorema Central del Límite?
6.653. Mapa conceptual
centro · posición
dispersión · escala
posición en desviaciones estándar
z → probabilidad
probabilidad → z
Nota. Elaboración propia.
6.654. Síntesis y puente hacia las leyes límite
La distribución normal es una familia continua:
X~N(μ,σ²).
Su densidad es:
f(x)=1/[σ√(2π)]·exp{−½[(x−μ)/σ]²}.
μ determina el centro y:
E[X]=μ.
σ determina la escala de dispersión y:
Var(X)=σ².
La curva es simétrica:
f(μ−d)=f(μ+d).
Las probabilidades son áreas, mientras que un punto individual posee probabilidad cero.
La constante √(2π) surge de la integral gaussiana y permite normalizar la densidad.
La estandarización:
Z=(X−μ)/σ
transforma una normal general en:
Z~N(0,1).
La función:
Φ(z)=P(Z≤z)
transforma una posición z en un área acumulada, mientras:
zp=Φ⁻¹(p)
resuelve el problema inverso.
La regla:
68,27 % · 95,45 % · 99,73 %
no es una regla universal de los datos; es una propiedad de la distribución normal.
Además:
Y=a+bX → normal,
X+Y → normal si X e Y son normales independientes.
Estas propiedades ayudan a explicar por qué la normal aparece repetidamente en probabilidad y estadística.
Pero queda una pregunta aún más profunda:
Esa pregunta nos llevará a la Ley de los Grandes Números, la simulación Monte Carlo y posteriormente a comprender con mayor profundidad el papel del Teorema Central del Límite.
La puntuación z no convierte cualquier distribución en normal.
Expresa posiciones relativas en una escala común de desviaciones estándar. Cuando el modelo es normal, Φ convierte además esa posición en una escala probabilística común.
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Casella, G., & Berger, R. L. (2002). Statistical inference (2nd ed.). Duxbury.
Feller, W. (1971). An introduction to probability theory and its applications (Vol. 2, 2nd ed.). Wiley.
Gauss, C. F. (1809). Theoria motus corporum coelestium in sectionibus conicis solem ambientium. Friedrich Perthes & I. H. Besser.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Ley de los Grandes Números y simulación Monte Carlo
¿Cómo emerge regularidad a partir de muchos resultados aleatorios?
frecuencia relativa · promedios · convergencia · error estándar · simulación · pseudoaleatoriedad · Monte Carlo
Un resultado individual puede ser impredecible. Sin embargo, cuando repetimos muchas veces un experimento bajo condiciones apropiadas, determinados promedios y frecuencias relativas presentan una regularidad cada vez más visible.
La Ley de los Grandes Números explica hacia qué cantidad tienden esos promedios. La simulación Monte Carlo utiliza precisamente esa regularidad para aproximar probabilidades, esperanzas e integrales mediante experimentos virtuales repetidos.
modelo → simulación → datos virtuales → estimador → incertidumbre → interpretación
6.655. Un experimento sencillo que esconde una idea profunda
Lancemos una moneda equilibrada.
El modelo establece:
P(cara)=0,5.
Esto no significa que cada grupo de diez lanzamientos tenga que contener exactamente cinco caras.
Una realización concreta podría ser:
Aparecen:
6 caras de 10 lanzamientos.
La frecuencia relativa observada es:
h10=6/10
h10=0,60.
El modelo dice 0,50. Los datos de esta realización dicen 0,60.
No existe contradicción.
6.656. La frecuencia relativa acumulada
Sea:
Sn = número de éxitos obtenidos en los primeros n ensayos.
Definimos:
hn=Sn/n.
hn cambia a medida que aparecen nuevos resultados.
Nota. Elaboración propia. Trayectoria simulada con fines didácticos.
6.657. Converger no significa acercarse en cada paso
Una frecuencia relativa puede:
La convergencia es una propiedad del comportamiento de largo plazo, no una obligación sobre cada nuevo ensayo.
6.658. ¿Cuánto puede cambiar hₙ con un nuevo ensayo?
Si Xn+1 vale 1 cuando ocurre un éxito y 0 cuando ocurre un fracaso:
hn+1 = [nhn+Xn+1]/(n+1).
Restando hn:
hn+1−hn = [Xn+1−hn]/(n+1).
6.659. El efecto máximo de un nuevo resultado
Como:
0≤Xn+1≤1
y:
0≤hn≤1,
entonces:
|Xn+1−hn|≤1.
Por tanto:
|hn+1−hn| ≤1/(n+1).
Los saltos individuales se hacen pequeños al aumentar n. Sin embargo, esto por sí solo no demuestra que hn converja hacia p. Para establecer el límite necesitamos la estructura probabilística de los ensayos.
6.660. Ley de los Grandes Números: versión intuitiva
Si repetimos muchas veces un experimento en condiciones apropiadas, la frecuencia relativa de un evento tiende a estabilizarse alrededor de su probabilidad.
hn → p cuando n → ∞.
Ningún experimento físico necesita ejecutar literalmente infinitos ensayos. La afirmación describe qué ocurre al considerar tamaños de muestra cada vez mayores.
6.661. Variables indicadoras: convertir un evento en un promedio
Para el ensayo i definimos:
Xi=1 si ocurre A
Xi=0 si no ocurre A.
Si:
P(A)=p,
entonces:
E[Xi]=p
Var(Xi)=p(1−p).
Además:
Una frecuencia relativa es un promedio de ceros y unos.
6.662. Ley Débil de los Grandes Números para Bernoulli
Supongamos que X₁,X₂,…,Xn son variables Bernoulli independientes con la misma probabilidad p.
hn = (X₁+···+Xn)/n.
Paso 1 · Esperanza
E[hn] = [np]/n = p.
Paso 2 · Varianza
Por independencia:
Var(X₁+···+Xn) = np(1−p).
Var(hn) = p(1−p)/n.
Paso 3 · Chebyshev
Para cualquier ε>0:
P(|hn−p|≥ε) ≤ p(1−p)/(nε²).
Paso 4 · Hacemos crecer n
p(1−p)/(nε²) → 0.
P(|hn−p|≥ε) → 0.
Equivalentemente:
P(|hn−p|<ε) → 1.
6.663. ¿Qué significa converger en probabilidad?
Elegimos cualquier tolerancia:
ε>0.
Decimos que Yn converge en probabilidad hacia Y si:
En la moneda:
P(|hn−0,50|≥ε) → 0.
Nota. Elaboración propia. Trayectoria ilustrativa.
6.664. La Ley Débil no es solamente una ley para monedas
Sean X₁,X₂,… variables independientes e idénticamente distribuidas, con:
E[Xi]=μ
Var(Xi)=σ²<∞.
Definimos el promedio:
La Ley Débil establece:
X̄n → μ en probabilidad.
6.665. Ley Débil general mediante Chebyshev
Para:
X̄n = (X₁+···+Xn)/n,
tenemos:
E[X̄n]=μ.
Por independencia:
Var(X̄n) = σ²/n.
Chebyshev da:
P(|X̄n−μ|≥ε) ≤ σ²/(nε²).
Cuando n→∞:
P(|X̄n−μ|≥ε) → 0.
6.666. Ley Fuerte de los Grandes Números
Existe una forma aún más intensa de convergencia.
Una formulación clásica para variables i.i.d. establece que, si:
E[|X₁|]<∞,
entonces:
X̄n → μ casi seguramente.
Significa que el conjunto de trayectorias para las cuales la convergencia falla tiene probabilidad cero dentro del modelo.
6.667. Diferentes formas de convergencia
La probabilidad de una desviación mayor que ε tiende a cero.
P(|X̄ₙ−μ|≥ε)→0
Para casi toda trayectoria infinita, el promedio termina convergiendo a μ.
X̄ₙ→μ c.s.
El error cuadrático esperado tiende a cero.
E[(X̄ₙ−μ)²]→0
Cuando Var(X)<∞:
E[(X̄n−μ)²]=σ²/n → 0.
6.668. Lo que la Ley de los Grandes Números NO dice
que hn sea exactamente igual a p a partir de cierto n.
que cada nuevo ensayo acerque la frecuencia a p.
que el próximo resultado compense los anteriores.
que cualquier dependencia entre observaciones sea irrelevante.
6.669. Error absoluto y error relativo pueden comportarse de manera distinta
La Ley de los Grandes Números afirma que:
Sn/n → p.
No afirma:
Por ejemplo, una diferencia absoluta de 50 éxitos respecto de np puede parecer grande.
Pero si:
n=10.000,
la diferencia relativa es:
50/10.000=0,005.
La regularidad de largo plazo se refiere principalmente a proporciones y promedios, no a una obligación de compensar diferencias absolutas.
6.670. La dispersión de un promedio disminuye como 1/√n
Para Bernoulli:
Var(hn)=p(1−p)/n.
Por tanto:
σh = √[p(1−p)]/√n.
Para p fija, la dependencia con 1/√n es exacta.
≈0,1581
0,0500
≈0,0158
0,0050
0,0005
Para reducir a la mitad la escala típica del error, necesitamos aproximadamente cuatro veces más observaciones.
Nota. Elaboración propia.
6.671. ¿Por qué σX̄=σ/√n?
Sean X₁,…,Xn independientes, con:
Var(Xi)=σ².
X̄=(X₁+···+Xn)/n.
Entonces:
Var(X̄) = (1/n²)Var(X₁+···+Xn).
Var(X̄) = (1/n²)(nσ²) = σ²/n.
Tomando raíz cuadrada:
σX̄=σ/√n.
6.672. Ley de los Grandes Números y Teorema Central del Límite no dicen lo mismo
Responde:
¿hacia dónde va el promedio?
X̄n→μ.
Responde:
¿cómo fluctúa el promedio alrededor de μ?
después de estandarizar, aparece aproximadamente una normal.
Bajo condiciones habituales:
localiza el límite μ
describe fluctuaciones a escala 1/√n
Nota. Elaboración propia.
6.673. Probabilidad teórica y frecuencia observada siguen siendo objetos distintos
Pertenece al modelo probabilístico.
Para una moneda equilibrada: p=0,5.
Se obtiene de una realización experimental.
Puede ser 0,47; 0,51; 0,5037…
La Ley de los Grandes Números establece una relación entre ambas, pero no las convierte en idénticas para una muestra finita.
6.674. ¿Qué es una simulación Monte Carlo?
Una simulación Monte Carlo utiliza números aleatorios o pseudoaleatorios para reproducir muchas veces un experimento o un modelo matemático.
Después utilizamos:
frecuencias · promedios · proporciones · indicadores · funciones de los resultados
para estimar una cantidad de interés.
100 · 1.000 · 100.000 · …
Nota. Elaboración propia.
6.675. El estimador Monte Carlo general
Supongamos que queremos calcular:
θ=E[Y].
Simulamos valores independientes:
Y₁,Y₂,…,YN.
Definimos:
Por la Ley de los Grandes Números:
θ̂N → θ.
6.676. Esperanza, varianza y error estándar del estimador
Si:
E[Y]=θ y Var(Y)=σ²<∞,
entonces:
E[θ̂N]=θ
Var(θ̂N)=σ²/N
SE=σ/√N
cantidad teórica de interés
estimación obtenida
varianza del estimador
escala típica de fluctuación
6.677. Estimar el error estándar a partir de la simulación
Normalmente σ es desconocida.
Calculamos la desviación estándar muestral s de los valores simulados Y₁,…,YN.
Entonces:
Utilizando la aproximación normal del Teorema Central del Límite, un intervalo Monte Carlo aproximado del 95 % es:
Este intervalo cuantifica incertidumbre debida a la simulación finita. No corrige automáticamente errores del modelo.
6.678. ¿Cuántas simulaciones hacen falta?
Como:
SE ∝1/√N,
para dividir el error estándar por un factor k necesitamos aproximadamente multiplicar N por:
Por ejemplo:
≈4 veces N
≈25 veces N
≈100 veces N
6.679. Una cota más potente para frecuencias Bernoulli
Chebyshev es muy general, pero para variables Bernoulli existen cotas más fuertes.
Una de ellas es la desigualdad de Hoeffding:
Esta desigualdad permite convertir una tolerancia deseada en un número mínimo de observaciones.
6.680. De Hoeffding a un tamaño de simulación
Queremos garantizar:
P(|hn−p|≥ε)≤δ.
Basta imponer:
2e−2nε²≤δ.
Tomando logaritmos y despejando n:
n ≥ ln(2/δ)/(2ε²).
Esta cota no dice que sea necesario exactamente ese número; establece una garantía suficiente bajo las hipótesis del resultado.
6.681. Ejemplo 1 · Una moneda virtual
Generamos:
U ~ Uniforme(0,1).
Definimos:
0≤U<0,5 → cara
0,5≤U<1 → sello
Supongamos que una simulación hipotética de 10.000 ensayos produce:
5.037 caras.
Entonces:
p̂=5.037/10.000
p̂=0,5037.
Nota. Resultado hipotético utilizado con fines didácticos.
6.682. Simular una moneda en una hoja de cálculo
Una hoja de cálculo puede generar números uniformes mediante:
Podemos transformar el resultado en 1 para cara y 0 para sello:
El promedio de los ceros y unos es la frecuencia relativa de caras.
Las hojas de cálculo suelen recalcular sus números aleatorios. Para investigaciones donde la reproducibilidad exacta sea importante, conviene utilizar software que permita controlar explícitamente la semilla.
6.683. Ejemplo 2 · Estimar π mediante puntos aleatorios
Generamos puntos:
(U,V)
uniformemente en el cuadrado:
0≤U≤1, 0≤V≤1.
El punto pertenece al cuarto de círculo de radio 1 cuando:
U²+V²≤1.
Nota. Elaboración propia. Los puntos son ilustrativos.
6.684. ¿De dónde sale la fórmula para π?
El área del cuadrado es:
1.
El área del cuarto de círculo es:
π/4.
Por uniformidad:
P(dentro) = (π/4)/1
P(dentro)=π/4.
Si M de N puntos quedan dentro:
M/N ≈ π/4.
Por tanto:
π̂=4M/N.
6.685. π, Ley de los Grandes Números e incertidumbre
Definimos:
Ii=1 si Ui²+Vi²≤1,
Ii=0 en caso contrario.
Entonces:
P(Ii=1)=π/4.
M/N = (I₁+···+IN)/N.
Por la Ley de los Grandes Números:
M/N → π/4.
4M/N → π.
Además:
Var(π̂) = 16(π/4)(1−π/4)/N.
Esto demuestra que la aproximación converge, pero también que la precisión mejora lentamente, a escala 1/√N.
6.686. Ejemplo 3 · Dos dados
Queremos estimar:
P(suma de dos dados ≥10).
En cada simulación:
- generamos el primer dado;
- generamos el segundo;
- sumamos;
- registramos 1 si la suma es 10, 11 o 12;
- registramos 0 en caso contrario.
Después:
P̂ = número de éxitos/N.
En este caso también conocemos el valor exacto:
P=(3+2+1)/36 = 6/36 = 1/6 ≈0,1667.
Esto permite verificar el comportamiento de la simulación.
6.687. Monte Carlo puede estimar valores esperados
Queremos calcular:
E[g(X)].
Simulamos:
X₁,…,XN.
Y calculamos:
promedio simulado → esperanza del modelo.
6.688. Monte Carlo como método de integración
Sea:
U ~ Uniforme(a,b).
Entonces:
f(u)=1/(b−a).
Por definición de esperanza:
Despejando:
Sustituyendo la esperanza por un promedio simulado:
6.689. ¿Por qué funciona la integración Monte Carlo?
Simulamos independientemente:
U₁,…,UN ~ Uniforme(a,b).
La Ley de los Grandes Números establece:
[g(U₁)+···+g(UN)]/N → E[g(U)].
Pero:
(b−a)E[g(U)] = ∫abg(u)du.
Por tanto:
[(b−a)/N]Σg(Ui) → ∫abg(u)du.
6.690. ¿Por qué Monte Carlo resulta especialmente valioso?
Para problemas sencillos, una fórmula exacta suele ser preferible.
Monte Carlo se vuelve especialmente útil cuando:
La tasa básica 1/√N no contiene explícitamente la dimensión del problema. Esta característica explica parte de su utilidad en problemas de alta dimensión.
Esto no significa que Monte Carlo sea siempre eficiente. Una varianza muy grande o eventos extremadamente raros pueden requerir técnicas especializadas.
6.691. Más simulaciones no garantizan una respuesta correcta
Aumentar N reduce el ruido aleatorio de simulación.
Pero un modelo incorrecto puede producir una estimación extremadamente estable del valor equivocado.
más simulaciones
↓
menor error Monte Carlo
estimación más precisa
más simulaciones
↓
resultado más estable
alrededor del valor incorrecto
Nota. Elaboración propia.
6.692. No todos los errores son el mismo error
Fluctuación debida a utilizar N finito.
Bias(θ̂)=E[θ̂]−θ.
El modelo no representa adecuadamente el fenómeno.
Redondeo, discretización o aproximaciones computacionales.
Algoritmo o código incorrectos.
La secuencia pseudoaleatoria introduce patrones problemáticos.
6.693. Números aleatorios y pseudoaleatorios
Una computadora convencional utiliza habitualmente números pseudoaleatorios.
Son producidos por un algoritmo determinista, pero están diseñados para imitar propiedades estadísticas útiles de secuencias aleatorias.
Determinista no significa inútil. La pseudoaleatoriedad es una herramienta fundamental de la simulación científica moderna.
6.694. La semilla y la reproducibilidad
Muchos generadores comienzan a partir de un valor llamado:
semilla.
Si utilizamos:
misma semilla + mismo algoritmo + implementación compatible,
podemos reproducir la misma secuencia pseudoaleatoria.
misma secuencia
misma secuencia
Nota. Elaboración propia. Los valores son ilustrativos.
6.695. ¿Qué esperamos de un buen generador pseudoaleatorio?
la secuencia no debe repetirse demasiado pronto.
los valores deben cubrir adecuadamente el espacio previsto.
deben evitarse patrones indeseados relevantes.
6.696. Aumentar N no es la única estrategia
Podemos mejorar una simulación no solamente repitiendo más, sino construyendo un estimador de menor varianza.
Divide el espacio en regiones y controla cuántas simulaciones se realizan en cada una.
Combina simulaciones negativamente relacionadas para estabilizar el promedio.
Utiliza una cantidad relacionada cuyo valor esperado conocemos.
Genera con mayor frecuencia observaciones relevantes para el cálculo.
mejor diseño del estimador → menor varianza → mayor eficiencia
6.697. Los eventos raros pueden ser difíciles para Monte Carlo ingenuo
Supongamos que:
P(A)=0,000001.
En un millón de simulaciones, el número esperado de ocurrencias es apenas:
1.
Podríamos incluso observar cero.
Para eventos extremadamente raros, simplemente aumentar N puede ser muy costoso. Técnicas como el muestreo de importancia pueden resultar mucho más eficientes.
6.698. Falacia del jugador: la ley no compensa el pasado
Supongamos que una moneda equilibrada produce:
C · C · C · C · C · C
Sería incorrecto afirmar:
Si los lanzamientos son independientes:
P(sello en el siguiente lanzamiento)=0,5.
La Ley de los Grandes Números describe proporciones de largo plazo. No crea una fuerza que recuerde y corrija los resultados pasados.
6.699. Actividad manual · 100 lanzamientos
- Lanza una moneda 100 veces.
- Registra 1 para cara y 0 para sello.
- Calcula hn para n=1,5,10,20,50 y 100.
- Construye una gráfica de hn contra n.
- Dibuja una línea horizontal en p=0,5.
- Describe las oscilaciones.
- Compara tu gráfica con la de otro grupo.
- ¿Son iguales las trayectorias?
- ¿Alguna trayectoria se acerca siempre de forma monotónica?
- Explica qué observas usando la Ley de los Grandes Números.
6.700. Actividad digital · 10, 100, 1.000 y 10.000 ensayos
Simula una moneda equilibrada y completa:
Realiza la comparación para:
10 · 100 · 1.000 · 10.000.
Repite el experimento completo tres veces.
No esperes que la ejecución con mayor N sea obligatoriamente la mejor en cada comparación individual.
6.701. Actividad Monte Carlo · Estima π
- Genera U y V uniformes entre 0 y 1.
- Calcula D=U²+V².
- Registra 1 si D≤1 y 0 en caso contrario.
- Realiza 100 simulaciones.
- Calcula M/N.
- Calcula π̂=4M/N.
- Repite con 1.000 puntos.
- Repite con 10.000 puntos.
- Compara con π≈3,14159.
- Calcula el error absoluto |π̂−π|.
- ¿10.000 puntos garantizan una mejor estimación que 1.000 en toda ejecución?
- Explica tu respuesta.
6.702. Reto · Resultado exacto frente a resultado simulado
Se lanzan dos dados equilibrados.
Estudia:
- P(suma=7).
- P(suma≥10).
- P(al menos un 6).
- P(los dos dados muestran el mismo número).
Para cada evento:
- calcula la probabilidad exacta;
- simula 100 repeticiones;
- simula 1.000;
- simula 10.000;
- calcula el error respecto del valor exacto;
- compara las ejecuciones;
- explica por qué no producen exactamente el mismo resultado.
6.703. Errores frecuentes
Confundir frecuencia observada con probabilidad del modelo.
Interpretar n→∞ como un experimento físicamente infinito.
Esperar convergencia monotónica.
Usar la LGN para predecir el siguiente resultado.
Creer que Monte Carlo entrega siempre el valor exacto.
Creer que duplicar N reduce el error a la mitad.
Creer que muchas simulaciones corrigen un modelo equivocado.
Creer que pseudoaleatorio significa inútil o defectuoso.
Confundir LGN con TCL.
Ignorar el error estándar de una estimación Monte Carlo.
Llamar «sesgo» a cualquier tipo de error.
Pensar que aumentar N es la única manera de mejorar Monte Carlo.
6.704. Mapa conceptual
SN/N
ΣYi/N
promedio → esperanza
fluctuaciones ≈ normales · escala 1/√N
estimador + error estándar + interpretación
Nota. Elaboración propia.
6.705. Comprueba lo aprendido
- ¿Qué es una frecuencia relativa?
- ¿Por qué puede diferir de p en una muestra finita?
- ¿Qué significa hn→p?
- ¿Por qué la convergencia no tiene que ser monotónica?
- ¿Cuánto puede cambiar como máximo hn al agregar un nuevo ensayo?
- ¿Qué es una variable indicadora?
- ¿Por qué una frecuencia puede escribirse como un promedio?
- ¿Cuánto vale E[hn] para Bernoulli?
- ¿Cuánto vale Var(hn)?
- ¿Qué papel cumple Chebyshev en la Ley Débil?
- ¿Qué significa convergencia en probabilidad?
- ¿Qué significa convergencia casi segura?
- ¿Qué es convergencia en media cuadrática?
- ¿Cuál es una condición clásica para la Ley Fuerte i.i.d.?
- ¿Por qué Sn/n→p no implica Sn−np→0?
- ¿Cómo cambia la desviación estándar de un promedio con n?
- ¿Por qué dividir el error entre dos exige aproximadamente cuadruplicar N?
- ¿Qué diferencia conceptual existe entre LGN y TCL?
- ¿Qué es una simulación Monte Carlo?
- ¿Qué es un estimador Monte Carlo?
- ¿Por qué E[θ̂]=θ en el promedio simple?
- ¿Cuál es Var(θ̂)?
- ¿Qué es el error estándar Monte Carlo?
- ¿Cómo se estima cuando σ es desconocida?
- ¿Qué expresa un intervalo θ̂±1,96·SE?
- ¿Qué garantiza la desigualdad de Hoeffding?
- ¿Por qué π puede estimarse con puntos aleatorios?
- ¿Cómo se obtiene π̂=4M/N?
- ¿Por qué Monte Carlo puede estimar una esperanza?
- ¿Cómo puede estimar una integral?
- ¿Por qué Monte Carlo es útil en alta dimensión?
- ¿Por qué más simulaciones no corrigen un modelo equivocado?
- ¿Qué diferencia hay entre error Monte Carlo y sesgo?
- ¿Qué son números pseudoaleatorios?
- ¿Qué es una semilla?
- ¿Qué condiciones permiten reproducir una secuencia?
- ¿Qué características esperamos de un buen generador?
- ¿Qué significa reducción de varianza?
- Nombra dos técnicas de reducción de varianza.
- ¿Por qué los eventos extremadamente raros pueden ser difíciles de simular?
- ¿Por qué la Ley de los Grandes Números no justifica la falacia del jugador?
6.706. Síntesis y puente hacia la integración final
Una realización individual puede ser impredecible.
Pero una frecuencia relativa puede escribirse como:
hn = (X₁+···+Xn)/n.
Para Bernoulli:
E[hn]=p
Var(hn)=p(1−p)/n.
Por la Ley Débil:
hn→p en probabilidad.
Y, bajo condiciones adecuadas, promedios más generales satisfacen:
X̄n→μ.
La Ley de los Grandes Números nos dice hacia dónde se dirige el promedio.
El Teorema Central del Límite ayuda a describir cómo fluctúa alrededor de ese límite, normalmente a una escala:
1/√N.
Monte Carlo aprovecha esta estructura.
Si:
θ=E[Y],
podemos estimar:
θ̂N = ΣYi/N.
Y cuantificar la incertidumbre mediante:
SE≈s/√N.
Monte Carlo puede estimar probabilidades, valores esperados e integrales, pero la precisión computacional no sustituye la validez conceptual del modelo.
También aprendimos que:
aumentar N no es la única estrategia; una mejor construcción del estimador puede reducir sustancialmente su varianza.
Falta reunirlas en una sola estrategia para resolver problemas reales de probabilidad.
El azar puede dominar cada ensayo individual.
Pero cuando observamos muchos ensayos, los promedios pueden revelar progresivamente la estructura probabilística que estaba escondida detrás del ruido.
Referencias
Bernoulli, J. (1713). Ars conjectandi.
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Feller, W. (1968). An introduction to probability theory and its applications (Vol. 1, 3rd ed.). Wiley.
Fishman, G. S. (1996). Monte Carlo: Concepts, algorithms, and applications. Springer.
Robert, C. P., & Casella, G. (2004). Monte Carlo statistical methods (2nd ed.). Springer.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.
Integración: resolver problemas reales de probabilidad
Del fenómeno al modelo, del modelo al cálculo y del cálculo a una interpretación razonada
preguntar · modelar · calcular · simular · verificar · interpretar · comunicar · decidir
Resolver un problema de probabilidad no consiste en reconocer una palabra y buscar una fórmula.
Consiste en comprender qué fenómeno estamos representando, formular con precisión la pregunta, identificar las condiciones relevantes, construir o seleccionar un modelo, calcular o simular, comprobar la coherencia del resultado e interpretar qué significa ese número dentro del contexto.
6.707. El verdadero problema no es recordar una fórmula
Considera las siguientes preguntas:
Todas son preguntas de probabilidad, pero no requieren la misma herramienta.
6.708. Una ruta general para resolver problemas probabilísticos
Las herramientas estudiadas a lo largo del capítulo pueden organizarse dentro de una estrategia común.
¿Qué ocurre? · ¿qué se desconoce? · ¿qué queremos responder?
orden · reemplazo · independencia · información nueva · tasa · continuidad
combinatoria · condicional · Bayes · distribuciones · límites · simulación
razonamiento primero · herramienta después
supuestos · rango · unidades · extremos · simulación · orden de magnitud
¿qué significa exactamente el número obtenido?
conclusión · supuestos · limitaciones · incertidumbre
consecuencias · objetivos · restricciones · tolerancia al riesgo
Nota. Elaboración propia. Si la verificación revela que el modelo no es adecuado, debemos regresar a etapas anteriores.
6.709. Tabla maestra de selección
¿Qué puede ocurrir?
Herramienta: espacio muestral.
¿Cuántas configuraciones existen?
Herramienta: combinatoria.
¿Qué cambia sabiendo B?
Herramienta: P(A|B).
¿Conocer A modifica la probabilidad de B?
Concepto: independencia.
¿Qué causa es probable después de la evidencia?
Herramienta: Bayes.
Resultado 0 o 1.
Modelo: Bernoulli.
n fijo, independencia, p constante.
Modelo: binomial.
Número de ensayos hasta el primer éxito.
Modelo: geométrica.
Población finita con K éxitos.
Modelo: hipergeométrica.
Conteo asociado a una tasa.
Modelo: Poisson.
Densidad constante.
Modelo: uniforme continua.
Proceso Poisson con tasa constante.
Modelo: exponencial.
Distancias respecto de μ.
Herramienta: z y Φ.
¿Hacia dónde se estabilizan?
Herramienta: Ley de los Grandes Números.
¿Cómo se distribuyen aproximadamente?
Herramienta: Teorema Central del Límite.
Podemos reproducir correctamente el modelo.
Herramienta: Monte Carlo.
6.710. Situación
Consideremos un ejemplo hipotético con fines didácticos.
Un lote contiene:
componentes
defectuosos
no defectuosos
Un inspector selecciona 10 componentes sin reemplazo.
6.711. Reconocer el mecanismo antes de calcular
Las características decisivas son:
población finita + selección sin reemplazo.
Cada componente retirado modifica la composición de la población restante.
N=100, K=8, n=10, k=2.
La composición se restablece.
p puede permanecer constante.
La composición cambia.
La población es finita.
Nota. Elaboración propia.
6.712. Cálculo exacto
Para obtener exactamente 2 defectuosos debemos seleccionar:
2 de los 8 defectuosos
y
8 de los 92 no defectuosos.
El número total de muestras posibles de tamaño 10 es:
C(100,10).
P(X=2)≈0,1506.
P(X=2)≈15,06 %.
6.713. ¿Qué ocurre si aproximamos mediante una binomial?
La proporción inicial de defectuosos es:
p=8/100=0,08.
Si utilizáramos:
X ~ Binomial(10;0,08),
obtendríamos:
P(X=2)=C(10,2)(0,08)²(0,92)⁸
≈0,1478≈14,78 %.
6.714. Medir el error de una aproximación
Los dos resultados son:
exacto = 15,06 %
aproximado = 14,78 %.
La diferencia absoluta es aproximadamente:
La aproximación es cercana en este caso, pero los modelos siguen representando mecanismos distintos.
Que una aproximación funcione bien para un evento concreto no demuestra que el modelo aproximado sea intercambiable con el modelo exacto en todas las preguntas.
¿Por qué el muestreo sin reemplazo reduce la varianza?
Para una hipergeométrica:
Var(X)=np(1−p)·(N−n)/(N−1).
El factor:
(N−n)/(N−1)
recibe el nombre de corrección por población finita.
Como n>1:
(N−n)/(N−1)<1.
Por tanto:
Var(hipergeométrica)<Var(binomial comparable).
La razón intuitiva es que extraer sin reemplazo introduce dependencia: lo que observamos modifica la composición de lo que queda.
Resultado: 15,06 %.
Mecanismo: sin reemplazo.
Papel: modelo exacto.
Resultado: 14,78 %.
Supuesto aproximado: p≈0,08 constante.
Papel: aproximación.
6.715. Interpretar dentro del modelo
Bajo el modelo del lote especificado y una selección aleatoria de 10 componentes sin reemplazo, la probabilidad de encontrar exactamente 2 defectuosos es aproximadamente 15,06 %.
La estructura de una buena conclusión es:
condiciones del modelo + evento + probabilidad.
6.716. El problema
Consideremos un ejemplo hipotético con fines didácticos.
Una máquina puede presentar una falla F o funcionar normalmente Fc.
2 % presentan falla.
Alarma cuando existe falla.
Alarma aun sin falla.
La alarma se activa.
Camino hacia alarma: 0,02×0,95=0,019
Camino hacia alarma: 0,98×0,04=0,0392
Nota. Elaboración propia. Ejemplo hipotético.
6.717. Primero calculamos la probabilidad total de alarma
La alarma puede producirse por dos caminos mutuamente excluyentes:
falla y alarma
o
no falla y alarma.
P(A)=0,02(0,95)+0,98(0,04)
P(A)=0,019+0,0392=0,0582.
6.718. Ahora actualizamos mediante Bayes
Queremos:
P(F|A).
P(F|A)=0,02(0,95)/0,0582
6.719. El mismo razonamiento con 10.000 máquinas
Las frecuencias naturales permiten ver el mecanismo sin comenzar por la fórmula.
máquinas con falla
190 activan alarma
máquinas sin falla
392 activan alarma
alarmas totales
190+392
Entre las 582 máquinas que activan alarma, 190 tienen falla.
6.720. La trampa de invertir una probabilidad
Sabemos que existe falla y preguntamos por la alarma.
Sabemos que apareció alarma y preguntamos por la falla.
Cambiar la condición cambia la pregunta.
6.721. Llegadas a un servicio: situación y tasa
Ejemplo hipotético: un servicio recibe, bajo un modelo Poisson que suponemos adecuado:
6 solicitudes cada 10 minutos.
Queremos:
La tasa por minuto es:
6/10=0,6 solicitudes por minuto.
Para cinco minutos:
λ=0,6×5=3.
λ=0,6
λ=3
λ=6
λ=18
Nota. Elaboración propia. Ejemplo hipotético.
6.722. Aplicar Poisson
Para X ~ Poisson(3):
P(X=2)=e−33²/2!
6.723. Las unidades forman parte del modelo
Sería incorrecto utilizar:
λ=6
para una pregunta referida a cinco minutos, porque 6 es el número esperado en diez minutos.
Una tasa sin sus unidades y sin su intervalo de referencia está incompleta.
6.724. El mismo fenómeno, otra pregunta: tiempo de espera
Ahora no preguntamos cuántas solicitudes llegarán.
Preguntamos:
Bajo un proceso Poisson de tasa:
r=0,6 por minuto,
el tiempo T hasta el próximo evento puede modelarse mediante:
T ~ Exponencial(0,6).
Por ejemplo:
P(T≤5)=1−e−0,6·5
=1−e−3
Mismo fenómeno, variable diferente: Poisson cuenta eventos; exponencial modela tiempos de espera.
6.725. Situación
Supongamos, como ejemplo hipotético, que existe justificación suficiente para utilizar un modelo normal:
μ=50 unidades
σ=4 unidades.
Queremos calcular:
6.726. Transformar ambos límites
Para x=46:
z₁=(46−50)/4=−1.
Para x=58:
z₂=(58−50)/4=2.
z=−1
z=0
z=1
z=2
Nota. Elaboración propia. Cada 4 unidades corresponden a una desviación estándar.
P(46≤X≤58)=P(−1≤Z≤2)
=Φ(2)−Φ(−1)
≈0,9772−0,1587
6.727. Una comprobación antes de confiar en el decimal
El intervalo:
−1≤Z≤2
contiene completamente:
−1≤Z≤1,
cuya probabilidad es aproximadamente:
68,27 %.
Y está contenido en:
−2≤Z≤2,
cuya probabilidad es aproximadamente:
95,45 %.
Por tanto, antes de consultar cualquier tabla, esperamos:
El resultado 81,85 % supera esta prueba de coherencia.
6.728. Dos comprobaciones conceptuales
Que X sea continua no demuestra que X sea normal. La normalidad es una hipótesis que debe justificarse.
Un valor muy alejado puede tener probabilidad muy pequeña sin ser matemáticamente imposible.
6.729. Seleccionar un comité
Un grupo tiene 12 estudiantes.
Se seleccionan 4 para formar un comité.
No existen cargos distintos.
Por tanto:
el orden no importa.
6.730. Si aparecen cargos, la pregunta cambia
Ahora seleccionamos:
Ahora sí importa quién ocupa cada posición.
12×11×10×9=11.880.
6.731. Combinaciones y ordenamientos están relacionados
Podemos obtener las 11.880 asignaciones de otra manera.
Primero escogemos las cuatro personas:
C(12,4)=495.
Después ordenamos esas cuatro personas en los cuatro cargos:
4!=24.
Por tanto:
elegir las personas × asignar las posiciones.
Seleccionar un grupo.
Cargos o posiciones distintas.
Nota. Elaboración propia.
6.732. Dos dados
Lanzamos dos dados equilibrados e suponemos independencia.
Queremos:
P(suma≥10).
3 resultados
2 resultados
1 resultado
6 casos favorables de 36 equiprobables.
6.733. Resolver el mismo problema mediante Monte Carlo
En cada repetición:
- generamos el primer dado;
- generamos el segundo;
- sumamos;
- registramos 1 si la suma es al menos 10;
- registramos 0 en caso contrario.
Después de N repeticiones:
p̂=0,1700
p̂=0,1600
p̂=0,1664
p≈0,1667
Nota. Elaboración propia. Datos simulados con fines didácticos. Una ejecución individual no tiene que mejorar de forma monotónica al aumentar N.
6.734. ¿Es razonable la diferencia observada?
Para N=10.000 obtuvimos:
p̂=0,1664.
El error estándar estimado es:
SE≈0,00372.
Un intervalo Monte Carlo aproximado del 95 % es:
0,1664 ± 1,96(0,00372)
≈0,1664 ± 0,0073.
El valor exacto:
1/6≈0,1667
se encuentra dentro de ese intervalo.
6.735. ¿Qué aprendemos al comparar ambos métodos?
Usa la estructura matemática.
P=1/6.
No presenta error Monte Carlo.
Reproduce virtualmente el modelo.
p̂≈P.
Presenta fluctuación porque N es finito.
Una solución exacta puede carecer de error Monte Carlo y aun así contener error de modelación o de implementación.
6.736. La misma probabilidad puede acompañar consecuencias diferentes
Imagina dos eventos con:
P=0,01.
En el primer caso, la consecuencia es una interrupción breve.
En el segundo, la consecuencia puede ser muy grave.
La probabilidad es la misma.
La decisión razonable puede ser diferente.
¿Qué tan probable es?
¿Qué ocurre si sucede?
¿Qué queremos proteger u obtener?
¿Qué opciones son posibles?
Nota. Elaboración propia.
6.737. Valor esperado de una consecuencia
Si una variable X puede tomar:
x₁,x₂,…,xm
con probabilidades:
p₁,p₂,…,pm,
entonces:
El valor esperado puede ayudar a comparar alternativas, pero no constituye una regla universal de decisión.
6.738. Una introducción a la pérdida esperada
En un problema de decisión distinguimos:
lo que decidimos hacer
lo que realmente ocurre
resultado de acción y estado
costo asociado a la consecuencia
Si L(a,sᵢ) representa la pérdida de tomar la acción a cuando ocurre el estado sᵢ:
Una posible regla de decisión consiste en elegir la acción con menor pérdida esperada.
cuantifica incertidumbre sobre estados o eventos.
representa cómo valoramos las consecuencias.
combina incertidumbre, consecuencias y objetivos.
6.739. El valor esperado como promedio de largo plazo
Supongamos repeticiones independientes con la misma distribución de una variable discreta e integrable X.
Si xᵢ apareció nᵢ veces en n realizaciones:
X̄=x₁(n₁/n)+···+xm(nm/n).
Por la Ley de los Grandes Números:
nᵢ/n → pᵢ.
Por tanto:
X̄ → Σxᵢpᵢ=E[X].
Esta interpretación depende de las condiciones del modelo; no convierte E[X] en el resultado que deba observarse en una realización individual.
6.740. Riesgo no significa destino
Supongamos que un modelo asigna:
70 %
a un evento.
Eso no significa que un caso individual esté:
Significa que, bajo el modelo y la información utilizados, ese evento recibe probabilidad 0,70.
La probabilidad cuantifica incertidumbre. No transforma una estimación en certeza, sentencia o destino individual.
6.741. Nueve pruebas rápidas de coherencia
¿La probabilidad está entre 0 y 1?
¿P(A)+P(Ac)=1?
¿La distribución suma o integra 1?
¿Tasas, tiempos e intervalos son compatibles?
¿El modelo se comporta razonablemente en casos límite?
¿Se justifican realmente las condiciones del modelo?
¿Una simulación independiente es compatible con el resultado?
¿El tamaño del resultado parece plausible?
¿El número responde exactamente a la pregunta?
6.742. Tres condiciones para confiar en una solución
representa razonablemente el fenómeno y sus condiciones
aplica correctamente la estructura matemática
traduce adecuadamente el resultado al contexto
Nota. Elaboración propia.
Un cálculo impecable no salva un modelo inadecuado.
Un modelo adecuado tampoco salva un error de cálculo.
Y ambos pueden conducir a una conclusión engañosa si interpretamos incorrectamente el resultado.
6.743. Mapa maestro de modelos y herramientas
espacio muestral
operaciones con eventos
combinatoria
condicional
independencia
probabilidad total
Bayes
discreta
continua
un ensayo
éxitos en n
hasta éxito
sin reemplazo
conteo
intervalo
espera
z y Φ
LGN · TCL
Monte Carlo
Nota. Elaboración propia. El nombre de una distribución nunca sustituye la comprobación de sus condiciones.
6.744. Doce preguntas antes de comenzar a calcular
1. ¿Qué exactamente me están preguntando?
2. ¿Cuál es el experimento o fenómeno aleatorio?
3. ¿Cuáles son los resultados posibles?
4. ¿Qué evento o variable debo definir?
5. ¿Existe información condicionante?
6. ¿Los ensayos pueden considerarse independientes?
7. ¿Existe reemplazo?
8. ¿La probabilidad permanece constante?
9. ¿Qué unidades tienen las tasas y los intervalos?
10. ¿Qué hipótesis necesita el modelo?
11. ¿Qué datos o evidencia justifican esas hipótesis?
12. ¿Cómo comprobaré que la respuesta tiene sentido?
6.745. Elige una situación
Individualmente o en equipo, selecciona una situación donde exista incertidumbre.
Los datos reales deben indicar fuente y contexto. Los datos inventados deben identificarse como hipotéticos o simulados.
6.746. Fase 1 · Formulación
1. Describe la situación con tus propias palabras.
2. Explica qué parte del fenómeno es aleatoria.
3. Define el experimento.
4. Define el espacio muestral cuando sea posible.
5. Define los eventos relevantes.
6. Define la variable aleatoria, si corresponde.
7. Formula una pregunta probabilística precisa.
6.747. Fase 2 · Construcción del modelo
1. Decide si la variable es discreta o continua.
2. Determina si existen ensayos repetidos.
3. Examina si pueden considerarse independientes.
4. Determina si existe reemplazo.
5. Decide si p permanece constante.
6. Si cuentas eventos, identifica tasa e intervalo.
7. Si estudias tiempos de espera, examina si un modelo exponencial es razonable.
8. Si utilizas normal, justifica por qué.
9. Selecciona el modelo probabilístico.
10. Explica por qué responde a la estructura.
11. Identifica al menos una limitación.
6.748. Fase 3 · Solución
1. Explica la estructura del razonamiento.
2. Escribe la fórmula utilizada.
3. Identifica cada parámetro.
4. Sustituye los valores.
5. Realiza el cálculo.
6. Expresa el resultado como decimal.
7. Cuando corresponda, exprésalo como porcentaje.
8. Interpreta el resultado en una oración completa.
6.749. Fase 4 · Verificación
1. ¿La respuesta está entre 0 y 1 si es una probabilidad?
2. ¿El complemento es coherente?
3. ¿La distribución suma o integra 1?
4. ¿Las unidades son correctas?
5. ¿Los parámetros corresponden al intervalo adecuado?
6. ¿Los supuestos del modelo son razonables?
7. ¿Una simulación produce aproximadamente el mismo resultado?
8. ¿El orden de magnitud tiene sentido?
9. ¿Qué podría hacer fallar el modelo en el mundo real?
6.750. Fase 5 · Comunicación
Presenta claramente:
1. la pregunta;
2. los datos y su procedencia;
3. el modelo y sus supuestos;
4. una figura, tabla o esquema útil;
5. el cálculo;
6. una simulación cuando sea pertinente;
7. la interpretación;
8. las limitaciones;
9. la conclusión final.
6.751. Fase 6 · Reproducibilidad y uso responsable de los datos
Si otra persona quisiera repetir tu análisis, debería poder comprender:
1. de dónde salieron los datos;
2. cómo fueron preparados;
3. qué supuestos utilizaste;
4. qué fórmula o algoritmo aplicaste;
5. qué semilla utilizaste, si la simulación requiere reproducibilidad;
6. qué decisiones metodológicas tomaste;
7. cuáles son las limitaciones del estudio.
Cuando los datos pertenecen a personas, también deben considerarse privacidad, anonimización y uso responsable de la información.
preguntar
modelar
calcular
simular
verificar
interpretar
comunicar
Nota. Elaboración propia.
6.752. Rúbrica del proyecto final
Excelente: pregunta precisa y variables claramente definidas.
Adecuado: pequeñas ambigüedades.
Por mejorar: no queda claro qué se desea calcular.
Excelente: modelo y supuestos justificados.
Adecuado: justificación parcial.
Por mejorar: distribución elegida por apariencia.
Excelente: explícitos y críticamente examinados.
Adecuado: menciona los principales.
Por mejorar: se presentan conclusiones sin condiciones.
Excelente: correcto, claro y reproducible.
Adecuado: esencialmente correcto.
Por mejorar: errores modifican la respuesta.
Excelente: varias comprobaciones independientes.
Adecuado: al menos una comprobación.
Por mejorar: acepta el resultado sin examinarlo.
Excelente: traduce correctamente y reconoce límites.
Adecuado: interpretación esencialmente correcta.
Por mejorar: confunde probabilidad con certeza.
Excelente: datos, método y decisiones pueden reconstruirse.
Adecuado: información suficiente con omisiones menores.
Por mejorar: no puede repetirse el análisis.
Excelente: solución ordenada, argumentada y visualmente clara.
Adecuado: solución comprensible.
Por mejorar: presenta números sin razonamiento.
6.753. Comprueba tu dominio del capítulo
1. ¿Qué es un experimento aleatorio?
2. ¿Qué diferencia existe entre resultado y evento?
3. ¿Qué representa Ω?
4. ¿Qué significa que dos eventos sean mutuamente excluyentes?
5. ¿Qué significa independencia?
6. ¿Por qué incompatibilidad e independencia no son sinónimos?
7. ¿Qué representa P(A|B)?
8. ¿Qué cambia cuando condicionamos por B?
9. Escribe la regla general de multiplicación.
10. ¿Cuándo resulta útil la probabilidad total?
11. ¿Qué problema resuelve Bayes?
12. ¿Por qué P(A|B) y P(B|A) pueden diferir mucho?
13. ¿Cuándo se utiliza una combinación?
14. ¿Cuándo importa el orden?
15. ¿Qué es una variable aleatoria?
16. ¿Qué diferencia existe entre variable discreta y continua?
17. ¿Qué es una función de masa?
18. ¿Qué es una densidad?
19. ¿Por qué f(x) no suele ser P(X=x)?
20. ¿Por qué P(X=x)=0 en una variable con densidad no significa imposibilidad lógica?
21. ¿Qué representa E[X]?
22. ¿Qué representa Var(X)?
23. ¿Cuáles son las condiciones de una binomial?
24. ¿Qué pregunta caracteriza una geométrica?
25. ¿Por qué la hipergeométrica aparece sin reemplazo?
26. ¿Qué representa λ en Poisson?
27. ¿Por qué λ debe ajustarse al intervalo?
28. ¿Qué relación existe entre Poisson y exponencial?
29. ¿Qué caracteriza una uniforme continua?
30. ¿Qué representan μ y σ en una normal?
31. ¿Qué significa una puntuación z?
32. ¿Qué representa Φ(z)?
33. ¿Qué representa Φ−1(p)?
34. ¿Por qué una variable continua no tiene que ser normal?
35. ¿Por qué una muestra grande no vuelve normales los datos originales?
36. Explica la Ley de los Grandes Números.
37. ¿Por qué una frecuencia relativa no converge necesariamente de forma monotónica?
38. ¿Qué diferencia conceptual existe entre LGN y TCL?
39. ¿Qué es una simulación Monte Carlo?
40. ¿Por qué el error estándar de un promedio Monte Carlo es de orden 1/√N?
41. ¿Cómo se estima el error estándar Monte Carlo?
42. ¿Qué significa un intervalo Monte Carlo?
43. ¿Por qué aumentar N no corrige un modelo equivocado?
44. ¿Qué significa reducción de varianza?
45. ¿Qué diferencia existe entre modelo adecuado, cálculo correcto e interpretación correcta?
46. ¿Por qué una probabilidad no determina por sí sola una decisión?
47. ¿Qué es una pérdida esperada?
48. ¿Qué papel cumplen los supuestos en un modelo?
49. ¿Por qué la reproducibilidad es importante?
50. Describe el procedimiento completo que utilizarías ante un problema probabilístico nuevo.
6.754. El viaje completo del capítulo
Nota. Elaboración propia.
6.755. Doce errores que ya debemos ser capaces de detectar
Confundir P(A|B) con P(B|A).
Confundir independencia con incompatibilidad.
Usar binomial cuando p cambia.
Ignorar el muestreo sin reemplazo.
Usar Poisson para cualquier conteo.
Confundir densidad con probabilidad puntual.
Creer que continua significa normal.
Creer que z es una probabilidad.
Confundir LGN con TCL.
Creer que Monte Carlo elimina el error de modelo.
Confundir una probabilidad precisa con certeza científica.
Tomar una decisión sin considerar consecuencias ni objetivos.
6.756. El modelo no es la realidad
Una moneda matemática puede ser perfectamente equilibrada.
Una moneda física puede presentar asimetrías.
Una máquina real puede deteriorarse.
Una tasa de llegadas puede variar con la hora.
Una medición puede contener errores sistemáticos.
Una distribución observada puede no ser normal.
Por eso debemos separar cuidadosamente varios niveles.
fenómeno complejo
evidencia obtenida
representación matemática bajo hipótesis
obtenemos consecuencias cuantitativas del modelo
qué significa y qué no significa el resultado
acción informada bajo incertidumbre
Nota. Elaboración propia. El modelo no sustituye la realidad; permite razonar sobre ella bajo supuestos explícitos.
6.757. Síntesis final del capítulo
Comenzamos comprendiendo que una probabilidad es una medida matemática de incertidumbre entre 0 y 1.
Construimos experimentos, resultados, espacios muestrales y eventos.
Aprendimos que muchas reglas de probabilidad se derivan de unos pocos axiomas fundamentales.
Utilizamos combinatoria para contar posibilidades.
Incorporamos nueva información mediante:
P(A|B).
Diferenciamos independencia e incompatibilidad.
Construimos árboles, aplicamos probabilidad total y actualizamos probabilidades mediante Bayes.
Convertimos resultados aleatorios en números mediante variables aleatorias.
Estudiamos esperanza y varianza.
Analizamos modelos discretos:
Bernoulli · binomial · geométrica · hipergeométrica · Poisson.
Pasamos a variables continuas y comprendimos la función de densidad y la función acumulada.
Estudiamos modelos:
uniforme · exponencial · normal.
Transformamos observaciones mediante:
z=(x−μ)/σ.
Comprendimos que una puntuación z es una distancia estandarizada, no una probabilidad.
Estudiamos la Ley de los Grandes Números para comprender hacia dónde se dirigen los promedios.
Utilizamos el Teorema Central del Límite para comprender cómo fluctúan muchos promedios alrededor de su centro.
Convertimos la repetición aleatoria en una herramienta computacional mediante Monte Carlo.
Y finalmente reunimos todo:
Cuando existe una decisión:
probabilidad + consecuencias + objetivos + restricciones → decisión informada.
Y llegamos a la lección que resume todo el capítulo: una buena solución probabilística no termina cuando aparece un número.
sin confundir probabilidad con certeza
Nota. Elaboración propia. La probabilidad no elimina la incertidumbre: permite describirla, analizarla y utilizarla racionalmente.
La probabilidad no promete decirnos exactamente qué ocurrirá.
Nos ofrece algo diferente y profundamente valioso:
una manera rigurosa de pensar cuando el futuro no puede conocerse con certeza.
Preguntar bien, modelar con cuidado, calcular correctamente, simular cuando sea útil, verificar, reconocer los límites y comunicar la incertidumbre con precisión: ese es el pensamiento probabilístico.
Referencias
Blitzstein, J. K., & Hwang, J. (2019). Introduction to probability (2nd ed.). CRC Press.
Casella, G., & Berger, R. L. (2002). Statistical inference (2nd ed.). Duxbury.
Feller, W. (1968). An introduction to probability theory and its applications (Vol. 1, 3rd ed.). Wiley.
Kolmogorov, A. N. (1933). Grundbegriffe der Wahrscheinlichkeitsrechnung. Springer.
Robert, C. P., & Casella, G. (2004). Monte Carlo statistical methods (2nd ed.). Springer.
Ross, S. M. (2019). A first course in probability (10th ed.). Pearson.