tema 03 de 03 · Matemáticas CCSS II
Probabilidad e inferencia
Es la parte más mecánica y la que más pesa en la nota de casi cualquier comunidad, y por eso la más rentable: diagramas de árbol, tabla de la normal y la fórmula del intervalo se repiten año tras año con números distintos. La única dificultad real está en leer bien el enunciado: qué va delante de la barra, si se pide bajar o subir por el árbol, y si el tamaño de muestra se redondea hacia arriba.
Qué te va a pedir el examen
- Definir los sucesos por escrito y calcular probabilidades con unión, complementario y condicionada; decidir si dos sucesos son independientes.
- Resolver un problema de probabilidad total y de Bayes con un diagrama de árbol.
- Aproximar una binomial por una normal, comprobando las condiciones y aplicando la corrección de continuidad; tipificar y leer la tabla.
- Construir un intervalo de confianza para la media o la proporción, calcular el error y el tamaño muestral mínimo, e interpretar el resultado.
1 Sucesos: lo que se pregunta va delante de la barra
Antes de calcular nada, define los sucesos por escrito: «Sea A = el cliente compra por internet». Parece trivial, y en los criterios de corrección se puntúa aparte del cálculo. Después, tres herramientas que resuelven casi todo: el complementario, P(no A) = 1 − P(A); la unión, P(A ∪ B) = P(A) + P(B) − P(A ∩ B); y las leyes de De Morgan, que traducen «ninguno de los dos» como 1 − P(A ∪ B) y «no los dos a la vez» como 1 − P(A ∩ B). Siempre que leas «al menos uno», piensa en el complementario: es el camino corto.
La probabilidad condicionada es la del bloque: P(A | B) = P(A ∩ B) / P(B), la probabilidad de A sabiendo que ha ocurrido B. En cuanto veas «sabiendo que», «si es de tipo», «entre los que», es una condicionada. Y el orden importa: lo que se pregunta va delante de la barra, la condición detrás. Invertir P(A | B) con P(B | A) es el error número uno del tema. De la definición sale la fórmula del producto, P(A ∩ B) = P(A | B)·P(B), que es la que usas para montar intersecciones.
Dos sucesos son independientes si P(A ∩ B) = P(A)·P(B), o lo que es lo mismo, si P(A | B) = P(A). Cuando te pidan comprobarlo, calcula los dos lados y compara, y escribe la conclusión con palabras. Y no lo confundas con incompatibles, que es otra cosa: incompatibles significa que no pueden ocurrir a la vez, P(A ∩ B) = 0. De hecho, dos sucesos incompatibles con probabilidad no nula son siempre dependientes.
2 El árbol: bajar para la probabilidad total, subir para Bayes
Cuando la población se reparte en varios grupos (una partición A1, A2, A3) y un suceso Q puede darse en cualquiera de ellos, dibuja un árbol: primer nivel, los grupos con sus probabilidades, que deben sumar 1; segundo nivel, desde cada grupo, Q y no Q con las condicionadas. La probabilidad de un camino es el producto de sus ramas. Si las ramas del primer nivel no suman 1, has repartido mal la partición.
La probabilidad total es bajar por el árbol: P(Q) es la suma de todos los caminos que llegan a Q, P(Q | A1)·P(A1) + P(Q | A2)·P(A2) + P(Q | A3)·P(A3). El teorema de Bayes es subir: ya sabes que ocurrió Q y preguntas de qué grupo venía, P(Ai | Q) = P(Q | Ai)·P(Ai) / P(Q). Es decir, el camino que te interesa dividido por la probabilidad total. Dar solo el numerador, sin dividir, es un error documentado que se repite cada año.
Cómo distinguirlos en el enunciado: si te da la condición y busca el suceso final («¿probabilidad de que la pieza sea defectuosa?»), es total; si te da el resultado y busca de qué grupo salió («si es defectuosa, ¿probabilidad de que venga de la máquina A?»), es Bayes. Casi siempre se piden en ese orden, porque Bayes reutiliza en el denominador la total que acabas de calcular. Y si la condición es «no ocurrió Q», usa las ramas de no Q, que son 1 menos las de Q.
3 Binomial y normal: tipificar, leer la tabla y corregir medio punto
La binomial B(n, p) cuenta éxitos en n pruebas independientes con probabilidad p constante; su media es n·p y su desviación típica la raíz de n·p·q, con q = 1 − p. Para valores exactos, P(X = k) = C(n, k)·pk·qn−k; para «al menos uno», el complementario 1 − P(X = 0). Cuidado: si las extracciones son sin reemplazamiento, no hay binomial, porque la probabilidad cambia en cada extracción.
La normal N(μ, σ) se trabaja siempre igual: se tipifica con Z = (X − μ) / σ y se lee la tabla, que da P(Z ≤ z) para z positivo. Los cuatro casos: lectura directa; P(Z ≥ z) = 1 − P(Z ≤ z); P(Z ≤ −z) = 1 − P(Z ≤ z), por simetría; y P(a ≤ Z ≤ b) = P(Z ≤ b) − P(Z ≤ a). Si un z se sale de la tabla, su probabilidad es prácticamente 0 o 1, y conviene decirlo. El problema inverso también cae: te dan la probabilidad, buscas el z y deshaces la tipificación con X = μ + z·σ.
Cuando n es grande, la binomial se aproxima por una normal N(n·p, √(n·p·q)), siempre que n·p ≥ 5 y n·q ≥ 5: comprueba y escribe las condiciones, porque forman parte de la respuesta. Y como pasas de una variable discreta a una continua, aplica la corrección de continuidad: P(X ≥ k) se convierte en P(X' ≥ k − 0,5), P(X ≤ k) en P(X' ≤ k + 0,5), y P(X = k) en el intervalo entre k − 0,5 y k + 0,5. Olvidar ese medio punto es el error más típico del apartado.
4 Intervalos de confianza: cinco pasos y una regla de redondeo
Si la población es N(μ, σ), la media muestral de muestras de tamaño n se distribuye como N(μ, σ/√n): las medias se agrupan más que los datos sueltos. De ahí sale la primera trampa del bloque: cuando pregunten por la media de una muestra, tipifica con σ/√n, no con σ. Tipificar con σ responde a otra pregunta, la de un individuo.
El intervalo de confianza para la media es (x̄ − E, x̄ + E), con el error E = zα/2·σ/√n. Cinco pasos: identifica x̄, σ y n; halla zα/2, que es el valor cuya área a la izquierda en la tabla es 1 − α/2 (no 1 − α); calcula E; escribe el intervalo; e interpreta con palabras: «con una confianza del 95 por ciento, la media de la población está entre 10,8 y 13,2 horas». Los valores más habituales: 90 por ciento, 1,645; 95, 1,96; 97, 2,17; 99, 2,575. Para el resto, la tabla. Para la proporción el esquema es idéntico cambiando σ/√n por √(p̂·q̂/n), con p̂ la proporción muestral, y el z es el mismo: depende solo de la confianza.
El tamaño muestral mínimo sale de despejar n en la fórmula del error: n ≥ (zα/2·σ / E)² para la media, y n ≥ zα/2²·p̂·q̂ / E² para la proporción (con p̂ = q̂ = 0,5 si no hay estimación previa). Y la regla que más se falla: se redondea hacia arriba, siempre, aunque salga 50,02. Con menos individuos el error sería mayor que el exigido, y no se pueden encuestar fracciones de persona. Un tamaño de 706,33 son 707.
Las tres relaciones que se preguntan como razonamiento: a más confianza, intervalo más ancho (z crece); a más tamaño de muestra, intervalo más estrecho (σ/√n baja), y para reducir el error a la mitad hay que cuadruplicar la muestra, porque n depende de 1/E²; y a más desviación típica, más amplitud. Precisión y confianza compiten: solo se ganan las dos a la vez con más datos. Un aviso más: la amplitud del intervalo es 2E, no E. Si te dan el intervalo ya construido, la media muestral es el centro (semisuma de los extremos) y el error es la semiamplitud (semidiferencia).
Para llevarte
- Define los sucesos por escrito antes de calcular: se puntúa aparte, y ordena todo lo demás.
- En P(A | B), lo que se pregunta va delante de la barra y la condición detrás; independiente no es incompatible.
- Probabilidad total es bajar por el árbol sumando caminos; Bayes es subir dividiendo el camino por la total.
- Al aproximar la binomial por la normal, comprueba n·p ≥ 5 y n·q ≥ 5 y aplica la corrección de continuidad de medio punto.
- La media muestral se tipifica con σ/√n; z<sub>α/2</sub> es el valor con área 1 − α/2; el tamaño muestral se redondea siempre hacia arriba.
- La amplitud es 2E, no E; y el intervalo se interpreta con una frase en el contexto del problema.
Errores que restan
- Invertir la condicionada, confundiendo P(A | B) con P(B | A), o no definir los sucesos por escrito.
- En Bayes, dar solo el numerador del camino sin dividir por la probabilidad total.
- Olvidar la corrección de continuidad al aproximar la binomial por la normal, o aproximar sin comprobar las condiciones.
- Tipificar la media muestral con σ en vez de con σ/√n, o buscar el z con área 1 − α en lugar de 1 − α/2.
- Redondear el tamaño muestral hacia abajo, confundir el error E con la amplitud 2E, o dar el intervalo sin interpretarlo.
Autochequeo
Responde sin mirar arriba. Si fallas, mejor aquí que el día del examen: cada opción trae su porqué.
1. El enunciado dice: «Sabiendo que un cliente compra por internet, calcula la probabilidad de que sea menor de 30 años». Con A = «menor de 30» y B = «compra por internet», ¿qué te piden?
«Sabiendo que» introduce la condición, y la condición va detrás de la barra: se sabe que compra por internet (B) y se pregunta por la edad (A), así que es P(A | B). Invertirla, P(B | A), es el error número uno del tema; la intersección y la unión no llevan condición.
2. Tres máquinas fabrican una pieza y conoces la probabilidad de defecto en cada una. Te preguntan: «Si la pieza es defectuosa, ¿qué probabilidad hay de que venga de la máquina A?». ¿Qué calculas?
Te dan el resultado final (defectuosa) y preguntan de qué grupo salió: eso es subir por el árbol, Bayes. El numerador es el camino de A, pero hay que dividirlo por la probabilidad total, que es la suma de los tres caminos; quedarse en el producto sin dividir es el error documentado. La total sola responde a la pregunta contraria.
3. X sigue una binomial B(400; 0,95), que aproximas por una normal. ¿Cómo calculas P(X ≥ 375)?
Las condiciones se cumplen: n·p = 380 y n·q = 20, los dos por encima de 5. Al pasar de una variable discreta a una continua, «X ≥ 375» incluye el 375 entero, así que el límite se mueve medio punto hacia fuera: 374,5. Tipificar en 375 sin corregir es el error más típico del apartado, y 375,5 corrige en el sentido contrario.
4. El tiempo de adaptación sigue una N(10,5; 1,5). Tomas una muestra de 25 y quieres la probabilidad de que la media de la muestra supere los 10 días. ¿Con qué tipificas?
La media muestral se distribuye como N(μ, σ/√n) = N(10,5; 0,3): las medias de 25 individuos se agrupan mucho más que los individuos sueltos. Tipificar con σ = 1,5 responde a otra pregunta, la de un solo niño, y es el error más caro del bloque. Multiplicar por √n o usar la varianza no corresponde a ninguna fórmula.
5. Al calcular el tamaño de muestra mínimo para que el error no supere cierto valor, te sale n = 706,33. ¿Qué respondes?
El requisito es que el error no pase del máximo admitido, y con 706 individuos el error real quedaría por encima. Hay que ir al entero que sigue cumpliendo la condición: hacia arriba, 707, aunque el decimal sea pequeño. Redondear al más cercano o hacia abajo es el error más común de la unidad, y no se pueden encuestar fracciones de persona.
6. Un intervalo de confianza para la media es (10,8; 13,2). ¿Cuál es el error máximo cometido?
Un intervalo es siempre centro ± error, así que el error es la semiamplitud: (13,2 − 10,8) / 2 = 1,2. Responder 2,4 es confundir el error con la amplitud, que es 2E; 12 es el centro, es decir, la media muestral. Para leer E no hace falta rehacer el intervalo desde cero.
La pregunta que decide si lo tienes
El tiempo de estudio semanal de los estudiantes de una universidad sigue una normal de media desconocida y desviación típica 5 horas. En una muestra de 81 estudiantes la media ha sido de 12 horas. Construye el intervalo de confianza al 97 por ciento para la media poblacional e interpreta el resultado. Después, calcula qué tamaño mínimo de muestra haría falta para que el error no superase media hora, con el mismo nivel de confianza.
Pista 1
Primero el z: al 97 por ciento, α = 0,03 y α/2 = 0,015, así que buscas en la tabla el valor cuya área a la izquierda es 0,985, que es 2,17. Después el error, E = z·σ/√n, con √81 = 9. El intervalo es (12 − E, 12 + E).
Pista 2
Para el tamaño de muestra, parte de la misma fórmula del error, E = z·σ/√n, pero ahora E = 0,5 es el dato y n la incógnita. Despeja √n, eleva al cuadrado y piensa hacia qué lado redondeas para que el error siga por debajo de 0,5.
Solución
Datos: x̄ = 12, σ = 5, n = 81, confianza del 97 por ciento. El valor crítico es z = 2,17, porque su área acumulada es 1 − 0,015 = 0,985. Error: E = 2,17·5/9 = 1,206 horas. Intervalo: (12 − 1,206; 12 + 1,206) = (10,794; 13,206). Interpretación: con una confianza del 97 por ciento, el tiempo medio de estudio semanal de la población está entre 10,8 y 13,2 horas, aproximadamente. Fíjate en el sentido de la confianza: no es que la media tenga un 97 por ciento de probabilidad de estar ahí, sino que, si repitiéramos el muestreo muchas veces, el 97 por ciento de los intervalos así construidos contendrían la media real. Para el tamaño de muestra, de 0,5 ≥ 2,17·5/√n sale √n ≥ 21,7, y elevando al cuadrado n ≥ 470,89. Como el error tiene que quedar por debajo de media hora, se redondea hacia arriba: hacen falta al menos 471 estudiantes. Observa que reducir el error de 1,2 a 0,5 ha multiplicado la muestra por casi seis, porque n depende del cuadrado de 1/E: la precisión sale cara, y esa es exactamente la relación que se pregunta como razonamiento.