SEMINARIO !
° ESTADÍSTICA
GRUPO # 1
Carlos A. Alvarez Mercado , Jonatan E. Yepez, Natalia Gómez Pedrozo, Julián E.
Cifuentes Solorzano, Santiago J. Salgado Carmona, Heyner D. Cantillo Anaya, Juan S.
Perez, María C. Ruiz, Tania L. Arroyo Romero, Edgardo Medrano Magallanes.
Maximiliano Ceballos
Química Analítica
Cuarto Semestre
Universidad de Cartagena
14 de mayo del 2025
5A - ALGUNOS CONCEPTOS IMPORTANTES
Para aumentar la confiabilidad de los resultados y conocer su variabilidad, se recomienda
realizar entre dos y cinco réplicas del procedimiento analítico. Los resultados de estas
mediciones suelen ser muy similares, por lo que el valor central, como la media o la mediana,
se considera la mejor estimación del valor real. Utilizar un conjunto de réplicas es más
confiable que depender de resultados individuales, y al analizar la variación de los datos, se
puede estimar la incertidumbre asociada a ese valor central.
5A.1 La media y la mediana
La medida más común para definir un valor central es la media o media aritmética, que se
calcula dividiendo la suma de las mediciones de las réplicas entre el número total de
mediciones en el conjunto
𝑁
∑ 𝑥𝑖
𝑖=1
𝑥= 𝑁
donde 𝑥𝑖 representa los valores individuales que componen un conjunto de N mediciones de
las réplicas
Cuando los datos se ordenan en forma creciente o decreciente, el valor central se determina
como la mediana. La mediana asegura que haya un número igual de resultados mayores y
menores que ella. Si el conjunto tiene un número impar de mediciones, la mediana se localiza
como el valor central después de ordenar los datos. Si el número es par, la mediana se calcula
promediando los dos valores centrales. En condiciones ideales, la media y la mediana
deberían ser idénticas, pero en conjuntos con pocas mediciones, estos valores pueden diferir.
5A.2
La precisión describe cuán consistentes o reproducibles son los resultados de un análisis. En
otras palabras, indica cuánto se repiten los resultados cuando se realizan dos o más
mediciones de la misma muestra bajo las mismas condiciones. Para calcular la precisión de
manera sencilla, se suelen realizar mediciones repetidas en un conjunto de muestras réplica.
Existen tres términos comunes para describir la precisión de los datos en un conjunto de
réplicas: la desviación estándar, la varianza y el coeficiente de variación. Estos términos
miden cuánto se aleja un resultado individual 𝑥𝑖 de la media. Esta diferencia se denomina
desviación de la media 𝑑𝑖 y se calcula con la siguiente fórmula:
𝑑𝑖 = |𝑥𝑖 − 𝑥|
5A.3 Exactitud
La exactitud se refiere a qué tan cercano está un valor medido del valor real o aceptado, y se
expresa mediante el error absoluto o relativo. A diferencia de la precisión, que evalúa la
concordancia entre múltiples mediciones realizadas de la misma forma, la exactitud compara
una medición con un valor aceptado. Mientras la precisión puede determinarse repitiendo
mediciones, la exactitud suele ser más difícil de establecer si no se conoce el valor real, por lo
que se recomienda usar un valor aceptado como referencia.
Error absoluto: El error absoluto (E) es la diferencia entre un valor medido (𝑥𝑖) y el valor
real o aceptado (𝑥𝑡), expresado como 𝐸 = 𝑥𝑖 − 𝑥𝑡 Este error puede ser positivo o negativo,
dependiendo de si el valor medido es mayor o menor que el valor aceptado. Por ejemplo, si el
valor aceptado es 20 ppm, un resultado de 20.2 ppm tiene un error de -0.2 ppm, mientras que
uno de 20.1 ppm tiene un error de +0.1 ppm. El signo indica la dirección del error respecto al
valor real.
Error relativo: El error relativo es más útil que el error absoluto, ya que permite comparar
errores en diferentes magnitudes. Se expresa como porcentaje o en partes por mil (ppt), y se
𝑥𝑖−𝑥𝑡
calcula con la fórmula: 𝐸𝑟 = 𝑥𝑡
𝑥100%
donde 𝑥𝑖 es el valor medido y 𝑥𝑡 el valor real o aceptado. Por ejemplo, si 𝑥𝑖 = 19. 8 y
𝑥𝑡 = 20. 0 el error relativo es:
19.8−20.0
𝐸𝑟 = 20.0
𝑥100% =− 1% 𝑜 − 10𝑝𝑝𝑚
La precisión de una medición se determina fácilmente al comparar datos de experimentos
replicados. Sin embargo, la exactitud es más difícil de estimar, ya que requiere conocer el
valor real, el cual es generalmente el objetivo del análisis. Es posible que un resultado sea
preciso pero no exacto, o exacto pero no preciso. Por ejemplo, en la figura 5.3, se muestran
los errores de cuatro analistas que obtienen diferentes combinaciones de precisión y exactitud
en sus mediciones.
En el análisis químico, existen tres tipos de errores que pueden afectar los resultados. El error
aleatorio o indeterminado provoca dispersión en los datos, lo que afecta la precisión. Esto se
observa cuando los datos de los analistas 1 y 3 muestran menor dispersión en comparación
con los de los analistas 2 y 4, reflejando un menor error aleatorio.
El error sistemático o determinado afecta la exactitud, ya que desplaza todos los resultados en
una dirección específica. Esto genera un sesgo en los resultados, como el error sistemático de
aproximadamente -20.2 ppm de Fe que se muestra en la figura 5.1. Los errores sistemáticos
pueden ser causados por factores constantes que afectan todas las mediciones, como la
pérdida de un analito volátil.
Finalmente, el error bruto o grueso es ocasional y suele ser de gran magnitud. Generalmente
es causado por errores humanos y provoca resultados atípicos, que son valores que se desvían
significativamente de los demás. Aunque en las figuras 5.1 y 5.3 no se observan errores
brutos, se pueden identificar mediante análisis estadísticos para detectar datos atípicos.
5B - ERRORES SISTEMÁTICOS
Tienen un valor definitivo, una causa asignable. Este tipo de errores llevan a sesgos en los
resultados de medición.
5B.1 Fuentes de errores sistemáticos
Hay 3 tipos de errores
Errores instrumentales
Todos los aparatos de medición son víctimas de errores sistemáticos. Por ejemplo, las pipetas,
buretas y matraces aforados, bikers pueden contener y entregar volúmenes un poco distintos
de aquellos indicados por su graduación. Estas diferencias surgen de usar cristalería a una
temperatura significativamente diferente de la temperatura de calibración, por distorsiones en
las paredes de un contenedor debidas al calentamiento mientras se seca una muestra, por
errores en la calibración original y por contaminantes en las superficies internas de los
recipientes. La calibración elimina la mayoría de los errores sistemáticos de este tipo.
Los instrumentos electrónicos también están sujetos a errores sistemáticos; estos pueden
surgir de diferentes fuentes. Por ejemplo, cuando el voltaje de una batería disminuye por el
uso. También pueden ocurrir errores si los instrumentos no se calibran de manera frecuente o
si se calibran en forma incorrecta. Algunos instrumentos son susceptibles al ruido inducido
por las líneas de corriente alterna (ca).
Errores de método
son el resultado del comportamiento físico o químico poco
ideal de un sistema analítico. En el caso de la titulación la exactitud de dicho análisis, por lo
tanto, está limitada por el mismo fenómeno que hace la valoración posible.
Errores personales
Muchas mediciones implican juicios personales que pueden generar errores sistemáticos,
como al estimar posiciones en escalas o detectar cambios de color. Estos errores varían entre
personas debido a diferencias en percepción o reacción, como un sesgo hacia ciertos valores
o una tendencia inconsciente a ajustar resultados hacia lo esperado. Además, el prejuicio o
sesgo numérico influye en las mediciones, ya que algunos prefieren ciertos dígitos. Para
minimizar estos errores personales, se recomienda ajustar los procedimientos analíticos o
automatizarlos.
5B.2 El efecto de los errores sistemáticos sobre los resultados analíticos.
Los errores constantes son independientes del tamaño de la
muestra que está siendo analizada. Los errores proporcionales disminuyen o aumentan en
proporción al tamaño de la muestra.
Errores constantes
El efecto de un error constante se hace mucho más grave conforme el tamaño de la magnitud
medida se hace más pequeño. El efecto de las pérdidas por solubilidad en los resultados
de un análisis gravimétrico, mostrados en el ejemplo 5.2, ejemplifica este comportamiento
Errores proporcionales
Una causa común de errores proporcionales es la presencia de interferencias o contaminantes
en la muestra. Un método común para determinar cobre implica su reacción con yoduro de
potasio, liberando yodo, cuya cantidad es proporcional al cobre presente. Sin embargo, si hay
hierro(III), este también libera yodo, generando una interferencia que causa una
sobreestimación del cobre. Este error es constante y depende de la proporción de hierro
contaminante, no del tamaño de la muestra, ya que al duplicar la muestra, también se
duplican tanto el cobre como el hierro y, por tanto, el yodo liberado.
5B.3 Detección de errores sistemáticos instrumentales y de errores personales.
Los errores sistemáticos instrumentales pueden detectarse y corregirse mediante calibración,
la cual debe hacerse periódicamente porque los instrumentos cambian con el tiempo (por
corrosión, maltrato u obsolescencia). Sin embargo, la calibración no corrige interferencias
químicas, que requieren métodos específicos (ver sección 8D.3).
Los errores personales se reducen con trabajo cuidadoso y disciplina en el laboratorio. Es
importante revisar lecturas, anotaciones y cálculos. También pueden evitarse eligiendo bien el
método analítico o usando procedimientos automatizados.
5B.4 Detección de errores sistemáticos de método
El sesgo en un método analítico es difícil de detectar, pero puede reconocerse y corregirse
mediante ciertos procedimientos.
Análisis de muestras estándar
La mejor forma de estimar el sesgo en un método analítico es mediante el análisis de
materiales de referencia certificados (MRC), que contienen analitos con concentraciones
conocidas.
Los MRC pueden obtenerse de dos formas:
Análisis independientes
Si no hay muestras estándar disponibles, se puede usar un método analítico independiente y
confiable en paralelo con el que se evalúa. Este método debe ser lo más distinto posible para
evitar efectos comunes. Luego, se aplica una prueba estadística (ver sección 7B.2) para
determinar si las diferencias se deben a errores aleatorios o a un sesgo en el método evaluado.
Determinaciones del blanco
Una determinación del blanco es un análisis que usa los mismos reactivos y disolventes que
la muestra, pero sin analito. Se realiza para simular la matriz de la muestra y seguir todos los
pasos del procedimiento. Sirve para corregir errores causados por contaminaciones de
reactivos o recipientes, y también para ajustar los datos en valoraciones, compensando el
volumen de reactivo que cambia el color del indicador.
Variación del tamaño de la muestra
El ejemplo 5.2 muestra que, al aumentar el tamaño de la muestra, el efecto del error constante
disminuye, por lo que este tipo de error puede detectarse fácilmente variando el tamaño de la
muestra.
6A - ERRORES ALEATORIOS
Los errores aleatorios, o indeterminados, nunca son eliminados totalmente y suelen ser la
mayor fuente de incertidumbre en una determinación. Los errores aleatorios son causados por
las variables incontrolables que acompañan a cada medición. Por lo general, los principales
contribuyentes de los errores aleatorios pueden ser identificados positivamente. Incluso si
identificamos las fuentes de errores aleatorios, sería imposible medirlos, debido a que la
mayoría de ellos son tan pequeños que no pueden ser detectados individualmente. El efecto
acumulado de las incertidumbres individuales, sin embargo, causa que las réplicas fluctúan
aleatoriamente alrededor de la media del conjunto.
2. Tabla 6.1 – Posibles combinaciones de cuatro incertidumbres
La tabla 6.1, muestra todas las formas posibles en las que los cuatro errores se pueden
combinar para causar las desviaciones indicadas del valor de la media. Observe que solo una
combinación provoca una desviación de 14 U, cuatro combinaciones causan una
desviación de 12 U y seis causan una desviación de 0 U. Los errores negativos tienen la
misma relación. Esta proporción de 1:4:6:4:1 es una medida de la probabilidad para que
ocurra una desviación de cada magnitud. Si realizamos una cantidad suficientemente grande
de mediciones, podemos esperar una distribución de frecuencia como la mostrada en la figura
6.2a.
Figura 6.2a.
3. Distribución de los resultados experimentales
Al repetir un mismo procedimiento cuantitativo (calibración de una pipeta de 10 mL) 50
veces, las pequeñas variaciones debidas a errores instrumentales, de lectura y de
manipulación muestran un comportamiento que, al representarse en un histograma, adopta la
forma de campana de Gauss. Esto justifica el uso de herramientas estadísticas basadas en la
distribución normal.
Protocolo experimental
• Pesar el matraz limpio con su tapa.
• Transferir 10 mL de agua con la pipeta y volver a pesar.
• Registrar la temperatura para obtener la densidad del agua.
• Calcular el volumen real transferido: V=((m))/((ρ) ).
Las 50 medidas quedaron comprendidas entre 9.969 mL y 9.994 mL, un rango total de 0.025
mL.
El valor medio y la mediana coinciden en 9.982 mL. La desviación estándar (σ ≈ 0.0075 mL)
refleja la dispersión y permite estimar incertidumbres e intervalos de confianza. Más del 50
% de las mediciones se concentran en ±0.004 mL alrededor de la media.
Algunas fuentes de incertidumbre aleatorias en la calibración de una pipeta son: 1) decisiones
basadas en observaciones visuales, como el nivel del agua con respecto a la marca de la
pipeta y nivel de mercurio en un termómetro; 2) variaciones en el tiempo de drenado y ángulo
de la pipeta mientras es drenada; 3) fluctuaciones en la temperatura, las cuales afectan el
volumen de la pipeta, viscosidad del líquido y desempeño de la balanza y 4) vibraciones y
corrientes de aire que causan variaciones en las lecturas de la balanza. Sin duda, hay muchas
otras fuentes de incertidumbre aleatoria en este método de calibración que no hemos
mencionado. Incluso el simple proceso de calibrar una pipeta es afectado por muchas
pequeñas variables incontrolables.
6B - TRATAMIENTO ESTADÍSTICO DE LOS ERRORES ALEATORIOS
El análisis estadístico de los errores aleatorios se basa en el supuesto de que estos siguen una
distribución normal o gaussiana. Aunque algunos datos pueden ajustarse a otras
distribuciones, como la binomial o de Poisson, la distribución gaussiana se utiliza
comúnmente como aproximación, especialmente cuando se tienen más de 30 resultados y no
hay sesgos evidentes.
6B.1
En general, el análisis estadístico se basa sobre el supuesto de que los errores aleatorios en los
resultados analíticos siguen una distribución gaussiana, o [Link] distribución es
simétrica, en forma de campana, y se usa comúnmente para describir la variabilidad de
resultados analí[Link] embargo, no todos los datos siguen una distribución [Link]
distribución binomial ocurre para experimentos con resultados dicotómicos (ej. éxito o fallo)
y la distribución de Poisson: para conteos de eventos raros como fotones o partículas.A pesar
de eso, se suele usar la distribución normal como una aproximación, especialmente cuando se
tienen más de 30 datos y no hay sesgo evidente
.Una población es la colección de todas las mediciones de interés para el experimentador,
mientras que una muestra es un subconjunto de mediciones seleccionadas a partir de la
población En muchos de estos casos que encontramos en química analítica, la población es
conceptual. Considere, por ejemplo, la determinación del contenido de calcio en el suministro
de agua de una comunidad con el objetivo de determinar la dureza del agua. En este ejemplo
la población es el inmenso, casi infinito, número de mediciones que podríamos realizar si
utilizáramos todo el suministro de agua. Cabe aclarar que si toman 4 muestras de agua del
mismo suministro para análisis de calcio, esas 4 mediciones forman una muestra
estadística, aunque provengan de cuatro muestras analíticas diferentes.
6B.2
Las curvas de Gauss son representaciones gráficas que muestran cómo se distribuyen
los errores en un experimento. Estas curvas son simétricas y tienen una forma de campana.
En ellas, el punto más alto de la curva es la media, que es el valor central, y la desviación
estándar indica cuán dispersos o concentrados están los datos alrededor de la media.
Media y desviación estándar
: Media muestral (x̅): Es el promedio de los valores obtenidos en una muestra de datos.
Media poblacional (µ): Es el valor verdadero de la población completa, pero generalmente
no la conocemos, solo la estimamos con la media muestral.
Desviación estándar: Es una medida de qué tanto se desvían los datos de la media. Si los
datos están más agrupados, la desviación estándar es baja; si están dispersos, la desviación
estándar es alta.
Donde N presenta el total de datos.
Áreas bajo la curva: La curva de Gauss tiene áreas bajo ella que indican las probabilidades
de que los datos caigan dentro de ciertos [Link] 68.3% de los datos están dentro de una
desviación estándar de la [Link] 95.4% de los datos están dentro de dos desviaciones
está[Link] 99.7% de los datos están dentro de tres desviaciones estándar.
. La desviación estándar del conjunto de datos, que produce una curva B más ancha, pero de
menor altura, es el doble de la desviación de la curva [Link] lo tanto, la precisión del conjunto
de datos indica que la curva A es dos veces mejor que el conjunto de datos representado por
la curva B.
6B.3 DESVIACIÓN ESTÁNDAR DE LA MUESTRA
Definición:
La desviación estándar de la muestra (s) es una medida estadística de dispersión que
cuantifica qué tan alejados están, en promedio, los valores individuales de una muestra
respecto a su media (x̄). Es uno de los indicadores más importantes de precisión en química
analítica, ya que permite estimar la incertidumbre asociada a los resultados experimentales.
Fórmula General
Donde:
xᵢ = Cada medición individual.
x̄ = Media aritmética de todas las mediciones.
N = Número total de mediciones.
N-1 = Grados de libertad, que corrigen el sesgo al trabajar con una muestra.
Nota del texto: Usar N-1 permite compensar el error que se comete al estimar la media
poblacional con la media muestral, evitando subestimar la verdadera dispersión.
Una expresión alternativa para la desviación estándar muestral
Interpretación Práctica
Valor bajo de s → Datos muy agrupados → Alta precisión.
Valor alto de s → Datos dispersos → Baja precisión.
Se usa para:
- Comparar la precisión entre distintos métodos o lotes de datos.
- Calcular intervalos de confianza.
- Detectar datos atípicos.
- Informar la calidad de resultados en reportes analíticos.
Importancia del número de grados de libertad
El número de grados de libertad indica la cantidad de resultados independientes que se
utilizan en el cálculo de la desviación estándar. Cuando μ no se conoce, dos cantidades deben
ser obtenidas a partir de un conjunto de réplicas de datos: x̄ y s.
Se utiliza un grado de libertad para establecer x̄ porque, con sus signos conservados, la suma
de las desviaciones individuales debe ser cero. Por lo tanto, cuando N - 1 desviaciones han
sido computadas, se conoce la final. En consecuencia, solo N - 1 desviaciones proporcionan
una medida independiente de la precisión del conjunto. El no utilizar N - 1 en el cálculo de la
desviación estándar de muestras pequeñas resulta en valores de s que son menores en
porcentaje que la desviación estándar verdadera s.
Ejemplo 6.1
Error estándar de la media
La desviación estándar de cada media es conocida como error estándar de la media y tiene el símbolo
sm. El error estándar de la media (símbolo: s ) mide la dispersión de las medias de varias muestras
tomadas de una misma población. . Este es inversamente proporcional a la raíz cuadrada del número
de datos N utilizado para calcular la media, como lo explica la ecuación:
Esto indica que, al aumentar el número de mediciones (N), la media se vuelve más precisa.
Sin embargo, mejorar la precisión solo promediando tiene límites, ya que duplicar la
precisión requiere 100 veces más datos. Por eso, es más eficiente reducir la desviación
estándar (s) mejorando el procedimiento o utilizando instrumentos más precisos.
6B.4 Confiabilidad de S como una medida de precisión
En el capítulo 7, se describen varias pruebas estadísticas como la evaluación de hipótesis para
producir intervalos de confianza para los resultados y detectar valores atípicos y rechazarlos.
ya que la mayoría de estas pruebas se basan en la desviación estándar de la muestra (s),la
probabilidad de estas pruebas aumentan conforme se proporcionen resultados correctos
subiendo la confiabilidad de s, que se vuelve más precisa al aumentar el tamaño de la muestra
(N), s se convierte en el mejor estimador de la desviación estándar poblacional (𝝈).
en la ecuación 6.4 se dice que cuando N aumenta s se aproxima mejor a 𝝈.
Entonces, cuando N es mayor que 20, s suele ser un estimador confiable de 𝝈, y ambas
cantidades pueden considerarse prácticamente iguales.
tomamos de ejemplo la tabla 6.2 en 10 subgrupos de 5 cada uno, s varía mucho (0.0023 a
0.0079mL), en cambio, si consideramos 2 subgrupos de 25 valores son casi idénticos (0.054
y 0.0058mL) cercanos al valor global (0.0056mL). esto demuestra que a mayor N menor
variabilidad en s, lo que permite estimar 𝝈 con mayor precisión.
● Combinación de datos para mejorar la confiabilidad de s.
Cuando se tiene varios subconjuntos de datos es más preciso calcular la desviación estándar
de la población al combinar los datos en lugar de usar un solo conjunto. Esto mejora la
estimación de σ. la estimación combinada de s la cual se llama SCOMBINADA, es un ponderado
de las estimaciones individuales.
Para calcular SCOMBINADA, las desviaciones de la media de cada subconjunto se eleva al
cuadrado; se suma todos los cuadrados de las desviaciones, después dividimos entre los
grados de libertad totales:
𝐺𝑟𝑎𝑑𝑜𝑠 𝑑𝑒 𝑙𝑖𝑏𝑒𝑟𝑡𝑎𝑑 = 𝑡𝑜𝑡𝑎𝑙 𝑑𝑒 𝑚𝑒𝑑𝑖𝑐𝑖𝑜𝑛𝑒𝑠(𝑁) − 𝑛ú𝑚𝑒𝑟𝑜 𝑑𝑒 𝑠𝑢𝑏𝑐𝑜𝑛𝑗𝑢𝑛𝑡𝑜𝑠(𝑡)
después se calcula la raíz cuadrada del resultado para obtener SCOMBINADA
6B.5 Varianza y otras medidas de precisión
Aunque la desviación estándar muestral es generalmente utilizada para reportar la precisión
de datos analíticos, frecuentemente encontramos otros métodos o conceptos.
● Varianza(S2)
Es el cuadrado de la desviación estándar. La varianza de la muestra s2 es un estimado de la
varianza poblacional σ2 y está definida por:
● desviación estándar relativa (DER) y coeficiente de variación (CV)
Frecuentemente las desviaciones estándar son dadas en términos relativos antes que
absolutos. Calculamos la desviación estándar relativa al dividir la desviación estándar entre el
valor de la medida del conjunto de datos. La DER es representada a veces como Sr.
𝑆
𝐷𝐸𝑅 = 𝑆r=
𝑋
El resultado es expresado en partes por 1000 (ppt) o en porcentaje al multiplicar esta
proporción por 1000 (ppt) o por 100%
𝑆
➔ 𝐷𝐸𝑅 𝑒𝑛 𝑝𝑝𝑡 = × 1000 𝑝𝑝𝑡
𝑋
La DER multiplicada por 100% es llamada coeficiente de variación (CV)
𝑆
➔ 𝐶𝑉 = 𝐷𝐸𝑅 𝑒𝑛 % = × 100%
𝑋
● Rango (w)
Es otro término que se utiliza para describir la precisión de un conjunto de réplicas de
resultados. Es la diferencia entre los valores mayor y menor del conjunto.