Calculadora de Muestra para Usabilidad Cuantitativa

Calcula el tamaño de tu muestra

Ingresa los parámetros

Usando valores predeterminados

Se han aplicado valores estándar recomendados. Puedes modificarlos según tus necesidades.

Valor actual de la métrica

Mejora esperada

Se calculará automáticamente si se deja vacío

TL;DR

La usabilidad cuantitativa no busca detectar problemas sino medir su magnitud: qué porcentaje de personas completa la tarea, cuánto tardan, cuántos errores cometen. Esta calculadora toma el mayor de dos números: el piso de 40 participantes que recomienda Nielsen Norman Group y el que exige tu propio cálculo de potencia estadística.

¿Cuándo usar esta calculadora?

Usa esta calculadora cuando el objetivo sea medir la usabilidad, no detectar qué falla:

Necesitas una cifra para comparar contra un objetivo o contra una versión anterior (tasa de éxito, tiempo en tarea, errores, SUS)

Vas a reportar el resultado a alguien que decide con números, no con citas de usuarios

Quieres estimar si la diferencia entre dos diseños es real o es ruido

Cuándo no usarla: si lo que necesitas es entender por qué algo falla, un estudio cualitativo con 5 participantes rinde más por menos. Jakob Nielsen lo argumentó en 2000 (Nielsen, 2000) y sigue siendo el punto de partida: 5 usuarios revelan cerca del 85% de los problemas de usabilidad. Lo que no permiten es estimar a cuánta gente le pasa.

Los dos enfoques no compiten. En nuestra experiencia el orden que funciona es cualitativo primero para saber qué medir, cuantitativo después para dimensionarlo.

De dónde sale el mínimo de 40

La calculadora resuelve n = Max(40, ((Za + Zb)^2 * s^2) / d^2) y se queda con el valor mayor.

El piso de 40 viene de Raluca Budiu y Kate Moran (Budiu y Moran, 2021): es el tamaño que sostiene un margen de error del 15% con 95% de confianza en métricas binarias como la tasa de éxito.

Reemplazó a una cifra anterior. Jakob Nielsen había recomendado 20 participantes (Nielsen, 2006), calculados sobre otro supuesto: comparar diseños cuyas diferencias son grandes, no estimar una métrica con precisión. Si encuentras el 20 citado por ahí, no está inventado, está desactualizado.

El cálculo de potencia responde otra pregunta: cuántos participantes necesitas para detectar la mejora que buscas. Za = 1.96 (95% de confianza) y Zb = 0.84 (80% de potencia, el estándar habitual); s es la desviación estándar de tu métrica y d la diferencia que quieres poder detectar.

Si tu métrica varía mucho o la mejora esperada es pequeña, el cálculo supera los 40 y manda él. Si la mejora esperada es grande, manda el piso.

Budiu y Moran también documentan escenarios más baratos: 28 a 30 participantes aceptando 90% de confianza, y 15 a 20 aceptando además un margen del 20%. Esta calculadora no los ofrece porque toma el escenario conservador, pero son alternativas legítimas si el presupuesto no da y asumes el riesgo de forma explícita.

La métrica que elijas cambia la muestra

Cuando no declaras una desviación estándar, la calculadora estima una según la métrica. Estos valores por defecto son un punto de partida, no una medición de tu producto:

Tiempo en tarea: 30% del valor actual. Los tiempos se dispersan mucho porque unos pocos participantes se atascan y estiran la cola.

Tasa de éxito: 20 puntos porcentuales.

Errores: 50% del valor actual. Es la más dispersa de las cuatro y por eso la que más muestra exige.

SUS: 15 puntos sobre la escala de 0 a 100.

La relación es cuadrática: duplicar la desviación estándar cuadruplica la muestra. Por eso, si tienes datos históricos propios, declararlos cambia el resultado más que cualquier otro parámetro.

La pregunta al revés: qué precisión compra tu presupuesto

Casi nadie llega con un margen de error objetivo; llega con un presupuesto. Por eso la calculadora también resuelve la pregunta invertida y muestra, junto al resultado, qué margen de error obtienes con 5, 10, 15, 20, 30 o 40 participantes.

Es el mismo cálculo leído al revés. Con una tasa de éxito del 50%, el peor caso posible, 40 participantes dan un margen de ±14.8 puntos porcentuales: eso es exactamente el ±15% del que hablan Budiu y Moran (2021), y de ahí sale el piso de 40.

La precisión mejora con la raíz de la muestra, no con la muestra. Partir el margen a la mitad exige cuadruplicar los participantes: de 10 a 40, de 20 a 80. Es la razón por la que un estudio cuantitativo caro no siempre entrega un número mucho mejor que uno barato.

Para tasas de éxito usamos el intervalo Wald ajustado, no el de los manuales. Con muestras chicas la fórmula clásica se rompe en los extremos: para 10 de 10 devuelve un intervalo de ancho cero, como si estuvieras seguro de que nadie falla nunca. El ajuste corrige eso (Sauro, 2010).

Para promedios (tiempo, errores, SUS) usamos la distribución t sobre la desviación estándar que declares, o sobre la estimada por defecto si la dejas vacía.

Un contraste honesto sobre los tiempos: Sauro (2010) reporta, con datos de 120 pruebas reales, que 20 participantes suelen quedar cerca de ±20% en tiempos de tarea. Nuestra estimación por defecto (30% del valor actual) produce un margen menor, así que trátala como el extremo optimista y declara tu desviación estándar en cuanto tengas datos propios.

Consideraciones prácticas

40 participantes son 40 sesiones. Moderado uno a uno son entre 20 y 30 horas de sesión, sin contar reclutamiento ni análisis. La mayoría de los estudios cuantitativos de usabilidad se corren no moderados, con herramientas de testing remoto, precisamente por eso.

Si vas a comparar grupos, 40 es por grupo. Dos países, dos segmentos o dos versiones son 80 personas, no 40 repartidas. Es el error de cálculo más común que vemos en briefs de estudios cuantitativos.

Presupuesta el no-show. En estudios no moderados con incentivo, una tasa de abandono del 10% al 20% es habitual: recluta por encima del número que te entrega la calculadora.

En LatAm el cuello de botella suele ser el reclutamiento, no el cálculo. Reunir 40 personas de un perfil específico en un solo país de la región cuesta más tiempo que correr el estudio. Conviene resolver el panel antes de comprometer fechas.

Referencias

  • Budiu, R., y Moran, K. (2021). How Many Participants for Quantitative Usability Studies: A Summary of Sample-Size Recommendations. Nielsen Norman Group. nngroup.com
  • Nielsen, J. (2006). Quantitative Studies: How Many Users to Test? Nielsen Norman Group. nngroup.com
  • Nielsen, J. (2000). Why You Only Need to Test with 5 Users. Nielsen Norman Group. nngroup.com
  • Sauro, J. (2010). A Practical Guide to Measuring Usability: 72 Answers to the Most Common Questions about Quantifying the Usability of Websites and Software. Measuring Usability LLC. ISBN 1453806563.

Recursos Relacionados

Última actualización: