Identificación de sesgos en los ítems: una guía práctica
.
Por: Luciana Salome Chumpitaz Polanco
En la construcción de instrumentos es importante garantizar que los ítems sean interpretados de la misma manera por todos los participantes, sin embargo, algunas veces algunos ítems pueden favorecer o perjudicar a ciertos grupos debido a diferencias culturales, lingüísticas o sociales. Cuando esto ocurre, las respuestas no reflejan únicamente su nivel de habilidad, rasgo o el constructo que se desea medir, sino también diferencias externas que afectan la validez de la medida realizada. A este fenómeno se le conoce como sesgo en los ítems.
De acuerdo con las guías de la International Test Commission (2017), los sesgos pueden surgir por diversas razones, entre ellas el uso de un lenguaje ambiguo, características propias de determinados grupos o supuestos implícitos sobre las experiencias de vida de los participantes. De esta forma, el sesgo no depende necesariamente de la intención del autor, sino de cómo los elementos son interpretados por los distintos grupos de participantes.

Para mitigar este problema han sido descritos dos procesos fundamentales. El primero es la revisión cualitativa del contenido de los ítems antes y después de aplicarlos, mientras que el segundo es un análisis estadístico posterior a la aplicación del test, conocido como Funcionamiento Diferencial del Ítem (DIF, por sus siglas en inglés: Differential Item Functioning), una herramienta estadística que permite identificar si un ítem funciona de manera distinta entre grupos debido a diferencias culturales, sociales o lingüísticas (Zumbo, 1999).
Respecto a la revisión cualitativa, cuando un ítem está escrito con palabras muy técnicas, infrecuentes, o poco conocidas para una población particular, algunos participantes pueden tener dificultades para entenderlo y sus respuestas pueden orientarse debido a problemas en la comprensión de la pregunta y no por la habilidad que se está evaluando. Este tipo de situaciones muestra que, aunque un test parezca adecuado, algunos ítems pueden introducir sesgos que afectan la validez y la interpretación de los resultados (Van de Vijver & Matsumoto, 2011).
Los siguientes ejemplos muestran cómo ciertos elementos podrían generar diferencias en las respuestas que no necesariamente reflejan el constructo que se pretende medir.

En este ítem se puede observar un sesgo lingüístico, ya que la expresión “pan comido” es un modismo que no necesariamente se entiende igual en todos los grupos culturales. Los participantes podrían interpretar el ítem de manera diferente dependiendo al conocimiento que tengan de esta expresión.

El ítem utiliza como contexto cotidiano una situación de uso de una billetera digital para realizar una transferencia de dinero. Sin embargo, la comprensión del problema puede depender de si la persona está familiarizada con estas herramientas digitales, lo cual puede causarle problemas en la resolución del ítem. Por lo tanto, el nivel de habilidad en razonamiento lógico podría verse afectado por estar familiarizado con este tipo de herramientas digitales, más no por una falta de habilidad de razonamiento del participante.

Este ítem se refiere a una festividad específica de ciertos países, principalmente Estados Unidos y Canadá. Para participantes de otras culturas donde esta celebración no forma parte de las tradiciones familiares, el ítem puede resultar poco relevante y difícil de interpretar. Por lo tanto, la respuesta puede depender más de esa familiaridad culturalque de la actitud general hacia la participación en actividades familiares.
En este sentido una revisión cualitativa del contenido de los ítems es fundamental para así lograr identificar posibles fuentes de sesgo relacionadas con aspectos culturales, lingüísticos o contextuales. Si bien, en muchos casos, el Funcionamiento Diferencial del Ítem (DIF) puede indicar la presencia de un sesgo en el instrumento ya aplicado, el procedimiento detecta la diferencia estadística pero no explica su origen, razón por la que el análisis cualitativo resulta fundamental tanto en las fases de diseño de los test, como en fases posteriores. Por este motivo, las guías de la International Test Commission (2017) recomiendan el uso de listas de verificación o check lists para detectar y corregir estos problemas antes de aplicar los instrumentos y realizar análisis psicométricos más avanzados, ya que permite mejorar la calidad de los tests y evitar interpretaciones erróneas de los resultados, por ejemplo, clasificar a un estudiante en un nivel de desempeño que no le corresponde. Así, según Hambleton et al. (2005), los procesos de adaptación y evaluación de pruebas deben incluir revisiones sistemáticas del contenido de los ítems por parte de expertos, quienes analizan posibles problemas relacionados con el lenguaje, la cultura o el contexto social.

¿Cómo identificar posibles sesgos en un ítem con la ayuda de un check list?
En los procesos de adaptación cultural de instrumentos, distintos autores han mencionado que la revisión de ítems debe considerar aspectos lingüísticos, conceptuales y experienciales para garantizar que las preguntas sean interpretadas de manera equivalente entre diversos grupos (ITC, 2017; Muñiz et al., 2013). Con base en estos criterios, el siguiente check list describe tres dimensiones que han de ser analizadas: lenguaje del ítem, contenido cultural y familiaridad con las experiencias.
- Lenguaje del Ítem (Equivalencia Lingüística y Semántica)
El objetivo es garantizar que la redacción no genere barreras de comprensión (Ramada-Rodilla et al., 2013).
- Ausencia de ambigüedad: ¿El ítem está redactado de forma clara y sin palabras ambiguas que puedan generar confusión?
- Simplicidad gramatical: ¿Se eliminaron las dobles negaciones y las estructuras gramaticales complejas que dificulten la comprensión?
- Claridad en las instrucciones: ¿Las instrucciones del ítem son directas y comprensibles para la población objetivo?
- Nivel de dificultad lingüística: ¿El vocabulario utilizado mantiene un nivel de dificultad comparable al de la versión original? ¿El vocabulario y el estilo de redacción es apropiado para el nivel educativo de la población evaluada?
- Adaptación de modismos: ¿Se evitaron modismos, expresiones o metáforas que puedan tener significados diferentes según la región o cultura? ¿Se han sustituido las expresiones originales por equivalentes funcionales en la cultura de destino?
- Contenido Cultural (Equivalencia Conceptual)
Esta dimensión evalúa que el significado del constructo sea culturalmente apropiado y comparable entre grupos. Es importante tener en cuenta que un ítem puede estar bien redactado desde lo lingüístico y aun así presentar sesgos culturales, ya que puede no tener sentido en el contexto cultural de quienes lo responden (ITC, 2017).
Contexto sociocultural: ¿El ítem incluye referencias a prácticas sociales, instituciones o situaciones que no existen o no son comunes en todos los contextos culturales?
3. Familiaridad con las Experiencias (Equivalencia Experiencial)
Esta dimensión busca asegurar que el desempeño en el ítem dependa de la capacidad evaluada y no de la exposición previa a ciertos contextos culturales o sociales. Es decir, las diferencias entre grupos no implican necesariamente sesgo, estas representan un problema cuando la falta de familiaridad influye en el desempeño sin estar relacionada con la habilidad que se evalúa (AERA, APA, y NCME, 2018).
- Oportunidad de aprendizaje: ¿El ítem asume experiencias o conocimientos previos que no todos los participantes han tenido la oportunidad de adquirir? ¿El ítem podría favorecer a personas que han tenido determinadas oportunidades educativas, sociales o tecnológicas?
- Familiaridad con el formato: ¿La población evaluada está familiarizada con el tipo de respuesta solicitado (ej. Escala Likert)?
- Contexto de la vida diaria: ¿Las situaciones descritas en la pregunta son comunes en la realidad del evaluado (ej. evitar analogías sobre climas, deportes o normativas que no existan en su región)?
- Familiaridad con los estímulos: ¿Los nombres de personas, lugares o ejemplos utilizados son familiares para el grupo evaluado?
Diferencias generacionales o sociales: ¿El ítem podría ser más fácil de responder para ciertos grupos (por ejemplo, por edad, nivel educativo o contexto socioeconómico)? ¿El diseño del ítem puede ser comprendido por personas con distintos niveles de exposición cultural o dominio del idioma?
Conclusión
Relevancia del constructo: ¿El contenido del ítem refleja que el concepto evaluado es igualmente relevante para los diferentes grupos culturales?
Sensibilidad y neutralidad: ¿Se ha verificado que el contenido no incluya temas que resulten ofensivos, perturbadores o estigmatizantes para ciertos grupos? ¿El ítem evita referencias culturales que puedan resultar extrañas o inapropiadas para algunos grupos?
Equivalencia de significado: ¿El ítem mide el mismo aspecto del constructo que en la versión original? Según el juicio de expertos, ¿el ítem evoca el mismo proceso mental en ambos grupos culturales?
Valores culturales: ¿El ítem asume valores, normas o creencias que podrían no ser compartidos por todos los grupos culturales evaluados?
Interpretación cultural: ¿Es posible que personas de diferentes contextos culturales interpreten el ítem de manera distinta? ¿Las imágenes, dibujos o gráficos han sido adaptados para que sean reconocibles y culturalmente apropiados para la población evaluada?
La identificación de sesgos en los ítems es un aspecto fundamental en la construcción y adaptación de pruebas. Cuando los ítems incluyen elementos lingüísticos, culturales o experienciales que no son compartidos por todos los grupos evaluados, las diferencias en las respuestas pueden reflejar desigualdades entre ellas y no el constructo que se quiere medir. Por esta razón, es importante que se realice una revisión cualitativa del contenido de los ítems en la fase de desarrollo de tests y antes de aplicar análisis estadísticos complejos.
Por lo tanto, el checklist presentado en este blog busca servir como una herramienta práctica para apoyar la revisión inicial de los ítems durante ese proceso. Este tipo de revisión previa ayuda a mejorar la calidad de los instrumentos, realizar interpretaciones adecuadas de los resultados y promover evaluaciones más justas y comparables entre diferentes grupos de participantes, ya que en conjunto la calidad de un instrumento no depende solo de sus análisis estadísticos, sino también de su pertinencia cultural, lingüística y experiencial.
Referencias
American Educational Research Association, American Psychological Association y National Council on Measurement in Education. (2018). Estándares para Pruebas Educativas y Psicológicas. American Educational Research Association. https://doi.org/10.2307/j.ctvr43hg2
Hambleton, R.K., Merenda, P.F., y Spielberger, C.D., (2005). Adapting Educational and Psychological Tests for Cross-cultural Assessment. Mahwah, NJ: Lawrence Erlbaum
ITC Guidelines for Translating and Adapting Tests (Second Edition). (2017). International Journal of Testing, 18(2), 101–134. https://doi.org/10.1080/15305058.2017.1398166
Muñiz, J., Elosua, P., & Hambleton, R. (2013). Directrices para la traducción y adaptación de los tests: segunda edición. Psicothema, 2(25), 151-157. https://doi.org/10.7334/psicothema2013.24
Ramada-Rodilla, J. M., Serra-Pujadas, C., y Delclós-Clanchet, G. L. (2013). Adaptación cultural y validación de cuestionarios de salud: revisión y recomendaciones metodológicas. Salud Pública de México, 55(1), 57–66. https://doi.org/10.1590/S0036-36342013000100009
Van de Vijver F. J. R., y Matsumoto D. (2011). Introduction to the Methodological Issues Associated with Cross-cultural Research. En D. Matsumoto & F. J. R. van de Vijver (Eds.), Cross-cultural research methods in psychology (pp. 1–14). Cambridge University Press.
Zumbo, B. D. (1999). A Handbook on the Theory and Methods of Differential Item Functioning (DIF): Logistic Regression Modeling as a Unitary Framework for Binary and Likert-Type (Ordinal) Item Scores. Ottawa, ON: Directorate of Human Resources Research and Evaluation, Department of National Defense.

Add Comment