16 Sesgo de confirmación y escepticismo organizado
Traducción literal al castellano del capítulo 16, «Confirmation Bias and Organized Skepticism», de Daniël Lakens, Improving Your Statistical Inferences.
Original: https://lakens.github.io/statistical_inferences/16-confirmationbias.html
Licencia del original: CC-BY-4.0. Traducción no oficial.
No puedo dar a ningún científico, sea cual sea su edad, un consejo mejor que este: la intensidad de la convicción de que una hipótesis es verdadera no tiene ninguna relación con que realmente lo sea. La importancia de la fuerza de nuestra convicción consiste únicamente en proporcionarnos un incentivo proporcionalmente fuerte para averiguar si la hipótesis resiste una evaluación crítica.
Medawar, 1979, Advice to a Young Scientist
Ser científico es una trayectoria profesional gratificante, pero también exigente. Hacer ciencia puede proporcionar la satisfacción intelectual de realizar descubrimientos o aumentar nuestra comprensión de preguntas importantes; la sensación gratificante de contribuir a resolver problemas relevantes para la sociedad; la oportunidad de relacionarse con colegas estimulantes; el reconocimiento de los pares y del público general; e incluso la posibilidad de obtener unos ingresos razonables si uno se convierte en un experto internacionalmente solicitado en su campo. Al mismo tiempo, puede ser una carrera difícil que exige mucho trabajo, incertidumbre sobre el futuro profesional, periodos en los que apenas se logra avanzar en el conocimiento, competitividad o incluso animadversión hacia otros científicos y una sensación de presión por alcanzar determinados objetivos (National Academy of Sciences et al. 2009). Aunque la ciencia es una empresa colectiva, los científicos suelen desarrollar un fuerte compromiso personal con su trabajo. Quieren tener éxito y se sienten decepcionados cuando su investigación no lo consigue.
En su libro Modern Science and the Nature of Life, William Beck (1957) escribe:
Cada paso sucesivo del método científico exige una mayor inversión emocional y hace más difícil mantener la objetividad. Cuando interviene el ego, la autocrítica puede resultar difícil (¿quién ha oído hablar alguna vez de dos científicos luchando por demostrar que el otro tiene razón?). Siempre existe un interés personal en que el resultado sea satisfactorio y, nos guste reconocerlo o no, todos sentimos la presión de triunfar, de abrir «nuevos caminos» quizá antes de haber dominado los antiguos, de seguir siendo productivos y, por tanto, admirados, de embarcarnos obsesivamente en una cruzada romántica hacia una verdad épica. Resulta evidente, por tanto, cómo ciertas tendencias neuróticas latentes pueden interferir con los mandatos limpios del método científico y distorsionarlos, generando errores, valores poco realistas, ansiedad y —reconozcámoslo, puesto que la ciencia se hace a puerta cerrada— deshonestidad. Como los científicos son humanos y la ciencia no lo es, también aquí el fino hilo de la integridad puede llegar a tensarse hasta romperse.
El reconocimiento de que la ciencia es una actividad humana no es nuevo. En 1620 Francis Bacon publicó Novum Organum —o Nuevo método—, una de las primeras descripciones de un método científico moderno, centrada en el empirismo y el razonamiento inductivo. Bacon comprendió hace más de cuatrocientos años que las personas no son observadores pasivos y ofreció una descripción muy temprana de lo que hoy llamaríamos sesgo de confirmación:
El entendimiento humano, una vez que ha adoptado una proposición —ya sea porque se acepta y se cree de manera general o porque resulta agradable—, fuerza todo lo demás para que proporcione nuevo apoyo y confirmación; y aunque puedan existir ejemplos muy numerosos y convincentes en sentido contrario, o bien no los observa, o los desprecia, o se deshace de ellos mediante alguna distinción y los rechaza con un prejuicio violento e injusto antes que sacrificar la autoridad de sus primeras conclusiones. Fue buena la respuesta de aquel a quien, después de mostrarle en un templo las tablillas votivas colgadas por quienes habían escapado de un naufragio, le preguntaron si reconocería entonces el poder de los dioses: «¿Y dónde están los retratos de quienes perecieron a pesar de sus votos?». Toda superstición funciona de manera parecida, ya sea la astrología, los sueños, los presagios, el juicio retributivo o cosas semejantes: los creyentes engañados observan los acontecimientos que se cumplen, pero descuidan y pasan por alto los fracasos, aunque sean mucho más frecuentes. Este mal se introduce todavía con mayor sutileza en la filosofía y en las ciencias, donde una máxima establecida corrompe y gobierna todas las demás circunstancias, aunque estas sean mucho más dignas de confianza. Además, incluso en ausencia de esa precipitación y falta de reflexión, es un error peculiar y permanente del entendimiento humano sentirse más impresionado y excitado por las afirmaciones que por las negaciones, cuando debería ser imparcial; de hecho, para establecer cualquier axioma verdadero, el caso negativo es el más poderoso.
En un artículo clásico sobre el sesgo de confirmación, Nickerson (1998) lo define como la búsqueda o interpretación de la evidencia de maneras que favorecen las creencias, expectativas o hipótesis que ya se mantienen. Los factores humanos que influyen —o sesgan— la generación de conocimiento científico han recibido relativamente poca atención por parte de los filósofos de la ciencia, aunque sería ingenuo creer que los científicos persiguen la verdad de forma completamente objetiva. Como escribe el filósofo de la ciencia Chang (2022):
Existe una tendencia en la filosofía de la ciencia a presentar al científico como un ser fantasmal que simplemente mantiene distintos grados de creencia en varias afirmaciones descriptivas, grados que se ajustan de acuerdo con ciertas reglas del pensamiento racional —por ejemplo, el teorema de Bayes— que eliminan cualquier necesidad de juicio real. Todo aquello que no encaja en esta imagen extraña y empobrecida tendemos a despreciarlo como una cuestión de «mera» psicología o sociología.
El sociólogo de la ciencia Robert Merton (1942) sostenía que «cuatro conjuntos de imperativos institucionales —universalismo, comunismo, desinterés y escepticismo organizado— conforman el ethos de la ciencia moderna». El universalismo significa que «la aceptación o el rechazo de las afirmaciones que entran en el ámbito de la ciencia no debe depender de los atributos personales o sociales de quien las formula». El comunismo significa que «los hallazgos sustantivos de la ciencia son producto de la colaboración social y se asignan a la comunidad». Los científicos no son propietarios de sus teorías: como mucho, reciben reconocimiento por haber desarrollado sus ideas. Como escribe Merton, «el secreto es la antítesis de esta norma; la comunicación plena y abierta es su realización».
El desinterés no se produce necesariamente en el nivel individual —un científico puede tener pasiones y motivaciones—, sino en el institucional. La institución científica adopta el desinterés como norma: las afirmaciones deben ser veraces y no espurias. Según Merton, los científicos están sometidos a una vigilancia rigurosa: son responsables ante sus pares, que comprobarán su trabajo, y solo las afirmaciones suficientemente desinteresadas sobrevivirán a ese escrutinio. Finalmente, el escepticismo organizado consiste en el «escrutinio de las creencias mediante criterios empíricos y lógicos». Las afirmaciones solo se aceptan después de haber sobrevivido al examen de los pares.
Como ocurre con cualquier norma, no todos los individuos suscriben todas estas normas y, lo que es más importante, no siempre se comportan de acuerdo con ellas. Por ejemplo, una norma habitual consiste en decir la verdad cuando hablamos con otras personas. Aunque la aceptemos, puede que nosotros mismos no siempre seamos completamente sinceros, y quizá pensemos que los demás mienten todavía más que nosotros. Este es exactamente el patrón que Anderson y sus colaboradores (2007) observaron en una encuesta entre científicos estadounidenses (véase la Figura 16.1). Los científicos mostraban una elevada adhesión a las normas mertonianas —la puntuación máxima posible era 12—, pero también reconocían no seguirlas siempre en su propia conducta y creían que los demás las seguían todavía menos. Con las contranormas —por ejemplo, el secretismo o el interés personal— aparecía el patrón contrario.
Cuando se les pregunta, los científicos no consideran en absoluto que los miembros de su propia profesión sean completamente objetivos. En una interesante serie de entrevistas con científicos implicados en el alunizaje del programa Apolo, Mitroff (1974) concluyó que «todos y cada uno de los científicos entrevistados en la primera ronda indicaron que consideraban ingenua la idea del científico objetivo y emocionalmente desinteresado». Su artículo está lleno de excelentes citas que ilustran esta conclusión:
Científico B: El científico no implicado y carente de emociones es una ficción tan grande como el científico loco que destruiría el mundo por el conocimiento. La mayoría de los científicos que conozco tienen teorías y buscan datos que las apoyen; no examinan impersonalmente los datos intentando encontrar una teoría que se ajuste a ellos. Hay que distinguir claramente entre no ser objetivo y hacer trampas. Un buen científico no se negará a cambiar su teoría si obtiene una preponderancia de evidencia que no la apoya, pero básicamente intenta defenderla. Sin compromiso emocional no existirían la energía ni el impulso necesarios para seguir adelante, en ocasiones frente a dificultades enormes. Uno no falsifica conscientemente la evidencia en ciencia, pero concede menos prioridad a un dato que va en su contra. Ningún científico respetable hace esto conscientemente, pero sí puede hacerlo de manera subconsciente.
Científico G: Toda idea científica necesita un representante personal que la defienda y la alimente para que no sufra una muerte prematura.
Estas entrevistas revelan que los científicos consideran que el compromiso con una idea o teoría determinada puede ser necesario para mantener la motivación de seguir explorándola cuando aparecen dificultades o para evitar que una idea sea descartada con demasiada facilidad. En otras palabras, el sesgo de confirmación podría incluso desempeñar un papel positivo.
Aunque actualmente existen filósofos de la ciencia que reconocen que la ciencia es un proceso social (Douglas 2009; Longino 1990), la mayoría de quienes estudian los factores humanos en la investigación científica proceden de campos como la psicología de la ciencia, la sociología de la ciencia, los estudios de ciencia y tecnología o la metaciencia. Los investigadores de estas áreas intentan describir las formas en que los científicos son víctimas del sesgo de confirmación, analizar los mecanismos que lo producen y proponer intervenciones para reducir su efecto sobre la ciencia.
Por ejemplo, Mahoney (1979) revisó la literatura relacionada con la descripción habitual de los libros de texto, según la cual los científicos son objetivos, racionales, abiertos de mente, inteligentes, íntegros y comparten el conocimiento de manera abierta y cooperativa, y llegó a las siguientes conclusiones:
- El científico no es inmune a los sesgos perceptivos y con frecuencia reacciona de forma bastante emocional ante cuestiones técnicas y epistemológicas.
- Todavía está por demostrar que los científicos sean más lógicos que quienes no son científicos al realizar e interpretar su trabajo.
- El científico puede mostrarse en ocasiones poco receptivo a datos relevantes y —especialmente en el caso de los teóricos— ser propenso a la especulación precipitada y a una tenacidad dogmática.
- Aunque los científicos suelen tener cocientes intelectuales superiores a los de quienes no son científicos, todavía está por demostrar que pequeñas diferencias intelectuales tengan un impacto sustancial sobre la competencia o la contribución profesional.
- Los informes sobre fabricación de datos y sesgo del experimentador sugieren que estos fenómenos no son ni raros ni triviales.
- Los científicos tienden a ser reservados y desconfiados hasta haber establecido públicamente la prioridad de su trabajo; las disputas por el reconocimiento personal y la prioridad dan lugar con frecuencia a enfrentamientos amargos.
Entonces, ¿por qué parece seguir funcionando la ciencia a pesar de todas estas limitaciones tan humanas? Una manera de entenderla es como un método mediante el cual grupos de personas formulan afirmaciones mientras aplican procedimientos destinados a reducir el papel del sesgo de confirmación. La ciencia es mucho más que un conjunto de reglas para reducir este sesgo, pero muchas prácticas —como la revisión por pares, las replicaciones independientes o la especificación del nivel alfa antes de observar los datos— solo se comprenden plenamente desde esta perspectiva. Algunos científicos consideran que los intentos activos de resistirse al sesgo de confirmación son una característica esencial de la buena ciencia. Como escribió Feynman (1974): «El primer principio es que no debes engañarte a ti mismo, y tú eres la persona más fácil de engañar».
16.1 Sesgo de confirmación en la ciencia
Wason (1960) diseñó una tarea sencilla para estudiar cómo ponen a prueba las personas sus hipótesis. Primero se presenta una serie de tres números. La tarea consiste en formular una hipótesis acerca de la regla subyacente que ha generado esos números. Después se puede poner a prueba esa regla proponiendo una nueva serie de tres números, y se informa a la persona de si la serie cumple o no la regla que debe descubrirse. Probemos. Los tres números son:
2, 4, 8.
Puedes pensar en una regla capaz de generar esta serie. Para ponerla a prueba, debes proponer otros tres números. Detente un momento y piensa qué tres números sugerirías. Supongamos que eliges 3, 6, 12 o 5, 10, 20. Ambas secuencias son compatibles con una regla del tipo «el primer número se duplica y después vuelve a duplicarse». Si hubieras propuesto una de estas series, te habrían dicho que cumple la regla que se intenta descubrir. Sin embargo, si hubieras propuesto 2, 3, 9, también te habrían dicho que cumple la regla. La regla real era simplemente «tres números en orden creciente de magnitud».
Si eres como la mayoría de las personas que realizan la tarea de Wason, probablemente habrás probado una serie que confirmaba la regla que tenías en mente. Que esa regla quede confirmada indica que podría ser correcta, pero muchas otras reglas también podrían serlo. En cambio, probar una serie que predices que no cumplirá la regla y descubrir que sí la cumple puede demostrar con certeza que tu regla inicial era incorrecta. Por ejemplo, si tu hipótesis fuera «cada número duplica al anterior», podrías intentar 1, 2, 3 esperando que no cumpliera la regla. Si descubres que sí la cumple, tu hipótesis queda descartada. Confirmar y falsar predicciones son actividades importantes, pero las personas parecen, en general, menos inclinadas a intentar demostrar que se equivocan. Conocer este rasgo de la psicología humana resulta útil porque permite desarrollar métodos y procedimientos que contrarresten los efectos negativos de nuestra inclinación a confirmar nuestras propias hipótesis.
En su artículo «Pathological Science», Langmuir (1989) analiza dos ejemplos de sesgo de confirmación en física. El primero es el efecto Davis-Barnes, que describía un comportamiento inesperado de partículas alfa al interactuar con electrones en un campo magnético. El segundo son los rayos N, una hipotética forma de radiación inspirada por el descubrimiento de los rayos X, descrita por el físico francés Blondlot en 1903 y confirmada inicialmente por otros físicos. En ambos casos, el escepticismo respecto a los hallazgos iniciales llevó a otros científicos a inspeccionar presencialmente los experimentos, concluyendo que los resultados se debían a errores del observador. Como escribió Langmuir, se trataba de casos sin deshonestidad, pero en los que las personas llegaban a resultados falsos porque no comprendían hasta qué punto los efectos subjetivos, el pensamiento desiderativo o las interacciones cercanas al umbral perceptivo podían inducirlas a error.
También existen casos en los que sí interviene la deshonestidad. A veces los científicos cometen fraude y fabrican datos, aunque no siempre es sencillo trazar la frontera entre el sesgo intencional y el no intencional. Un caso famoso es el del genetista Gregor Mendel y sus estudios sobre la herencia en plantas de guisante. Reanálisis posteriores realizados por Ronald Fisher revelaron que los resultados eran inverosímilmente próximos a los valores predichos (Fisher 1936). Aunque existe acuerdo en que los resultados son estadísticamente improbables, resulta difícil identificar la causa. La anomalía podría deberse a una descripción incorrecta de ciertos detalles del experimento, a errores de clasificación o incluso a que algún ayudante sintiera presión para comunicar resultados acordes con las expectativas (Radick 2022). Una razón para adoptar prácticas de ciencia abierta es precisamente que una mayor transparencia permita a la comunidad comprender mejor qué ocurrió cuando surgen dudas sobre la validez de unos resultados.
No solo los científicos fabrican datos; también lo hacen los estudiantes. En un artículo extraordinariamente interesante que documentaba intentos de realizar una replicación como tarea de clase, Azrin y sus colaboradores (1961) observaron que muchos estudiantes fabricaban todos o parte de los datos porque seguir el procedimiento experimental resultaba demasiado difícil. En uno de los experimentos de clase, solo un estudiante comunicó que estaba teniendo problemas para realizar correctamente el procedimiento. Más tarde, cuando los estudiantes comentaron el experimento y ese estudiante reconoció que lo había intentado seis veces, había fracasado y finalmente se había rendido, otros ocho admitieron de repente que también habían tenido problemas y que se habían apartado considerablemente de las instrucciones. Peor aún, en otra tarea de clase que replicaba el mismo estudio, cuando un estudiante preguntaba a otro «Estoy teniendo problemas con mi experimento; ¿puedes decirme cómo hiciste el tuyo?», 12 de los 19 estudiantes a quienes se planteó la pregunta admitieron sin demasiada resistencia que habían fabricado datos.
Podemos imaginar muchas razones por las que un estudiante podría fabricar datos: no querer reconocer que ha sido incapaz de seguir correctamente las instrucciones y sentirse torpe, o sencillamente evitar realizar el trabajo real. En una asignatura que impartí hace muchos años con un colega también descubrimos que algunos estudiantes fabricaban datos. Les habíamos pedido que recogieran respuestas a una breve encuesta de diez amigos o familiares para disponer de datos reales que analizar durante el curso. No nos habíamos dado cuenta de que la encuesta que los propios estudiantes habían construido había acabado siendo bastante más larga de lo previsto, ni de que a muchos les resultaba incómodo pedir ese favor a diez personas. Ningún estudiante nos dijo que estuviera teniendo dificultades: varios simplemente fabricaron encuestas hasta poder entregar diez respuestas. Como profesores, evidentemente habíamos planteado una tarea poco razonable. Si algún estudiante nos hubiera explicado honestamente el problema, habríamos modificado la actividad —como hicimos al año siguiente—.
El código de conducta sobre integridad de la investigación se aplica tanto al personal como al alumnado. Si alguna vez sientes presión y estás considerando vulnerar ese código —por ejemplo, fabricando datos—, no lo hagas. Explica el problema a un profesor o, si te resulta más cómodo, a un asesor confidencial.
Como vimos al hablar de prácticas de investigación cuestionables, los investigadores pueden utilizar de forma oportunista la flexibilidad de sus métodos para aumentar la probabilidad de encontrar apoyo a sus hipótesis. A menudo no está claro hasta qué punto son conscientes de lo problemático que resulta este comportamiento y, por tanto, es difícil decidir cuándo se trata simplemente de deshonestidad y cuándo de sesgo provocado por una comprensión insuficiente. Estas prácticas se conocen desde hace mucho tiempo. Kish (1959) ya describía entre los usos incorrectos de las pruebas estadísticas la «caza con escopeta» de diferencias significativas: un investigador con buen ojo que examinara los resultados de mil lanzamientos aleatorios de monedas perfectas encontraría y mostraría aproximadamente cincuenta resultados «significativos» con p = .05; el problema, señalaba, quizá se hubiera vuelto más agudo con los ordenadores de alta velocidad capaces de realizar cientos de contrastes de significación.
Barber (1976) recuerda que «puesto que los experimentos son diseñados y realizados por individuos falibles, presentan tantas trampas como cualquier otra actividad humana» y ofrece una extensa descripción de las maneras en que los investigadores pueden sesgar sus conclusiones. Enumera muchas formas de influir sobre los resultados, tanto como experimentador —por ejemplo, tratando de manera ligeramente distinta a las personas de la condición experimental y de la condición de control— como como investigador —por ejemplo, analizando los datos de múltiples maneras hasta encontrar un resultado significativo—. Estas preocupaciones solo recibieron una atención generalizada en psicología al inicio de la crisis de replicación, por ejemplo con el artículo «False-Positive Psychology: Undisclosed Flexibility in Data Collection and Analysis Allows Presenting Anything as Significant» (Simmons et al. 2011).
Un último mecanismo mediante el cual opera el sesgo de confirmación es el sesgo de citación, por el que los autores citan selectivamente investigaciones que respaldan las afirmaciones que desean realizar e ignoran evidencia en sentido contrario. Las citas cumplen una función importante en ciencia. En las introducciones de los artículos ofrecen una panorámica del conocimiento existente y justifican la investigación realizada. También reconocen el trabajo de científicos cuyas investigaciones han resultado útiles, y el número de citas recibidas suele utilizarse, al menos en parte, como indicador de la excelencia de la investigación. Por ello es importante citar los artículos que merecen ser citados. Sin embargo, los autores seleccionan con frecuencia la literatura de manera sesgada (Duyx et al. 2017).
Por ejemplo, los resultados estadísticamente significativos tienen más probabilidades de ser citados que los no significativos, lo que amplifica aún más el efecto del sesgo de publicación. Los investigadores pueden evitar citar críticas a su trabajo, a las medidas que utilizan o a sus procedimientos estadísticos para reducir la posibilidad de que los revisores identifiquen posibles debilidades. Además, pueden existir motivos no científicos para citar unos artículos y no otros. Los científicos necesitan en ocasiones citar sus trabajos anteriores, pero también muestran una tendencia a autocitarse incluso cuando esas citas no son las más relevantes. Pueden preferir citar el trabajo de amigos o miembros de su propio grupo y evitar citar a investigadores hacia quienes sienten animadversión o que pertenecen a un grupo externo.
La literatura científica sobre el efecto Hawthorne ofrece un buen ejemplo de sesgo de citación. En varios estudios realizados en la planta eléctrica Hawthorne Works se investigó si distintas condiciones de iluminación influían sobre la productividad. El efecto Hawthorne suele describirse como un aumento general de la productividad cuando los trabajadores saben que están siendo estudiados, independientemente de las condiciones experimentales. Esta interpretación ha sido ampliamente criticada, pero los investigadores citan predominantemente interpretaciones favorables e ignoran las críticas (Letrud y Hernes 2019). Otro ejemplo famoso es una breve carta publicada en New England Journal of Medicine que afirmaba que la adicción era rara entre pacientes tratados con narcóticos. La carta fue citada masivamente como evidencia de la seguridad de los opioides, algo que se considera que contribuyó a la actual crisis de opioides en Norteamérica (Leung et al. 2017).
El sesgo de citación puede reducirse leyendo siempre la literatura que se cita —una recomendación sorprendentemente trivial pero, por desgracia, necesaria, y cada vez más importante ahora que existen herramientas de IA capaces de generar referencias falsas— y buscando la literatura de forma sistemática, en lugar de confiar únicamente en los artículos más citados de la primera página de Google Scholar.
El sesgo de citación también puede utilizarse deliberadamente para hacer que un artículo resulte más convincente. Corneille et al. (Corneille et al. 2023) describen este recurso junto con otras técnicas que los científicos pueden emplear para que sus afirmaciones parezcan más sólidas de lo que realmente son. Detectarlas suele requerir bastante conocimiento del área: citar trabajos débiles o conocidos por ser incorrectos, formular afirmaciones sin respaldo empírico, generalizar mucho más allá de la evidencia disponible, citar selectivamente otros trabajos o fuera de contexto, o minimizar las limitaciones de un estudio. A medida que desarrolles experiencia como científico aprenderás a reconocer estas estrategias, pero suelen resultar más difíciles de detectar para investigadores con menor experiencia. Los científicos pueden sentirse motivados para presentar sus afirmaciones como más novedosas o convincentes porque esto facilita publicar en revistas más prestigiosas, algo beneficioso para su carrera.
16.2 Escepticismo organizado
A estas alturas está claro que existe el riesgo de que los científicos permitan que sus sesgos influyan sobre las afirmaciones que realizan. Siguiendo la idea de escepticismo organizado de Merton (1942), existen diversas prácticas científicas cuyo objetivo consiste, en la medida de lo posible, en contrarrestar esos sesgos permitiendo que las afirmaciones sean sometidas a escrutinio crítico.
16.2.1 Control de errores
Cuando William Gosset —conocido también como Student, por la prueba t de Student— escribió un documento interno para la fábrica Guinness explicando la utilidad de las probabilidades de error para «permitirnos juzgar el número y la naturaleza de los nuevos experimentos necesarios para establecer o refutar las distintas hipótesis que estamos considerando», ya reconoció que resultaba útil especificar de manera objetiva la tasa de error con la que se extraerían conclusiones. Señalaba que dejar el rechazo de los experimentos enteramente a discreción del experimentador era peligroso porque este podía estar sesgado, y que por ello se había propuesto adoptar un criterio basado en la probabilidad de que apareciera un error tan grande en un determinado número de observaciones.
El bioestadístico Irwin Bross (1971) plantea una idea similar: dado que las convenciones lingüísticas suelen utilizar números redondos, resulta natural emplear un valor como el 5 %. Estos números redondos evitan sugerir que el valor crítico se ha manipulado o escogido específicamente para demostrar una determinada afirmación. En resumen, si se permite que los investigadores establezcan el nivel alfa después de observar los datos, existe la posibilidad de que intervenga el sesgo de confirmación —o incluso estrategias deliberadas para evitar una falsación— (Uygun Tunç et al. 2023). Utilizar un nivel alfa fijo —5 % en muchos campos— constituye, por tanto, un ejemplo de escepticismo organizado. Las afirmaciones deben superar un criterio que controla las conclusiones erróneas antes de ser tomadas en serio.
16.2.2 Prerregistro
En el capítulo dedicado a los «efectos del investigador sobre el análisis de datos», Barber (1976) presenta como una de las principales trampas la elección de la hipótesis después de observar los datos. El problema aparece cuando los investigadores recogen una gran cantidad de información sin haber planificado previamente cómo la analizarán y deciden qué análisis realizar después de haber «echado un vistazo» a los resultados. Un investigador puede fijar el nivel alfa antes de ver los datos, pero eso no basta para controlar las conclusiones erróneas si después escoge qué contraste realizar tras identificar patrones interesantes.
La solución a este problema es el prerregistro de un plan de análisis. De nuevo, el prerregistro constituye una forma de escepticismo organizado. No se confía simplemente en que los investigadores informen sin sesgo de qué análisis habían planeado. En su lugar, se les pide utilizar un método de contraste de hipótesis que permita a sus pares comprobar si los análisis se planificaron realmente antes de acceder a los datos. Es perfectamente posible que una desviación respecto al plan de análisis resista el escrutinio de los pares (Lakens 2019), pero debe permitirse que otros evalúen de manera transparente si los contrastes no fueron seleccionados oportunistamente. Cuando en un campo se espera que los investigadores prerregistren sus estudios —como sucede en los ensayos clínicos—, el prerregistro constituye una implementación institucional del escepticismo organizado. El tema se explica con más detalle en el capítulo sobre prerregistro y transparencia.
16.2.3 Estudios de replicación independientes
Después de realizar un estudio y alcanzar una conclusión, una nueva oportunidad para someter la afirmación a escrutinio aparece cuando otros investigadores intentan replicar de manera independiente el hallazgo. Como escribe Neher (1967), los investigadores individuales no siempre reconocen características sutiles pero cruciales de su muestra o de su estudio, errores mecánicos de registro y cálculo o errores derivados de su propia influencia y sus sesgos. La replicación independiente permite explorar hasta qué punto estas características produjeron el efecto observado. La utilidad de la replicación independiente en psicología fue señalada hace décadas por Mack (1951) y Lubin (1957), y resulta igualmente importante en otros campos, como la física de partículas (Junk y Lyons 2020).
Si otros investigadores pueden replicar de forma independiente un hallazgo, disminuye la probabilidad de que la afirmación original dependa de características sutiles del primer estudio. También se vuelve menos probable que el estudio original estuviera afectado por problemas más graves, como fraude o una tasa de error de tipo I inflada por la flexibilidad analítica. Sin embargo, una replicación independiente exitosa no elimina por completo estas preocupaciones. Como advierte Bakan (1967), un investigador que intenta replicar el estudio de otro debe considerar cuidadosamente la posibilidad de sugestión o su disposición a aceptar los resultados del investigador anterior —especialmente si este goza de prestigio—, así como las posibles motivaciones para demostrar que estaba equivocado.
Siempre es posible que los investigadores implicados en la replicación compartan los mismos sesgos sistemáticos o que también hayan observado, por azar, un error de tipo I. No obstante, con cada replicación independiente exitosa estas preocupaciones se vuelven menos plausibles. Una replicación fallida resulta más difícil de interpretar. Quien la realiza podría estar motivado para estropear el experimento porque desea obtener un resultado no significativo, o podrían existir diferencias reales entre ambos estudios que requieran investigaciones posteriores. Aun así, las replicaciones independientes fallidas plantean dudas sobre la generalización de las afirmaciones y, si varios grupos fracasan al intentar replicar de manera independiente un estudio, existe un motivo real de preocupación. Este tema se desarrolla en el capítulo sobre estudios de replicación.
16.2.4 Revisión por pares
El ejemplo prototípico de escepticismo organizado en ciencia es la revisión por pares. Como escribe la filósofa de la ciencia Helen Longino (1990), la crítica procedente de puntos de vista alternativos es necesaria para la objetividad, y someter las hipótesis y el razonamiento basado en la evidencia a escrutinio crítico es precisamente lo que limita la intrusión de las preferencias subjetivas individuales en el conocimiento científico. La revisión por pares suele señalarse como la vía estándar para ejercer esa crítica.
Recibir críticas resulta a menudo emocionalmente difícil, y obtener revisiones negativas no es una experiencia agradable. Sorprendentemente, no solemos enseñar a los investigadores jóvenes cómo enfrentarse a la crítica. Cuando otras personas enumeran todo aquello que consideran incorrecto en un trabajo al que alguien ha dedicado meses o incluso años, simplemente esperamos que aprenda a manejar las emociones asociadas. Es lógico sentirse mal ante una crítica fuerte, especialmente cuando parece injusta o excesivamente dura. Con el tiempo, la mayoría —aunque no todos— los investigadores aprenden a separar en cierta medida la evaluación de su trabajo de la evaluación de sí mismos. Intenta no tomarte las críticas como algo personal. Forman parte del escepticismo organizado. Haz tu mejor trabajo y utiliza las críticas válidas para mejorarlo siempre que sea posible.
El proceso de revisión por pares funciona aproximadamente así. Cuando un científico ha escrito un manuscrito, lo envía a la revista científica que elige. Un editor comprueba primero si el trabajo puede interesar a sus lectores y si parece tener una calidad suficiente. Si es así, lo envía a revisión. Se invita por correo electrónico a científicos con experiencia en el tema para que evalúen el manuscrito. Los editores suelen intentar conseguir al menos dos revisores, aunque a veces solicitan más. Los revisores reciben acceso al manuscrito, pero normalmente no pueden compartirlo con otras personas; en la mayoría de los casos, el proceso es confidencial. Realizan su revisión gratuitamente como parte de su trabajo científico y suelen disponer de varias semanas. Después, el editor lee los informes y decide si rechaza el manuscrito, lo acepta o solicita una revisión. En este último caso, los autores responden a las críticas y sugerencias y vuelven a enviar el trabajo. En ocasiones son necesarias varias rondas antes de la aceptación.
La revisión por pares suele ser anónima. Los nombres de los revisores no son conocidos por los autores y, habitualmente, solo el editor conoce su identidad. Los investigadores afirman que serían menos proclives a revisar para una revista si su identidad se hiciera pública y señalan anecdóticamente que firmar las revisiones dificultaría ser completamente sincero cuando consideran que un manuscrito tiene poca calidad (Mulligan et al. 2013). Una encuesta posterior encontró que el 50,8 % de casi 3000 científicos creía que revelar la identidad de los revisores empeoraría la revisión por pares (Ross-Hellauer et al. 2017). Casi dos tercios pensaban que los revisores serían menos proclives a formular críticas contundentes si los autores conocieran su identidad.
El anonimato tiene ventajas, pero también inconvenientes. Como señaló Longino, la confidencialidad y privacidad pueden convertir la revisión en un vehículo para consolidar posiciones establecidas. Los revisores pueden intentar impedir que entren en la literatura científica determinados hallazgos, como fracasos al replicar su propio trabajo o resultados que falsan predicciones de teorías que ellos mismos han propuesto. Entre los científicos existe incluso la broma recurrente del «Revisor 2»: el revisor que siempre parece extraordinariamente crítico con tu manuscrito, hasta el punto de ser descortés y recomendar el rechazo por argumentos débiles. No existe evidencia empírica de que el segundo revisor sea realmente más negativo en general, pero las malas experiencias con la revisión por pares han dado incluso lugar al grupo de Facebook «Reviewer 2 Must Be Stopped».
Puesto que la revisión por pares desempeña un papel central en la publicación de los manuscritos científicos, existe mucha crítica sobre su funcionamiento, preocupación por su calidad, intentos de falsificarla —por ejemplo, alianzas entre investigadores que revisan sus propios artículos (Ferguson et al. 2014)— y numerosos experimentos destinados a mejorarla. Entre las innovaciones recientes se encuentran la revisión abierta, en la que el contenido de los informes se hace público, y las revisiones firmadas, en las que los revisores revelan sus nombres.
Después de una revisión por pares de alta calidad, un artículo debería haber sido examinado cuidadosamente y no contener errores ni afirmaciones incorrectas. Pero también es posible que la revisión sea de baja calidad y que el manuscrito conserve fallos. La revisión por pares solo es tan buena como los pares que la realizan. Si ninguno de los revisores tiene una formación sólida en estadística, por ejemplo, un manuscrito puede contener inferencias estadísticas incorrectas. Además, las crecientes exigencias de tiempo al personal académico pueden hacer cada vez más difícil encontrar buenos revisores disponibles o provocar que estos dediquen poco tiempo a comprobar cuidadosamente el trabajo. Aunque esto está cambiando lentamente con el auge de la ciencia abierta (Vazire 2017), los revisores tampoco suelen disponer de los materiales, los datos y los scripts de análisis y deben confiar en que esas partes del proceso se hayan realizado de manera competente, algo que no siempre ocurre. Por todas estas razones, aunque una buena revisión por pares desempeña un papel importante en ciencia, no debemos asumir que todos los artículos revisados por pares están libres de errores o de afirmaciones incorrectas.
La revisión por pares suele producirse cuando un estudio se envía para su publicación, pero también puede realizarse después de que haya sido publicado. Esto se conoce como revisión por pares pospublicación y ocurre, por ejemplo, en plataformas como PubPeer. A los científicos no siempre les agrada que su trabajo sea sometido a escrutinio adicional, pero esta revisión posterior ha revelado en muchas ocasiones fallos que los revisores originales no detectaron y debe considerarse una herramienta adicional valiosa para facilitar el escepticismo organizado.
16.2.5 Doble comprobación de errores
Como escribe Friedlander (1964), «los errores en investigación ocurren. Su prevalencia debería contemplarse con alarma y no con aceptación pasiva como un acompañante inevitable de la investigación realizada por seres humanos». Friedlander se utiliza a sí mismo como ejemplo de un investigador que cometió un error. Calculó coeficientes de fiabilidad en un análisis factorial y obtuvo valores sorprendente y preocupantemente bajos. Repitió el cálculo y encontró una fiabilidad mayor. Él mismo reconoció que una combinación de disgusto y desconfianza ante los primeros resultados, junto con su fuerte compromiso con un estudio casi terminado, le llevó a repetir el cálculo con más cuidado, y fue «recompensado» con coeficientes superiores a .70. Una repetición adicional mantuvo esos valores. Si los coeficientes iniciales no le hubieran desagradado y sorprendido, dudaba que hubiera repetido los cálculos: habría cometido un error de tipo II.
Rosenthal (1966) revisó varios estudios en los que los investigadores cometían errores al registrar las respuestas de los participantes y esos errores tendían a favorecer sus hipótesis. En resumen, los errores ocurren y es más probable que se detecten —o que se revisen— cuando los resultados van en contra de lo esperado.
Todos cometemos errores, y quizá no los busquemos con el mismo empeño cuando observamos resultados en la dirección predicha. Una forma de evitar esta doble comprobación sesgada consiste en revisar todos los análisis que realizamos. Wicherts (2011), por ejemplo, describe un modelo de «copiloto» en el que los colegas comparten los datos y comprueban mutuamente sus análisis para evitar errores embarazosos. Strand (2023) plantea una idea similar: si partimos del supuesto de que los errores se producirán incluso cuando las personas intenten evitarlos, debemos diseñar métodos para revisar nuestro trabajo y detectarlos. Convertir la doble comprobación en un hábito dentro de una colaboración funciona como una capa de protección en el modelo del «queso suizo» de Reason. Aplicar estas comprobaciones en todos los proyectos también reduce la sensación de que revisar el trabajo de alguien implica desconfiar de esa persona: simplemente pasa a formar parte del funcionamiento normal del grupo. Otros instrumentos, como los manuscritos computacionalmente reproducibles, también reducen errores, por ejemplo los derivados de copiar y pegar resultados (Rouder et al. 2019; Strand 2023).
16.2.6 El abogado del diablo
El abogado del diablo es una persona que adopta explícitamente el papel del escéptico y argumenta contra la posición aceptada o deseada, independientemente de que personalmente crea o no en esos argumentos. La práctica tiene su origen en la Iglesia católica, donde se utilizaba en los procesos para declarar santo a alguien: el advocatus diaboli argumentaba contra la canonización del candidato y se oponía al «abogado de Dios» (advocatus Dei).
La idea de asignar a una persona del grupo el papel explícito de abogado del diablo parte de que, en general, a las personas no les gusta criticar porque temen consecuencias negativas en sus relaciones. Esta es también una de las razones por las que la revisión por pares suele ser anónima. Cuando un grupo toma decisiones, nadie es anónimo. Al asignar a una persona la función de abogado del diablo, se garantiza al menos que alguien planteará activamente críticas y, al mismo tiempo, se la protege de parte de las consecuencias interpersonales porque criticar constituye precisamente su tarea. Otros beneficios son que esta figura promueve la diversidad de puntos de vista y contrarresta la presión hacia la conformidad.
Naturalmente, el abogado del diablo debe ser escuchado y su papel no puede ser meramente ceremonial —acusación que Christopher Hitchens formuló después de ser entrevistado por el Vaticano como abogado del diablo durante el proceso de beatificación de Madre Teresa—. No debería ser posible afirmar que un proceso de decisión utilizó un abogado del diablo cuando después se ignoraron todas sus objeciones, simplemente para aparentar que se habían tomado medidas contra el sesgo. La transparencia sobre las críticas planteadas y la forma en que fueron respondidas puede ayudar. Otro problema es que el abogado del diablo necesita conocimientos suficientes para formular buenos contraargumentos. La investigación sugiere que un disenso minoritario auténtico —es decir, incluir a personas que realmente mantienen opiniones diferentes de la mayoría— puede producir decisiones de mayor calidad que un abogado del diablo asignado artificialmente (Nemeth et al. 2001).
16.2.7 Colaboraciones adversariales
Una manera de garantizar que exista suficiente conocimiento especializado a ambos lados de un debate consiste en organizar una colaboración entre científicos que discrepan (Rosenthal 1966). Rosenthal proponía que, cuando dos o más científicos competentes discrepan sobre una cuestión teórica o empírica suficientemente importante, podrían coordinar sus esfuerzos de forma más eficiente. En la fase de diseño, los oponentes pueden colaborar para construir un plan de investigación que ambos acepten como capaz de resolver la discrepancia. También pueden colaborar durante la recogida de datos, directamente o mediante ayudantes proporcionados por ambas partes.
Cuando los dos grupos tienen resultados preferidos distintos —por ejemplo, predicciones teóricas opuestas—, los proyectos en los que ambas partes trabajan juntas para resolver empíricamente su desacuerdo se denominan colaboraciones adversariales (Mellers et al. 2001). Un excelente ejemplo fue la gran colaboración internacional organizada por Coles et al. (Coles et al. 2022) para diseñar y realizar un experimento que pusiera a prueba de la mejor manera posible las discrepancias entre especialistas respecto a la hipótesis de la retroalimentación facial.
Para que una colaboración adversarial tenga éxito, los investigadores deben ser capaces de diseñar un experimento que diferencie entre las teorías siguiendo los principios de la inferencia fuerte (Platt 1964). Esto no siempre es posible. Además, pueden existir numerosas hipótesis auxiliares que deban comprobarse antes de realizar cualquier prueba crítica de las distintas teorías. Finalmente, los participantes podrían intentar proteger su teoría frente a una posible falsación, por ejemplo manteniendo una ambigüedad estratégica sobre qué resultados predice realmente y cuáles no (Frankenhuis et al. 2022). A pesar de estas dificultades, las colaboraciones adversariales ofrecen una vía prometedora para resolver debates de larga duración en los que se ha avanzado relativamente poco.
Además de nuevos estudios empíricos, puede ser útil escribir revisiones colaborativas con equipos grandes de investigadores que representen puntos de vista diferentes. Desde el año 2000 la revista Psychological Science in the Public Interest tiene como uno de sus principales objetivos publicar este tipo de revisiones (Ceci y Bjork 2000). Se selecciona cuidadosamente un equipo de especialistas de primera línea que represente distintas posiciones y se le pide elaborar una revisión equilibrada del estado del conocimiento sobre un tema concreto. Incluso este tipo de revisiones puede conservar una naturaleza adversarial (Crusius et al. 2020).
16.2.8 Ciencia con equipos rojos
En igualdad de condiciones, deberíamos confiar más en estudios y teorías que han sido evaluados de manera más crítica. Cuanto más expuesto haya estado un producto científico a procesos específicamente diseñados para detectar fallos, mayor será la confianza que podremos depositar en él (Mayo 1996). Sin embargo, existen barreras para adoptar enfoques críticos. Los investigadores son vulnerables a sesgos como el de confirmación y pueden obtener ventajas competitivas en empleos, financiación o promociones si sacrifican rigor para producir una mayor cantidad de investigación. Incluso cuando son suficientemente transparentes para que otros examinen críticamente sus materiales, código e ideas, existen pocos incentivos para que alguien —incluidos los revisores— dedique tiempo a hacerlo. Solo podemos confiar en los hallazgos de un campo si existen mecanismos de autocorrección que garanticen una evaluación crítica capaz de identificar y corregir conclusiones erróneas (Vazire y Holcombe 2022).
Encontrar maneras de demostrar que nos equivocamos es un ideal científico, pero rara vez constituye la práctica habitual. La apertura a la crítica está mucho menos extendida de lo que a los investigadores les gusta pensar. Pocas veces se establecen procedimientos para recibir y responder activamente a las objeciones. La mayoría de los mecanismos formales están vinculados a la revisión por pares, que suele producirse después de terminar la investigación y redactar el manuscrito, aunque probablemente sea más beneficioso recibir comentarios de colegas antes de recoger los datos (Lakens 2023).
En ciencia, un equipo rojo (red team) puede consistir en un grupo diverso de críticos científicos que examina un proyecto desde todos los ángulos y actúa explícitamente para contrarrestar los sesgos de los autores originales con el objetivo de mejorar el producto final. En la industria del software, los equipos rojos se utilizan para localizar vulnerabilidades de seguridad antes de que puedan ser descubiertas y explotadas por actores maliciosos (Zenko 2015). De forma análoga, los equipos científicos pueden trabajar con un equipo rojo en cada fase de un proyecto e incorporar sus críticas (Lakens 2020). La lógica se parece a la de los Informes Registrados, donde los protocolos se revisan antes de conocer los resultados, salvo que aquí la crítica no la organiza una revista o un editor, sino la propia colaboración.
Idealmente, la comunicación entre el equipo investigador y el equipo rojo puede ser más abundante y rápida que la revisión por pares convencional, produciendo preprints y manuscritos de mayor calidad. Sus integrantes pueden elegirse por sus competencias específicas —por ejemplo, un experto en contenido, otro en estadística, otro en medición—, reuniendo una diversidad y experiencia superiores a las que habitualmente es posible obtener con la revisión por pares. Los equipos rojos pueden resultar especialmente útiles en proyectos muy sensibles o muy costosos. Todavía se utilizan poco en ciencia, pero ya se están dando los primeros pasos para estudiar su utilidad.
16.2.9 Cegamiento
Aquella información que los investigadores no conocen tampoco puede sesgarlos. Por ejemplo, algunas revistas solicitan manuscritos anonimizados, sin nombres de autores ni pistas sobre su identidad, para evitar que este conocimiento influya sobre la evaluación de los revisores.
Los estudios doble ciego, en los que ni el participante ni el experimentador saben si una persona pertenece a la condición experimental o a la condición de control, pretenden prevenir tanto los efectos del participante como los efectos del experimentador (Rosenthal 1966).
Para evitar sesgos durante el análisis, los investigadores pueden recurrir al análisis ciego, en el que el archivo de datos deja de contener información que permita reconocer qué observaciones pertenecen a cada condición (MacCoun y Perlmutter 2015). Un colega no implicado en el análisis crea una versión modificada del conjunto de datos mediante alguna estrategia de cegamiento. Los investigadores realizan todos sus análisis con esa versión y, cuando han terminado, se produce el «descegamiento»: se revela qué condiciones correspondían realmente a los datos y los investigadores descubren entonces si sus predicciones están respaldadas por los datos originales.
16.2.10 Separar a los teóricos de los experimentalistas
Otra forma de reducir el sesgo del experimentador consiste en introducir una división de tareas entre quienes desarrollan las hipótesis y quienes las ponen a prueba. Esta distinción entre teóricos y experimentalistas es habitual en muchos campos y puede resultar especialmente fructífera cuando existe cierta tensión entre ambos grupos. Como escribió Moscovici (1972), «experimento y teoría no mantienen una relación transparente; la función de la teoría es hacer innecesario el experimento, y la función del experimento es hacer imposible la teoría».
Rosenthal (1966) plantea la posibilidad de un experimentador profesional cuya única función consista en recoger datos de alta calidad para otros investigadores que han desarrollado la hipótesis. La inversión emocional de ese profesional estaría en obtener los datos más exactos posibles, pues ese sería el criterio con el que se evaluaría su trabajo, y no en conseguir datos favorables a una hipótesis. Las hipótesis seguirían siendo responsabilidad del investigador principal, no de quien recoge los datos. En general, un experimentador profesional podría tener menos incentivos para producir datos sesgados que un científico-experimentador o un estudiante de posgrado que pone a prueba su propia idea.
Esta separación existe en campos como la física experimental. Junk y Lyons (2020) señalan que en física experimental de partículas existe especialización entre teóricos y experimentalistas. Una ventaja es que los modelos quedan completamente definidos por los teóricos antes de ser puestos a prueba. Otra es que los experimentalistas casi nunca prueban teorías que ellos mismos hayan inventado, lo que ayuda a reducir posibles efectos del sesgo de confirmación. En psicología no existe una división tan clara, pero puede lograrse algo parecido separando a quienes recogen los datos de quienes realizan su interpretación teórica. Una propuesta consiste, por ejemplo, en que otros investigadores redacten la discusión de un artículo (Schoenegger y Pils 2023): externalizar esa sección a personas distintas de los autores originales podría reducir diversos sesgos personales.
16.2.11 Método de múltiples hipótesis de trabajo
En muchos campos científicos no existe una tradición de especialización y una misma persona realiza prácticamente todas las tareas del proceso: teorización, diseño experimental, desarrollo de medidas, recogida de datos, análisis y comunicación de resultados. Ya en 1890 T. C. Chamberlin observó la tendencia de los científicos a desarrollar una preferencia afectiva por determinadas teorías o explicaciones:
En el momento en que alguien propone una explicación original para un fenómeno y esta le parece satisfactoria, nace el afecto por su criatura intelectual; a medida que la explicación se convierte en una teoría definida, sus afectos parentales se agrupan alrededor de esa descendencia intelectual y esta se vuelve cada vez más querida. Aunque aparentemente mantenga la teoría de forma provisional, la mantiene con cariño, no con imparcialidad. Tan pronto como ese afecto parental se apodera de la mente, se produce rápidamente la adopción de la teoría. Se seleccionan y magnifican inconscientemente los fenómenos que armonizan con ella y la respaldan, y se descuidan aquellos que no coinciden. La mente se detiene con placer en los hechos que encajan felizmente con la teoría y siente una frialdad natural hacia aquellos que se muestran refractarios. Instintivamente se buscan fenómenos que la apoyen, porque la mente es conducida por sus deseos. También surge una presión inconsciente sobre la teoría para hacerla encajar con los hechos y sobre los hechos para hacerlos encajar con la teoría.
Para impedir que este procesamiento afectivo sesgue la generación de conocimiento, Chamberlin propuso el método de múltiples hipótesis de trabajo (Chamberlin 1890). En lugar de considerar y poner a prueba una única hipótesis, el científico desarrolla activamente un conjunto amplio de hipótesis de trabajo. La idea es que ninguna disfrute de un estatus preferente y que el investigador pueda examinar con mayor objetividad cuál de ellas queda mejor corroborada por los datos. Chamberlin lo expresa así: el esfuerzo consiste en traer a la vista toda explicación racional de los nuevos fenómenos y desarrollar cada hipótesis defendible acerca de sus causas e historia. El investigador pasa a ser «progenitor de una familia de hipótesis» y, precisamente por esa relación parental con todas ellas, evita vincularse en exceso con una sola.
Si no es posible separar teóricos y experimentalistas, al menos un mismo científico puede intentar mantener simultáneamente varias ideas teóricas. Platt (1964) se inspiró en Chamberlin para desarrollar su concepto de inferencia fuerte. Según Platt, muchos problemas científicos surgen cuando el conflicto necesario para una inferencia inductiva precisa se convierte en un conflicto entre personas, cada una con su propia «teoría dominante». Cuando cada investigador comienza a trabajar con múltiples hipótesis, el enfrentamiento puede transformarse en un conflicto entre ideas. Entonces resulta mucho más fácil intentar cada día refutaciones concluyentes —inferencia fuerte— sin reticencia ni combatividad. Cuando existen varias hipótesis que no son «propiedad personal» de nadie y experimentos cruciales que pueden distinguirlas, el trabajo cotidiano del laboratorio puede adquirir incluso la emoción de una historia detectivesca. Naturalmente, este enfoque exige que los investigadores conozcan bien cada modelo teórico y posean las habilidades necesarias para poner a prueba todas las hipótesis alternativas.
16.3 Conclusión
Como observó Reif (1961), «la situación laboral del científico no es simplemente un refugio tranquilo para la actividad académica, ideal para personas de temperamento introvertido. El científico puro, al igual que el empresario o el abogado, trabaja en un entorno social y, como ellos, está sometido a presiones sociales y competitivas apreciables».
Hace mucho que se reconoce que la ciencia es una empresa humana. Los científicos tienen motivaciones y deseos que pueden sesgar las afirmaciones que realizan. Al mismo tiempo, esas mismas motivaciones y deseos pueden hacer que una persona mantenga una hipótesis el tiempo suficiente como para realizar un nuevo descubrimiento cuando la mayoría de los demás investigadores ya habrían abandonado la idea. Existen prácticas, tanto institucionales como individuales, que pueden impedir que estas motivaciones y deseos nos desvíen. Los factores humanos forman parte de la ciencia, y necesitamos diseñar la ciencia de manera que permita generar conocimiento de forma eficiente y fiable. Es importante comprender el papel que desempeña el sesgo de confirmación y conocer algunas de las prácticas descritas en este capítulo para evitar que ese sesgo consiga engañarnos.
Conviene recordar la advertencia que Johann Wolfgang von Goethe formuló en 1792:
Por ello nunca podremos ser demasiado cuidadosos en nuestros esfuerzos por evitar extraer conclusiones apresuradas de los experimentos o utilizarlos directamente como pruebas destinadas a respaldar alguna teoría. Porque precisamente aquí, en este tránsito de la evidencia empírica al juicio, del conocimiento a la aplicación, acechan todos los enemigos internos del ser humano: la imaginación, que lo arrastra sobre sus alas antes de que advierta que sus pies han abandonado el suelo; la impaciencia; la precipitación; la autosatisfacción; la rigidez; el pensamiento formalista; el prejuicio; la comodidad; la frivolidad; la inconstancia; toda esta multitud y su séquito. Aquí permanecen emboscados y sorprenden no solo al observador activo, sino también al contemplativo que parece a salvo de toda pasión.
Para profundizar en los temas de este capítulo puedes escuchar el episodio del podcast HPS sobre Collective Objectivity, con Fiona Fidler, o los episodios de Nullius in Verba sobre Confirmation Bias y Skepticism. También puedes leer Nobody’s Fool, de Daniel Simons y Christopher Chabris, y ver este vídeo sobre el sesgo de confirmación.