Volver a Noticias
SeguridadAI Understanding sesión informativa

Un estudio encuentra que las personas prestan más atención a GPT-4 que sus pares en las noticias escritas por IA

Un experimento registrado previamente en la Universidad de Osaka encontró que los estudiantes cambiaron sus juicios más hacia GPT-4 que hacia el consejo de sus pares, pero el resultado utilizó texto de la era GPT-2 y no valida los detectores de IA modernos.

Por 4 min read
A student compares ambiguous paper fragments while three distinct sources offer competing evidence through abstract light patterns.
La versión corta

Un experimento registrado previamente en la Universidad de Osaka encontró que los estudiantes cambiaron sus juicios más hacia GPT-4 que hacia el consejo de sus pares, pero el resultado utilizó texto de la era GPT-2 y no valida los detectores de IA modernos.

que paso

Un artículo de investigación de la Universidad de Osaka publicado el 2 de agosto informa que los estudiantes dieron más importancia a los consejos de GPT-4 que a los de sus compañeros de estudios al estimar qué parte de una noticia japonesa fue escrita por humanos.

Yuhao Fu y Nobuyuki Hanaki realizaron un estudio de laboratorio con 220 estudiantes nativos de habla japonesa de la Universidad de Osaka a lo largo de un experimento principal y tres sesiones de seguimiento. El experimento principal fue aprobado por la junta de revisión del instituto universitario y prerregistrado; dos de las tres condiciones agregadas estaban prerregistradas por separado.

Cada participante juzgó 30 artículos en japonés: 10 artículos de Wikinews escritos por humanos, 10 artículos generados con un modelo japonés GPT-2 y 10 que comenzaron con texto escrito por humanos y terminaron con texto generado. Los participantes estimaron la proporción escrita por humanos, vieron una estimación numérica atribuida a GPT-4, a otro estudiante o, en sesiones posteriores, a un experto en lingüística y luego enviaron una estimación revisada.

En el experimento principal de 87 personas, la medida de ponderación de los consejos de los investigadores promedió 0,592 para los consejos de GPT-4 y 0,326 para los consejos de pares, una diferencia estadísticamente significativa. Las estimaciones finales también fueron más precisas en la condición GPT-4, pero el análisis de regresión del artículo atribuye la mayor parte de esa ganancia a la calidad del asesoramiento recibido más que a la etiqueta de IA en sí.

Lea la fuente principal: Fu and Hanaki research paper on arXiv

Por qué es importante

El estudio separa la confianza de la utilidad: una fuente puede influir fuertemente en una decisión, pero esa influencia sólo ayuda cuando sus consejos son lo suficientemente precisos para la tarea.

Esa distinción es importante para escuelas, redacciones, plataformas y otras organizaciones que consideran herramientas automatizadas de detección de contenido. Una etiqueta de IA familiar o la confianza del usuario en ella no es evidencia de que el detector funcione en el contenido, el lenguaje y la generación de modelos que realmente enfrentan.

El estudio también complica una historia simple de IA versus humanos. En las sesiones de seguimiento de 2025, los participantes dieron más importancia a los consejos atribuidos a expertos en lingüística que a los consejos del GPT-4 cuando las dos condiciones utilizaban el mismo procedimiento y período calendario. El grupo anterior de GPT-4 mostró una mayor confianza que el grupo de expertos, pero los autores advierten que la comparación abarca diferentes años y procedimientos.

Una lección operativa más segura es validar la calidad del asesoramiento y preservar la revisión humana. El experimento midió hasta qué punto las personas se acercaban a una estimación; no demostró que un detector de IA deba tomar decisiones finales sobre autoría, mala conducta o desinformación.

Qué ver a continuación

Esté atento a replicaciones independientes con generadores actuales, detectores dedicados, poblaciones más amplias y decisiones del mundo real donde las acusaciones falsas conllevan consecuencias.

El artículo es una nueva preimpresión, no un veredicto completo de revisión por pares. Sus participantes procedían de una universidad y el diseño del laboratorio controlado no puede establecer cómo se comportarían los periodistas, profesores, moderadores o el público en general fuera del experimento.

La brecha tecnológica es especialmente importante: el texto sintético provino de GPT-2, mientras que los consejos provinieron de GPT-4. Los generadores y sistemas de detección especializados actuales pueden producir diferentes patrones de precisión y confiabilidad. Los autores tampoco observaron directamente qué estrategias lingüísticas, contextuales o fácticas utilizaron los participantes.

La evidencia futura debería informar las tasas de falsos positivos, el rendimiento en todos los idiomas y familias de modelos, y si mostrar incertidumbre o procedencia cambia la confianza adecuada. Hasta entonces, este estudio es evidencia de que se deben seguir consejos bajo una configuración controlada, no una recomendación para usar ChatGPT como detector de escritura de IA.

Guías y cuestionarios relacionados

¿Encontró esto útil?
El informe mensual

Obtenga las historias de IA que realmente importan.

Un breve correo electrónico al mes: qué cambió en la IA, por qué es importante, además de las herramientas y guías que valen la pena.

Gratis · Sin spam · Darse de baja en un clic