OpenAI descarta su propia herramienta de detección de texto generado por IA
Unsplash
En un movimiento que ha sorprendido a muchos en la industria tecnológica, OpenAI ha decidido desactivar su herramienta de detección de texto generado por IA, conocida como AI Classifier. Esta decisión se debe a la baja precisión de la herramienta, la cual solo identificaba correctamente el 26% de los textos generados por IA y, en ocasiones, etiquetaba incorrectamente textos escritos por humanos como creados por máquinas.
El fracaso de AI Classifier

Lanzado en enero de 2023, el AI Classifier fue presentado como una solución prometedora para identificar textos generados por IA. La intención era evitar el uso indebido de estas herramientas en contextos como la educación, donde se temía que los estudiantes pudieran utilizar IA para hacer trampa en sus trabajos académicos. Sin embargo, la realidad demostró que la herramienta no estaba a la altura de las expectativas.
En las pruebas realizadas, la herramienta no solo mostró una baja tasa de precisión, sino que también falló en detectar de manera confiable textos más cortos o aquellos escritos en idiomas distintos al inglés. Además, era vulnerable a falsos positivos, etiquetando erróneamente como generados por IA textos escritos por humanos, lo que generó preocupaciones sobre su fiabilidad.
El principal desafío radica en que los textos generados por IA no siempre presentan características distintivas claras que puedan ser identificadas fácilmente. La tecnología detrás de la generación de texto ha avanzado rápidamente, y los modelos de lenguaje, como GPT-3 y GPT-4 de OpenAI, producen textos que son cada vez más indistinguibles de los escritos por humanos.
OpenAI ha reconocido estas limitaciones y ha enfatizado que la herramienta no debería ser utilizada como el único método para determinar la procedencia de un texto. En lugar de eso, recomiendan su uso complementario junto a otros métodos y técnicas. A pesar de la retirada del AI Classifier, OpenAI sigue comprometido con la mejora de sus herramientas y está trabajando en desarrollar soluciones más precisas para el futuro.
Nuestro clasificador no es completamente confiable. En nuestras evaluaciones de un “conjunto de desafío” de textos en inglés, nuestro clasificador identifica correctamente el 26 % del texto escrito por IA (verdaderos positivos) como “probablemente escrito por IA”, mientras que etiqueta incorrectamente el texto escrito por humanos como escrito por IA el 9 % de las veces (falsos positivos). La confiabilidad de nuestro clasificador generalmente mejora a medida que aumenta la longitud del texto de entrada.
Mejoras de OpenAI para detectar texto generado por IA
Por ahora, OpenAI está explorando nuevas técnicas y colaborando con educadores y otros profesionales para desarrollar mecanismos que ayuden a identificar contenido generado por IA. Aunque AI Classifier ya no está disponible, la compañía ha anunciado una versión mejorada de sus sistema para detectar texto generado por IA.
No obstante, la compañía ha insistido en que esta versión tiene limitaciones y que debe usarse como un complemento con otras herramientas similares y no manera exclusiva para identificar textos escritos con inteligencia artificial. En específico, OpenIA recomienda:
- El clasificador presenta una fiabilidad muy baja en textos cortos, es decir, aquellos con menos de 1000 caracteres. Incluso los textos más extensos a menudo reciben etiquetas incorrectas por parte del clasificador.
- Es posible que textos escritos por humanos sean etiquetados incorrectamente, pero de manera segura, como creados por IA.
- Recomendamos utilizar el clasificador únicamente para textos en inglés, ya que su rendimiento en otros idiomas es considerablemente inferior y no es fiable para analizar código.
- Un texto altamente predecible no se puede identificar de manera confiable. Por ejemplo, no se puede determinar si una lista de los primeros 1000 números primos fue escrita por una IA o por humanos, ya que la respuesta correcta es siempre la misma.
- Los textos generados por IA pueden ser editados para evitar la detección del clasificador. Aunque los clasificadores como el nuestro pueden ser actualizados y reentrenados en función de los ataques exitosos, no está claro si esta detección ofrece una ventaja a largo plazo.
- Se ha observado que los clasificadores basados en redes neuronales están mal calibrados fuera de sus datos de entrenamiento. En el caso de entradas que son muy diferentes de los textos en nuestro conjunto de entrenamiento, el clasificador a veces muestra una confianza extrema al hacer predicciones incorrectas.
También te puede interesar: Una IA más conversacional: estas son las 3 nuevas funciones de voz para ChatGPT