
Dr. José Antonio Pérez Ramos
investigacion@mrci.com.mx
La inteligencia artificial generativa permite entregar trabajos bien elaborados sin que ello demuestre que quien los presenta comprende su contenido, y frente a esa brecha resulta tentador confiar a un detector de texto generado por IA la tarea de resolver la duda. Este artículo, concebido como una revisión narrativa crítica, sostiene que esa pregunta es pertinente, pero insuficiente, porque el origen del texto es solo una de cuatro dimensiones que conviene separar, junto con la corrección de su contenido, el cumplimiento de las reglas de la actividad y el aprendizaje de la persona. El recorrido examina primero qué hacen los detectores y qué fiabilidad cabe exigirles, después qué significa comprender, verificar, aprender y aplicar cuando se trabaja con IA, y finalmente propone un protocolo y una rúbrica orientativa para hacer observable el aprendizaje sin renunciar a la integridad, recorrido que parte de una situación concreta de evaluación.
El problema educativo detrás de la pregunta por la autoría
Una persona entrega un ensayo ordenado, con lenguaje fluido y conclusiones plausibles, y el documento puede ser excelente y, aun así, no mostrar si quien lo presenta entiende los conceptos, reconoce los límites de las fuentes o sabe resolver una situación distinta. La IA generativa intensifica esta separación entre producto y competencia porque permite obtener una respuesta elaborada antes de haber realizado parte del trabajo necesario para aprender, de ahí que la pregunta por la procedencia del texto sea pertinente, pero no agote la pregunta educativa.
El problema tiene al menos cuatro dimensiones, que son el origen de las palabras, la corrección del contenido, el cumplimiento de las reglas de la actividad y el aprendizaje de la persona, y aunque estas dimensiones se relacionan, no son intercambiables. Un texto humano puede contener errores o no evidenciar comprensión, mientras que un texto asistido por IA puede ser correcto y haber servido para aprender. Puede existir también aprendizaje junto con una infracción de las reglas de uso, de modo que reconocer la competencia adquirida no borra una falta de transparencia.
Este artículo sostiene que la evaluación necesita información distinta para cada dimensión, pues un detector puede aportar una señal sobre ciertos patrones del texto, la revisión de fuentes puede examinar su fundamento y una actividad de desempeño puede mostrar qué sabe hacer el estudiante. Atribuir a un solo instrumento la capacidad de resolver las cuatro preguntas conduce a decisiones débiles, mientras que esta separación permite asignar controles adecuados a la producción documental, la evidencia y la responsabilidad de quien utiliza la herramienta.
La prioridad propuesta consiste en hacer observable la comprensión, el aprendizaje y la aplicación práctica sin renunciar a la integridad. Cuando una institución permite utilizar IA, debe precisar para qué tareas, con qué límites y con qué declaración de uso, y cuando la restringe, debe explicar el propósito formativo de esa restricción. En ambos escenarios, una entrega debe poder sostenerse mediante razones, fuentes y desempeño, porque el documento es una evidencia parcial de la formación y no un sustituto de ella.
Alcance y método de esta revisión
El trabajo es una revisión narrativa crítica con una propuesta de evaluación y no presenta un experimento propio, una revisión sistemática ni una validación de productos comerciales. Su corpus reúne estudios de detección, documentación de un proveedor, una decisión universitaria publicada en 2023, investigaciones sobre aprendizaje y dos documentos de la UNESCO sobre educación y competencias en inteligencia artificial, selección con la que se busca contrastar explicaciones técnicas, resultados empíricos y orientaciones pedagógicas relevantes para el problema planteado.
Se privilegian publicaciones originales, repositorios de los artículos y documentación institucional identificable, y los datos bibliográficos se contrastan con las páginas editoriales o con los documentos publicados. Para las versiones españolas de los informes de la UNESCO se conservan sus años de edición y se indica el año de la obra original, razón por la cual las citas emplean las fechas 2023/2024 y 2024/2025. La consulta de documentación web se realizó para esta versión, cerrada el 1 de octubre de 2026.
La lectura distingue resultados observados, inferencias de este artículo y recomendaciones. Así, cuando se describe un ensayo educativo, se conserva el contexto de la intervención y el resultado medido, cuando se presenta un ejemplo numérico, se identifica como hipotético, y cuando se propone una rúbrica, se declara que necesita pilotaje y no se atribuyen a sus ponderaciones propiedades psicométricas que no han sido comprobadas. Esta disciplina evita convertir una recomendación razonable en una conclusión experimental.
La revisión tiene límites deliberados, pues no reúne todas las versiones de todos los detectores, no reproduce sus pruebas y no estima tasas locales para estudiantes hispanohablantes, como tampoco demuestra efectos de largo plazo del uso de IA en una población mexicana. Su contribución consiste en ordenar las preguntas, examinar evidencia seleccionada y formular un procedimiento evaluable, mientras que las decisiones de alto impacto requerirán evidencias del contexto concreto y las reglas institucionales correspondientes.
Qué hace un detector de texto generado por IA
Un detector recibe un texto y aplica un procedimiento para decidir si presenta características asociadas con textos generados por determinados sistemas. En la investigación existen clasificadores entrenados con ejemplos etiquetados y métodos que utilizan probabilidades o propiedades de modelos de lenguaje, y RAID, que incluye herramientas de ambas familias, muestra que su evaluación exige variar dominios, modelos y condiciones de generación, pues compartir la etiqueta de detector no significa compartir arquitectura, entrenamiento o comportamiento (Dugan et al., 2024).
La diferencia entre identificar patrones y reconstruir la historia de producción es fundamental, porque el detector normalmente observa el resultado disponible y no todas las operaciones que lo precedieron. Por ese solo análisis no sabe si hubo una lluvia de ideas, una traducción, una corrección de estilo o una revisión humana intensiva, de manera que una clasificación puede ser compatible con varias historias de elaboración sin que la historia más plausible quede convertida automáticamente en una historia comprobada.
Puede entenderse el proceso como una medición indirecta, en la que se extraen señales, se combinan en una puntuación y se adopta un umbral de decisión, por lo que el resultado depende del procedimiento y de las condiciones en que se haya validado. Si el tipo de documento, la lengua o el modelo generador cambia, es necesario preguntar si el instrumento mantiene su desempeño. Esta explicación describe la lógica general de una clasificación estadística y no pretende revelar el funcionamiento interno de un producto propietario.
Los indicios estilísticos considerados por un lector también son indirectos, ya que la regularidad de los párrafos, las transiciones previsibles o una prosa muy pulida pueden motivar preguntas, pero no certifican origen, en la medida en que una persona puede escribir de manera estandarizada y una máquina puede producir variaciones. El juicio responsable requiere, en consecuencia, distinguir entre una observación del texto y una afirmación sobre quién lo produjo, especialmente cuando esta última tendría consecuencias para otra persona.
Probabilidades, clasificadores y marcas de agua
DetectGPT ejemplifica un método basado en propiedades probabilísticas de un modelo. Mitchell et al. (2023) comparan la probabilidad del pasaje con la de perturbaciones de ese pasaje y utilizan una propiedad de curvatura para discriminar muestras generadas por un modelo determinado, procedimiento que no necesita entrenar un clasificador separado, aunque depende del acceso y de los modelos utilizados para calcular esas señales. Con todo, su rendimiento experimental no equivale a una tasa universal de identificación correcta para cualquier texto.
Los clasificadores supervisados aprenden a separar categorías a partir de ejemplos, y su problema práctico es que los ejemplos de entrenamiento no pueden representar todas las formas de escritura humana, todas las lenguas y todas las generaciones futuras, de modo que una distinción útil en el conjunto de desarrollo puede debilitarse fuera de él. Esta posibilidad obliga a pedir pruebas de generalización, en vez de valorar una herramienta únicamente por la mejor cifra anunciada en su entorno de prueba.
Otra familia incorpora una señal durante la generación, como la marca de agua que proponen Kirchenbauer et al. (2023) mediante un sesgo controlado en la selección de tokens, detectable con una prueba estadística. Se trata de un sistema configurado para producir esa señal y de un procedimiento que la busca después, de suerte que una marca compatible puede aportar evidencia de procedencia bajo sus condiciones, aunque su ausencia no demuestra autoría humana y su presencia no mide cuánto comprendió o cuánto trabajó una persona.
La comparación exige evitar dos simplificaciones, la de considerar que todos los detectores solo buscan palabras repetidas y la de afirmar que cualquier detección es imposible, pues hay métodos técnicamente distintos y escenarios en los que una señal puede ser informativa. Lo que no se sigue de ello es una garantía general de exactitud, una reconstrucción completa de la autoría o una medición del esfuerzo intelectual, por lo que la utilidad de una señal debe definirse para una pregunta y unas condiciones específicas.
Para ilustrar la lectura probabilística, GLTR muestra qué tan probable resulta una palabra para un modelo, qué posición ocupa entre sus alternativas y qué incertidumbre tiene la distribución de predicciones. Gehrmann et al. (2019) diseñaron una visualización que apoya el juicio humano sobre posibles artefactos de generación, y dado que estas señales describen relaciones entre el texto y el modelo utilizado, su significado depende de ese modelo y de los supuestos del procedimiento.
Puede imaginarse una frase incompleta con varias continuaciones posibles, a las que un modelo asigna probabilidades, mientras el análisis pregunta cómo se distribuyen las elecciones del texto observado. Una sucesión de elecciones muy esperadas puede aportar una señal en determinados métodos, pero no identifica automáticamente una máquina. El ejemplo permite entender la diferencia entre medir predictibilidad y observar directamente el acto de redactar, aunque no ofrece una regla para clasificar textos de manera informal.
La palabra token designa una unidad de procesamiento que no coincide necesariamente con una palabra completa, pues según el sistema puede representar una palabra, una parte de ella o un signo. La guía de Miao y Holmes (2023/2024) describe los modelos de lenguaje y su generación a partir de patrones aprendidos, y entender esa unidad ayuda a reconocer que la representación matemática del texto no equivale a una medida de sus ideas ni a una lectura de la intención de quien escribe.
Una puntuación asociada con un patrón tampoco es necesariamente una probabilidad calibrada, porque para interpretar una salida como probabilidad es necesario demostrar que sus valores corresponden a frecuencias observadas en condiciones pertinentes, y un número entre cero y uno puede ser solo una escala del instrumento. Esta distinción conceptual exige pedir documentación y validación antes de traducir una puntuación a una afirmación como noventa posibilidades de cien de que una persona haya incumplido las reglas.
Qué ignifica el porcentaje de un informe
Turnitin (2026) explica que su porcentaje de detección se refiere a texto calificable, principalmente prosa extensa, que el modelo considera que podría haber sido generado por IA. Advierte también que puede clasificar incorrectamente textos y que el resultado no debe ser la única base para una acción adversa, además de distinguir ese indicador del porcentaje de similitud. Por tanto, reportar una fracción marcada no equivale a reportar una fracción comprobada del trabajo realizado con IA.
Una fracción del documento y una probabilidad de clasificación son cantidades diferentes, pues si una herramienta marca una parte de la prosa, el denominador puede excluir materiales que no procesa de la misma manera, y si otra herramienta muestra una puntuación de confianza, esa puntuación no tiene necesariamente el mismo significado. De ahí que, antes de comparar informes, sea indispensable leer qué representa cada indicador, qué partes del archivo analiza y qué interpretación autoriza su documentación.
La propia documentación de Turnitin informa que los resultados inferiores al 20 % presentan más problemas de falsos positivos y que los porcentajes de 1 a 19 se sustituyen por un asterisco, además de señalar restricciones relacionadas con el texto calificable y la extensión. Estas condiciones son relevantes para interpretar el producto consultado, no para asignar el mismo umbral o las mismas limitaciones a cualquier detector del mercado (Turnitin, 2026).
Una indicación de cero significa que no se identificó la señal reportada en el texto calificable, pero no certifica que ninguna herramienta haya intervenido durante la elaboración, de modo que leer un informe exige respetar su alcance (Turnitin, 2026).
Por qué no puede obtenerse un porcentaje exacto de aportación intelectual
Para calcular un porcentaje se necesita definir la unidad de medida, y puede contarse el número de palabras, el tiempo de elaboración, las decisiones adoptadas o los componentes de una tarea. Ninguno de estos denominadores representa por sí solo la aportación intelectual, ya que una idea decisiva puede ocupar una línea y una explicación rutinaria varias páginas, por lo que, antes de preguntar cuánto hizo la IA, conviene determinar qué se quiere contar y por qué ese conteo sería relevante.
Considérese una situación hipotética en la que la IA produce un borrador de mil palabras y una persona lo corrige, verifica cada fuente, modifica la tesis y conserva solo cuatrocientas palabras. Es posible describir algunas operaciones si se dispone de registros, pero la proporción de palabras conservadas no mide el valor de la revisión ni el aprendizaje, mientras que un segundo proceso podría partir de una tesis humana y delegar la redacción completa, con lo que produciría otra relación entre palabras y contribución.
Un texto final no contiene necesariamente información suficiente para identificar esas historias, dado que dos procesos distintos pueden terminar en formulaciones muy parecidas e incluso un registro detallado de interacciones muestra acciones observables, no toda la deliberación mental. Por ello, una declaración de uso y un historial pueden mejorar la trazabilidad, pero requieren interpretación y no convierten la contribución intelectual en una magnitud exacta comparable al peso de un objeto.
La respuesta honesta es que el análisis del texto, por sí solo, no permite certificar con certeza absoluta el porcentaje real de todo el trabajo realizado mediante IA. Esta conclusión no niega la posibilidad de identificar usos concretos con evidencias adicionales, sino que señala una insuficiencia entre lo que se observa y lo que se pretende medir, de manera que, si la institución necesita controlar una fase específica, debe definirla y documentarla en vez de pedir al detector una cifra que no corresponde a su función.
Métricas para evaluar la fiabilidad
La fiabilidad no puede resumirse sin contexto en una afirmación de alta exactitud, pues una evaluación necesita saber cuántos textos humanos fueron marcados como generados, cuántos textos generados no fueron identificados y bajo qué condiciones ocurrieron ambos resultados, además de precisar la versión del instrumento, la población de prueba y el umbral. Estas preguntas permiten entender si una cifra describe un escenario comparable al uso que se pretende realizar.
La sensibilidad expresa qué proporción de los casos positivos definidos para la prueba identifica el sistema, mientras que la especificidad expresa qué proporción de los negativos deja correctamente sin marcar. El valor predictivo positivo, por su parte, pregunta qué fracción de los resultados positivos corresponde a positivos reales en la población considerada, y la exactitud agrega aciertos de ambas categorías, pero puede ocultar un mal desempeño para una de ellas cuando las categorías están desequilibradas.
También importa la definición de la categoría positiva, porque si una prueba llama positivo a cualquier texto producido enteramente por un modelo, no ha validado necesariamente la detección de una corrección gramatical permitida o de una colaboración mixta. La etiqueta uso de IA puede abarcar operaciones educativas y técnicas diferentes y, sin una definición operacional, una comparación entre detectores corre el riesgo de medir tareas distintas bajo un mismo nombre.
Una métrica obtenida en una evaluación técnica no es, además, una regla disciplinaria, y aun un instrumento con un desempeño útil puede requerir corroboración antes de una decisión individual. El criterio para organizar una revisión masiva no tiene por qué ser idéntico al criterio para sostener una acusación, de modo que separar estos usos evita que un umbral práctico de clasificación se transforme, sin justificación adicional, en un umbral de responsabilidad académica.
Un ejemplo numérico sobre falsos positivos
El siguiente ejemplo es un cálculo hipotético, no un resultado de Turnitin ni de otro detector, en el que se supone que se revisan mil trabajos, que cincuenta cumplen una definición previamente fijada de uso no permitido y que el instrumento tiene sensibilidad del 90 % y especificidad del 95 %. Estas condiciones producirían, en valores esperados, cuarenta y cinco positivos verdaderos y 47,5 falsos positivos, donde el valor decimal expresa una expectativa estadística y no medio trabajo observado.
Entre los resultados positivos habría, por tanto, 45 casos verdaderos de un total esperado de 92,5, y el valor predictivo positivo sería aproximadamente 48,6 %, pues la operación es 45 dividido entre 92,5 y multiplicado por cien. El ejemplo muestra que una sensibilidad alta no basta para interpretar una señal individual, porque la proporción inicial de casos positivos y la especificidad también influyen en el significado de un resultado marcado.
Si se mantienen la sensibilidad y la especificidad y se supone una proporción positiva del 30 %, el mismo conjunto de mil trabajos produciría 270 positivos verdaderos y 35 falsos positivos, con lo que el valor predictivo positivo ascendería aproximadamente al 88,5 %. El cambio no se debe a que la herramienta haya aprendido más entre ambos escenarios, sino a que cambia la composición supuesta de la población, y ambos cálculos son ilustraciones del razonamiento condicional.
El ejemplo no permite estimar la frecuencia real de infracciones en un curso, frecuencia que no debe inventarse para obtener una cifra conveniente. Su finalidad es enseñar por qué una salida del detector necesita contexto y por qué el error individual sigue siendo relevante, en la medida en que una política prudente debe considerar tanto el costo de no identificar usos indebidos como el daño de atribuir una conducta a quien no la realizó.
Qué han encontrado las evaluaciones de detectores
Weber-Wulff et al. (2023) evaluaron catorce herramientas, incluidas doce de acceso público y dos sistemas comerciales, y sus resultados identificaron limitaciones importantes de exactitud y efectos de la traducción y de modificaciones del texto sobre la detección. El estudio constituye evidencia contra una confianza indiscriminada en las herramientas examinadas, pero corresponde a instrumentos y condiciones de 2023, por lo que no establece, por sí solo, la tasa de error de toda versión posterior.
Liang et al. (2023) estudiaron siete detectores con muestras de ensayos TOEFL y escritos de estudiantes estadounidenses de octavo grado, y en los 91 ensayos TOEFL la tasa media de falsos positivos reportada fue de 61,3 %. El hallazgo documenta un problema serio en esa muestra, no un porcentaje universal para todas las personas que escriben en una segunda lengua, y antes de trasladar la comparación a otra población también deben considerarse las diferencias de tarea, edad y contexto.
RAID amplió la evaluación mediante un banco de pruebas con más de seis millones de generaciones, once modelos y ocho dominios, además de variaciones de generación y modificaciones adversarias. Dugan et al. (2024) examinaron doce detectores y encontraron debilidades frente a cambios en las condiciones de evaluación, y su contribución es mostrar la importancia de la robustez y de la generalización, sin proporcionar una validación local automática para cada institución o cada producto.
Estas investigaciones responden preguntas diferentes y no deben promediarse como si fueran mediciones de una misma población, como tampoco prueban que una señal carezca siempre de utilidad. En conjunto, justifican pedir condiciones de prueba, reconocer errores y evitar conclusiones individuales basadas exclusivamente en una salida automática, porque un uso defendible necesita precisar qué se detecta, con qué evidencia de funcionamiento y para qué tipo de decisión.
Equidad, privacidad y reglas institucionales
Vanderbilt University (2023) anunció que desactivaría el detector de IA de Turnitin después de revisar preocupaciones sobre fiabilidad, transparencia y consecuencias para estudiantes, y su comunicación aconsejó aclarar expectativas y conversar con quienes pudieran haber usado IA de manera indebida. Se trata de una decisión institucional publicada en agosto de 2023 que debe tratarse como antecedente histórico, no como una afirmación sobre la configuración actual de sus sistemas.
El problema de equidad exige atención al idioma, al género textual y a las condiciones de escritura, de manera que una institución que evalúa textos en español necesita evidencias pertinentes para ese uso y no solo resultados en inglés. Los hallazgos de Liang et al. (2023) motivan una pregunta de validación, pero no demuestran por sí mismos una tasa específica de error para estudiantes mexicanos, y reconocer esa diferencia protege tanto la precisión científica como la justicia de las decisiones.
La guía de Miao y Holmes (2023/2024) sitúa la protección de datos, la agencia humana y la validación del uso educativo entre las condiciones de una incorporación responsable de la IA generativa. Desde esa orientación, la búsqueda de una señal de detección no justifica enviar indiscriminadamente trabajos, expedientes o información personal a servicios externos, por lo que la institución necesita valorar qué datos entrega, para qué finalidad y bajo qué condiciones de resguardo.
Una política clara debe distinguir el uso autorizado del no autorizado, exigir declaraciones proporcionadas a la actividad y establecer un procedimiento de revisión comprensible. Puede, además, conservar evidencia de proceso sin recopilar más información de la necesaria, y en ella el estudiante debe poder explicar su trabajo y responder a observaciones concretas. Estas recomendaciones son una propuesta de gobernanza educativa del artículo, no una descripción de obligaciones jurídicas universales.
Comprender un texto no equivale a poder repetirlo
Comprender significa construir una explicación de las relaciones que sostienen un contenido, de modo que una persona demuestra comprensión cuando puede identificar la pregunta, distinguir la tesis de sus razones, reconocer supuestos y explicar por qué una conclusión se sigue de una evidencia. Repetir una frase correcta es una observación más limitada que, aunque puede formar parte del aprendizaje, no basta para mostrar que la persona sabe cuándo usar esa idea o cuándo dejar de usarla.
Ante un texto producido con IA, la primera tarea formativa propuesta es reconstruir el razonamiento en palabras propias, para lo cual el estudiante debe separar los conceptos centrales de los adornos retóricos y localizar los pasos que necesitan respaldo. Una pregunta útil es qué cambiaría en la conclusión si uno de los supuestos fuera falso, y otra consiste en identificar una objeción relevante y explicar si obliga a modificar la tesis, a limitar su alcance o a buscar nueva evidencia.
Miao et al. (2024/2025) presentan un marco que articula cuatro dimensiones de competencia y tres niveles de progresión (comprender, aplicar y crear). Sus dimensiones son la mentalidad centrada en el ser humano, la ética de la IA, las técnicas y aplicaciones y el diseño de sistemas, y esta estructura permite situar la interacción con herramientas dentro de un desarrollo de competencias más amplio, en vez de reducir la formación a obtener resultados eficaces de una conversación.
La propuesta de este artículo traduce ese enfoque a una exigencia concreta, según la cual quien usa una explicación automatizada debe poder reconocer su función y su límite. Si no entiende una fórmula, una categoría o una afirmación, no debe incorporarla solo porque suena convincente, sino que puede pedir una explicación adicional, acudir a una fuente o solicitar ayuda docente, y el momento de reconocer que no se comprende algo también es una oportunidad de aprendizaje y de responsabilidad.
La verificación como distinción entre fluidez y fundamento
La guía de Miao y Holmes (2023/2024) advierte sobre los límites de los contenidos generados y propone validar su pertinencia educativa. Para este artículo, verificar significa contrastar las afirmaciones importantes con fuentes que puedan examinarse, no únicamente pedir a la misma herramienta que confirme lo que ya escribió, ya que una segunda respuesta automatizada puede orientar una búsqueda, pero la confirmación depende del contenido y de la calidad de la evidencia encontrada.
La verificación de una referencia tiene dos niveles, comprobar que la obra existe y comprobar que sostiene la afirmación atribuida, porque un título real y un DOI válido no garantizan que el artículo demuestre aquello que el texto afirma. Es necesario leer la parte pertinente, distinguir su método y conservar sus límites, tarea que convierte la bibliografía en una estructura de respaldo y evita tratarla como decoración que añade apariencia científica a un argumento.
Una actividad práctica puede entregar un párrafo con tres tipos de afirmaciones (una sustentada, una plausible pero no documentada y una exageración de un resultado real), y el estudiante debe clasificarlas, explicar qué evidencia falta y reescribir el párrafo sin inflar las conclusiones. La tarea propuesta no requiere adivinar si la redacción provino de una máquina, sino demostrar criterio para transformar información disponible en conocimiento defendible.
La misma disciplina se aplica a números, tablas y resúmenes, respecto de los cuales debe preguntarse qué población fue estudiada, qué variable se midió y si el porcentaje describe un cambio relativo o una diferencia en puntos porcentuales. Si esas preguntas quedan sin respuesta, la cifra todavía no es una base suficiente para actuar, y aprender a verificar incluye saber detener una conclusión y declarar qué información sería necesaria para sostenerla.
Éxito asistido y capacidad autónoma en el aprendizaje
El éxito asistido describe lo que una persona logra mientras dispone de una ayuda, y la capacidad autónoma, lo que puede hacer al retirar esa ayuda bajo condiciones adecuadas. Ambas son relevantes, pero responden preguntas distintas, pues una herramienta puede elevar la calidad de una entrega sin que el usuario adquiera todos los conocimientos que esa entrega parece mostrar, y por eso la evaluación necesita observar desempeños con ayuda y desempeños sin ella.
Bastani et al. (2025) reportan una intervención de matemáticas de bachillerato con cerca de mil estudiantes, en la que los accesos a una interfaz básica y a un tutor con resguardos pedagógicos mejoraron el rendimiento durante la práctica. Al retirar la herramienta, en cambio, el grupo de la interfaz básica obtuvo calificaciones un 17 % inferiores al control, perjuicio que el tutor mitigó ampliamente, aunque el resultado se refiere a una evaluación de corto plazo y no demuestra una pérdida permanente de capacidad intelectual.
Kestin et al. (2025) estudiaron un tutor diseñado con principios pedagógicos en un curso universitario de física y reportaron mejores resultados inmediatos que la enseñanza activa comparada para las lecciones evaluadas, en un diseño analizado en el que participaron 194 estudiantes elegibles. El resultado corresponde a una intervención estructurada y a pruebas próximas a la actividad, no a cualquier conversación con un modelo ni a una superioridad universal sobre docentes o sobre otras formas de enseñanza.
Los estudios no autorizan una sentencia única de que la IA siempre mejora o siempre perjudica el aprendizaje, pero sí permiten reconocer que la arquitectura de la ayuda importa, pues una interfaz que entrega soluciones y un tutor que orienta el razonamiento no constituyen la misma intervención. La recomendación derivada es examinar qué actividad cognitiva conserva el estudiante y qué capacidad demuestra después, en vez de evaluar la herramienta solo por la rapidez o por el acabado de su respuesta.
Recuperar, revisar y retener lo aprendido
Karpicke y Roediger (2008) encontraron, en una tarea de aprendizaje de vocabulario, que la recuperación repetida favorecía la retención posterior frente a condiciones centradas en volver a estudiar, mientras que las predicciones de los participantes sobre su aprendizaje no reflejaban adecuadamente esos resultados. El estudio no examinó IA, pero ofrece una razón para distinguir entre sentirse familiarizado con una respuesta y poder producirla cuando ya no está delante de la persona.
Dunlosky et al. (2013), en una revisión de técnicas de aprendizaje, asignaron alta utilidad a las pruebas de práctica y a la práctica distribuida. Su análisis no equivale a afirmar que toda técnica funciona igual para todas las tareas, pero respalda la conveniencia de incluir recuperación y distribución temporal, aunque aplicar esa orientación al uso de IA requiere diseñar actividades y comprobar sus resultados en el contexto, en vez de asumir que la lectura de explicaciones basta.
Se propone un ciclo de trabajo en el que el estudiante obtiene o consulta una explicación, identifica sus ideas centrales y después cierra la ayuda para reconstruirlas, y tras comparar su reconstrucción con las fuentes, corrige vacíos y vuelve a intentarlo en otra sesión. El propósito no es memorizar el texto generado, sino practicar las operaciones que necesita conservar, que son explicar relaciones, seleccionar datos pertinentes y justificar un procedimiento.
La demora entre sesiones permite formular otra pregunta evaluativa, la de qué permanece disponible después de la impresión inicial de claridad, aunque el intervalo debe ser adecuado al curso y al contenido, y no convertirse en un ritual uniforme. Una comprobación posterior puede incluir una explicación breve o un problema equivalente, y si el estudiante solo conserva el documento, pero no puede recuperar el razonamiento básico, el trabajo todavía necesita una fase de apropiación formativa.
Aplicación, transferencia y reconocimiento de límites
Aplicar un conocimiento supone elegirlo y adaptarlo a una situación, por lo que no basta con sustituir números dentro de un procedimiento si el estudiante no sabe cuándo ese procedimiento corresponde al problema. Una evaluación de aplicación debe introducir cambios que obliguen a reconocer variables, supuestos y consecuencias, y si bien el caso nuevo puede parecerse al estudiado, necesita una diferencia significativa que haga visible el razonamiento de quien lo resuelve.
Una tarea matemática puede cambiar la información disponible y pedir que se decida si el método anterior sigue siendo válido, una actividad de programación puede introducir una condición de entrada que revele un error y un análisis de políticas puede modificar el objetivo o los recursos disponibles y exigir otra recomendación. Estos son ejemplos hipotéticos de diseño de evaluación, no resultados de investigación que prueben por sí mismos la eficacia de una metodología.
También es aplicación práctica saber cuándo no utilizar una respuesta, pues si faltan datos, si la evidencia no es pertinente o si el costo de un error es alto, la acción competente puede consistir en suspender la decisión y solicitar revisión. La responsabilidad no se demuestra actuando siempre con rapidez, sino relacionando la confianza con la calidad de las razones disponibles, y una respuesta generada puede ser el inicio de una exploración sin estar lista para ejecutarse.
El marco de Miao et al. (2024/2025) propone evaluaciones basadas en competencias y desempeño, con atención a sus dimensiones técnicas y humanas, y la presente propuesta se alinea con esa orientación al exigir decisiones observables y explicación de consecuencias. Sin pretender que una sola prueba mida toda la formación de una persona, recomienda combinar evidencias y delimitar qué competencia sostiene cada una, especialmente cuando la evaluación tiene efectos importantes.
Un protocolo para trabajar con IA y aprender
El protocolo propuesto comienza con la definición de la tarea y de las reglas de uso, en la que el estudiante identifica qué necesita aprender, qué ayuda está permitida y qué resultado debe poder producir personalmente, y después redacta un diagnóstico inicial de sus conocimientos y dudas. Esta fase permite distinguir la herramienta que responde de la persona que necesita formarse, además de establecer un punto de comparación para observar avances.
Durante la interacción se solicita una ayuda ajustada al propósito, sea una pista, una explicación, un ejemplo alternativo o una crítica del razonamiento, y la respuesta se revisa y se contrasta con fuentes. El estudiante registra decisiones relevantes, especialmente las correcciones de errores o los cambios de criterio, en una bitácora que debe ser breve y funcional, porque una colección indiscriminada de conversaciones puede dificultar la revisión y exponer información innecesaria.
La fase de apropiación exige cerrar la ayuda y producir una explicación propia del núcleo del trabajo. No se espera reconstruir palabra por palabra el documento, sino demostrar los conceptos, las relaciones y los procedimientos centrales, y si aparecen vacíos, se regresa a la consulta y se vuelve a intentar, de modo que el protocolo admite ciclos de mejora y convierte una dificultad de comprensión en una señal para intervenir, sin disfrazarla mediante una entrega más pulida.
La fase final incluye una tarea nueva, una revisión de las fuentes utilizadas y una declaración de uso. En ella, el estudiante identifica qué aportó la herramienta, qué decisiones asumió personalmente y qué límites persisten, mientras que el docente evalúa el producto y la competencia con criterios anunciados. Este procedimiento es una propuesta a pilotar, no un instrumento validado ni una garantía de que cualquier usuario alcanzará el mismo resultado por seguir sus pasos.
Un ejercicio completo puede construirse a partir del ejemplo numérico de falsos positivos presentado antes. El estudiante consulta una explicación asistida y después entrega su propio cálculo, identifica los dos denominadores utilizados y explica por qué 90 % de sensibilidad no significa 90 % de resultados positivos correctos, y para cerrar la fase de comprensión señala qué parte del ejemplo es una suposición y qué parte es una consecuencia matemática de esas suposiciones.
La aplicación introduce otra composición hipotética de la población y pide que se anticipen los efectos antes de calcular, de manera que el aprendiz debe decidir si espera más o menos falsos positivos entre los resultados marcados y justificarlo. Después realiza las operaciones, compara su predicción con el resultado y, si se equivoca, describe el paso conceptual que revisó, ya que la evidencia de aprendizaje incluye esa corrección fundamentada y no únicamente la cifra final que puede obtenerse con una herramienta.
Una comprobación posterior puede pedir que explique la misma relación sin disponer del ejemplo anterior y con otras cantidades sencillas. La actividad no intenta demostrar que todos los contenidos deban aprenderse mediante cálculo manual, sino que selecciona una relación conceptual central y utiliza números como apoyo para hacerla visible. El docente, por su parte, debe proporcionar los recursos permitidos y mantener condiciones equivalentes, para que el resultado represente la competencia y no una diferencia arbitraria de acceso.
La bitácora de este ejercicio puede limitarse a tres decisiones narradas, que son qué explicación resultó útil, qué interpretación se corrigió y qué afirmación se evitó porque excedía los datos, sin necesidad de reproducir toda la conversación. Al comparar el diagnóstico inicial con la comprobación final, el estudiante puede identificar una mejora concreta, y así el diseño convierte un trabajo hecho con IA en una oportunidad para comprender, practicar y demostrar lo aprendido, conservando una declaración de uso proporcionada.
Evaluar con evidencias que se complementan
La evaluación propuesta reúne cinco evidencias (el producto final, una bitácora breve, una explicación del razonamiento, una verificación de afirmaciones y una aplicación a un caso nuevo), y cada una responde una pregunta. El producto muestra la calidad de la entrega, la bitácora permite examinar decisiones documentadas, la explicación muestra comprensión, la verificación observa criterio sobre las fuentes y el caso nuevo examina el uso del conocimiento bajo otras condiciones.
La explicación puede ser oral o escrita según los objetivos y las condiciones del estudiante, ya que un formato oral exclusivo puede introducir dificultades ajenas al contenido que se quiere medir. Las adecuaciones de accesibilidad deben conservar la competencia evaluada sin imponer un único modo de expresión, y el mismo cuidado exige separar un problema de comprensión de un problema de ansiedad, de velocidad de respuesta o de manejo de la lengua.
Una comprobación sin IA no necesita abarcar todo el documento, por lo que conviene seleccionar los núcleos que el curso considera esenciales y anunciar esa expectativa antes de la entrega. El docente puede pedir que se justifique un paso, se detecte un error o se resuelva una variación, pero la selección debe ser proporcional y comparable entre estudiantes, porque una prueba improvisada y desigual puede debilitar el valor de la evidencia que pretende obtener.
La integración de evidencias tampoco debe producir un expediente excesivo, pues en una actividad breve una explicación de pocos minutos o un ejercicio adicional puede ser suficiente para el objetivo, mientras que en un proyecto amplio una revisión por etapas puede aportar más información. El principio propuesto es hacer visible el aprendizaje con el menor costo razonable, manteniendo criterios claros y evitando convertir la evaluación en vigilancia permanente del estudiante.
Una rúbrica orientativa de comprensión y aplicación
La rúbrica sugerida distribuye cien puntos entre comprensión conceptual, verificación, aplicación, autonomía y responsabilidad, con pesos que no proceden de una validación estadística y que deben adaptarse al curso. Su utilidad inicial es hacer explícito qué desempeño se espera, y también permite discutir con estudiantes por qué una entrega correcta puede requerir todavía una demostración de aprendizaje, o por qué una respuesta imperfecta puede contener avances valiosos que necesitan revisión.
Tabla 1: Rúbrica orientativa para evaluar trabajos con apoyo de IA
|
Dimensión |
Puntos |
Evidencia esperada |
|
Comprensión conceptual |
25 |
Explica relaciones, supuestos y límites con palabras propias |
|
Verificación |
20 |
Contrasta afirmaciones relevantes con fuentes pertinentes |
|
Aplicación |
25 |
Resuelve una variación y justifica la adaptación del método |
|
Autonomía |
20 |
Demuestra el núcleo de la competencia en una tarea sin IA |
|
Responsabilidad |
10 |
Declara el uso, reconoce límites y cumple las instrucciones |
Nota. Elaboración propia; las ponderaciones suman 100 puntos y requieren adaptación y pilotaje; no constituyen una escala validada.
La puntuación de comprensión debe observar si la persona explica relaciones y supuestos, no únicamente si usa vocabulario técnico, y la verificación debe considerar la correspondencia entre las afirmaciones y las fuentes. La aplicación necesita un problema con una variación relevante, la autonomía puede observarse mediante una tarea acotada sin IA y la responsabilidad exige una declaración veraz y la identificación de límites, además del cumplimiento de las instrucciones de uso.
La ponderación no resuelve por sí misma los casos de incumplimiento, pues una infracción debe examinarse conforme al procedimiento anunciado y con evidencias suficientes, sin diluirla automáticamente en una suma de puntos, y, a su vez, una sospecha de infracción no justifica ignorar la competencia demostrada. Separar ambas decisiones permite mantener el objetivo formativo y la integridad, evitando que una única impresión del documento determine todos los juicios.
Casos prácticos sobre el paso del texto recibido a la decisión propia
En un caso hipotético de administración, una herramienta redacta una propuesta para reducir retrasos en un servicio y el aprendiz debe identificar cómo se mide el retraso, qué datos faltan y qué recursos supone la propuesta. Después compara una alternativa de reorganización con otra de contratación y explica qué cambiaría si el presupuesto fuera menor, pues el objetivo de la actividad es mostrar razonamiento sobre restricciones y consecuencias, sin asumir que una propuesta plausible ya está fundamentada.
En una actividad de programación, el estudiante recibe una función generada y debe explicar qué entradas acepta, qué salida produce y qué condición puede hacerla fallar, para luego diseñar una prueba que revele ese fallo y corregir el código. El producto relevante no es únicamente una función que parece operar, sino la capacidad de reconocer su alcance, verificarla y modificarla, y el ejercicio puede realizarse primero con apoyo y después mediante una variación sin la herramienta.
En un análisis profesional de documentos, el aprendiz recibe un resumen y lo contrasta con las fuentes originales, identifica una omisión relevante, distingue lo que el documento dice de lo que la respuesta infiere y reescribe la conclusión con sus límites, utilizando versiones autorizadas o anonimizadas para la actividad si el material incluye información sensible. Este caso ilustra una tarea de revisión documental y no formula asesoramiento jurídico ni sustituye la revisión competente de un asunto real.
En los tres casos, la evaluación debe anunciar el criterio de éxito y reservar una fase de revisión. Un estudiante puede explicar correctamente y todavía equivocarse al ejecutar, o ejecutar por imitación sin comprender, de modo que observar ambas dimensiones permite identificar la necesidad formativa, pues la finalidad no es premiar una declaración general de que se aprendió, sino comprobar acciones concretas que hagan visible la apropiación y permitan corregir sus fallas.
El auditor hostil como método de mejora
La expresión auditor hostil designa aquí una revisión adversarial del argumento y de sus evidencias, cuya función es buscar afirmaciones sin respaldo, generalizaciones indebidas, inconsistencias bibliográficas y propuestas presentadas como si fueran hallazgos. No significa un dictamen humano independiente ni un proceso editorial externo, ya que en esta versión la revisión fue realizada mediante el asistente, con una comprobación documental y una lectura crítica separada de la redacción inicial.
Una primera pregunta hostil es si el artículo confunde detección con atribución de responsabilidad, y responderla exige revisar cada uso de palabras como prueba, porcentaje y certeza. Una segunda pregunta examina si las críticas a detectores se extrapolan a herramientas no estudiadas, y una tercera busca si un resultado educativo inmediato se presenta como aprendizaje permanente, de modo que la corrección consiste en recuperar el contexto, conservar la magnitud exacta y retirar la afirmación que el estudio no sostiene.
Otra objeción importante es que el énfasis en comprender podría servir para justificar la entrega de un trabajo prohibido, inferencia que el artículo rechaza porque la competencia y la autorización son dimensiones distintas y una persona puede aprender mediante una práctica que incumple las reglas de una evaluación concreta. Por ello, el modelo conserva la declaración de uso y el procedimiento de integridad, mientras propone mejorar la forma de comprobar las competencias.
El auditor también debe cuestionar la propuesta pedagógica, pues una rúbrica razonable puede carecer de fiabilidad entre evaluadores y un protocolo puede imponer una carga excesiva. La respuesta no consiste en declarar que ya están validados, sino en pilotarlos, comparar puntuaciones, recoger dificultades y modificar su diseño, y una auditoría útil hace visibles esos límites y deja un procedimiento de mejora, en lugar de añadir una etiqueta de perfección al documento.
Cómo poner a prueba la propuesta en una institución
Una implementación inicial puede seleccionar un curso y una competencia concreta, conservar criterios comunes y comparar dos momentos de desempeño. Antes de usar IA se obtiene una evidencia breve del punto de partida, después se realiza una actividad asistida y una tarea equivalente sin ayuda, y una comprobación posterior permite examinar retención, aunque el diseño debe considerar las diferencias entre tareas y no asumir que cualquier cambio observado fue causado únicamente por la herramienta.
El pilotaje debe registrar la calidad de las respuestas y el costo de evaluación, para lo cual resulta útil observar cuánto tiempo requieren docentes y estudiantes, qué partes de la bitácora aportan información y qué criterios producen desacuerdos. La existencia de dos evaluadores sobre una muestra puede ayudar a identificar ambigüedades de la rúbrica, si bien estas recomendaciones describen un plan de validación futura y no resultados que el presente artículo haya obtenido.
Si se utiliza un detector, conviene evaluarlo por separado con materiales de procedencia documentada y usos representativos del curso, en un conjunto que debe incluir las operaciones permitidas, para evitar clasificarlas erróneamente como la conducta que se desea controlar, y conservar también la versión y el umbral. Un conjunto pequeño puede servir para detectar problemas iniciales, pero no ofrece necesariamente estimaciones precisas de errores poco frecuentes ni una validación general del producto.
La institución necesita revisar si el procedimiento mejora el aprendizaje y si mantiene decisiones comprensibles y proporcionadas, pues no basta con aumentar el número de controles o reducir la cantidad de informes positivos cuando un sistema puede parecer más estricto y seguir midiendo mal. El criterio de mejora propuesto es obtener evidencias más pertinentes sobre las competencias, con reglas claras, fuentes verificables y una carga compatible con la enseñanza.
Discusión sobre lo que importa aprender de un trabajo hecho con IA
Un trabajo elaborado con apoyo de IA puede servir como explicación, ejemplo, objeto de crítica o material de práctica, y su utilidad educativa aparece cuando activa operaciones que la persona necesita dominar. En el enfoque de Miao y Holmes (2023/2024), la incorporación de estas herramientas requiere conservar la agencia humana y validar sus usos, orientación que la presente revisión desarrolla mediante exigencias de comprensión, verificación y aplicación, sin convertirlas en un resultado experimental propio.
Lo importante que el ser humano debe aprender no es únicamente el contenido aparente de la respuesta, pues debe aprender a formular la pregunta, a reconocer qué evidencia necesita, a distinguir una afirmación de una inferencia y a valorar las consecuencias de actuar, y necesita saber también qué puede delegar y qué debe conservar bajo su responsabilidad. Estas capacidades son parte del trabajo intelectual aunque no todas queden registradas en el número de palabras del documento final.
La formación debe incluir el reconocimiento de la incertidumbre, pues una persona competente puede decir que no sabe, señalar una fuente insuficiente o modificar su conclusión ante nueva evidencia. La fluidez de una respuesta automatizada puede hacer menos visible esa necesidad, por lo que la evaluación debe permitir y valorar las correcciones fundamentadas, en tanto aprender de la IA implica poder discutir su respuesta, no solo adoptarla o descartarla de manera automática.
También debe aprenderse a trabajar con herramientas dentro de una comunidad de reglas y responsabilidades, en la que declarar el uso, respetar los límites de una actividad y proteger la información son acciones compatibles con el aprendizaje. La cuestión de procedencia conserva importancia cuando la autoría o una ejecución personal son parte del objetivo, y la propuesta no sustituye esa exigencia, sino que pide evaluarla con evidencia pertinente y distinguirla de la competencia adquirida.
Conclusiones
Los detectores de IA aplican procedimientos de clasificación o de búsqueda de señales bajo condiciones específicas y pueden aportar información, pero sus resultados necesitan una interpretación que respete el texto analizado, la definición de las categorías y los errores posibles. Las evaluaciones revisadas justifican cautela ante su uso indiscriminado, y ninguna de esas observaciones permite convertir un porcentaje marcado en el porcentaje exacto de todo el trabajo intelectual realizado por IA.
La evidencia educativa revisada muestra que la ayuda puede mejorar el desempeño durante una actividad y que el diseño de esa ayuda influye en los resultados posteriores, aunque no sostiene que toda IA produzca aprendizaje ni que cualquier uso lo perjudique. Por ello, una evaluación centrada solo en el acabado del documento es insuficiente para conocer la formación de la persona, y es necesario observar qué puede explicar, verificar, recuperar y resolver con y sin apoyo.
El criterio central propuesto es valorar la apropiación humana del conocimiento, lo que supone comprender sus relaciones, aprender mediante práctica y revisión, aplicandolo en una situación nueva, mientras que la transparencia y el cumplimiento de las reglas siguen siendo exigencias distintas y necesarias.
Una educación que incorpora IA necesita enseñar a producir mejores respuestas y a hacerse responsable de ellas, y en ella el documento deja de ser la única evidencia y pasa a integrarse con explicaciones, fuentes, decisiones y desempeño. Esta ampliación permite que la evaluación atienda el propósito de formar personas capaces de comprender y actuar, al mismo tiempo que mantiene criterios de integridad y reconoce los límites de sus propios instrumentos.
– José Antonio Pérez Ramos
Fuentes de Información
Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö., y Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. Proceedings of the National Academy of Sciences, 122(26), Artículo e2422633122. https://doi.org/10.1073/pnas.2422633122
Dugan, L., Hwang, A., Trhlik, F., Ludan, J. M., Zhu, A., Xu, H., Ippolito, D., y Callison-Burch, C. (2024). RAID: A shared benchmark for robust evaluation of machine-generated text detectors. En L.-W. Ku, A. Martins, y V. Srikumar (Eds.), Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long papers) (pp. 12463–12492). Association for Computational Linguistics. https://doi.org/10.18653/v1/2024.acl-long.674
Dunlosky, J., Rawson, K. A., Marsh, E. J., Nathan, M. J., y Willingham, D. T. (2013). Improving students’ learning with effective learning techniques: Promising directions from cognitive and educational psychology. Psychological Science in the Public Interest, 14(1), 4–58. https://doi.org/10.1177/1529100612453266
Gehrmann, S., Strobelt, H., y Rush, A. M. (2019). GLTR: Statistical detection and visualization of generated text. En M. R. Costa-jussà y E. Alfonseca (Eds.), Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics: System demonstrations (pp. 111–116). Association for Computational Linguistics. https://doi.org/10.18653/v1/P19-3019
Karpicke, J. D., y Roediger, H. L., III. (2008). The critical importance of retrieval for learning. Science, 319(5865), 966–968. https://doi.org/10.1126/science.1152408
Kestin, G., Miller, K., Klales, A., Milbourne, T., y Ponti, G. (2025). AI tutoring outperforms in-class active learning: An RCT introducing a novel research-based design in an authentic educational setting. Scientific Reports, 15, Artículo 17458. https://doi.org/10.1038/s41598-025-97652-6
Kirchenbauer, J., Geiping, J., Wen, Y., Katz, J., Miers, I., y Goldstein, T. (2023). A watermark for large language models. En A. Krause, E. Brunskill, K. Cho, B. Engelhardt, S. Sabato, y J. Scarlett (Eds.), Proceedings of the 40th International Conference on Machine Learning (Vol. 202, pp. 17061–17084). PMLR. https://proceedings.mlr.press/v202/kirchenbauer23a.html
Liang, W., Yuksekgonul, M., Mao, Y., Wu, E., y Zou, J. (2023). GPT detectors are biased against non-native English writers. Patterns, 4(7), Artículo 100779. https://doi.org/10.1016/j.patter.2023.100779
Miao, F., y Holmes, W. (2024). Guía para el uso de IA generativa en educación e investigación (Prioridade Consultoria Ltda., Trad.). UNESCO. https://unesdoc.unesco.org/ark:/48223/pf0000389227_spa(Obra original publicada en 2023).
Miao, F., Shiohira, K., y Lao, N. (2025). Marco de competencias para estudiantes en materia de IA (L. Pavón, Trad.). UNESCO. https://doi.org/10.54675/EKCU4552 (Obra original publicada en 2024).
Mitchell, E., Lee, Y., Khazatsky, A., Manning, C. D., y Finn, C. (2023). DetectGPT: Zero-shot machine-generated text detection using probability curvature. En A. Krause, E. Brunskill, K. Cho, B. Engelhardt, S. Sabato, y J. Scarlett (Eds.), Proceedings of the 40th International Conference on Machine Learning (Vol. 202, pp. 24950–24962). PMLR. https://proceedings.mlr.press/v202/mitchell23a.html
Turnitin. (2026). Using the AI writing report. Recuperado el 1 de octubre de 2026, de https://guides.turnitin.com/hc/en-us/articles/22774058814093-Using-the-AI-Writing-Report
Vanderbilt University. (2023, 16 de agosto). Guidance on AI detection and why we’re disabling Turnitin’s AI detector. Brightspace. https://www.vanderbilt.edu/brightspace/2023/08/16/guidance-on-ai-detection-and-why-were-disabling-turnitins-ai-detector/
Weber-Wulff, D., Anohina-Naumeca, A., Bjelobaba, S., Foltýnek, T., Guerrero-Dib, J., Popoola, O., Šigut, P., y Waddington, L. (2023). Testing of detection tools for AI-generated text. International Journal for Educational Integrity, 19, Artículo 26. https://doi.org/10.1007/s40979-023-00146-z
Autor:
Dr. José Antonio Pérez Ramos
Síguenos en redes
¡Deja tu comentario!
Aquí encontrarás artículos, reseñas y pensamientos que dialogan con la historia, la filosofía y la literatura, invitando siempre a la reflexión crítica.