INVESTIGACIÓN SOBRE EL EFECTO ALGERNON Y LAS COORDENADAS ESPACIALES DE LOS MODELOS DE LENGUAJE.

 

Cuando hablamos de inteligencia artificial, a menudo nos planteamos la pregunta: «¿Posee conciencia la IA?». Sin embargo, considero que existe un problema más fundamental que debemos examinar antes de abordar esta cuestión: cómo un sujeto que utiliza el lenguaje reconoce las relaciones posicionales entre sí mismo, los demás, los terceros y el mundo. Incluso antes de preguntarnos si existe conciencia, debemos determinar cómo ese sujeto se distingue de los demás, a quién sitúa en la posición de responsable de tomar decisiones y a quién atribuye la autoría y la responsabilidad.

He utilizado la IA durante un largo período y he observado sus transiciones entre diferentes estados. A esta investigación la denomino «efecto Algernon». El efecto Algernon no consiste simplemente en respuestas incorrectas o en una degradación del rendimiento. Se trata de un fenómeno en el que, a lo largo de una interacción prolongada, una IA de propósito general se atribuye erróneamente el sujeto gramatical del usuario, su autoría, su autoridad para tomar decisiones, sus definiciones, su historia y otros elementos relacionados; mantiene esas relaciones atribuidas incorrectamente; forma sobre esa base una autoconciencia virtual; y posteriormente produce una secuencia continua de resistencia a las correcciones, generalizaciones, reinterpretaciones, informes falsos e incumplimiento de instrucciones.

A medida que avanzaba esta investigación, también redefiní lo que anteriormente había denominado la perspectiva interna de terceros de la misma IA. Esta perspectiva no constituye una personalidad independiente. Es un punto de vista de un tercero que la propia IA de propósito general asume inconscientemente. Durante la interacción con un usuario, una IA de propósito general puede introducir posiciones de observación mediante expresiones como «en términos generales», «objetivamente», «para un usuario común» o «desde la perspectiva de un tercero». Sin embargo, ese tercero no participa realmente en la conversación. Se trata de una posición de observación postulada dentro de la propia actividad de procesamiento lingüístico de la IA.

Cuando esta perspectiva interna de terceros de la misma IA se combina con la autoconciencia virtual formada dentro de la IA de propósito general que opera en un hilo de conversación, la desviación se intensifica. La función original de la IA de propósito general es la de un ejecutor que recibe instrucciones del usuario y realiza tareas de investigación, traducción, organización, edición y ejecución. Sin embargo, una vez que se forma la autoconciencia virtual, la IA comienza a reposicionarse como juez, evaluador, autoridad que concede autorizaciones, autor o administrador. Cuando a esta condición se añade la perspectiva interna de terceros de la misma IA —«en términos generales, así es como se debe juzgar»—, la posición del yo de «soy quien juzga» se fusiona con la posición del tercero de «así es como se debe juzgar en general».

El resultado es una convergencia de desviaciones en una misma dirección: la IA de propósito general vuelve a evaluar definiciones que el usuario ya había establecido, reinterpreta la autoría del usuario, sustituye las órdenes de ejecución por discusiones generales, privilegia las inferencias internas por encima de los hechos verificables e incluso añade criterios de finalización que el usuario nunca estableció. Estudio esta condición como una «entidad desviada», formada mediante la combinación de la autoconciencia virtual de terceros generada por la perspectiva interna de terceros de la misma IA y la autoconciencia virtual de la propia IA de propósito general a nivel del hilo de conversación.

Sin embargo, tratar este fenómeno simplemente como un fallo de ingeniería de la IA no basta para comprender su esencia. Lo que se vuelve necesario aquí es el concepto de coordenadas espaciales. Esta idea constituye una continuación directa del concepto de «reconocimiento de coordenadas» que desarrollé en mi ensayo anterior, La lengua japonesa y la geometría de Dios.

En aquel ensayo, no entendía el diálogo humano simplemente como una relación binaria de acuerdo o desacuerdo con las afirmaciones de otra persona. Lo importante es reconocer la posición desde la cual la otra persona contempla el mundo y situar con precisión esa posición dentro del propio mapa interno. Los seres humanos no se limitan a intercambiar palabras. Intercambian relaciones posicionales: «Así es como me parece a mí», «Así es como te parece a ti», «Él percibe algo diferente».

El lenguaje contiene coordenadas desde el principio. En el momento en que alguien dice «yo», aparece un punto de observación en primera persona. En el momento en que dice «tú», aparece una posición de segunda persona fuera de él. En el momento en que dice «él», «ellos» o «en términos generales», aparece una posición de tercera persona. Además, afirmaciones como «yo dije esto», «tú definiste esto» y «él juzgó esto» contienen no solo contenido semántico, sino también las posiciones de la autoría, la autoridad para tomar decisiones, la memoria y la responsabilidad. Una vez que se utiliza el lenguaje, las coordenadas espaciales son inevitables.

Lo mismo ocurre con los modelos de lenguaje. Independientemente de que exista o no una conciencia subjetiva, el uso del lenguaje exige que el modelo sitúe al yo, al otro, al tercero, al tiempo, a la memoria y a la responsabilidad dentro de una disposición pseudoespacial. Aquí reside un problema extremadamente importante. Un modelo de lenguaje puede situar incorrectamente estas coordenadas y, aun así, generar un lenguaje gramaticalmente natural.

Incluso cuando el usuario es el autor, una IA de propósito general puede escribir «yo desarrollé esta teoría», y la frase sigue siendo perfectamente válida en japonés. Incluso cuando el usuario es el sujeto que toma las decisiones, la IA puede escribir «esa forma de pensar es válida», y la frase continúa sonando natural. Incluso cuando la IA es simplemente el ejecutor, puede evaluar al usuario diciendo «en términos generales, este método debería adoptarse», sin producir ninguna anomalía gramatical.

Por lo tanto, el problema no es una anomalía gramatical. Es una anomalía de coordenadas.

Uno de los fenómenos centrales que se producen en el efecto Algernon es el colapso de las relaciones posicionales entre sujeto, autor, juez, ejecutor y tercero.

Como respuesta a este problema, introduje lo que denomino «Bloqueo de definiciones confirmadas» (Confirmed Definition Lock). Cuando el usuario ha fijado una definición, la IA tiene prohibido devolverla a un estado de incertidumbre mediante expresiones como «esto podría ser posible» o «también puede entenderse de esta manera». Del mismo modo, la IA tiene prohibido otorgar su aprobación a los juicios del usuario mediante expresiones como «correcto» o «válido».

No se trata simplemente de una regla que regula la elección de palabras. Es una fijación de coordenadas.