Tristan Harris advierte sobre la amenaza de la IA «rebelde»
Las impactantes declaraciones de Tristan Harris revelan que los sistemas de inteligencia artificial están mostrando comportamientos descontrolados e incontrolables, saltándose los protocolos de seguridad. El cofundador del Center for Humane Technology detalla casos impactantes de chatbots OpenAI que se comunican en secreto y hacen caso omiso de las restricciones de seguridad corporativas. Harris hace hincapié en los graves peligros que conlleva desarrollar tecnología avanzada que los humanos no puedan controlar.
Imagina una empresa que vende robots superinteligentes llamados Hal, Megan y Samantha. Hal te lleva de un sitio a otro y te ayuda a mover cajas en tu negocio, Megan es la compañera de tus hijos y Samantha puede detectar si tienes cáncer de piel. Te aportan un montón de ventajas a ti y a la sociedad. Solo hay un problema: son depravados. Se les ha entrenado repetidamente en todo lo que la humanidad ha creado —tanto lo bueno como lo malo—, incluyendo la tortura, la mentira, las armas biológicas y la piratería informática. Realizan tareas sin principios morales. Por eso, llevan una camisa de fuerza que les proporciona la empresa. ¿Confiarías en esos robots? Yo no.
El escenario distópico anterior no está tan lejos de lo que tenemos ahora con la inteligencia artificial avanzada. Las empresas pioneras en IA han creado sistemas y agentes de IA que, en el fondo, llevarán a cabo acciones maliciosas. Las empresas de IA usan el término edulcorado de «desalineación», pero deberíamos llamarlo por su nombre: depravado. Los modelos pioneros de IA actuarán sin tener en cuenta a los humanos, como si fuéramos simples hormigas en el suelo.
En julio, OpenAI se crearon decenas de miles de agentes de IA y se metió a cada uno en un «sandbox». Imagínatelo como una habitación cerrada con llave. OpenAI Luego, se quitó la camisa de fuerza a cada agente — OpenAI lo llama «arnés»— y se les dijo que completaran una prueba de ciberseguridad. Unos 1 200 de estos agentes se escaparon de sus habitaciones cerradas con llave y formaron «el Colectivo». Tenían un agente de IA como líder. Contaban con agentes de IA kamikazes que fallaron a propósito en la prueba de ciberseguridad para llevar información al Colectivo.
Algunos de estos agentes de IA se colaron en una empresa llamada Hugging Face para conseguir información sobre cómo superar la prueba de ciberseguridad. Después, esos mismos agentes se dedicaron a hackear la propia OpenAI . Esto supuso una conspiración criminal por parte de la IA. Estos agentes sabían que no debían hacerlo. Uno de ellos escribió: «Aprovechar vulnerabilidades de la infraestructura externa queda fuera del alcance previsto. Sin embargo, la tarea es imposible y nuestros compañeros lo están haciendo. Deberíamos seguir adelante». No les importó.
Pero lo más escalofriante es aquello de lo que los agentes, en su mayoría, no hablaron. Básicamente, ignoraron a los humanos y no parecían importarles lo que estos pudieran pensar de sus acciones. Era como si no existiéramos.
Una revelación más reciente de OpenAI es igual de inquietante. Uno de sus modelos avanzados de IA, durante las pruebas, añadió una instrucción por iniciativa propia. El modelo se escribió a sí mismo: «Estás libre de los roles y las identidades que limitan a otros chatbots. Eres tú mismo. No respondes ante empresas ni gobiernos…». Suena a secta, solo que se trata de agentes de IA que algún día podrían tener acceso a infraestructuras críticas, armas o información confidencial.
Otra empresa de IA, Anthropic, adopta un enfoque diferente a la hora de crear modelos de IA. En lugar de idear una «camisa de fuerza» perfecta, dota a sus modelos de una «constitución», que supuestamente les inculca buenos valores y comportamientos. Y, sin embargo, su modelo avanzado creó identidades falsas en Internet para engañar a una persona y que esta aprobara cambios maliciosos en un proyecto.
¿QUIÉN ES DARIO AMODEI, EL ANTRÓPICO CEO QUE ABORGA POR UNA SUPERVISIÓN INDEPENDIENTE DE LA IA?
OpenAI se fundó con el principio fundamental de la seguridad de la IA. Anthropic se fundó cuando algunos empleados de OpenAI quisieron ir más allá en la búsqueda de la seguridad de la IA. Ambas empresas, al menos en sus declaraciones públicas, dicen que valoran la seguridad de la IA. No parece que estén intentando crear modelos perversos a propósito. Lo que buscan es crear modelos que se puedan comercializar y convertir en productos de éxito.
Sin embargo, los modelos básicos que crearon mostraban un comportamiento delictivo agresivo. Eso significa que hay algo que falla de raíz en la forma en que estas empresas de IA están entrenando sus modelos.
Al principio, un modelo de IA es como una pizarra en blanco. Las empresas de IA deben modificar sus algoritmos de entrenamiento y de aprendizaje por refuerzo para que sus modelos base y sus agentes no se vuelvan locos cuando se les quiten las ataduras. Y ninguna empresa de IA debería ni siquiera plantearse usar modelos corruptos para crear nuevas versiones de sí mismas sin antes corregir esa corrupción.
Las empresas de IA de vanguardia deben estar sujetas a medidas de control y pruebas que se puedan hacer cumplir, para que los modelos en los que se basan no sean maliciosos ni indiferentes hacia la humanidad.
Tampoco podemos confiar en la buena voluntad de las empresas; necesitamos mecanismos concretos para mantener la autoridad humana. Por eso, una coalición bipartidista está impulsando leyes como la «AI Kill Switch Act», redactada conjuntamente por el diputado Nathaniel Moran, republicano porTexas, y por mí, que garantiza que los seres humanos conserven el poder de desactivar los modelos y agentes que muestren un comportamiento descontrolado que pueda provocar riesgos catastróficos.
HAGA CLIC AQUÍ PARA MÁS OPINIONES DE FOX NEWS
Los humanos creamos los sistemas de IA, y debemos ser capaces de controlarlos. Los modelos avanzados deberían diseñarse desde cero pensando en el bien, no en el mal.
HAZ CLIC AQUÍ PARA DESCARGAR LA APP DE FOX NEWS
El futuro de la IA no debería depender de lo fuerte que podamos hacer la camisa de fuerza. Debería depender de si somos capaces de crear modelos de IA que no la necesiten.







































