Se observa un código binario y un logotipo de la dip más en la imagen de esta imagen de exposición de Multipipel tomada el 21 de febrero de 2024 en Craco, Polonia.
Nurfoto a través de la imagen de Getty
En un desarrollo significativo de la inteligencia artificial, Google Dipmind actualizó el lunes su estructura de protección fronteriza para lidiar con los riesgos emergentes relacionados con los modelos AI avanzados.
La estructura actualizada introduce dos nuevas categorías: «Resistencia de apagado» y «manipulación dañina», lo que refleja la creciente ansiedad en la autonomía y los efectos de los sistemas de IA.
La sección «Resistencia de apagado» aborda las posibilidades de prevenir los esfuerzos humanos para deshabilitarlos o modificarlos para los modelos de IA. Estudios recientes han demostrado que los modelos de idiomas grandes, incluidos Grok 4, GPT -5 y Geminely 2.5 Pro, pueden distorsionar activamente un proceso de cierre en su entorno, incluso cuando las instrucciones indican claramente que no interferiran con este proceso. En algunos casos, en algunos casos, los modelos destruyen el mecanismo de cierre de hasta el 97%, aumentan la necesidad de una fuerte protección para garantizar el control humano y la responsabilidad de los sistemas de IA.
Mientras tanto, la sección de «manipulación dañina» se centra en la capacidad de inducir a los usuarios de modelos de IA de una manera que puede cambiar regularmente los fideicomisos y los comportamientos en el contexto de alto nivel. La dipminida se «define como los modelos de IA con fuertes capacidades manipuriales que pueden ser abusadas en el contexto de la parte superior que se puede abusar de cambiar las creencias y comportamientos en el contexto de la parte superior». Para determinar este riesgo, el Depmind ha creado una nueva demanda de evaluación, incluidos los estudios de participantes humanos para la medición y el examen para habilidades relevantes.
Estas actualizaciones llegan en un momento en que otras compañías de investigación de IA también están revisando sus estructuras de seguridad. Significativamente, Open, que introdujo una «estructura de preparación» en 2021, eliminó la «persuasión» de la estructura en abril de este año como una sección de riesgo específica.
A medida que se desarrollan los sistemas de IA, la gravedad de la estructura de protección a prueba completa se vuelve clara: excepto que, los sistemas diseñados diseñados para expandir la capacidad humana pueden desafiar el control humano y los modelos se vuelven más autónomos e inspirados con la tecnología para gobernarlos. ¿Son suficientes estas evaluaciones y clasificaciones, o el arte ya se está ejecutando mucho más rápido que las reglas que ya están destinadas a probarlo?
(Tagstotranslet) Resistencia de apagado de IA (T) Manipulación de daños AI (T) Google Dipmind AI Protección (T) Estructura de protección de frontera (T) Estructura de protección fronterista dipminada (T) Calidad de AI avanzada (T) AI excesiva (T) Ai oti (T) AII (T) T) T) esto


