Hay un déficit de datos de IA que Lumming. Los investigadores de Google tienen una nueva solución.

Los investigadores de Google Profrobemind tienen una idea de cómo resolver la sequía de datos de IA y puede involucrar su número de Seguro Social.

Los modelos de idiomas grandes para fortalecer la IA requieren muchos datos de capacitación extraídos de programas web, libros y otras fuentes. Cuando se trata del texto en particular, la cantidad de datos en la web considerado como juegos justos para el entrenamiento para los modelos de IA se está raspando más rápido que la creación de nuevos datos.

Sin embargo, una gran parte de los datos no se usa porque es venenoso, se considera incorrecto o ha identificado personalmente información.

En un artículo recientemente publicado, un grupo de investigadores de Google Dipmind ha encontrado alguna forma de usar estos datos para la limpieza y la capacitación, que según ellos son una «herramienta poderosa» para escalar modelos fronterizos.

Se refieren al concepto como refinamiento de datos del generador o RDA. El procedimiento utiliza modelos de generador Pretrine para reescribir los datos de Okzo, purificarlos de manera efectiva para que pueda ser entrenado de manera segura. No está claro que este sea un truco que Google está usando para sus modelos Gemini.

Minki Jiang, uno de los investigadores del documento, que ha dejado la compañía desde entonces, le dijo a Business Insider que muchos laboratorios de IA estaban dejando los datos utilizados en la tabla porque se combinaban con datos malos. Por ejemplo, si hay un documento en la Web para que haya algo considerado como el número de teléfono utilizable, como el número de teléfono o un error de alguien, los laboratorios a menudo cancelan todo.

Ziang dijo: «Así que básicamente perderá todas las fichas dentro de ese documento, incluso si se trataba de una pequeña línea única que contiene cierta información de identificación», dijo Jiang. Los tokens son la unidad de datos, procesada por AI, que produce palabras en el texto.

Los escritores han dado una instancia de datos sin procesar para que alguien pueda incluir el número de seguro social o la información que pronto envejezca («CEO llegada …»). En estos casos, los números de la RDA cambiarán o eliminarán, ignorarán los riesgos de estar obsoletos y mantener el resto de los datos utilizables.

El artículo fue escrito hace más de un año y solo publicado este mes. Un portavoz de Google Dipmind no respondió a ninguna solicitud para comentar si el trabajo del investigador se estaba aplicando a los modelos de IA.

La búsqueda de los escritores puede demostrar ayudar a los laboratorios porque los datos utilizables son secos. Han citado un trabajo de investigación desde 2022 que los modelos de IA pronósticos pueden remojar todos los textos probados por humanos entre 2026 y 2032 Esta predicción se creó en función de la cantidad de datos web índices utilizando el rastreo ordinario, que está constantemente desechado por las páginas web y está disponible para el uso de Labs AI.

Para el documento de la RDA, los investigadores tomaron un millón de código de línea y los lablers de expertos humanos demostraron el concepto de la línea de datos a través de la línea. Luego comparan los resultados con el método RD.

«Aplasta por completo el uso de soluciones de la industria existentes para este tipo de cosas», dijo Jiang.

Los escritores también dijeron que su método es mejor que el uso de datos sintéticos (datos generados por los modelos de IA para el entrenamiento), que se ha convertido en objeto de búsqueda entre los laboratorios de IA. Sin embargo, el uso de datos sintéticos puede reducir la calidad de la salida del modelo y, en algunos casos, conduce al «colapso».

Los escritores compararon datos de la RDA contraria a los datos sintéticos creados por LLM y descubrieron que sus modelos de IA de enfoque se crearon para la capacitación.

También dicen que algunos tipos de datos más complejos pueden probarse como un GO, como materiales con derechos de autor y datos personales que se especifican en múltiples documentos sin ortografía.

Ziang dijo que el documento no fue revisado, agregó que era común en la industria de la tecnología y que todos los documentos fueron revisados ​​internamente.

Los investigadores simplemente probaron la RDA en el texto y la codificación. Ziang dijo que también podría probarse en otros métodos como video y audio. Sin embargo, la tarifa a la que se generan nuevos videos todos los días, todavía proporcionan datos FirHoz para la capacitación de IA.

Ziang dijo: «Con el video, solo obtendrás más, solo millones de horas de video tienen un flujo constante que se genera todos los días», dijo Jiang. «Así que creo que vamos a desbloquear muchos más datos cruzando nuevos métodos fuera del texto, videos e imágenes».

¿Tienes algo para compartir? Póngase en contacto con este reportero por correo electrónico hlangley@businessinsider.com O señal al 628-228-1836. Use una dirección de correo electrónico privada y un dispositivo no laboral; Nuestra guía está aquí para compartir información de manera seguraEl

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *