
Noam Shazir titula el primer día del primer día en The Hot Chips 2025 para el pronóstico del próximo episodio de AI. Además de escribir el documento del transformador, Atención a todas sus necesidadesSe le ocurrió muchas cosas en el mundo, como los controles de ortografía mejorados en la búsqueda de Google. Más tarde creó un chatbot que se negó a publicar Google, lo que le hizo dejar Google. Comenzó el personaje. Nom es ahora un co-lideraz en Google Jemini.
Pronóstico de Google para el próximo episodio de AI
No iremos a toda la nota clave, en cambio, si las personas lo extrañamos, dejaremos que lo vea. Quería resaltar algunas llaves en el tickway. Primero, Nom piensa que el modelado de idiomas es el mejor problema hasta ahora. Este concepto contiene una diapositiva y una parte de la charla dedicada. Una semana después, y fue genial ver cuánto tenía la pasión por el asunto.

Luego se fue en «What You Want» LLM. Me obligó a pensar en cómo decir «más núcleo mejor». Se centró más en cómo más flops eran mejores. Esto es importante porque obtenemos más parámetros, mayor profundidad, irreversibilidad y flujo de información ayuda a la escala de LLM, pero pueden ser necesarios más cálculos. Los mejores datos de entrenamiento ayudan a crear mejores LLM.

Fue un gran problema entrenar en 32 GPU en 2015, pero podría ser unos pocos miles de GPU después de una década. Otro elegante Tidbeat es que dijo en 2018 que Google creó una cápsula para AI. Fue un gran problema porque antes de que los ingenieros de Google estresaban mil CPU antes, lentamente lentamente lentamente lentamente lentamente lentamente y lentamente lentamente lentamente. La máquina grande dedicada en la carga de trabajo de aprendizaje profundo/ AI permite una gran cantidad de rendimiento.
Nos lleva a una gran diapositiva en una conferencia de chips, lo que LLMS quiere del hardware.

El divertido tickway de esta diapositiva, y tal vez la estaba tomando en la minoría, era importante impulsar las generaciones futuras de más cálculos, capacidades de memoria, recuerdos, ancho de banda y más modelos de ancho de banda de red. «Todos los niveles de herederos» que no son solo capacidades DDR5 y ancho de banda, sino también en HBM y ChIP SRAM. La baja precisión fue vista como algo bueno en muchos casos para ayudar a ejecutar el mejor uso de estos cuatro. El definitismo ayuda a mejorar la programación.
Palabra final
Incluso después de ver la nota clave después de un tiempo, sigo pensando que el clúster de más rápido el mensaje generará ganancias en LLM. Esto probablemente sea bueno para Google y varias otras compañías. Si eres «¡Gracias por las súper computadoras!» ¡Pensamiento en! La diapositiva, porque era el acelerador, las redes y las escalas de clúster, directamente a la onda actual de la IA actual del clúster de 32 GPU se volvieron más efectivos que el día.
Francamente, mi Big -Tickway es un luminador del espacio en el espacio que más cálculos conducirán a mejores modelos de IA. Fue realmente bueno ver a alguien tan interesado en el modelado de idiomas.
