Поворот Черновик

«Внимание — всё, что нужно»: появляется Transformer, на котором вырастет ChatGPT

В июне 2017 года восемь исследователей, в основном из Google, предложили новый способ устройства нейросетей — Transformer. Тогда это выглядело как работа про машинный перевод. Сегодня на этой идее построены почти все чат-боты, включая ChatGPT.

Чтобы понять, почему эта статья так важна, нужно вспомнить, как компьютеры работали с текстом раньше. Нейросети читали предложение строго по порядку, слово за словом, — как человек, который ведёт пальцем по строке. Это было медленно, а к концу длинного текста модель плохо помнила начало.

12 июня 2017 года восемь исследователей — Ашиш Васвани, Ноам Шазир, Ники Пармар, Якоб Ушкорайт, Ллион Джонс, Эйдан Гомес, Лукаш Кайзер и Илья Полосухин — выложили статью «Attention Is All You Need» («Внимание — всё, что нужно»). Они предложили устройство нейросети, которое назвали Transformer.

Transformer смотрит на весь текст сразу и для каждого слова решает, на какие другие слова обратить «внимание», чтобы понять смысл. Например, в фразе «кошка не запрыгнула на шкаф, потому что он был слишком высоким» модель может понять, что «он» — это шкаф, а не кошка.

Авторы проверили идею на машинном переводе и обошли лучшие системы того времени. Причём на обучение ушли считаные дни.

Почему это важно

У нового подхода было главное достоинство: работу можно делить между множеством процессоров одновременно. Значит, модель можно учить на огромных объёмах текста и делать всё больше — а она от этого становится умнее. Именно рецепт «больше данных и больше вычислений» через пять лет привёл к ChatGPT.

Буква T в названии GPT означает как раз Transformer. Но в 2017 году статья выглядела просто как сильная работа о переводе — её настоящее значение стало понятно позже.

Для любопытных

На англо-немецком тесте WMT 2014 (Workshop on Machine Translation — ежегодное соревнование систем машинного перевода) модель набрала 28,4 балла BLEU (Bilingual Evaluation Understudy — автоматическая оценка качества перевода) — на 2 с лишним балла выше прежнего рекорда. На англо-французском — 41,8 балла, рекорд для одиночной модели, после 3,5 дня обучения на восьми GPU (Graphics Processing Unit — графический процессор). Transformer отказался от рекуррентных и свёрточных сетей, которые до этого считались стандартом для работы с текстом.

Источники

  1. Attention Is All You Need, arXiv, 12 июня 2017 (первоисточник)