Чудо, которое готовилось пять лет
Тем, кто открыл ChatGPT в начале декабря 2022 года, казалось, что будущее наступило за одну ночь. Ещё вчера компьютер не понимал простых просьб, а сегодня пишет стихи, объясняет квантовую физику и шутит.
Но у этого «внезапного» чуда долгая предыстория. Почти всё, что сделало ChatGPT возможным, появилось за пять с половиной лет до него. Сначала идея в научной статье. Потом лаборатория, которая решила поставить на эту идею всё. Потом открытие, что модели становятся умнее просто от того, что их делают больше. И наконец, способ научить их разговаривать по-человечески.
Пролог рассказывает, как эти части сошлись вместе. В этой истории пока мало громких событий: большинство людей ничего о ней не знали. Зато здесь закладывается всё, что случится дальше.
До начала: как машины научились видеть и играть
Идее думающей машины почти семьдесят лет. Сам термин «искусственный интеллект» появился в середине 1950-х, и с тех пор область не раз переживала взлёты и «зимы» — периоды, когда обещания не сбывались, а деньги уходили.
Перелом начался в 2012 году. Трое исследователей из Торонто — Алекс Крижевский, Илья Суцкевер и Джеффри Хинтон — показали нейросеть, которая узнавала предметы на фотографиях лучше любых прежних программ. Её обучили на 1,3 миллиона снимков, разложенных по тысяче категорий: собаки, машины, грибы, музыкальные инструменты. Причём обучали не на суперкомпьютере, а на двух игровых видеокартах Nvidia — запомним и эту деталь.
Нейросеть — это программа, которая устроена отдалённо похоже на мозг. Её не программируют правилами вроде «если у животного длинные уши, это заяц». Ей показывают тысячи примеров, и она сама подбирает внутренние настройки, пока не начнёт угадывать правильно. Такой подход называют глубоким обучением.
С 2012 года глубокое обучение стало главным направлением в ИИ. Запомним одно имя из той тройки — Илья Суцкевер. Через три года он станет одним из основателей лаборатории, которая сделает ChatGPT.
В марте 2016 года мир увидел, на что способен новый подход. Программа AlphaGo от лондонской компании DeepMind, принадлежащей Google, обыграла в Сеуле Ли Седоля — одного из сильнейших игроков в го — со счётом 4:1. За матчем следили больше 200 миллионов человек.
Особенно запомнился 37-й ход второй партии. AlphaGo поставила камень туда, куда, по расчётам самой AlphaGo, профессионал поставил бы его с вероятностью один к десяти тысячам. Комментаторы были в недоумении. Но ход оказался сильным, и AlphaGo выиграла партию.
Го долго считали игрой, где компьютеру не победить человека: вариантов слишком много, чтобы перебрать их все. AlphaGo показала, что машина может находить решения, которых не подсказывал никто.
Но и распознавание картинок, и игра в го — это узкие задачи. С языком всё было сложнее. Компьютеры кое-как переводили тексты и отвечали на простые команды голосовых помощников, но настоящего понимания речи не было. Именно здесь и случится главный поворот.
Июнь 2017: статья, которую почти никто не заметил
12 июня 2017 года восемь исследователей, в основном из Google, выложили в открытый архив научных статей работу с необычно дерзким названием — «Attention Is All You Need», то есть «Внимание — всё, что нужно».
Чтобы понять, что они предложили, представьте, как нейросети читали текст до этого. Строго по порядку, слово за словом, как человек, который ведёт пальцем по строке. Каждое новое слово модель пыталась связать с тем, что запомнила раньше. Но память у неё была короткая: к концу длинного предложения начало уже расплывалось. И главное — такое чтение нельзя ускорить. Пока не прочитано пятое слово, нельзя браться за шестое.
Авторы статьи предложили другое устройство нейросети и назвали его Transformer. Он читает весь текст сразу. Для каждого слова модель решает, на какие другие слова обратить «внимание», чтобы понять смысл. В предложении «кошка не запрыгнула на шкаф, потому что он был слишком высоким» модель учится понимать, что «он» — это шкаф. А в предложении «кошка не запрыгнула на шкаф, потому что она устала» — что «она» — это кошка.
Авторы проверили новинку на машинном переводе — с английского на немецкий и французский — и обошли лучшие системы того времени. Причём на обучение ушли считаные дни.
Для специалистов это была сильная работа о переводе. Мало кто увидел в ней начало новой эпохи. Но у Transformer было свойство, которое окажется важнее всего остального: работу можно делить между тысячами процессоров одновременно. Раз модель читает текст целиком, все слова можно обрабатывать параллельно.
Это значит, что такую модель можно сделать огромной и обучить на огромном количестве текста — быстрее и дешевле, чем прежние нейросети. Через пять лет буква T в названии GPT будет означать именно Transformer.
Странная лаборатория из Сан-Франциско
Чтобы идея превратилась в ChatGPT, понадобился кто-то, кто поставит на неё всё. Этим кем-то стала OpenAI.
Её основали в декабре 2015 года как некоммерческую исследовательскую организацию. Цель сформулировали так: развивать цифровой интеллект так, чтобы это с наибольшей вероятностью принесло пользу всему человечеству. Деньги — в сумме миллиард долларов — пообещали основатели и спонсоры: Сэм Альтман, Грег Брокман, Илон Маск, Рид Хоффман, Джессика Ливингстон, Питер Тиль и несколько компаний. Научным руководителем стал Илья Суцкевер.
Создатели OpenAI объясняли: некоммерческий статус позволит работать в интересах всех, а не акционеров одной корпорации. Эта идея — и противоречия вокруг неё — будут сопровождать OpenAI всю книгу.
2018: машина, которая сначала читает
11 июня 2018 года OpenAI показала модель, которую позже назовут GPT-1. В ней было простое, но важное открытие.
Раньше нейросеть для каждой задачи учили отдельно. Хочешь, чтобы она определяла тон отзывов, — покажи ей тысячи размеченных отзывов. Хочешь, чтобы она отвечала на вопросы, — собери тысячи вопросов с ответами. Такую разметку делают люди, это долго и дорого.
OpenAI сделала по-другому. Сначала модель на основе Transformer просто читала много текста — несколько тысяч книг — и училась угадывать следующее слово. Никто ничего не размечал: книга сама подсказывает правильный ответ. Так модель впитывала, как устроен язык. И только потом её немного доучивали на конкретную задачу — и она справлялась с ней лучше моделей, которые учили с нуля.
Этот подход назвали предобучением. Именно его означают две другие буквы в GPT — Generative Pre-trained Transformer, «генеративный предобученный трансформер».
В октябре того же года Google показала свою модель на основе Transformer — BERT (Bidirectional Encoder Representations from Transformers). Она тоже училась на неразмеченных текстах и стала рекордсменом во множестве языковых задач. Позже Google встроит такие модели в свой поиск, и они начнут лучше понимать запросы миллиардов людей.
Казалось бы, Google была впереди: она придумала Transformer, у неё были деньги, данные и лучшие учёные. Но Google использовала новые модели внутри своих сервисов — чтобы поиск работал чуть лучше. OpenAI делала ставку на другое: что модель, которая читает всё больше, однажды научится чему-то принципиально новому.
2019: «слишком опасно, чтобы публиковать»
14 февраля 2019 года OpenAI объявила о модели GPT-2. Она была намного больше первой — 1,5 миллиарда параметров — и обучалась на восьми миллионах веб-страниц.
Параметры — это те самые внутренние настройки, которые нейросеть подбирает во время обучения. Чем их больше, тем больше модель может запомнить и уловить. Полтора миллиарда — как полтора миллиарда регуляторов на огромном пульте.
GPT-2 умела писать связные тексты на несколько абзацев. Дашь ей начало новости — она допишет продолжение, правдоподобное и местами пугающе убедительное.
Но громче всего прозвучало другое. OpenAI объявила, что не выложит полную модель: боится, что её используют для массового производства фейковых новостей, спама и оскорблений. Вместо этого компания опубликовала уменьшенную версию и описание работы, назвав это экспериментом в ответственном раскрытии. Большие версии в течение года выкладывали постепенно.
Одни посчитали это разумной осторожностью. Другие — рекламным ходом: мол, «слишком опасный ИИ» — лучший способ привлечь внимание. Так или иначе, впервые вопрос «а не опасна ли эта технология?» задала сама лаборатория, которая её создала. Этот спор станет одной из главных линий книги.
В том же году OpenAI изменилась изнутри. Обучение всё больших моделей требовало всё больше денег, а пожертвований на это не хватало. В марте 2019 года организация создала коммерческую «дочку» с необычным устройством — компанию с ограниченной прибылью. Инвесторы первого раунда могли заработать не больше чем в сто раз от вложенного, а всё сверх этого должно было уйти некоммерческой OpenAI, которая сохраняла контроль.
В июле 2019 года Microsoft вложила в OpenAI миллиард долларов. Взамен Microsoft стала её единственным облачным провайдером и приоритетным партнёром по выводу технологий на рынок. Компании договорились вместе строить суперкомпьютеры для обучения моделей. Союз, который через три с половиной года изменит расклад сил во всей индустрии, был заключён.
2020: рецепт найден — больше
В январе 2020 года исследователи OpenAI опубликовали работу, которая звучала почти как закон природы. Они обнаружили, что качество языковых моделей растёт предсказуемо: чем больше модель, данных и вычислений, тем меньше она ошибается — и это правило держится на огромном диапазоне масштабов.
Это меняло всё. Если прогресс предсказуем, то следующий шаг понятен: строить модели ещё больше. Не нужно ждать гениального озарения — нужны деньги, чипы и данные.
28 мая 2020 года OpenAI опубликовала описание GPT-3. В ней было 175 миллиардов параметров — в десять раз больше, чем в любой подобной модели до неё.
GPT-3 умела то, чего раньше не ждали от языковых моделей. Её не нужно было доучивать под каждую задачу. Достаточно было написать в запросе пару примеров — скажем, три пары «английское слово — французское слово» — и модель понимала, что от неё хотят, и продолжала сама. Это назвали обучением по нескольким примерам. Модель будто научилась учиться прямо в разговоре.
11 июня 2020 года OpenAI открыла доступ к GPT-3 через API (Application Programming Interface — программный интерфейс): разработчики, получившие приглашение, могли подключить модель к своим программам. Посыпались демонстрации. GPT-3 писала код по описанию, сочиняла стихи, придумывала рекламные тексты, имитировала стиль известных писателей.
В сентябре 2020 года британская газета The Guardian опубликовала колонку под заголовком о том, что её целиком написал робот. Текст убеждал читателей, что людям нечего бояться ИИ. Позже выяснилось, что GPT-3 написала восемь разных вариантов, а редакторы собрали из них лучшие куски. Критики назвали подачу вводящей в заблуждение: она скрывала, сколько работы сделали люди.
Эта история хорошо показывает тот момент. Модель уже умела удивлять, но её возможности часто преувеличивали. Пользоваться ею могли только разработчики, а широкая публика видела лишь отдельные яркие примеры.
У GPT-3 были и очевидные слабости. Она не отличала факты от выдумки, легко сбивалась в длинных рассуждениях и могла повторять предрассудки, которыми полны тексты в интернете. А главное — она умела продолжать текст, но не понимала, что от неё хотят. Чтобы получить хороший ответ, нужно было хитро сформулировать начало, будто подсовывая модели первую страницу нужного документа. Это умение даже получило название — составление промптов, то есть запросов к модели.
Железо: почему всё упирается в чипы
Пока учёные спорили о моделях, тихо решался вопрос, который окажется не менее важным: на чём их считать.
Обучение нейросети — это огромное количество однотипных вычислений: умножить, сложить, повторить миллиарды раз. Обычный процессор компьютера делает такие операции по очереди. А видеокарты изначально создавали для игр: чтобы рисовать на экране миллионы точек одновременно, они умеют выполнять тысячи простых вычислений параллельно. Оказалось, что для нейросетей это ровно то, что нужно.
Мы уже видели, что нейросеть 2012 года обучили на двух игровых видеокартах Nvidia. С тех пор графические процессоры, или GPU (Graphics Processing Unit — графический процессор), стали главным инструментом ИИ, а Nvidia — его главным поставщиком.
Но для моделей вроде GPT-3 двух видеокарт было мало. В мае 2020 года, за девять дней до публикации о GPT-3, Microsoft объявила, что построила для OpenAI суперкомпьютер: больше 285 тысяч процессорных ядер и 10 тысяч графических процессоров. По словам Microsoft, он входил в пятёрку самых мощных публично известных суперкомпьютеров мира.
Вот что на самом деле означал «рецепт масштаба». Чтобы сделать модель умнее, нужно больше вычислений, а значит — больше чипов, больше электричества и больше денег. Тот, у кого есть доступ к самым мощным чипам, получает преимущество в гонке. Этот простой вывод скоро превратит видеокарты в предмет большой политики, а Nvidia — в одну из самых дорогих компаний мира.
30 ноября 2020: задача, над которой бились полвека
Ровно за два года до появления ChatGPT, 30 ноября 2020 года, случилось событие, которое для науки, возможно, важнее всего в этой предыстории. Только произошло оно не в языке, а в биологии.
Белки — это молекулы, из которых построена и которыми управляется вся жизнь. Каждый белок — длинная цепочка, которая сворачивается в сложную трёхмерную форму. От формы зависит, что белок делает: переносит кислород, борется с вирусом или вызывает болезнь. Узнать форму по цепочке было одной из главных нерешённых задач биологии — около 50 лет. Экспериментально это занимало месяцы и годы работы.
Раз в два года учёные устраивают соревнование CASP: программы должны предсказать форму белков, которую уже определили в лабораториях, но ещё не опубликовали. В 2020 году система AlphaFold 2 от DeepMind набрала на нём медианную оценку 92,4 из 100. По словам одного из организаторов соревнования, результат около 90 считается сопоставимым с экспериментальными методами.
Задачу, над которой бились полвека, по сути решила нейросеть. Через четыре года руководитель DeepMind Демис Хассабис и его коллега Джон Джампер получат за это Нобелевскую премию по химии — об этом в одной из следующих частей.
Через восемь месяцев, в июле 2021 года, DeepMind вместе с Европейской лабораторией молекулярной биологии (EMBL, European Molecular Biology Laboratory) открыла бесплатную базу с предсказанными формами около 350 тысяч белков — включая все примерно 20 тысяч белков, которые есть в организме человека. То, на что раньше уходили годы работы лабораторий, стало доступно любому учёному в несколько кликов. Для разработки лекарств и понимания болезней это огромный задел.
AlphaFold — напоминание, что ИИ — это не только чат-боты. Сюжетная линия «ИИ в науке» начинается здесь.
2021: ИИ берёт в руки кисть и клавиатуру
5 января 2021 года OpenAI показала DALL·E — модель, которая рисует картинки по текстовому описанию. Напишешь «картина: капибара сидит в поле на рассвете» — и получишь картинку. По сути это была версия GPT-3 на 12 миллиардов параметров, обученная на парах «текст — изображение».
Первые картинки DALL·E были размытыми и странными, но сама идея поражала: машина рисует то, чего никогда не видела, соединяя понятия по описанию.
29 июня 2021 года GitHub — крупнейшая площадка для программистов, принадлежащая Microsoft, — представил Copilot, «ИИ-напарника для программиста». Он работал на модели OpenAI Codex и подсказывал программисту целые строки и функции прямо по ходу работы. Это был один из первых массовых случаев, когда языковая модель стала рабочим инструментом для профессионалов.
В том же 2021 году группа бывших сотрудников OpenAI во главе с братом и сестрой Дарио и Даниэлой Амодеи основала компанию Anthropic. Её главным приоритетом объявили безопасность ИИ. Через несколько лет Anthropic станет одним из главных участников гонки.
2022: последний год «до»
2022 год выглядел как обычный год исследований. Но если смотреть из будущего, видно: все детали ChatGPT в нём уже лежали на столе.
Январь. Скрытый ключ. 27 января OpenAI рассказала об InstructGPT. Проблема GPT-3 была в том, что она умела продолжать текст, но плохо выполняла просьбы. Попросишь объяснить что-то шестилетнему ребёнку — она может продолжить список похожих просьб вместо ответа.
OpenAI решила научить модель слушаться с помощью людей. Сначала люди писали образцовые ответы. Потом сравнивали варианты ответов модели и отмечали, какой лучше. На этих оценках обучили отдельную программу-«судью», а уже она помогала доучивать модель. Метод называется RLHF (Reinforcement Learning from Human Feedback — обучение с подкреплением на отзывах людей).
Результат удивил: людям больше нравились ответы маленькой InstructGPT на 1,3 миллиарда параметров, чем огромной GPT-3 на 175 миллиардов. Модель стала реже выдумывать факты. Важно было не только сделать модель больше, но и научить её быть полезной. Именно этот метод через десять месяцев сделает ChatGPT таким удобным собеседником.
Апрель — июль. Картинки для всех. Весной OpenAI показала DALL·E 2. Новая модель рисовала уже реалистичные изображения и умела дорисовывать фотографии. В июле её открыли для бета-тестирования, и интернет заполнился сгенерированными картинками.
Июнь. Спор о сознании. 11 июня газета The Washington Post опубликовала историю Блейка Лемойна, инженера Google. Он общался с внутренним чат-ботом компании LaMDA и пришёл к выводу, что у программы появилось сознание. Google отправила его в отпуск, а в июле уволила, заявив, что его утверждения «совершенно необоснованны», а сам он нарушил правила компании о работе с данными.
Многие специалисты возражали Лемойну: умение складывать убедительные фразы — не то же самое, что чувства. Но история показала две вещи. Во-первых, у Google был чат-бот, способный так впечатлить даже инженера. Во-вторых, люди склонны видеть в говорящей машине живое существо. Обе вещи скоро станут очень важны.
Август. Открытая дверь. 22 августа компания Stability AI выпустила Stable Diffusion — ещё одну модель, которая рисует по описанию. Главное отличие от DALL·E 2: её код и сами «веса» модели (те самые подобранные при обучении настройки) выложили в открытый доступ. Модель можно было скачать и запустить на обычном современном компьютере.
Это был первый громкий эпизод спора, который пройдёт через всю книгу: должны ли самые мощные модели быть закрытыми, как у OpenAI, или открытыми для всех? Сторонники открытости говорили о свободе и конкуренции, противники — о том, что открытую модель нельзя отозвать, если её начнут использовать во вред.
Сентябрь. Обиженные художники. В начале сентября стало известно, что на ярмарке штата Колорадо в США первое место в конкурсе цифрового искусства заняла работа «Théâtre D'opéra Spatial» («Космический оперный театр»). Её автор Джейсон Аллен создал изображение с помощью нейросети Midjourney. В соцсетях его засыпали тысячами комментариев о том, что победа нечестная.
Это был первый массовый конфликт ИИ и творческих профессий: кто автор картины, которую нарисовала машина по описанию человека? И честно ли, что модели учатся на работах художников без их согласия? Эти вопросы только начинают звучать.
Октябрь. Чипы становятся оружием. 7 октября Министерство торговли США ввело новые ограничения на экспорт в Китай. Под запрет попали самые мощные чипы для ИИ, суперкомпьютеры и оборудование для производства передовых микросхем.
Для обычного человека это выглядело как скучная торговая новость. На деле это был ясный сигнал: США считают вычислительные мощности для ИИ вопросом национальной безопасности. Сюжетная линия «США против Китая» начинается здесь. Через два с небольшим года она приведёт к одной из самых громких историй книги — модели DeepSeek-R1.
Ноябрь. Неудачная репетиция. 15 ноября Meta (бывшая Facebook) представила Galactica — языковую модель для учёных, обученную на 48 миллионах фрагментов научных статей, учебников, лекций и энциклопедий. Она должна была помогать писать научные тексты и искать знания.
Через три дня, 17 ноября, Meta закрыла публичную демонстрацию. Пользователи быстро обнаружили, что Galactica уверенно сочиняет несуществующие научные статьи — иногда с именами реальных учёных — и пишет выдуманные энциклопедические заметки, например об истории медведей в космосе. Критики сказали: модель, которая не отличает правду от вымысла, не может быть научным инструментом.
Galactica показала главную слабость языковых моделей — способность уверенно выдумывать. Эту проблему называют «галлюцинациями». До запуска ChatGPT оставалось меньше двух недель.
Кто есть кто к концу 2022 года
Прежде чем начнётся главная история, познакомимся с её героями. Именно они будут двигать сюжет всех следующих частей.
OpenAI. Небольшая по меркам гигантов лаборатория из Сан-Франциско, которая сделала самую смелую ставку — на масштаб. У неё есть GPT-3 и её улучшенные версии, рисующая DALL·E 2, модель Codex для программистов и, главное, союз с Microsoft. Внутри неё уживаются некоммерческая миссия и коммерческая компания — и это противоречие ещё даст о себе знать.
Google и DeepMind. Формально — лидер. Google придумала Transformer и BERT, у неё есть разговорный бот LaMDA, лучшие учёные и почти бесконечные деньги. DeepMind решила задачу о белках и обыграла чемпиона мира в го. Но свои языковые модели Google держит внутри компании и встраивает в поиск и другие сервисы, почти не показывая их широкой публике.
Microsoft. Главный партнёр и инвестор OpenAI, владелец GitHub с его Copilot. ИИ может помочь ей потеснить Google в поиске и усилить свои облачные сервисы.
Meta. Владелец Facebook и Instagram, со своей сильной исследовательской лабораторией. Неудача с Galactica в ноябре 2022 года сделала её осторожнее — но ненадолго.
Anthropic. Самый молодой игрок, основанный выходцами из OpenAI, с упором на безопасность ИИ. Пока о нём знают в основном специалисты.
Nvidia. Производитель видеокарт, без которых ничего из этого не работает. Её чипы стоят и в игровых компьютерах, и в дата-центрах, где обучают модели. Её звёздный час ещё впереди.
Открытое сообщество. Stability AI, исследователи и энтузиасты, которые выкладывают модели в открытый доступ. Их Stable Diffusion показала, что мощный ИИ может работать на домашнем компьютере.
Государства. Пока почти не вмешиваются. В Европейском союзе с 2021 года обсуждают первый большой закон об ИИ, но он ещё не принят. Самый жёсткий шаг сделали США, которые в октябре 2022 года ограничили доступ Китая к чипам для ИИ. Для большинства правительств ИИ пока одна из многих технологий. Это изменится очень быстро.
Накануне
К вечеру 29 ноября 2022 года на столе лежало всё необходимое.
Была архитектура, которую можно масштабировать бесконечно, — Transformer. Был рецепт, по которому модели умнеют от размера, — законы масштабирования. Была огромная модель, которая умела почти всё, — GPT-3 и её наследники. Был способ научить её слушаться и быть полезной — RLHF. Были деньги и суперкомпьютеры — союз OpenAI и Microsoft.
Не хватало одного: простой двери, через которую к этому мог бы войти любой человек. Не API для программистов, не демонстрация для журналистов, а обычное окно чата — пиши что хочешь.
Были и предупреждения. История GPT-2 спрашивала, не опасна ли технология. История Лемойна — не начнём ли мы приписывать машинам чувства. История Galactica — что делать с машиной, которая уверенно врёт. Художники из Колорадо — кому принадлежит творчество. Экспортные ограничения — кому принадлежит сама технология.
Ни на один из этих вопросов к концу ноября 2022 года ответа не было. На следующий день они перестанут быть вопросами для специалистов и станут вопросами для всех.
Итог Пролога
- Почти всё, что сделало ChatGPT возможным, появилось между 2017 и 2022 годами: архитектура Transformer, предобучение, законы масштабирования и обучение на отзывах людей.
- Google придумала ключевую идею, но OpenAI первой поставила на неё всё — и получила для этого деньги Microsoft.
- Главный рецепт эпохи сложился уже тогда: чем больше модель, данных и вычислений, тем она умнее.
- ИИ уже менял науку (AlphaFold), программирование (Copilot) и искусство (DALL·E, Stable Diffusion, Midjourney), но широкая публика почти этого не замечала.
- Все главные споры следующих лет — об опасности, открытости, авторстве, правде и контроле над чипами — были заложены ещё до 30 ноября 2022 года.