Искусственный интеллект и его возможности

Искусственный интеллект сейчас способен на невероятные вещи. Но является ли его предельный вклад в том, что он за доли секунды выполнит всё то, что может человек? По мнению лингвиста и исследователя AI, на этом дело не заканчивается. Остаётся много направлений для исследований того, что AI может дать нам и как он это может давать.

В четвёртой, завершающей, части этой беседы мы увидим фрагмент того будущего. В конце — забавный вопрос: если сегодня обучать AI писать в стиле Рабиндраната Тагора, как именно нужно подавать эти данные? Какие этапы при этом будут?

Вопросы о развитии AI

Ваш рассказ действительно очень интересен. При этом у меня возник вопрос: за последние годы OpenAI и подобные ChatGPT добились таких успехов в основном благодаря постепенному масштабированию одной и той же архитектуры — то есть тренировали похожие модели всё большие и большие, и это дало улучшение «по капле»? Не уменьшилась ли эта возможность — просто увеличивать размер модели и ожидать улучшения?

Если это так, то, раз вы говорите, что исследования всегда направлены в будущее, что можно ожидать в исследованиях по этой теме в ближайшее десятилетие? Какие проблемы, вопросы или вызовы станут наиболее интересными и важными?

Революция производственного AI

Если посмотреть шире — не только в области обработки языка (NLP), а на всю картину, — то это можно рассматривать как революцию производственного AI (generative AI). Мы называем его «производственным», потому что такие системы способны создавать новое. Сначала на рынке появилось поколение генерации текста — рассказы, стихи, эссе. Потом появились модели генерации изображений и дизайна.

Текущие достижения несомненно имеют практические приложения: то, что создаёт AI, может помогать людям в выполнении задач. Но возможна и иная важная роль — задачи, которые человеку по сути под силу, и те, где AI может просто делать те же вещи быстрее: там AI экономит время и ресурсы.

Важнее другой класс примеров — задачи, которые человеку выполнить невозможно, но которые под силу моделям. В науке таких примеров много: открытие лекарств (drug discovery) или проектирование сложных молекул (molecule design). Могу ли я спроектировать молекулу, которая лечит конкретное заболевание или связывается с определённым белком? Для человека это чрезвычайно трудно: обычно идут многократные попытки и эксперименты в лаборатории, на что иногда уходят годы. Если модель сделает это за год, это окажет колоссальное влияние.

Тонкости языка и возможности AI

Мне кажется, это важное направление: там, где человек не может задать жёсткие правила или сам не знает, как создать нужный объект, модель, обученная на массиве данных, находит решения. В языке можно привести более скромный пример: использование форм обращения «вы–ты». Когда мы говорим, есть множество слов и грамматических правил, которые воспроизводят структуру. Но многое зависит от социального контекста: одно и то же высказывание в разных ситуациях приобретает совершенно разные оттенки.

Эти тонкие различия человек не всегда формализует и не всегда «знает правила» осознанно — он просто интуитивно действует. Здесь AI действительно может помочь, зафиксировав такие тонкости на основе большого корпуса данных.

Исследования в социальных науках

Если расширить картину, то так же как в естественных науках генеративный AI уже делает интересные вещи, в социальных науках технология тоже открывает новые возможности. Недавно популярность получила статья исследователей из ведущих университетов, которая обсуждает идею «Simulacra». Суть в том, что экспериментировать с людьми — очень сложно, порой сложнее, чем в естественных науках: трудно проводить строго контролируемые эксперименты, где можно целенаправленно создавать условия и наблюдать эволюцию группы.

Многие исследования ограничены наблюдением, а не вмешательством. Если же мы сможем моделировать (simulate) такие сценарии, ставить модели в роли различных персонажей и наблюдать, как меняется поведение сообщества в результате их взаимодействий, это может быть очень интересным.

Проблемы и вызовы в моделировании

В центре идеи Simulacra — имитация человеческого общества с помощью моделей. Но у этого подхода также есть ограничения и риски. Именно сейчас я и занимаюсь по сути попыткой понять: когда модели работают хорошо, а когда — нет.

Как пример, возьмём бенгальский язык. Если задать вопрос модели на бенгальском, она часто даёт хорошие ответы и не звучит «сломано». Но в понимании тонких аспектов или контекстов её работа иногда уступает английской версии. Одна из причин — объём англоязычных данных в интернете намного больше, поэтому модель лучше «выучила» английский.

Исследовательские возможности и ограничения

Важно понять, в каких ситуациях применение simulacra или модельных симуляций оправдано, а где — нет. Вокруг этих вопросов много исследовательских возможностей с точки зрения приложений. С точки зрения самих моделей — главная нынешняя проблема их большого класса в том, что они очень дорогостоящи: огромные модели с миллиардами параметров работают лучше, и без большой сети параметров добиться высокого качества сложно.

Если я захочу запускать модель на мобильном телефоне или получить ответ в реальном времени в веб-приложении, использование такого огромного «тяжёлого» варианта невозможно. И финансовые затраты — тоже серьёзный фактор.

Создание языковой модели в стиле Рабиндраната Тагора

Если бы удалось перенести качество 100-миллиардной или триллионной модели в компактную модель с миллионами параметров, выигрыш был бы огромен. Это — самостоятельная большая тема исследований. Уже есть признаки, что небольшие модели могут проявлять сильные качества, но для устойчивого улучшения и приближения к крупным моделям ещё требуется много работы.

Наконец, последний вопрос, о котором раньше немного говорили: хотя модели вроде ChatGPT очень хороши на английском, во многих других языках их возможности заметно хуже. Одна из главных причин — объём доступных данных на английском в интернете значительно больше, поэтому модели лучше обучены на этой базе.

Допустим, у меня есть достаточные ресурсы, и я хочу создать большую языковую модель (LLM), которая будет писать рассказы в стиле Рабиндраната Тагора. Если на данном этапе не учитывать ограничения ресурсов, какие шаги нужно предпринять для достижения этой цели?

Под ресурсами вы имеете в виду вычислительные ресурсы? Тогда начнём с предтренировки (pretraining). Берём большую модель, которая уже чему‑то обучена — например, одну из доступных моделей вроде LLaMA или аналогичных — и начинаем дообучение на корпусе сочинений Тагора.

«Дообучение» означает, что в качестве входных данных мы загружаем цифровой вариант всей его творческой наследия. Что входит в входные данные? Не фрагменты, а максимально возможный объём текста — вся письменная коллекция Тагора в цифровом виде.

Современные фреймворки и платформы (например, открытые репозитории с кодом обучения) позволяют разбивать корпус на датасеты и готовить их к обучению; код для тренировки сейчас широко доступен и может быть адаптирован.

Затем начинается процесс тренировки с настройкой параметров: скорость обучения (learning rate), размер батча (batch size), число проходов по данным (epochs) и т.д. Во время тренировки по получающимся результатам корректируются эти гиперпараметры: если модель генерирует текст, близкий к стилю Тагора, параметры либо фиксируются, либо корректируются для улучшения. Это называется дообучением на целевом корпусе.

Этапы настройки модели

Далее идёт этап instruction tuning — настройка модели на конкретные инструкции и вопросы. Это более трудоёмко, поскольку нужные пары «запрос – желаемый ответ» не всегда доступны в готовом виде. Можно составить такие пары вручную: придумать вопросы, ожидания, и собрать ответы от экспертов через краудсорсинг. Так можно получить десятки тысяч примеров, но для сотен тысяч или миллионов таких пар человеческого труда может не хватить.

Тогда используются разные хитрости: перевод соответствующих англоязычных датасетов на бенгальский или на целевой язык, извлечение вопросов из школьных экзаменационных билетов и литературных справочников, автоматизированная генерация вариантов вопросов и их последующая валидация. Это — ещё одно поле для исследований и изобретательности.

После этого модель обычно проходит стадию выравнивания (alignment). Например, если просишь модель писать стихотворение, она может всегда выдавать очень длинные стихи или, наоборот, слишком краткие четверостишия там, где нужен развёрнутый текст. Для коррекции таких свойств проводится тонкая донастройка, иногда с использованием методов подкрепления (reinforcement learning) и обратной связи с участием людей (RLHF — reinforcement learning from human feedback).

Это помогает добиться соответствия поведения модели ожидаемому стилю, длине и тону. Именно такими шагами можно приблизить модель к умению сочинять в стиле конкретного автора.

Этические и юридические вопросы

Конечно, остаются этические, юридические и эстетические вопросы — например, насколько корректно и легально воссоздавать стиль живых или недавно умерших авторов, как избегать плагиата и как уважать культурное наследие — но технически это последовательность основных этапов: предтренировка на большой базе, дообучение на корпусе автора, instruction tuning с парой «вопрос–ответ» и финальное выравнивание поведения модели с помощью человеко-ориентированной обратной связи и методов усиленного обучения.

Спасибо за уделённое время — мы обсудили очень актуальную тему. Надеюсь, ещё удастся продолжить этот разговор; учитывая темпы развития, многое может измениться уже через короткое время.