Технологии ChatGPT: как устроен и работает сервис

В этой статье

Когда говорят «технологии ChatGPT», в одну фразу часто складывают сразу несколько разных вещей: нейросеть, обучение на больших массивах данных, генерацию ответа, поиск в интернете и сам сайт или приложение. Из-за этого может показаться, будто ChatGPT — единая база знаний, которая просто достаёт готовый ответ.

Полезнее представить его как несколько уровней. Модель GPT обрабатывает входные данные и генерирует продолжение. ChatGPT даёт этой модели интерфейс диалога, инструкции и контекст беседы. А поиск, работа с файлами, изображениями или голосом подключают к разговору отдельные режимы и инструменты. Именно такое разделение помогает понять, что происходит с вашим вопросом.

Из чего начинается ответ

Сначала ваш текст превращается в токены. Токеном может быть целое слово, часть слова, знак препинания или другой небольшой фрагмент. Например, длинное русское слово не обязано обрабатываться как один неделимый элемент: модель может увидеть его частями. Точное разбиение зависит от используемого токенизатора и модели.

Для нейросети это не «слова в голове», а последовательность числовых представлений. В неё могут входить не только ваши последние слова, но и предыдущие сообщения диалога, системные инструкции и, если включён соответствующий режим, данные из файла или другого источника.

Дальше модель оценивает, какой следующий токен лучше всего подходит к уже получившемуся контексту. Затем выбранный фрагмент добавляется к последовательности, и расчёт повторяется. Так постепенно появляются фраза, абзац и весь ответ.

Бытовая аналогия здесь довольно точная: вы начинаете предложение, а собеседник каждый раз выбирает наиболее уместное продолжение, учитывая всё сказанное до этого. Разница в том, что языковая модель делает такой выбор с помощью большого числа математических операций и не ограничивается одной заранее заготовленной фразой.

Что такое языковая модель, параметры и foundation model

GPT — это семейство генеративных языковых моделей. «Языковая» означает, что модель работает с закономерностями языка и других последовательностей; «генеративная» — что она создаёт новый текст, а не только классифицирует уже существующий.

Foundation model, или базовая модель, — это обученное ядро, на котором могут строиться разные прикладные сценарии. Внутри модели находятся параметры — числовые значения, которые постепенно настраиваются во время обучения. Они не являются каталогом статей или списком готовых ответов. Скорее, в них закрепляется множество статистических связей: какие выражения часто встречаются вместе, как обычно строится объяснение, какие признаки характерны для кода, таблицы или диалога.

Точное устройство конкретной современной модели и количество её параметров не следует угадывать по названию сервиса: OpenAI раскрывает не все такие детали. Для понимания ChatGPT достаточно знать общий принцип: модель вычисляет продолжение последовательности на основе выученных закономерностей и текущего контекста.

Как модель обучают

У обучения есть несколько разных этапов, и их не стоит смешивать с работой модели во время вашего диалога.

Предобучение: найти закономерности

На этапе предобучения модель обрабатывает большие массивы данных и учится предсказывать пропущенный или следующий фрагмент. Благодаря множеству таких примеров она постепенно усваивает структуру языка, распространённые способы рассуждения, формы программного кода и другие повторяющиеся связи.

Это не означает, что модель читает каждый источник так же, как человек, и складывает его в библиотеку с удобным поиском. Результатом становится настроенная система параметров, которая умеет строить вероятные продолжения по новому контексту. В общих чертах этот подход описан OpenAI в материале о разработке базовых моделей и в технологическом объяснителе OpenAI.

Постобучение: сделать ответы полезнее

После предобучения модель умеет продолжать текст, но это ещё не делает её хорошим собеседником. Её дополнительно настраивают так, чтобы она лучше следовала инструкциям, отвечала в подходящей форме и соблюдала требования безопасности. Этот этап называют постобучением или донастройкой.

В публично описанном подходе InstructGPT для этого использовали человеческие демонстрации желаемых ответов и сравнения нескольких вариантов. В описании также фигурирует RLHF — обучение с подкреплением на основе обратной связи от людей. Это важная иллюстрация принципа постобучения, но не утверждение, что процедура полностью описывает каждую актуальную модель ChatGPT: OpenAI описывает этот подход отдельно.

Поэтому ответ формируется не только из вероятностного продолжения. На его вид влияют контекст разговора, инструкции продукта, настройки безопасности и конкретный режим, в котором вы работаете.

Чем ChatGPT отличается от модели GPT

Эти названия обозначают разные уровни.

Модель GPT — вычислительное ядро, которое принимает входную последовательность и генерирует результат. У сервиса может быть несколько доступных моделей или режимов их выбора, причём состав со временем меняется.

ChatGPT — пользовательский сервис поверх моделей. Он отвечает за интерфейс, историю диалога, передачу запроса, системный контекст и доступные пользователю функции. Поэтому фраза «ChatGPT знает» иногда слишком упрощает ситуацию: в одном случае ответ построен на общих закономерностях модели, в другом к нему добавлены сведения из загруженного файла или подключённого инструмента.

По этой же причине не всякая функция в окне ChatGPT является свойством одной базовой модели. Поиск может получить свежие страницы, загрузка файла — передать модели новый материал для разбора, а голосовой режим — добавить распознавание и синтез речи. Доступность возможностей зависит от модели, аккаунта, тарифа, платформы и текущих ограничений; актуальный обзор возможностей ChatGPT перечисляет их отдельно.

Что меняется, когда включены инструменты

Представьте один и тот же вопрос: «Какие технологии ChatGPT используются сейчас?»

Без поиска модель строит ответ на основе уже выученных закономерностей и данных, доступных ей в рамках конкретной модели и контекста. С поиском сервис может отправить запрос во внешний источник, получить найденные материалы и использовать их в текущем ответе. Это не превращает модель в постоянно обновляемую энциклопедию: свежие данные появились благодаря дополнительному каналу.

С файлом происходит похожая вещь. Сам документ не становится навсегда частью параметров модели. Он передаётся в рамках текущей задачи, после чего сервис может использовать его содержимое для анализа, пересказа или поиска нужного фрагмента. В изображении модель может обрабатывать визуальные признаки, а голосовой режим связывает разговор с распознаванием и воспроизведением речи.

Удобная схема выглядит так: GPT генерирует ответ, ChatGPT организует диалог, а инструменты при необходимости добавляют данные или другой способ взаимодействия. Такое разделение помогает не приписывать базовой модели постоянное знание свежих сайтов, файлов и всех возможностей интерфейса.

Почему убедительный ответ может оказаться неверным

Главный принцип генерации — выбрать подходящее продолжение, а не доказать каждое утверждение. Если в контексте недостаточно данных или вопрос сформулирован двусмысленно, модель может построить гладкий и уверенный текст, который содержит ошибку. Звучит он правдоподобно именно потому, что модель хорошо знает типичные формы объяснения.

Поэтому «модель выбрала наиболее вероятный следующий токен» не означает «модель установила истину». Чем важнее вывод, тем внимательнее стоит проверить его по исходным данным и независимому первоисточнику. Попросите указать, на каких сведениях построен вывод, отделить факт от предположения и показать расчёт, если он есть. Для даты, цены, закона, медицинского или технического требования отдельно проверьте актуальный источник.

На практике полезно начать с небольшого уточнения: «Какие данные вы использовали?» или «Что в этом ответе является предположением?». Если вопрос относится к вашему документу, приложите исходный файл. Если нужна свежая информация, убедитесь, что в вашем режиме действительно доступен подходящий инструмент поиска, и всё равно откройте ключевую ссылку самостоятельно.

Что нужно для расширенных возможностей

Сначала определите, чего именно вам не хватает: самой модели, доступа к определённому режиму или инструмента вроде файлов и поиска. Эти вещи не взаимозаменяемы. Подписка ChatGPT не равна пополнению OpenAI API, а наличие тарифа не означает автоматического продления или одинакового набора функций на всех платформах.

Если расширенные лимиты или функции недоступны вашему текущему аккаунту, можно посмотреть месячные варианты подписки ChatGPT в Amber Market. В карточке представлены ChatGPT Go, Plus и Pro на один месяц; подключение указано на аккаунте покупателя и выполняется вручную. Перед заказом проверьте актуальные условия, наличие и цену: они могут измениться. Оплата проходит через СБП, а конкретный результат и доступные возможности нужно сопоставить с условиями карточки.

Главное — не начинать с покупки, пока не понятна сама потребность. Если вам нужно разобраться в возможностях сервиса, полезно перейти к обзору ChatGPT и его ограничений. Если вопрос уже перешёл к выбору конкретной модели, пригодится справочник моделей GPT OpenAI. А для первого практического шага есть инструкция как начать пользоваться ChatGPT.

Итак, технологии ChatGPT — не одна загадочная «база ответов». Это сочетание обученной языковой модели, токенов и параметров, этапов предобучения и постобучения, пользовательского сервиса и подключаемых инструментов. Модель помогает сгенерировать продолжение, сервис собирает контекст, а инструменты могут добавить новый источник данных. Понимая эту границу, проще пользоваться ChatGPT и вовремя проверять то, что звучит уверенно, но ещё не стало доказанным фактом.

Источники

Есть следующая задача?Ещё по теме «Первые шаги» →