В этой статье
ChatGPT может извлечь из PDF даты, условия и цитаты. Чтобы ответом можно было пользоваться, у каждого значения должна быть опора в документе. Загрузите свою копию PDF, назовите нужные сведения и попросите связать каждый ответ с короткой исходной фразой. Затем сверьте эти фразы с оригиналом.
Загрузите файл и задайте поля ответа
Откройте разговор в ChatGPT, найдите кнопку добавления файла и прикрепите PDF. Используйте ту версию документа, условия которой вам нужны. Перед загрузкой проверьте, можно ли передавать этот документ внешнему сервису; сведения, не относящиеся к вопросу, удалите из копии.
Вопрос «О чём этот документ?» оставляет модели выбор главного. Если вы ищете условия участия, перечислите конкретные поля:
По загруженному PDF укажи: 1) до какой даты принимают заявки; 2) когда пройдёт встреча; 3) чем подтверждается запись; 4) что участник должен принести; 5) когда организатор отправит памятку. Отвечай только по документу. Для каждого пункта приведи короткую цитату и номер страницы, если его можно определить. Если сведения нет, напиши «в файле не указано». Если указан только относительный срок, сохрани его и отдельно отметь отсутствие точной даты. Не заполняй пропуски догадками.
Такой запрос определяет, что искать и как обращаться с пропусками. Конкретная задача, достаточный контекст и уточнение запроса после проверки ответа входят в рекомендации OpenAI по формулировке запросов.
В большом документе разбирайте вопросы по очереди: даты и сроки, требования к участнику, исключения и приложения. Каждый ответ проверяйте до перехода к следующему вопросу — так проще заметить потерянное условие.
Пример: две страницы условий мастерской
Возьмём условный PDF. На странице 1 написано:
Приём заявок до 20 сентября. Встреча пройдёт 28 сентября с 11:00 до 13:00. Запись считается подтверждённой после ответа организатора.
На странице 2:
Участник приносит блокнот. Материалы для практики выдаются на месте. После встречи организатор отправит участникам памятку.
Разбор этих данных выглядит так:
| Вопрос | Ответ по PDF | Опора в файле |
|---|---|---|
| До какой даты принимают заявки? | До 20 сентября | Страница 1: «Приём заявок до 20 сентября» |
| Когда проходит встреча? | 28 сентября, с 11:00 до 13:00 | Страница 1: «Встреча пройдёт 28 сентября с 11:00 до 13:00» |
| Чем подтверждается запись? | Ответом организатора | Страница 1: «Запись считается подтверждённой после ответа организатора» |
| Что нужно принести? | Блокнот | Страница 2: «Участник приносит блокнот» |
| Когда пришлют памятку? | После встречи; точная дата и срок в днях в файле не указаны | Страница 2: «После встречи организатор отправит участникам памятку» |
Заявки принимают до 20 сентября, встреча состоится 28 сентября. Это два разных поля. Если в ответе срок записи оказался 28 сентября, достаточно сопоставить его с первой фразой, чтобы найти ошибку.
С памяткой другая ситуация. Слово «после» задаёт порядок событий, но не срок в днях или часах. Ответ «пришлют 29 сентября» добавляет выдуманную дату. Ответ «в файле не указано» без уточнения тоже теряет часть данных: отправка после встречи всё-таки названа.
Стоимость и адрес в этом PDF не указаны вовсе. Для них ответ «в файле не указано» точен. Название мастерской и дата встречи не позволяют заполнить эти поля.
Проверьте ответ по исходной странице
Откройте PDF и найдите каждую цитату поиском по тексту или глазами. Сверьте число, единицу измерения, отрицание и то, к чему относится фраза. Затем прочитайте соседние предложения: исключение из общего правила может находиться в следующем пункте или на следующей странице.
В примере полезно проверить три связи:
- «До 20 сентября» относится к приёму заявок, а «28 сентября» — к встрече.
- Подтверждением записи служит ответ организатора. Самой отправки заявки для такого вывода недостаточно.
- «После встречи» относится к отправке памятки и не задаёт точную дату.
Если ChatGPT дал общий пересказ, уточните: «Для каждого пункта покажи исходную фразу. Отдели прямое указание в документе от своего вывода». Повторный ответ также сверьте с файлом.
Номер страницы проверяйте отдельно. Если нумерация неясна, попросите указать раздел и короткую цитату, а страницу отметить как неопределённую. Придуманный номер только мешает найти фрагмент.
После сверки выпишите вопросы, на которые документ не отвечает. В нашем примере это стоимость, адрес и точный срок отправки памятки. Их нужно уточнять у организатора.
Совпадение цитаты с PDF подтверждает соответствие ответа тексту. Оно не доказывает, что сам документ актуален или содержит верные сведения.
Если PDF не читается или пропущен рисунок
Сначала проверьте, выделяются ли слова в PDF мышью. Если нет, перед вами может быть скан без текстового слоя. В таком файле буквы хранятся как изображение страницы.
По справке OpenAI о загрузке файлов, работа с файлами доступна на бесплатных и платных планах с ограничениями. Для одного документа действуют пределы 512 МБ и 2 млн токенов. Соответствие этим пределам не гарантирует, что все нужные сведения будут извлечены.
В той же справке указано различие в обработке PDF: Visual Retrieval поддерживается в Enterprise, а остальные планы извлекают цифровой текст и отбрасывают встроенные изображения. Поэтому текст страницы может попасть в ответ, а важная схема рядом — остаться без внимания.
Для скана получите текст с помощью OCR — распознавания символов — и проверьте, сохранились ли даты, числа и отрицания. Другой вариант: передайте нужную страницу отдельным изображением и задайте вопрос о ней:
Прочитай текст на этой странице. Выпиши срок подачи заявки и условие подтверждения записи вместе с исходными фразами. Неразборчивые слова и цифры отметь отдельно, не восстанавливай их по догадке.
Если нужное условие находится на рисунке или фотографии, начните с этой страницы. Подробный порядок работы есть в инструкции по распознаванию текста с фото. Покупка Plus или Pro сама по себе не решает задачу визуального чтения встроенных изображений PDF.
Если вы выбираете платный доступ для регулярной работы с файлами, в Amber Market можно посмотреть месячные подписки ChatGPT Go, Plus и Pro. При выборе учитывайте различие между загрузкой документа и чтением изображений внутри него.
Какие данные оставить в копии
Удаляйте из копии страницы и сведения, которые не нужны для вопроса. Сохраняйте контекст условия: если за правилом следует исключение, оставьте оба фрагмента. Иначе даже дословная цитата из сокращённого файла может дать неполный ответ.
В личном ChatGPT можно отключить Improve the model for everyone через Settings → Data Controls. Новые разговоры останутся в истории, но не будут использоваться для обучения; это описано в FAQ OpenAI о Data Controls. Настройка не заменяет правила вашей организации о передаче документов внешним сервисам.