Что такое GPT-4o и что означает буква «o»
GPT-4o — это флагманская модель OpenAI, представленная в мае 2024 года. Буква «o» в названии расшифровывается как «omni» (от лат. «всеобъемлющий»). Это указывает на главную особенность модели: она способна одновременно обрабатывать и генерировать информацию в разных форматах — текст, аудио, изображения и видео. В отличие от предыдущих версий, где для каждого типа данных использовались отдельные модели, GPT-4o работает как единая нейронная сеть, обученная на всех модальностях сразу. Это позволило значительно ускорить обработку запросов и улучшить качество ответов, особенно в голосовом режиме.
Ключевые отличия GPT-4o от GPT-4
Основное отличие — архитектура. В GPT-4 голосовой режим работал через конвейер из трёх моделей: одна распознавала речь, вторая (GPT-4) обрабатывала текст, третья синтезировала ответ. Это приводило к потере интонации, эмоций и контекста, а задержка составляла в среднем 5,4 секунды. GPT-4o объединяет все этапы в одной модели, что снижает задержку до 0,3 секунды — сопоставимо с человеческой реакцией. Кроме того, модель стала в два раза быстрее и на 50% дешевле в API. Она также лучше понимает неанглийские языки: для русского языка требуется на 1,7 раза меньше токенов, для хинди — почти в три раза.
Мультимодальность: как GPT-4o работает с текстом, аудио и видео
GPT-4o принимает на вход любую комбинацию текста, аудио, изображений и видео, а на выходе может генерировать текст, аудио и изображения. Это значит, что вы можете задать вопрос голосом, показать картинку и получить ответ в виде текста или аудио. Модель способна распознавать эмоции по голосу, определять настроение по выражению лица, переводить речь в реальном времени и даже петь. В демонстрациях OpenAI показали, как GPT-4o помогает успокоиться перед публичным выступлением, анализирует эмоции по видео и переводит диалог между двумя людьми, говорящими на разных языках.
Скорость и эффективность: почему GPT-4o быстрее и дешевле
Благодаря единой архитектуре GPT-4o обрабатывает запросы значительно быстрее предшественников. Среднее время ответа на аудиовопрос — 320 миллисекунд, что почти в 17 раз быстрее, чем у GPT-4 (5,4 секунды). Ускорение достигнуто за счёт того, что модель не тратит время на преобразование данных между разными подсистемами. Кроме того, новая токенизация позволила сократить количество токенов для многих языков: для русского — на 40%, для хинди — на 65%. Это снижает стоимость обработки запросов как для пользователей, так и для разработчиков, использующих API.
Новые возможности для работы с изображениями и видео
GPT-4o умеет распознавать и описывать содержимое изображений, переводить текст на картинках, отвечать на вопросы по визуальному контенту и генерировать изображения по текстовому описанию. В тестах модель успешно перевела меню ресторана с иврита на русский, но хуже справилась с расшифровкой врачебного почерка. С видео модель работает аналогично: понимает происходящее без звука, распознаёт предметы, может комментировать видео в реальном времени и даже сжимать длинные ролики с пересказом. В десктопной версии ChatGPT появилась возможность делиться экраном — нейросеть видит всё, что отображается на мониторе, и может помогать с кодом, документами или презентациями.
Голосовой режим: как изменилось общение с ChatGPT
Голосовой режим GPT-4o — одно из самых заметных улучшений. Модель говорит с естественными интонациями, может смеяться, петь, менять тембр и эмоциональную окраску. Она не перебивает пользователя, делает паузы, как человек, и способна поддерживать диалог до 7 минут, не теряя контекст. В приложении для смартфонов и macOS можно выбрать голос из нескольких предустановленных вариантов. Также модель умеет определять эмоции по голосу — например, если пользователь нервничает, она может предложить успокаивающий ответ. В будущем OpenAI планирует добавить возможность видеозвонков с ChatGPT.
Доступность и стоимость: что получают бесплатные и платные пользователи
GPT-4o доступна всем пользователям ChatGPT, включая тех, кто использует бесплатную версию. Однако бесплатные пользователи имеют ограничения по количеству сообщений. Подписчики ChatGPT Plus (20 долларов в месяц) получают в пять раз больше сообщений, а также ранний доступ к новым функциям, таким как улучшенный голосовой режим. Для разработчиков модель доступна через API по цене вдвое ниже, чем GPT-4 Turbo, с вдвое большей скоростью и в пять раз более высокими лимитами запросов. OpenAI также анонсировала десктопное приложение для macOS, которое синхронизирует историю диалогов между устройствами.
Интеграция с iOS и другими платформами
По слухам, Apple заключила соглашение с OpenAI об использовании GPT-4o в iOS 18. Это может сделать Siri более естественной и контекстно-зависимой. Модель сможет помогать в написании текстов в «Заметках», сортировке писем в «Почте», распознавании объектов в «Фото». Кроме того, GPT-4o может стать основой для универсального переводчика, помощника дополненной реальности и генератора контента. Пока эти возможности находятся на стадии обсуждения, но сам факт переговоров подтверждает высокий интерес к модели со стороны крупных платформ.
Безопасность и ограничения новой модели
OpenAI провела обширное тестирование GPT-4o, включая красное командирование с участием более 70 внешних экспертов. Модель оценили по категориям кибербезопасности, биологического оружия, убеждения и автономии — во всех случаях риск не превысил среднего уровня. Тем не менее, аудиомодальности создают новые риски, такие как синтез голоса или эмоциональная манипуляция. Поэтому на старте аудиовыходы ограничены набором предустановленных голосов, а видеорежим пока недоступен широкой публике. OpenAI продолжает совершенствовать систему безопасности и обещает выпускать обновления постепенно.
Вопросы и ответы
Чем GPT-4o отличается от GPT-4?
GPT-4o — это мультимодальная модель, которая обрабатывает текст, аудио, изображения и видео в единой нейронной сети. В отличие от GPT-4, где голосовой режим работал через три отдельные модели, GPT-4o делает это быстрее (задержка 0,3 секунды против 5,4 секунды) и с сохранением эмоций и интонаций. Модель также на 50% дешевле в API и лучше понимает неанглийские языки.
Какие новые функции появились в ChatGPT-4o?
Среди ключевых нововведений: голосовой режим с естественными интонациями и возможностью петь, распознавание эмоций по голосу и лицу, перевод в реальном времени, работа с видео (включая комментирование происходящего на экране), генерация изображений с текстом, а также поддержка 50 языков с улучшенной токенизацией.
Сколько стоит подписка на ChatGPT-4o?
Базовая версия GPT-4o доступна бесплатно всем пользователям ChatGPT с ограничением по количеству сообщений. Подписка ChatGPT Plus стоит 20 долларов в месяц и даёт в пять раз больше сообщений, а также ранний доступ к новым функциям, таким как улучшенный голосовой режим. Для разработчиков API GPT-4o вдвое дешевле, чем GPT-4 Turbo.
Может ли GPT-4o распознавать врачебный почерк?
В тестах GPT-4o справился с этой задачей хуже, чем с переводом печатного текста. Модель правильно определила ФИО и возраст пациента, но не смогла точно распознать номер справки, дату и специализацию врача. Это показывает, что возможности распознавания рукописного текста пока ограничены, особенно если почерк неразборчив.
Как GPT-4o работает с видео?
Модель понимает происходящее на видео без звука, распознаёт отдельные предметы, может комментировать видео в реальном времени (например, для незрячих пользователей) и сжимать длинные ролики с пересказом. В десктопной версии ChatGPT можно поделиться экраном, и нейросеть будет видеть всё, что отображается на мониторе.
Когда станет доступен видеорежим в GPT-4o?
OpenAI планирует выпустить видеорежим для широкой аудитории в ближайшие месяцы. На старте видеовозможности будут доступны только ограниченному кругу доверенных партнёров через API. Компания продолжает тестирование и доработку системы безопасности, чтобы минимизировать риски, связанные с новыми модальностями.
Будет ли GPT-4o интегрирован в iOS 18?
По данным СМИ, Apple ведёт переговоры с OpenAI об использовании GPT-4o в iOS 18. Это может улучшить Siri, добавить функции ИИ в «Заметки», «Почту» и «Фото», а также создать универсальный переводчик и помощник дополненной реальности. Официального подтверждения от Apple пока нет, но интерес к интеграции подтверждается источниками.