Как OpenAI и Microsoft создали чат-бот с ИИ, который изменил всё

9

Конец 2022 года принес не только праздничные показатели продаж. Он вызвал цифровое землетрясение.

ChatGPT ворвался на сцену. Никакого постепенного запуска. Никаких шепотом обсуждаемых бета-тестов. Еще вчера он был лишь примечанием в технологических блогах, а на следующий день уже общался со всеми.

Реакция была мгновенной и поляризованной. Средства массовой информации не переставали восхищаться плавностью бесед. Он писал статьи. Он генерировал идеи. Он даже попробовал себя в творческой прозе. Но наряду с благоговением пришла глубокая, тревожащая тревога. Люди осознали, что этот инструмент не просто отвечает на вопросы. Он вторгается в то, чем люди гордятся больше всего: в интеллектуальные способности.

Миллиардная ставка

Чтобы понять бота, нужно посмотреть на деньги, стоящие за ним.

OpenAI была основана в декабре 2015 года с одной единственной, агрессивной целью: продвинуть искусственный интеллект как можно дальше. Лицом этой миссии является Сэм Альтман. Возможно, вы знаете его имя по другим успешным проектам. Он соосновал Airbnb. Он помогал финансировать гигантов вроде Reddit, Twitch и Dropbox через Y Combinator.

Сначала Альтман сотрудничал с Илоном Маском для запуска OpenAI. С первого дня сумма была огромной. Стартап привлек раунд финансирования в 1 миллиард долларов.

Но Microsoft увидела знаки на стене. Они присоединились в качестве инвесторов в 2019 году. Затем, в январе 2023 года, они пошли ва-банк. Microsoft инвестировала в OpenAI еще несколько миллиардов долларов.

Зачем? Чтобы сдержать Google.

Оба технологических гиганта соревновались за доминирование в сфере ИИ. Масштабная инвестиция Microsoft была не просто поддержкой. Это была стратегическая атака для противодействия передовым исследованиям Google.

Это финансирование купило не только серверы. Оно купило результаты. Исследования OpenAI уже привели к созданию DALL-E — инструмента для генерации изображений, который произвел фурор весной 2022 года с выходом версии 2. ChatGPT стал следующим логическим шагом. Генератор текста. Собеседник.

Двигатель под капотом

ChatGPT — это не магия. Это математика. Тяжелая математика.

Основная технология опирается на большие языковые модели (LLM). Цель на бумаге проста: понять структуру человеческого языка. Но ее реализация пугающе сложна. Главная задача алгоритма — предсказать следующее слово в предложении. Связывая эти предсказания, он генерирует связный текст.

Но нельзя просто загрузить скрипт на сервер и надеяться на лучшее. Нужна тренировка. Огромное ее количество.

ChatGPT поглотил набор данных из 500 миллиардов документов. Речь идет обо всем интернете по состоянию на 2021 год. Плюс сотни тысяч книг. Научные статьи. Все подряд.

Ей нужно было научиться взвешивать важность каждого термина в фразе, чтобы извлечь основную концепцию.

Масштаб трудно представить.

  • 500 миллиардов документов проанализировано.
  • 175 миллиардов параметров в модели.
  • 2 миллиона евро на обучение.
  • 100 000 долларов в день операционных расходов только для поддержания работы.

Прототип ChatGPT-3 показал миру, что возможно. Запущен 30 ноября 2022 года.

Реакция сломала интернет.

Одна миллион регистраций пользователей за пять дней.

Это не просто строка поиска

Люди хотели знать, на что он способен.

В своей основе ChatGPT — это интерфейс для общения. Но он ведет себя скорее как неутомимый исследовательский помощник, который слишком старается угодить, чем как база данных.

Мы протестировали его. Мы бросали в него все подряд.

Энциклопедические факты? Разобрали.
Кулинарные рецепты? Разобрали.
Фильмографии? Разобрали.

Качество синтеза в целом было высоким. Когда его попросили объяснить нюансы между двумя сложными темами, он справился с удивительно хорошим результатом.

Но вот здесь становится интересно.

ChatGPT не просто извлекает данные. Он импровизирует. Каждый раз, когда вы задаете вопрос, он генерирует новый ответ на основе вероятности. Он не вытаскивает статичный ответ с полки. Он строит ответ в реальном времени.

И он запоминает.

Он отслеживает контекст разговора. Он слушает.

Во время тестирования мы задали простой географический вопрос.

«Какая самая длинная река в мире?»

ChatGPT ответил: «Нил».

Мы возразили.

«Разве Амазонка не длиннее Нила?»

Бот немедленно исправился.

«Приношу свои извинения. Я допустил ошибку в предыдущем ответе. Амазонка действительно является самой длинной рекой в мире».

Эта способность к самокоррекции в рамках окна контекста отличает современные LLM от старых поисковых алгоритмов. Он не просто ищет факты. Он поддерживает диалог.

Но делает ли это его умнее? Или просто лучше имитирует разговор?

Это вопрос, висящий над каждым технологическим работником, студентом и любопытным пользователем, который пытается понять, смотрит ли он на инструмент или на конкурента.

Возможности генерации контента

Утилита выходит за рамки простого ответа на вопросы. Мы протестировали систему с помощью специфических, слегка хаотичных запросов. Один запрос был простым: сгенерировать примеры комментариев к спорной статье, включая эмодзи. Результат оказался стандартным для интернета: шаблонное выражение шока в сочетании с грустным смайликом. Типично.

Но мы пошли дальше. Модель создала посты для Facebook. Она составила советы по торгу при покупке подержанных автомобилей. Она предложила программное обеспечение для редактирования изображений. Диапазон был широким. Мы хотели проверить предел возможностей, поэтому попросили составить план сюжета для детективного романа. Результат оказался удивительно связным. Он выстроил загадку с реальной структурой.

Однако есть и ограничения. Задачи по творческому письму давались модели с трудом. Мы попросили написать рэп-песню о 2023 годе. Результат оказался пустым. Любовное стихотворение тоже не удалось. Ритм был нарушен. Эмоции не хватало. Всё звучало механически.

Модель проявляет меньше вдохновения, когда пытается передать сырые человеческие эмоции или культурные нюансы.

Эта непоследовательность может успокаивать. Она доказывает, что ИИ не всемогущ в художественных сферах. Тем не менее, вопрос остаётся открытым. Это успокоение временно. Разрыв между логичным сюжетом и искренним стихотворением, вероятно, сократится. Просто ещё не сейчас.

Когда ИИ пишет за вас

Суммаризация — одна из тех функций, которые делают ChatGPT по-настоящему полезным, а не просто забавным трюком. Я протестировал её, подав на вход длинную статью о генераторах изображений на основе ИИ из Futura Sciences. Результат был не только точным, но и лаконичным.

В статье обсуждается использование искусственного интеллекта для генерации изображений по текстовому описанию. Эту функцию используют несколько приложений, таких как Dall-e 2, Stable Diffusion и MidJourney. Принцип их работы заключается в вводе текста и генерации соответствующего изображения с высоким уровнем художественного качества. В статье также упоминается OpenAI, некоммерческая организация, создавшая Dall-e 2 и стремящаяся расширить границы ИИ, придерживаясь этических принципов, обеспечивающих безопасность человека.

Он уловил суть Dall-e 2, Stable Diffusion и MidJourney, не углубляясь в технические термины. Он даже правильно определил некоммерческий статус OpenAI и её заявленные этические цели. Это значительный скачок по сравнению с ранними моделями ИИ, которые часто «галлюцинировали» контекст или упускали главное из виду.

Генерация кода как ускоритель

Если суммаризация — это быстрая победа, то программирование — там, где полезность резко возрастает. ChatGPT может генерировать функциональные фрагменты кода, которые можно скопировать и вставить в проект. Я попросил его создать контактную форму. Результатом стал валидный HTML и CSS, готовые к развертыванию.

Но вот что действительно впечатляет: он также может генерировать код, специально адаптированный для WordPress. Для разработчиков и владельцев сайтов, которые не пишут код на PHP с нуля каждый день, это значительно сокращает время разработки. Он не просто предоставляет синтаксис; он понимает контекст среды управления контентом (CMS).

Темная сторона: академический и контентный обман

Разумеется, не все видят в этом полезного помощника. Некоторые рассматривают его как инструмент для обхода правил, подрывающий честность. Преподаватели уже заметили, что студенты используют его для написания эссе.

Рассмотрим вопрос, поставленный профессором из Лионского университета: В какой степени герой несет ответственность за свои поступки?

Я ввел этот точный запрос в ChatGPT. Ответ был философским, структурированным и вполне правдоподобным:

Герой несет ответственность за свои поступки, поскольку осознает, что он делает, и принимает последствия. Он способен принимать решения и реализовывать их, как позитивные, так и негативные. Он также несет ответственность за свои поступки, поскольку должен отчитываться перед властями и обществом и способен признавать и раскаиваться в своих ошибках. Наконец, герой несет ответственность за свои поступки, поскольку является свободной и автономной личностью, которая должна отчитываться перед собой и своими близкими.

Когда я продолжил диалог, попросив написать эссе на эту тему объемом 500 слов, ChatGPT справился с задачей. Тон был академическим. Структура была грамотной. Его можно было бы принять за работу компетентного студента. Именно здесь обещание «рабочего кода» превращается в инструмент для списывания.

Где ИИ спотыкается

Несмотря на свое совершенство, ChatGPT не безошибочен. Он «галлюцинирует». Более того, он допускает фактические ошибки, иногда грубые.

Возьмем Рене Декарта. В начале января, если вы спросили ChatGPT, где жил этот философ, он утверждал, что он проводил время в Южной Америке. Это исторически неверно. Декарт умер в Швеции и преимущественно жил во Франции и Нидерландах. Спустя месяц модель исправилась. Когда ее спросили конкретно о Южной Америке, она отказалась от своего предыдущего утверждения.

Кажется, что модель учится или корректирует свои веса со временем, но нет прозрачности в том, как она исправляет эти ошибки. В отличие от Википедии, которая приводит источники, ChatGPT дает ответ без цепочки ссылок на источники. Если вы используете его для исследований, вы доверяете «черному ящику». Если вам нужно проверить факт, вам все равно придется обращаться к первоисточникам.

Проблема прогнозирования

Давайте будем откровенны: ChatGPT не претендует на наличие хрустального шара. Когда речь заходит о президентских выборах во Франции в 2027 году, модель уклоняется от ответа. Если попросить назвать конкретную дату, когда люди ступят на Марс, она отказывается делать предположения. Мы изменяли формулировки, проверяли границы допустимого — но модель не сдвинулась с места.

Часть этого явления обусловлена структурой. ChatGPT 3 опирается на базу данных, актуальность которой ограничена 2021 годом. Всё, что произошло после этой даты, для неё невидимо. Однако молчание модели уходит глубже, чем просто отсутствие данных.

Отказ от выбора стороны

Мы просили высказать мнения. Много мнений. Ответы строго укладывались в рамки политической корректности. Каждый ответ казался тщательно выверенным пресс-релизом.

Возьмём сравнение Джо Байдена и Дональда Трампа. Модель отмечает, что у них разные позиции. Она утверждает, что определение того, кто «лучше», зависит от индивидуальных критериев. Она не выбирает победителя.

Спросите, является ли атомная энергетика экологичной. Модель перечисляет аргументы «за» и «против». Она занимает выжидательную позицию.

Но есть одно исключение. Одна жёсткая граница.

Красная линия в вопросе климата

Каждый раз, когда возникает тема «климатических скептиков», тон меняется. Модель становится твёрдой. Она отвергает альтернативные точки зрения. В вопросе глобального потепления нет места нюансам.

Это порождает назойливый вопрос. Не заложили ли программисты свои собственные предубеждения в код?

Мы не должны игнорировать возможность того, что разработчики повлияли на поведение модели в темах, которые их глубоко волновали.

Стоит задаться вопросом: является ли эта жёсткость следствием обучающих данных или сознательно установленным ограничением? Модель не делает предположений. Она просто навязывает консенсус.

Почему шутки не работают

Юмор — это слепое пятно. Когда модель просили сочинить шутку, она не смогла выдать ничего, что могло бы вызвать смех. Дело не только в том, что они были плохими; они были структурно несостоятельными или банально очевидными. ИИ не обладает интуитивным скачком, необходимым для остроумия. Он имитирует форму панчлайна, не понимая ни тайминга, ни подтекста.

Костыль клише

Также присутствует тенденция к заполнению текста. Вывод часто затягивается, разбавляется многословными формулировками, которые мало что говорят. Вы получаете длинные, извилистые предложения, которые можно сократить вдвое без потери смысла. Хуже того, модель сильно полагается на заезженные фразы. Одни и те же переходы повторяются снова и снова, с лишь незначительной заменой слов. Это паттерн колебаний, замаскированный под прозу. Когда модель не знает ответа, она не делает паузу. Она просто говорит больше.