Рис. 1.11. Поиск пользовательских GPT
Рис. 1.12. Пример использования GPT
Еще ChatGPT умеет интегрироваться c приложениями для расширения функциональности, можно добавить календарь, почту или даже Photoshop. Полный список доступен на официальном сайте. Давайте попробуем добавить приложение Flixor, обещают, что оно поможет нам с выбором фильма (рис. 1.13). Теперь, когда мы вводим символ @, появляется список наших приложений (рис. 1.14). Для начала спросим, что вообще мы теперь можем делать, введя «@ Flixor функции» (обратите внимание на появившуюся иконку у поля ввода: когда она есть, вам не нужно каждый раз вводить название с @ в начале), а затем проверим, как оно работает. На запрос «Подбери сериалы, похожие на Dark» он выдает категоризированный список названий с объяснениями (рис. 1.15).
Рис. 1.13. Пример интеграции
Рис. 1.14. Отметка о подключенном приложении
Рис. 1.15. Результат использования
Также с недавнего времени добавлен сервис Codex (рис. 1.16) – платформа для разработки программного обеспечения, интегрирующаяся с GitHub и вашей системой разработки (IDE).
И это далеко не все, что может старый добрый ChatGPT на данный момент. Актуальный функционал пополняется с каждым обновлением, поэтому обязательно заглядывайте в список возможностей на официальном сайте OpenAI.
Рис. 1.16. Интерфейс Codex
Как можно заметить, нам предоставляется достаточно большой функционал на бесплатном тарифе – пусть и с некоторыми лимитами, на платных – больше возможностей, выше версия модели, способность справляться с более сложными задачами. Также есть тарифы вроде Business и Enterprise, предназначенные специально для компаний и совместных проектов.
Хочется еще кратко упомянуть о настройках ChatGPT (рис. 1.17). Мы можем редактировать внешний вид, уведомления, контролировать активность на разных устройствах и так далее. Но самое интересное – это «Персонализация» (рис. 1.18). Здесь мы можем указать все, что только пожелаем, для того чтобы общение с чат-ботом было более качественным и комфортным.
Рис. 1.17. Настройки ChatGPT
Рис. 1.18. Персонализация
Сейчас ChatGPT – непрерывно развивающийся ИИ, а возможности его интеграции лишь растут. OpenAI, задав высокую планку в далеком 2018 году, уверенно ее держат, продолжая работу над одним из самых мощных на данный момент инструментов.
https://chatgpt.com/.
https://help.openai.com/en/articles/9260256-chatgpt-capabilities-overview.
https://chatgpt.com/gpts.
6.2. Gemini[17]
Семейство моделей ИИ от Google DeepMind (рис. 1.19). До 2023 года у Google было два основных направления развития ИИ: модель PaLM, которая в дальнейшем легла в основу корпоративных сервисов, и LaMDA – разговорная языковая модель, ставшая основой для чат-бота Bard. Он умел отвечать на вопросы пользователей, знал 20 языков программирования и имел интеграции с основными продуктами Google.
В конце 2023 года Bard перешел на новую языковую модель Gemini 1.0, которая изначально была создана как мультимодальная – то есть способная обрабатывать не только текстовую информацию, но и иные форматы. Теперь все усилия разработчиков Google DeepMind оказались сосредоточены на развитии именно этой модели. Уже через пару месяцев вышла Gemini 1.5 Pro, имеющая рекордное количество обрабатываемой одновременно информации: можно было загрузить целую книгу, и модель, дойдя до ее конца, не «забывала», что было в начале.
К весне 2024 года Google отказался от предыдущего названия чат-бота и окончательно сделал его одноименным с моделью: Gemini. Сейчас происходит постепенное превращение в целую экосистему: интеграция с сервисами уже есть, осталось научить модель выполнять реальные действия, помимо выдачи ответов, то есть развитие ИИ-агентов. А также, если пользуетесь Android, вы, вероятно, уже заметили, что как альтернатива привычному Google Assistant теперь предлагается ИИ. Это тоже Gemini.
Рис. 1.19. Интерфейс Gemini
Итак, что нам сейчас предлагает Google?
♦ Генерация и обработка изображений по текстовому запросу и редактирование пользовательских. Сейчас для этого используется генератор Nano Banana.
♦ Генерация видео при помощи Veo. Ограничение – длина ролика не больше 8 секунд, для фильма этого не хватит, но вот «оживить» фото вполне.
♦ Умеет анализировать не только изображения или текст, но и видео.
♦ В мобильном приложении Gemini может «смотреть» вокруг при помощи камеры или переводить текст с экрана вашего смартфона.
♦ Умеет справляться со сложными задачами при помощи режимов Deep Think и Deep Research, задействуя многогипотезное параллельное мышление, позволяющее получить более точные ответы, чем в других моделях.
♦ Интегрирован с сервисами Google. Поможет найти информацию в вашем Gmail, умеет работать с Google Docs и сохранять их на Google Drive, проложит маршрут на Google Maps, перескажет видео и так далее.
♦ Поддерживает голосовой разговор при помощи Gemini Live. Выступает полноценным собеседником, выдерживающим необходимые интонации, которого можно перебивать и задавать уточняющие вопросы.
♦ Умеет создавать персональных ИИ-ассистентов – Gems.
Также стоит отметить существование Google AI Studio (рис. 1.20)[18]. Сервис, больше направленный на более сложные задачи, чем поиск ответа на вопрос или генерация изображения. Он позволяет создавать собственных ИИ-ботов, обученных на ваших специфических данных, умеет работать с огромными массивами текста (но все же в определенных пределах), позволяет более тонкую настройку (рис. 1.21): например, можно указать четкие рамки для его ответов и поведения, а также настроить температуру (креативность) ответов. По сути, AI Studio – это «песочница», обладающая бо́льшим функционалом, чем просто Gemini. Это полезно, если вы хотите получить доступ через API, создать свой прототип или просто поэкспериментировать и посмотреть, как это все работает, но доставляет излишние сложности, если вы хотите всего лишь спланировать отпуск. Поэтому для простых задач используем Gemini, для более экспериментального подхода – Google AI Studio.
Рис. 1.20. Google AI Studio
Рис. 1.21. Настройки в Google AI Studio
Как и в предыдущем случае, актуальные на текущий момент функции и возможности лучше уточнять на официальном сайте разработчика, так как ИИ непрерывно обновляется и оптимизируется.