Мультимодальность: что она меняет на практике

Голосовой и мультимодальный ИИ · Урок 1 / 20

ИИ, который слышит и видит

Ещё недавно с ассистентом общались только текстом. Сейчас большинство из них принимают голос, фотографии, скриншоты, документы и таблицы. Это звучит как технический пустяк, но меняет главное — когда вы к ИИ обращаетесь.

Текстовый запрос требует сесть, открыть, сформулировать и напечатать. Из-за этого множество мелких вопросов просто не задаётся: проще махнуть рукой. Голос и камера убирают этот барьер, и ассистент начинает использоваться в тех ситуациях, где раньше был бесполезен — на кухне, в магазине, в дороге, перед сломанной техникой.

Четыре канала и что каждый даёт

  • Голос. Скорость. Говорите вы примерно втрое быстрее, чем печатаете, и можете делать это с занятыми руками.
  • Фото. Контекст без описания. Показать сломанный кран быстрее и точнее, чем описать его словами.
  • Скриншот. Точность. Вы не пересказываете ошибку, вы её показываете — вместе со всем, что вокруг.
  • Файлы. Объём. Договор на сорок страниц не перескажешь в запросе, а загрузить можно.

Главное правило выбора канала

Выбирайте не по удобству, а по тому, что дешевле передать. Если объяснение словами займёт три предложения и всё равно будет неточным — показывайте. Если вопрос простой, но руки заняты — говорите. Если нужен точный текст с формулировками — печатайте, потому что диктовка ошибается на терминах и именах.

Чего мультимодальность не меняет

Способ подачи не влияет на качество мышления модели. Плохо сформулированный вопрос голосом останется плохо сформулированным. Ошибки и выдумки никуда не деваются — более того, к ответу по фотографии люди относятся доверчивее, чем к ответу по тексту, хотя оснований для этого нет.

Инсайт. Мультимодальность меняет не качество ответов, а частоту обращений. Ценность в том, что вы задаёте вопросы, которые раньше не задавали вовсе.
Частая ошибка. Доверять ответу по фотографии больше, чем ответу по тексту. Картинка создаёт ощущение, что модель «увидела своими глазами», хотя ошибается она здесь чаще.
Про-совет. Прежде чем печатать длинное описание ситуации, спросите себя: не проще ли это показать. Три предложения объяснений почти всегда проигрывают одному снимку.

Шпаргалка

  • Голос — скорость, фото — контекст, скриншот — точность, файл — объём.
  • Выбирайте канал по тому, что дешевле передать.
  • Барьер входа падает — вопросов становится больше.
  • Качество мышления модели от канала не зависит.
1. Что главное меняет мультимодальность?
2. По какому принципу выбирать канал?
3. Как люди обычно относятся к ответу по фотографии?
Задание — проверяет ИИ

Вспомните 6 ситуаций за последнюю неделю, когда вам был нужен быстрый ответ, но вы не стали спрашивать ИИ — потому что было неудобно, долго или сложно объяснить. Для каждой определите, какой канал подошёл бы лучше (голос, фото, скриншот, файл) и почему. Затем выберите две из них и реально проделайте через выбранный канал. Опишите, что получилось и совпало ли с ожиданием.

🔒 Ответьте на вопрос верно, чтобы перейти к следующему уроку.

Мультимодальность: что она меняет на практике — Голосовой и мультимодальный ИИ — Skilvy