Мультимодальность: что она меняет на практике
Голосовой и мультимодальный ИИ · Урок 1 / 20
ИИ, который слышит и видит
Ещё недавно с ассистентом общались только текстом. Сейчас большинство из них принимают голос, фотографии, скриншоты, документы и таблицы. Это звучит как технический пустяк, но меняет главное — когда вы к ИИ обращаетесь.
Текстовый запрос требует сесть, открыть, сформулировать и напечатать. Из-за этого множество мелких вопросов просто не задаётся: проще махнуть рукой. Голос и камера убирают этот барьер, и ассистент начинает использоваться в тех ситуациях, где раньше был бесполезен — на кухне, в магазине, в дороге, перед сломанной техникой.
Четыре канала и что каждый даёт
- Голос. Скорость. Говорите вы примерно втрое быстрее, чем печатаете, и можете делать это с занятыми руками.
- Фото. Контекст без описания. Показать сломанный кран быстрее и точнее, чем описать его словами.
- Скриншот. Точность. Вы не пересказываете ошибку, вы её показываете — вместе со всем, что вокруг.
- Файлы. Объём. Договор на сорок страниц не перескажешь в запросе, а загрузить можно.
Главное правило выбора канала
Выбирайте не по удобству, а по тому, что дешевле передать. Если объяснение словами займёт три предложения и всё равно будет неточным — показывайте. Если вопрос простой, но руки заняты — говорите. Если нужен точный текст с формулировками — печатайте, потому что диктовка ошибается на терминах и именах.
Чего мультимодальность не меняет
Способ подачи не влияет на качество мышления модели. Плохо сформулированный вопрос голосом останется плохо сформулированным. Ошибки и выдумки никуда не деваются — более того, к ответу по фотографии люди относятся доверчивее, чем к ответу по тексту, хотя оснований для этого нет.
Шпаргалка
- Голос — скорость, фото — контекст, скриншот — точность, файл — объём.
- Выбирайте канал по тому, что дешевле передать.
- Барьер входа падает — вопросов становится больше.
- Качество мышления модели от канала не зависит.
Вспомните 6 ситуаций за последнюю неделю, когда вам был нужен быстрый ответ, но вы не стали спрашивать ИИ — потому что было неудобно, долго или сложно объяснить. Для каждой определите, какой канал подошёл бы лучше (голос, фото, скриншот, файл) и почему. Затем выберите две из них и реально проделайте через выбранный канал. Опишите, что получилось и совпало ли с ожиданием.