1 фото — и двойник заговорил
Не ролик и не озвучка поверх картинки. Человек на экране слушает, отвечает и шевелит губами в такт собственным словам. Прямо в разговоре.
Мы-то с вами знаем, чего стоит одна минута «говорящей головы». Свет не тот, ракурс не тот, на восьмом дубле заело фразу, на девятом за стеной начали сверлить. К вечеру ролика нет, зато есть твёрдое намерение никогда больше не включать камеру. 🙈
Вчера Google показал Gemini 3.8 Live with Live Avatar. Дословно из их блога:
«Gemini 3.8 Live with Live Avatar brings real-time visual presence to Gemini's conversational AI».
Перевожу на кухонный: голосовому собеседнику, который и раньше умел разговаривать, наконец приделали лицо. Видео идёт потоком, с минимальной задержкой — поэтому разговор не разваливается на «вопрос… пауза… ответ».
А вот вторая строчка, из-за которой это касается лично нас. Из одного хорошего фото собирается полностью анимированный отвечающий аватар — с сохранением сходства, фирменного стиля бренда или образа персонажа. Говорит он при этом на многих языках.
Лицо, голос, мимика. Без камеры, без света, без восьмого дубля.
Теперь ложка дёгтя — и я не стану делать вид, что её нет. ⛔
В том же объявлении написано: работает это в Gemini Enterprise, а создание собственных аватаров идёт «only through enterprise allowlisting» — по белому списку для корпоративных клиентов.
То есть прийти сегодня и собрать себе говорящего двойника нельзя. Ни вам, ни мне.
Зачем тогда знать об этом сейчас?
Затем, что дорогу эту мы с вами уже видели. Генерация картинок начиналась с закрытых списков и заявок «мы вам напишем» — а теперь кнопка лежит в каждом втором сервисе, и ею пользуется школьник. Сколько путь займёт на этот раз, я гадать не буду. Но в тот день, когда доступ откроют, выиграет не тот, кто в этот день о новости узнает, а тот, кто заранее понял, что с ней делать. 🤔
И сразу вопрос, от которого опускаются руки: «Если такую кнопку дадут всем — кому тогда буду нужен я?»
Караоке стоит в каждом торговом центре. На концерты почему-то ходят к тем, кто поёт. 😏
Подешевела аппаратура. А что говорить — не подешевело ни на рубль. Кнопка не знает, с какой фразы начать, чтобы человек не закрыл окно. Не знает, что отвечать на «дорого». И тем более не знает, чем разговор стоматологии отличается от разговора автосервиса. Платят за сценарий и за человека, который его собрал. Кнопку раздадут даром.
Что можно сделать уже сейчас — без доступа и без бюджета:
1️⃣ Напишите то, что двойник будет говорить. Пять вопросов, которые вам задают ещё до оплаты, и ответы своими словами. Без этого текста любой аватар — красивая кукла с пустым ртом.
2️⃣ Тренируйтесь на том, что открыто сегодня. Голосовой режим, картинки, видео. Навык под всем этим один: объяснить машине задачу словами так, чтобы не переделывать руками.
3️⃣ Посчитайте свою минуту. Сколько часов уходит у вас на одну минуту готового видео — со всеми дублями и сверлящим соседом. Эти часы и есть ваша будущая цена: с цифрой на руках разговаривать с заказчиком куда спокойнее. ✔️
Такие новости разбираю здесь каждую неделю — без паники и по-человечески. Оставайтесь. 👌
А вы выпустили бы на экран своего цифрового двойника — или лицо должно оставаться живым, и точка?
Кстати, вся эта история с аватарами упирается в один-единственный навык: внятно объяснить машине задачу. Ровно его и собираем руками на бесплатном практикуме. Хотите с нами? 😉