97 языков. Переключает сама. 🤯
И не человек жмёт кнопку «сменить язык». Машина слышит, что собеседник заговорил на другом, — и переходит следом. Посреди фразы.
Мы-то с вами привыкли к другому голосу в трубке. «Нажмите один... назовите цель обращения... я вас не поняла, повторите» 🙄. Третий круг по меню, и хочется дать трубке в глаз. Ведь бесит же, согласитесь?
15 сентября Google показал две модели — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Формулировка из его же блога: «самые продвинутые наши модели живого диалога, созданные для естественного разговора».
Что умеют — строго по объявлению, без моих домыслов:
💥 обрабатывают изображение почти без задержки: с моделью можно не только говорить, но и показывать ей;
✔️ сами определяют язык и переходят на него прямо посреди разговора — те самые 97 языков;
🤔 в фоне дёргают нужные инструменты и сервисы, при этом разговор не встаёт на паузу.
Раскатывают с того же дня: разработчикам — через Gemini API и Google AI Studio, всем остальным — в Search Live.
А теперь без «мир никогда не будет прежним». Что из этого касается лично нас.
Говорящий помощник съехал с территории программистов. Ещё недавно «робот, который разговаривает с моим клиентом» упиралось в разработчика, техзадание и месяцы. Сейчас это строительный блок, который лежит в открытом доступе. Собирать из него — работа не про код, а про сценарий разговора.
Два адреса, по которым это стучится.
💼 Если вы эксперт и тонете во входящих. «А сколько стоит?», «а когда есть окно?», «а вы работаете с подростками?» — это не ваша экспертная работа. Это работа администратора, которого мы себе так и не наняли: то жалко, то искать некогда. Вот её и можно наконец отдать голосу, оставив себе собственно приём.
⚙️ Если вы присматриваетесь к заработку на нейросетях. У салонов, клиник, автосервисов, школ эта дыра зияет годами: пропущенный звонок = ушедшие деньги. Владелец про неё знает и годами не чинит.
И тут же встаёт законный вопрос: «Если инструмент открыли всем — кто станет за это платить мне?»
Отвечаю честно. Открыли инструмент, а не результат. Фотоаппарат сегодня в кармане у каждого — фотографы почему-то не вымерли. 😏
Платят не за доступ к модели, а за человека, который сядет и продумает: что помощник отвечает на «дорого», в какой момент передаёт разговор живому, что делает, когда клиент злится. Владелец автосервиса этого делать не будет. Ему некогда, неинтересно и нечем.
Что можно сделать на этой неделе — без бюджета и без кода:
1️⃣ Поговорите вслух. Минут десять, с голосовой моделью, про свою реальную задачу. Не читайте про это — попробуйте. Страх уходит именно так;
2️⃣ Соберите вопросы. Выпишите 10 штук из тех, что вам задают до того, как заплатить. Это и есть будущий сценарий;
3️⃣ Ответьте письменно. На каждый — своими словами, как ответили бы сами. Вот этот текст и превращается в говорящего помощника. Не программа. Текст.
Такие новости разбираю здесь каждую неделю — без паники и по-человечески. Оставайтесь.
А вы бы доверили машине первый разговор со своим клиентом? Или первый голос должен быть живым — и точка?
Кстати, вся эта история упирается в один-единственный навык: внятно объяснить машине задачу словами. Ровно его и собираем руками на бесплатном практикуме. Хотите с нами? 😉