✦ Awe Reads. Мы пишем так, чтобы после прочтения вы смотрели на вещи чуть яснее.

Пожилая женщина ночью сидит на краю кровати и прижимает телефон к уху, лицо освещено экраном: звонок от мошенниковИзображение сгенерировано ИИ
Технологии

Сколько секунд нужно, чтобы подделать голос: всего 3

12 мин14.08.2026

Три секунды записи - и голос клонирован. Но хуже другое: люди стали хуже узнавать настоящую речь, а не подделку.

50 150

Телефон звонит в 23:40. Номер незнакомый. Вы поднимаете трубку и слышите голос дочери: она плачет, говорит, что попала в аварию, рядом полиция, и деньги нужны прямо сейчас. Голос её. Интонация её. Даже короткий вдох перед словом «мам» - её.

Это не она.

Чтобы подделать голос, мошенникам хватает трёх секунд вашей записи. Отличить результат на слух почти невозможно, и это измерено: в исследовании 2026 года 1768 человек слушали записи и узнавали синтетическую речь в 71-73% случаев. Программа-детектор в том же эксперименте была права в 94,5%. Ухо проигрывает машине больше двадцати процентных пунктов.

Но главная цифра в этом исследовании другая. За пять лет люди не стали лучше ловить подделки - они стали хуже узнавать настоящую речь: 64,1% правильных ответов против 72,7% в 2021 году. Телефонный звонок перестаёт быть доказательством вообще, а не только когда на том конце мошенник.

Значит, защищает не слух, а процедура: положить трубку и перезвонить самому. Ниже - сколько секунд записи нужно мошенникам и откуда они её берут, почему совет «прислушайтесь к интонации» скорее вредит, и один вопрос, который ломает любой клон. О нём ближе к концу.

Сколько секунд записи нужно, чтобы подделать голос?

Трёх секунд. Не трёх минут и не часа разговора - трёх секунд обычной речи.

В 2023 году исследователи Microsoft показали систему VALL-E, которая синтезирует речь нового человека, услышав всего «трёхсекундную запись незнакомого голоса». Технически это называется zero-shot синтез (модель работает с человеком, которого никогда раньше не слышала, без отдельного обучения на нём). До этого для убедительного клона требовались десятки минут студийной записи и инженер рядом.

Независимо это подтвердила проверка McAfee: инженеры компании взяли бесплатные онлайн-инструменты и получили 85% совпадения с оригиналом из записи длиной три-четыре секунды. Когда над клоном поработали подольше, совпадение дошло примерно до 95%. В том же отчёте - опрос 7054 человек в семи странах: каждый четвёртый взрослый уже сталкивался с голосовым мошенничеством, а из тех, кто попался, деньги потеряли 77%.

Дальше у мошенников вопрос только один: где взять эти три секунды. И ответ неприятный.

Где лежит ваш голос прямо сейчас

  • Сторис и рилсы. Любое видео, где вы говорите в камеру. Даже пятисекундное.
  • Голосовые сообщения в мессенджерах. Пересланное голосовое живёт дальше в чужих чатах, и вы за него уже не отвечаете.
  • Рабочие созвоны и вебинары. Записи встреч часто лежат по ссылке без пароля.
  • Автоответчик и приветствие голосовой почты. Двенадцать слов вашим голосом, доступные любому, кто набрал номер.
  • Обычный входящий звонок. Достаточно, чтобы вы сказали «алло, вас слушаю» - и запись уже есть.

Федеральная торговая комиссия США формулирует это без метафор: злоумышленнику нужен «короткий аудиофрагмент голоса вашего родственника, который можно взять из выложенного в сеть контента, и программа клонирования голоса». И всё: ни доступа к телефону, ни взлома, ни утечки базы.

Хорошо, подделать голос легко и дёшево. Но человек ведь узнаёт своих - на этом держится вся наша уверенность. Проверки она не выдерживает.

Можно ли отличить голос нейросети от настоящего на слух?

Почти нет. Человек в принципе плохо различает синтетическую речь, и тренировка почти не помогает. Это не про невнимательных людей, это про всех.

Учёные из Университетского колледжа Лондона проверили это на 529 участниках. Люди слушали записи на английском и китайском и решали, настоящая речь или сгенерированная. Подделку узнавали в 73% случаев. Потом части участников дали послушать примеры дипфейков (подделок, собранных нейросетью - программой, которая учится на примерах и потом сама создаёт похожее), чтобы натренировать ухо. Точность выросла на 3,84 процентных пункта. Это статистически значимо и практически бесполезно: ошибаться в четверти случаев вместо чуть большей четверти - не защита.

Причина в том, как устроено узнавание голоса. Мозг не хранит запись человека целиком - он держит несколько грубых опор: высоту, скорость речи, характерную мелодику фразы, пару личных словечек. По этим опорам он достраивает остальное сам, как достраивает лицо по силуэту в темноте. Синтез копирует ровно эти опоры, потому что именно они несут больше всего информации о говорящем. Получается, подделка бьёт не мимо системы узнавания, а точно в неё.

Добавьте сюда телефон. Линия режет частоты, сжатие съедает призвуки, а шум машины или подъезда маскирует остатки. Ровно те мелкие дефекты синтеза, которые различимы в наушниках на тихой записи, в реальном звонке просто не доезжают до уха.

Отдельно стоит сказать про ограничения: в том эксперименте звучал один женский голос, а доля подделок в выборке была выше, чем в реальной жизни. Авторы честно отметили и то, что использовали не самый передовой на тот момент синтез. То есть в реальности всё, скорее всего, хуже, а не лучше.

Через три года ту же проверку повторили на заметно большей выборке, и главный результат там оказался не про подделки.

Что изменилось к 2026 году: почему люди перестают верить настоящим голосам?

Люди не стали хуже ловить фейки. Люди стали хуже узнавать правду.

Исследователи Fraunhofer AISEC (немецкий институт прикладных исследований в области кибербезопасности) собрали 1768 участников и 35 532 оценки записей, сделанных 138 разными системами синтеза. Сравнили с аналогичным замером 2021 года. Картина такая:

  • Точность распознавания синтетической речи: 72,9% в 2021 году, 71,2% в 2026-м. Практически не изменилась.
  • Точность узнавания настоящей речи: 72,7% в 2021 году, 64,1% в 2026-м. Падение на 8,6 процентных пункта.

Авторы называют это сдвигом скептицизма. Проще говоря: наслушавшись про дипфейки, люди начали подозревать подделку там, где её нет. Живой человек говорит в трубку - а его записывают в роботы.

Это переворачивает привычную рамку разговора. Обычно опасность описывают так: «вас обманут поддельным голосом». Настоящая цена другая и шире: телефонный звонок перестаёт быть доказательством чего-либо. Не только звонок мошенника - вообще любой. Мать не поверит сыну, суд не поверит записи.

Есть и практический вывод, неудобный для большинства статей на эту тему. Списки вроде «пять признаков ИИ-голоса: металлический призвук, странные паузы, ровное дыхание» тренируют ровно тот навык, который в исследовании просел. Человек начинает вслушиваться - и промахивается в обе стороны. Машина, кстати, справляется: детектор в том же эксперименте дал 94,5%. Но детектора у вас в трубке нет.

Значит, вопрос ставится иначе: не «как расслышать», а «как проверить, не полагаясь на слух». Прежде чем перейти к ответу, посмотрим, как такой звонок устроен изнутри - узнать сценарий проще, чем расслышать тембр.

Как звонят мошенники с поддельным голосом: три сценария

Клонированный голос почти никогда не работает сам по себе - он вставлен в готовую схему давления. Схем в основном три.

1. Родственник в беде

Классика, которой десятки лет, только теперь с настоящим голосом. Авария, задержание, больница, «мам, только не говори папе». Ключевой признак - не звук, а структура разговора: спешка, секретность и запрет проверять. Вас просят не класть трубку, никому не звонить и решить всё за пятнадцать минут.

ФТК США описывает финансовую развязку так: «Если звонящий говорит перевести деньги, отправить криптовалюту или купить подарочные карты и продиктовать их номера и PIN-коды - это могут быть признаки мошенничества». Логика простая: такие переводы почти невозможно отменить.

2. Голос начальника

Здесь бьют по служебной иерархии. Спокойный, узнаваемый голос руководителя просит срочно оплатить счёт, прислать документ или подтвердить реквизиты. Возражать директору неловко, перепроверять - тем более. Механизм описывают в «Лаборатории Касперского»: сам по себе уровень власти, который слышится в трубке, повышает шансы, что человек подчинится не раздумывая.

3. Сотрудник банка или полиции

Самый массовый сценарий в мире по деньгам. В Сингапуре, где полиция публикует детальную разбивку, мошенничество с представлением себя госслужащим в 2025 году заняло второе место по сумме потерь среди всех схем. В США на тех, кто выдавал себя за компанию, за тот же год потеряли почти миллиард долларов, и больше всего внутри этой группы - как раз на «сотрудниках банка». Ещё около 920 млн ушло тем, кто представлялся государственным ведомством.

Выглядит это буднично. Сначала звонит «служба безопасности банка»: по вашей карте зафиксирована подозрительная операция, подтвердите, что это не вы. Вы говорите «нет, не я» - и разговор аккуратно передают «сотруднику полиции», который уже знает ваше имя и последние цифры карты. Дальше вас просят никому не рассказывать, потому что «идёт проверка», и перевести деньги на безопасный счёт. Голос спокойный, речь официальная, на фоне слышен офисный шум. Ни одного из этих элементов нет в списках «признаков ИИ-голоса» - потому что подделан здесь не звук, а обстановка.

Общий знаменатель всех трёх сценариев: вас торопят и уводят от проверки. Поддельный голос - только инструмент, чтобы вы не успели усомниться. Во сколько это обходится миру, видно по национальным отчётам.

Сколько денег теряют на голосовом мошенничестве?

Потери растут почти везде, но не везде - и это самое полезное наблюдение. Данные за 2025 год, каждая цифра от национального регулятора или полиции:

  • США - 3,5 млрд долларов потерь от схем с выдачей себя за другого. Почти каждое третье обращение о мошенничестве относилось к этой категории, а сами потери выросли почти втрое с 2020 года. Общие потери американцев от мошенничества - 16 млрд долларов, на четверть больше, чем годом раньше (ФТК, 2026).
  • Австралия - 2,18 млрд австралийских долларов, рост на 7,8% за год. Национальный антимошеннический центр отдельно отмечает «растущую изощрённость мошенничества за счёт искусственного интеллекта».
  • Сингапур - 913,1 млн сингапурских долларов против 1,1 млрд годом раньше, и это падение: число случаев снизилось почти на четверть, на 24,8%. Полиция предотвратила ущерб примерно на 348 млн и изъяла у мошенников ещё около 140 млн.
  • Россия и СНГ - 29,3 млрд рублей похищено со счетов за 2025 год, на 6,4% больше, чем годом раньше. Число операций без согласия клиента выросло на 31,2% - крадут чаще, но мельче. Банки при этом предотвратили хищений на 13,9 трлн рублей, а вот вернули пострадавшим только 1,7 млрд - 5,9% от украденного, годом раньше возвращали 9,9% (данные Банка России в изложении «Интерфакса», февраль 2026).

Сингапурский случай стоит того, чтобы на нём задержаться. Он показывает, что кривая не обязана расти: там сработали блокировки переводов, обязательная задержка платежей и массовое информирование. Технология одна и та же во всех странах - разница в процедурах вокруг денег.

Ровно та же логика работает и на уровне одной семьи. Не пытайтесь перехитрить технологию. Меняйте процедуру.

Какие советы против мошенников не работают?

Половина популярных рекомендаций по этой теме бесполезна, а некоторые делают хуже. Разберём их прежде, чем перейти к рабочим.

  • «Вслушайтесь в паузы и дыхание». Это ровно тот навык, который в замерах падает, а не растёт. Хуже того, натренированное подозрение бьёт по живым людям: доля правильно узнанной настоящей речи упала до 64,1%.
  • «Перезвоните на этот же номер». Номер мошенника подменяется (спуфинг - подстановка чужого номера в определитель, техническая операция без взлома чего-либо). Обратный звонок попадёт к тому же человеку, который вам только что врал.
  • «Спросите кодовое слово прямо в этом разговоре». Работает только если слово уже согласовано заранее. Придумывать его в момент звонка бессмысленно: вы сами продиктуете собеседнику то, что он попросит повторить.
  • «Задайте личный вопрос». Личный и частный - разные вещи. Имя питомца, марка машины, город рождения, школа - всё это лежит в открытых профилях и находится за минуту.
  • «Поставьте определитель ИИ-голоса». Детекторы существуют и работают хорошо: 94,5% точности в лабораторных условиях. Но они анализируют файл после разговора, а не поток в вашей трубке в реальном времени.

Общая ошибка у всех пяти одна: они пытаются выиграть на территории мошенника - в самом звонке. Выигрывают за её пределами.

Как проверить, что звонит настоящий человек?

Проверка занимает меньше минуты и не требует от вас различать тембр. Именно поэтому она работает, даже если клон идеальный.

Шаг 1. Положить трубку и перезвонить самому

Главное правило, и оно же формулировка ФТК: «Не верьте голосу. Позвоните человеку, который якобы с вами связался, и проверьте историю. Используйте номер, который точно принадлежит ему».

Ключевое слово - сами. Не «перезвоните по номеру, с которого звонили», не «наберите номер, который вам продиктовали». Откройте свою записную книжку и наберите оттуда. Мошенник может держать линию занятой, поэтому если человек не отвечает, ФТК советует попробовать связаться с ним через другого родственника или друзей.

Обычное возражение: а если авария настоящая, время уйдёт впустую. Тридцать секунд на звонок не решают судьбу ни в одной настоящей аварии. Зато решают в поддельной - потому что схема живёт ровно до момента, пока вы не проверили.

Шаг 2. Кодовое слово в семье

Заранее договорённое слово, которое знают только свои и которого нет нигде в переписке и соцсетях. Не кличка кота и не девичья фамилия матери - это ищется за минуту. Что-то бессмысленное: «абрикос», «седьмой троллейбус», «синий чемодан».

Работает это потому, что клонировать можно голос, но не память. Нейросеть воспроизведёт тембр и манеру - и не знает, о чём вы договаривались за ужином в марте.

Правило одно: слово не произносят вслух в обычных разговорах и не пишут в чате. Оно живёт только на случай тревожного звонка.

Шаг 3. Вопрос, ответа на который нет в интернете

Тот самый вопрос, обещанный в начале. Спросите что-то, что знает только настоящий человек, и чего нет ни в одном профиле: что вы ели в прошлое воскресенье, как зовут соседку снизу, где лежит запасной ключ, чем закончился спор про отпуск.

Мошенник с поддельным голосом в этот момент оказывается в тупике. Он управляет голосом в реальном времени, у него нет секунд на выдумывание правдоподобной детали, и любая пауза ломает давление, на котором держится схема. Типичная реакция - раздражение и возврат к спешке: «некогда, потом объясню». Это и есть ответ.

Важно: вопрос должен быть про частное, а не про общеизвестное. «Как зовут мою собаку» - плохой вопрос, собака есть в ленте. «Что мы забыли купить в прошлую субботу» - хороший.

Что делать, если деньги мошенникам уже перевели?

Действовать в первые часы, потому что дальше шансы падают. Порядок такой:

  1. Позвонить в банк и заявить, что перевод сделан под влиянием мошенников. Не через чат, а голосом на горячую линию с обратной стороны карты. Попросить зафиксировать обращение и назвать его номер.
  2. Подать заявление в полицию. Без него банк в большинстве стран не начнёт разбирательство, а платёжные системы не станут отзывать перевод.
  3. Сохранить всё. Номер, с которого звонили, время, скриншоты перевода, запись разговора, если она есть. Это единственные доказательства.
  4. Предупредить своих. Один украденный голос обычно используют по всему списку контактов. Если позвонили «вам от сына», следующими будут бабушка и брат.

Шансы честнее не приукрашивать: в России в 2025 году банки вернули пострадавшим 5,9% украденного, и это меньше, чем годом раньше. Но и эти проценты собираются из обращений, которые поступили в первые часы. По остальным не возвращается ничего.

Как защитить свой голос от клонирования?

Полностью защитить не выйдет, и делать вид, что выйдет, нечестно. Но объём доступных мошенникам записей сократить можно:

  • Закрыть профили, где вы регулярно говорите на камеру, если публичность не нужна вам по работе.
  • Не оставлять голосовое приветствие на автоответчике - системный звук справляется не хуже.
  • Не отвечать на звонки с незнакомых номеров голосом. Молчание в трубку записать нельзя.
  • Проверять, не лежат ли записи ваших рабочих встреч по открытой ссылке.

И честная оговорка: если вы преподаёте, ведёте подкаст, продаёте через сторис или просто активны в мессенджерах - ваш голос уже доступен, и с этим ничего не сделать. Поэтому шаги из предыдущего раздела важнее гигиены. Смысл не в том, чтобы вас нельзя было подделать. Смысл в том, чтобы подделка ничего не дала.

Коротко

  • Мошенникам достаточно трёх секунд записи, чтобы подделать голос.
  • Человек узнаёт подделку примерно в 7 случаях из 10, и тренировка почти не помогает.
  • К 2026 году люди стали хуже узнавать настоящую речь: 64,1% против 72,7% пятью годами раньше.
  • Голос - не доказательство. Доказательство - обратный звонок, кодовое слово и вопрос из личной памяти.

Вернёмся к звонку в 23:40. Вы слышите голос дочери, и внутри всё обрывается - это нормально, так и должно быть. Но дальше вы говорите одну фразу: «Перезвоню тебе сама». И набираете её номер из своей книжки.

Сегодня же напишите в семейный чат одно бессмысленное слово и договоритесь: если беда - произносим его. Две минуты. Голос подделать можно. Общее слово - нет.

Источники

#сколько секунд нужно подделать голос#подделать голос нейросетью#как отличить голос нейросети#клонирование голоса мошенники#кодовое слово от мошенников#дипфейк голоса по телефону#мошенники подделывают голос

Лучшие идеи — на почту

Раз в неделю присылаем 3–5 статей, которые реально стоит прочитать. Без спама, отписаться можно в один клик.

Читайте также

Частые вопросы

Трёх секунд. Система VALL-E от Microsoft синтезирует речь по трёхсекундному образцу, а инженеры McAfee получили 85% совпадения из записи в три-четыре секунды бесплатными онлайн-инструментами.

Почти нет. В исследованиях 2023 и 2026 годов люди узнавали синтетическую речь в 71-73% случаев, а тренировка добавляла меньше 4 процентных пунктов. Программа-детектор при этом даёт 94,5%.

Положить трубку и перезвонить самому по номеру из своей записной книжки, а не по тому, с которого звонили. Если человек не отвечает, связаться через других родственников или друзей.

Любое, которого нет в соцсетях и переписке: не кличка питомца и не фамилия матери. Подойдёт бессмысленное сочетание вроде «синий чемодан». Вслух в обычных разговорах его не произносят.

Полностью нет. Объём можно сократить: закрыть профили с видео, убрать голосовое приветствие на автоответчике, не отвечать голосом на незнакомые номера. Но проверка звонка важнее гигиены.

Комментарии

Войдите в аккаунт, чтобы оставить комментарий.

Войти

Пока нет комментариев. Будьте первым!

Awe ReadsПодписаться на Awe Reads
Сколько секунд нужно, чтобы подделать голос: всего 3