Телефон звонит в 23:40. Номер незнакомый. Вы поднимаете трубку и слышите голос дочери: она плачет, говорит, что попала в аварию, рядом полиция, и деньги нужны прямо сейчас. Голос её. Интонация её. Даже короткий вдох перед словом «мам» - её.
Это не она.
Чтобы подделать голос, мошенникам хватает трёх секунд вашей записи. Отличить результат на слух почти невозможно, и это измерено: в исследовании 2026 года 1768 человек слушали записи и узнавали синтетическую речь в 71-73% случаев. Программа-детектор в том же эксперименте была права в 94,5%. Ухо проигрывает машине больше двадцати процентных пунктов.
Но главная цифра в этом исследовании другая. За пять лет люди не стали лучше ловить подделки - они стали хуже узнавать настоящую речь: 64,1% правильных ответов против 72,7% в 2021 году. Телефонный звонок перестаёт быть доказательством вообще, а не только когда на том конце мошенник.
Значит, защищает не слух, а процедура: положить трубку и перезвонить самому. Ниже - сколько секунд записи нужно мошенникам и откуда они её берут, почему совет «прислушайтесь к интонации» скорее вредит, и один вопрос, который ломает любой клон. О нём ближе к концу.
Сколько секунд записи нужно, чтобы подделать голос?
Трёх секунд. Не трёх минут и не часа разговора - трёх секунд обычной речи.
В 2023 году исследователи Microsoft показали систему VALL-E, которая синтезирует речь нового человека, услышав всего «трёхсекундную запись незнакомого голоса». Технически это называется zero-shot синтез (модель работает с человеком, которого никогда раньше не слышала, без отдельного обучения на нём). До этого для убедительного клона требовались десятки минут студийной записи и инженер рядом.
Независимо это подтвердила проверка McAfee: инженеры компании взяли бесплатные онлайн-инструменты и получили 85% совпадения с оригиналом из записи длиной три-четыре секунды. Когда над клоном поработали подольше, совпадение дошло примерно до 95%. В том же отчёте - опрос 7054 человек в семи странах: каждый четвёртый взрослый уже сталкивался с голосовым мошенничеством, а из тех, кто попался, деньги потеряли 77%.
Дальше у мошенников вопрос только один: где взять эти три секунды. И ответ неприятный.
Где лежит ваш голос прямо сейчас
- Сторис и рилсы. Любое видео, где вы говорите в камеру. Даже пятисекундное.
- Голосовые сообщения в мессенджерах. Пересланное голосовое живёт дальше в чужих чатах, и вы за него уже не отвечаете.
- Рабочие созвоны и вебинары. Записи встреч часто лежат по ссылке без пароля.
- Автоответчик и приветствие голосовой почты. Двенадцать слов вашим голосом, доступные любому, кто набрал номер.
- Обычный входящий звонок. Достаточно, чтобы вы сказали «алло, вас слушаю» - и запись уже есть.
Федеральная торговая комиссия США формулирует это без метафор: злоумышленнику нужен «короткий аудиофрагмент голоса вашего родственника, который можно взять из выложенного в сеть контента, и программа клонирования голоса». И всё: ни доступа к телефону, ни взлома, ни утечки базы.
Хорошо, подделать голос легко и дёшево. Но человек ведь узнаёт своих - на этом держится вся наша уверенность. Проверки она не выдерживает.
Можно ли отличить голос нейросети от настоящего на слух?
Почти нет. Человек в принципе плохо различает синтетическую речь, и тренировка почти не помогает. Это не про невнимательных людей, это про всех.
Учёные из Университетского колледжа Лондона проверили это на 529 участниках. Люди слушали записи на английском и китайском и решали, настоящая речь или сгенерированная. Подделку узнавали в 73% случаев. Потом части участников дали послушать примеры дипфейков (подделок, собранных нейросетью - программой, которая учится на примерах и потом сама создаёт похожее), чтобы натренировать ухо. Точность выросла на 3,84 процентных пункта. Это статистически значимо и практически бесполезно: ошибаться в четверти случаев вместо чуть большей четверти - не защита.
Причина в том, как устроено узнавание голоса. Мозг не хранит запись человека целиком - он держит несколько грубых опор: высоту, скорость речи, характерную мелодику фразы, пару личных словечек. По этим опорам он достраивает остальное сам, как достраивает лицо по силуэту в темноте. Синтез копирует ровно эти опоры, потому что именно они несут больше всего информации о говорящем. Получается, подделка бьёт не мимо системы узнавания, а точно в неё.
Добавьте сюда телефон. Линия режет частоты, сжатие съедает призвуки, а шум машины или подъезда маскирует остатки. Ровно те мелкие дефекты синтеза, которые различимы в наушниках на тихой записи, в реальном звонке просто не доезжают до уха.
Отдельно стоит сказать про ограничения: в том эксперименте звучал один женский голос, а доля подделок в выборке была выше, чем в реальной жизни. Авторы честно отметили и то, что использовали не самый передовой на тот момент синтез. То есть в реальности всё, скорее всего, хуже, а не лучше.
Через три года ту же проверку повторили на заметно большей выборке, и главный результат там оказался не про подделки.
Что изменилось к 2026 году: почему люди перестают верить настоящим голосам?
Люди не стали хуже ловить фейки. Люди стали хуже узнавать правду.
Исследователи Fraunhofer AISEC (немецкий институт прикладных исследований в области кибербезопасности) собрали 1768 участников и 35 532 оценки записей, сделанных 138 разными системами синтеза. Сравнили с аналогичным замером 2021 года. Картина такая:
- Точность распознавания синтетической речи: 72,9% в 2021 году, 71,2% в 2026-м. Практически не изменилась.
- Точность узнавания настоящей речи: 72,7% в 2021 году, 64,1% в 2026-м. Падение на 8,6 процентных пункта.
Авторы называют это сдвигом скептицизма. Проще говоря: наслушавшись про дипфейки, люди начали подозревать подделку там, где её нет. Живой человек говорит в трубку - а его записывают в роботы.
Это переворачивает привычную рамку разговора. Обычно опасность описывают так: «вас обманут поддельным голосом». Настоящая цена другая и шире: телефонный звонок перестаёт быть доказательством чего-либо. Не только звонок мошенника - вообще любой. Мать не поверит сыну, суд не поверит записи.
Есть и практический вывод, неудобный для большинства статей на эту тему. Списки вроде «пять признаков ИИ-голоса: металлический призвук, странные паузы, ровное дыхание» тренируют ровно тот навык, который в исследовании просел. Человек начинает вслушиваться - и промахивается в обе стороны. Машина, кстати, справляется: детектор в том же эксперименте дал 94,5%. Но детектора у вас в трубке нет.
Значит, вопрос ставится иначе: не «как расслышать», а «как проверить, не полагаясь на слух». Прежде чем перейти к ответу, посмотрим, как такой звонок устроен изнутри - узнать сценарий проще, чем расслышать тембр.
Как звонят мошенники с поддельным голосом: три сценария
Клонированный голос почти никогда не работает сам по себе - он вставлен в готовую схему давления. Схем в основном три.
1. Родственник в беде
Классика, которой десятки лет, только теперь с настоящим голосом. Авария, задержание, больница, «мам, только не говори папе». Ключевой признак - не звук, а структура разговора: спешка, секретность и запрет проверять. Вас просят не класть трубку, никому не звонить и решить всё за пятнадцать минут.
ФТК США описывает финансовую развязку так: «Если звонящий говорит перевести деньги, отправить криптовалюту или купить подарочные карты и продиктовать их номера и PIN-коды - это могут быть признаки мошенничества». Логика простая: такие переводы почти невозможно отменить.
2. Голос начальника
Здесь бьют по служебной иерархии. Спокойный, узнаваемый голос руководителя просит срочно оплатить счёт, прислать документ или подтвердить реквизиты. Возражать директору неловко, перепроверять - тем более. Механизм описывают в «Лаборатории Касперского»: сам по себе уровень власти, который слышится в трубке, повышает шансы, что человек подчинится не раздумывая.
3. Сотрудник банка или полиции
Самый массовый сценарий в мире по деньгам. В Сингапуре, где полиция публикует детальную разбивку, мошенничество с представлением себя госслужащим в 2025 году заняло второе место по сумме потерь среди всех схем. В США на тех, кто выдавал себя за компанию, за тот же год потеряли почти миллиард долларов, и больше всего внутри этой группы - как раз на «сотрудниках банка». Ещё около 920 млн ушло тем, кто представлялся государственным ведомством.
Выглядит это буднично. Сначала звонит «служба безопасности банка»: по вашей карте зафиксирована подозрительная операция, подтвердите, что это не вы. Вы говорите «нет, не я» - и разговор аккуратно передают «сотруднику полиции», который уже знает ваше имя и последние цифры карты. Дальше вас просят никому не рассказывать, потому что «идёт проверка», и перевести деньги на безопасный счёт. Голос спокойный, речь официальная, на фоне слышен офисный шум. Ни одного из этих элементов нет в списках «признаков ИИ-голоса» - потому что подделан здесь не звук, а обстановка.
Общий знаменатель всех трёх сценариев: вас торопят и уводят от проверки. Поддельный голос - только инструмент, чтобы вы не успели усомниться. Во сколько это обходится миру, видно по национальным отчётам.
Сколько денег теряют на голосовом мошенничестве?
Потери растут почти везде, но не везде - и это самое полезное наблюдение. Данные за 2025 год, каждая цифра от национального регулятора или полиции:
- США - 3,5 млрд долларов потерь от схем с выдачей себя за другого. Почти каждое третье обращение о мошенничестве относилось к этой категории, а сами потери выросли почти втрое с 2020 года. Общие потери американцев от мошенничества - 16 млрд долларов, на четверть больше, чем годом раньше (ФТК, 2026).
- Австралия - 2,18 млрд австралийских долларов, рост на 7,8% за год. Национальный антимошеннический центр отдельно отмечает «растущую изощрённость мошенничества за счёт искусственного интеллекта».
- Сингапур - 913,1 млн сингапурских долларов против 1,1 млрд годом раньше, и это падение: число случаев снизилось почти на четверть, на 24,8%. Полиция предотвратила ущерб примерно на 348 млн и изъяла у мошенников ещё около 140 млн.
- Россия и СНГ - 29,3 млрд рублей похищено со счетов за 2025 год, на 6,4% больше, чем годом раньше. Число операций без согласия клиента выросло на 31,2% - крадут чаще, но мельче. Банки при этом предотвратили хищений на 13,9 трлн рублей, а вот вернули пострадавшим только 1,7 млрд - 5,9% от украденного, годом раньше возвращали 9,9% (данные Банка России в изложении «Интерфакса», февраль 2026).
Сингапурский случай стоит того, чтобы на нём задержаться. Он показывает, что кривая не обязана расти: там сработали блокировки переводов, обязательная задержка платежей и массовое информирование. Технология одна и та же во всех странах - разница в процедурах вокруг денег.
Ровно та же логика работает и на уровне одной семьи. Не пытайтесь перехитрить технологию. Меняйте процедуру.
Какие советы против мошенников не работают?
Половина популярных рекомендаций по этой теме бесполезна, а некоторые делают хуже. Разберём их прежде, чем перейти к рабочим.
- «Вслушайтесь в паузы и дыхание». Это ровно тот навык, который в замерах падает, а не растёт. Хуже того, натренированное подозрение бьёт по живым людям: доля правильно узнанной настоящей речи упала до 64,1%.
- «Перезвоните на этот же номер». Номер мошенника подменяется (спуфинг - подстановка чужого номера в определитель, техническая операция без взлома чего-либо). Обратный звонок попадёт к тому же человеку, который вам только что врал.
- «Спросите кодовое слово прямо в этом разговоре». Работает только если слово уже согласовано заранее. Придумывать его в момент звонка бессмысленно: вы сами продиктуете собеседнику то, что он попросит повторить.
- «Задайте личный вопрос». Личный и частный - разные вещи. Имя питомца, марка машины, город рождения, школа - всё это лежит в открытых профилях и находится за минуту.
- «Поставьте определитель ИИ-голоса». Детекторы существуют и работают хорошо: 94,5% точности в лабораторных условиях. Но они анализируют файл после разговора, а не поток в вашей трубке в реальном времени.
Общая ошибка у всех пяти одна: они пытаются выиграть на территории мошенника - в самом звонке. Выигрывают за её пределами.
Как проверить, что звонит настоящий человек?
Проверка занимает меньше минуты и не требует от вас различать тембр. Именно поэтому она работает, даже если клон идеальный.
Шаг 1. Положить трубку и перезвонить самому
Главное правило, и оно же формулировка ФТК: «Не верьте голосу. Позвоните человеку, который якобы с вами связался, и проверьте историю. Используйте номер, который точно принадлежит ему».
Ключевое слово - сами. Не «перезвоните по номеру, с которого звонили», не «наберите номер, который вам продиктовали». Откройте свою записную книжку и наберите оттуда. Мошенник может держать линию занятой, поэтому если человек не отвечает, ФТК советует попробовать связаться с ним через другого родственника или друзей.
Обычное возражение: а если авария настоящая, время уйдёт впустую. Тридцать секунд на звонок не решают судьбу ни в одной настоящей аварии. Зато решают в поддельной - потому что схема живёт ровно до момента, пока вы не проверили.
Шаг 2. Кодовое слово в семье
Заранее договорённое слово, которое знают только свои и которого нет нигде в переписке и соцсетях. Не кличка кота и не девичья фамилия матери - это ищется за минуту. Что-то бессмысленное: «абрикос», «седьмой троллейбус», «синий чемодан».
Работает это потому, что клонировать можно голос, но не память. Нейросеть воспроизведёт тембр и манеру - и не знает, о чём вы договаривались за ужином в марте.
Правило одно: слово не произносят вслух в обычных разговорах и не пишут в чате. Оно живёт только на случай тревожного звонка.
Шаг 3. Вопрос, ответа на который нет в интернете
Тот самый вопрос, обещанный в начале. Спросите что-то, что знает только настоящий человек, и чего нет ни в одном профиле: что вы ели в прошлое воскресенье, как зовут соседку снизу, где лежит запасной ключ, чем закончился спор про отпуск.
Мошенник с поддельным голосом в этот момент оказывается в тупике. Он управляет голосом в реальном времени, у него нет секунд на выдумывание правдоподобной детали, и любая пауза ломает давление, на котором держится схема. Типичная реакция - раздражение и возврат к спешке: «некогда, потом объясню». Это и есть ответ.
Важно: вопрос должен быть про частное, а не про общеизвестное. «Как зовут мою собаку» - плохой вопрос, собака есть в ленте. «Что мы забыли купить в прошлую субботу» - хороший.
Что делать, если деньги мошенникам уже перевели?
Действовать в первые часы, потому что дальше шансы падают. Порядок такой:
- Позвонить в банк и заявить, что перевод сделан под влиянием мошенников. Не через чат, а голосом на горячую линию с обратной стороны карты. Попросить зафиксировать обращение и назвать его номер.
- Подать заявление в полицию. Без него банк в большинстве стран не начнёт разбирательство, а платёжные системы не станут отзывать перевод.
- Сохранить всё. Номер, с которого звонили, время, скриншоты перевода, запись разговора, если она есть. Это единственные доказательства.
- Предупредить своих. Один украденный голос обычно используют по всему списку контактов. Если позвонили «вам от сына», следующими будут бабушка и брат.
Шансы честнее не приукрашивать: в России в 2025 году банки вернули пострадавшим 5,9% украденного, и это меньше, чем годом раньше. Но и эти проценты собираются из обращений, которые поступили в первые часы. По остальным не возвращается ничего.
Как защитить свой голос от клонирования?
Полностью защитить не выйдет, и делать вид, что выйдет, нечестно. Но объём доступных мошенникам записей сократить можно:
- Закрыть профили, где вы регулярно говорите на камеру, если публичность не нужна вам по работе.
- Не оставлять голосовое приветствие на автоответчике - системный звук справляется не хуже.
- Не отвечать на звонки с незнакомых номеров голосом. Молчание в трубку записать нельзя.
- Проверять, не лежат ли записи ваших рабочих встреч по открытой ссылке.
И честная оговорка: если вы преподаёте, ведёте подкаст, продаёте через сторис или просто активны в мессенджерах - ваш голос уже доступен, и с этим ничего не сделать. Поэтому шаги из предыдущего раздела важнее гигиены. Смысл не в том, чтобы вас нельзя было подделать. Смысл в том, чтобы подделка ничего не дала.
Коротко
- Мошенникам достаточно трёх секунд записи, чтобы подделать голос.
- Человек узнаёт подделку примерно в 7 случаях из 10, и тренировка почти не помогает.
- К 2026 году люди стали хуже узнавать настоящую речь: 64,1% против 72,7% пятью годами раньше.
- Голос - не доказательство. Доказательство - обратный звонок, кодовое слово и вопрос из личной памяти.
Вернёмся к звонку в 23:40. Вы слышите голос дочери, и внутри всё обрывается - это нормально, так и должно быть. Но дальше вы говорите одну фразу: «Перезвоню тебе сама». И набираете её номер из своей книжки.
Сегодня же напишите в семейный чат одно бессмысленное слово и договоритесь: если беда - произносим его. Две минуты. Голос подделать можно. Общее слово - нет.
Источники
- Wang C. и др. Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers (VALL-E), arXiv, 2023
- Müller N. M., Choong W. H. Eroding Trust in Real Speech: A Large-Scale Study of Human Audio Deepfake Perception, Fraunhofer AISEC, 2026
- Mai K. T. и др. Warning: Humans cannot reliably detect speech deepfakes, PLOS ONE, 2023
- Федеральная торговая комиссия США: потери от схем с выдачей себя за другого в 2025 году, 2026
- Федеральная торговая комиссия США: мошенники используют ИИ в схемах «родственник в беде», 2023
- Национальный антимошеннический центр Австралии (ACCC): потери от мошенничества за 2025 год, 2026
- Полиция Сингапура: годовой отчёт по мошенничеству и киберпреступности за 2025 год, 2026
- McAfee. Beware the Artificial Impostor: опрос 7054 человек в 7 странах, 2023
- «Интерфакс» со ссылкой на Банк России: объём хищений со счетов за 2025 год, февраль 2026
- «Лаборатория Касперского»: как работают поддельные голосовые звонки и как защититься






