Deepfake-фишинг: как голос CEO взломал корпорацию
Забудь про письма с «дорогой клиент, ваш счёт заблокирован» — новое поколение социальной инженерии звучит как твой начальник, говорит его интонациями и просит перевести деньги «срочно, не по регламенту, я объясню потом». Это не фантастика — это уже случившиеся многомиллионные кражи.
Кейс 1: $243 000 за один звонок
В 2019 году мошенники обкатали технологию на энергетической компании из Великобритании. Гендиректору позвонил «руководитель материнской фирмы в Германии» — с точным акцентом, интонацией и манерой речи реального человека. Голос был синтезирован ИИ на основе публичных записей выступлений. Итог — $243 тыс. улетели третьей стороне за один разговор.
Схема сработала не из-за технической дыры, а из-за психологии: звонок совпал по времени с «срочной сделкой», начальник «был раздражён» и требовал немедленной оплаты. Классический BEC-паттерн (Business Email Compromise), только без единой строчки текста.
Кейс 2: $25,6 млн через deepfake-видеоконференцию
В 2024 году сотрудник финансового отдела гонконгского филиала международной корпорации получил приглашение на видеозвонок с CFO компании и несколькими коллегами. Всё выглядело реально: лица, голоса, манера общения. Единственная проблема — из всех участников звонка реальным был только сам сотрудник. Остальные — deepfake-рендеры, собранные из публичных видео и аудио с YouTube. Итог — 15 переводов и $25,6 млн ущерба.
Это уже не «поддельный звонок», а полноценная постановочная спектакль-атака: злоумышленники заранее собрали видеоматериал, обучили модель на нескольких участниках и синхронизировали живую подмену лица и голоса в реальном времени.
Почему это работает: техническая база атаки
Современным моделям голосового клонирования достаточно 3–5 секунд чистого аудио, чтобы построить достаточно правдоподобный voice-print. Источники сырья — открытые:
- Публичные выступления, интервью, вебинары CEO/CFO
- Записи созвонов, разошедшиеся по YouTube/VK/корпоративным каналам
- Голосовые сообщения в Telegram/WhatsApp, слитые или перехваченные
По исследованиям, 66% участников не смогли отличить синтезированный голос от настоящего в контролируемом эксперименте. Это не «плохое ИИ», это статистика провала человеческого восприятия против современного TTS/voice-conversion стека (в духе ElevenLabs-уровня качества).
Сценарий атаки почти всегда идёт по одной цепочке:
- OSINT-разведка — сбор голосовых/видео образцов цели из открытых источников.
- Обучение модели — клонирование голоса или lip-sync deepfake на базе собранного датасета.
- Постановка легенды — «срочная сделка», «конфиденциальное поглощение», «уходит в отпуск, нужно всё решить сейчас».
- Контакт с жертвой — звонок, голосовое сообщение или полноценная видеоконференция с несколькими фейковыми участниками.
- Финансовая или доступная эксфильтрация — перевод денег, выдача пароля, снятие MFA-ограничений.
Как это выглядит с точки зрения защитника
Если ты пентестишь или строишь SOC-процессы, вот что реально ловит такие атаки — не «доверяй интуиции», а конкретные контрольные точки:
- Правило второго канала. Любой запрос на перевод денег или смену доступа, пришедший голосом/видео, подтверждается через заранее известный альтернативный канал (звонок на записанный в CRM номер, а не тот, с которого пришёл запрос).
- Кодовые фразы для критичных операций. Финансовый отдел и топ-менеджмент договариваются об одноразовой кодовой фразе, которую deepfake не может знать заранее — простой, но рабочий hardening социальной инженерии.
- Задержка на крупные транзакции. Любой перевод выше порога проходит через 24-часовой холд и второе подтверждение — атаки типа Arup строятся на ощущении срочности, разрушь это ощущение регламентом.
- Аудио/видео-артефакты. Учи сотрудников замечать: неестественную монотонность речи, странные паузы, артефакты синхронизации губ, «плавающий» фон на видео.
- Технические детекторы. Есть открытые модели anti-spoofing (ASVspoof-based детекторы, liveness-checks для видео) — если строишь внутренний security-стек, это отдельный слой защиты, не финальный, но полезный.
Мини-пример: как быстро прикинуть «подозрительность» звонка эвристически (не детектор deepfake, а чек-лист-скрипт для security awareness тренинга):
|
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 |
def suspicion_score(call: dict) -> int: score = 0 if call.get("urgency_language"): # "срочно", "прямо сейчас", "не звони никому" score += 3 if call.get("unusual_channel"): # незнакомый номер/новый мессенджер score += 2 if call.get("bypasses_procedure"): # просит обойти обычный протокол оплаты score += 4 if call.get("requests_secrecy"): # "не говори бухгалтерии" score += 3 if call.get("financial_action"): # перевод, смена реквизитов, выдача доступа score += 3 return score # score >= 7 -> эскалация, звонок через второй канал обязателен |
Это не killer-фича, а напоминалка команде: связка «срочность + секретность + деньги» — это красный флаг независимо от того, насколько реалистичен голос.
Куда это движется
Атаки дешевеют и масштабируются: real-time face-swap теперь работает без предзаписи, а голосовые клоны генерируются за секунды из пары фраз. Следующий рубеж — massовые deepfake-совещания как в кейсе Arup, где вся видеоконференция целиком синтетическая, кроме жертвы.
Для компаний вывод один: технические детекторы дипфейков — это гонка вооружений, которую защита пока не выигрывает стабильно. Реальная защита строится на процессах — верификация через independent канал, кодовые фразы, задержки на транзакции — а не на надежде, что человек «на слух» отличит подделку.

На этом все. Всем хорошего дня!
