Лекция 5. AI в финансовом секторе и ритейле¶
Лекция 5 · ~75 мин · 33 слайдов
Hook: коллапс Zillow¶
«Начнём не с восторга и не с предостережения, а с одной даты и одной цифры.
[понизить голос] Ноябрь 2021 года. Zillow — крупнейшая в США платформа объявлений о недвижимости — закрывает целое направление бизнеса. Называлось оно Zillow Offers. Идея была красивая. Компьютерная модель прогнозирует, сколько будет стоить конкретный дом. На основании прогноза Zillow сама, автоматически, покупает этот дом, делает косметический ремонт и перепродаёт дороже. Это называется iBuying — алгоритмическая скупка жилья. Убрать человека-оценщика, масштабировать до тысяч домов в десятках городов одновременно.
[пауза 2 сек] На практике модель систематически переоценивала дома. Компания покупала дороже, чем могла продать. Итог в трёх числах. Списание запасов — больше трёхсот миллионов долларов за один квартал. Совокупные потери направления — оценочно полмиллиарда и выше. Уволено примерно двадцать пять процентов штата, около двух тысяч человек. Акция упала примерно на четверть за дни после анонса.
[пауза] Целое направление крупной публичной компании закрыто из-за ошибок одной прогнозной модели.
И вот здесь давайте вместе зададим вопрос, на который мы будем отвечать всю лекцию. Какой это был тип ИИ — и почему обычная ошибка модели превратилась в потерю бизнеса, а не в мелкую неточность? Сразу скажу: это был не ChatGPT. Не «искусственный интеллект, который всё может». Это была прогнозная модель, оценивающая число — цену — по табличным и географическим данным. Языковая модель тут не применялась и не могла.
[обращение к залу] Тридцать секунд, подумайте про себя. Вот ошибка модели. Когда она стоит около нуля, а когда — полмиллиарда долларов? Что отличает один случай от другого? [пауза 30 сек]
Держите свой ответ в голове. Мы вернёмся к Zillow подробно — и проверим, совпало ли.»
[Переход к s02.]
Обложка и карта¶
«Лекция пятая. AI в финансовом секторе и ритейле. Это вторая отраслевая тема курса. В Лекции 4 мы брали разработку ПО — один тип ИИ, но вглубь. Сегодня — палитра типов. Семь блоков на карте внизу: открытие, прогноз, аномалии, скоринг, LLM, рекомендации и сборка в аппарат.»
[Переход к s03.]
KEYSTONE: палитра пяти типов¶
«Запомните эту картинку — она держит всю лекцию.
В Лекции 4, в разработке ПО, мы по сути разбирали один тип ИИ — генеративную модель-кодер — но в глубину, по лестнице автономности. В финансах и ритейле картина другая. Здесь работает целая палитра разных типов ИИ под разные задачи, и большинство ценности даёт вовсе не языковая модель.
Вот пять типов, которые мы пройдём. Прогноз спроса — это раз. Поиск мошенничества — это два. Кредитный скоринг — это три. Языковые ассистенты в поддержке — это четыре. Рекомендации и цены — это пять. И шестым пластом, сквозной иллюстрацией, пройдёт компьютерное зрение — касса без кассира, биометрия на входе в банк.
[пауза] Это структурно разные типы ИИ. И применить везде языковую модель было бы инженерной ошибкой. Запомните фразу, она пройдёт через всю лекцию: LLM — не универсальный молоток.
И ещё одна честная оговорка. Четыре понятия мы с вами будем вводить прямо сегодня, с нуля: ошибки первого и второго рода, матрица ошибок, механизм прокси-предвзятости и дрейф распределения. Это нормально, что они новые — мы разберём каждое на пальцах, когда дойдём.»
[Переход к s04.]
Центральный вопрос и единый паттерн¶
«Вот центральный вопрос всей лекции. Запишите его — мы вернёмся к нему пять раз, в конце каждого раздела.
[понизить голос, читать медленно] Финансы и ритейл — отрасли максимального внедрения ИИ. Под какую задачу — какой тип ИИ, почему именно он, а не LLM везде, и где этот тип ломается?
[пауза 2 сек] Обратите внимание: вопрос из двух половин. Первая — «какой тип и почему именно он». Вторая — «где ломается». Обе обязательны, и вторая — важнее.
Чтобы разбирать пять типов одинаково, мы с вами возьмём одну рамку — единый паттерн карточки. Пять шагов. Шаг первый — какая задача. Шаг второй — какой тип ИИ и почему именно он, а не языковая модель. Шаг третий — реальный пример, наш и мировой. Шаг четвёртый — где ломается, документированный провал. Шаг пятый — альтернатива и критерий: при каком условии этот тип неприменим.
Важная оговорка. Этот «паттерн карточки» — не отраслевой стандарт и не термин из учебника. Это способ организовать материал, наш с вами рабочий конструкт лекции — как лестница автономности в прошлый раз. Понять всё сразу не требуется. Каждый тип идёт по одной и той же схеме, и к концу схема станет вашим инструментом выбора.»
[Переход к s04a.]
Дивайдер: Раздел 1¶
«Раздел первый из пяти. Прогнозирование временных рядов. Начнём с самой массовой задачи ритейла — и сразу с типа ИИ, который НЕ языковая модель.»
[Переход к s05.]
Прогноз ряда: почему не LLM¶
«Прогнозирование временных рядов — это предсказание будущих значений числа, которое измеряется регулярно во времени. Сколько молока купят в следующий вторник. Какой будет приток денег в следующем месяце. Ключевое слово — ряд: последовательность чисел во времени, в которой есть тренд, сезонность и шум.
Тип ИИ — классическая статистика и табличное обучение: семейство ARIMA, градиентный бустинг. Не генеративная модель и не LLM.
[пауза] Почему не LLM? Языковая модель предсказывает следующий токен текста. Прогноз ряда — следующее число в последовательности с трендом и сезонностью. У языковой модели нет внутреннего понятия «сезонность продаж» — она видела тексты про продажи, не ваш ряд. Запомните интуицию: для ряда чисел во времени нужен инструмент, который умеет в ряд чисел во времени. Правильный тип ИИ определяется структурой задачи, а не модностью инструмента.»
[Переход к s06.]
Задача прогноза: развёрнутый критерий¶
«В ритейле прогноз спроса — основа всей операционной цепочки: сколько заказать, сколько держать на полке, когда запустить промо. Ошибка в одну сторону — пустая полка и упущенная продажа. В другую — переполненный склад и списание просрочки. В финансах аналог — прогноз притока денег и прогноз оттока клиентов.
Нам с вами важно понимать критерий выбора целиком — три аргумента.
Первый — структура данных. Это табличные ряды: дата, товар, количество, цена, признаки. Модели для рядов спроектированы извлекать тренд и сезонность. Перевести ряд в текст для языковой модели — значит потерять ровно ту структуру, которую надо использовать.
Второй — измеримость. Прогнозу нужна численная метрика ошибки и доверительный интервал, потому что на этих числах строится решение о закупке. Классические модели дают это из коробки. От языковой — нет.
Третий — что сломается. Возьмёте LLM — получите правдоподобное число без обоснованной неопределённости. Решение о закупке всё равно придётся принять, и цена систематической ошибки умножается на объём. Запомните механизм — ровно он разорил Zillow.
И сквозная тема — безопасность данных. Если в данных персональные данные граждан — на них распространяется закон о персональных данных. Отправить такие ряды в публичное облако — и неверный тип ИИ, и риск нарушения локализации. Правильный тип здесь ещё и безопаснее: табличная модель разворачивается на своей инфраструктуре.»
[Переход к s07.]
Пример: X5 и Магнит¶
«Реальный пример, наша страна. X5 — это «Пятёрочка», «Перекрёсток» — с 2019 года развивает собственные алгоритмы прогноза спроса. По данным компании, точность прогноза превышает семьдесят процентов. К концу 2023 года ML-инструменты принесли, по заявлению компании, около пяти миллиардов рублей дополнительной выручки и снизили списания просрочки примерно на два процента.
Зачем это инженеру по сути? Прогноз — не самоцель. Он подключён к решению о закупке и пополнении полки. Точность напрямую конвертируется в деньги: меньше списаний, меньше упущенных продаж.
[пауза] Второй пример особенно поучителен. Магнит до 2022 года использовал прогнозно-логистические системы иностранных вендоров — класса SAP, Blue Yonder. После их ухода с рынка компания строит собственную систему прогноза спроса и автозаказа. Пилот стартовал на распределительном центре.
Вывод для нас с вами: уход иностранных вендоров сделал импортозамещение прогнозных систем не теоретической, а прямой инженерной задачей нашей отрасли. Это контекст, в котором вы будете работать. И заметьте: ни X5, ни Магнит не решают эту задачу языковой моделью. Они строят специализированные прогнозные системы, потому что тип ИИ диктуется задачей.»
[Переход к s08.]
Как это работает: товаровед¶
«Давайте посмотрим механику на пальцах, без формул.
Представьте график продаж одного товара за два года. Глаз почти сразу видит три вещи. Наклон вверх — тренд. Регулярную гребёнку, где каждую субботу пик и горб к декабрю — сезонность. Мелкое дрожание вокруг — шум. Модель делает то же численно: раскладывает историю на тренд, сезонность, шум и продлевает регулярность в будущее.
Аналогия, запомните. Модель прогноза — как опытный товаровед, который, глядя на историю, говорит: «к выходным возьми больше, перед Новым годом — сильно больше». Только для миллионов пар «магазин и товар» сразу.
[понизить голос] И здесь зашита уязвимость. Прогноз продлевает паттерны прошлого. Пока завтра похоже на вчера — работает прекрасно. Но если мир меняется качественно, модель уверенно экстраполирует паттерны, которых больше нет. Она не понимает, что мир изменился. Запомните — это ключ к следующему слайду.»
[Переход к s09.]
Провал Zillow: точка возврата 1¶
«Центральный вопрос возвращается первый раз. Раскрываем Zillow.
Модель прогнозировала цену дома, по прогнозу Zillow автоматически скупала жильё. В 2020–2021 рынок пережил пандемийный шок. Модель, обученная на стабильном рынке, систематически переоценивала. Полмиллиарда потерь.
Введём термин с нуля. Дрейф распределения — когда данные в реальности перестают быть похожими на обучающие. Одной фразой: модель училась на одном мире, работает в другом.
[пауза] Но дрейф сам по себе не разоряет — модели дрейфуют постоянно. Разорило то, к чему подключён выход. Ключевое понятие: асимметрия цены ошибки. Та же ошибка в рекомендации стоит около нуля; в автопокупке дома — десятки тысяч, необратимо.
[понизить голос] Callback. Knight Capital в 2012 за сорок пять минут потеряла четыреста сорок миллионов — автоматика выставляла заявки без контроля. Обычный алгоритм, не ML. Класс ошибки тот же: автоматика необратимого без аварийного выключателя.
Урок, который мы с вами уносим. Тип ИИ выбран правильно — прогноз это прогноз. Ошибкой было решение, куда подключить выход: необратимое, автоматически, без выключателя. Конкурент Opendoor пережил тот же период на том же типе — за счёт консервативной обвязки. Тот же ИИ, другое суждение — банкротство или выживание.
[обращение к залу] Тридцать секунд про себя: где ещё необратимое авто-действие на прогнозе опасно? [пауза 30 сек]»
[Переход к s10.]
Дивайдер: Раздел 2¶
«Раздел второй из пяти. Поиск аномалий: фрод и противодействие отмыванию. Прогноз был про будущее. Теперь — про настоящее: поймать аномалию за миллисекунды, пока платёж ещё не прошёл.»
[Переход к s11.]
Задача фрода и почему anomaly detection¶
«Задача: обнаружить мошенническую транзакцию в реальном времени. Украденная карта, нетипичный платёж — в потоке, где подавляющее большинство операций честные, а доля фрода крайне мала.
Тип ИИ — поиск аномалий. Модель строит представление нормального поведения клиента: как он обычно платит — суммы, география, время, продавцы — и сигнализирует об отклонениях. Это не прогноз ряда: мы не предсказываем будущее значение. И не генерация: мы ничего не порождаем. Это калибровка границы «нормально или аномально».
[пауза] Давайте посмотрим, почему именно этот тип, а не другие — это важная развилка.
Почему не обычная классификация «фрод или не фрод» на размеченных примерах? Потому что фрод по определению редок и постоянно меняет форму. Размеченных примеров мало, и они устаревают, как только мошенник придумал новую схему. Учить «как выглядит фрод» хрупко, потому что фрод — движущаяся цель. Поиск аномалий переворачивает задачу: учить не «как выглядит фрод», а «как выглядит норма этого клиента» — данных много, вся его честная история — и ловить отклонения.
Почему не языковая модель? Транзакция — это структурированная запись: сумма, время, гео, продавец. Не текст. Задача геометрическая — далеко ли точка от облака нормы. Не языковая.
Аналогия, запомните. Представьте облако точек: обычные транзакции клиента кучно лежат вместе. Модель очерчивает это облако. Операция, выпавшая далеко за край — платёж в другой стране на нетипичную сумму в четыре утра — кандидат на аномалию. Модель не знает, что это фрод. Она знает, что это не похоже на норму, и поднимает флаг.
И одной строкой — противодействие отмыванию денег, AML. Это набор регуляторных требований выявлять подозрительные схемы. С точки зрения типа ИИ это подмножество той же задачи поиска аномалий, не отдельный тип. Но часть AML-логики — жёсткие законодательные пороги, и они реализуются детерминированными правилами, а не вероятностной моделью. Почему — увидим дальше.»
[Переход к s12.]
Примеры: Stripe, JPMorgan, Visa, РФ¶
«Реальные примеры. Stripe Radar — антифрод платёжной платформы — по данным компании снижает фрод в среднем примерно на тридцать два процента, при этом одобряет больше девяноста девяти процентов честных операций. JPMorgan сообщает о снижении ложных срабатываний примерно на тридцать процентов. Visa сообщала о предотвращении порядка сорока миллиардов долларов мошеннических операций за финансовый 2023 год — это почти вдвое больше, чем годом раньше.
В нашей стране обнаружение аномалий в транзакциях — стандартная практика крупных банков. По материалам Банка России традиционный ИИ широко применяется в антифроде и риск-менеджменте.
[пауза] Обратите внимание на формулировку всех этих цифр: «снижение ложных срабатываний». Это намёк. Ключевая метрика антифрода — не «точность вообще», а соотношение двух типов ошибок. Чтобы понять, почему «точность девяносто девять и девять» в антифроде — обманчивая и даже опасная цифра, нам нужен аппарат матрицы ошибок. Введём его с нуля.»
[Переход к s13.]
Матрица ошибок с нуля¶
«Это первое появление матрицы ошибок в курсе. Вводим с нуля, на пальцах.
Любая система, которая делит события на два класса — «заблокировать или пропустить» — может ошибиться двумя разными способами, и они не равноценны. Четыре ячейки.
Истинно-положительный: была фродом, система поймала. Хорошо. Истинно-отрицательный: была честной, система пропустила. Хорошо.
Дальше две ошибки. Ложно-положительный: честная операция ошибочно помечена как фрод и заблокирована. Это ошибка первого рода — пострадал честный клиент. Ложно-отрицательный: фрод система пропустила. Это ошибка второго рода — деньги ушли мошеннику. Эти четыре ячейки и есть матрица ошибок.
[пауза] Теперь — почему «точность лжёт». Точность — доля правильных ответов. Представьте миллион транзакций, фрода тысяча — одна десятая процента. Модель, которая ничего не делает и говорит «всё честно», даёт точность девяносто девять и девять: почти миллион честных «угадала», тысяча фрода не двигает долю.
[понизить голос] То есть бесполезная модель показывает отличную точность. Запомните: при сильном дисбалансе классов точность измеряет размер большего класса, а не способность ловить редкое важное событие.
Отсюда ключевая идея — стоимостно-взвешенная оценка. Две ошибки разные не только по смыслу, но и по цене. Цена пропущенного фрода — убыток банка. Цена заблокированного честного клиента — испорченный опыт, в худшем случае уход к конкуренту. Правильная постановка — не «максимизировать точность», а минимизировать ожидаемую стоимость ошибок, где каждая взвешена реальной ценой.
И forward-pointer: формальный аппарат — чувствительность, специфичность — мы с вами построим в Лекции 7, на медицинском примере. Сегодня достаточно интуиции: два типа ошибки, разные цены, точность при дисбалансе обманчива.»
[Переход к s14.]
Провал false positives: точка возврата 2¶
«Центральный вопрос возвращается второй раз. Провал-сторона важнее рекламных цифр.
Оптимистичная картина: ложных срабатываний доли процента, одобрение выше девяноста девяти. Кажется отлично. Но умножьте на масштаб. Миллиарды транзакций в год — даже половина процента это десятки миллионов заблокированных честных операций. За каждой конкретный человек.
Почему это нельзя убрать настройкой? Работает компромисс — точность против полноты. Разведём две идеи. Стоимостная оценка — по какой цене выбирать точку срабатывания. Компромисс точность-полнота — сам компромисс неизбежен. Подозрительнее модель — больше заблокированных честных. Терпимее — больше пропущенного фрода. Лучшая модель сдвигает кривую, но не отменяет выбор точки на ней.
[пауза] Конкретика. Два ложных срабатывания. Первое: блокировка кофе за пять долларов. Клиент повторил другой картой, забыл через час. Цена около нуля, обратимо.
[понизить голос] Второе: блокировка платежа на пять тысяч за срочную медицину в чужой стране — «нетипичная сумма плюс нетипичная геолокация», ровно тот паттерн, который модель учили считать подозрительным. Тот же класс ошибки — но цена на порядки выше, и случай необратим по последствиям.
Вывод: «снизили ложные срабатывания на двадцать пять процентов» — бессмысленная без контекста цифра, она усредняет копеечный и катастрофический случай.
Callback к Knight: автоблокировка крупного необратимого платежа без человека — тот же класс «автоматика необратимого без гейта».
Критерий. Жёсткая автоблокировка — только для обратимых или мелких операций. Для крупных — не глухой отказ, а мягкий запрос подтверждения: код 3-D Secure, звонок, плюс быстрый канал разблокировки с человеком. А жёсткие пороги отмывания — это закон, его исполняет детерминированный движок правил, не вероятностная модель.
[обращение к залу] Двадцать секунд про себя: заблокировать платёж пять тысяч на лечение по аномалии — ваш порог? Блокировать, мягкий запрос, пропустить с флагом? [пауза 20 сек] Это вторая точка возврата: тип выбран верно, но какое действие автоматизировать — отдельное решение по цене ошибки.»
[Переход к s15.]
Дивайдер: Раздел 3¶
«Раздел третий из пяти. Кредитный скоринг. Аномалию нашли. Теперь — решение, которое меняет жизнь клиента: дать кредит или отказать. И здесь принципиально нельзя чёрный ящик.»
[Переход к s16.]
Скоринг: почему не нейросеть¶
«Кредитный скоринг — оценка кредитоспособности заёмщика. По данным о клиенте система выдаёт оценку риска невозврата, и на её основе — решение о выдаче, лимите, ставке.
Тип ИИ в индустрии — классический табличный ML: градиентный бустинг, логистическая регрессия, скоркарты. Сознательно не нейросеть и не LLM. Причина не в том, что «нейросети хуже считают». Нам с вами важно понимать критерий — четыре аргумента.
Первый, несущий. Объяснимость — регуляторное требование, не пожелание. Клиенту, которому отказали, по закону положено понятное объяснение — коды причин: «высокая долговая нагрузка», «короткая история». Ответ «алгоритм так решил» юридически недопустим. Модель, из которой нельзя извлечь причину, здесь неприменима в принципе — не «менее удобна», а неприменима.
Второй — данные табличные. На табличных данных бустинг конкурентоспособен или сильнее, при несопоставимо большей понятности.
Третий — аудит важнее одного процента точности. Регулятор должен мочь воспроизвести решение и проверить отсутствие дискриминации.
Четвёртый — что сломается с чёрным ящиком. Нельзя объяснить — нарушение. Нельзя аудировать на предвзятость — кризис, ровно следующий слайд. Нестабильно воспроизводимо — нечем защититься перед регулятором.
[пауза] Аналогия, запомните. Интерпретируемая модель — кредитный инспектор, который не просто говорит «нет», а показывает расчёт построчно. Чёрный ящик — инспектор, который говорит «нет» и отказывается объяснять. Из бустинга штатным методом — он называется SHAP — извлекается тот же построчный ответ: какой признак на сколько сдвинул решение.
[понизить голос] И честно про рефлекс «новое — значит нейросеть, значит лучше». В скоринге это прямая инженерная ошибка, структурно. Здесь объяснимость не бонус, а условие законности. Инженер, выбравший в скоринг языковую модель, совершил ту же категориальную ошибку, что выбравший LLM в прогноз рядов.»
[Переход к s17.]
Пример: Сбер¶
«Реальный пример, наша страна. Сбербанк, по заявлениям банка, в феврале–марте 2024 года перешёл на приём кредитных решений по физлицам практически полностью на ИИ. Скоринговая модель учитывает до пяти тысяч параметров клиента. Дополнительный эффект от ИИ по всем направлениям банк оценил примерно в триста пятьдесят миллиардов рублей за 2023 год.
По материалам Банка России степень автономии ИИ в скоринге физлиц у системно значимых банков приближается к ста процентам. И важная деталь для сквозной темы «человек против ИИ»: по тому же документу свыше восьмидесяти процентов финансовых организаций, постоянно применяющих ИИ, дают клиенту возможность отказаться от ИИ-обработки и переключиться на сотрудника.
[пауза] Здесь нам важно понимать вот что. «Решение принимает ИИ на сто процентов» не означает «нейросеть-чёрный-ящик решает судьбу клиента бесконтрольно». Это означает высокую автоматизацию конвейера на интерпретируемых моделях с кодами причин, под надзором регулятора, с сохранённым правом клиента на человека. Тип ИИ — табличный ML, выбранный именно из-за объяснимости, а не вопреки.»
[Переход к s18.]
Провал Apple Card и прокси-bias: точка возврата 3¶
«Центральный вопрос возвращается третий раз. Кейс — Apple Card и Goldman Sachs, 2019.
Точную фактуру упрощать нельзя. Разработчик Дэвид Ханссон опубликовал вирусный тред: ему одобрили лимит примерно в двадцать раз выше, чем жене — при совместной декларации и более высоком рейтинге супруги. Похожие жалобы, включая Стива Возняка. Регулятор штата Нью-Йорк открыл расследование.
[понизить голос] Критический нюанс. В марте 2021 года регулятор по итогам анализа около четырёхсот тысяч заявителей нарушения законов о справедливом кредитовании не нашёл. Утверждать «Apple Card доказанно дискриминировала женщин» — фактологически неверно. Но регулятор указал на непрозрачность: клиенты не могли получить объяснение, и «так решил алгоритм» подорвал доверие.
То есть провал — не доказанная дискриминация, а кризис из-за необъяснимости. Даже формально-законная модель без кодов причин создаёт кризис. Точность этой формулировки — сама по себе урок проверки фактов.
[пауза] Введём с нуля механизм, опасный даже без злого умысла — прокси-предвзятость. Инженер сознательно не подаёт пол и расу. Кажется, дискриминация исключена. Но остаются признаки, коррелирующие с запрещёнными: почтовый индекс, структура трат, тип занятости. Модель, оптимизируя точность, косвенно восстанавливает запрещённый признак через эти прокси — и по-разному относится к группам, формально их не видя.
Аналогия. Вы убрали графу «пол», но оставили десяток граф, по совокупности которых пол угадывается почти однозначно. Модель это и делает, без умысла. Поэтому «мы не используем защищённые признаки» — не доказательство. Единственное доказательство — прямой аудит исходов по защищённым группам. Forward-pointer: канонический разбор — кейс Obermeyer — мы с вами увидим в Лекции 7.
Критерий. Регулируемое кредитное решение требует одновременно трёх вещей: коды причин; человеческий канал апелляции на оспоренном; аудит исходов на предвзятость до продакшена, не после скандала. Без любого из трёх скоринг применять нельзя. Это третья точка возврата: тип выбран правильно, но без объяснимости и аудита он всё равно даёт кризис.»
[Переход к s19.]
Критерий: автоматизация без gate¶
«Соберём из трёх разделов сквозной критерий. Мы с вами видели один и тот же класс ошибки в трёх типах ИИ. Zillow — прогноз, подключённый к автоматической необратимой скупке. Антифрод — аномалия, подключённая к автоматической необратимой блокировке. Knight Capital — детерминированный алгоритм, автоматические необратимые заявки.
Сформулируем обобщение как критерий-вывод. [понизить голос] Автоматика, исполняющая необратимые финансовые действия в открытом контуре без аварийного выключателя, без лимитов, без верифицированного развёртывания — превращает обычную ошибку модели в скорость разорения.
[пауза] Что это значит для скоринга конкретно. В нашей стране скоринг автоматизирован почти на сто процентов — значит критерий применим к нему остро. «Сто процентов решений принимает ИИ» приемлемо только в обвязке: коды причин на каждое решение, сохранённый человеческий канал, аудит исходов на регулярной основе, мониторинг дрейфа, регуляторный надзор. Уберите обвязку — и сто процентов автоматизации из эффективности превращаются в Apple Card на масштабе целого банка.
Запомните формулировку: высокая автономия — не цель и не зло сама по себе. Цель — автономия, вокруг которой стоят оплаченные гейты, пропорциональные цене ошибки и необратимости действия.»
[Переход к s20.]
Дивайдер: Раздел 4¶
«Раздел четвёртый из пяти. Языковые модели в финансах. До сих пор — намеренно НЕ LLM. Теперь LLM, и сразу про его границы.»
[Переход к s21.]
Где LLM к месту¶
«Задача, где языковая модель к месту в банке: клиентская поддержка, голосовой ассистент, помощь сотруднику — суммаризировать обращение, объяснить продукт простым языком. Текстово-диалоговые задачи — ровно то, для чего LLM спроектирована, в отличие от первых трёх разделов.
Масштаб. По верифицированным данным, чат-бот Т-Банка обрабатывает свыше сорока процентов обращений. Около семидесяти процентов банков планировали голосовых ассистентов к 2025 году.
[понизить голос] Важная оговорка, она же иллюстрация темы. Встречается формулировка «голосовые ассистенты обрабатывают более девяноста процентов обращений банков». Цифра около девяноста где-то существует — но относится к доле звонков в колл-центре одного банка, не к обращениям банков в целом. Это классическая подмена базы. Поэтому мы используем только верифицированную цифру. Строить утверждение на подменённой базе значило бы нарушить ровно то, чему лекция учит.
[пауза] И симметрия. Может остаться впечатление «LLM везде неуместен» — это неверно. В прогнозе, аномалиях, скоринге LLM неправильный тип, потому что задачи не текстовые. В поддержке — правильный, потому что задача текстово-диалоговая. «Разная задача — разный тип ИИ» означает не «LLM плох», а «LLM хорош ровно там, где задача текстово-диалоговая».»
[Переход к s22.]
Паттерн fact-checking и grounding¶
«Здесь — сквозной паттерн всей лекции: проверка фактов. Развёрнутый критерий «когда LLM НЕ источник истины» — три аргумента и альтернатива.
Тезис. В финансах ответ языковой модели о ставках, условиях, правах клиента обязан быть grounded — опираться на проверяемый первоисточник: тариф из системы, текст договора. LLM здесь не источник истины, а интерфейс к нему.
Первый — механизм галлюцинации. Языковая модель генерирует правдоподобное продолжение, а не извлекает проверенный факт. Правдоподобно не равно верно. Спросите точную ставку — она выдаст уверенно звучащее, но неверное число.
Второй — цена ошибки в финансах юридическая. Неверная ставка — потенциальное введение в заблуждение и прямой ущерб клиенту, за который отвечает организация.
Третий — что сломается. Свободная генерация ответов о регулируемых фактах — это масштабируемый генератор дезинформации с юридической ответственностью банка за каждый ответ.
Альтернатива. Для фиксированных фактов ответ строится детерминированной выборкой из системы. Мини-напоминание Лекции 3 — RAG, генерация с опорой на проверяемый фрагмент. LLM формулирует найденное языком, но не выдумывает само число.
[пауза] Аналогия для grounding, запомните. Без grounding модель отвечает как студент на экзамене, который не помнит цифру, но не хочет молчать: правдоподобно и уверенным тоном. С grounding тот же студент сначала открывает справочник, читает точное значение, и только потом формулирует своими словами.
Пять классов ошибок ИИ. Первый — галлюцинация факта: число без ссылки на источник. Второй — устаревшие данные: цифра без даты. Третий — прокси-предвзятость в выводе. Четвёртый — обман метрикой: «точность девяносто девять» без базы. Пятый — подмена базы: громкая доля без точной формулировки «доля чего от чего» — ровно наши девяносто процентов.
Граница с семинаром. На лекции — распознать класс и назвать принцип проверки. Самостоятельно проверить пять заявлений по первоисточникам Банка России — это Семинар 5, уровень Apply. Лекция готовит навык, семинар доводит до практики.»
[Переход к s23.]
Air Canada и Klarna: точка возврата 4¶
«Центральный вопрос возвращается четвёртый раз — двумя кейсами.
Кейс первый — Air Canada, callback Лекции 3, не дубль. Чат-бот авиакомпании сообщил пассажиру несуществующую политику возврата. Пассажир на этом ответе действовал. В феврале 2024 канадский трибунал постановил: компания отвечает за информацию своего чат-бота, и обязал выплатить компенсацию. Класс ошибки: галлюцинация финансово значимого факта равна юридической ответственности организации. Перенос в банк прямой: чат-бот, назвавший неверную ставку, создаёт такую же ответственность.
[пауза] Кейс второй — Klarna, дуга 2023 до 2025. Финтех развернул языкового ассистента поддержки. Он закрывал около двух третей обращений, сократил время решения с примерно одиннадцати минут до менее двух. Заявленная экономия — около сорока миллионов долларов в год. Подавалось как «ИИ заменяет поддержку».
[понизить голос] Развязка. К середине 2025 Klarna зафиксировала падение удовлетворённости клиентов и вернулась к найму людей. По сообщениям СМИ, генеральный директор признал: ставка на снижение издержек дала более низкое качество.
Почему это не «ИИ плох», а тоньше. Ассистент работал — экономия реальна. Провал в категориальной ошибке: задачу «отвечать на обращения» спутали с системой «клиентский сервис». Сервис — это ещё редкие, эмоционально заряженные, спорные случаи, где на кону доверие. Их мало, но именно по ним клиент решает — остаться или уйти. Полная замена оптимизировала среднюю стоимость контакта и обрушила тяжёлый хвост. Тот же класс, что стоимостная оценка из раздела про фрод.
Критерий. Галлюцинация финфакта равна юридической ответственности — значит регулируемые факты обязаны быть grounded. Полная автозамена поддержки неустойчива — правильная роль LLM augmentation, не замена: ИИ на рутине плюс гарантированная человеческая эскалация на споре.
[обращение к залу] Тридцать секунд про себя: чат-бот банка назвал вам ставку — как вы РАСПОЗНАЕТЕ риск галлюцинации, не проверяя саму ставку? [пауза 30 сек] Это четвёртая точка возврата: LLM правильный тип для диалога, но в регулируемой отрасли обязан быть grounded и иметь человеческий выход.»
[Переход к s24.]
Pivot: что вокруг любого типа ИИ¶
«Сделаем поворот — не сводку, а мост.
Мы с вами прошли четыре разных типа ИИ: прогноз, аномалии, скоринг, диалоговый LLM. В каждом провал имел одинаковую форму. Тип выбран правильно под структуру задачи. Ломалось не в типе, а в обвязке: на необратимом действии у Zillow, на крупной блокировке у фрода, на регулируемом решении у Apple Card, на обязывающем факте у Air Canada.
[понизить голос] Отсюда двухуровневый вывод, запомните. Первая половина вопроса — «какой тип и почему» — решается структурой задачи, чаще однозначно. Вторая — «что вокруг ИИ на цене ошибки» — проектируется отдельно. Правильный выбор типа необходим, но не достаточен. Инженер, усвоивший только первую половину, будет правильно называть тип — и всё равно строить системы класса Zillow.
[пауза] И переход к последнему типу. До сих пор все типы касались действий с высокой ценой ошибки: деньги, кредит, юридический факт. Последний — рекомендации и цены — кажется самым безобидным. Ну порекомендовал не тот фильм. Именно поэтому он опаснее: низкая видимая цена усыпляет, а провал тихий — система рапортует об успехе ровно тогда, когда разрушает то, что в метрику не попало.»
[Переход к s25.]
Дивайдер: Раздел 5¶
«Раздел пятый из пяти, последний содержательный. Рекомендации и динамическое ценообразование. Самый безобидный по видимой цене ошибки тип — и с самыми тонкими патологиями.»
[Переход к s26.]
Collaborative и content-based с нуля¶
«Задача: персонализация — «что ещё купить или посмотреть», ранжирование ленты. Тип ИИ — рекомендательные системы. Вы видите это понятие впервые, поэтому развернём с вами два базовых подхода на пальцах.
Подход первый — коллаборативная фильтрация. Идея одной фразой: «люди, похожие на тебя по поведению, покупали X — значит, вероятно, понравится и тебе». Система строит большую таблицу «пользователь и товар» — кто что покупал — и ищет похожие строки. Важно: она не знает, что это за товар, только кто с чем взаимодействовал. Сильная сторона — ловит неожиданные связи: «покупатели дрели часто берут именно эти перчатки», система это видит, даже не зная, что такое дрель. Слабые стороны, назовём сразу: холодный старт — для нового товара нет истории, рекомендовать не на чем; и смещение к популярному — система склонна рекомендовать и без того популярное, потому что по нему больше всего данных.
[пауза] Подход второй — контентная фильтрация. Идея: «этот товар похож по своим признакам на то, что ты уже любил». Система использует атрибуты товара — жанр, бренд, категория, цена — и рекомендует похожее. Сильная сторона: нет проблемы холодного старта для нового товара, как только у него есть атрибуты. Слабая сторона — чрезмерная специализация: система замыкает пользователя в узкую нишу «ещё такого же», не открывая ничего за пределами уже известного.
Аналогия, разводящая два подхода. Коллаборативная — «спроси у людей, похожих на тебя, что они брали». Контентная — «возьми ещё одну вещь, похожую по описанию на твою любимую». Первый рискует утопить тебя в популярном, второй — запереть в нише. Запомните что это за подходы и какая у каждого слабость по имени. Механизм — почему именно отсюда растут эти слабости — на следующем слайде, на конкретной таблице.»
[Переход к s27.]
Hybrid, filter bubble, dynamic pricing¶
«Подход третий — гибрид. Большинство реальных промышленных систем — это гибрид: коллаборативная плюс контентная плюс контекст — время, устройство, история сессии. Скомбинированы так, чтобы сильные стороны одного компенсировали слабости другого. Контентная часть закрывает холодный старт, коллаборативная ломает замыкание в нише. Это не третий отдельный алгоритм, а инженерная композиция первых двух.
[пауза] Введём с нуля две патологии. Информационный пузырь — эффект, когда система, оптимизируя релевантность под уже проявленные предпочтения, сужает разнообразие того, что пользователь видит. Механизм: модель показывает похожее, пользователь взаимодействует с похожим, модель учится показывать ещё более похожее. Это не злой умысел, а прямое следствие оптимизации на краткосрочную релевантность.
Динамическое ценообразование — автоматическая подстройка цены под спрос, время, конкурента, контекст. Технически — оптимизация целевой функции «выручка». Зафиксируем сразу инженерно-этическую границу: восприятие справедливости цены и регуляторные ограничения — это ограничения задачи, а не оптимизируемые переменные. Попытка оптимизировать цену «в лоб», игнорируя их — классическая ошибка «прокси вместо цели», это раскроет следующий слайд.
[понизить голос] И с дисциплиной проверки фактов — мы только что про неё говорили. Широко цитируется, что у Amazon около тридцати пяти процентов выручки от рекомендаций, у Netflix около семидесяти пяти процентов просмотров. Подаём корректно: это исторически приводимые классические оценки, восходящие к одному источнику примерно 2013 года, а не свежие верифицированные показатели. Для Ozon и Wildberries долю первоисточником подтвердить не удалось, поэтому переносить сюда цифру Amazon нельзя. Корректная формулировка: рекомендации — ключевой драйвер конверсии маркетплейсов, точную долю компании не раскрывают. Это практическая иллюстрация: скромная атрибутированная формулировка вместо красивого, но непроверенного переноса.»
[Переход к s28.]
Wendy's и прокси≠цель: точка возврата 5¶
«Центральный вопрос возвращается пятый, последний раз. Провал этого типа тоньше предыдущих.
Корень — прокси вместо цели. Рекомендательная система оптимизирует то, что измеримо в моменте: клики, время просмотра, конверсию. Но это прокси — косвенный признак, а не настоящая цель: долгосрочная ценность и доверие пользователя. Когда прокси расходится с целью, система честно максимизирует прокси — и получает патологии: информационный пузырь, тёмные приёмы интерфейса, гомогенизацию.
[пауза] Кейс — Wendy's, февраль 2024. Сеть фастфуда анонсировала порядка двадцати миллионов долларов в цифровые меню-борды с динамическим ценообразованием. В СМИ это интерпретировали как «цена растёт в часы пик, как у такси». Вспыхнул скандал, бойкот в соцсетях. За считаные дни компания публично откатила формулировку.
Почему это чистая иллюстрация, а не «неудачный пиар». Технически surge-цена — решаемая оптимизационная задача. Поставите её так — оптимизатор честно решит и приведёт ровно к тому, что вызвало бойкот. Ошибка не в модели, а в постановке: «справедливость» и «лояльность» отброшены, потому что плохо измеримы, а измеримая выручка входила в функцию.
[понизить голос] И главное. Это тот же механизм, что информационный пузырь: прокси (клик, выручка за смену) расходится с целью (долгосрочная ценность, доверие к бренду). Патология не выглядит как сбой: метрика растёт, провал виден, только если смотреть на то, что в метрику не попало. У прогноза и скоринга провал громкий, у рекомендаций — тихий.
Критерий. Метрика-прокси не равна цели — значит обязательно встраивать намеренную долю неожиданных рекомендаций, объяснимость, аудит на дискриминацию. А ценовая политика — решение человека в правовой рамке, не выход оптимизатора. Справедливость и закон — ограничения, не переменные.
[обращение к залу] Тридцать секунд про себя: где в знакомом сервисе вы замечали информационный пузырь или несправедливую цену — что там прокси, а что цель? [пауза 30 сек] Это пятая, замыкающая точка возврата, и здесь мы с вами видим: даже безобидный тип ИИ требует человека и рамки вокруг себя.»
[Переход к s29.]
Матрица «задача × тип ИИ»¶
«Раздел шестой, без дивайдера — сборка. Соберём с вами пять разделов в один аппарат — ответ на центральный вопрос.
Матрица. Строка — задача, колонки — правильный тип, почему именно он, типичный провал. Это компактная упаковка пяти уже доказанных фактов, не новый материал. По строкам.
Прогноз спроса, оттока — тип ИИ прогноз временных рядов. Почему не LLM: ряд чисел с трендом, не текст, нужна калиброванная ошибка. Типичный провал — дрейф распределения на необратимом авто-действии, Zillow. Критерий — человеческий гейт на капитальном, узкий сегмент, аварийный выключатель.
Фрод в реальном времени — поиск аномалий плюс движок правил. Почему не LLM: задача норма-отклонение, не генерация; порог отмывания — это закон. Провал — ложные срабатывания на масштабе, точность лжёт при дисбалансе. Критерий — стоимостная оценка, мягкий запрос подтверждения на крупном.
Кредитный скоринг — классический табличный ML. Почему не нейросеть: объяснимость это регуляторное требование. Провал — прокси-предвзятость плюс непрозрачность, Apple Card. Критерий — коды причин, канал апелляции, аудит до прода.
Поддержка и объяснение — языковая модель с grounding. Почему именно она: задача текстово-диалоговая. Провал — галлюцинация финфакта как юридическая ответственность, замена не равна augmentation. Критерий — grounding, проверяемость, путь к человеку.
Рекомендации и цены — рекомендательная система; цена — оптимизатор в рамке. Провал — прокси не равно цель, Wendy's. Критерий — диверсификация, аудит; цена — человек плюс право.
[пауза, понизить голос] И нижняя строка — намеренно. Детерминированная верифицируемая регуляторная задача — жёсткий порог отмывания, обязательная проверка. Правильный инструмент — обычный код, движок правил. НЕ ИИ. Почему: нужны точность, повторяемость, аудируемость. Закон не равен вероятности. ИИ здесь не «не помешает» — он добавил бы недетерминизм и поверхность ошибки туда, где требуется точность и аудит. Матрица — это не «выбрать модную модель», а «назвать тип под структуру задачи, и иногда правильный тип — это вообще не ИИ».»
[Переход к s30.]
Когда ИИ не нужен или опасен¶
«Соберём сквозной критерий «когда ИИ не нужен или опасен». Это не пять разных предостережений, а один принцип в пяти проявлениях: правильный выбор типа необходим, но не достаточен; ИИ опасен там, где его выход подключён к действию, цена ошибки которого не оплачена обвязкой.
Необратимое авто-действие без гейта — Zillow, Knight. Решение: человеческий гейт, узкий сегмент, живой мониторинг.
Регулируемое решение без объяснимости — Apple Card. Решение: объяснимая модель, человек на эскалации, аудит исходов.
Финфакт без grounding — Air Canada. Решение: grounding, проверяемость, путь к человеку.
Полная замена людей в сервисе — Klarna. Решение: augmentation с гарантированной эскалацией.
Ценовая дискриминация без правовой рамки — Wendy's. Решение: цена — человек в правовой рамке, оптимизатор только внутри границ.
[понизить голос] Заметьте главное. Ни в одном из пяти случаев исправление — не «лучшая модель». Во всех — лучшее суждение о том, что стоит вокруг ИИ на цене ошибки. Это и есть содержательный ответ на центральный вопрос: «где ломается» — не в типе ИИ, он выбран правильно, а в отсутствии обвязки, пропорциональной необратимости и регулируемости действия.»
[Переход к s31.]
Безопасность: ФЗ-152, PII, биометрия, скрытый труд¶
«Безопасность данных в финансах и ритейле острее, чем где-либо. Два блока.
Блок первый — данные и закон. Здесь обрабатываются финансовые данные, персональные данные и биометрия. Закон о персональных данных требует локализации — хранение и обработка данных граждан на серверах в стране, а биометрия — отдельный, более строгий режим. Практический вывод: финансовые данные, персональные данные и биометрию нельзя отправлять в публичный облачный LLM. У публичного облака три структурных минуса, которые не настраиваются: данные покидают контур организации; вы не контролируете, что провайдер с ними делает; аудируемость падает. Критерий выбора — по чувствительности данных и регуляторному режиму, а не по силе модели.
[пауза] Блок второй — компьютерное зрение, проходим иллюстративно. KYC — «знай своего клиента» — обязательная идентификация при подключении клиента. В цифре она часто включает liveness — проверку живости: что перед камерой реальный живой человек, а не фото, маска или дипфейк. Это биометрия — строгий режим.
[понизить голос] Ключевой принцип биометрии отдельным предложением. Биометрический признак необратимо скомпрометирован при утечке. Пароль можно сменить, лицо и отпечаток — нельзя. Цена ошибки здесь асимметрична так же, как у прогноза в Zillow.
И ещё урок — скрытый человеческий труд. Amazon Just Walk Out — магазины без кассира на компьютерном зрении — в апреле 2024 свёрнут из ряда форматов. По сообщениям, автономная касса опиралась на свыше тысячи ревьюеров в Индии, дообрабатывавших проблемные транзакции. Сам Amazon оспаривал такую трактовку — наличие двух версий само по себе иллюстрация проверки фактов: одно событие, две стороны, нужна проверяемая база. Урок: прежде чем автоматизировать зрение, оцени реальную совокупную стоимость и скрытый труд. «Полностью автономно» в маркетинге — гипотеза для проверки, не факт. Forward-pointer: ошибки распознавания по группам мы с вами углубим в Лекции 7.»
[Переход к s32.]
Чек-лист, мост к Семинару 5, Q&A¶
«Сворачиваем пять разделов в чек-лист — до выбора ИИ. Восемь вопросов на экране: какой тип; почему не LLM; можно ли без ИИ; обратимо ли действие; как проверить факт; регулируемо ли решение; кто отвечает; есть ли ПДн или биометрия?
[пауза] Этот аппарат — линза для всех отраслевых лекций дальше. Парный Семинар 5 доводит навык до практики: команды проверяют пять заявлений об ИИ в банках по первоисточникам Банка России и ВЦИОМ. Граница строгая: лекция учит распознавать класс и принцип, семинар — верифицировать самостоятельно.
[понизить голос] И последнее. ИИ здесь даёт огромную измеримую ценность — X5, Сбер, Stripe. А ошибочное суждение стоит полмиллиарда или доверия миллионов. Между восторгом и отрицанием — инженер, который умеет сказать: какой тип, почему он, где ломается и кто отвечает. Этот навык, который мы с вами собрали, не устаревает с выходом следующей модели.
[пауза] Спасибо. У нас есть время на вопросы.»
[Q&A — резерв ~5 мин.]
































