Игры и адаптация: как стратегии меняют среду друг друга
Как повторяющиеся взаимодействия, репутация, локальные правила и отбор стратегий создают устойчивые нормы и глобальные структуры.
В небольшой команде руководитель однажды отвечает на письмо в полночь. Коллега решает, что вопрос срочный, и тоже подключается. Через неделю вечерние ответы становятся способом показать вовлечённость. Через месяц тот, кто выключает уведомления, рискует пропустить решение. Общего правила никто не принимал, но оно уже действует.
Каждый участник сделал понятный локальный выбор. Руководитель хотел быстро закрыть вопрос, коллега — не задержать остальных. Однако их ответы изменили ожидания всей команды. Теперь следующий человек выбирает уже в другой среде.
Теория игр изучает именно такие взаимозависимые решения. Адаптивные и эволюционные модели добавляют время: участники наблюдают за результатами, меняют поведение, копируют удачные приёмы — и тем самым перестраивают условия, в которых будут выбирать дальше.
Правило, которого никто не вводил
Ситуацию удобно описывать как игру, если можно назвать участников, доступные им действия, последствия разных сочетаний действий, известную им информацию и порядок встреч. «Игра» здесь не означает развлечение или манипуляцию. Это способ увидеть, что результат одного человека зависит от решений других.
Стратегия — не обязательно сложный план. Часто это условное правило: «если партнёр выполнил договорённость, продолжить обмен»; «если дорога перегружена, выбрать другой маршрут»; «если пробный запуск прошёл без ошибок, увеличить его масштаб». Такое правило связывает наблюдаемую ситуацию с действием.
Равновесие Нэша описывает профиль стратегий, при котором ни один участник не улучшит свой результат, если изменит поведение в одиночку, а остальные продолжат действовать по-прежнему.1 Это полезный снимок взаимно согласованных ответов. Он сам по себе ничего не говорит о справедливости, общественной пользе или о том, сохранится ли порядок после совместного изменения.
Полуночная переписка тоже может прийти к устойчивому состоянию. Пока все отвечают вечером, отдельному человеку дорого отключаться первым. При этом команда в целом могла бы предпочесть другое правило — например, помечать действительно срочные письма и оставлять остальные до утра.
Не всем доступны одинаковые ходы
Участники входят во взаимодействие с разным количеством времени и денег, разным доступом к данным и разной переговорной силой. Один может провести десять проб и пережить девять неудач. Для другого первая неудача нарушит обязательства и закроет возможность попробовать снова. Формально действие разрешено обоим, практически — только одному.
В исследованиях экономики сложности хозяйство рассматривают как развивающийся процесс: неоднородные участники замечают повторяющиеся схемы, строят по ним ожидания, действуют и вместе меняют схемы, на которые будут ориентироваться дальше.2 Поэтому мало спросить, какая стратегия дала лучший результат сегодня. Нужно также выяснить, кто сможет её повторить и кто переживёт изменение правил.
Адаптацию можно разложить на три процесса. Сначала появляются новые правила или варианты старых. Затем среда отбирает те, что дают лучший результат в текущих условиях. Наконец, удачные правила сохраняются — в привычке, записи, регламенте, коде или практике найма. Носители различны, поэтому биологическую эволюцию, обучение людей и изменение организаций нельзя считать одним и тем же процессом. Общей остаётся схема: вариация, отбор и сохранение.
Преимущество зависит от того, кто ещё им пользуется
Редкая стратегия иногда выгодна именно своей редкостью. Новый способ работы приносит компании дополнительную маржу, пока его не скопировали конкуренты. После распространения меняются ожидания клиентов, цены и требования к поставщикам — вместе с ними исчезает исходное преимущество.
Джон Мейнард Смит и Джордж Прайс применили игровую модель к конфликтам животных и развили понятие эволюционно устойчивой стратегии: при заданной структуре выигрышей распространённая стратегия способна сопротивляться вторжению редкой альтернативы.3 Это точное свойство модели частотно-зависимого отбора, а не общая оценка того, что стратегия «хороша».
Похожая зависимость встречается в моделях финансового рынка. У Брока и Хоммеса одни участники сравнивают цену с оценкой базовой стоимости, а другие продолжают недавнее направление движения цены. Они переключаются между правилами, ориентируясь на прошлые результаты. При некоторых параметрах взаимодействие этих двух способов строить ожидания порождает нестабильную, сложную динамику.4 Модель показывает возможный внутренний механизм колебаний; для объяснения конкретного рынка всё равно нужны данные об институтах, ограничениях и внешних событиях.
Повторение меняет ценность памяти
Продавец даёт постоянному клиенту отсрочку без длинного договора. Клиент платит вовремя, и следующая сделка проходит быстрее. История платежей снижает стоимость проверки, потому что обе стороны ожидают новую встречу и могут прекратить обмен.
В модели Аксельрода и Гамильтона для повторяющейся дилеммы заключённого кооперация на основе взаимности при определённых условиях могла возникать, сохраняться среди других стратегий и сопротивляться вторжению.5 Позднейшие модели выделяют и другие механизмы: прямую и косвенную взаимность, влияние сети и групповой отбор.6
Репутация помогает только тогда, когда действия можно различить, а у записи есть дата, срок актуальности и контекст. Если в записи есть ошибка, её должно быть можно оспорить и исправить. Без этих условий память превращается в слух или вечное наказание за событие, смысл которого уже потерян. Подробно воспроизводимые правила, роли и процедуры пересмотра разбираются в статье «Микроинституции».
Сеть решает, кто у кого учится
Стратегии распространяются по связям. Коллеги чаще копируют практики своей команды, компании — заметных конкурентов, жители — решения соседей. Плотная группа быстро согласует норму, но её участники получают похожую информацию. Слабые связи соединяют разные круги и приносят сведения извне, хотя координация через них требует дополнительных усилий.7
Сеть влияет и на последствия нарушения. В анонимной разовой сделке невыполненное обещание затрагивает одну встречу. В небольшом сообществе та же история быстро становится известной будущим партнёрам.
Некоторые задачи допускают несколько совместимых решений: по какой стороне дороги ехать, как записывать дату, когда начинать совещание. Любая устойчивая договорённость экономит повторные переговоры. В модели Пейтона Янга участники координационной игры учатся при ограниченной рациональности и небольших случайных отклонениях; долгая динамика способна выбрать одну устойчивую конвенцию из нескольких равновесий.8 Затем учебные материалы, интерфейсы и ожидания подстраиваются под принятое правило, и менять его становится дороже.
Как ночное письмо становится общей нормой
Вернёмся к команде. Первый вечерний ответ создаёт сигнал срочности. Ответ коллеги подтверждает его. Несколько повторений связывают видимую вовлечённость с доступностью по ночам. Новичок наблюдает уже не отдельные решения, а сложившуюся норму и подстраивается под неё.
Последовательность можно записать так:
человек наблюдает поведение коллег
→ отвечает на него
→ меняет ожидания команды
→ следующие участники выбирают уже в новых условиях
Модели помогают увидеть, как локальные решения дают гораздо более заметный общий результат. Томас Шеллинг показал на модели городской сегрегации, что умеренные требования жителей к составу ближайшего окружения могут приводить к значительно более выраженному разделению города.9 Этот механизм не заменяет эмпирического анализа: для объяснения реального города нужны данные о рынке жилья, дискриминации, доходах, инфраструктуре и политике.
В пороговой модели Марка Грановеттера у каждого участника есть своё условие присоединения: сколько других должно начать действовать раньше него. Небольшое изменение распределения таких порогов способно резко изменить общий результат, даже если их среднее значение остаётся прежним.10 Обе модели показывают не одинаковые причины, а общий принцип: по итоговой картине нельзя без дополнительных данных восстановить мотив каждого участника.
Технический пример: разумный повтор, который усиливает сбой
После превышения допустимого времени ожидания (тайм-аута) программа повторяет запрос. Для одного клиента это разумно: повтор повышает шанс получить ответ. Если тысячи клиентов одновременно делают то же самое, зависимый сервис — следующий сервис в цепочке — получает дополнительную нагрузку именно тогда, когда уже не справляется.
Инженеры ограничивают число повторов общим лимитом (retry budget), увеличивают паузу между попытками (exponential backoff) и добавляют к ней небольшую случайную величину (jitter), чтобы клиенты не обращались одновременно. Ещё помогают единое предельное время всей операции и автоматический выключатель запросов к явно недоступному сервису (circuit breaker).
Эти средства согласуют поведение независимых программных компонентов и ограничивают общий ущерб. Это инженерная аналогия правила игры, а не описание человеческих намерений: программа не обладает правами, репутацией или способностью договориться о справедливом порядке.
Что проверить в адаптивной игре
- Кто участвует? Следует учесть посредников и тех, кто несёт побочный ущерб.
- Что видно участникам? Действие, результат, намерение и репутационная запись — разные виды информации.
- Что сохраняется в памяти? Важно знать, кто хранит историю, как долго и можно ли исправить ошибку.
- Что повторяется? Сделка, встреча, выпуск новой версии, сезон или поколение задают разные сроки обучения.
- Меняется ли выгода при распространении стратегии? Приём может потерять ценность, когда станет обычным или повысит общую нагрузку.
- Как правило передаётся? Его могут копировать, преподавать, закреплять договором или встраивать в программу.
- Можно ли прекратить обмен? Возможность уйти влияет на переговоры не меньше, чем размер немедленного выигрыша.
Ответы подсказывают, что именно можно изменить: доступную информацию, задержку обратной связи, стоимость действия, процедуру координации или состав доступных стратегий.
Границы модели
Игровая модель полезна, когда явно заданы участники, стратегии, информация и выигрыши. Для эволюционной модели нужно дополнительно указать, как стратегии появляются, отбираются и передаются.
Биологическая приспособленность описывает воспроизводство в определённой среде. Оценка человеческого порядка требует других критериев: прав, достоинства, распределения власти и внешних последствий. Устойчивая стратегия может поддерживать неравный или расточительный порядок.
Репутация лучше работает при проверяемых действиях, соразмерных последствиях, возможности ответа и процедуре исправления записи. Сети дают одним людям доступ и доверие, но могут закрывать вход другим. Поэтому анализ должен учитывать не только участников успешного обмена, но и тех, кто остался за его границей.
Что полезно запомнить
Стратегия не действует в пустоте. Она встречает другие стратегии, меняет их выгоды и постепенно перестраивает условия собственного успеха. Разовый ход отвечает на текущую ситуацию; повторение создаёт память; распространение правил формирует общую норму.
Вместо поиска вечной выигрышной стратегии полезнее спросить: какое поведение здесь вознаграждается, что взаимодействие сохраняет в памяти и какой порядок возникнет, если локально разумный ход повторят многие?
Чтобы понять этот выбор, нужно перейти от взаимодействия стратегий к состоянию самого участника. «Человек как адаптивная система» разбирает роль опыта, внимания, телесного состояния, отношений и целей.
Источники и примечания
-
John F. Nash Jr., “Equilibrium Points in N-Person Games”, Proceedings of the National Academy of Sciences 36(1), 1950, pp. 48–49. ↩︎
-
W. Brian Arthur, “Complexity Economics: A Different Framework for Economic Thought”, Santa Fe Institute Working Paper 2013-04-012, 2013. ↩︎
-
John Maynard Smith, George R. Price, “The Logic of Animal Conflict”, Nature 246, 1973, pp. 15–18. ↩︎
-
William A. Brock, Cars H. Hommes, “Heterogeneous beliefs and routes to chaos in a simple asset pricing model”, Journal of Economic Dynamics and Control 22(8–9), 1998, pp. 1235–1274. ↩︎
-
Robert Axelrod, William D. Hamilton, “The Evolution of Cooperation”, Science 211(4489), 1981, pp. 1390–1396. ↩︎
-
Martin A. Nowak, “Five Rules for the Evolution of Cooperation”, Science 314(5805), 2006, pp. 1560–1563. ↩︎
-
Mark Granovetter, “The Strength of Weak Ties”, American Journal of Sociology 78(6), 1973, pp. 1360–1380. ↩︎
-
H. Peyton Young, “The Evolution of Conventions”, Econometrica 61(1), 1993, pp. 57–84. ↩︎
-
Thomas C. Schelling, “Dynamic Models of Segregation”, The Journal of Mathematical Sociology 1(2), 1971, pp. 143–186. ↩︎
-
Mark Granovetter, “Threshold Models of Collective Behavior”, American Journal of Sociology 83(6), 1978, pp. 1420–1443. ↩︎