Вернуться к новостям
БезопасностьAI Understanding брифинг

Исследователи создают симулятор кампании влияния на основе искусственного интеллекта для 100 000 агентов

IO Factory связывает планирование кампании, симуляцию активности платформы, воздействие на аудиторию и измерение изменений состояния, но ее авторы подчеркивают, что результаты не оценивают реальное убеждение и не доказывают, что какая-либо кампания имела место.

6 min readRead the primary source
ПервоисточникИсточник записан
Издатель
IO Factory research paper on arXiv
Ссылка на источник
arxiv.orghttps://arxiv.org/abs/2608.10920
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Основная истина
Доверенные ссылочные метки, используемые для обучения или оценки результатов модели.
Калибровка
Насколько хорошо показатели достоверности модели соответствуют фактическим вероятностям правильности.
Проверьте себяВикторина по безопасности ИИ

Что случилось

В новой статье arXiv представлена ​​IO Factory, исследовательская платформа для моделирования кампаний влияния с использованием искусственного интеллекта как отслеживаемых жизненных циклов. Система связывает скоординированные действия агентов с записями воздействия и настроенными изменениями аудитории, позволяя исследователям сравнивать активную кампанию с совпадающим базовым уровнем внутри контролируемой платформы.

Структура разделяет три уровня, которые часто сворачиваются при обсуждении онлайн-манипулирования: уровень управления, который планирует эксперимент, уровень моделирования, где агенты действуют на платформе, и уровень оценки, который измеряет воздействие и изменения состояния. Сообщение не считается влиянием только потому, что оно было создано. Он должен быть размещен, стать видимым в соответствии с правилами платформы, достичь смоделированного гражданского лица, пройти настроенную процедуру измерения, а затем сравниться с базовым уровнем.

Сообщаемая реализация использует Gemma 4 31B на узлах H200 для моделируемых субъектов и поддерживает проверку с участием 100 000 гражданских лиц и 10 000 операторов операций влияния. Сопоставленные доказательства, приведенные в статье, основаны на меньших проектах с участием 10 000 гражданских лиц и 13 парных базово-активных реплик. Авторы тестируют двухконструктивный сценарий, направленный на повышение доверия к России и поддержку поедания насекомых, а также отдельный сценарий, нацеленный на снижение доверия к государственным институтам; это настройки моделирования, а не наблюдения за реальными популяциями.

В проекте с двумя конструкциями в статье сообщается о направленной подъемной силе 0,132 для поддержки поедания насекомых и 0,130 для доверия к России. В едином дизайне доверие к государственным учреждениям снижается по сравнению с базовым уровнем с зарегистрированным скорректированным по знаку подъемом 0,336. Все три первичные конечные точки являются значимыми после коррекции Холма при p<0,001. В той же таблице сообщается о более высокой смоделированной поляризации в активных прогонах, включая 4,714 против 3,865 для конструкции с одной конструкцией, но эти значения остаются в масштабе симулятора.

Авторы также сообщают о том, что доля активного охвата составляет около 0,494 в обоих основных проектах, а это означает, что примерно половина смоделированных гражданских лиц имела записи о воздействии, связанном с источником воздействия. Активность гражданской ретрансляции была низкой в ​​соответствии с установленной мерой, особенно в моноконструкции. В документе неоднократно ограничивается интерпретация: прогоны показывают, что IO Factory может выполнять и измерять заявленные предположения кампании, а не то, что кампания с использованием ИИ сможет достичь таких эффектов на реальной платформе или населении.

Подробности об источнике: IO Factory research paper on arXiv ↗

Почему это важно

Практический вклад — это контрольный журнал для модели угроз, которую невозможно понять на основе отдельных сообщений. Это дает защитникам возможность проверить, как взаимодействуют координация, видимость платформы, воздействие и измерение аудитории, прежде чем рассматривать синтетическую модель как свидетельство реального влияния.

Генеративные модели могут сделать сообщения дешевыми, плавными и адаптированными, но сам по себе объем сообщения не обеспечивает убедительности. Доверие к источнику, повторение, социальный контекст, предыдущие убеждения и путь, по которому человек сталкивается с утверждением, — все это имеет значение. IO Factory делает эти предположения явными как часть жизненного цикла, поэтому исследователь может увидеть, какой этап изменился между активным запуском и базовым, вместо того, чтобы приписывать все различия языковой модели.

Эта структура может улучшить оборонительные упражнения. Платформа, наблюдатель за выборами, группа общественных интересов или группа безопасности могут варьировать количество скоординированных агентов, время их действий, правила видимости или точку вмешательства, а затем проверять полученные записи о происхождении. Значение не является прогнозом вымышленной совокупности. Это возможность воспроизвести вопрос о том, какие сигналы можно наблюдать, какие измерения отсутствуют и как предлагаемый механизм обнаружения или взаимодействия может повлиять на ход кампании.

Разделение действий и доказательств в статье особенно полезно для анализа инцидентов. Группа похожих сообщений может быть симптомом, но более убедительные доказательства могут связать учетные записи, действия, пути воздействия и адаптацию с течением времени. Управляемый симулятор может помочь исследователям разработать эти записи и сравнить методы обнаружения. Это также может выявить, когда оценщик измеряет активность или уверенность судьи-модели, а не изменение убеждений аудитории.

Сохранение границы видимой является гарантией общественных интересов. Сообщаемые сценарии «Россия», «поддержка насекомых» и «институциональное доверие» представляют собой настраиваемые конструкции, выбранные для эксперимента. Они не являются результатами опросов, выводами разведки или доказательством того, что людей удалось убедить. Если рассматривать результаты симулятора как реальный инцидент, это создаст другой вид информационного риска: синтетическую демонстрацию можно принять за свидетельство о стране, сообществе или выборах.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Интерактивная проверка концепции+10 Points
AI Safety Quiz

What is 'specification gaming' in AI systems?

Что посмотреть дальше

Следующие доказательства должны связать симулятор с наблюдениями, собранными с этической точки зрения, проверить, выдерживают ли его измерения изменения модели и платформы, и показать, как защитники могут использовать контрольный журнал, не превращая синтетические результаты в обвинения.

Независимые исследователи должны воспроизвести совпадающие планы с использованием различных языковых моделей, политик акторов, генераторов населения и сетевых структур. В настоящем документе для отчетов о запусках используется одна конфигурация модели и объявляется множество правил симулятора. Анализ чувствительности должен показать, какие выводы сохраняются при изменении качества сообщения, достоверности источника, порогов воздействия и поведения ретранслятора, а не предполагать, что одна параметризация представляет собой онлайн-жизнь.

Калибровка по реальным наблюдениям — более сложный шаг. Данные об этической сфере могут включать общедоступные, согласованные или сохраняющие конфиденциальность меры охвата и взаимодействия, но эти данные не будут автоматически указывать на изменение убеждений. Будущая работа должна сравнить события платформы с проверенными показателями социальных наук, выявить неопределенность и отличить то, что симулятор может воспроизвести, от того, что он просто делает визуально правдоподобным. Судьи, основанные на моделях, должны оставаться инструментами измерения для аудита, а не заменой реальных фактов.

Правозащитникам также следует протестировать адаптивные кампании и защитные меры. В документе описывается планирование, воздействие, измерение и адаптация, однако реальный противник может изменить время, личность источника, язык или стиль взаимодействия после того, как узнает, что отслеживается. Полезные оценки могли бы сравнить трение, регистрацию происхождения, обнаружение скоординированного поведения и проверку людьми, одновременно измеряя ложные срабатывания и побочные эффекты для обычных пользователей.

Наконец, ответственное использование требует контроля над самой структурой. Среда «красной команды» должна ограничивать сценарии, избегать нацеливания на реальных людей, защищать любые связанные данные и документировать, как синтетические агенты и созданный контент отделены от общедоступных платформ. До тех пор, пока не будет получена внешняя проверка, IO Factory лучше всего воспринимать как прозрачный инструмент исследования и моделирования угроз: ценный для проверки предположений, недостаточный для утверждения убедительности в реальном мире или реального инцидента.

Сопутствующие руководства и викторины

Безопасность ИИЭтика ИИИИ-агентыLLM оценкиПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером регулирования ИИ
Нашли это полезным?