Большие языковые модели, такие как ChatGPT и Claude, не обучаются в вакууме. Их обучающие данные берутся из реальной информационной среды, формируемой социальными и политическими институтами. Когда правительства осуществляют широкий контроль над информацией, доступной их гражданам, это может влиять и на то, как большие языковые модели, обученные на языке этой страны, отображают политические события, институты и идеи. Каковы потенциальные риски? Как информационная среда, контролируемая государством, может влиять на разработку и поведение языковых моделей? И каковы могут быть более широкие последствия для политического дискурса, целостности информации и демократических обществ?
Джошуа А. Такер — профессор им. Джулиуса Сильвера, Розлин С. Сильвер и Инид Сильвер Уинслоу, профессор политологии, аффилированный профессор славистики и аффилированный профессор data science в Нью-Йоркском университете (NYU). Он является директором Центра углублённого изучения России им. Джордана при NYU. Он один из соучредителей и содиректоров Центра социальных медиа и политики при NYU (CSMaP). Изначально его исследования были посвящены массовому политическому поведению в посткоммунистических странах, но последние двенадцать лет он сосредоточен на пересечении цифровой информационной среды, социальных медиа и политики.
### Таймкоды
*00:00 – 07:55 — Введение и DeepSeek:* Представление исследования, цензура DeepSeek и роль обучающих данных.
*07:55 – 19:44 — Пропаганда в обучающих данных:* CulturaX, китайские государственные материалы и их влияние на модели.
*19:44 – 28:23 — Эксперимент с моделью:* Проверка влияния пропаганды на ответы open-weight модели.
*28:23 – 33:42 — Влияние на другие языки:* Неожиданный перенос эффекта на японский и другие языки.
*33:42 – 44:06 — Аудит моделей и глобальные последствия:* ChatGPT, Claude, 37 стран, свобода прессы и ограничения исследования.
*44:14 – 53:33 — Q&A: Как обучаются языковые модели:* Предобучение, Common Crawl, постобучение и RLHF.
*53:33 – 01:02:27 — Q&A: Языковой перенос:* Может ли влияние обучающих данных распространяться между языками?
*01:02:27 – 01:10:52 — Q&A: ChatGPT и Claude:* Личный опыт, устаревшие ответы и ограничения моделей.
*01:10:52 – 01:22:47 — Q&A: Политические предубеждения:* Политический уклон моделей и эффект sycophancy.
*01:22:47 – 01:32:35 — Q&A: Россия и дипфейки:* Регулирование ИИ, разные ИИ-экосистемы и «дивиденд лжеца», проверка информации и влияние моделей на пользователей.
*01:32:35 – 01:41:30 — Q&A: Регулирование и будущее ИИ:* Дистилляция моделей, прозрачность и государственное регулирование.