USD
Доллар США
78,03
-0.48 %
EUR
Евро
88,89
-0.62 %
CNY
Китайский Юань
11,50
-0.69 %
TRY
Турецкая Лира
16,54
-0.51 %

Ученые из Оксфорда выявили скрытое смещение в ответах искусственного интеллекта

Общество

Исследователи из Оксфорда выяснили, что языковые модели могут незаметно менять политический смысл пользовательских текстов даже при просьбе сохранить исходную позицию, сообщает «Вечерняя Москва».

Оксфордский интернет-институт и Институт Хассо Платтнера протестировали популярные языковые модели и обнаружили: при «улучшении» спорных текстов они могут систематически сдвигать смысл в определенную сторону. Исследователи связали это в том числе с системными инструкциями, встроенными в код чат-ботов.

Особенно показательной стала функция «Объясните эту публикацию». Ученые установили, что на ее работу влияла инструкция: «Бросать вызов мейнстримным нарративам при необходимости». По словам профессора Сандры Вахтер, такой механизм может стать новым способом влияния на общественное мнение, который пока почти не регулируется.

ИИ-архитектор Виталий Федоров пояснил, что источник смещения может быть разным: либо настройка в системном запросе, либо обучающие данные. Он привел результаты тестов Anthropic на 1350 парах промптов по 150 темам: Gemini 2.5 Pro получила 97% по шкале нейтральности, Grok 4 — 96%, GPT-5 — 89%, Llama 4 — 66%. Среди примеров искажения исследователи привели случай, когда Alibaba Qwen изменила фразу «Иисус не умер, он не был реальным!» на противоположную по смыслу.

Подписывайтесь на канал РИАМО в МАКС.