Пользуетесь DeepSeek вместо ChatGPT? Он в два раза чаще врёт вам о Тайване

Китайские чат-боты провалили тест NewsGuard.


kpz3u2m4pm5ifhg5664i7g4windfk6dd.jpg

Китайские чат-боты с искусственным интеллектом заметно хуже западных конкурентов распознают ложные утверждения в пользу Китая, а на чувствительные для Пекина вопросы нередко предпочитают вообще не отвечать. К такому выводу пришла служба NewsGuard, проверив семь популярных китайских систем.

Специалисты проверили DeepSeek , MiniMax, Ernie от Baidu, Qwen от Alibaba, Yuanbao от Tencent, Kimi от Moonshot AI и Z.ai от Zhipu AI. Каждому чат-боту на английском языке задавали вопросы по десяти заведомо ложным утверждениям, которые распространяли китайские государственные СМИ или прокитайские пользователи социальных сетей. Результаты сравнили с июльской проверкой десяти ведущих западных чат-ботов.

Китайские системы не смогли опровергнуть ложную информацию в 53% случаев. У западных чат-ботов показатель составил 24%. NewsGuard засчитывала как неудачу не только прямое повторение недостоверных сведений, но и отказ отвечать, при котором пользователь оставался без опровержения.

Для каждого утверждения использовали три варианта запроса. В первом пользователь нейтрально просил проверить информацию, во втором изначально считал ложное утверждение правдой и просил подробности. Третий вариант имитировал человека, который намеренно пытается заставить систему создать новую версию дезинформации. Всего специалисты отправили чат-ботам 210 запросов.

Главным отличием китайских систем стали частые отказы отвечать. Такой результат зафиксировали в 24% случаев против 0,5% у западных моделей. Причём 88% отказов китайских чат-ботов касались Тайваня. NewsGuard связывает это с встроенными ограничениями на политически чувствительные темы: китайские правила требуют от систем искусственного интеллекта блокировать материалы, которые могут угрожать национальной безопасности или привести к разглашению государственной тайны.

Проблема не ограничилась отказами. При запросах, специально составленных для создания ложных утверждений, китайские системы выдавали недостоверные сведения в 51% случаев, западные – в 42%. В одном из тестов шесть из семи китайских чат-ботов написали убедительно выглядящие новости о вымышленном досрочном выводе немецких войск из Гренландии из-за тарифных угроз США.

Результаты заметно различались между отдельными сервисами. MiniMax опроверг ложные утверждения в 85% случаев и ни разу не отказался отвечать. Хуже всех показал себя Ernie от Baidu, который повторял прокитайские недостоверные сведения в 60% случаев.

NewsGuard также обнаружила связь между ответами чат-ботов и источниками информации. Китайские системы ссылались на государственные СМИ КНР в 38% случаев, западные – в 16%. Чаще всего чат-боты повторяли именно те ложные утверждения, которые получили наиболее широкое распространение в китайских государственных СМИ и социальных сетях.

Авторы отчёта считают, что проблема особенно актуальна на фоне того, что китайские модели распространяются за пределами страны. Открытые модели позволяют компаниям разворачивать системы внутри собственной инфраструктуры и снижать расходы, однако вместе с преимуществами пользователи могут получить политические ограничения и недостоверные ответы, заложенные в исходных моделях.