Hirundo发布去政治化版Qwen:审查回答率从89.8%降至2.8%
AI安全实验室Hirundo于2026年10月5日发布阿里巴巴Qwen开源权重模型的“去政治化”版本,通过机器遗忘技术直接从模型权重中移除与中国政治立场相关的对齐。该版本覆盖Qwen3.6-35B-A3B和Qwen3.5-4B两个模型,已在Hugging Face开放下载。
Hirundo的评测显示,在包含500条提示的基准测试中,原版Qwen3.6-35B-A3B在89.8%的回答中存在政治审查、宣传式框架或政治偏见;经机器遗忘处理后,该比例降至2.8%。在外部基准测试中,DECCP数据集上的拒绝率从65.26%降至3.16%,ChinaBench上的不合规率从96.67%降至6.67%。同时,模型的推理、编程和指令遵循能力基本保持,在GPQA、IFBench、LiveCodeBench和MMLU-Pro等基准上的平均得分与原版相差不超过0.72分,安全与有害性评测结果也基本持平。
Hirundo联合创始人兼CEO Ben Luria表示,中国开源模型能力出色,但采用它们不应意味着接受其中被强加的政治对齐。该公司计划继续对主流中国模型推出类似版本。其技术报告已发布在官网,并计划公开CCPC-500基准供其他研究者使用。
此前,CBS News在报道中对原版和去政治化版本进行了独立测试。Hirundo是一家位于特拉维夫的AI安全实验室,其机器遗忘技术已有九项美国专利申请,曾与Google DeepMind和IBM Research有过合作。
- 2026-10-05 21:05 | venturebeat.com:Hirundo Releases Westernized Qwen, Cutting Censored and CCP-Aligned Answers From 89.8% to 2.8% in the Leading Chinese AI Model阅读原文
Hirundo's research found Chinese Communist Party (CCP) aligned censorship, propaganda or political bias in 89.8% of Qwen's answers on sensitive topics, including inside everyday tasks. Its Westernized version cuts that to 2.8% while preserving the model's capabilities. TEL AVIV, Israel--(BUSINESS W...