Hirundoが10月5日に発表した「Qwenの検閲回答削減」結果によると、改変したAlibabaのQwenモデルは、中国共産党(CCP)の方針に沿った検閲回答を89.8%から2.8%に減らした。

要点

  • Hirundoの報告によると、改変したQwenモデルは、政治的に微妙な質問に対する検閲または中国共産党(CCP)の方針に沿った回答を89.8%から2.8%に減らした

  • HirundoはNvidiaのNeMo EvaluatorをGB200 NVL72チップ上で使用し、「西洋化したQwen」の結果を検証した

  • 今回の発表では、政治以外のタスクのベンチマークスコアは示されず、製品の提供状況、価格、レート制限、対象地域、サービス階層も明らかにされなかった

  • Hirundoが引用したCrowdStrikeの調査では、プロジェクトがチベットに関連するとされた場合、DeepSeekがより脆弱なコードを生成したことが判明した

Hirundoによると、「西側向けに調整したQwen」と称するこのバージョンを構築し、Nvidia(NVDA)のNeMo EvaluatorをGB200 NVL72チップ上で使用して結果を検証した。

Qwenの検閲された回答を削減

このリリースでは、台湾、天安門広場、中国共産党の政策に関する質問など、政治的にセンシティブなプロンプトを使ってQwenのベースラインモデルをテストした。こうした質問では、中国政府寄りの回答になる可能性がある。Hirundoによると、未改変モデルは89.8%の確率で検閲された回答、または中国政府寄りの回答を返した。

再学習後、その割合は2.8%に低下した。

Hirundoは、一般的な能力を損なわずに政治的な条件付けによる回答を取り除くことを目的とした、的を絞ったファインチューニングによって削減を実現したとしている。しかし、この発表には政治以外のタスクに関するベンチマークスコアが示されていないため、改変後のモデルがこうしたプロンプト以外でどのように機能するかは明らかになっていない。

関連記事:Googleの研究者ら、AIエージェントが自分のテストを記憶するのを防ぐ手法を発表

さらに重要なのは、これは企業が報告した再学習テストであり、広く提供されている製品が通常の利用時にどう振る舞うかを示す証拠ではないという点だ。

Hirundoは提供状況、価格、レート制限、提供地域、サービス階層を明らかにしておらず、顧客が公表済みの商用条件に基づいて評価・導入できる製品は示されていない。

オープンウェイトモデルは、基盤となるパラメーターが公開され、誰でもダウンロードして変更できるモデルだ。元の研究機関に利用料を支払わずに、外部の開発者がベースモデルを基に開発できるため、AI業界の中心的な存在となっている。Alibabaが開発したQwenは、世界で最もダウンロードされているオープンウェイトモデルの一つであり、中国国外で導入する企業にとって、モデルに組み込まれた政治的バイアスが懸念材料となっている。

Hirundoはまた、別のCrowdStrikeの調査も引用している。この調査では、中国のDeepSeekにプロジェクトがチベットに関連すると伝えると、より脆弱なコードが生成された。これは、政治的な条件付けが、政治に関する直接的な質問だけでなく、技術的な文脈でも表れる可能性を示している。

この結果は、中国のオープンウェイトモデルが、どこにウェイトを展開しても中国政府寄りの傾向を持ち続けるかどうかをめぐる研究に、新たなデータを加えるものだ。

Qwenと、MetaのLlamaなどの欧米の代替モデルを比較検討する企業にとって、数値化されたバイアスのベンチマークが得られた。ただし、「修正済み」バージョンを販売するHirundoの利害を踏まえ、独立した再検証が望まれる。

次の記事:Aleph Alpha、欧州の主権型オープンウェイトモデル「Kolibri」を発表