10月10日、madrobot.blogが「China's top AI labs published safety results at launch for 9 of 857 models」と題した記事を公開した。中国主要AIラボが5年間でリリースした857モデルのうち、リリース時点で安全性評価を公開していたのはわずか9件。世界中の開発者が業務・製品開発に組み込んでいるDeepSeekやQwen、Kimiといったモデルが、安全性エビデンスをほぼ開示しないまま流通している実態を、全件調査によって初めて明らかにした報告書だ。
857モデル中、安全性結果を公開したのは9件だけ
調査報告書はリサーチ会社SemiAnalysisが発表した「Beijing Will Not Pace the Frontier」(※有料ニュースレターのため、非購読者は全文を参照できない場合がある)。DeepSeek、Alibaba、ByteDance、Moonshotなど中国の主要AI開発者9社が2021年〜2026年9月15日の間にリリースした全モデルを、各社のモデルカード・リリースノート・技術レポートと照合した。
結果は明快だ。857件のリリースのうち、何らかの安全性評価結果を公開したのは31件(3.6%)のみ。そのうちリリース時点で公開されていたのはわずか9件。別の16件はリリース後に公開されており、中央値で42日の遅延があった。最長はDeepSeek-R1で、安全性付録が公開されたのはリリースから349日後の2026年1月だった。残りの813件(94.9%)には安全性開示が一切ない。
「安全性訓練済み」と謳うだけでは集計対象外とされた。集計に含めるには、特定モデルに紐付いた形で、有害出力・ジェイルブレイク・毒性・プライバシー・拒否応答・危険能力のいずれかに関する実際の評価結果が必要とされた。
リリース件数は2023年初頭の四半期あたり3件から2025年半ばには101件へと急増した。だが安全性開示はそれに追いつかず、直近15四半期のうち9四半期では、安全性評価を添付したモデルのリリースがゼロだった。
大手テック4社が最低ライン、Zhipuだけが例外
企業別に見ると、大手4社(Alibaba・ByteDance・Tencent・Baidu)は540件中11件(**2%**)と最も開示率が低い。内訳はAlibaba:238件中7件、ByteDance:120件中2件、TencentとBaiduはそれぞれ1件ずつ(133件中・49件中)。
スタートアップ5社(DeepSeek・Moonshot・Zhipu・MiniMax・StepFun)は317件中20件とやや高い。
際立つのがZhipu(Z.aiとして販売)で、2022年から毎年継続して安全性評価を公開している唯一の開発者だ。一方でDeepSeekはV3のみリリース時に文書化し、R1・V3.1・V4ファミリーは未公開のまま。
サイバー攻撃リスクや生物兵器リスクを検証したドキュメントは全データセット中3件のみで、いずれもZhipuのGLM-5.2・GLM-5.3とMoonshotのKimi K2に限られる。最も急成長しているカテゴリである推論モデル(Reasoning models)は93%が未文書化だった。
「AI開発者の自制心は幻想だ」
中国はAIを規制しているが、主にコンテンツラベリングや未成年者保護、AIコンパニオン、エージェント、データといったアプリケーション層が対象だ。2026年9月14日に標準化委員会TC260が発行した「AI安全ガバナンスフレームワーク3.0」は自己改善するAIへの警戒を述べているが、同時にイノベーションと開発を「第一優先」と位置づける。基準は推奨であって拘束力はなく、AI法の立法は2025年に棚上げされた。
EUがパラメータ数などを基準にモデルへの義務を課し、カリフォルニア州SB 53が同様の基準を設けるのと対照的だ(10²⁵〜10²⁶回の演算以上の学習規模が閾値。これはGPT-4規模相当の大規模学習に匹敵するとされる)。
専門家の声は辛辣だ。中国の研究者4名が学術誌National Science Reviewの4月の論説で述べた言葉が報告書中で引用されている。
AIガバナンスの進展は危機的なほど遅く、AI開発者の自制心は幻想だ。
— Zeng Yi、Huang Tiejun、Jiang Yugang、Poo Mu-ming(National Science Review、報告書内の翻訳より)
一方、反論もある。北京通用人工知能研究院(BIGAI)所長のZhu Songchun氏は今年のWorld AI Conferenceで、AIによる絶滅リスクへの警告を「オッペンハイマー式マーケティング」であり「資本の論理が背後にある」と批判した。
報告書はこの議論に対し、「どちらの陣営も実際には何も決めない。決めるのは最高指導部だ」と結論づける。
なぜ今これが重要か
DeepSeekやQwen、Kimiといった中国のオープンモデルは世界中の開発者が利用しているが、それらが安全性エビデンスをほとんど公開せずにリリースされているという全件調査はこれが初めてだ。
報告書が公開された背景には、Anthropic CEOのDario Amodei氏が9月に各ラボへ「フロンティアのペースを合わせる(pace the frontier)」よう呼びかけた動きがある。報告書はAnthropicがその呼びかけの4日後にClaude Opus 5.5をリリースし「中国との競争力維持のため」と説明したことも指摘しており、「中国が先行しているから速度を落とせない」という西側の論法が成立するかどうかを問い直している。
日本の開発者コミュニティにとっても、この調査結果は他人事ではない。DeepSeekやQwenは国内のスタートアップ・大企業を問わず広く採用が進んでいるが、今回の調査が示すのは「モデルの性能は検証できても、安全性の根拠を第三者が確認する手段がほとんど存在しない」という構造的な問題だ。OSSモデルをプロダクションに採用する際のリスク評価や、企業のAIガバナンス方針の策定において、安全性開示の有無を採用判断の一指標として明示的に組み込む必要性が、あらためて浮き彫りになっている。EUのAI法やカリフォルニア州SB 53のような法的枠組みを持たない現状では、開発者側が自衛的にデューデリジェンスを行うほかなく、今回のような全件調査はその判断材料として直接活用できる。
詳細はChina's top AI labs published safety results at launch for 9 of 857 modelsを参照していただきたい。




