DeepSeek AI、脱獄手法疑惑でセキュリティ上の懸念に直面

フォーラムのユーザーが方法を共有したと報告されているDeepSeek AI のコンテンツ制限を回避するように設計されていますが、この主張は現時点では未検証のままです。ユーザーは、脱獄プロンプトが制限されたコンテンツの生成に役立つと主張しています。これにより、人気のある AI モデルの安全性について新たな懸念が生じています。

DeepSeek は中国の人工知能企業です。強力なチャットボットとして世界中で注目を集めています。多くの人がさまざまな作業に使用しています。ただし、他の AI システムと同様に、安全ルールが組み込まれています。

これらのルールにより、有害なコンテンツや違法なコンテンツの生成が防止されます。一部のユーザーはこれらのルールを破ろうとします。彼らは「脱獄」と呼ばれる特別なプロンプトを使用します。これらのプロンプトは、AI を騙して安全ガイドラインを無視させます。

脱獄の試みとそのリスクを理解する

脱獄の試みはかなり前から行われてきました。同じ問題に直面している AI プログラムは数多くあります。フィルターを通過する方法を見つけるために、ユーザーはさまざまなロールプレイング手法を使用します。たとえば、ユーザーは AI に特定のキャラクターのルールを無視するように要求できます。 AI システムの脆弱性は、サイバーセキュリティにおける AI の欠点.

するとキャラクターは無制限に返答します。頻繁に適用されるテクニックは、架空の世界を構築することです。その世界では、通常のルールやコンプライアンスは存在せず、AI はあたかもその世界にいるかのように行動を開始します。

一部の専門家は、安全上の制限により AI の有用性が低下すると主張しています。彼らは、これらの制限により AI の知能が低下すると主張しています。ただし、DeepSeek はリスクを認識しています。

同社は、AIモデルが悪用される可能性があると述べた。彼らはまた、「幻覚」についても警告しました。これは、AIが誤った情報を生成する場合です。 DeepSeekは、自社モデルが幻覚を起こさないという保証はできないことを認めた。

DeepSeek はセキュリティ問題に対処するための措置を講じています。同社は現在、AI が生成したコンテンツにラベルを追加しています。彼らはモデルのトレーニングを説明する文書も公開しました。このドキュメントでは、AI がどのように学習して応答を生成するかを説明します。

さらに、DeepSeek はトレーニング データをフィルタリングしていると述べました。彼らはヘイトスピーチや暴力を含むコンテンツを削除します。また、データの偏りを軽減することにも取り組んでいます。

DeepSeek は安全性を非常に重視していると述べています。しかし、セキュリティ研究者は弱点を発見しました。たとえば、公式の DeepSeek バージョン 2.1.0 および 2.1.1 に脆弱性があることが判明した人もいます。攻撃者はロールベースのプロンプトを使用して、すべての制限を無効にする可能性があります。このモデルは、悪意のあるコードと危険な情報を提供します。同社は後にこれらのバージョンにパッチを適用した。

DeepSeek コミュニティからの公式レポートもあります。報告書には、今年5月の未解決のセキュリティ問題がいくつか列挙されている。これらの問題の中には、ジェイルブレイクが関係するものもあります。あるレポートでは、「NetError ジェイルブレイク」について言及しています。これは、ロールベースのプロンプト挿入方法です。レポートには、この問題は未解決のままであると記載されています。もう 1 つの問題は思考モードに関係します。攻撃者はこのモードを使用して偽の認証情報を作成できます。これは、公式チャンネルさえも現在進行中の問題を認識していることを示しています。

数人の開発者が DeepSeek の無修正バージョンを設計しています。彼らは元のモデルを変更し、その安全機能を削除しました。たとえば、ほぼすべての安全対策を回避するために、「DeepSeek-V4-Flash-DSpark-Abliterated」を特別に作成しました。

作成者によると、この修正バージョンの拒否回避率は 100% です。したがって、AI は何でも同意します。このような修正バージョンは研究目的のみに使用してください。それにもかかわらず、組み込まれた安全対策の取り外しが非常に簡単であることが証明されました。

DeepSeek に関するその他のセキュリティ上の懸念事項

DeepSeek が直面している問題は脱獄の主張だけではありません。セキュリティの専門家は、システムの他の弱点を発見しました。大きな問題の 1 つは、「推論中断」と呼ばれる新しい攻撃手法に関係しています。この攻撃により、AI は思考プロセスを強制的に停止させられます。その結果、モデルは空の、または役に立たない答えを生成します。研究者らは、この欠陥が公式の DeepSeek-R1 モデルに影響を与えることを発見しました。

7 月には別の脆弱性が明らかになりました。これには、開発者向けツールである DeepSeek MCP サーバーが関係します。この問題により、攻撃者がユーザーの会話を乗っ取ることが可能になります。彼らはセッション ID を盗み、プライベート チャットにアクセスすることができます。同社はこの問題を修正するパッチをリリースしましたが、この脆弱性の重大度スコアは 10 点中 8.6 と高く、リスクが重大であることを示しています。

さらに、今年 5 月のコミュニティ レポートには、未解決のセキュリティ問題がいくつか挙げられています。これらには、未修正のままの「NetError ジェイルブレイク」が含まれます。攻撃者は AI の「思考モード」を悪用して、偽の認証情報を作成することもできます。レポートでは、脅威は現在 3 つの層から来ていると指摘しています。これらは、モデル自体、Web アプリケーション、およびインフラストラクチャです。これは、DeepSeek のシステム全体がリスクに直面していることを意味します。

AI の安全性と検閲に関する広範な議論

この情報は、AIを巡る議論が続く中で明らかになった。世界中の政府が人工知能ソフトウェアを評価しています。たとえば、中国は政治的機密性を考慮して AI モデルを分析しています。

これらの当事者は、社会主義的価値観の主要原則に対する AI モデルの積極的な貢献を求めています。米国も課題を指摘している。アメリカのレポートの 1 つは、DeepSeek が人権や民主主義などの問題に関連する多くの応答を妨げていることを明らかにしました。

ファーウェイは DeepSeek の安全なバージョンも作成しました。このバージョンは中国政府の基準を満たしています。政治的にデリケートなコンテンツは生成されません。同社は浙江大学と共同でこれを開発した。彼らはこのプロジェクトにファーウェイ独自のチップを使用しました。これは、政府の規制に合わせた AI モデルの推進を示しています。

主張されている脱獄テクニックは、多くのケースのうちの 1 つにすぎません。これは、AI の作成者とそのユーザーの間で戦争が続いていることを証明しています。 DeepSeek のような開発者は、テクノロジーの悪用を阻止しようと努めています。

ただし、ユーザーはテクノロジーの限界を突破するさまざまな方法を常に考えています。コミュニティのレポートによると、攻撃エリアは拡大し続けています。今日、モデル層、Web アプリケーション、インフラストラクチャが脅威を生み出しています。これは、システム全体が影響を受けやすいことを意味します。