Deep Seekについて
出典・更新履歴・検証情報
この保存版のデータを照合するための情報です。元記事の初公開日とは区別しています。
- データセットの版
- 2026.09.23.4
- 記事内容のSHA-256
554063803143abe4b77e9fefa0c34aabe123a83e0ba1b383e27cd168887f0e0e- 保存版のSHA-256
2db9ea4ce284e1dee736bfa6205b9a96d92573e3dc6efc23f077ea1e68849b78
外部証明の最終検査結果は詳細を開くと表示します。
DeepSeek R1とDeepSeek V3は、いずれもDeepSeek社が開発した大規模言語モデル(LLM)であり、それぞれ異なる特徴と強みを持っています。
#DeepSeek V3:
#- 概要: 2024年12月にリリースされたモデルで、6710億のパラメータを持ち、汎用的な言語処理タスクに対応しています。
- 技術的特徴:
- Mixture-of-Experts(MoE)アーキテクチャ: 256の専門家ネットワークと1つの共有専門家を組み合わせ、各トークンに対して370億のパラメータが活性化されます。
- Multi-head Latent Attention Transformer: データを多角的に分析し、重要な情報を効果的に抽出します。
- パフォーマンス: GPT-4oやClaude 3.5 Sonnetと同等の性能を示し、MetaのLlama 3.1やQwen 2.5を上回ると報告されています。
DeepSeek R1:
#- 概要: 2025年1月にリリースされた推論能力に特化したモデルで、複雑な問題解決や論理的推論を得意としています。
- 技術的特徴:
- 強化学習(RL)の活用: 特にR1-Zeroモデルでは、教師あり微調整を行わず、強化学習のみでトレーニングされています。
- 推論能力の強化: 論理的なステップを明示的に踏むことで、複雑な問題解決能力を向上させています。
- パフォーマンス: OpenAIのo1モデルと同等の性能を持ちながら、トレーニングコストは約5%と報告されています。
ChatGPT(GPT-4)との比較:
#- パフォーマンス: DeepSeek R1は、数学的推論や複雑な問題解決において、ChatGPT(GPT-4)と同等、またはそれ以上の性能を示すと報告されています。
- 効率性: DeepSeekのモデルは、トレーニングに必要な計算資源やコストの面で、ChatGPTよりも効率的であるとされています。
総合的に、DeepSeek R1とV3は、それぞれの強みを活かし、ChatGPT(GPT-4)と比較しても競争力のある性能を持っています。特に、トレーニングコストや計算資源の効率性において優位性があると報告されています。
##
GPUの能力を引き出すPTXコーディング
#PTXの概要
#PTXは、NVIDIAが提供するCUDAプラットフォームにおける中間言語 (IR: Intermediate Representation) です。GPUで並列処理を行うために設計されており、CUDAコードをGPUが実際に実行できる命令に変換するプロセスで重要な役割を果たします。
#特徴と目的
#- 中間言語
- CUDA C/C++などの高水準プログラム言語をPTXに変換することで、ハードウェアに依存しない汎用的なコードを生成します。
- PTXはさらに、実際のGPUアーキテクチャに最適化されたバイナリ(SASS: Streaming Assembler)にコンパイルされます。
- ハードウェアからの独立性
- PTXは「仮想アセンブリ言語」として機能し、将来のGPUアーキテクチャと互換性を保つ設計になっています。これにより、新しいGPUが登場しても、既存のPTXコードを再利用できる可能性があります。
- 人間が読める形式
- PTXコードはアセンブリに似た形式で記述されており、比較的人間が理解しやすい表記です。このため、パフォーマンスチューニングやデバッグに役立ちます。
PTXの役割
#- コンパイルの中間段階
- CUDAソースコードは以下の手順で最終バイナリに変換されます:
- ソースコード → PTX (nvccコンパイラで生成)
- PTX → SASS (ドライバやランタイムで変換)
- 柔軟な実行
- PTXファイルを保存しておくことで、別のGPUアーキテクチャ上で再コンパイルして実行可能です。
- デバッグと最適化
- PTXコードを直接編集して、細かいレベルでのGPUプログラムのパフォーマンス改善や問題解決が可能です。
関連する概念
#- CUDA: GPUを活用するための高水準プログラミングモデル。
- SASS: PTXコードを特定のGPUアーキテクチャに最適化した低レベルコード。
- nvccコンパイラ: CUDAソースコードをPTXに変換するためのツール。
メリットと用途
#- 移植性: PTXは複数のGPUアーキテクチャに対応。
- 柔軟性: 再コンパイルにより新しいGPUにも対応可能。
- 最適化: ローレベルのカスタマイズにより高効率なコード実行が可能。
#
Deep Seekへの利用
#DeepSeekは、GPUの性能を最大限に引き出すため、CUDAの下位レイヤーであるPTX(Parallel Thread Execution)コードを直接記述していると報告されています。
#これは、C言語のような高水準言語を介さず、アセンブリ言語に近いレベルでプログラミングを行うことに相当します。
#PTXコードを直接使用する主な利点:
#- パフォーマンスの最適化: PTXコードを直接記述することで、GPUのアーキテクチャに特化した最適化が可能となり、計算効率を向上させることができます。
- ハードウェアリソースの詳細な制御: レジスタやメモリの使用、スレッドの管理など、ハードウェアリソースを細かく制御することで、特定の計算タスクに対して最適なパフォーマンスを引き出すことができます。
- レイテンシの低減: 高水準言語の抽象化によるオーバーヘッドを排除し、処理の遅延を最小限に抑えることが可能です。
しかし、PTXコードを直接記述することは、開発の複雑さや保守性の観点から挑戦的であり、専門的な知識と経験が求められます。DeepSeekは、このアプローチを採用することで、GPUの潜在能力を最大限に活用し、高性能なAIモデルの開発を実現しています。
##
DeepSeekの教師なし学習
#DeepSeekの教師なし学習は、多様な最先端技術が統合されることで実現されており、それぞれの技術が異なる側面から学習プロセスをサポートしています。以下では、主要な技術とその役割について解説します。
##
\1. 教師なし学習の基本原則
#教師なし学習では、明示的なラベルやタスク固有の目標がない状況で、モデルが自主的に環境の構造を探索し、有益な表現や潜在知識を獲得します。DeepSeekの設計は以下の2つの柱に基づいています:
#- 自己教師あり学習 (Self-Supervised Learning): データから内在的な関係を学習。
- 環境探索の促進 (Exploration Enhancement): 強化学習的手法で環境構造を発見。
これを支える具体的な技術は以下の通りです。
##
\2. DeepSeekの教師なし学習を支える主要技術
#(1) Mixture of Experts (MoE)
#- 役割:
- 入力データに基づいて活性化する複数の「エキスパート」(モデルのサブユニット)を選択的に使用。
- 各エキスパートが、データや状態空間の異なる部分に特化。
- メリット:
- 大規模モデルでも計算コストを削減。
- エキスパート間の役割分担により、データ分布やタスク空間を広く探索。
#
(2) Multi Head Latent Attention
#- 役割:
- 入力データの異なる特徴や潜在情報を並行して捕捉するアテンションメカニズム。
- 特徴:
- 各アテンションヘッドが別々の潜在構造を学習するため、特定タスクに縛られない柔軟な表現獲得が可能。
- データ間の関係や構造を発見し、環境理解を深める。
- 具体例:
- 複数の選択肢やデータサブセットの中で、特定の側面に注目し、探索行動を向上。
#
(3) Group Relative Policy Optimization (GRPO)
#- 役割:
- 相対的なポリシー評価を通じて、目標を持たない探索を指導。
- 仕組み:
- 絶対的な報酬値ではなく、特定の選択肢がグループ内で他の選択肢と比較してどれだけ「良いか」を評価。
- 明示的な目標設定が不要で、環境の広範な探索を可能に。
- 効果:
- 環境の未知の側面を発見する学習プロセスを促進。
#
(4) 自己教師あり学習 (Self-Supervised Learning)
#- 役割:
- データ内に含まれるパターンや関係性を明示的なラベルなしで学習。
- 具体例:
- Masked Token Prediction(入力データの一部を隠し、その予測を通じて構造を学習)。
- Contrastive Learning(データペアの類似度を学習し、潜在表現を獲得)。
- 効果:
- 環境やデータの特性をラベル不要で捉え、一般化能力の高い表現を形成。
#
(5) スキルの事前学習 (Skill Pre-training)
#- 役割:
- 汎用的なスキルを事前に学習し、新しい環境でこれを基礎として探索。
- 特徴:
- 小さなエージェントが環境との相互作用を通じて、初期のスキルセット(例えば移動や観察)を習得。
- 明示的タスク設定がなくても、次元削減や潜在空間の探索を促進。
#
(6) アクティブ探索 (Active Exploration)
#- 役割:
- 事前に報酬が与えられない状況でも、未知性(uncertainty)を基準に行動。
- 技術:
- Curiosity-Driven Exploration(好奇心駆動型探索):
- モデルが知らない状態や情報を発見することで報酬を得る。
- 例えば、「次に観測される状態が予測と異なるほど高報酬」とする設計。
- State Discrepancy Modeling:
- 環境の状態空間の偏りを理解し、探索戦略を最適化。
#
DeepSeek-R1-Zeroは教師なし微調整(Supervised Fine-Tuning)を用いていません
#\1. Supervised Fine-Tuning(教師あり微調整)
#概要
#- 教師あり微調整は、事前にトレーニングされた大規模言語モデル(例: GPT)のパフォーマンスを特定のタスクに適合させるために行われるプロセスです。
- 主に、大量のタスク固有データ(入力と正解ラベルのペア)を使用して、モデルをさらにトレーニングします。
特徴
#- タスク特化: 事前学習されたモデルが一般的な言語能力を持つ一方で、微調整により特定のタスク(例: 質問応答、翻訳、要約)の性能を向上させます。
- 教師データ: 入力とターゲット出力のペア(例: 問題とその正解)が必要。
- 簡単な適用: 強化学習に比べて実装が簡単で計算効率が良い。
プロセス
#- データ収集: 特定タスクに対応した高品質なデータを集めます(例: 質問応答データセット)。
- モデル微調整:
- クロスエントロピー損失を使用して、モデルがターゲットラベルを予測する確率を最大化。
- 評価:
- 微調整後のモデルのパフォーマンスをタスクに特化したメトリクス(例: F1スコア)で評価。
#
\2. Chain-of-Thought(CoT)学習データ
#概要
#- Chain-of-Thought(思考の連鎖)は、モデルが複雑な推論タスクを解く際に、中間的なステップ(理由付けの過程)を示す学習データです。
- 特に数値計算、論理問題、複数の条件が絡むタスクで効果を発揮します。
特徴
#- 説明性: モデルが中間推論を示すため、出力の理解やデバッグがしやすくなります。
- 推論力の向上: 複雑なタスクにおいて単純なエンドツーエンドの予測よりも優れたパフォーマンスを発揮します。
- プロンプト設計: Chain-of-Thoughtのフレームワークを用いることで、モデルが理由付けを段階的に行うよう誘導可能。
CoTの学習データ例
#以下は、「3つのリンゴを5人で分けると、1人あたり何個か?」という質問をモデルに与える場合のデータ例です。
#- 通常の学習データ:
- makefile
- CoT学習データ:
- makefile
このように中間的な推論プロセスを明示することで、モデルがより論理的に回答するようになる。
##
\3. 両者の関係と使用法
#- Supervised Fine-Tuning + CoTデータ:
- CoT形式のデータを使用して教師あり微調整を行うと、推論力の向上を期待できます。
- CoTデータは、特に複雑な問題やクリティカルなタスク(例: 医療や法律など)に適しており、説明可能性の向上も見込めます。
プロセス
#- CoTデータ収集:
- 専門家アノテータやスクリプトを使用して、CoT形式のラベル付けを行う。
- モデル微調整:
- CoTデータを用いてモデルをトレーニング(クロスエントロピー損失を使用)。
- 評価:
- モデルの推論力と説明力を測定(例: 正答率、理由付けの一貫性)。
#
\4. 両者を適用すべき場面
#- Supervised Fine-Tuning:
- シンプルなタスク(例: 特定フォーマットのデータ変換、分類など)に適している。
- CoT学習データ:
- 複雑な推論が必要なタスク(例: 数学、論理、条件処理)や、モデルに説明能力を求める場面に使用。
Deep SeekR1はDeep Seek-R1-ZeroにCot学習データを用いたSFTを2回して、最後に仕上げの強化学習を掛けたものです
##
Deep Seekが開発したこれらのモデルは8億円程度で出来たなどと噂されていますが、実際はNvidiaのGPU、NVIDIA H100を5万台ほど持っていて、それで2500億円ほどは掛っているという噂もあったりするので、そこまでコストが下がってはいないだろう
#そこまで下がっていないだけで、かなりの効率化には成功していて、コストも下がって、安価に生成AIが作れるようになったのだとは思う
#だからといって、GPUや生成AIのインフラ設備が過剰になったという訳ではないだろう
#今回のブレークスルーが生成AIの発展をますます推し進めはするだろうが、それでNVIDIAのGPUやデータセンターや電力などのインフラが必要なくなるわけではない
#むしろ、生成AIをより賢くするのにも、GPUなどの計算資源はますます必要となるし、世界中の人達が使うようになっていく事で、ますます資源が必要になって来るだろうと思う
##
何でも、そうだがただ金を使えばいいという訳でもないのだ
#ちゃんと見極めた上で勝てる戦いをしないといけない
#今回のDeep Seekのように、他の潤沢な資金を持つ生成AI開発企業とは違うアプローチでブレークスルーを起こすことも出来るのである
#いいプロダクトを作る事、その中身がどれだけ革新的か 細かいところを詰めていけば、全く違うやり方で勝てるかも知れないのである
#若い天才たちが引き寄せ合い、集まれば、そういった不可能を可能にする奇跡がよく起こるものだ
#シリコンバレーから産まれたpaypalがそうであったように、結局若者が革新的な事を思いつき世界を変えてしまうのである
#札束でなぐり合うゲームではあるが、その費用を少なくし、勝負をする事も出来るのである
#Deep Seekはそういう事を私に教えてくれた
##
Deep Seekはオープンソースだが、どういったデータを学習させたのか具体的には公開されていない
#トレーニングやデータ処理に使ったコードも公開されていないのだ
#その為に、それを模倣する事も難しいだろうと考えられる
#ソースコードは公開されていないのである
#openAIやtesla、googleなどは、MoEやMulti Head Latent Attention、自己教師あり学習なども利用して、潤沢な計算資源でより高性能で使い勝手のいい生成AIを開発していく事であろうと思う
#と同時に、小規模でも工夫次第で安価な割りには驚きの性能を示すモデルを開発する企業も出て来るだろうと思う
##
私はLLMどころか、機械学習も強化学習も深層学習も何もかも技術について理解出来ていない
#ちゃんと基本から勉強した方がいいなと思う それは、数年前からずっと言ってるけど、調べたり動画観て軽く勉強して終るだけなので、その程度の知識しか持っていないのであった
#記事はchatgptの出力多め 画像はnovelai
#