DeepSeek,全稱杭州深度求索人工智能基礎技術研究有限公司,由幻方量化的聯合創始人梁文峰創立。
1.DeepSeek 沖擊波引發全球科技市場的連鎖反應
DeepSeek作為中國AI領域的突破性成果,憑借其低成本、高性能的技術路線和開源策略,引發了全球科技市場的深刻變革。其技術普惠化和開源模式不僅推動了AI技術的廣泛應用,還對全球科技產業鏈、資本市場和國際競爭格局產生了深遠影響。
根據數據分析平臺QuestMobile最新數據顯示,從上線以來至2月9日,DeepSeekAPP的累計下載量已超1.1億次,周活躍用戶規模最高近9700萬。其中,1月20日至1月26日,DeepSeek
APP周下載量達到226萬次。次周,下載量則直接飆升至6300萬次,環比增長超2700%。在用戶體驗方面,DeepSeek表現不俗。用戶普遍認為DeepSeekR1的性能出色,特別是在數學推理、編程能力和自然語言理解等領域。其推理速度和準確度在多個測試場景中達到業界領先水平。此外,DeepSeekR1的“聰明”特性使得用戶無需復雜的提示詞技巧,即可獲得高質量的回答。在實際使用場景中,無論是游戲、視頻播放還是日常工作的輔助,其流暢的操作體驗都得到了用戶的高度評價。用戶反饋顯示,DeepSeek界面簡潔直觀、操作簡單,在實時數據推送和內容推薦上十分出色能夠有效提升工作效率,減少用戶在信息檢索上的時間投入。
DeepSeekR1的發布引起了硅谷科技領袖、國際媒體及學術界的廣泛關注。其性能和開源策略獲得了高度評價,被認為是“非美國公司踐行 OpenAI初心”的典范。DeepSeekR1的發布引發了全球科技市場的連鎖反應。其開源策略、低成本、高性能的特性,對科技巨頭形成了壓力。其訓練成本僅為 600萬美元,遠低于 OpenAI和谷歌等公司的同類模型,《MIT Technology Review》提到,DeepSeek開發了一種名為“Group Relative Policy Optimization(GRPO)”的新算法,通過創新的訓練方法大幅降低了模型的訓練成本,還指出,DeepSeek在硬件優化方面也取得了突破,并強調了DeepSeek通過免費開放模型的方式,推動了AI技術的普及和應用。
DeepSeek的崛起促使全球投資重心從硬件密集型企業轉向算法優化和應用開發領域。盡管DeepSeek降低了單個模型的算力需求,但其技術普惠化反而刺激了應用場景的擴展,導致算力總需求暴增(“杰文斯悖論”再次生效),而其技術路徑的轉變降低了對高端GPU的依賴,為國產芯片提供了新的發展機遇,其軟硬件協同優化(如盡可能繞過英偉達提供的CUDA軟件,直接使用匯編語言PTX與硬件對話),為國產芯片和系統閉環提供了技術驗證,推動國內從“模型-芯片-系統”全鏈條自主化。
2.DeepSeek公司成立背景與發展歷程
DeepSeek,全稱杭州深度求索人工智能基礎技術研究有限公司,由幻方量化的聯合創始人梁文峰創立。公司自2023年7月年成立以來,始終專注于大語言模型(LLM)及其相關技術的深度研發。公司堅持技術創新路線,開創性地提出多頭潛在注意力機制(MLA)和DeepSeekMoE等創新架構。憑借這些創新成果,DeepSeek的大模型在多項權威測評中展現出頂尖的性能表現。DeepSeek的成立標志著幻方量化從量化投資領域向通用人工智能(AGI)領域的拓展。幻方量化為DeepSeek提供了強大的硬件支持,使得DeepSeek在技術研發上具備了堅實的基礎。
DeepSeek自成立以來,迅速在大語言模型(LLM)及相關技術研發方面取得了顯著進展。以下是其主要發展歷程:
2023年11月2日:發布首個開源代碼大模型DeepSeekCoder,支持多種編程語言的代碼生成、調試和數據分析任務。
2023年11月29日:推出DeepSeekLLM,參數規模達670億,涵蓋對話和文本生成等自然語言任務。
2024年1月5日:發布DeepSeekLLM,包含670億參數,從零開始在2萬億token的數據集上進行訓練。
2024年2月5日:推出DeepSeekMath,專注于數學相關任務。
2024年3月11日:發布DeepSeek-VL,一個開源視覺-語言模型。
2024年5月7日:發布DeepSeek-V2,采用Mixture-of-Experts(MoE)架構,顯著提升性能。
2024年6月17日:推出DeepSeek-Coder-V2,提升編碼和數學推理能力。
2024年9月5日:合并DeepSeekCoderV2和DeepSeekV2Chat,升級推出 DeepSeekV2.5.
2024年12月13日:發布DeepSeek-VL2,改進視覺語言型的多模態理解能力。
2024年12月26日:上線DeepSeek-V3首個版本并同步開源。
2025年1月20日:發布DeepSeek-R1,采用強化學習技術提升模型推理能力。

3.DeepSeek開源戰略
DeepSeek的開源戰略是其技術發展和市場推廣的核心策略之一。公司堅持“非商業化優先”的開源路線,通過技術共享推動AI普惠。這一戰略不僅體現了 DeepSeek的技術理想主義,也展示了其對全球AI技術發展的貢獻。
DeepSeek的開源策略對閉源巨頭如OpenAI等形成了競爭壓力。DeepSeek的開源戰略不僅推動了AI技術的普及和創新,還對全球AI產業格局產生了深遠影響。通過開源,DeepSeek的技術得以在全球范圍內廣泛傳播和持續改進,形成了一個龐大且活躍的開發者社區。這種開源模式極大地促進了知識共享和技術創新,加速了人工智能技術的普及與應用。未來,DeepSeek將繼續在模型架構、訓練效率、無限上下文長度等方面進行研究,力求在通往AGI(通用人工智能)的道路上不斷前進。
4.DeepSeek技術創新的核心要點
DeepSeekV3大模型的基礎架構仍在Transformer的框架中,但是DeepSeek對每個TransformerBlock的注意力機制(Attention)和前饋神經網絡(Feed-ForwardNetwork)都采用了創新的架構設計。對于注意力機制,DeepSeek設計了多頭潛在注意力(MultiHeadLatentAttention(MLA)),通過將鍵值(Key-Value(KV))緩存顯著壓縮為一個潛在向量來確保高效推理。對于前饋神經網絡,DeepSeekMoE通過稀疏計算的方式實現了以經濟的成本進行強大模型的訓練。

DeepSeek-R1-Zero是第一個無需監督微調,僅通過純強化學習訓練(RL)就獲得強大推理能力的開源模型。DeepSeek-R1在DeepSeek-R1-Zero的基礎上使用了多階段訓練管道,包括冷啟動數據和多次強化學習訓練迭代,實現了更好的推理性能和可讀性。而通過蒸餾,可以將這種推理能力遷移到更小的模型中,小型模型(如 DeepSeek-R1-Distill-Qwen-7B)能夠超越 GPT-4o 等非推理模型,而 DeepSeek-R1-Distill-Owen-32B和70B模型甚至超越了 o1-mini。通過蒸餾得到的模型在性能上通常優于直接進行強化學習訓練的小型模型。
DeepSeek-V系列模型算法優化
多頭潛在注意力(MLA)。傳統的Transformer模型通常采用多頭注意力機制(MHA),但在生成過程中,其龐大的鍵值緩存將成為限制推理效率的瓶頸。為了減少鍵值緩存,谷歌研究團隊提出了兩種共享鍵值的模型:多查詢注意力機制(MOA)和成組查詢注意力機制(GOA)。雖然這兩種模型所需的鍵值緩存較小,但是性能卻不及MHA。針對這些挑戰,DeepSeek設計了創新的注意力機制 MLA。MLA的核心是用低秩鍵值聯合壓縮來降低鍵值緩存,這些被壓縮的潛在向量可以通過投影方式還原為鍵值,從而在不犧牲模型質量的前提下保證高效的推理吞吐最。
MLA是一種改進的注意力機制,DeepSeek-V2率先采用了MLA技術,之后的DeepSeek-V3也延續使用該技術。該技術使用壓縮的潛在向量來表示查詢,與標準的多頭注意力(MHA)相比,MLA在保持或提高性能的同時,大大降低了KV緩存的需求,從而提高了推理效率。根據DeepSeek-V2技術報告,MLA在小型MoE模型上減少了86%的KV緩存,在大型MoE模型上減少了96%的 KV 緩存。
DeepSeekMoE架構:DeepSeekMoE是一種創新的大規模語言模型架構,其核心在于專家混合系統,該系統通過稀疏化專家分配策略,顯著降低了計算量。通過整合專家混合系統(MixtureofExperts,MoE)、改進的注意力機制和優化的歸一化策略,在模型效率與計算能力之間實現了新的平衡。該架構通過更細粒度的專家劃分和隔離共享專家來減少知識冗余,從而提升模型性能。DeepSeekMoE 架構從DeepSeek-V2開始得到應用。采用該架構的模型,在相同激活參數和總參數條件下,性能優于傳統的 MoE架構模型。根據DeepSeekMoE論文結果,與經典 MoE模型 GShard 相比,僅需不到后者28.5%的計算量。
DeepSeekMoE有兩個關鍵理念:一是將專家進行更細粒度的劃分,以實現更高程度的專家專業化以及更精準的知識獲取;二是隔離部分共享專家,來減輕被路由專家之間的知識冗余。與諸如GShard 這類傳統的混合專家(MoE)架構相比,DeepSeekMoE架構能夠以經濟的成本訓練出強
大的模型。當采用專家并行時,被路由的專家將分布在多個設備上。每個token與MoE相關的通信頻率與目標專家所覆蓋的設備數量成正比。由于DeepSeekMoE采用了更細粒度的專家劃分,激活的專家可能會很多,所以專家并行會使MoE相關的通信成本更高。對此,DeepSeekMoE首先確保每個token的目標專家最多分布在M個專家親和度得分最高的設備上,之后對這些設備進行 Top-K選擇。DeepSeekMoE引入專家和設備級別的平衡損失,有效降低這些風險,保障各設備間計算均衡,使模型在訓練和推理過程中更穩定、高效地運行。
多令牌預測(Multi-TokenPrediction,MTP)方法在 DeepSeek-V3 技術報告中被提出,是DeepSeek-V3模型中一項重要創新。該技術旨在提高大語言模型在解碼階段的推理效率。通過 MTP技術,DeepSeek-V3解碼速度提高了1.8倍,模型預測第二個token接受率在 85%到90%之間,與傳統方法一次只能預測一個token相比,MTP技術可以同時預測多個token。以上結果表明,模型進行序列生成時,能夠高效預測后續輸出,減少計算步驟,更快生成文本。
DeepSeek-R1模型算法優化
純強化學習(RL)驅動推理能力提升。DeepSeek-R1-Zero 基于 DeepSeek-V3模型開發,是完全通過大規模強化學習進行訓練得到的首個開源推理大模型。DeepSeek-R1-Zero在訓練過程中自然涌現出多種推理行為,如自我驗證、反思和生成長鏈式思考(CoT),證明了大語言模型的推理能力可以通過純RL過程來激勵獲得。該技術的成功嘗試為推理大模型領域未來發展奠定了基礎。結果表明,DeepSeek-R1-Zero在AIME2024測試中pass@1得分從 15.6%提高到71.0%,通過多數投票機制,該得分可進一步提高到 86.7%。
多階段訓練和冷啟動數據。為了解決 DeepSeek-R1-Zero的可讀性差和語言混合問題,并進一步提高推理性能,DeepSeek-R1引入了多階段訓練流程和少量冷啟動數據。多階段訓練流程包括兩個RL階段與兩個SFT階段。冷啟動使用小樣本提示與長COT作為示例,直接提示模型生成具有反思和驗證的詳細答案。通過以上技術訓練得到 DeepSeek-R1模型,達到了與OpenAI-01-1217相當的性能。
從大型模型到小型模型的知識蒸餾。DeepSeekAl使用DeepSeek-R1作為教師模型生成推理數據,微調多個在研究中廣泛使用的小型密集模型,大幅增強了小模型推理能力。例如對Qwen-7B模型進行微調,得到DeepSeek-R1Distill-0wen-7B模型,該模型在AIME2024上達到了55.5%的成績,超過了OwO-32B-Preview。同時,研究還表明,在DeepSeek-R1中發現的推理模式可以被提煉到小型模型中,性能比直接在小型模型上應用RL更優。
FP8低精度訓練技術是DeepSeek在訓練大模型時采用的一項關鍵創新,旨在通過降低計算精度米顯薺提升訓練效率和降低成本。FP8(FloatPoint8-bit)低精度訓練技術是一種在深度學習訓練中使用8位浮點數來表示數據和進行計算的技術,相比傳統的16位或32位浮點數,它在內存占用和計算速度上具有顯著優勢FP8通常會將這8位劃分為符號位、指數位和尾數位。通過特定的編碼方式,在有限的位數內盡可能精確地表示數值。在深度學習訓練過程中,涉及到大量的矩陣乘法、加法等運算。FP8低精度訓練技術通過專門設計的硬件和算法,能夠直接對FP8數據進行高效的計算。硬件層面上,相關的計算單元會針對FP8的特點進行優化,例如采用更緊湊的邏輯電路來實現FP8的運算,提高計算效率。算法層面上,會對一些數值計算方法進行調整,以適應FP8的精度范圍,確保在低精度下計算結果的準確性和穩定性。
通過采用FP8低精度訓練技術,DeepSeek在保持高性能的同時,大幅降低了訓練成本和資源需求,為AI模型的訓練和應用開辟了新的道路。
1)顯著降低顯存占用:通過使用FP8格式,DeepSeek大幅減少了訓練過程中的顯存需求使得大規模模型訓練更加高效。2)提升訓練迷度:低精度計算加速了訓練過程,使得模型能夠在更短時間內完成訓練。3)降低能耗:FP8訓練減少了計算資源的使用,從而降低了訓練過程中的能耗
DecpScck模型已成功適配并部署在華為異騰PU平臺上,使用騰910B芯片,結合CANN7.0.1.5和華為CloudEulerOS2.0操作系統,實現了高效的模型推理。華為云ModelArtsStudio模型即服務平臺也支持DeepSeek-R1-Distil,進一步降低了 DeepSeek的開發
和部署成本,提升了其運行效率。MindIE(MindInferenceEngine,異騰推理引擎)是華為異騰針對AI全場景業務的推理加速套件。DeepSeek首發支持國內昇騰平臺(Ascend)和MindIE推理引擎,這種軟硬件一體化的支持使得用戶能夠在不同的硬件環境中靈活高效地部署模型。DeepSeek支持多種主流框架、全面開源策略。模型支持 SGLang、LMDeploy和TensorRT-LLM等多個主流框架,開發者可以根據自身需求選擇合適的開發工具和框架。