近期,中國月之暗面發布的 Kimi K3 模型表現卓越,但同時面臨來自美國方面的指控,稱其性能主要依賴於「#蒸餾」技術。究竟什麼是蒸餾?這是否等同於抄襲?本文將為您拆解這項 AI 領域的核心技術。
一、 什麼是「#知識蒸餾」?
知識蒸餾(Knowledge Distillation)的本質,是將一個大型、複雜且性能優異的「教師模型」所學到的知識,系統性地轉移給一個更小、更高效的「學生模型」。其核心目的是在不顯著犧牲性能的前提下,降低模型的計算成本與運行時間,使其更易於在資源受限的環境中部署。
二、 蒸餾技術的兩種主要形式
1. 白盒蒸餾:可以訪問教師模型的內部結構(例如隱藏層的特徵表示),從而傳遞更為細緻的知識。
2. 黑盒蒸餾:無法看到內部結構,僅能利用教師模型的最終輸出結果(如概率分佈或推理步驟)來進行模仿學習。這也是目前 Kimi K3 爭議的焦點所在。
三、 蒸餾是 Kimi 獨有的技術嗎?
並非如此。蒸餾是 AI 業界廣泛使用的通用公共技術,幾乎所有主流大模型都在不同程度上應用了此技術:
– Meta 的 Llama 系列明確將模型蒸餾作為核心能力之一,並鼓勵開發者使用。
– 阿里雲的 Qwen 模型系列在發展過程中,也體現了對更大模型能力的繼承與優化。
四、 爭議的核心究竟是什麼?
既然業界普遍使用,為何 Kimi K3 會引發強烈質疑?問題的關鍵不在於「是否使用蒸餾」,而在於「如何使用」以及「數據來源是否合法」。
目前的爭議焦點在於:開發過程是否違反了其他商業模型(如 #Claude)的用戶協議,以及是否存在大規模、有組織地抓取競爭對手數據來加速自身模型開發的行為。