21/07/2026 11:59
《魚缸博客》KIMI K3有人話係「蒸餾」Claude?博客同你解釋咩理由!
《魚缸博客》呢個禮拜AI又爆炸了,講緊就係「月之暗面」旗下新一代模型Kimi K3近日發布引發關注,美媒報道稱「打破『美國領先中國』的固有認知」,係咪真係吹大?睇你自己點解讀。
不過網絡上有個說法,就係話KIMI最新大模型K3,係透過Claude去「蒸餾」出來的。所謂「蒸餾」,簡單用人話講,就係抄功課,皆因有用家走去試用KIMI K3模型,但個AI聲稱自己唔係「KIMI」而係「Claude」,所以就出咗呢個說法。
博客唔係咩AI專家,但因為要研究科技行業同科技股,所以都略懂一二。要分開幾點講,首先,Claude(據公開資訊推測)是密集(Dense)架構,即每次推理啟動全部參數;Kimi K3 是稀疏混合專家(MoE)架構,參數總量2.8T,但每次只啟動16/896個專家。前者係每一條問題先全部跑一次AI再解答,後者就先分析問題,再搵適當嘅專家解讀,好處就係:節省好多TOKEN。
至於係咪「蒸餾」,其實博客覺得屬於「資料污染」或「SFT(監督微調)資料外洩」。皆因訓練大模型時,業界普遍會用高難度模型(如Claude或GPT-4)產生的合成資料來微調(SFT)自己的模型,以提升「風格」和「指令遵循」能力。但如果清洗流程不嚴謹,或者合成資料包含了「我是由Anthropic創建的Claude」這類對話模板,模型在RLHF或SFT階段就會強行記憶住這個身分。
所以某程度係屬於是數據層面的「數據蒸餾」(Data Distillation)--K3一定大量使用了包括Claude、GPT 在內的頂級模型生成的合成數據進行微調和偏好對齊(呢個係目前業內公開「潛規則」),而非模型蒸餾(Model Distillation)。
由此可見,Kimi K3厲害之處,在於佢係自研MoE骨架,餵咗海量原生互聯網數據,並輔以高手合成數據做「調味」。如果單單將佢功歸咎於「蒸餾」,係技術上確實低估了MoE預訓練的工程難度;但你話佢完全無借鑒Claude的數據風格,其實都不符合AI圈嘅現實。
用比喻去講,KIMI K3更似一個天賦異禀(架構好)且博覽群書(預訓練廣),而且搵名師(Claude/GPT)輔導過作文(SFT)的超級學霸,而唔係一個抄襲學霸作業嘅學渣。呢個就係點解KIMI K3係業內「爆炸」嘅原因啦!
《編者按》本欄搜羅即市傳聞,惟消息未經證實,《經濟通》亦不保證內容之準確性。
不過網絡上有個說法,就係話KIMI最新大模型K3,係透過Claude去「蒸餾」出來的。所謂「蒸餾」,簡單用人話講,就係抄功課,皆因有用家走去試用KIMI K3模型,但個AI聲稱自己唔係「KIMI」而係「Claude」,所以就出咗呢個說法。
博客唔係咩AI專家,但因為要研究科技行業同科技股,所以都略懂一二。要分開幾點講,首先,Claude(據公開資訊推測)是密集(Dense)架構,即每次推理啟動全部參數;Kimi K3 是稀疏混合專家(MoE)架構,參數總量2.8T,但每次只啟動16/896個專家。前者係每一條問題先全部跑一次AI再解答,後者就先分析問題,再搵適當嘅專家解讀,好處就係:節省好多TOKEN。
至於係咪「蒸餾」,其實博客覺得屬於「資料污染」或「SFT(監督微調)資料外洩」。皆因訓練大模型時,業界普遍會用高難度模型(如Claude或GPT-4)產生的合成資料來微調(SFT)自己的模型,以提升「風格」和「指令遵循」能力。但如果清洗流程不嚴謹,或者合成資料包含了「我是由Anthropic創建的Claude」這類對話模板,模型在RLHF或SFT階段就會強行記憶住這個身分。
所以某程度係屬於是數據層面的「數據蒸餾」(Data Distillation)--K3一定大量使用了包括Claude、GPT 在內的頂級模型生成的合成數據進行微調和偏好對齊(呢個係目前業內公開「潛規則」),而非模型蒸餾(Model Distillation)。
由此可見,Kimi K3厲害之處,在於佢係自研MoE骨架,餵咗海量原生互聯網數據,並輔以高手合成數據做「調味」。如果單單將佢功歸咎於「蒸餾」,係技術上確實低估了MoE預訓練的工程難度;但你話佢完全無借鑒Claude的數據風格,其實都不符合AI圈嘅現實。
用比喻去講,KIMI K3更似一個天賦異禀(架構好)且博覽群書(預訓練廣),而且搵名師(Claude/GPT)輔導過作文(SFT)的超級學霸,而唔係一個抄襲學霸作業嘅學渣。呢個就係點解KIMI K3係業內「爆炸」嘅原因啦!
《編者按》本欄搜羅即市傳聞,惟消息未經證實,《經濟通》亦不保證內容之準確性。














