開源AI社群這兩天幾乎被同一則消息洗版。DeepReinforce團隊正式發布的Ornith-1.5系列模型,在SWE-bench與極限推理評測中的數字,直接撞進頂級商業閉源模型的地盤——不僅硬撼Claude 3.5 Sonnet,部分項目甚至壓過Opus 4.8。更讓人坐不住的是,他們把9B參數的版本做了4-bit量化壓縮,宣稱iPhone 17與Android旗艦機就能離線流暢運行。
這件事之所以引起震盪,不是因為又有一個開源模型宣稱「逼近」閉源巨頭——這種話我們聽多了——而是因為Ornith-1.5不是單點突破,它同時端出了從397B雲端怪獸到手機端輕量版本的完整產品矩陣,而且全線採用Apache 2.0商業友善授權。換句話說,開源社群第一次有了「你要旗艦我給旗艦,你要輕量我給輕量」的全面選擇權。
自我改進循環:讓模型自己出題考自己
Ornith-1.5這次最關鍵的技術亮點,不在參數數量,而在訓練架構中導入的「自我改進循環(Self-Improvement Loop)」機制。過去開源模型最大的痛點之一,就是高品質訓練資料的取得成本愈來愈高,人工標註跟不上模型規模的膨脹,合成資料又有品質不穩定的風險。
這套機制的做法,白話來說就是讓模型在學習過程中主動探索自己的能力邊界,然後自己設計難度更高、邏輯更複雜的推理題目來挑戰自己,再透過強化學習的反饋機制持續修正。這不是什麼科幻情節,而是讓AI在不需要無止境餵入人工數據的前提下,自主突破邏輯推理的瓶頸。
說真的,這種「自己當教練也當球員」的訓練思維,如果真如DeepReinforce宣稱的那樣有效,那開源模型長期以來被詬病的「推理深度不足」問題,或許真的找到了結構性的解法。
三個版本,三種算力場景的精準打擊
Ornith-1.5系列這次一口氣推出三種參數規模,擺明不是來試水溫的。
旗艦版Ornith-1.5-397B採用MoE混合專家架構,總參數3,970億,推論時只動態啟動特定專家網路來壓低算力消耗。DeepReinforce公布的測試數據顯示,它在複雜程式碼生成與深度推理項目上,不只追上Claude Opus 4.8,部分關鍵項目甚至超車。如果第三方實測能複製這個結果,那閉源模型在頂級性能上的護城河,恐怕真的被填平了一大段。
中階的Ornith-1.5-35B-A3B同樣是MoE架構,總參數350億。DeepReinforce宣稱它在推論速度與吞吐量上全面壓過同級稠密模型,包括Google的Gemma-4-31B。對企業私有化部署來說,這等於在算力成本與模型表現之間,多了一個非常有說服力的選項。
輕量版Ornith-1.5-9B則是90億參數的稠密模型,有趣的是,官方數據顯示它在多數標準評測中不只超越同尺寸模型,甚至跨級打敗了310億參數的Gemma-4-31B。這種參數利用效率,已經不是「優化」兩個字可以解釋,比較像是架構設計上真的做出了差異。
9B-Mobile:端側AI從選項變成標配
如果說前面幾個版本是為了企業和開發者準備的,那9B-Mobile量化版本,就是DeepReinforce對一般使用者丟出的震撼彈。
透過4-bit權重壓縮、端側NPU記憶體優化與頻寬加速技術,他們宣稱這個版本能在iPhone 17與主流Android旗艦機上離線順跑——不用連網、不用付API費用、不用把任何對話記錄上傳到雲端。對那些因為資料敏感而不敢用雲端AI的企業和個人來說,這條路一旦真的走得通,資安疑慮就少了一大半。
當然,我們得先保留一點質疑的空間。「宣稱」能跑和「實際使用體驗順暢」之間,往往存在不小的落差,尤其端側裝置的散熱、續航和NPU算力調度,都會影響真實表現。但方向是對的:頂尖AI不該只能藏在雲端資料中心裡,它應該要能放進口袋。
編輯觀點:Ornith-1.5的出現,與其說是一場技術輾壓,不如說它精準地打在兩個痛點上。第一,它用自我改進循環迴避了開源模型長期依賴昂貴人工標註數據的困境,這在成本結構上是根本性的改變。第二,它把端側部署從「實驗室展示」變成「產品矩陣的一環」,這對台灣大量的硬體製造與邊緣運算廠商來說,是明確的訊號:開源模型的落地門檻正在急速降低。接下來幾個月,真正該觀察的不是它能不能在榜單上贏過Claude,而是有多少開發者真的願意把專案遷移過來——生態系的移動,才是這場仗的真正戰場。
開源與閉源的下一回合
DeepReinforce這次的發布,某種程度上也是在回應一個長期存在的質疑:開源模型就算再強,部署和維運成本還是讓一般團隊望而卻步。他們用從397B到9B-Mobile的完整矩陣,試圖回答這個問題——你要頂級的,我有;你要省錢的,我也有;你要放進手機離線用的,我還是給你。
有趣的是,原文同時提到了OpenAI與Anthropic密會遊說限制中國開源模型的動態,以及黃仁勳、馬斯克力挺開放生態的路線之爭。這說明了Ornith-1.5的發布從來不只是技術新聞,它踩進了AI產業最敏感的權力結構——誰能掌握模型、誰能部署模型、誰能從模型中獲利。
開源陣營用Ornith-1.5證明了技術上的可行性,但真正的考驗在於:當頂級開源模型真的追上來之後,商業閉源公司會怎麼回應?是加快研發速度拉開差距,還是用專利、授權或政策手段築起新的高牆?
這個問題沒有標準答案,但有一件事可以確定:過去「開源模型就是比較弱」的刻板印象,已經被Ornith-1.5踢進歷史課本裡了。
接下來,就看第三方開發者願不願意用實際的行動——下載、測試、貢獻、部署——來證明這場開源勝利不是又一次的媒體煙火。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。
常見問題 FAQ
Ornith-1.5真的能在iPhone 17上離線運行嗎?
根據DeepReinforce公布的消息,Ornith-1.5-9B-Mobile量化版本確實可以在iPhone 17與主流Android旗艦機上離線運行,不需連接網路。實際流暢度仍需等實機測試驗證。
Ornith-1.5是免費的嗎?可以用在商業專案嗎?
是的,Ornith-1.5全系列採用Apache 2.0授權,屬於商業友善的開源授權,企業可以免費使用於商業專案,無需支付授權費用。
Ornith-1.5跟ChatGPT或Claude哪個比較強?
DeepReinforce公布的測試數據顯示,Ornith-1.5-397B在部分項目超越Claude Opus 4.8,整體表現與頂級商業模型處於同一梯隊,建議關注第三方獨立評測結果更具參考價值。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。