一句話結論: 一家名為 PrismML 的 Caltech 衍生新創公司,剛將一個 270 億參數的 AI 模型從 54GB 壓縮到不到 4GB,小到可以直接跑在 iPhone 上——這項技術若能成熟,將徹底改寫 Apple 的 AI 策略,讓強大的 AI 不再需要連上雲端,直接在手機裡就能運作。
2026 年 7 月 14 日,Apple 正式開放了 iOS 27 的公開測試版,讓使用者首次大規模體驗到那套歷經多次延宕、終於重新打造的 Siri。
但就在同一天,另一則消息可能對 Apple 的長遠 AI 策略更為關鍵。
根據 CNBC 獨家報導,Apple 正在與一家名為 PrismML 的矽谷新創公司進行早期洽談——這家公司號稱能將大型 AI 模型壓縮到小到可以直接在 iPhone 上執行,而且不需要網路連線。
從 54GB 到 3.9GB:一場模型壓縮的極限挑戰
要理解這項技術有多驚人,先要知道一個 270 億參數的 AI 模型原本有多大。
以 PrismML 壓縮的 Qwen3.6 27B 模型為例,在標準的 16 位元精度下,它的權重數據總共需要約 54GB的儲存空間。就算用目前最先進的 4 位元量化,仍然需要大約 18GB。
一般來說,一個 270 億參數的模型需要至少 36GB 的 VRAM(顯示記憶體)才能順暢執行。而 iPhone 的統一記憶體(Unified Memory)最多也只有 16GB(Pro 機型)——而且系統和 App 還要分走一大半。
這就是為什麼到目前為止,所有強大的 AI 模型都必須在雲端執行:手機根本裝不下它們。
PrismML 的突破在於,他們把每個權重的儲存精度從 16 位元大幅降低到 1 位元甚至更低。具體來說,他們推出了兩個版本的壓縮模型:
- Ternary(三元)Bonsai 27B:5.9 GB,每個權重用 1.71 個有效位元,品質接近筆電等級
- 1-bit(單一位元)Bonsai 27B:3.9 GB,每個權重僅用 1.125 個有效位元,專為手機設計
CEO Babak Hassibi 將這個過程比喻為晶片產業從 8 位元走向 4 位元計算,但 PrismML 走得更遠。
速度、能耗與品質的取捨
壓縮不是沒有代價的。
PrismML 坦承,壓縮後的模型在整體表現上會損失幾個百分點。其中事實查核能力(factual recall)的下降最明顯,而推理、數學、程式碼撰寫等能力保留得比較好。
不過,在其他方面的優勢非常明顯:
- 記憶體用量減少 10 到 15 倍
- 回應速度提升 6 到 8 倍
- 能耗降低 3 到 6 倍
這意味著,原本需要 8 顆 GPU 才能運行的雲端模型,現在 1 顆就夠了;原本只能在資料中心運算的模型,現在可以放進你的口袋。
AnythingLLM 的創辦人測試後表示,Bonsai 27B 在壓縮後「保留了約 90% 的智慧能力」,卻只需要不到 10GB 的記憶體。
為什麼這對 Apple 至關重要
Apple 的 AI 策略一直面臨一個核心矛盾:最強大的 AI 模型需要太多的記憶體和運算能力,無法在 iPhone 上本地執行。
目前的解決方案是「混合架構」——簡單的任務(翻譯、摘要、照片辨識)在手機上處理,複雜的請求送到 Apple 的私有雲端或第三方模型。但這帶來了三個問題:
1. 延遲:送到雲端再回來,總是有網路延遲
2. 隱私:使用者的個人資料必須離開手機
3. 離線限制:沒網路時功能大打折
如果 PrismML 的技術能被成功整合到 iPhone 中,Apple 可以把更多功能移到裝置端執行——包括運算攝影、影片生成、以及依賴敏感個人資料的健康與健身功能。
Creative Strategies 的分析師 Carolina Milanesi 指出:「能在裝置端做的事愈多愈好,特別是健康和用藥資料,使用者絕對不希望這些離開手機。」
壓縮技術的晶片產業連鎖效應
PrismML 的發布時機非常敏感。目前整個半導體產業正在激烈辯論:AI 效率大幅提升後,是否會降低對記憶體晶片和昂貴資料中心基礎設施的需求?
摩根士丹利估計,Apple 在 2027 會計年度的平均 DRAM 單位成本可能上升約 190%,NAND 成本上升約 180%。該機構預測 Apple 可能會將 iPhone 18 的起售價提高約 200 美元來維持利潤。
但壓縮技術不一定意味著晶片需求會減少。D.A. Davidson 分析師 Gil Luria 指出:「減少模型大小不代表不需要晶片了——你只是把更多晶片從資料中心搬到手機和其他裝置上。」
歷史也告訴我們,效率突破往往會導致更多的使用,而不是更低的支出。更便宜、更快的 AI 會催生新產品,消費者也會更頻繁地使用 AI。
Bonsai 27B 的下一步
PrismML 的技術源自 CEO Babak Hassibi 在加州理工學院(Caltech)的研究團隊。Caltech 擁有相關專利,並獨家授權給 PrismML。今年 3 月,該公司完成了由 Khosla Ventures 等投資人參與的 1625 萬美元種子輪融資。
接下來,PrismML 計畫壓縮 Google 的開源 Gemma 模型,然後是更大規模的模型——包括目前通常只能在資料中心運行的前沿實驗室模型。
Hassibi 強調:「智慧必須是本地的,而且必須能快速運作。」這項技術的應用範圍遠不止手機和筆電——機器人、自動駕駛系統和其他需要在沒有雲端連線的情況下快速做出決策的產品,都將受惠。
所有 Bonsai 27B 的模型都以 Apache 2.0 開源授權釋出。這意味著任何人都可以下載、測試、甚至商用這些技術。
對 Apple 來說,如果能成功整合 PrismML 的技術,Siri 終於有可能從「被罵了好幾年的智障助理」晉升為「真正聰明的裝置端 AI」——而且這一切都在你的手機上完成,不經雲端、不犧牲隱私。
但分析師也提醒,PrismML 的成果仍需要在數百萬次查詢、數千種裝置組合和大規模壓力測試下證明其穩定性。能耗可能是最大的未知數——一個夠聰明、讓人頻繁使用的模型,即使記憶體需求降低了,仍然可能大量消耗手機電池。
無論如何,通往「手機上的強 AI」這條路,已經被打開了一個全新的方向。
常見問題 (FAQ)
Q: Bonsai 27B 是什麼?A: Bonsai 27B 是 PrismML 基於阿里巴巴開源模型 Qwen3.6 27B 壓縮後推出的 AI 模型。它包含 270 億個參數,但被壓縮到 3.9GB 大小,可以直接在 iPhone 上執行。
Q: PrismML 是怎麼做到的?A: 核心技術是極端的權重量化——把每個參數從標準的 16 位元精度降低到 1 位元甚至更少。這極大減少了儲存和運算所需的記憶體。
Q: Apple 真的會用 PrismML 的技術嗎?A: CNBC 報導指出雙方正在早期洽談階段,Apple 正在評估 PrismML 模型的速度、能耗和效能。目前還不確定是否會正式合作。
Q: 壓縮後的模型表現會不會變差?A: 會有一些損失,特別是在事實查核能力上。但根據測試,推理、數學和編碼能力保留得很好,整體智慧表現約保留 90%。
Q: 這對我的 iPhone 有什麼好處?A: 如果 Apple 成功整合這項技術,你的 iPhone 可以在本地執行更強大的 AI 功能,無需網路連線,回應更快,隱私更安全。
Q: 什麼時候能用上 Bonsai 27B?A: Bonsai 27B 已經在 PrismML 的 GitHub 上以 Apache 2.0 開源釋出,開發者和技術使用者現在就能下載測試。
Q: 這會讓資料中心的晶片需求減少嗎?A: 不一定。效率提升往往會導致更多使用,且更多晶片可能從資料中心轉移到手機等裝置端。總體晶片需求可能不會減少。
Q: PrismML 接下來要做什麼?A: 他們計劃壓縮 Google 的 Gemma 模型,然後是更大規模的前沿 AI 模型,最終目標是讓所有 AI 都能在本地裝置上執行。
標籤: PrismML, Apple, AI壓縮, iPhone, Bonsai27B, 模型量化, 邊緣AI, Qwen, iOS27, Siri
留言
張貼留言