作者:阿中哥 + AI 協助彙整。 【本文約有3,772字】

一台 Mac,開始有資格成為公司的 AI 伺服器了:從 Splash 看中小企業地端 AI 的下一步

這幾年如果你問企業資訊部門:「要在公司內部跑一套 AI,需要什麼?」

多數技術主管腦中第一個浮現的,大概都是 NVIDIA GPU。

RTX 4090、5090,甚至 RTX PRO、A 系列專業卡,再往上就是昂貴的企業級 GPU Server。接著還有 Linux、CUDA、Docker、Driver、vLLM、模型量化、API Server,以及一大堆部署與維護問題。

但最近 Inco AI 發表的 Splash,讓我開始重新思考一件事情:

中小企業的 AI Server,真的一定要長得像一台 GPU Server 嗎?

Splash 是一套專門針對 Apple Silicon 打造的開源 inference engine。它最有意思的地方,不只是「又多了一套推論引擎」,而是它走了一條和 Ollama、llama.cpp、MLX 等通用型方案不太一樣的路。

一般推論引擎追求的是:

一套引擎,盡量支援愈多模型愈好。

Splash 卻反過來:

我不追求什麼模型都跑,而是針對特定模型,把整個推論引擎做到極致。

每個支援模型都有專屬的 fused Metal kernels、DFlash 2 draft model,以及針對該模型與硬體計算出來的記憶體配置。Runtime、Scheduler 與 API 可以共用,但真正執行模型的核心部分則高度專用化。

這個思維,我認為非常值得企業 IT 人員注意。

從「什麼都能跑」變成「把一件事情跑到最好」

企業正式上線的系統,和工程師實驗模型,其實是兩回事。

研發階段我們當然希望今天跑 Qwen、明天試 Gemma、後天再換另一個模型。

但真正進入 Production 之後,企業通常不希望每天換模型。

假設公司已經決定:

Qwen3.8-27B 就是我們內部 AI Agent 的主要模型。

接下來真正重要的問題就變成:

它能不能更快?

能不能穩定服務多個員工?

Context 能不能做大?

重複文件能不能快速 Cache?

部署能不能簡單?

維護成本能不能降低?

這恰好就是 Splash 的設計方向。

Inco AI 官方使用 M5 Pro、16-core GPU、48GB Unified Memory 測試 Qwen3.8-27B,短 Prompt Decode 可以達到 74 tok/s;32K Prompt Prefill 約 363 tok/s;32K Context 在 Cache 命中之後,Time to First Token 可以降低到 282ms

真正讓我注意的反而是另外一個數字:

4 個 concurrent short prompts,Aggregate Decode 達到 170 tok/s。

官方測試中,這個成績大約是其比較的次快引擎 3.9 倍。

為什麼我特別注意這個?

因為企業根本不在乎老闆一個人聊天可以跑 80 tok/s 還是 100 tok/s。

企業真正關心的是:

四個員工一起用的時候,還能不能工作?

這才是 Production。

48GB Mac,開始出現「小型 AI Server」的味道

Splash 官方最低要求是 Apple M3 以上、macOS 26.4 以上,以及至少 36GB Unified Memory,但官方直接建議使用 48GB 以上

這裡我要特別提醒一件事。

能跑,跟適合生產,是兩回事。

36GB 可以啟動,不代表我會建議公司採購 36GB 當 Production Server。

Qwen3.8-27B-Splash 整個 Package 約 17.4GB,其中 Target Model 約 14.1GiB,而且本身已經是 4-bit;另外還有約 1.2GiB 的 DFlash 2 draft model,以及 vision encoder。

剩餘記憶體還必須留給 macOS、KV Cache、Context、多個 concurrent requests,以及其他服務。

因此,如果今天真的要我幫一家中小企業規劃,我會把:

48GB 視為真正的入門生產規格。

如果準備讓 2~4 位員工長期共同使用,我反而會往 64GB,甚至 128GB 評估。

原因不只是模型塞不塞得進去。

官方文件明確指出,更多記憶體代表可以容納更大的 Context,以及更多 concurrent requests;36GB Mac 能處理的 Context 與並發數會低於 48GB。

這才是企業買大記憶體真正的價值。

它不是只能聊天,Coding 才是我更看好的地方

Splash 可以提供 OpenAI Chat Completions、OpenAI Responses,以及 Anthropic Messages API,並支援 Streaming、Tool Calling、JSON Schema、圖片輸入與 inline PDF。

它甚至直接整合 OpenCode、Claude Code、Codex 與 Hermes。

所以我不會把它定位成:

「公司自己架一個 ChatGPT。」

這樣太浪費了。

我會把它定位成:

公司的 Local AI Runtime。

例如四位工程師的 Coding Agent,可以共同呼叫這台 Mac。

內部 RAG 系統可以呼叫它。

文件摘要系統可以呼叫它。

客服知識庫可以呼叫它。

自動化 Agent 也可以呼叫它。

員工甚至不需要知道後面到底跑的是什麼。

前端可以是一套 WebUI,也可以直接整合公司既有 ERP、CRM、內部網站或自動化 Workflow。

員工只需要打開瀏覽器工作。

那可以拿 Splash 生圖片、做短影片嗎?

目前答案是:

不是它的工作。

Splash 可以接受圖片輸入,代表模型可以「看圖片、理解圖片」,但這和 Stable Diffusion、Flux、Qwen-Image 那種「生成圖片」完全不同。

短影片生成也一樣。

Splash 目前不是影片生成引擎。

但站在企業系統架構的角度,我反而不認為這是缺點。

因為我們本來就不應該要求一個 Runtime 把所有事情全部做完。

更合理的架構應該是:

Splash + Qwen 負責大腦

理解需求、Reasoning、Coding、規劃工作、產生 Prompt

透過 Tool Calling

呼叫生圖 Server、影片 Server、資料庫、搜尋引擎、ERP、CRM 或其他 API

這才是真正的 Agent Architecture。

記憶體變大,要不要從 Q4 升到 Q8?

這也是企業採購很容易產生的迷思。

「既然我買了 128GB Mac,那是不是應該跑 Q8?」

理論上,大記憶體當然提供跑更高精度模型的條件。

但目前官方 Qwen3.8-27B-Splash Package 本身就是固定的 4-bit Target Model,不是使用者想切 Q4、Q8、BF16 就自己切換。官方也明確表示這個 Package 並不是一般 Transformers 或 MLX checkpoint,而是 Splash 專用格式。

而且 Q8 不代表效率一定更高。

Q8 最大的意義主要是降低量化造成的模型品質損失,但模型權重變大之後,需要搬動的資料也更多。

對 Unified Memory 架構來說,Memory Bandwidth 非常重要。

因此:

Q4 通常追求的是速度、記憶體效率與併發能力。

Q8 或 BF16 追求的則比較偏向模型品質。

這兩件事情不能混為一談。

Splash 現在倒是允許把 KV Cache 從預設 INT8 改成 BF16,但官方特別提醒,這會使用大約兩倍 Target KV Memory,而且在 Long Context 下可能更慢;模型權重本身也不會因此從 Q4 變成 BF16。

所以站在 Production 的角度,我不會因為機器有 128GB,就盲目追求 Q8。

我會先問:

這家公司到底需要更高精度,還是需要四個員工同時工作?

答案不同,硬體配置就完全不同。

Splash 真正改變的是中小企業導入 Local AI 的門檻

我認為 Splash 現階段最大的問題也非常明顯:

支援模型還太少。

目前官方主要提供 Qwen3.8-27B-Splash 與 Qwen3.6-35B-A3B-Splash。

如果企業需要經常更換模型,那 Ollama、MLX、llama.cpp 等通用型生態仍然更有彈性。

但如果今天是一家公司準備正式部署:

模型已經選定。

工作流程已經固定。

每天都會大量使用。

這時候 Splash「針對模型打造引擎」的缺點,反而可能變成優點。

因為 Production 最終追求的從來不是「可以玩多少模型」。

而是:

穩不穩、快不快、多少人可以一起用,以及 IT 部門到底要花多少時間維護。

這也是我認為 Splash 最值得關注的地方。

過去講到企業地端 AI,大家想到的是機房、Linux Server、GPU、CUDA,以及昂貴的專業顯示卡。

但是現在另一條路正在逐漸成形:

一台大記憶體 Apple Silicon Mac,放在辦公室角落,接上網路,24 小時開著。

兩個、三個、四個員工透過瀏覽器或 API 使用。

員工根本不用知道模型放在哪裡。

公司的文件、程式碼與內部資料也不必為了每一次推論全部送到外部模型供應商。

對我來說,這才是 Splash 真正值得觀察的地方。

它不只是讓 Qwen3.8-27B 從十幾個 tok/s 跑到五十、七十個 tok/s。

真正重要的是:

Mac 正在從「工程師桌上的 AI 實驗機」,逐漸變成一台可以認真討論 Production 的小型 AI Server。

而一旦 Local AI 的部署複雜度真的降低到:

安裝軟體、下載模型、啟動 API,然後全公司開始使用——

那麼下一波 Local AI 的競爭,可能就不再只是:

「誰的模型比較強?」

而會變成:

「誰能把 AI 做成一台企業買回去,開機就能開始生產的設備?」

這件事情,我認為才剛剛開始。

投影片補充 00

投影片補充 01

投影片補充 02

投影片補充 03

投影片補充 04

投影片補充 05

投影片補充 06

投影片補充 07

投影片補充 08

投影片補充 09

投影片補充 10

投影片補充 11

投影片補充 12

投影片補充 13

投影片補充 14

投影片補充 15

投影片補充 16

投影片補充 17

投影片補充 18

投影片補充 19

投影片補充 20

NT$105,400 買這台,我認為配置是對的

這台其實很適合 Splash 用途。

截圖這台規格是:

  • Mac mini M5 Pro
  • 15 核 CPU
  • 16 核 GPU
  • 64GB 統一記憶體
  • 1TB SSD
  • 2.5GbE
  • NT$105,400

Splash 官方 benchmark 本身就是在 M5 Pro / 16-core GPU / 48GB 上測試,所以你這台的 16-core GPU 完全對到官方測試平台,而且記憶體還從 48GB 增加到 64GB。官方測得 Qwen3.8-27B 短 Prompt 約 74 tok/s、四路 concurrent aggregate 約 170 tok/s

如果用途是:

公司 AI Server → Splash → Qwen3.8-27B → 2~4 人使用

我認為 64GB 比升更高階 CPU/GPU 更有價值

原因是 Splash 官方明確說明,記憶體越多,可以提供更多 Context 與更多 concurrent requests;36GB 相較 48GB 就會限制 Context 與並發數。

因此 64GB 可以讓你比官方 48GB benchmark 環境留下更多空間給:

Q4 模型約 17.4GB + KV Cache + 長 Context + 多使用者並發 + macOS。

而且它的 Qwen3.8-27B package 執行架構本身就是針對最多四個 sequence 同時 decode設計。

唯一我會考慮加的,是如果這台真的要當公司長期 AI Server,把 2.5GbE 升成 10GbE,尤其未來還可能接 NAS、RAG 文件庫或其他 AI 工作站。

NT$105,400 買這台,我認為配置是對的。 不需要為了 Splash 特別再往更高 GPU 配置衝;64GB RAM 對「2~4 人共用 AI Server」的實際價值更高。

它省電嗎?

很省電。 如果你要把這台 Mac mini M5 Pro 64GB 當成公司 24 小時 AI Server,耗電其實是它非常大的優勢。

Apple 官方公布的 M5 Pro Mac mini 功耗測試,測試機甚至是 64GB RAM + 8TB SSD

  • 閒置:約 6W
  • 最大功耗:約 145W
  • 整台機器規格允許的最大持續功率為 155W

你截圖那台是 64GB + 1TB。實際跑 Splash + Qwen3.8-27B 時不代表會一直吃滿 145W;功耗會隨推論負載變化。

假設粗略抓 AI 推論平均 80W,每天真的連續高負載 8 小時:

0.08 kW × 8 小時 × 30 天 = 19.2 kWh/月

即使粗暴地假設 145W 連續 24 小時滿載

0.145 × 24 × 30 = 104.4 kWh/月

所以和一台裝 RTX 5090、整機負載可能數百瓦的 AI 工作站相比,Mac mini 這種架構在 每瓦效能、散熱、噪音、24 小時待機成本方面非常有吸引力。Apple 自己也特別把 M5 Pro Mac mini 定位為適合長時間運行 AI Agent 的高每瓦效能設備。

所以你這台 NT$105,400 的 64GB M5 Pro,如果目標是 Splash + Qwen3.8-27B、2~4 人公司內部共用,我會把「省電」列為它相對傳統 GPU 工作站的一個很大優勢。

它會很吵嗎?

平常非常安靜,但跑 Splash 長時間滿載時,我不會說它「完全沒聲音」。

Apple 官方對 2026 Mac mini M5 Pro 的聲學測試,在 18 核 CPU / 20 核 GPU / 48GB 機型上,待機與一般網頁使用在操作者位置都只有 4 dB,基本上幾乎感覺不到風扇聲。

但有一個關鍵:Apple 公布的 4 dB 並不是 AI 滿載測試。官方沒有公布長時間跑 LLM inference 時的噪音數字,因此不能直接說跑 Qwen3.8-27B 時也是 4 dB。

以你要的使用情境:

Mac mini M5 Pro 64GB → Splash → Qwen3.8-27B → 公司 2~4 人共用

GPU 長時間工作後風扇一定可能升速,但 Apple Silicon 功耗相對低,整機最大持續功率也只有 155W

所以如果放在辦公桌旁,我預期會是平常幾乎無聲,重度 AI 推論時聽得到風扇,但不像 RTX 5090 工作站那種高功耗 GPU + 機殼風扇的聲量。至於 Splash 四人同時滿載究竟幾 dB,目前還缺實測數據。

如果你考慮把這台 NT$105,400 的 64GB Mac mini 當 24×7 AI 生產機,我認為「低功耗+低噪音+體積小」正是它相對傳統 GPU 工作站很大的優勢。