AI Model Field Guide
香港版 / 獨立選型筆記 / 2026

選模型,不押品牌。

將六款主流商業 AI 模型放在同一張表比較。這裡不設虛假的「總冠軍」,只回答三個實際問題:可以做甚麼、成本多少,以及何時不應選它。

資料更新時間2026 年 8 月 2 日 · 香港時間
價格均參考廠商官方頁面
01 / Quick chooser

先由工作負載出發

建議按廠商公開定位、API 能力及價格結構整理,並非跨模型基準測試結論。

LONG-HORIZON

複雜推理、程式碼與長流程 Agent

先以真實工作測試旗艦閉源模型,尤其留意工具調用穩定性及失敗復原。

GPT-5.6 Sol · Claude Opus 5
MULTIMODAL

多模態理解與原型開發

Gemini 的原生多模態能力及 Google 工具生態值得先測試,但 Pro 現時仍標示為 Preview。

Gemini 3.1 Pro Preview
ECONOMICS

講求成本的大規模 API

DeepSeek 的公開單價明顯較低;正式上線前仍須測試吞吐、延遲、合規及目標語言質素。

DeepSeek V4-Pro
REGIONAL FIT

香港團隊與中英文業務

香港團隊常同時處理中英文及跨區服務。千問提供人民幣計價和內地雲服務路徑,但不宜直接與美元價格相減比較。

Qwen3.7-Max
02 / At a glance

核心規格,一眼看清

價格為標準即時 API 每百萬 tokens 的輸入/輸出價;快取、Batch、工具調用、長上下文及地區費率或會另計。

模型官方定位摘要上下文輸入/輸出輸入模態狀態
GPT-5.6 SolOpenAI複雜專業工作、推理與編碼旗艦1.05M$5 / $30USD / MTok文字、圖像旗艦
Claude Opus 5Anthropic複雜 Agent 編碼與企業工作1M$5 / $25USD / MTok文字、圖像正式可用
Gemini 3.1 ProGoogle多模態理解、Agent 與複雜編碼以官方模型頁為準$2 / $12≤200K prompt多模態Preview
Grok 4.5xAIAgent 軟件、工程及工作流程500K$2 / $6USD / MTok文字、圖像API 可用
DeepSeek V4-ProDeepSeek思考/非思考雙模式及高性價比1M$0.435 / $0.87cache miss / output文字API 可用
Qwen3.7-MaxAlibaba Cloud思考/非思考雙模式,內地雲服務路徑1M¥12 / ¥36CNY / MTok 原價文字正式可用
03 / Model files

六份模型檔案

「適合」只代表優先評估方向。任何採購決定仍須補充內部質素、安全、延遲及總成本測試。

01 · OPENAI

GPT-5.6 Sol

旗艦推理與編碼模型,工具覆蓋完整,適合複雜專業工作。

  • 上下文1.05M
  • 最大輸出128K
  • 工具Web / File / Computer
查看官方模型頁 ↗
02 · ANTHROPIC

Claude Opus 5

面向複雜 Agent 編碼與企業工作,支援自適應思考及多雲接入。

  • 上下文1M
  • 最大輸出128K
  • 相對延遲Moderate
查看官方模型頁 ↗
03 · GOOGLE

Gemini 3.1 Pro

強調多模態、複雜問題、Agent 及「vibe coding」,目前為預覽版。

  • 價格門檻200K prompt
  • 短上下文輸出價$12 / MTok
  • 發佈狀態Preview
查看官方模型頁 ↗
04 · XAI

Grok 4.5

面向 Agent 軟件、工程及工作流程,支援推理、函數調用與結構化輸出。

  • 上下文500K
  • 快取輸入$0.30 / MTok
  • 輸入文字、圖像
查看官方模型頁 ↗
05 · DEEPSEEK

DeepSeek V4-Pro

同一模型支援思考及非思考模式,兼容 OpenAI 與 Anthropic API 格式。

  • 上下文1M
  • 最大輸出384K
  • 工具調用支援
查看官方價格頁 ↗
06 · ALIBABA CLOUD

Qwen3.7-Max

具 1M 上下文的思考/非思考模型,以人民幣計價,適合評估內地雲接入。

  • 上下文1M
  • 即時原價¥12 / ¥36
  • Batch官方列示半價
查看官方價格頁 ↗
04 / Cost sketch

快速估算單次成本

只計算標準輸入及輸出 token 費用,不包括快取、搜尋、工具、儲存、地區、Batch 或折扣;結果並非帳單報價。

Estimated API cost
$1.10

100,000 輸入 + 20,000 輸出 tokens;標準即時費率粗略估算。

05 / Read before buying

價格以外的四個變數

可靠性不是參數表

模型在自家工具、數據及錯誤復原流程是否穩定,比單次公開榜單分數更貼近實際表現。

長上下文不等於有效記憶

視窗容量只代表可接收上限;召回質素、注意力衰減、首 token 延遲及階梯價格須分別測試。

數據邊界要逐項確認

免費層、付費 API、企業合約及雲端代理的訓練使用、日誌保留與地區處理政策可能不同。

總成本包括失敗

輸出冗長度、重試率、工具調用次數、快取命中及人工覆核,往往比每百萬 token 標價更影響帳單。

06 / Primary sources

只連結官方資料

模型及價格變動很快;採購或上線當日,請重新開啟廠商頁面確認。