複雜推理、程式碼與長流程 Agent
先以真實工作測試旗艦閉源模型,尤其留意工具調用穩定性及失敗復原。
GPT-5.6 Sol · Claude Opus 5將六款主流商業 AI 模型放在同一張表比較。這裡不設虛假的「總冠軍」,只回答三個實際問題:可以做甚麼、成本多少,以及何時不應選它。
建議按廠商公開定位、API 能力及價格結構整理,並非跨模型基準測試結論。
先以真實工作測試旗艦閉源模型,尤其留意工具調用穩定性及失敗復原。
GPT-5.6 Sol · Claude Opus 5Gemini 的原生多模態能力及 Google 工具生態值得先測試,但 Pro 現時仍標示為 Preview。
Gemini 3.1 Pro PreviewDeepSeek 的公開單價明顯較低;正式上線前仍須測試吞吐、延遲、合規及目標語言質素。
DeepSeek V4-Pro香港團隊常同時處理中英文及跨區服務。千問提供人民幣計價和內地雲服務路徑,但不宜直接與美元價格相減比較。
Qwen3.7-Max價格為標準即時 API 每百萬 tokens 的輸入/輸出價;快取、Batch、工具調用、長上下文及地區費率或會另計。
| 模型 | 官方定位摘要 | 上下文 | 輸入/輸出 | 輸入模態 | 狀態 |
|---|---|---|---|---|---|
| GPT-5.6 SolOpenAI | 複雜專業工作、推理與編碼旗艦 | 1.05M | $5 / $30USD / MTok | 文字、圖像 | 旗艦 |
| Claude Opus 5Anthropic | 複雜 Agent 編碼與企業工作 | 1M | $5 / $25USD / MTok | 文字、圖像 | 正式可用 |
| Gemini 3.1 ProGoogle | 多模態理解、Agent 與複雜編碼 | 以官方模型頁為準 | $2 / $12≤200K prompt | 多模態 | Preview |
| Grok 4.5xAI | Agent 軟件、工程及工作流程 | 500K | $2 / $6USD / MTok | 文字、圖像 | API 可用 |
| DeepSeek V4-ProDeepSeek | 思考/非思考雙模式及高性價比 | 1M | $0.435 / $0.87cache miss / output | 文字 | API 可用 |
| Qwen3.7-MaxAlibaba Cloud | 思考/非思考雙模式,內地雲服務路徑 | 1M | ¥12 / ¥36CNY / MTok 原價 | 文字 | 正式可用 |
「適合」只代表優先評估方向。任何採購決定仍須補充內部質素、安全、延遲及總成本測試。
旗艦推理與編碼模型,工具覆蓋完整,適合複雜專業工作。
面向複雜 Agent 編碼與企業工作,支援自適應思考及多雲接入。
強調多模態、複雜問題、Agent 及「vibe coding」,目前為預覽版。
面向 Agent 軟件、工程及工作流程,支援推理、函數調用與結構化輸出。
同一模型支援思考及非思考模式,兼容 OpenAI 與 Anthropic API 格式。
具 1M 上下文的思考/非思考模型,以人民幣計價,適合評估內地雲接入。
只計算標準輸入及輸出 token 費用,不包括快取、搜尋、工具、儲存、地區、Batch 或折扣;結果並非帳單報價。
100,000 輸入 + 20,000 輸出 tokens;標準即時費率粗略估算。
模型在自家工具、數據及錯誤復原流程是否穩定,比單次公開榜單分數更貼近實際表現。
視窗容量只代表可接收上限;召回質素、注意力衰減、首 token 延遲及階梯價格須分別測試。
免費層、付費 API、企業合約及雲端代理的訓練使用、日誌保留與地區處理政策可能不同。
輸出冗長度、重試率、工具調用次數、快取命中及人工覆核,往往比每百萬 token 標價更影響帳單。
模型及價格變動很快;採購或上線當日,請重新開啟廠商頁面確認。