LLM InsightsEnglish
回到所有文章

2026 年 8 月 LLM 定價變動總覽:DeepSeek 分時計費、OpenAI 旗艦降到 $4/$20、Ling-3.0 超低價進場

11 分鐘閱讀LLM Price Compare

2026 年 8 月的 LLM 定價變動,跟過去兩年那種「大家一起降價」的節奏不太一樣。這個月值得記下來的五件事裡,只有兩件是單純的數字下修;其餘三件改變的是計費的方式,而不是價格的大小。這個區別對做預算的人比較重要:單價變動可以用乘法算完,計費模式變動會讓你原本的估算方法整個失效。

以下所有數字都來自本站目錄在 2026 年 8 月的實際紀錄,並標註了各自的驗證日期。促銷價與表定價會分開說明。

一、DeepSeek 把時段計費帶進了 LLM API

這是本月影響最大、也最少被討論的一件事。DeepSeek 的三顆現役模型全部改採尖峰/離峰兩段計費:UTC 01:00–04:00 與 06:00–10:00 為尖峰時段,以表定價的 2 倍計費,其餘時間為離峰價。

整個 LLM API 市場幾乎沒有第二家這樣做。這是雲端運算的定價邏輯——用價格把負載推離尖峰——第一次被完整搬進 token 計費裡。

模型離峰輸入離峰輸出尖峰輸入尖峰輸出品質
deepseek-v4-flash$0.14$0.28$0.28$0.5688
deepseek-chat-v4$0.2574$1.0287$0.5148$2.057488
deepseek-reasoner-v4$0.435$0.87$0.87$1.7492
DeepSeek 兩段計費,單位為每 1M token(驗證於 2026-08-16)

台灣團隊要特別注意一件事:UTC+8 換算後,尖峰時段落在當地的 09:00–12:00 與 14:00–18:00,幾乎完整覆蓋一個上班日。如果你的流量來自辦公室時間使用的內部工具,你實際付的一直是 2 倍價,而不是比價表上顯示的那個數字。

反過來看,這對可排程的工作負載是難得的機會。夜間批次摘要、離線資料清洗、非同步內容生成,只要能推到離峰執行,deepseek-reasoner-v4 用 $0.435/$0.87 提供品質 92 的推理能力——同樣 92 分的 claude-sonnet-5 是 $2/$10,輸出貴 11.5 倍。reasoner-v4 的代價在速度:30 tokens/秒,是本站目錄裡最慢的一顆(claude-sonnet-5 是 95)。

實作建議兩點:排程器裡用 UTC 明確標時段,不要從本地時間推算;另外為尖峰時段準備 fallback。qwen3.5 全時段同價 $0.10/$0.15,兩邊都比 DeepSeek 的離峰價更低,是最自然的替補。

二、OpenAI 把目錄裡分數最高的模型降到 $4/$20

gpt-5.6-sol 在 8 月 22 日從 $5/$30 調整為 $4/$20(官方來源),輸入降 20%、輸出降三分之一。它的品質分數 98 是本站追蹤的 68 個模型裡最高的。

值得注意的不只是降幅,而是它落在哪個位置。目錄裡品質 96 分以上的模型有五顆:gpt-5.6-sol(98)、gpt-5.5(97,$5/$30)、claude-opus-5(97,$5/$25)、claude-fable-5 與 claude-mythos-5(皆 96,$10/$50)。降價後,分數最高的那一顆同時也是輸入與輸出最便宜的那一顆——這在過去兩年的旗艦帶沒有出現過。

對 claude-opus-5 的影響最直接。降價前 Opus 5 的輸出便宜 17%,兩顆各有立場;現在 Sol 的輸入便宜 20%、輸出便宜 20%、品質高 1 分、上下文同為 1,049K,還多了原生音訊。帳面上每一格都翻了過去。

比價表贏不等於該搬家。品質分數是綜合基準指標,測不到工具使用的可靠度、長對話裡的指令遵循,也測不到你的 prompt 已經針對哪一顆調校過。跨供應商遷移要重跑整套回歸測試,在旗艦帶這個成本通常大於一年的價差。合理的作法是新專案直接從 Sol 起跑,既有系統先用影子流量比對再決定。

三、Anthropic 旗艦線:Opus 5 進場,Sonnet 5 再降三成

claude-opus-5 在 8 月進入本站目錄,定價 $5/$25,品質分數 97,上下文 1,049K。把它放進 Anthropic 自己的價格軌跡才看得出意義:本站紀錄的 claude-opus-4-8 在 2026 年 1 月是 $15/$75,4 月 $10/$50,6 月 $5/$25。也就是說今天的旗艦價只有年初的三分之一,而品質往上走。

同月 claude-sonnet-5 從 7 月的 $3/$15 調整為 $2/$10,兩邊各降三分之一。對照仍在目錄裡的 claude-sonnet-4-6($3/$15、品質 90),新一代同時更便宜 33% 且高 2 分——這種「兩邊都贏」的世代交替在市場上不常見,多數供應商推新版時會擇一保留。

claude-fable-5 則是一個需要單獨解釋的例子。它是 $10/$50、品質 96,而 Opus 5 是 $5/$25、品質 97——同一家、同樣 1,049K 上下文、速度幾乎一樣,價格卻是兩倍,帳面沒有一項更好。fable 系列的定位是長篇寫作與敘事一致性,而那恰好是自動化基準分數最測不準的維度。誠實的說法是:這個溢價無法從表格證明合理,只能用你自己的稿件盲測驗證。內容產出量大、輸出直接面對讀者的團隊值得測;其餘情況先用 Opus 5 建立基準。

四、Gemini Flash:表定價沒動,折扣藏在計費層

這一段要先修正一個常見誤解。gemini-3.5-flash 的表定價自進入本站目錄以來一直是 $1.50/$9.00,本月並未調整。網路上流傳的「Gemini 3.5 Flash 降價」,指的其實不是表定價。

真正變便宜的是計費選項。Google 為這顆模型提供 Batch 與 Flex 模式,兩者都是表定價的五折($0.75/$4.50)快取命中的輸入為 $0.15/1M token,是表定價的十分之一。換句話說,你付多少錢主要取決於工作負載能不能容忍非同步執行與重複前綴,而不是取決於你選了哪顆模型。

這件事在比價表上是看不見的,而它的影響往往比換模型更大。一條走 Batch、system prompt 穩定的管線,實際成本可能只有列表價的十分之一到二分之一;而即時、單次、每次前綴都不同的請求,就得照 $1.50/$9.00 付。

順帶一提,如果你不需要 1,049K 上下文或音訊模態,Google 自家的 gemini-2.5-flash 是 $0.30/$2.50、品質 84。相對 3.5-flash 的品質 86,多付 5 倍輸入與 3.6 倍輸出去換 2 分,這筆帳值得先算過再決定。

五、InclusionAI Ling-3.0-flash:$0.07 的進場價

Ling-3.0-flash 在 8 月進入目錄,$0.07/$0.22、品質 80、上下文 262K、速度 180 tokens/秒。它是 124B 參數的 MoE 模型,每個 token 只啟用約 5.1B 參數——這是它能同時做到高速與低價的技術原因,因為推論成本跟啟用參數量走,不跟總參數量走。

這裡有一個必須講清楚的但書:官方定價是 ¥0.40/¥1.20 每 1M token,目前 OpenRouter 上有 65% 的上市促銷折扣,本站顯示的美元價反映的是促銷期間實際價格。做年度預算時請以官方費率計算,不要把促銷價當成長期成本。

跟同樣 180 tokens/秒 的對手比:claude-haiku-4-5 是 $1/$5、品質 82、上下文 200K,輸入貴 14 倍、輸出貴 23 倍,品質只高 2 分,上下文還少了四分之一。deepseek-v4-flash 是 $0.14/$0.28、品質 88、上下文 1,000K,在品質與上下文上更好,但有尖峰加價;Ling 沒有時段差別。

品質 80 定義了它的邊界:足以做分類、路由、擷取、改寫與第一層過濾,不足以當推理主力。最有價值的用法是分層架構的第一層——讓它以近乎零成本吃掉大部分請求,只把困難案例升級給上層模型。評估任何超低價模型時,該問的都不是「它能不能取代主力」,而是「它能吃掉主力多少不必要的流量」。

8 月價格地圖:本文提到的模型一覽

模型供應商輸入 /1M輸出 /1M品質上下文速度
gpt-5.6-solOpenAI$4.00$20.00981,049K85
claude-opus-5Anthropic$5.00$25.00971,049K58
claude-fable-5Anthropic$10.00$50.00961,049K60
kimi-k3Moonshot AI$3.00$15.00951,000K60
claude-sonnet-5Anthropic$2.00$10.00921,049K95
deepseek-reasoner-v4DeepSeek$0.435$0.8792131K30
grok-4.5xAI$2.00$6.0091500K91
gemini-3.1-proGoogle$2.00$12.00911,049K70
qwen3.5Alibaba$0.10$0.15911,000K85
gpt-5.6-lunaOpenAI$0.20$1.20901,049K150
deepseek-chat-v4DeepSeek$0.2574$1.028788131K140
gemini-3.5-flashGoogle$1.50$9.00861,049K190
claude-haiku-4-5Anthropic$1.00$5.0082200K180
gpt-4o-miniOpenAI$0.15$0.6080128K160
Ling-3.0-flashInclusionAI$0.07$0.2280262K180
速度單位為 tokens/秒。DeepSeek 為離峰價,Ling-3.0-flash 為促銷價。

表中其餘幾顆模型本文沒有展開,但各自有獨立的分析頁:

  • deepseek-chat-v4——131K 上下文是它最該注意的限制,同價位帶已有 262K 到 1,000K 的選擇。
  • gemini-3.1-pro——$2/$12、品質 91,被 claude-sonnet-5 與 grok-4.5 兩面夾擊,真正的理由是 GCP 生態。
  • kimi-k3——$3/$15 的旗艦,但同樣 95 分的 gpt-5.6-terra 在價格、上下文與速度上都更好。
  • gpt-4o-mini——仍在大量產線上服役,而它的價格優勢已經比多數人以為的小很多。

供應商層級的完整價格表:OpenAIAnthropicGoogleDeepSeekxAIAlibabaMistralMoonshot AI

把五件事放在一起看

這個月最值得帶走的結論不是「哪顆模型最便宜」,而是單一價格數字正在失去解釋力。DeepSeek 的價格取決於你什麼時候送請求,Gemini 的價格取決於你能不能走 Batch 與快取,Ling 的價格取決於促銷還在不在,Anthropic 與 OpenAI 的旗艦價則在半年內各自走完了一大段降幅——且排序在 8 月 22 日翻轉。用一個 $/1M token 的欄位去比較這五家,已經算不出你真正會付多少。

另一個結構性訊號是:品質 90 分以上不再等於昂貴。本站目錄裡有 25 個模型品質 90 分以上,其中 qwen3.5($0.15 輸出)、MAI-DS-R1($0.28)、deepseek-reasoner-v4($0.87)與 gpt-5.6-luna($1.20)的輸出價都在 $1.20 以下。「便宜模型能力一定有天花板」這個假設,在 2026 年 8 月已經不成立了。

務實的作法是分層:用 Ling-3.0-flashgpt-5.6-luna 這種等級的模型吃掉大部分流量,把 claude-opus-5gpt-5.6-sol 留給錯誤成本高、且沒有人工複核關卡的任務。剩下的中間地帶交給 claude-sonnet-5grok-4.5

把你自己的用量帶進來算一次

輸入每次請求的 token 數與每月請求量,直接比較這些模型在你的工作負載下的實際月費。

開啟成本計算器

常見問題

DeepSeek 的尖峰時段換算成台灣時間是幾點?

DeepSeek 的尖峰時段是 UTC 01:00–04:00 與 06:00–10:00,以 2 倍計費。台灣為 UTC+8,換算後是當地 09:00–12:00 與 14:00–18:00。建議在排程器中直接使用 UTC 設定,避免換算錯誤導致整批工作以 2 倍價執行。

gpt-5.6-sol 降價後,還有必要用 Claude Opus 5 嗎?

純看帳面沒有:gpt-5.6-sol 在 8 月 22 日調到 $4/$20、品質 98,對 claude-opus-5 的 $5/$25、品質 97 在輸入、輸出與分數三項上都更好,上下文同為 1,049K 並多了音訊模態。但品質分數量不到工具使用可靠度、長對話的指令遵循,也量不到你既有 prompt 的調校成本;跨供應商遷移要重跑整套回歸測試,在旗艦帶這個成本常大於一年的價差。建議新專案從 Sol 起跑,既有系統先跑影子流量比對。

Gemini 3.5 Flash 這個月到底有沒有降價?

表定價沒有變動,一直是 $1.50/$9.00 每 1M token。變便宜的是計費選項:Batch 與 Flex 模式為表定價的五折($0.75/$4.50),快取命中的輸入為 $0.15/1M token。所以實際成本是否下降,取決於你的工作負載能不能使用這些模式。

Ling-3.0-flash 的 $0.07 是長期價格嗎?

不是。官方定價為 ¥0.40/¥1.20 每 1M token,$0.07/$0.22 反映的是 OpenRouter 上 65% 的上市促銷折扣。做長期預算時應以官方費率計算,並確認你的架構可以在促銷結束後更換底層模型。

Claude Fable 5 比 Opus 5 貴一倍、品質分數還低 1 分,為什麼還會有人選?

本站的品質分數是綜合基準指標,衡量的是任務正確率這類可自動評分的項目。fable 系列的定位是長篇寫作與敘事一致性,而那正是自動評分最測不準的維度。分數低 1 分不代表寫作品質較差,但也不保證更好——這是需要用真實稿件盲測才能判斷的差異。內容產出量大且輸出直接面對讀者的團隊值得測試,其他情況建議先用 Opus 5 建立基準。

品質 90 分以上的模型,最便宜的是哪一顆?

以輸出單價計,本站目錄中品質 90 分以上最便宜的是 Alibaba 的 qwen3.5,$0.10/$0.15、品質 91、上下文 1,000K。需要注意它的價格來源為 OpenRouter(驗證於 2026-08-06)而非供應商官方頁面,且這類策略定價可能隨時調整,長期採用前建議確認官方費率並保留更換模型的彈性。