費(fèi)看懂英偉達(dá)為何不賣大模型API:商業(yè)模式與生態(tài)博弈)
之前在做 AI 應(yīng)用調(diào)研時我注意到一個很有意思的現(xiàn)象明明英偉達(dá)擁有全球最核心的 GPU 產(chǎn)能幾乎壟斷了高端 AI 芯片市場但普通開發(fā)者使用大模型時都是向 OpenAI、Anthropic、智譜、DeepSeek 這些模型廠商付費(fèi)按 token 計(jì)費(fèi)。英偉達(dá)為什么不親自下場賣 token如果它既賣算力芯片又直接面向開發(fā)者售賣模型 token理論上不是可以賺到更多利潤嗎這個問題看似簡單背后卻牽扯到商業(yè)模式邊界、產(chǎn)業(yè)鏈分工、生態(tài)位保護(hù)等關(guān)鍵邏輯。這篇文章我會從 token 計(jì)費(fèi)模型、英偉達(dá)的商業(yè)定位、GPU 與模型服務(wù)的成本結(jié)構(gòu)幾個角度把這件事講清楚。同時也會站在開發(fā)者視角聊聊我們?nèi)粘=佑| token 時需要注意的技術(shù)細(xì)節(jié)和常見坑點(diǎn)。1. token 到底是什么為什么 AI 廠商愛按 token 收費(fèi)1.1 從“漢字拆字”理解 token在深入討論英偉達(dá)之前先把 token 這個概念聊透。大模型本身并不直接理解文字、單詞或句子它處理的是數(shù)值。為了讓模型能理解文本我們需要把文本切分成一個個小的單元再映射成數(shù)字向量。這個小的單元就是 token。舉個例子你好世界如果按常見的大模型分詞方式這句話可能被切成若干個 token比如“你好”“” “世界”“”或者更細(xì)粒度的字節(jié)級片段。不同模型使用的 tokenizer分詞器不一樣切分方式也不同。有的模型一個漢字可能對應(yīng) 1 個 token有的可能對應(yīng) 2 個 token。英文單詞通常 1 個單詞可能是 1 或 2 個 token也可能被拆成多個子詞。那為什么 AI 廠商喜歡按 token 收費(fèi)根本原因在于token 數(shù)量直接決定了模型的計(jì)算量。輸入 prompt 越長模型需要處理的前綴計(jì)算越多。輸出內(nèi)容越長模型需要自回歸生成一步、一步地推出更多 token。上下文越長KV Cache 占用的顯存也越多。所以 token 數(shù)量是最貼近真實(shí)資源消耗的計(jì)費(fèi)維度。按 token 計(jì)費(fèi)本質(zhì)上是一種“資源用量計(jì)費(fèi)模式”類似云計(jì)算的按量付費(fèi)。1.2 一套典型的 token 計(jì)費(fèi)結(jié)構(gòu)大多數(shù)大模型 API 的計(jì)費(fèi)包含兩部分輸入 token 和輸出 token。通常輸出的單價會高于輸入單價因?yàn)樯呻A段是逐步推理的計(jì)算成本更高。{ model: example-chat-model, prompt_tokens: 120, completion_tokens: 80, total_tokens: 200 }這就是一個常見的 API 響應(yīng)片段。調(diào)用大模型接口時服務(wù)商通常會在響應(yīng)里返回 usage 信息里面包含 prompt_tokens、completion_tokens、total_tokens方便開發(fā)者統(tǒng)計(jì)每次調(diào)用的消耗。1.3 開發(fā)者如何預(yù)估 token 消耗實(shí)際開發(fā)中我們經(jīng)常需要估算一段文本大概占多少 token。這里有兩種常用方式。第一種是使用模型廠商官方的 tokenizer 工具比如 OpenAI 開源了 tiktoken可以直接在 Python 中計(jì)算 token 數(shù)量import tiktoken encoding tiktoken.get_encoding(cl100k_base) text Hello, world! 你好世界 tokens encoding.encode(text) print(token 數(shù)量, len(tokens)) print(token 列表, tokens)運(yùn)行這段代碼會打印出文本切分后的 token 列表和數(shù)量。對開發(fā)者來說在構(gòu)造 prompt 之前先估算 token能有效控制成本避免出現(xiàn)請求量過大導(dǎo)致賬單飆升的情況。第二種是使用模型服務(wù)商控制臺自帶的 Tokenizer 工具。大多數(shù)平臺都提供了可視化調(diào)試頁面你可以直接輸入文本系統(tǒng)會展示 token 切分效果。很多開發(fā)者誤以為“1 個漢字 1 個 token”這個說法在部分中文大模型中成立但換成英文模型或不同分詞策略時結(jié)論就變了。在做成本預(yù)估時最好用官方 tokenizer 跑一遍不要憑經(jīng)驗(yàn)猜測。2. 英偉達(dá)的業(yè)務(wù)圖譜芯片之外它到底靠什么賺錢2.1 英偉達(dá)的主營業(yè)務(wù)構(gòu)成一說起英偉達(dá)很多人第一反應(yīng)是“賣顯卡的”。這沒錯但它的業(yè)務(wù)早就不是單純賣 GPU 這么簡單。從業(yè)務(wù)板塊來看英偉達(dá)的收入主要來自以下幾塊業(yè)務(wù)板塊核心產(chǎn)品目標(biāo)客戶數(shù)據(jù)中心計(jì)算A100、H100、H200、B200 等 GPU以及 DGX 服務(wù)器云廠商、大型互聯(lián)網(wǎng)公司、科研機(jī)構(gòu)專業(yè)視覺與工作站RTX 專業(yè)顯卡、Omniverse 平臺設(shè)計(jì)、影視、仿真行業(yè)汽車業(yè)務(wù)NVIDIA DRIVE 平臺整車廠、自動駕駛公司消費(fèi)級游戲顯卡GeForce RTX 系列玩家、創(chuàng)作者而 AI 時代最受關(guān)注的是數(shù)據(jù)中心計(jì)算業(yè)務(wù)它是英偉達(dá)市值飆升的核心引擎。2.2 英偉達(dá)已經(jīng)做算力服務(wù)了很多人可能不知道英偉達(dá)不只是賣物理芯片它也有了自己的云服務(wù)產(chǎn)品。比如 NVIDIA DGX Cloud它提供的是“GPU 算力即服務(wù)”企業(yè)可以不自己買顯卡而是按周期租用英偉達(dá)的 GPU 算力在上面跑模型訓(xùn)練和推理任務(wù)。再比如 NVIDIA AI Enterprise這是一套企業(yè)級 AI 軟件平臺包含 CUDA、cuDNN、Triton Inference Server、NIM 微服務(wù)等組件幫助企業(yè)快速部署和管理 AI 工作負(fù)載。你會發(fā)現(xiàn)一個規(guī)律英偉達(dá)在做的是“賣算力基礎(chǔ)設(shè)施”而不是“賣模型推理結(jié)果”。2.3 英偉達(dá)自己有哪些大模型這里要區(qū)分一下。英偉達(dá)其實(shí)也發(fā)布了若干模型比如 Nemotron 系列包括用于智能體場景的 Llama-Nemotron 模型也有用于代碼生成的模型。但英偉達(dá)發(fā)布這些模型更多是為了展示 GPU 能力、完善生態(tài)工具鏈而不是為了成為一家“通用大模型 API 服務(wù)商”。它并不想靠“輸出 token”來賺錢它想讓你相信“用英偉達(dá)的 GPU 來跑 token 生成才是最省錢的”。3. 核心問題英偉達(dá)為什么不親自售賣 token3.1 商業(yè)模式定位的沖突要理解這個問題我們需要先梳理 AI 產(chǎn)業(yè)鏈的上中下游。上游是算力硬件包括 GPU、CPU、網(wǎng)絡(luò)設(shè)備、存儲設(shè)備。英偉達(dá)是這一層的絕對霸主。中游是模型與平臺包括基礎(chǔ)大模型、模型微調(diào)平臺、推理服務(wù)、云服務(wù)。OpenAI、Google、Anthropic、智譜、DeepSeek 等廠商在這一層競爭。下游是應(yīng)用與終端包括各類 AI 應(yīng)用、智能體、辦公軟件、垂直行業(yè)解決方案。如果英偉達(dá)親自下場售賣 token會發(fā)生什么它就不再是“中立的上游供應(yīng)商”而是直接變成了中游模型服務(wù)商的競爭對手。那些大模型廠商今天還在瘋狂采購 H100、B200轉(zhuǎn)頭發(fā)現(xiàn)英偉達(dá)自己也推出了一個大模型 API并且按 token 收費(fèi)。你覺得它們還會繼續(xù)把英偉達(dá)當(dāng)作最親密的合作伙伴嗎這不是猜測而是商業(yè)利益層面的必然沖突。3.2 賣鏟子比淘金更穩(wěn)定在淘金熱里最賺錢的不一定是挖到黃金的人而是賣鏟子的人。這個比喻雖然老了點(diǎn)但在 AI 時代依然成立。英偉達(dá)現(xiàn)在的核心策略就是“賣鏟子”。GPU 是訓(xùn)練和運(yùn)行大模型的必需品只要全球 AI 訓(xùn)練和推理需求在增長英偉達(dá)就可以源源不斷地賣出高毛利芯片。相比之下賣 token 是一門需要長期運(yùn)營、不斷優(yōu)化模型、持續(xù)投入研究和迭代的生意。模型效果不好用戶會立刻流失競爭對手推出更便宜的模型定價權(quán)也會被削弱。更重要的一點(diǎn)是token 服務(wù)的利潤率不一定比賣 GPU 更高。從公開財(cái)報(bào)可以窺見英偉達(dá)數(shù)據(jù)中心的毛利率極高。而大模型 API 服務(wù)商的利潤空間反而受制于推理成本和激烈的價格戰(zhàn)。過去一年國內(nèi)外大模型 API 的價格一路走低很多廠商都在通過降價換市場。這種背景下英偉達(dá)不可能放棄高毛利的硬件核心業(yè)務(wù)轉(zhuǎn)頭扎進(jìn)低價競爭的 token 市場。3.3 英偉達(dá)不賣 token那云廠商為什么不自己做芯片這個問題經(jīng)常被拿來對比。實(shí)際上云廠商確實(shí)在嘗試自研芯片。Google 有 TPU亞馬遜有 Trainium 和 Inferentia微軟也在推進(jìn)自研 AI 芯片。但它們的邏輯和英偉達(dá)不一樣云廠商本來就提供 token 服務(wù)自研芯片是為了降低采購成本和供應(yīng)鏈風(fēng)險同時提升云產(chǎn)品的利潤空間。也就是說云廠商是“模型服務(wù)商 芯片自研者”的雙重身份。而英偉達(dá)不具備模型服務(wù)商的身份也不需要冒險去摧毀自己的核心護(hù)城河。3.4 直接賣 token 會帶來哪些技術(shù)挑戰(zhàn)除了商業(yè)層面的沖突直接售賣 token 對英偉達(dá)來說也意味著進(jìn)入一個完全不同的技術(shù)領(lǐng)域。賣 GPU 的核心是硬件工程、驅(qū)動開發(fā)、互連通信、散熱設(shè)計(jì)。而賣 token 的核心是大模型訓(xùn)練、RLHF、推理優(yōu)化、并發(fā)調(diào)度、內(nèi)容安全、用戶增長、API 網(wǎng)關(guān)、計(jì)費(fèi)系統(tǒng)。這兩套技術(shù)棧雖然有關(guān)聯(lián)但能力要求差異巨大。一個典型的 token 服務(wù)需要具備以下能力高并發(fā)推理引擎能在毫秒級響應(yīng)大量用戶請求。彈性伸縮策略應(yīng)對潮汐式的調(diào)用流量。多用戶隔離和配額管理確保單個用戶不會耗盡整體資源。內(nèi)容安全和合規(guī)審核避免模型生成違規(guī)內(nèi)容。完善的開發(fā)者平臺包括文檔、SDK 和調(diào)試工具。這些能力不是英偉達(dá)的強(qiáng)項(xiàng)如果硬要做需要投入巨大的人力物力而且成功的概率并不高。4. 如果英偉達(dá)真的賣 token會怎樣我們可以做一個思想實(shí)驗(yàn)假設(shè)英偉達(dá)發(fā)布了一個“NVIDIA Token”服務(wù)會帶來哪些連鎖反應(yīng)4.1 現(xiàn)有客戶關(guān)系的瓦解英偉達(dá)的最大客戶是誰是 OpenAI、微軟、Google、亞馬遜、Meta以及無數(shù) AI 創(chuàng)業(yè)公司。這些客戶對英偉達(dá)又愛又怕。愛的是它的 GPU 性能確實(shí)無可替代怕的是供應(yīng)緊張、價格上漲。如果英偉達(dá)自己也做模型 API這些客戶會立刻調(diào)整采購策略扶持 AMD、自研芯片或者其他算力渠道降低對英偉達(dá)的依賴。這條路風(fēng)險極大得不償失。4.2 生態(tài)內(nèi)外的雙重競爭在生態(tài)內(nèi)部英偉達(dá)和云廠商之間有緊密合作。很多云廠商的實(shí)例就是搭載 NVIDIA GPU 的。在生態(tài)外部英偉達(dá)又在跟云廠商的“自研芯片方案”競爭。如果英偉達(dá)進(jìn)入 token 市場合作關(guān)系會被進(jìn)一步擠壓。云廠商會擔(dān)心自己用了英偉達(dá)的 GPU 來跑模型服務(wù)結(jié)果英偉達(dá)轉(zhuǎn)頭用自己的 GPU 資源做 token 服務(wù)既當(dāng)供應(yīng)商又當(dāng)競爭對手。這樣的局面會讓“GPU 銷售 云合作”這條路越來越難走。4.3 利潤率可能反而下降賣硬件是相對直接的商業(yè)模型研發(fā)、生產(chǎn)、銷售、交付然后產(chǎn)生利潤。賣 token 則是高成本運(yùn)營模型模型訓(xùn)練要燒錢工程師團(tuán)隊(duì)要燒錢客服支持要燒錢內(nèi)容安全要燒錢。國內(nèi)外的模型 API 又在瘋狂打價格戰(zhàn)token 單價一直在往下走。如果英偉達(dá)把資源從 GPU 研發(fā)轉(zhuǎn)向 token 運(yùn)營反而可能導(dǎo)致整體利潤率下滑。5. 那英偉達(dá)在 AI 時代到底在賣什么5.1 賣 CUDA 生態(tài)英偉達(dá)最強(qiáng)的護(hù)城河之一是 CUDA 軟件生態(tài)。全球有數(shù)百萬開發(fā)者習(xí)慣用 CUDA 進(jìn)行 GPU 編程。無論是 PyTorch、TensorFlow 還是 JAX底層調(diào)用的都可能是 CUDA 庫。這種軟件生態(tài)的粘性極強(qiáng)。如果你用了 CUDA 生態(tài)即使某天競爭對手的芯片性能追上來遷移成本依然很高。所以英偉達(dá)很舍得在軟件生態(tài)上投入比如開源大量庫、提供開發(fā)者培訓(xùn)、舉辦 GTC 大會。5.2 賣一站式 AI 基礎(chǔ)設(shè)施英偉達(dá)現(xiàn)在更愿意做的是“AI 工廠”的解決方案商。從芯片到服務(wù)器從網(wǎng)絡(luò)到存儲從集群管理到推理框架英偉達(dá)希望提供一個完整的 AI 基礎(chǔ)設(shè)施方案。企業(yè)只需要購買這個方案就可以快速搭建自己的 AI 平臺而不需要自己處理底層軟硬件的復(fù)雜適配。這種模式的核心訴求是讓英偉達(dá)成為 AI 時代最底層的“基礎(chǔ)設(shè)施供應(yīng)商”。它不需要依賴某一個具體的模型產(chǎn)品賺錢因?yàn)闊o論哪家模型公司贏英偉達(dá)都能通過底層硬件獲利。5.3 英偉達(dá)的“免費(fèi) token”是什么這里要提一個容易混淆的概念。有些開發(fā)者會搜索“英偉達(dá)免費(fèi) token”其實(shí)這不是英偉達(dá)在售賣 API token而是英偉達(dá)在 NVIDIA NIM、NVIDIA Developer Program 等平臺上提供的免費(fèi)試用額度或演示資源。比如英偉達(dá)的 NIM 微服務(wù)提供了推理服務(wù)的容器化部署方案開發(fā)者在一些免費(fèi)資源配額內(nèi)可以快速體驗(yàn)?zāi)P屯评砟芰?。這種“免費(fèi)試用”和直接售賣 token 是兩碼事。它更像是一種生態(tài)培育手段讓開發(fā)者先體驗(yàn)英偉達(dá)的推理軟件平臺熟悉之后再到云環(huán)境或企業(yè)環(huán)境購買完整解決方案。6. 開發(fā)者視角理解 token 計(jì)費(fèi)避免踩坑雖然不是所有人都會去搭建一套大模型 API 服務(wù)但作為開發(fā)者理解 token 計(jì)費(fèi)對日常開發(fā)非常有幫助。我結(jié)合常見的報(bào)錯場景整理了下面這些高頻問題。6.1 token 用量如何計(jì)算計(jì)算 token 用得最多的地方是成本預(yù)估。以大模型 API 調(diào)用為例影響 token 用量的變量主要有幾個系統(tǒng)提示詞system prompt的長度上下文的長度用戶輸入的長度模型輸出內(nèi)容的長度如果你的應(yīng)用需要頻繁調(diào)用大模型最好在服務(wù)端記錄每次調(diào)用的 usage 信息按用戶或按任務(wù)維度統(tǒng)計(jì) token 消耗。下面是統(tǒng)計(jì) token 用量的一個簡單思路def log_token_usage(user_id, task_id, usage): total_tokens usage.get(total_tokens, 0) prompt_tokens usage.get(prompt_tokens, 0) completion_tokens usage.get(completion_tokens, 0) print( f用戶 {user_id} 任務(wù) {task_id} f消耗 token {total_tokens} f(輸入 {prompt_tokens} / 輸出 {completion_tokens}) )在實(shí)際項(xiàng)目中可以將這些數(shù)據(jù)寫入日志或數(shù)據(jù)庫用于后續(xù)的成本分析和配額控制。6.2 token 失效是什么意思開發(fā)中經(jīng)常聽到“token 失效”的說法。這里要區(qū)分兩種情況。一種是 API Key 過期。很多模型平臺頒發(fā)的 API Key 有有效期到期后請求會返回 401 Unauthorized提示 invalid token 或 authentication failed。另一種是會話 token 失效比如在單點(diǎn)登錄系統(tǒng)里JWT 過期導(dǎo)致登錄態(tài)失效需要重新登錄。這兩種場景其實(shí)都和“大模型 token 計(jì)費(fèi)”無關(guān)。前者屬于密鑰管理后者屬于用戶認(rèn)證體系。6.3 cookie、session 與 token 的區(qū)別有一些初學(xué)者會混淆 cookie、session 和 token。簡要說一下cookie 是存儲在瀏覽器端的少量數(shù)據(jù)每次請求自動攜帶。session 是存儲在服務(wù)端的會話數(shù)據(jù)通過 session id 關(guān)聯(lián)用戶狀態(tài)。token 是一種憑證通常由服務(wù)端簽發(fā)客戶端保存后隨請求發(fā)送服務(wù)端校驗(yàn)其有效性。在 AI 應(yīng)用里token 往往用于兩層含義一是大模型的文本切分單元二是認(rèn)證憑證。遇到“token 過期”這類問題要先確認(rèn)說的是哪一層含義再對癥排查。6.4 常見 token 報(bào)錯及處理結(jié)合平時開發(fā)經(jīng)驗(yàn)我整理了一張 token 相關(guān)報(bào)錯的排查表問題現(xiàn)象常見原因解決思路401 Unauthorized: invalid tokenAPI Key 錯誤或已過期檢查密鑰是否有權(quán)限重新生成并配置token 數(shù)量超過模型上下文限制prompt 長度超出模型窗口做 prompt 截?cái)?、摘要壓縮或分段處理token 消耗過快、賬單異常循環(huán)調(diào)用或未做重試限制增加調(diào)用頻率限制設(shè)置單用戶配額token exchange failed認(rèn)證服務(wù)端異?;蚓W(wǎng)絡(luò)不通檢查認(rèn)證服務(wù)地址、網(wǎng)絡(luò)策略和服務(wù)可用性token endpoint returned 403 forbidden服務(wù)端策略拒絕該請求來源檢查賬號區(qū)域、訪問策略、請求來源 IP 是否被服務(wù)商允許credits 兌換 token 比例不清晰平臺按積分/額度方式計(jì)費(fèi)查閱平臺官方計(jì)費(fèi)文檔按實(shí)際模型定價測算注意遇到 403 forbidden 這類報(bào)錯時首先要檢查服務(wù)商是否允許你所在區(qū)域的賬號訪問以及請求來源 IP 是否符合服務(wù)商策略。任何繞過服務(wù)商區(qū)域限制的做法都不可取不僅違反平臺條款也可能帶來安全風(fēng)險。正確的做法是使用服務(wù)商認(rèn)可的訪問方式或聯(lián)系平臺獲取官方支持。6.5 如何在代碼中避免 token 超限調(diào)用大模型時一個非常常見的問題就是“prompt too long”。解決思路通常有這幾種提前估算 prompt 的 token 數(shù)量超過閾值前進(jìn)行截?cái)?。對長文本做摘要保留關(guān)鍵信息。使用支持更長上下文的模型。把長文本拆分成多個片段分批處理。下面是一個簡單的長度預(yù)檢示例MAX_INPUT_TOKENS 3000 def validate_prompt(prompt, tokenizer): token_count len(tokenizer.encode(prompt)) if token_count MAX_INPUT_TOKENS: raise ValueError(fprompt 過長當(dāng)前 {token_count} token超過限制 {MAX_INPUT_TOKENS}) return token_count在實(shí)際工程中還可以在異常捕獲里增加降級邏輯比如提示用戶縮短輸入或自動觸發(fā)摘要任務(wù)。7. 英偉達(dá)與 token 的產(chǎn)業(yè)分工誰在賺哪一份錢到現(xiàn)在我們已經(jīng)把英偉達(dá)不賣 token 的原因拆得很清楚了。總結(jié)一下核心邏輯可以歸納為三點(diǎn)。7.1 產(chǎn)業(yè)鏈定位決定商業(yè)模式英偉達(dá)希望做 AI 時代的算力基礎(chǔ)設(shè)施供應(yīng)商它賺的是“芯片 軟件棧 云計(jì)算”的錢。而 token 售賣屬于模型服務(wù)層的生意需要直接面向開發(fā)者、面對用戶運(yùn)營和英偉達(dá)目前的商業(yè)模式存在結(jié)構(gòu)性沖突。7.2 生態(tài)保護(hù)決定合作邊界英偉達(dá)的大客戶里有大量模型服務(wù)商。如果英偉達(dá)親自賣 token就相當(dāng)于和客戶競爭。這不是能力問題而是信任問題。一旦客戶產(chǎn)生“英偉達(dá)會搶我生意”的顧慮英偉達(dá)的芯片優(yōu)勢也會被削弱。7.3 利潤結(jié)構(gòu)決定選擇理性GPU 是高毛利產(chǎn)品而 token 服務(wù)正面臨激烈的價格戰(zhàn)。從商業(yè)收益角度看英偉達(dá)沒有理由主動進(jìn)入一個毛利率下降、競爭慘烈、且可能破壞現(xiàn)有主業(yè)的賽道。8. 關(guān)注 token也關(guān)注產(chǎn)業(yè)鏈通過這篇文章我們清楚了幾個關(guān)鍵點(diǎn)token 是大模型的文本切分單元也是 AI API 計(jì)費(fèi)的核心維度。按 token 計(jì)費(fèi)的本質(zhì)是按資源消耗計(jì)費(fèi)。英偉達(dá)不是沒能力賣 token而是它更適合做 GPU 和算力基礎(chǔ)設(shè)施供應(yīng)商。英偉達(dá)的戰(zhàn)略是通過 CUDA 生態(tài)、AI Enterprise 軟件棧、DGX Cloud 等方式鎖定 AI 產(chǎn)業(yè)鏈最底層的位置。對開發(fā)者來說理解 token 不只是為了讀懂賬單。在設(shè)計(jì) AI 應(yīng)用時token 估算、上下文管理、成本控制和異常處理都是真實(shí)落地時繞不開的工程問題。只有理解了 token 的經(jīng)濟(jì)學(xué)才能做出既好用又可控成本的 AI 產(chǎn)品。至于未來英偉達(dá)會不會推出一款“英偉達(dá)自家大模型 API”我認(rèn)為不會輕易發(fā)生。更大的可能是英偉達(dá)繼續(xù)用硬件、軟件和生態(tài)推動整個 AI 產(chǎn)業(yè)向前走讓更多玩家在模型和應(yīng)用的賽道上去競爭。而我們會繼續(xù)一邊用著 GPU 加速的算力一邊為大模型的 token 買單。