
5分鐘跑通text-generation-webui本地大模型極簡部署【免費(fèi)下載鏈接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/te/textgen你的機(jī)器只有 8G 顯存卻想私有化地跑一個(gè)本地大模型還要能接 API。text-generation-webui 是一款開源的本地 LLM 部署應(yīng)用文本對話、視覺理解、工具調(diào)用都支持還帶 OpenAI/Anthropic 兼容的 API數(shù)據(jù)全程不出你的機(jī)器。下面這幾分鐘我們把整套流程跑通。選對你的路 裝錯(cuò)依賴是最常見的坑而依賴該裝哪一套看你的硬件就行。項(xiàng)目把依賴按硬件拆好了都在 requirements/full/ 目錄下對照這張表定位你的方案你的硬件推薦路徑對應(yīng)依賴文件NVIDIA 顯卡一鍵啟動(dòng)腳本CUDA 加速requirements/full/requirements.txtAMD 顯卡一鍵啟動(dòng)腳本ROCmrequirements/full/requirements_amd.txtApple M 系列芯片一鍵啟動(dòng)腳本Metalrequirements/full/requirements_apple_silicon.txt純 CPU一鍵啟動(dòng)腳本requirements/full/requirements_cpu_only.txt多項(xiàng)目 / 服務(wù)器部署Docker 容器化部署docker/拿不準(zhǔn)就用 Dockerdocker/ 目錄里 nvidia、amd、cpu、intel 都有現(xiàn)成配置系統(tǒng)環(huán)境一點(diǎn)不碰。三步跑起來 路線定下來后面其實(shí)就三步裝、配、啟。裝先把代碼拉到本地就這兩行g(shù)it clone https://gitcode.com/GitHub_Trending/te/textgen cd textgen放心啟動(dòng)腳本自帶環(huán)境隔離——它會(huì)自動(dòng)下載 Miniforge、在項(xiàng)目目錄里建一個(gè)獨(dú)立的 Python 環(huán)境你系統(tǒng)里已有的 Python 全家桶基本不會(huì)被碰。配接下來給自己定制啟動(dòng)參數(shù)。打開 user_data/CMD_FLAGS.txt把你希望每次啟動(dòng)都生效的參數(shù)寫進(jìn)去每行一個(gè)比如--auto-launch --listen --api三個(gè)參數(shù)分別的意思--auto-launch啟動(dòng)后自動(dòng)打開瀏覽器--listen讓局域網(wǎng)里別的設(shè)備也能訪問--api把 OpenAI 兼容的 API 服務(wù)打開。text-generation-webui 會(huì)把這個(gè)文件當(dāng)成持久化的參數(shù)配置寫一次以后就不用再敲了。啟Linux 上把這行貼進(jìn)終端./start_linux.sh第一次跑要裝依賴耐心等它走完然后瀏覽器會(huì)自己彈出 http://localhost:7860。Windows 用戶直接雙擊 start_windows.batmacOS 用戶跑 start_macos.sh效果一樣。調(diào)出你的風(fēng)格 ??模型加載好之后如果輸出太穩(wěn)或者老是車轱轆話八成是參數(shù)問題。Parameters 頁的參數(shù)你不用全背先把這 5 個(gè)調(diào)明白就夠用了參數(shù)它控制什么起步推薦值max_new_tokens一次最多輸出多少 token512temperature輸出的隨機(jī)程度0 是純確定性0.7top_p候選詞池的寬窄0.9repetition_penalty重復(fù)懲罰1 表示不懲罰1.1Truncate the prompt up to this length提示詞截?cái)嗌舷抟蚕喈?dāng)于顯存護(hù)欄保持加載模型后的自動(dòng)值打個(gè)比方temperature 是創(chuàng)意旋鈕擰得越低輸出越一本正經(jīng)top_p 管的是模型敢不敢即興越低越保守。max_new_tokens 別貪大它擠占的上下文預(yù)算會(huì)反過來截?cái)嗄愕奶崾驹~。懶得自己調(diào)的話同一頁的預(yù)設(shè)菜單里有社區(qū)票選出來的組合一鍵切換每個(gè)參數(shù)的詳細(xì)解釋在 docs/03 - Parameters Tab.md。按需解鎖 如果你要在同一臺(tái)機(jī)器上并行幾個(gè)項(xiàng)目或者往服務(wù)器上部署、不想污染宿主機(jī)Docker 容器化部署就是最省心的選擇。docker/ 目錄為 nvidia、amd、cpu、intel 各硬件都備好了 Dockerfile 和 compose 文件。以 NVIDIA 為例cd textgen docker compose -f docker/nvidia/docker-compose.yml up --build首次構(gòu)建要等一會(huì)兒相當(dāng)于把整套環(huán)境打包進(jìn)鏡像之后再拉起來就是秒級。如果它提示缺少 .env 文件先按 docs/09 - Docker.md 的說明準(zhǔn)備一下。量化省顯存、模型訓(xùn)練、外掛擴(kuò)展這些高級玩法docs/ 目錄里各有一篇用到時(shí)再翻??ㄗ×丝催@里 癥狀一句話解法相關(guān)文件加載模型報(bào) CUDA out of memory加--load-in-8bit或--load-in-4bit量化加載體積減半、精度微損user_data/CMD_FLAGS.txt局域網(wǎng)其他設(shè)備訪問不了加--listen順手檢查一下端口和防火墻user_data/CMD_FLAGS.txt依賴裝不進(jìn)去、版本互相打架換 Docker 部署環(huán)境隔離一步到位docker/生成速度不滿意調(diào)小 max_new_tokens或換個(gè)預(yù)設(shè) / 更小的模型user_data/presets/把下載好的模型加載、點(diǎn)一下生成吧。跑通之后翻一翻 user_data/presets/換個(gè)生成預(yù)設(shè)試試新風(fēng)格?!久赓M(fèi)下載鏈接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/te/textgen創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考