一 OpenAI/Anthropic API 運(yùn)行任意模型的開源 AI 運(yùn)行時(shí))
LocalAI 文檔全覽與上手指南以統(tǒng)一 OpenAI/Anthropic API 運(yùn)行任意模型的開源 AI 運(yùn)行時(shí)【免費(fèi)下載鏈接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/lo/LocalAILocalAI 是一個(gè)可組合的開源 AI 運(yùn)行時(shí)——核心只負(fù)責(zé)對(duì)外提供 OpenAI 與 Anthropic 兼容 API而文本、視覺、語(yǔ)音、聲音、圖像、視頻、向量、重排序與智能體等每種推理能力都由按需拉取的獨(dú)立后端承載。本篇文章以倉(cāng)庫(kù)內(nèi)docs/content/_index.md文檔首頁(yè)為骨架結(jié)合倉(cāng)庫(kù)源碼與子文檔展開幫助你理解 LocalAI 的定位、快速在幾分鐘內(nèi)用 Docker 跑通第一個(gè)模型并掌握官方文檔六大分區(qū)的檢索路徑從而能夠獨(dú)立完成安裝 → 運(yùn)行模型 → 生產(chǎn)化運(yùn)維的完整閉環(huán)。LocalAI 是什么一個(gè)小核心 按需后端的 AI 運(yùn)行時(shí)docs/content/_index.md首頁(yè)對(duì)項(xiàng)目給出了精煉定義LocalAI is the open source AI runtime: a small core that speaks the OpenAI and Anthropic APIs, with each inference backend added only when a model needs it.這句話包含兩個(gè)關(guān)鍵設(shè)計(jì)統(tǒng)一的 API 外觀核心只講 OpenAI 與 Anthropic 的語(yǔ)言因此任何已適配 OpenAI SDK 的客戶端只需把 base URL 指向 LocalAI 即可完成替換無需改動(dòng)業(yè)務(wù)代碼。后端按需加載核心二進(jìn)制保持精簡(jiǎn)當(dāng)某個(gè)模型被真正加載時(shí)才拉取對(duì)應(yīng)的推理后端實(shí)現(xiàn)用什么裝什么而不是把每個(gè)引擎都編譯進(jìn)同一個(gè)二進(jìn)制里。從模態(tài)覆蓋面看LocalAI 可以運(yùn)行文本LLM、視覺理解、語(yǔ)音合成/識(shí)別、聲音分類、圖像與視頻生成、embedding、rerank 以及自主 Agentautonomous agents運(yùn)行環(huán)境橫跨 CPU 筆記本到分布式 GPU 集群且默認(rèn)無需 GPUNo GPU Required。與這一定位呼應(yīng)的源碼結(jié)構(gòu)清晰可見多語(yǔ)言后端群倉(cāng)庫(kù)backend/目錄下按語(yǔ)言分設(shè)backend/cpp/、backend/go/、backend/python/、backend/rust/例如backend/cpp/whisper、backend/go/piper、backend/python/diffusers、backend/rust/kokoros等印證了任何語(yǔ)言皆可實(shí)現(xiàn)后端的開放契約。統(tǒng)一 gRPC 后端契約docs/content/reference/architecture.md 明確說明 LocalAI 內(nèi)部每個(gè)后端本質(zhì)上就是一個(gè) gRPC server可以內(nèi)建管理也可以指定外部 gRPC serverpkg/grpc/下的client.go、server.go、interface.go正是這一層客戶端/服務(wù)端/接口抽象的落地實(shí)現(xiàn)。單一可執(zhí)行入口主程序 cmd/local-ai/main.go 是一個(gè) Go 二進(jìn)制使用kong完成 CLI 解析并在啟動(dòng)前依次探測(cè).env、localai.env、用戶主目錄下的localai.env與/etc/localai.env等環(huán)境變量文件其 CLI 幫助文本自稱drop-in replacement OpenAI API for running LLM, GPT and genAI models locally on CPU, GPUs with consumer grade hardware與首頁(yè)定位完全一致。一分鐘上手Docker 安裝并啟動(dòng)首頁(yè)給出的最簡(jiǎn)啟動(dòng)方式即 Dockerdocker run -ti --name local-ai -p 8080:8080 localai/localai:latest參數(shù)含義-p 8080:8080將容器的 8080 端口映射到本機(jī)--name local-ai為容器命名便于后續(xù)docker stop/start管理-ti保持交互輸出日志。啟動(dòng)成功后打開http://localhost:8080即可看到內(nèi)置 Web 界面——無需安裝任何額外工具就能聊天、瀏覽/安裝模型、創(chuàng)建 Agent、生成圖像與音頻、監(jiān)控系統(tǒng)資源。需要 GPU 加速時(shí)請(qǐng)按硬件選擇對(duì)應(yīng)鏡像下表完整來自 docs/content/getting-started/quickstart.md硬件Docker 鏡像僅 CPUlocalai/localai:latestNVIDIA CUDAlocalai/localai:latest-gpu-nvidia-cuda-12AMD (ROCm)localai/localai:latest-gpu-hipblasIntel GPUlocalai/localai:latest-gpu-intelVulkanlocalai/localai:latest-gpu-vulkanNVIDIA 場(chǎng)景需追加--gpus allAMD/Intel/Vulkan 場(chǎng)景需按硬件追加對(duì)應(yīng)--device參數(shù)。鏡像標(biāo)簽、構(gòu)建方式與依賴聲明可在倉(cāng)庫(kù)根目錄的 Dockerfile 以及backend/下各Dockerfile.*中進(jìn)一步核對(duì)。通過 Web 界面跑通第一次對(duì)話打開Models → Explore搜索qwen3-4b一個(gè)體積小、CPU 友好、且支持工具調(diào)用/function calling 的 Qwen3 模型點(diǎn)擊Install等待下載完成。打開Chat頁(yè)面在模型下拉框中選擇qwen3-4b輸入消息發(fā)送通常幾秒內(nèi)即可收到回復(fù)。若想修正歷史中的某條消息而無需重新推理可懸停到已保存消息選擇EditSave會(huì)更新該會(huì)話本地歷史Cancel則丟棄草稿。用 CLI 預(yù)裝模型與調(diào)用 APILocalAI 支持在啟動(dòng)時(shí)通過參數(shù)一次性安裝多個(gè)模型Docker 與本地 CLI 均適用首頁(yè)所屬文檔中給出的典型寫法如下local-ai run qwen3-4b local-ai run huggingface://TheBloke/phi-2-GGUF/phi-2.Q8_0.gguf local-ai run ollama://gemma:2b local-ai run https://gist.githubusercontent.com/.../phi-2.yaml local-ai run oci://localai/phi-2:latest可見模型來源支持模型庫(kù)名、Hugging Face、Ollama、遠(yuǎn)程 YAML 配置以及 OCI 鏡像等多種 URI。此外也可通過以下命令管理模型local-ai models list # 列出模型庫(kù)中可用模型 local-ai models install name # 安裝指定模型以上能力由 core/cli/models.go 與 core/cli/run.go 等命令模塊承載更完整的參數(shù)可用local-ai --help查看或參考 CLI 參考。啟動(dòng)服務(wù)后即可使用 OpenAI 兼容 APIcurl http://localhost:8080/v1/chat/completions \ -H Content-Type: application/json \ -d { model: qwen3-4b, messages: [{role: user, content: Hello!}] }除 OpenAI Chat/Completions 之外LocalAI 還兼容 Anthropic Messages API、Open Responses API 等協(xié)議各類端點(diǎn)的完整示例見 Try it out。遠(yuǎn)程暴露時(shí)的安全基線如果實(shí)例需要暴露到外網(wǎng)Quickstart 文檔明確給出了兩條安全基線務(wù)必在啟動(dòng)前設(shè)置簡(jiǎn)單 API 密鑰設(shè)置環(huán)境變量LOCALAI_API_KEYyour-key即可加門禁。注意API Key 授予完整管理員權(quán)限不區(qū)分角色。用戶認(rèn)證體系設(shè)置LOCALAI_AUTHtrue啟用多用戶支持提供 admin/user 角色區(qū)分、OAuth 登錄、按用戶 API Key 與用量追蹤細(xì)節(jié)見 認(rèn)證與授權(quán)。文檔分區(qū)導(dǎo)航六大門類覆蓋全生命周期_index.md的核心價(jià)值之一是給出官方文檔的導(dǎo)航地圖將其轉(zhuǎn)換為倉(cāng)庫(kù)內(nèi)可直接查閱的路徑如下分區(qū)解決什么問題倉(cāng)庫(kù)內(nèi)對(duì)應(yīng)文檔入口Getting started安裝、跑通第一個(gè)模型、調(diào)用 API、排查常見啟動(dòng)問題docs/content/getting-started/quickstart.md完整索引見 docs/content/getting-started/_index.en.mdFeatures按模態(tài)分類的全部能力文本、Agent、音頻、視覺、圖像與視頻、檢索、分布式推理、模型管理docs/content/features/_index.en.mdAdvanced模型配置、VRAM 管理、反向代理與 TLS 等細(xì)粒度控制面docs/content/advanced/_index.en.mdOperations實(shí)例的運(yùn)行與治理中間件、云與 MITM 代理、后端監(jiān)控docs/content/operations/_index.en.mdReference架構(gòu)、CLI 參數(shù)、兼容性表、API 與運(yùn)行時(shí)錯(cuò)誤、系統(tǒng)信息、二進(jìn)制docs/content/reference/_index.en.mdFAQ高頻問題的短問答docs/content/faq.md此外還有幾個(gè)常被需要的入口Integrations基于 LocalAI 構(gòu)建的工具與項(xiàng)目集合見 docs/content/integrations.md。News發(fā)布說明release notes所在地見 docs/content/whats-new.md。Model gallery模型庫(kù)是可安裝模型的貨架倉(cāng)庫(kù)內(nèi)的gallery/*.yaml如 gallery/qwen3.yaml、gallery/whisper-base.yaml、gallery/piper.yaml即模型清單定義配合 docs/content/features/model-gallery.md 使用可在 Web 界面或 CLI 中一鍵安裝。為什么能裝什么用什么從文檔定位到倉(cāng)庫(kù)實(shí)現(xiàn)的對(duì)照_index.md首頁(yè)反復(fù)強(qiáng)調(diào)的核心概念是composable可組合與按需加載。在倉(cāng)庫(kù)中可以找到三層互相印證的證據(jù)第一層多語(yǔ)言、多項(xiàng)目共存的 backend 矩陣。backend/下按語(yǔ)言劃分的數(shù)十個(gè)后端子項(xiàng)目C 的 llama-cpp、whisper、ds4Go 的 vllm-cpp、parakeet、piperPython 的 diffusers、fish-speech、transformersRust 的 kokoros 等說明每個(gè)后端都是圍繞某個(gè)同類最佳引擎封裝的獨(dú)立產(chǎn)物。它們通過獨(dú)立進(jìn)程被拉起、升級(jí)或卸載互不影響甚至可部署到另一臺(tái)機(jī)器上任一后端故障都不會(huì)拖垮核心——這正是首頁(yè)所述each inference backend added only when a model needs it的工程基礎(chǔ)。第二層gRPC 是唯一的后端接口契約。docs/content/reference/architecture.md 指出 Internally LocalAI backends are just gRPC server用戶甚至可以自寫任何語(yǔ)言的 gRPC server 在運(yùn)行時(shí)擴(kuò)展 LocalAIpkg/grpc/與backend/grpc/目錄下的實(shí)現(xiàn)如 pkg/grpc/client.go、pkg/grpc/server.go、pkg/grpc/interface.go為這一論斷提供直接源碼支撐。第三層模型安裝與后端解析的解耦。從 gallery YAML模型聲明到檢測(cè) GPU → 選擇后端鏡像 → 下載啟動(dòng)的鏈路可以在 core/gallery/model_artifacts.go 與 core/gallery/backend_resolve.go 等模塊看到端倪當(dāng)從 gallery 或 YAML 安裝模型時(shí)LocalAI 會(huì)自動(dòng)探測(cè) NVIDIA/AMD/Intel GPU 能力并下載對(duì)應(yīng)后端參見 GPU 加速。這也解釋了為何local-ai run qwen3-4b一行命令即可完成模型 后端 服務(wù)的閉環(huán)??v深能力與下一步路徑首頁(yè)將其能力畫像概括為可在受控硬件上運(yùn)行文本、視覺、語(yǔ)音、聲音、圖像、視頻、embeddings、reranking 與自主智能體。若想繼續(xù)深入推薦的閱讀順序是先讀 Overview 建立全局心智模型按 Quickstart 跑通首個(gè)模型之后根據(jù)目標(biāo)能力選擇對(duì)應(yīng)專區(qū)文本生成與工具調(diào)用見 text-generation、Agent 與 MCP 見 agents、分布式推理見 distributed_inferencing生產(chǎn)化反向代理/TLS、VRAM、中間件見 advanced 與 operations 分區(qū)遇到問題先查 FAQ 與 troubleshooting。按這一路徑走下去你既能快速落地一套私有化 AI 服務(wù)也能在需要時(shí)借助源碼與 gallery 配置把 LocalAI 擴(kuò)展成恰好符合自身需求的運(yùn)行時(shí)棧。一文總覽速查你需要做的事打開這里了解項(xiàng)目全貌與組成docs/content/overview.md首次安裝與運(yùn)行模型docs/content/getting-started/quickstart.md按模態(tài)查能力清單docs/content/features/_index.en.md模型/VRAM/TLS 等精細(xì)控制docs/content/advanced/_index.en.md中間件、代理、后端監(jiān)控docs/content/operations/_index.en.md架構(gòu)與 CLI 參考docs/content/reference/architecture.md高頻問答docs/content/faq.md【免費(fèi)下載鏈接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考