详情

首页手游攻略 在本地部署大模型ollama的保姆级教程实践整理

在本地部署大模型ollama的保姆级教程实践整理

佚名 2026-08-19 20:30:02

平时做技术实践时,很多问题不是概念不会,而是细节没串起来。拿“在本地部署大模型ollama的保姆级教程”来说,它看着像小点,放到项目里常会牵出环境、配置、兼容性和维护成本。下面按实际使用顺序,把思路、关键写法和容易踩坑的地方讲清楚,方便你直接对照操作。

一、部署方式选择

部署方式上手难度核心特点适用场景
Ollama命令极简,自动适配环境,自带 API 接口新手日常本地调用、更快测试
LM Studio图形化操作,无需敲代码,兼容 OpenAI 接口不想采用命令行、纯可视化采用
Text Generation WebUI⭐⭐⭐功能齐全,兼容模型微调、多种量化格式深度调试模型、个性化参数设置
vLLM⭐⭐⭐⭐推理速度快,高并发性能强搭建对外服务、生产环境部署

实际处理时,大家可以按需自我选择,我的建议是本地自己玩采用ollama,在企业采用最好用vLLM

二、ollama下载(windows电脑为例)

若官网能下载就用官网,不能就镜像地址,懂得都懂

  1. 官网地址:(链接已移除)
  2. 镜像地址:(链接已移除)

注意:后续下载模型一般都好几个G,可以在setting中设置模型下载地址

三、免费开源大模型选择

模型名称建议版本中文友好商用权限Ollama 下载命令最低显存建议显存最低内存建议内存硬件适配选型
通义千问 QwenQwen2:7b/14b免费可商用ollama run qwen2:7b
ollama run qwen2:14b
6G
10G
8-16G
16G+
16G
32G
32G
64G
16G 内存选 7b,32G 及以上内存选 14b
智谱 ChatGLMchatglm3:6b免费可商用ollama run chatglm3:6b5G6-8G16G32G常规家用内存均可流畅运行
Llama3llama3:8b个人免费商用受限ollama run llama3:8b6G8-16G16G32G16G 标准内存适配日常采用
DeepSeekdeepseek:7b个人免费商用受限ollama run deepseek:7b6G8-16G16G32G代码推理场景,16G 内存够用
Mixtralmixtral:8x7b免费可商用ollama run mixtral10G16G+32G64G大内存机型专属,长文本处理优选
Gemmagemma2:9b个人免费商用受限ollama run gemma2:9b8G12-16G16G32G主流内存设置均可稳定运行
Phi-3phi3:mini免费可商用ollama run phi3:mini3G4-6G8G16G低配小内存笔记本首选

实际处理时,我是16G内存,下载的是Qwen2:7b,直接在powershell上运行ollama run qwen2:7b

四、采用

选中模型直接对话即可,就可以采用了!!!

地址验证:(链接已移除)

五、项目集成(Spring AI框架为例)

  1. pom依赖
<dependencies>
        <dependency>
            <groupId>org.springframework.boot</groupId>
            <artifactId>spring-boot-starter-web</artifactId>
        </dependency>
        <!-- Spring AI Ollama 依赖 -->
        <dependency>
            <groupId>org.springframework.ai</groupId>
            <artifactId>spring-ai-starter-model-ollama</artifactId>
            <version>1.0.0</version>
        </dependency>
    </dependencies>
  1. yaml设置
spring:
  application:
    name: spring-ai-demo
  ai:
   ollama:
     base-url: http://localhost:11434
     chat:
       model: qwen2:7b
  1. 测试运行
package com.example.springaidemo.controller;
import org.springframework.ai.chat.client.ChatClient;
import org.springframework.web.bind.annotation.GetMapping;
import org.springframework.web.bind.annotation.RestController;
@RestController
public class AiController {
    private final ChatClient chatClient;
    // 自动注入 Ollama
    public AiController(ChatClient.Builder chatClientBuilder) {
        this.chatClient = chatClientBuilder.build();
    }
    // 测试接口
    @GetMapping("/ai")
    public String ask(String question) {
        return chatClient.prompt()
                .user(question)
                .call()
                .content();
    }
}

实际处理时,总的来说,本地部署大模型ollama这部分内容适合结合实际项目边做边理解。先抓住核心思路,再逐步补上细节和边界处理,最后效果会更稳定,也更容易复用。

点击查看更多
推荐专题
热门阅读