本地模型部署
Chunbin Lv4

最近换了个新的MBP,有了32G的内存还有苹果的统一内存技术,尝试部署一个本地模型

技术选择

我们选择vLLM来部署本地模型。选择他的理由:

模型选择

模型选择首先得找适合自己电脑的,我们这里使用社区的方案llmfit

1
2
// 查看适合自己硬件的模型
llmfit

就会出现下面这个页面

我们主要关注几个点Mem,tok/s,Params,他们的意思是占用我们多少内存,能吐多少个token/s和多少参数,其中Mem越低越好,tok/s我感觉10多已经够用了,参数当然也是越多越好(跑的动的前提下)。

同时我们要注意以下几个点

不选择Mem占用高的

因为除了模型占用内存,你的上下文也会被存进KV存储,也是占用内存,如果你选太满,会导致你的上下文没有空间,导致如果发长文或者聊天产高一点整个模型就卡死了,吐不出token了。这也是为什么模型ToC难做,因为每有人对话,就需要存储。

最好选带MLX的模型

MLX是苹果自己做的机器学习框架,专门为 Apple Silicon 设计。因为苹果是统一内存,所以使用MLX的模型是能发挥模型最好效果。

最好选择国产的大模型

主要是中文语料训练足,比如Qwen、GLM、MiniMax等

选新不选旧

选越新的模型越好,原因:

  • 老模型一般训练不足
  • 知识蒸馏,新的小模型往往不是从零学的,而是由超大模型当老师教出来的,所以能超过以前相对较大的模型
  • 数据质量更好

选中文语料的模型/国产模型

训练模型中文语料越丰富、分词器的词表更合理对模型越好,他体现在几个方面:

  1. 更省token,比如它把常见词组(”人工智能”、”快速发展”、”生活方式”)合并成了单个 token
  2. 速度更快,省token意味着速度更快

综合以上,我选择了Qwen3.5-9B,https://huggingface.co/huihui-ai/Huihui-Qwen3.5-9B-abliterated-mlx-4bit

部署与使用

1
2
3
4
5
## 安装vllm-metal,是vllm的一个mlx支持
curl -fsSL https://raw.githubusercontent.com/vllm-project/vllm-metal/main/install.sh | bash

## 启动模型
source ~/.venv-vllm-metal/bin/activate && vllm serve "huihui-ai/Huihui-Qwen3.5-9B-abliterated-mlx-4bit" --port 8100 --max-model-len 65536 --gpu-memory-utilization 0.8 --enable-auto-tool-choice --tool-call-parser qwen3_xml

如何使用

通过openai协议连接上claude或者其他工具即可使用,但接入第三方工具的时候claude code的websearch等工具就用不了,需要额外的开发成本。

总结

实际跑下来模型太吃内存了,效果不是很理想,大概是20tok/s,但最大的问题是上下文不够,如果是类似claude code这种多轮循环调用工具的产品使用小模型,很容易就崩溃。如果想部署本地大模型一定要买大大大的存储,最近也听闻很多公司开始购买苹果的mac高配版来部署本地的大模型,不得不感慨苹果在AI时代的“躺赢”。另外最近也发现了一些自带本地LLM的应用,大部分原因是因为隐私,我想这可能是未来,随着大模型的加强,内存的扩产,也许有一天会每台电脑自带大模型完成相对简单的工作。

 评论
评论插件加载失败
正在加载评论插件
由 Hexo 驱动 & 主题 Keep
访客数 访问量