LLM / Gemma 4

Gemma 4 E2B IT

已发布 Gemma 4 E2B IT 的 RKLLM 镜像,并提供兼容 OpenAI 的 API。选择目标设备后,可选择量化方式(W4A16-G128 / W8A8)。

19 次下载
大小
5.54GB

选择你正在使用的设备,设置指南和文档将相应更新。

快速开始

部署
sudo docker run --rm -d \
  --name recomputer-rk-llm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e INTERACTIVE_CHAT=true \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/llm/gemma-4-e2b-it:rk3576-w4a16-g128

模型详情

在 reComputer RK 上部署 LLM

本通用指南适用于目录中列出的所有 LLM。在模型页面中选择模型系列和量化方式,然后使用对应的已发布镜像标签。

已发布镜像格式

text
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:<platform>-<quantization>

已发布的 LLM 镜像包含转换后的 .rkllm 模型、RKLLM 运行时和兼容 OpenAI 的服务器。可用标签列于各模型系列的目录记录中。W4A16/W4A16-G128 镜像通常仅适用于 RK3576;RK3588 记录使用 W8A8。

要求

  • 运行 64 位 Linux 镜像的 reComputer RK3576 或 RK3588
  • 已安装 Docker 和 Docker Buildx
  • 通过 /dev 访问 NPU
  • 开发板上的 8001 端口可用

示例使用 --privileged-v /dev:/dev 访问 NPU。本地 API 不提供身份验证或 TLS;请仅在可信网络中使用。

运行已发布的 LLM

<model-id><platform>-<quantization> 替换为所选模型页面中显示的值。

RK3576

bash
sudo docker run --rm -it \
  --name recomputer-rk-llm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e INTERACTIVE_CHAT=true \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3576-<quantization>

RK3588

bash
sudo docker run --rm -it \
  --name recomputer-rk-llm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e INTERACTIVE_CHAT=true \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3588-w8a8

上述命令会启用终端交互式聊天。若要以后台模式运行,请将 -it 更改为 -d,并移除 INTERACTIVE_CHAT=true

健康检查和文档

bash
curl http://localhost:8001/health
curl http://localhost:8001/docs

当健康检查端点成功响应时,服务即已就绪。

兼容 OpenAI 的 API

非流式请求:

bash
curl http://localhost:8001/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "rkllm-model",
    "messages": [{"role": "user", "content": "Explain edge AI in one sentence."}],
    "max_tokens": 128,
    "stream": false
  }'

流式请求:

bash
curl -N http://localhost:8001/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "rkllm-model",
    "messages": [{"role": "user", "content": "Give me three uses for an edge AI board."}],
    "max_tokens": 128,
    "stream": true
  }'

Python 客户端:

python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8001/v1", api_key="dummy-key")
response = client.chat.completions.create(
    model="rkllm-model",
    messages=[{"role": "user", "content": "Hello from reComputer RK."}],
    max_tokens=128,
)
print(response.choices[0].message.content)

兼容 Ollama 的 API

bash
curl http://localhost:8001/api/chat \
  -H 'Content-Type: application/json' \
  -d '{"model":"rkllm-model","messages":[{"role":"user","content":"Hello"}],"stream":false}'

停止运行和故障排查

bash
sudo docker logs recomputer-rk-llm
sudo docker stop recomputer-rk-llm

如果平台检测失败,请设置 TARGET_PLATFORM=rk3576TARGET_PLATFORM=rk3588。如果 8001 端口已被占用,请更改主机侧的端口映射,并使用新的 API URL。

输入与输出

输入:文本提示词或聊天消息。输出:通过兼容 OpenAI 的 API 生成的文本。