LLM / Gemma 4
Gemma 4 E2B IT
已发布 Gemma 4 E2B IT 的 RKLLM 镜像,并提供兼容 OpenAI 的 API。选择目标设备后,可选择量化方式(W4A16-G128 / W8A8)。
19 次下载
大小
5.54GB选择你正在使用的设备,设置指南和文档将相应更新。
快速开始
部署
sudo docker run --rm -d \
--name recomputer-rk-llm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e INTERACTIVE_CHAT=true \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/llm/gemma-4-e2b-it:rk3576-w4a16-g128模型详情
在 reComputer RK 上部署 LLM
本通用指南适用于目录中列出的所有 LLM。在模型页面中选择模型系列和量化方式,然后使用对应的已发布镜像标签。
已发布镜像格式
text
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:<platform>-<quantization>已发布的 LLM 镜像包含转换后的 .rkllm 模型、RKLLM 运行时和兼容 OpenAI 的服务器。可用标签列于各模型系列的目录记录中。W4A16/W4A16-G128 镜像通常仅适用于 RK3576;RK3588 记录使用 W8A8。
要求
- 运行 64 位 Linux 镜像的 reComputer RK3576 或 RK3588
- 已安装 Docker 和 Docker Buildx
- 通过
/dev访问 NPU - 开发板上的 8001 端口可用
示例使用 --privileged 和 -v /dev:/dev 访问 NPU。本地 API 不提供身份验证或 TLS;请仅在可信网络中使用。
运行已发布的 LLM
将 <model-id> 和 <platform>-<quantization> 替换为所选模型页面中显示的值。
RK3576
bash
sudo docker run --rm -it \
--name recomputer-rk-llm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e INTERACTIVE_CHAT=true \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3576-<quantization>RK3588
bash
sudo docker run --rm -it \
--name recomputer-rk-llm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e INTERACTIVE_CHAT=true \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/llm/<model-id>:rk3588-w8a8上述命令会启用终端交互式聊天。若要以后台模式运行,请将 -it 更改为 -d,并移除 INTERACTIVE_CHAT=true。
健康检查和文档
bash
curl http://localhost:8001/health
curl http://localhost:8001/docs当健康检查端点成功响应时,服务即已就绪。
兼容 OpenAI 的 API
非流式请求:
bash
curl http://localhost:8001/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{
"model": "rkllm-model",
"messages": [{"role": "user", "content": "Explain edge AI in one sentence."}],
"max_tokens": 128,
"stream": false
}'流式请求:
bash
curl -N http://localhost:8001/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{
"model": "rkllm-model",
"messages": [{"role": "user", "content": "Give me three uses for an edge AI board."}],
"max_tokens": 128,
"stream": true
}'Python 客户端:
python
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8001/v1", api_key="dummy-key")
response = client.chat.completions.create(
model="rkllm-model",
messages=[{"role": "user", "content": "Hello from reComputer RK."}],
max_tokens=128,
)
print(response.choices[0].message.content)兼容 Ollama 的 API
bash
curl http://localhost:8001/api/chat \
-H 'Content-Type: application/json' \
-d '{"model":"rkllm-model","messages":[{"role":"user","content":"Hello"}],"stream":false}'停止运行和故障排查
bash
sudo docker logs recomputer-rk-llm
sudo docker stop recomputer-rk-llm如果平台检测失败,请设置 TARGET_PLATFORM=rk3576 或 TARGET_PLATFORM=rk3588。如果 8001 端口已被占用,请更改主机侧的端口映射,并使用新的 API URL。
输入与输出
输入:文本提示词或聊天消息。输出:通过兼容 OpenAI 的 API 生成的文本。