VLM / Qwen3.5
Qwen3.5 4B
此发布的 VLM 镜像将 Qwen3.5 4B 语言模型、其 RKNN 视觉编码器与兼容 OpenAI 的多模态 API 相结合。
23 次下载
大小
3.81GB选择你正在使用的设备,设置指南和文档将相应更新。
快速开始
部署
sudo docker run --rm -d \
--name recomputer-rk-vlm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e MODEL_KIND=vlm \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/vlm/qwen3.5-4b:rk3576-w4a16-g128模型详情
在 reComputer RK 上部署 VLM
本通用指南适用于目录中列出的所有 VLM,包括 Qwen3.5。每个已发布的 VLM 镜像均包含与所选开发板和量化方式匹配的 RKLLM 语言模型和 RKNN 视觉编码器。
已发布的镜像格式
text
ghcr.io/seeed-projects/recomputer-rk-llm/vlm/<model-id>:<platform>-<quantization>W4A16-G128 镜像通常仅适用于 RK3576。RK3588 VLM 记录使用 W8A8。
要求
- 运行 64 位 Linux 镜像的 reComputer RK3576 或 RK3588
- 已安装 Docker 和 Docker Buildx
- 可通过
/dev访问 NPU - 开发板上的 8001 端口可用
VLM 镜像使用兼容 OpenAI 的 API,不提供终端交互式聊天。
运行已发布的 VLM
将 <model-id> 和 <quantization> 替换为所选的目录记录。
RK3576
bash
sudo docker run --rm -d \
--name recomputer-rk-vlm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e MODEL_KIND=vlm \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/vlm/<model-id>:rk3576-<quantization>RK3588
bash
sudo docker run --rm -d \
--name recomputer-rk-vlm \
--privileged \
-p 8001:8001 \
-v /dev:/dev \
-e MODEL_KIND=vlm \
-e LOG_LEVEL=warning \
ghcr.io/seeed-projects/recomputer-rk-llm/vlm/<model-id>:rk3588-w8a8健康检查和 API 文档
bash
curl http://localhost:8001/health
curl http://localhost:8001/docs
curl http://localhost:8001/redocOpenAI 多模态请求
服务器每次请求接受一张图片。请使用公开的 HTTP(S) URL 或 base64 数据 URL。
bash
curl -X POST http://localhost:8001/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "rkllm-vision",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image in detail."},
{"type": "image_url", "image_url": {"url": "https://example.com/your-image.jpg"}}
]
}],
"stream": false
}'对于本地图片,请在 image_url.url 中填入数据 URL:
text
data:image/jpeg;base64,<base64-encoded-image>流式多模态请求
bash
curl -N -X POST http://localhost:8001/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "rkllm-vision",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "List the objects visible in this image."},
{"type": "image_url", "image_url": {"url": "https://example.com/your-image.jpg"}}
]
}],
"stream": true
}'Python 客户端:
python
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8001/v1", api_key="dummy-key")
response = client.chat.completions.create(
model="rkllm-vision",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image."},
{"type": "image_url", "image_url": {"url": "https://example.com/your-image.jpg"}},
],
}],
max_tokens=128,
)
print(response.choices[0].message.content)Cherry Studio
配置自定义的 OpenAI 兼容提供商:
- API 主机:
http://<board-ip>:8001/v1 - API 密钥:任意值,例如
rkllm-local - 模型:
rkllm-vision
选择提供商后附加图片。
故障排除
- 不要混用来自不同开发板或标签的语言模型与视觉编码器构件。
- 如果服务器报告缺少视觉模型,请确认
MODEL_KIND=vlm和已发布的镜像标签。 - 使用
sudo docker logs recomputer-rk-vlm检查启动输出。
输入与输出
输入:图像和文本提示词。输出:通过兼容 OpenAI 的 API 生成基于图像内容的文本。