VLM / Qwen3.5

Qwen3.5 4B

此发布的 VLM 镜像将 Qwen3.5 4B 语言模型、其 RKNN 视觉编码器与兼容 OpenAI 的多模态 API 相结合。

23 次下载
大小
3.81GB

选择你正在使用的设备,设置指南和文档将相应更新。

快速开始

部署
sudo docker run --rm -d \
  --name recomputer-rk-vlm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e MODEL_KIND=vlm \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/vlm/qwen3.5-4b:rk3576-w4a16-g128

模型详情

在 reComputer RK 上部署 VLM

本通用指南适用于目录中列出的所有 VLM,包括 Qwen3.5。每个已发布的 VLM 镜像均包含与所选开发板和量化方式匹配的 RKLLM 语言模型和 RKNN 视觉编码器。

已发布的镜像格式

text
ghcr.io/seeed-projects/recomputer-rk-llm/vlm/<model-id>:<platform>-<quantization>

W4A16-G128 镜像通常仅适用于 RK3576。RK3588 VLM 记录使用 W8A8。

要求

  • 运行 64 位 Linux 镜像的 reComputer RK3576 或 RK3588
  • 已安装 Docker 和 Docker Buildx
  • 可通过 /dev 访问 NPU
  • 开发板上的 8001 端口可用

VLM 镜像使用兼容 OpenAI 的 API,不提供终端交互式聊天。

运行已发布的 VLM

<model-id><quantization> 替换为所选的目录记录。

RK3576

bash
sudo docker run --rm -d \
  --name recomputer-rk-vlm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e MODEL_KIND=vlm \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/vlm/<model-id>:rk3576-<quantization>

RK3588

bash
sudo docker run --rm -d \
  --name recomputer-rk-vlm \
  --privileged \
  -p 8001:8001 \
  -v /dev:/dev \
  -e MODEL_KIND=vlm \
  -e LOG_LEVEL=warning \
  ghcr.io/seeed-projects/recomputer-rk-llm/vlm/<model-id>:rk3588-w8a8

健康检查和 API 文档

bash
curl http://localhost:8001/health
curl http://localhost:8001/docs
curl http://localhost:8001/redoc

OpenAI 多模态请求

服务器每次请求接受一张图片。请使用公开的 HTTP(S) URL 或 base64 数据 URL。

bash
curl -X POST http://localhost:8001/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "rkllm-vision",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Describe this image in detail."},
        {"type": "image_url", "image_url": {"url": "https://example.com/your-image.jpg"}}
      ]
    }],
    "stream": false
  }'

对于本地图片,请在 image_url.url 中填入数据 URL:

text
data:image/jpeg;base64,<base64-encoded-image>

流式多模态请求

bash
curl -N -X POST http://localhost:8001/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "rkllm-vision",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "List the objects visible in this image."},
        {"type": "image_url", "image_url": {"url": "https://example.com/your-image.jpg"}}
      ]
    }],
    "stream": true
  }'

Python 客户端:

python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8001/v1", api_key="dummy-key")
response = client.chat.completions.create(
    model="rkllm-vision",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Describe this image."},
            {"type": "image_url", "image_url": {"url": "https://example.com/your-image.jpg"}},
        ],
    }],
    max_tokens=128,
)
print(response.choices[0].message.content)

Cherry Studio

配置自定义的 OpenAI 兼容提供商:

  • API 主机:http://<board-ip>:8001/v1
  • API 密钥:任意值,例如 rkllm-local
  • 模型:rkllm-vision

选择提供商后附加图片。

故障排除

  • 不要混用来自不同开发板或标签的语言模型与视觉编码器构件。
  • 如果服务器报告缺少视觉模型,请确认 MODEL_KIND=vlm 和已发布的镜像标签。
  • 使用 sudo docker logs recomputer-rk-vlm 检查启动输出。

输入与输出

输入:图像和文本提示词。输出:通过兼容 OpenAI 的 API 生成基于图像内容的文本。