轻量高效的多模态理解能力,覆盖文本、图像、语音、OCR、视觉问答。
支持 API 快速集成,低延迟、低成本、高吞吐、灵活部署。
MULTIMODAL MODEL
用一个轻量模型承接多种输入,让产品具备更自然、更完整的理解能力。
MODEL LAB

支持 JPG / PNG / WebP,大小不超过 10MB
摘要、分类、情感分析
场景、物体、属性分析
印刷体与手写体识别
多语言转写与标点
基于图像的问答
JSON / 表格结果
| 模型版本 | 参数规模 | 上下文长度 | 推理延迟 | 显存占用 | 适用场景 |
|---|---|---|---|---|---|
| multimodal-small-v1.6 | 8.2B | 64K | 328 ms | 16 GB | 通用场景 |
| multimodal-small-v1.6-lite | 4.1B | 32K | 188 ms | 8 GB | 高并发场景 |
| multimodal-nano-v1.6 | 1.2B | 16K | 98 ms | 3 GB | 边缘设备 |
POST https://api.xiangchen.com/v1/chat/completions
Authorization: Bearer API_KEY
{
"model": "multimodal-small-v1.6",
"messages": [{ "role": "user",
"content": "请描述这张图片的内容" }],
"temperature": 0.3
}查看 API 文档