openbmb/MiniCPM-o-4_5 icon

openbmb/MiniCPM-o-4_5

认领

MiniCPM-o 4.5 是 openbmb 在 Hugging Face 上推出的 9B 参数多模态模型,支持视觉、语音、OCR 与全双工直播工作流,并提供指令与思考模式及多种部署方式。

openbmb/MiniCPM-o-4_5

概述

MiniCPM-o 4.5 是 openbmb 在 Hugging Face 上推出的一个多模态模型,将视觉、语音和直播能力整合到一个端到端系统中。模型卡将其描述为 MiniCPM-o 系列中最新、能力最强的模型,由 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 构建,总计 9B 参数。

来源重点介绍了该模型的四项主要任务:视觉理解、实时语音对话、全双工多模态直播,以及 OCR/文档解析。它还指出,该模型支持英语和中文的双语语音,整体覆盖 30 多种语言,并提供多种部署路径,从 Nvidia GPU 上的 PyTorch 到 llama.cpp、Ollama、vLLM、SGLang、量化格式和 FlagOS。

主要特性

9B 参数多模态模型

该模型由 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 端到端构建,总计 9B 参数,并被呈现为 MiniCPM-o 系列中的最新模型。

指令与思考模式

MiniCPM-o 4.5 在单一模型中同时支持指令模式和思考模式,用户无需切换模型即可在更快响应与更深层推理行为之间进行选择。

语音对话能力

该模型支持英语和中文的双语实时语音对话、可配置的助手音色、声音克隆,以及基于简短参考音频的角色扮演。

全双工直播

它可以同时处理连续音频和视频流,并并发生成文本与语音输出,从而实现不受模态阻塞的全双工实时交互。

高分辨率视觉输入

该模型可处理最高 180 万像素的高分辨率图像和最高 10 fps 的高帧率视频,并被描述为在 OCR 和文档解析任务上表现出色。

多种推理与部署选项

页面列出了多种部署路径,包括在 Nvidia GPU 上使用 PyTorch、llama.cpp、Ollama、量化 int4 和 GGUF 模型、vLLM、SGLang 以及 FlagOS 支持。

常见用例

  • 多模态助手工作流

    当你需要一个既能回答图像、文档页面或其他视觉输入问题,又能处理语音交互的单一系统时,可使用该模型。

  • 实时语音助手

    适用于必须实时倾听并响应的直播对话代理,包括支持英语和中文语音交互且音色可配置的场景。

  • 全双工直播

    适用于将摄像头输入与音频结合并持续输出的应用,例如演示体验、具身接口或实时场景讲解。

  • 文档与 OCR 处理

    当 OCR 或文档解析是工作的一部分时可使用,尤其适合高分辨率页面和图像密集型工作流。

  • 本地与优化部署

    当你需要通过 PyTorch、llama.cpp、Ollama、vLLM、SGLang 或量化格式进行本地或优化推理时,可使用可部署版本和运行时支持。

Pros and Cons

Pros

  • 将视觉、语音和流式行为整合到一个模型中,而不是需要多个独立系统。
  • 同时支持指令模式和思考模式,让用户可以在效率和更深层推理之间进行选择。
  • 提供多种部署选项,包括偏向 CPU 的路径、量化路径以及更高吞吐量的运行时。
  • 支持多语言语音和超过 30 种语言,扩大了实际使用场景。
  • 在通用多模态理解之外,还包含 OCR 和文档解析能力。

Cons

  • 来源将基础使用描述为在 Nvidia GPU 上进行 PyTorch 推理,因此最直接的设置并不适合所有环境,且不够轻量。
  • 某些能力,如全双工直播和主动交互,属于专业功能,相比标准单轮推理可能需要更复杂的集成。
  • 收集到的定价信息针对的是 Hugging Face 的通用服务,而不是 MiniCPM-o 4.5 的模型专属定价。

FAQ

MiniCPM-o 4.5 是什么类型的模型?

MiniCPM-o 4.5 被定位为用于视觉、语音和全双工直播的多模态模型。它被描述为一个同时支持指令模式和思考模式的单一模型。

MiniCPM-o 4.5 可以如何运行?

来源说明该模型可通过在 Nvidia GPU 上进行 PyTorch 推理用于基础使用,也支持 llama.cpp 和 Ollama 进行 CPU 推理、支持量化 int4 和 GGUF 格式、支持用于更高吞吐量推理的 vLLM 和 SGLang,以及用于统一多芯片后端插件的 FlagOS。

除了文本和图像理解之外,该模型还支持什么?

该模型被描述为支持英语和中文的实时语音对话,以及全双工多模态直播,即在处理视频和音频输入的同时并发生成文本和语音输出。

文中提到哪些输入类型和语言覆盖?

模型卡说明 MiniCPM-o 4.5 可以处理最高 180 万像素的高分辨率图像、最高 10 fps 的高帧率视频,并支持超过 30 种语言的多语言能力。

在 Hugging Face 上使用该模型是否有公开定价?

Hugging Face 的定价页面确认 Hugging Face 提供付费基础设施和推理服务,但所收集的来源并未提供 MiniCPM-o 4.5 的模型专属定价。

Quick Facts

提供方
openbmb
平台
Hugging Face
模型类型
多模态模型
模态
视觉、语音、音频、视频、文本
参数量
9B
来源域名
huggingface.co

openbmb/MiniCPM-o-4_5 数据分析

流量数据仅供参考。

流量与排名

月访问量
2711.8万
平均访问时长
05:14
每次访问页数
6.35

流量趋势

主要访问地区

  • 美国: 19.2%
  • 中国: 11.1%
  • 印度: 9.48%
  • 俄罗斯: 5.08%
  • 德国: 4.72%
  • 其他: 50.4%

流量来源

  • 直接访问: 43.4%
  • 搜索: 32.9%
  • 引荐: 10.3%
  • 社交: 9.11%
  • 邮件: 0.74%
  • 展示广告: 0.13%
openbmb/MiniCPM-o-4_5 - AI Tool, Features, Use Cases & Alternatives | Findings24