openbmb/MiniCPM-o-4_5 icon

openbmb/MiniCPM-o-4_5

認領

openbmb/MiniCPM-o-4_5 是 Hugging Face 上的 9B 多模態模型,支援視覺、語音、OCR 與全雙工直播工作流程,具備 instruct 與 thinking 模式,並可透過 PyTorch、llama.cpp、Ollama、vLLM、SGLang 部署。

openbmb/MiniCPM-o-4_5

概述

MiniCPM-o 4.5 是 openbmb 在 Hugging Face 上的多模態模型,將視覺、語音與直播能力整合於單一端到端系統中。模型卡將其描述為 MiniCPM-o 系列中最新且能力最強的模型,由 SigLip2、Whisper-medium、CosyVoice2 與 Qwen3-8B 構成,總參數為 9B。

來源強調了該模型的四項主要任務:視覺理解、即時語音對話、全雙工多模態直播,以及 OCR/文件解析。也指出該模型支援英文與中文的雙語語音、整體超過 30 種語言,並提供多種部署路徑,涵蓋在 Nvidia GPU 上使用 PyTorch、llama.cpp、Ollama、vLLM、SGLang、量化格式與 FlagOS。

主要功能

9B 參數多模態模型

該模型由 SigLip2、Whisper-medium、CosyVoice2 與 Qwen3-8B 端到端構建,總參數為 9B,並被呈現為 MiniCPM-o 系列中的最新模型。

Instruct 與 thinking 模式

MiniCPM-o 4.5 在單一模型中同時支援 instruct 與 thinking 模式,讓使用者可在較快回應與更深入推理行為之間選擇,而無需切換模型。

語音對話功能

該模型支援英文與中文的即時雙語語音對話、可設定的助理聲線、聲音複製,以及透過短參考音訊片段進行角色扮演。

全雙工直播

它可以在生成文字與語音輸出的同時,並行處理持續的音訊與視訊串流,從而實現不阻塞不同模態的全雙工即時互動。

高解析度視覺輸入

該模型可處理最高達 180 萬像素的高解析度圖片與最高 10 fps 的高幀率影片,並被描述為在 OCR 與文件解析任務上表現出色。

多種推理與部署選項

頁面列出多種部署路徑,包括在 Nvidia GPU 上使用 PyTorch、llama.cpp、Ollama、量化 int4 與 GGUF 模型、vLLM、SGLang,以及 FlagOS 支援。

常見使用案例

  • 多模態助理工作流程

    當你需要一個系統同時回答關於圖片、文件頁面或其他視覺輸入的問題,並處理與語音相關的互動時,使用此模型。

  • 即時語音助理

    用於必須即時聆聽並回應的即時對話代理,包括英文與中文的雙語語音互動,以及可設定聲線的情境。

  • 全雙工直播

    用於結合攝影機輸入與音訊、並持續輸出內容的應用,例如展示體驗、具身介面或即時場景評論。

  • 文件與 OCR 處理

    當 OCR 或文件解析是工作的一部分時使用,特別是高解析度頁面與以圖片為主的工作流程。

  • 本地與最佳化部署

    當你需要透過 PyTorch、llama.cpp、Ollama、vLLM、SGLang 或量化格式進行本地或最佳化推理時,使用可部署版本與執行階段支援。

Pros and Cons

Pros

  • 將視覺、語音與串流行為整合在同一模型中,而無需分別使用多個系統。
  • 同時支援 instruct 與 thinking 模式,讓使用者可在效率與更深入推理之間做選擇。
  • 提供多種部署選項,包括偏向 CPU 的路徑與量化路徑,以及更高吞吐量的執行環境。
  • 支援多語語音與超過 30 種語言,擴大了實際可用場景。
  • 除一般多模態理解外,還具備 OCR 與文件解析能力。

Cons

  • 來源將基本使用描述為在 Nvidia GPU 上進行 PyTorch 推理,因此對所有環境而言,最直接的設定並不輕量。
  • 部分能力,例如全雙工直播與主動式互動,屬於專門功能,與標準單輪推理相比,可能需要更複雜的整合。
  • 彙整到的定價資訊是關於 Hugging Face 整體服務,而非 MiniCPM-o 4.5 的模型專屬定價。

FAQ

MiniCPM-o 4.5 是什麼類型的模型?

MiniCPM-o 4.5 被定位為用於視覺、語音與全雙工直播的多模態模型。它被呈現為一個同時支援 instruct 與 thinking 模式的單一模型。

MiniCPM-o 4.5 可以如何執行?

來源指出,該模型可在 Nvidia GPU 上使用 PyTorch 推理進行基本使用,也支援 llama.cpp 與 Ollama 進行 CPU 推理、量化 int4 與 GGUF 格式、用於更高吞吐量推理的 vLLM 與 SGLang,以及用於統一多晶片後端外掛的 FlagOS。

除了文字與影像理解之外,該模型還支援什麼?

該模型據稱支援英文與中文的即時語音對話,以及全雙工多模態直播,可在處理影音輸入的同時並行生成文字與語音輸出。

提到哪些輸入類型與語言覆蓋範圍?

模型卡說明 MiniCPM-o 4.5 可處理最高達 180 萬像素的高解析度圖片、最高 10 fps 的高幀率影片,並支援超過 30 種語言的多語能力。

在 Hugging Face 上使用這個模型有公開定價嗎?

Hugging Face 的定價頁面確認 Hugging Face 提供付費基礎設施與推理服務,但所收集的來源並未提供 MiniCPM-o 4.5 的模型專屬定價。

Quick Facts

提供者
openbmb
平台
Hugging Face
模型類型
多模態模型
模態
視覺、語音、音訊、影片、文字
參數量
9B
來源網域
huggingface.co

openbmb/MiniCPM-o-4_5 數據分析

流量數據僅供參考。

流量與排名

月造訪量
2711.8萬
平均造訪時長
05:14
每次造訪頁數
6.35

流量趨勢

主要造訪地區

  • 美國: 19.2%
  • 中國: 11.1%
  • 印度: 9.48%
  • 俄羅斯: 5.08%
  • 德國: 4.72%
  • 其他: 50.4%

流量來源

  • 直接造訪: 43.4%
  • 搜尋: 32.9%
  • 引薦: 10.3%
  • 社群: 9.11%
  • 郵件: 0.74%
  • 展示廣告: 0.13%