openbmb/MiniCPM-o-4_5 icon

openbmb/MiniCPM-o-4_5

認証する

openbmb/MiniCPM-o-4_5は、視覚・音声・OCR・フルデュプレックスのライブ配信ワークフローに対応するHugging Face上の9Bマルチモーダルモデル。PyTorch、llama.cpp、Ollama、vLLM、SGLangで導入可能。

openbmb/MiniCPM-o-4_5

概要

MiniCPM-o 4.5は、Hugging Face上のopenbmbによるマルチモーダルモデルで、視覚、音声、ライブ配信機能を1つのエンドツーエンドシステムにまとめています。モデルカードでは、SigLip2、Whisper-medium、CosyVoice2、Qwen3-8Bをベースにした、MiniCPM-oシリーズで最新かつ最も高性能なモデルであり、9Bパラメータを持つと説明されています。

ソースでは、このモデルの主な用途として、視覚理解、リアルタイム音声会話、フルデュプレックスのマルチモーダルライブ配信、OCR/文書解析の4つが挙げられています。また、英語と中国語のバイリンガル音声、全体で30以上の言語、さらにNvidia GPU上のPyTorchからllama.cpp、Ollama、vLLM、SGLang、量子化形式、FlagOSまで、複数の導入経路に対応していることも示されています。

主な特徴

9Bパラメータのマルチモーダルモデル

このモデルはSigLip2、Whisper-medium、CosyVoice2、Qwen3-8Bからエンドツーエンドで構築され、合計9Bパラメータを持ち、MiniCPM-oシリーズの最新モデルとして紹介されています。

Instructモードとthinkingモード

MiniCPM-o 4.5は、1つのモデルでinstructモードとthinkingモードの両方をサポートしており、モデルを切り替えることなく、より高速な応答とより深い推論動作を選べます。

音声会話機能

このモデルは、英語と中国語でのバイリンガルなリアルタイム音声会話、設定可能なアシスタント音声、ボイスクローニング、短い参照音声クリップからのロールプレイをサポートしています。

フルデュプレックスのライブ配信

連続する音声と映像のストリームを同時に処理しながらテキストと音声の出力を並行生成でき、モダリティ間でブロックせずにフルデュプレックスのライブ対話を実現します。

高解像度の視覚入力

このモデルは最大180万ピクセルの高解像度画像と最大10fpsの高FPS動画を扱え、OCRや文書解析タスクに強いと説明されています。

複数の推論・導入オプション

ページには、Nvidia GPU上のPyTorch、llama.cpp、Ollama、量子化されたint4およびGGUFモデル、vLLM、SGLang、FlagOS対応を含む複数の導入経路が記載されています。

一般的なユースケース

  • マルチモーダルアシスタントのワークフロー

    画像、文書ページ、その他の視覚入力について質問に答えると同時に、音声関連のやり取りも処理できる1つのシステムが必要な場合に使用します。

  • リアルタイム音声アシスタント

    設定可能な音声による英語と中国語の音声対話を含め、リアルタイムで聞いて応答する必要があるライブ会話エージェントに使用します。

  • フルデュプレックスのライブ配信

    デモ体験、身体性インターフェース、ライブシーン解説など、カメラ入力と音声を継続的な出力と組み合わせるアプリケーションに使用します。

  • 文書処理とOCR

    OCRや文書解析が業務の一部であり、特に高解像度ページや画像中心のワークフローで必要な場合に使用します。

  • ローカルおよび最適化された導入

    PyTorch、llama.cpp、Ollama、vLLM、SGLang、または量子化形式を通じて、ローカルまたは最適化された推論が必要な場合に、導入可能なバリアントと実行時サポートを使用します。

Pros and Cons

Pros

  • 視覚、音声、ストリーミングの動作を1つのモデルにまとめており、別々のシステムを必要としません。
  • instructモードとthinkingモードの両方に対応しているため、効率性と深い推論のどちらを重視するかを選べます。
  • CPU向けや量子化パスに加えて、より高スループットなランタイムも含む複数の導入オプションがあります。
  • 多言語音声と30以上の言語に対応しており、実用的なユースケースが広がります。
  • 一般的なマルチモーダル理解に加えて、OCRおよび文書解析機能を備えています。

Cons

  • ソースでは基本的な使用方法としてNvidia GPU上でのPyTorch推論が説明されているため、最も直接的なセットアップはすべての環境で軽量ではありません。
  • フルデュプレックスのライブ配信やプロアクティブな対話など、一部の機能は特殊であり、標準的な単一ターン推論よりも複雑な統合が必要になる場合があります。
  • 収集された価格情報はHugging Faceのサービス全般に関するものであり、MiniCPM-o 4.5自体のモデル固有の料金ではありません。

FAQ

MiniCPM-o 4.5はどのようなモデルですか?

MiniCPM-o 4.5は、視覚、音声、フルデュプレックスのライブ配信を対象としたマルチモーダルモデルとして位置づけられています。instructモードとthinkingモードの両方に対応する単一モデルとして紹介されています。

MiniCPM-o 4.5はどのように実行できますか?

ソースによると、このモデルは基本的な用途ではNvidia GPU上でのPyTorch推論で利用でき、CPU推論向けにllama.cppとOllama、より高スループットな推論向けに量子化されたint4およびGGUF形式、vLLMとSGLang、そして統一マルチチップバックエンドプラグイン用のFlagOSにも対応しています。

テキストと画像の理解以外に、このモデルは何をサポートしていますか?

このモデルは、英語と中国語でのリアルタイム音声会話に加え、動画と音声の入力を処理しながらテキストと音声の出力を同時に生成できるフルデュプレックスのマルチモーダルライブ配信にも対応していると説明されています。

どのような入力タイプと言語対応が示されていますか?

モデルカードでは、MiniCPM-o 4.5は最大180万ピクセルの高解像度画像、最大10fpsの高FPS動画を処理でき、30以上の言語にわたる多言語機能をサポートすると述べられています。

Hugging Faceでこのモデルを使うための公開価格はありますか?

Hugging Faceの料金ページでは、Hugging Faceが有料のインフラと推論サービスを提供していることは確認できますが、収集されたソースにはMiniCPM-o 4.5のモデル固有の料金は記載されていません。

Quick Facts

提供元
openbmb
プラットフォーム
Hugging Face
モデルタイプ
マルチモーダルモデル
モダリティ
視覚、音声、オーディオ、動画、テキスト
パラメータ数
9B
ソースドメイン
huggingface.co

openbmb/MiniCPM-o-4_5 の分析

トラフィックデータは参考情報としてご利用ください。

トラフィックとランキング

月間訪問数
2711.8万
平均滞在時間
05:14
訪問あたりのページ数
6.35

トラフィック推移

主な地域

  • アメリカ合衆国: 19.2%
  • 中国: 11.1%
  • インド: 9.48%
  • ロシア: 5.08%
  • ドイツ: 4.72%
  • その他: 50.4%

トラフィックソース

  • 直接流入: 43.4%
  • 検索: 32.9%
  • 参照元: 10.3%
  • ソーシャル: 9.11%
  • メール: 0.74%
  • ディスプレイ広告: 0.13%