9B 参数多模态模型
该模型由 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 端到端构建,总计 9B 参数,并被呈现为 MiniCPM-o 系列中的最新模型。
MiniCPM-o 4.5 是 openbmb 在 Hugging Face 上推出的一个多模态模型,将视觉、语音和直播能力整合到一个端到端系统中。模型卡将其描述为 MiniCPM-o 系列中最新、能力最强的模型,由 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 构建,总计 9B 参数。
来源重点介绍了该模型的四项主要任务:视觉理解、实时语音对话、全双工多模态直播,以及 OCR/文档解析。它还指出,该模型支持英语和中文的双语语音,整体覆盖 30 多种语言,并提供多种部署路径,从 Nvidia GPU 上的 PyTorch 到 llama.cpp、Ollama、vLLM、SGLang、量化格式和 FlagOS。
该模型由 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 端到端构建,总计 9B 参数,并被呈现为 MiniCPM-o 系列中的最新模型。
MiniCPM-o 4.5 在单一模型中同时支持指令模式和思考模式,用户无需切换模型即可在更快响应与更深层推理行为之间进行选择。
该模型支持英语和中文的双语实时语音对话、可配置的助手音色、声音克隆,以及基于简短参考音频的角色扮演。
它可以同时处理连续音频和视频流,并并发生成文本与语音输出,从而实现不受模态阻塞的全双工实时交互。
该模型可处理最高 180 万像素的高分辨率图像和最高 10 fps 的高帧率视频,并被描述为在 OCR 和文档解析任务上表现出色。
页面列出了多种部署路径,包括在 Nvidia GPU 上使用 PyTorch、llama.cpp、Ollama、量化 int4 和 GGUF 模型、vLLM、SGLang 以及 FlagOS 支持。
当你需要一个既能回答图像、文档页面或其他视觉输入问题,又能处理语音交互的单一系统时,可使用该模型。
适用于必须实时倾听并响应的直播对话代理,包括支持英语和中文语音交互且音色可配置的场景。
适用于将摄像头输入与音频结合并持续输出的应用,例如演示体验、具身接口或实时场景讲解。
当 OCR 或文档解析是工作的一部分时可使用,尤其适合高分辨率页面和图像密集型工作流。
当你需要通过 PyTorch、llama.cpp、Ollama、vLLM、SGLang 或量化格式进行本地或优化推理时,可使用可部署版本和运行时支持。
MiniCPM-o 4.5 被定位为用于视觉、语音和全双工直播的多模态模型。它被描述为一个同时支持指令模式和思考模式的单一模型。
来源说明该模型可通过在 Nvidia GPU 上进行 PyTorch 推理用于基础使用,也支持 llama.cpp 和 Ollama 进行 CPU 推理、支持量化 int4 和 GGUF 格式、支持用于更高吞吐量推理的 vLLM 和 SGLang,以及用于统一多芯片后端插件的 FlagOS。
该模型被描述为支持英语和中文的实时语音对话,以及全双工多模态直播,即在处理视频和音频输入的同时并发生成文本和语音输出。
模型卡说明 MiniCPM-o 4.5 可以处理最高 180 万像素的高分辨率图像、最高 10 fps 的高帧率视频,并支持超过 30 种语言的多语言能力。
Hugging Face 的定价页面确认 Hugging Face 提供付费基础设施和推理服务,但所收集的来源并未提供 MiniCPM-o 4.5 的模型专属定价。
流量数据仅供参考。
书生是通用大模型体系,覆盖语言、多模态、气象海洋、工业设计、三维空间、金融与科学发现等场景,提供模型与平台能力;官网未公开价格、部署步骤或接入文档。
OpenAI 是一家 AI 研究与部署公司,聚焦 ChatGPT、API、Platform 工具和 Codex。适合个人、开发者和企业探索对话式 AI、构建模型应用并了解产品与研究更新。
小艺是华为自主研发的 AI 智慧助手,支持知识问答、AI 写作、文档阅读、代码辅助与识图,适合日常查询、内容处理和鸿蒙开发场景,并支持文件拖放输入。
AI Magicx 是一体化 AI 工作区,集聊天、图片、视频、语音、音乐、邮件和开发任务于一处,帮助创作者、团队和开发者集中使用多种模型,无需在多个工具和订阅间切换。
Hypertype 是面向工业领域支持团队的 AI agent,可减少重复性前线工作,兼容现有工具,并在企业咨询式上线流程中使用客户选定的数据。
Bible.ai is a Christian AI app for scripture-based conversations, faith questions, and biblical guidance through voice or text. It is positioned for believers and the Christian community rather than general-purpose AI use.