マルチモーダル入力対応
Inklingは、テキスト、画像、音声を受け取りながらテキスト出力を生成する、マルチモーダルな自己回帰トランスフォーマーです。モデルカードでは、英語やその他の言語、さらに複数のコーディング言語向けであるとされています。
InklingはThinking Machines Labのオープンウェイト・マルチモーダル基盤モデル。テキスト、画像、音声を入力し、テキストを生成。Tinkerでファインチューニング可能。
InklingはThinking Machines Labのオープンウェイト・マルチモーダルモデルです。テキスト、画像、音声の入力を受け取り、テキスト出力を生成する汎用基盤モデルとして提供されており、英語、その他の言語、複数のコーディング言語に対応しています。
モデルカードでは、InklingはスパースMixture-of-Expertsルーティングを備えた66層のデコーダー専用トランスフォーマーで、総パラメータ数9750億、アクティブパラメータ数410億、最大100万トークンのコンテキストウィンドウを持つと説明されています。Thinking Machinesは、会話システム、エージェント的ワークフロー、コーディングツール、検索拡張アプリケーションを構築する開発者向けのカスタマイズ可能なベースモデルとして位置づけています。
InklingはApache 2.0の下でオープンウェイトとして配布され、Hugging Face経由で利用でき、Tinkerでファインチューニング可能です。発表資料では、同じファミリーの軽量版プレビューとしてInkling-Smallにも触れていますが、ソースページではInklingが主なリリースとして強調されています。
Inklingは、テキスト、画像、音声を受け取りながらテキスト出力を生成する、マルチモーダルな自己回帰トランスフォーマーです。モデルカードでは、英語やその他の言語、さらに複数のコーディング言語向けであるとされています。
このモデルは、総パラメータ数9750億、アクティブパラメータ数410億のスパースMixture-of-Expertsアーキテクチャを採用しています。モデルカードによると、各トークンは256個のエキスパートのうち6個と、2個の共有エキスパートにルーティングされます。
Inklingは最大100万トークンのコンテキストウィンドウをサポートしており、長文ドキュメントや長い会話のワークフローに適しています。
発表記事では、Inklingは制御可能な思考量によってコストと性能のバランスを取ると説明されています。これにより、タスクに応じて異なる推論努力レベルで使える基盤モデルになります。
InklingはTinkerでファインチューニング可能であり、Tinkerの製品ページではforward_backward、optim_step、sample、save_stateの4つの関数を通じた学習が説明されています。
モデルカードでは、重みはHugging Faceで利用できるほか、Tinkerおよびサードパーティの推論プロバイダー経由でもアクセス可能とされています。
開発者は、テキストの指示に応答するだけでなく、同じセッション内で画像や音声も解釈できるチャットボットやアシスタント型製品を構築できます。
コーディングコパイロット、ツール利用エージェント、検索拡張システムに取り組むチームは、下流の調整や統合のための汎用ベースモデルとしてInklingを利用できます。
研究者やプロダクトチームは、オープンウェイトをTinkerでファインチューニングし、カスタムの応答スタイルやドメインタスクなど、特定の挙動やワークフローに合わせてモデルを適応させられます。
長い文書、長時間の会話、複数ターンにまたがる拡張コンテキストを処理する必要があるアプリケーションは、最大100万トークンのコンテキストウィンドウを活用できます。
オープンウェイトのデプロイ選択肢を評価している組織は、モデルカードのチェックポイント情報とハードウェアガイダンスを使って、自社システムまたは対応プロバイダー経由での推論計画を立てられます。
Inklingはオープンウェイトモデルとして提供されており、重みはHugging Faceで公開されています。また、Tinkerおよびサードパーティの推論プロバイダー経由でも利用できます。発表資料とモデルカードでは、消費者向けチャットアプリではなく、下流の開発者向けに設計されていることが示されています。
モデルカードによると、Inklingはテキスト、画像、音声の入力を受け取り、テキスト出力を生成します。汎用の会話利用、指示追従、コーディング、エージェント的ワークフロー、検索拡張生成システム向けに設計されています。
Tinkerは、Inklingをファインチューニングするために使われる学習APIです。モデルカードではInklingがTinkerでファインチューニング可能とされており、発表記事では、アクティブな重みを更新する前に、Tinkerを使って自己ファインチューニングジョブを作成、実行、評価する流れが説明されています。
モデルカードでは、InklingはスパースMixture-of-Expertsルーティングを備えた66層のデコーダー専用トランスフォーマーとして説明されています。総パラメータ数は9750億、アクティブパラメータ数は410億で、最大100万トークンのコンテキストウィンドウをサポートします。
ソース資料には価格情報は記載されていません。価格ページのURLは現在404ページ(見つかりません)を返します。
Orcaは、コードエージェントでの開発・実装を支援するAgent Development Environment。分離されたworktree上で複数のCLIエージェントを並列実行し、デスクトップとモバイルの連携ワークフローに対応します。
Firebase Studioは、Gemini支援のコーディング、アプリプレビュー、クラウドエミュレータを備えたブラウザベースのフルスタック開発用ワークスペースです。既存リポジトリの取り込み、新規アプリの試作、共同作業、ブラウザからのデプロイに対応します。
OpenAIは、ChatGPT、API、Platformツール、Codexを中心にしたAI研究・展開企業です。会話型AI、モデル開発、製品と研究の最新情報を確認できます。
AakarDev AIは、AIプロバイダーのアクセス管理、プロジェクト設定、ログ、分析を1つのダッシュボードで行えるチーム向けツールです。BYOKに対応し、OpenAI、Google Gemini、Anthropic、Groq、Mistral AI、Perplexity AIをサポートします。
JetBrainsは、IntelliJ IDEA、PyCharm、DataGrip、WebStorm、Rider、CLionなどを含む開発者向けツールを提供。コードを理解したナビゲーション、提案、実行・デバッグ・テスト機能をIDEに統合。
書生は、言語・多模態・気象海洋・工業設計・三次元空間・金融・科学発見に対応する通用大規模モデル体系。価格や導入手順の公開情報は未掲載。