正式環境 trace 可觀測性
查看每次 AI 呼叫的 prompts、responses、tool calls、延遲、成本與請求中繼資料。此 UI 旨在檢視正式環境行為,並從真實 traces 中找出問題。
Braintrust 是一個 AI 可觀測性平台,適合想要追蹤正式環境行為、評估模型品質,並在回歸影響使用者前及早發現的團隊。網站將其定位為一套用來理解正式環境中實際發生了什麼,而不只是依賴離線測試的系統。
產品結合了 trace 檢視、evals、自動化與 workflow 工具。團隊可以為應用程式加入埋點、檢視 prompts 與 tool calls、比較 models 和 prompts、從真實失敗建立 datasets,並利用 Topics 等正式環境訊號來持續引導改善。
查看每次 AI 呼叫的 prompts、responses、tool calls、延遲、成本與請求中繼資料。此 UI 旨在檢視正式環境行為,並從真實 traces 中找出問題。
對 datasets 執行實驗,並使用 LLMs、程式碼或人工來為輸出評分。產品將 evals 定位為在發布前定義品質,以及並排比較 prompts 或 models 的方式。
使用 Topics 從真實流量中浮現重複模式,接著將這些模式轉換為 evaluations 或 alerts。定價頁與首頁文案都將 Topics 描述為在正式環境 logs 中分類與發現特定領域問題的方法。
將正式環境 traces 轉換成可用於迴歸測試的 datasets,並建立人工審查流程,而不必撰寫自訂前端程式碼。網站也強調 datasets、playgrounds 與自訂標註介面。
使用 CLI、SDKs 與 MCP server 來為應用程式加上埋點、查詢 logs、執行 evals,並從開發工具更新 prompts。文件強調可重複設定,以及供 coding-agent 工作流程使用的腳本化操作。
隨著團隊擴大,可自訂 trace 檢視、圖表、環境與存取控制。定價頁在較高方案中列出已儲存的表格檢視、自訂欄位、自訂圖表、環境、RBAC、SSO、MFA 與資料保留控制。
為 AI 應用程式加上埋點,讓每次呼叫都將 traces 寫入 Braintrust,然後在 Logs 檢視中查看 prompts、outputs、tool calls、token 數量、延遲與成本。
根據真實 datasets 建立 evals,並排比較 prompts 和 models,並在發布變更前使用 LLMs、程式碼或人工審查者為輸出評分。
使用 Topics 找出正式環境 logs 中重複出現的模式,接著在出現新的回歸時,將這些模式轉換為 evals、品質門檻或 alerts。
根據實際 traces 建立 datasets 與自訂審查流程,讓團隊可以針對邊界情況進行測試,並以符合任務的 workflow 來審查輸出。
使用 CLI、SDKs 或 MCP server 從工程工具與 agent workflows 查詢 logs、執行 evals,並管理 prompts。
Braintrust 透過安裝 CLI、將應用程式加入埋點,接著在 Braintrust UI 中查看 traces 來完成設定。快速上手指南展示了安裝 `bt` 的設定指令,並引導進行埋點;文件也說明可使用 `bt` CLI 進行可重複作業,例如執行 evals、查詢 logs 與同步資料。
追蹤快速上手指南說明,當你的應用程式完成埋點後,系統會為每次 AI 呼叫記錄 traces。在 UI 中,你可以檢視完整的輸入 prompt 與模型輸出、token 數量、延遲、成本、模型設定,以及請求/回應中繼資料。
文件將 Braintrust 描述為一個用於擷取 traces、分析 logs、加入人工回饋、建立 datasets、以實驗測試變更,並在監控正式環境的同時上線的 platform。其工作流程圍繞著擷取 traces、找出模式、加入回饋、測試變更,然後監控正式環境。
文件與定價頁顯示,透過原生 SDK 支援 Python、TypeScript、Go、Ruby、C# 等語言,並可整合 AI providers、frameworks 與 developer tools。integrations 頁面也指出可透過 MCP 與 CLI 進行與框架無關的使用,以及 developer-tools 工作流程。
Braintrust 提供免費的 Starter 方案、付費的 Pro 方案,以及客製化的 Enterprise 定價。定價頁也顯示,依處理資料與分數計費,並在較高方案中提供自訂圖表、RBAC 與更長保留期等功能。
blop 是一款 QA agent,將瀏覽器測試以程式碼形式寫入你的 repo,在 CI 中執行,彙整重複失敗,並可開啟 PR 修復損壞測試。適合使用 coding agents 並希望瀏覽器 QA 保持可審閱與版本控管的團隊。
Orca 是一款 Agent 開發環境,專為搭配 coding agents 發佈軟體而設計。可在隔離的 worktrees 中平行執行多個 CLI agents,並提供桌面與行動裝置輔助工作流程。
BotLab is a tool for testing video-game bots by running them in simulated game clients, reviewing session logs, and comparing results in the Reactor. It offers a free tier for short sessions and a paid Pro plan for longer online runs.
Firebase Studio 是一個以瀏覽器為基礎的全端應用開發工作區,提供 Gemini 輔助編碼、應用預覽、雲端模擬器,可匯入既有專案、原型設計、協作與瀏覽器部署。
EZsite AI 是一款 AI 網站建置工具,可將網址轉換成完整的 React 或 Vue.js 應用程式,並提供主機、網域、程式碼匯出與後端功能,適合需要可部署成果的團隊。
AI Magicx 是整合式 AI 工作區,將聊天、圖片、影片、語音、音樂、電子郵件與開發任務集中於一處,方便創作者、團隊與開發者整合多模型,免切換工具與訂閱。