Skip to main content
FIM One はプロバイダーに依存しない — OpenAI 互換のエンドポイントであれば動作します。このページでは、ユースケースに最適なモデルの組み合わせを選択するのに役立ちます。設定の詳細については、環境変数を参照してください。

FIM One がモデルを使用する方法

FIM One には 3 つのモデルロールがあります: Fast と Reasoning が設定されていない場合は General にフォールバックします。本番環境のデプロイメントでは、少なくとも 2 つのモデル(General + Fast)に分割することで、最適なコスト/品質のバランスが得られます。 これらのロールは環境変数を通じて、または admin UI の Model Groups 機能を通じて設定できます。この機能により、モデルセット間のワンクリック切り替えが可能になります。詳細な admin UI ガイドについては Model Management を参照してください。

Quick Selection Matrix

Vision indicates whether the model accepts image input. This is required for Intelligent Document Processing (IDP) — if your model doesn’t support vision, IDP will fall back to text-only extraction. Providers marked ⚠️ have vision on some models but not others; check the specific model you’re using.Chat attachments follow the same flag: with a text-only model an attached image is not sent, and the model receives its file name only. The chat composer says so before you send, based on the model the turn would actually use (agent setting, then the active model group, then the system default). Document text is unaffected — a PDF or DOCX still has its content extracted and injected.
This table lists the combinations we recommend, not the full set of providers FIM One supports. xAI (Grok), ByteDance Doubao, Mistral and any OpenAI-compatible relay all work; see the Provider Capability Matrix for the complete list and how each one is routed.

構造化出力の互換性

FIM OneのDAGプランナーは、モデルがスキーマに一致する有効なJSON構造を返す必要があります。内部的には、以下の3つの抽出レベルを順番に試みます:
  1. ネイティブ関数呼び出し — ツール呼び出しAPIを介してスキーマに一致するJSONを出力するようモデルに強制します。最も信頼性が高いです。
  2. JSONモードresponse_format: json_objectをリクエストします。有効なJSONを保証しますが、スキーマ準拠を強制しません。
  3. プレーンテキスト抽出 — 最後の手段として、自由形式のテキストからJSONを解析します。
レベル1(強制的なtool_choiceを伴うネイティブFC)をサポートするモデルは、最高のプランニング信頼性を提供します。モデルがレベル2のみに対応している場合、出力品質はプロンプト指示にどの程度従うかに依存します。弱いモデルは、期待される構造に一致しない有効なJSONを生成する可能性があります。 このテーブルは選択の参考です。各プロバイダーが受け入れるtool_choice状態と、いずれかが拒否された場合にFIM Oneが行うことを含む、権威あるコードアンカー版はプロバイダー機能マトリックスです。
「有効なタスクプランの生成に失敗しました」というエラーが表示される場合、モデルの構造化出力機能はDAGプランニングには不十分です。メインLLMを⭐⭐⭐または⭐⭐以上の評価を持つモデルに切り替えるか、DAGモードを無効にしてより単純なReActエージェントを代わりに使用してください。

思考 / 推理互換性

異なるプロバイダーは「思考」(思考の連鎖推論)を根本的に異なる方法で実装しています。これが重要な理由は、思考モードがツール呼び出しと競合する可能性があり、出力がプロバイダーによって異なる場所に表示されるためです。FIM One はこれらすべてを透過的に処理します — この表は、内部で何が起こっているかを理解するのに役立ちます。

主要概念

  • オプトイン — 思考はデフォルトでオフです。API パラメータ(例:reasoning_effort)を使用して有効にします。呼び出しごとに選択的に無効にできます。
  • 常時オン — モデルは常に思考します。オフにするための API パラメータはありません。これを回避するには、思考しないモデルバリアントに切り替える必要があります。
  • モデルレベル — 思考は、パラメータではなく、選択するモデル ID(例:deepseek-reasoner vs deepseek-chat)によって決定されます。

互換性マトリックス

このテーブルの背景にあるプロバイダー別の詳細情報 (各 effort レベルの変換方法や、推論が後続ターンで再生されるかどうかなど) は、プロバイダー機能マトリックスの表C に記載されています。

FIM One が各ケースを処理する方法

API レベルの reasoning_content(Claude、DeepSeek):推論フィールドは API レスポンスから直接読み込まれ、UI の Reasoning パネルに表示されます。後処理は不要です。 コンテンツ内の <think> タグ(MiniMax、Qwen、QwQ、およびその他のオープンソース派生モデル):FIM One は自動的にコンテンツフィールドから <think>...</think> タグを削除し、思考テキストを Reasoning パネルに転送します。これはストリーミングおよび非ストリーミングレスポンスの両方で機能します。 強制 FC + 思考の競合はプロバイダーごとであり、思考モデル全般の特性ではありません。Claude はこの組み合わせを拒否しますが、その思考はオプトインなので、FIM One はそのコール用に reasoning_effort=None を渡して思考をオフにし、ネイティブ関数呼び出しを進めます。Kimi も拒否しますが、その思考はパラメータではなくモデル ID で選択されるため、修正方法は思考モデルのネイティブ関数呼び出しを無効にすることです。MiniMax はすべてのコールで思考し、強制関数呼び出しを受け入れるため、それに対する回避策は適用されません。 フォールバックチェーン:強制関数呼び出しが何らかの理由で失敗した場合、FIM One は自動的にフォールバックします:ネイティブ FC → JSON モード → プレーンテキスト抽出。この 3 段階のアプローチにより、ツール呼び出しサポートが部分的なプロバイダーでもプランニングが機能することが保証されます。
Main LLM として常に思考するモデル(MiniMax M2.7、deepseek-reasoner)を使用している場合、思考出力はすべてのエージェント反復の Reasoning パネルに表示されます。これは正常です——機能に影響を与えず、モデルの推論プロセスを確認できます。

プロバイダーの詳細

OpenAI

最も実績のあるオプションです。OpenAIモデルは最高のネイティブ関数呼び出し(ツール呼び出し)サポートを備えており、これはエージェントの信頼性に直接影響します。GPT-5ファミリー(2025年8月以降)はGPT-4に対する大きな世代的飛躍です。 推奨モデル:
  • メイン:gpt-5.4(最新フラグシップ、2026年3月——1M以上のコンテキスト、コンピュータ使用)またはo3(最高の推論精度)
  • 高速:gpt-5.4-mini0.75/0.75/4.50 per MTok)またはgpt-5.4-nano(最安値 0.20/0.20/1.25 per MTok)
  • 予算重視高速:gpt-5-mini0.25/0.25/2.00)およびgpt-5-nano0.05/0.05/0.40)はより低い価格で利用可能
  • レガシー:gpt-4.1(API内に存在、1Mコンテキスト、コーディングに適している)
推論: LLM_REASONING_EFFORT=mediumを設定します——o-seriesおよびGPT-5.xモデルでネイティブに動作します。GPT-5.4はreasoning_effortnonelowmediumhighxhighのレベルでサポートしています。o-seriesはmax_tokensの代わりにmax_completion_tokensを必要とし、LiteLLMが自動的に処理します。注意:/v1/chat/completionsはツールと推論を組み合わせたGPT-5.xリクエストを拒否するため、FIM OneはGPT-5.xの場合、両方が一緒に動作するResponses APIを直接使用します。そのパスは各ターンの暗号化された推論を次のターンに持ち込むため、エージェントが複数ステップの回答を構築する際に、すべてのツール呼び出しで再導出する代わりに、既に導き出したものを保持します。/v1/responsesルートのないエンドポイントはチャット補完にフォールバックし、エージェントツール使用ステップ中に明示的なreasoning_effort: "none"を使用し、FIM_GPT5_RESPONSES_MODEで手動でいずれかのフォールバックを強制できます。OpenAI互換エンドポイント上の他のモデルファミリーはチャット補完に留まります:Responsesから何も得られず、それのプロキシシムは悪くストリーミングをバッファリングできます。GPT-5.4はtemperature=1を必要とし、FIM OneはLiteLLMのパラメータフィルタリング(drop_params)を介して自動的に処理します。

Anthropic (Claude)

Claudeは微妙な推論と複雑なマルチステップタスクに優れています。FIM OneはLiteLLM経由で接続し、Anthropicモデルをネイティブ API を通じて自動的にルーティングします。現在の世代はClaude 4.6(2026年2月)です。 推奨モデル:
  • メイン: claude-sonnet-4-6(機能とコストのベストバランス — 3/3/15 per MTok)
  • 高速: claude-haiku-4-5(高速で安価 — 1/1/5 per MTok)
  • プレミアム: claude-opus-4-6(最も高機能、最大出力128K — 5/5/25 per MTok)
ベース URL: https://api.anthropic.com/v1/ Opus 4.6とSonnet 4.6は1Mのコンテキストウィンドウを備えています(2026年3月13日以降GA — ベータヘッダーは不要)。Haiku 4.5は200Kのコンテキストウィンドウを備えています。 推論: LLM_REASONING_EFFORT=mediumを設定します。LiteLLMはAnthropicモデルをネイティブ API を通じてルーティングするため、reasoning_content(拡張思考)は完全に返され、UI の「thinking」ステップで表示されます。Claude 4.6以降は、手動のbudget_tokensの代わりにAdaptive Thinking(thinking: {type: "adaptive"}output_config.effort)を使用します。これはFIM Oneが直接発行するもので、LiteLLMのマッピングに依存しません。Anthropicは思考がアクティブな間はtemperature=1を要求し、システムはそれを強制します。リクエストビルダーはAnthropicルートで値をピンし、サンプリングパラメータを完全に拒否するモデルではtemperatureを削除します。LLM_TEMPERATURE=1を手動で設定しないでください。詳細はExtended Thinkingを参照してください。

Google Gemini

Geminiモデルは、Googleの OpenAI互換エンドポイント経由で競争力のある価格で強力なパフォーマンスを提供します。3.x世代(2025年後半以降)は大きな飛躍です — Gemini 3 Flashは2.5 Proを上回りながら3倍高速です。注意: gemini-3-pro-previewは2026年3月9日にシャットダウンされました — 代わりにgemini-3.1-pro-previewを使用してください。 推奨モデル:
  • 安定版(GA): gemini-2.5-pro(メイン)+ gemini-2.5-flash(高速)— 本番環境対応
  • 最新版(プレビュー): gemini-3.1-pro-preview(メイン)+ gemini-3-flash-preview(高速)+ gemini-3.1-flash-lite-preview(予算重視の高速)— 最高のパフォーマンス、ただしプレビュー状態
ベースURL: https://generativelanguage.googleapis.com/v1beta/openai/ 推論: 互換性エンドポイントでreasoning_effortがサポートされています — LLM_REASONING_EFFORT=mediumを設定するとそのまま動作します。

DeepSeek

DeepSeekは市場で最高のコスト/パフォーマンス比を提供しています。V3.2(2025年12月)はチャットと推論の系統を単一のモデルに統合し、非常に低い価格設定を実現しています。 モデルID(両方ともV3.2によってサポート):
  • deepseek-chat — 汎用(非思考モード)
  • deepseek-reasoner — 思考の連鎖推論モード、reasoning_contentを返す
ベースURL: https://api.deepseek.com 価格設定: 0.28/0.28/0.42 per MTok(キャッシュヒット: $0.028)— 圧倒的に最も安いフロンティアクラスのAPI。 出力制限: deepseek-chatの最大出力は8Kトークン(max_tokensで明示的に設定する必要があります)。deepseek-reasonerの最大出力は64Kトークン(思考の連鎖を含む)。
V4は2026年4月予定: 1兆パラメータのマルチモーダルモデル、1Mコンテキストウィンドウ。起動時に新しいモデルIDが期待されます。

中国国内モデル

すべての主要な中国のモデルプロバイダーは、OpenAI互換のエンドポイントを公開しています。これらは中国語タスクに特に強く、競争力のあるローカル価格を提供しています。

Qwen / 通义千問 (Alibaba Cloud)

Qwen 3.5(2026年2月)是最新一代 — 397B MoE旗艦版在MMLU-Pro上的表現超越GPT-5.2。最強的中文語言支持和最便宜的前沿級定價(~$0.11/MTok輸入)。
  • Base URL(中國): https://dashscope.aliyuncs.com/compatible-mode/v1
  • Base URL(全球): https://dashscope-intl.aliyuncs.com/compatible-mode/v1
  • 主要: qwen3.5-plus(旗艦版,1M上下文,0.11/0.11/0.66 per MTok)或 qwen3-max(256K,最強)
  • 快速: qwen3.5-flash0.055/0.055/0.22 per MTok)或 qwen-turbo0.04/0.04/0.08 per MTok)
  • 推理: qwen3-max 搭配 enable_thinking: true 參數(沒有單獨的 qwen3-max-thinking 模型ID)

ChatGLM / 智谱

GLM-4.7 と GLM-5 (2026) は最新モデルです。GLM-5 は 745B MoE フラッグシップで、コーディング/エージェントタスクで Claude Opus レベルに近づいています。
  • Base URL (国内): https://open.bigmodel.cn/api/paas/v4
  • Base URL (Z.AI International): https://api.z.ai/api/paas/v4
  • Main: glm-4.7 (強力なコーディング、Z.AI で 0.60/0.60/2.20)
  • Fast: glm-4.7-flash (無料ティア!) または glm-4.7-flashx (0.07/0.07/0.40、より高いスループット)
  • Reasoning: glm-5 (745B MoE フラッグシップ、1.00/1.00/3.20)
強制的な tool_choice はサポートされていません — "auto" のみが機能します。
一部の HTTP クライアントは base URL に自動的に /v1 を追加します。Zhipu は /v4 を使用しているため、クライアントが OpenAI スタイルのパス接尾辞を強制しないようにしてください。そうしないと 404 エラーが発生します。

MiniMax

MiniMax M2.7(2026年3月18日)是最新模型,开放权重,在SWE-Bench上得分为80.2%。M2.5仍可作为快速/预算选项使用。 MiniMax为不同地区提供两个独立的API端点:
  • Base URL(全球/海外版): https://api.minimax.io/v1 — 适用于中国大陆以外的用户
  • Base URL(中国/国内版): https://api.minimaxi.com/v1 — 适用于中国大陆用户(注意minimaxi中多了一个i
  • 主要: MiniMax-M2.7
  • 快速: MiniMax-M2.5
  • 速度: MiniMax-M2.7-highspeed(成本提高2倍,延迟降低)

Kimi / 月之暗面 (Moonshot)

Kimi K2.5(2026年1月)拥有256K上下文和强大的编码性能(在开源模型中SWE-Bench达到76.8%)。
  • Base URL(グローバル): https://api.moonshot.ai/v1
  • Base URL(中国): https://api.moonshot.cn/v1
  • メイン: kimi-k2.5
  • 高速: kimi-k2(非思考モード、関数呼び出し機能あり)
  • 推論: kimi-k2-thinking0.47/0.47/2.00 per MTok)
強制的なtool_choiceは思考モードがオフの場合にのみ機能します。思考が有効な場合、"auto"のみがサポートされます。

ローカルモデル (Ollama)

独自のハードウェア上でモデルを完全に実行 — APIキーは不要で、完全にオフライン。Ollama は OpenAI 互換エンドポイントをそのまま公開します。オープンソースの状況は劇的に変わりました — Qwen 3.5、Llama 4、GPT-OSS (OpenAI の最初のオープンウェイトモデル) がすべて利用可能です。 ベース URL: http://localhost:11434/v1 VRAM別の推奨モデル: ツール呼び出しに最適: Qwen 3/3.5 (32B+)、GLM-4.7、GPT-OSS、Mistral — これらは明示的な関数呼び出しトレーニングを備えています。14B 以上のパラメータを持つモデルは信頼できるツール呼び出しの最小要件です。32B 以上が強く推奨されます。
ツール呼び出しの品質はローカルモデル全体で大きく異なります。 すべてのモデルが確実に有効な関数呼び出しを生成するわけではありません。本番環境で使用する前に、エージェントワークフローで選択したモデルをテストしてください。一般的なルール: 最小 14B、エージェントタスクには 32B 以上を推奨します。

サードパーティリレープラットフォーム

多くのユーザーは、単一のリレー(プロキシ)サービスを通じて複数のモデルプロバイダーにアクセスしています。FIM Oneは、URLパスパターンに基づいて正しいAPIプロトコルを自動的に検出します。LLM_BASE_URLを入力するだけで動作します。

仕組み

ベースURLがサードパーティリレーを指している場合、FIM OneはURLパスを検査してどのプロトコルを使用するかを決定します: 解決順序: 明示的なDB プロバイダフィールド > ドメインマッチ(公式API) > URLパスヒント(リレープラットフォーム) > OpenAI互換フォールバック。

例:1つのリレー、3つのプロトコル

単一のリレーアカウントで、ベースURLパスを変更するだけで異なるプロバイダーにアクセスできます:
追加の設定は不要です。認証ヘッダー、パラメータ形式、レスポンス解析がすべて自動的に切り替わります。

ステップバイステップ: パス検出の仕組み

リレーを設定するときに内部で何が起こるかを示す具体例です:
  1. FIM One は URL パスの /claude を認識 → Anthropic ネイティブプロトコルを検出
  2. モデルは LiteLLM ルーティング用に anthropic/claude-sonnet-4-6 としてプレフィックスが付与される
  3. リクエストは Anthropic の /v1/messages フォーマットを使用し、x-api-key 認証ヘッダーで認証
  4. reasoning_effort=medium は Anthropic のネイティブ thinking パラメータに変換される (OpenAI の reasoning_effort ではない)
同じリレー URL が https://my-relay.example.com/v1 だった場合、/claude ヒントが欠落するため、FIM One は OpenAI 互換プロトコルにフォールバックし、Claude ネイティブエンドポイントに /v1/chat/completions リクエストを送信することになり、失敗します。URL パスが重要です。

このことが重要な理由

  • Anthropic ネイティブエンドポイントは、適切な reasoning_content サポート(UI に表示される拡張思考)、正しいツール呼び出し形式、および x-api-key 認証を提供します。これらは OpenAI 互換変換を使用する場合に失われる機能です。
  • Google ネイティブエンドポイントは、ネイティブ Gemini パラメータと x-goog-api-key 認証を提供します。
  • OpenAI 互換は汎用フォールバックであり、任意のリレーで機能しますが、プロバイダー固有の機能(拡張思考出力など)は利用できない場合があります。
リレープラットフォームが非標準パス規則を使用している場合(例:URL に /claude または /anthropic がない)、FIM One は OpenAI 互換プロトコルにフォールバックします。これはほとんどのユースケースで機能します。完全なネイティブプロトコルサポートの場合、管理者モデル設定 UI から provider フィールドを明示的に設定できます。
リレーは直接プロバイダーとは異なる方法で失敗し、そのほとんどは無音です:ドロップされたパラメータ、削除されたキャッシュブレークポイント、エラーが発生しないバッファリングされたストリーム。症状別リストは リレー/プロキシの落とし穴にあります。
リレーはベストエフォート型です。 FIM One の文書化された動作は、OpenAI、Anthropic、Google、およびモデルを直接提供する他のベンダーを含む、ファーストパーティエンドポイントに対して保証されます。リレーは機能し、その方法でのみ到達可能なモデルを含めて広く使用されていますが、リレーがリクエストに対して行うことは当社の制御外にあるため、そのような保証はありません。ホスト名によってブロックされるものはありません。機能はエンドポイントごとにプローブされ、サポートされていない動作は独自にフォールバックします。モデルレイヤーのバグを報告する前に、ファーストパーティエンドポイントに対して再現してください。

設定戦略

Main vs Fast: 分割するタイミング

  • 分割する メインモデルが高価または遅い場合(例:gpt-5.4 + gpt-5.4-nano)。DAG モードは多くの並列ステップを実行します — より安価な高速モデルを使用することで大幅なコスト削減が実現します。
  • 同じモデル モデルが既に安価な場合(例:両方に deepseek-chat)。2つのモデルを管理するオーバーヘッドは価値がありません。

推論を有効にする時期

  • 有効にする 複雑な分析タスク、複数ステップの計画、慎重な判断が必要なタスク
  • 無効にする(デフォルト)ルーチンタスク、シンプルなQ&A、コスト効率を重視するデプロイメント
  • 推論は通常、リクエストあたりのコストを2~5倍増加させます — mediumの努力レベルが良い出発点です

コンテキストウィンドウサイジング

LLM_CONTEXT_SIZE をモデルの実際のウィンドウに合わせて設定します: ローカルモデルの場合、LLM_CONTEXT_SIZELLM_MAX_OUTPUT_TOKENS の両方を明示的に設定してください。デフォルト値はクラウド規模のコンテキストウィンドウを想定しており、ローカルモデルではサポートできません。