Wie FIM One Modelle nutzt
FIM One hat drei Modellrollen:
Fast und Reasoning fallen auf General zurück, falls nicht konfiguriert. Für Produktionsbereitstellungen bietet die Aufteilung in mindestens zwei Modelle (General + Fast) das beste Kosten-/Qualitätsverhältnis.
Diese Rollen können über Umgebungsvariablen oder über die Funktion Model Groups der Admin-Benutzeroberfläche konfiguriert werden, die Ein-Klick-Umschaltung zwischen Modellsätzen ermöglicht. Siehe Model Management für das vollständige Admin-UI-Handbuch.
Schnellauswahlmatrix
Strukturierte Ausgabekompatibilität
Der DAG-Planer von FIM One benötigt, dass das Modell gültiges strukturiertes JSON zurückgibt. Intern versucht es drei Extraktionsebenen der Reihe nach:- Native Function Calling — zwingt das Modell, JSON auszugeben, das einem Schema über die Tool-Call-API entspricht. Am zuverlässigsten.
- JSON Mode — fordert
response_format: json_objectan. Garantiert gültiges JSON, erzwingt aber keine Schemakonformität. - Plain Text Extraction — analysiert JSON aus Freitext als letzter Ausweg.
tool_choice) unterstützen, bieten die beste Planungszuverlässigkeit. Wenn ein Modell nur Level 2 erreicht, hängt die Ausgabequalität davon ab, wie gut es Anweisungen befolgt — schwächere Modelle können gültiges JSON produzieren, das nicht der erwarteten Struktur entspricht.
Thinking / Reasoning Kompatibilität
Verschiedene Anbieter implementieren “Thinking” (Chain-of-Thought-Reasoning) auf grundlegend unterschiedliche Weise. Dies ist wichtig, da der Thinking-Modus mit Tool-Aufrufen in Konflikt geraten kann und die Ausgabe je nach Anbieter an verschiedenen Stellen erscheint. FIM One handhabt all dies transparent — diese Tabelle hilft dir zu verstehen, was unter der Haube passiert.Schlüsselkonzepte
- Opt-in — Denken ist standardmäßig deaktiviert; Sie aktivieren es über einen API-Parameter (z. B.
reasoning_effort). Kann selektiv pro Aufruf deaktiviert werden. - Always-on — das Modell denkt immer; es gibt keinen API-Parameter, um es auszuschalten. Sie müssten zu einer Modellvariante ohne Denken wechseln, um es zu vermeiden.
- Modell-Ebene — Denken wird durch die Modell-ID bestimmt, die Sie wählen (z. B.
deepseek-reasonervsdeepseek-chat), nicht durch einen Parameter.
Kompatibilitätsmatrix
Wie FIM One jeden Fall handhabt
API-Levelreasoning_content (Claude, DeepSeek): Das Reasoning-Feld wird direkt aus der API-Antwort gelesen und im UI-Reasoning-Panel angezeigt. Keine Nachbearbeitung erforderlich.
<think> Tags im Inhalt (MiniMax, Qwen, QwQ und andere Open-Source-Derivate): FIM One entfernt automatisch <think>...</think> Tags aus dem Inhaltsfeld und leitet den Thinking-Text zum Reasoning-Panel um. Dies funktioniert sowohl für Streaming- als auch für Non-Streaming-Antworten.
Erzwungene FC + Thinking-Konflikte (Claude, Kimi): Wenn FIM One erzwungenes Function Calling benötigt (z. B. während der strukturierten Ausgabeextraktion der DAG-Planung), deaktiviert es vorübergehend das Thinking für diesen spezifischen Aufruf, indem es reasoning_effort=None übergibt. Dies funktioniert, weil Claudes Thinking opt-in ist — das Nichtversenden des Parameters bedeutet kein Thinking, was den 400-Fehler vermeidet. Für Anbieter, bei denen Thinking nicht deaktiviert werden kann (MiniMax), funktioniert erzwungenes FC einwandfrei, da diese Anbieter die Kombination nicht ablehnen.
Fallback-Kette: Wenn erzwungenes Function Calling aus irgendeinem Grund fehlschlägt, führt FIM One automatisch einen Fallback durch: natives FC → JSON-Modus → Klartext-Extraktion. Dieser dreistufige Ansatz stellt sicher, dass die Planung auch bei Anbietern mit teilweiser Tool-Calling-Unterstützung funktioniert.
Wenn Sie ein Modell verwenden, das immer denkt (MiniMax M2.7, DeepSeek R1) als Ihr Haupt-LLM, wird die Thinking-Ausgabe im Reasoning-Panel jeder Agent-Iteration angezeigt. Dies ist normal — es beeinträchtigt die Funktionalität nicht, und Sie können den Reasoning-Prozess des Modells sehen.
Anbieterdetails
OpenAI
Die am meisten bewährte Option. OpenAI-Modelle haben die beste native Unterstützung für Funktionsaufrufe (Tool-Calling), was sich direkt auf die Zuverlässigkeit von Agenten auswirkt. Die GPT-5-Familie (August 2025+) stellt einen großen generationalen Sprung gegenüber GPT-4 dar. Empfohlene Modelle:- Main:
gpt-5.4(neuestes Flaggschiff, März 2026 — 1M+ Kontext, Computer-Nutzung) odero3(beste Reasoning-Genauigkeit) - Fast:
gpt-5.4-mini(4,50 pro MTok) odergpt-5.4-nano(günstigste bei 1,25 pro MTok) - Budget Fast:
gpt-5-mini(2,00) undgpt-5-nano(0,40) bleiben zu niedrigeren Preisen verfügbar - Legacy:
gpt-4.1(noch in API, 1M Kontext, gut für Coding)
LLM_REASONING_EFFORT=medium — funktioniert nativ mit o-Series und GPT-5.x Modellen. GPT-5.4 unterstützt reasoning_effort mit Stufen none, low, medium, high, xhigh. Die o-Series erfordert max_completion_tokens statt max_tokens, was LiteLLM automatisch handhabt. Hinweis: GPT-5.x lässt reasoning_effort immer noch fallen, wenn Tools in /v1/chat/completions vorhanden sind — FIM One lässt es während Agent-Tool-Use-Schritte stillschweigend fallen, damit Workflows ungestört ablaufen. GPT-5.4 erfordert temperature=1 — FIM One handhabt dies automatisch über LiteLLMs Parameterfilterung (drop_params).
Anthropic (Claude)
Claude zeichnet sich durch differenziertes Denken und komplexe mehrstufige Aufgaben aus. FIM One verbindet sich über LiteLLM, das Anthropic-Modelle automatisch über ihre native API leitet. Die aktuelle Generation ist Claude 4.6 (Februar 2026). Empfohlene Modelle:- Main:
claude-sonnet-4-6(beste Balance zwischen Leistung und Kosten — 15 pro MTok) - Fast:
claude-haiku-4-5(schnell und günstig — 5 pro MTok) - Premium:
claude-opus-4-6(am leistungsfähigsten, 128K maximale Ausgabe — 25 pro MTok)
https://api.anthropic.com/v1/
Opus 4.6 und Sonnet 4.6 haben ein Kontextfenster von 1M (GA seit 13. März 2026 — kein Beta-Header erforderlich). Haiku 4.5 hat ein Kontextfenster von 200K.
Reasoning: Setzen Sie LLM_REASONING_EFFORT=medium — LiteLLM leitet Anthropic-Modelle über die native API, daher wird reasoning_content (erweitertes Denken) vollständig zurückgegeben und ist im UI-Schritt „thinking” sichtbar. Claude 4.6-Modelle unterstützen Adaptive Thinking (thinking: {type: "adaptive"}), das manuelles budget_tokens ersetzt — LiteLLM handhabt die Übersetzung automatisch. Wenn erweitertes Denken aktiviert ist, erfordert Anthropic temperature=1 — setzen Sie LLM_TEMPERATURE=1 in Ihrer .env oder Modellkonfiguration. Siehe Extended Thinking für Details.
Google Gemini
Gemini-Modelle bieten starke Leistung zu wettbewerbsfähigen Preisen über Googles OpenAI-kompatiblen Endpunkt. Die 3.x-Generation (Ende 2025+) ist ein großer Sprung — Gemini 3 Flash übertrifft 2.5 Pro und ist dabei 3x schneller. Hinweis:gemini-3-pro-preview wurde am 9. März 2026 abgeschaltet — verwenden Sie stattdessen gemini-3.1-pro-preview.
Empfohlene Modelle:
- Stabil (GA):
gemini-2.5-pro(Hauptmodell) +gemini-2.5-flash(schnell) — produktionsreif - Neueste (Vorschau):
gemini-3.1-pro-preview(Hauptmodell) +gemini-3-flash-preview(schnell) +gemini-3.1-flash-lite-preview(Budget schnell) — beste Leistung, aber Vorschaustatus
https://generativelanguage.googleapis.com/v1beta/openai/
Reasoning: reasoning_effort wird auf dem Kompatibilitäts-Endpunkt unterstützt — setzen Sie LLM_REASONING_EFFORT=medium und es funktioniert sofort.
DeepSeek
DeepSeek bietet das beste Kosten-Leistungs-Verhältnis auf dem Markt. V3.2 (Dezember 2025) vereinigte die Chat- und Reasoning-Linien in einem einzigen Modell mit unglaublich niedrigen Preisen. Modell-IDs (beide unterstützt durch V3.2):deepseek-chat— Allzweck (Non-Thinking-Modus)deepseek-reasoner— Chain-of-Thought-Reasoning-Modus, gibtreasoning_contentzurück
https://api.deepseek.com
Preise: 0,42 pro MTok (Cache-Hit: $0,028) — bei weitem die günstigste Frontier-Klasse-API.
Ausgabelimits: deepseek-chat maximale Ausgabe beträgt 8K Token (muss explizit über max_tokens gesetzt werden). deepseek-reasoner maximale Ausgabe beträgt 64K Token (einschließlich Chain-of-Thought).
V4 erwartet April 2026: Billionen-Parameter-Multimodal-Modell mit 1M-Kontextfenster. Erwarten Sie neue Modell-IDs bei der Veröffentlichung.
Chinesische Inlandsmodelle
Alle großen chinesischen Modellanbieter stellen OpenAI-kompatible Endpunkte bereit. Diese sind besonders stark für chinesischsprachige Aufgaben und bieten wettbewerbsfähige lokale Preise.Qwen / 通义千问 (Alibaba Cloud)
Qwen 3.5 (Februar 2026) ist die neueste Generation — das 397B MoE Flaggschiff übertrifft GPT-5.2 bei MMLU-Pro. Stärkste Unterstützung für chinesische Sprache und günstigste Frontier-Class-Preisgestaltung (~$0,11/MTok Input).- Base URL (China):
https://dashscope.aliyuncs.com/compatible-mode/v1 - Base URL (Global):
https://dashscope-intl.aliyuncs.com/compatible-mode/v1 - Main:
qwen3.5-plus(Flaggschiff, 1M Kontext, 0,66 pro MTok) oderqwen3-max(256K, stärkste) - Fast:
qwen3.5-flash(0,22 pro MTok) oderqwen-turbo(0,08 pro MTok) - Reasoning:
qwen3-maxmitenable_thinking: trueParameter (es gibt keine separateqwen3-max-thinkingModell-ID)
ChatGLM / 智谱
GLM-4.7 und GLM-5 (2026) sind die neuesten Modelle. GLM-5 ist das 745B MoE Flaggschiff, das sich Claude Opus-Niveau bei Coding-/Agent-Aufgaben nähert.- Basis-URL (Inland):
https://open.bigmodel.cn/api/paas/v4 - Basis-URL (Z.AI International):
https://api.z.ai/api/paas/v4 - Hauptmodell:
glm-4.7(starkes Coding, 2.20 auf Z.AI) - Schnell:
glm-4.7-flash(kostenlos!) oderglm-4.7-flashx(0.40, höherer Durchsatz) - Reasoning:
glm-5(745B MoE Flaggschiff, 3.20)
tool_choice wird nicht unterstützt — nur "auto" funktioniert.
MiniMax
MiniMax M2.7 (18. März 2026) ist das neueste Modell mit offenen Gewichten und erreicht 80,2% auf SWE-Bench. M2.5 bleibt als schnelle/Budget-Option verfügbar. MiniMax bietet zwei separate API-Endpunkte für verschiedene Regionen:- Basis-URL (Global/海外版):
https://api.minimax.io/v1— für Benutzer außerhalb des chinesischen Festlands - Basis-URL (China/国内版):
https://api.minimaxi.com/v1— für Benutzer im chinesischen Festland (beachten Sie das zusätzlicheiinminimaxi) - Main:
MiniMax-M2.7 - Fast:
MiniMax-M2.5 - Speed:
MiniMax-M2.7-highspeed(2x Kosten, niedrigere Latenz)
Kimi / 月之暗面 (Moonshot)
Kimi K2.5 (Januar 2026) hat 256K Kontext und starke Codierungsleistung (76,8% SWE-Bench unter Open-Source-Modellen).- Basis-URL (Global):
https://api.moonshot.ai/v1 - Basis-URL (China):
https://api.moonshot.cn/v1 - Hauptmodell:
kimi-k2.5 - Schnell:
kimi-k2(kein Denken, Funktionsaufrufe funktionieren) - Reasoning:
kimi-k2-thinking(2,00 pro MTok)
tool_choice funktioniert nur, wenn der Thinking-Modus ausgeschaltet ist. Wenn Thinking aktiviert ist, wird nur "auto" unterstützt.
Lokale Modelle (Ollama)
Führen Sie Modelle vollständig auf Ihrer eigenen Hardware aus — kein API-Schlüssel erforderlich, vollständig offline. Ollama stellt standardmäßig einen OpenAI-kompatiblen Endpunkt bereit. Die Open-Source-Landschaft hat sich dramatisch verändert — Qwen 3.5, Llama 4 und GPT-OSS (OpenAIs erste Open-Weight-Modelle) sind alle verfügbar. Basis-URL:http://localhost:11434/v1
Empfohlene Modelle nach VRAM:
Am besten für Tool-Aufrufe: Qwen 3/3.5 (32B+), GLM-4.7, GPT-OSS, Mistral — diese haben explizites Funktionsaufrufe-Training. Modelle mit 14B+ Parametern sind das Minimum für zuverlässige Tool-Aufrufe; 32B+ wird dringend empfohlen.
Drittanbieter-Relay-Plattformen
Viele Benutzer greifen auf mehrere Modellanbieter über einen einzigen Relay-(Proxy-)Dienst zu. FIM One erkennt automatisch das richtige API-Protokoll basierend auf URL-Pfadmustern – füllen Sie einfachLLM_BASE_URL aus und es funktioniert.
Funktionsweise
Wenn Ihre Basis-URL auf ein Drittanbieter-Relay verweist, inspiziert FIM One den URL-Pfad, um das zu verwendende Protokoll zu bestimmen:
Auflösungsreihenfolge: Explizites DB-Anbieterfeld > Domain-Match (offizielle APIs) > URL-Pfad-Hinweis (Relay-Plattformen) > OpenAI-kompatibler Fallback.
Beispiel: Ein Relay, drei Protokolle
Mit einem einzelnen Relay-Konto können Sie auf verschiedene Anbieter zugreifen, indem Sie einfach den Basis-URL-Pfad ändern:Schritt für Schritt: Wie die Pfaderkennung funktioniert
Hier ist ein konkretes Beispiel, das zeigt, was intern geschieht, wenn Sie ein Relay konfigurieren:- FIM One erkennt
/claudeim URL-Pfad → erkennt Anthropic natives Protokoll - Modell wird als
anthropic/claude-sonnet-4-6für LiteLLM-Routing präfixiert - Anfragen verwenden das Anthropic-Format
/v1/messagesmitx-api-keyAuth-Header reasoning_effort=mediumwird in Anthropics nativenthinking-Parameter übersetzt (nicht OpenAIsreasoning_effort)
Warum das wichtig ist
- Anthropic nativer Endpunkt bietet dir ordnungsgemäße
reasoning_content-Unterstützung (erweitertes Denken sichtbar in der UI), korrektes Tool-Calling-Format undx-api-key-Authentifizierung — Funktionen, die bei der Verwendung von OpenAI-kompatibler Übersetzung verloren gehen. - Google nativer Endpunkt bietet dir native Gemini-Parameter und
x-goog-api-key-Authentifizierung. - OpenAI kompatibel ist der universelle Fallback und funktioniert mit jedem Relay, aber anbietersspezifische Funktionen (wie erweiterte Thinking-Ausgabe) sind möglicherweise nicht verfügbar.
Wenn deine Relay-Plattform nicht standardisierte Pfadkonventionen verwendet (z. B. kein
/claude oder /anthropic in der URL), greift FIM One auf das OpenAI-kompatible Protokoll zurück — was für die meisten Anwendungsfälle funktioniert. Für vollständige native Protokollunterstützung kannst du das Feld provider explizit über die Admin-Modellkonfiguration-UI setzen.Konfigurationsstrategie
Main vs Fast: Wann sollte man aufteilen
- Aufteilen wenn dein Hauptmodell teuer oder langsam ist (z. B.
gpt-5.4+gpt-5.4-nano). DAG-Modus führt viele parallele Schritte aus — die Verwendung eines günstigeren schnellen Modells spart erhebliche Kosten. - Gleiches Modell wenn dein Modell bereits günstig ist (z. B.
deepseek-chatfür beide). Der Overhead der Verwaltung von zwei Modellen lohnt sich nicht.
Wann sollte man Reasoning aktivieren
- Aktivieren für komplexe analytische Aufgaben, mehrstufige Planung und Aufgaben, die sorgfältige Beurteilung erfordern
- Deaktivieren (Standard) für Routineaufgaben, einfache Fragen und Antworten sowie kostensensitive Bereitstellungen
- Reasoning erhöht typischerweise die Kosten um das 2-5-fache pro Anfrage —
mediumAufwand ist ein guter Ausgangspunkt
Context-Fenster-Größe
Setzen SieLLM_CONTEXT_SIZE auf die tatsächliche Fenster-Größe Ihres Modells:
Für lokale Modelle setzen Sie sowohl
LLM_CONTEXT_SIZE als auch LLM_MAX_OUTPUT_TOKENS explizit — die Standardwerte gehen von Cloud-Scale-Context-Fenstern aus, die lokale Modelle nicht unterstützen können.