Nahtlose Interaktion zwischen Client-Apps, der zentralen Server-Engine und flexiblen Deployment-Optionen
Vollständig verwalteter Cloud-Service auf Thies-Infrastruktur. Keine eigene Serverwartung erforderlich, DSGVO-konform in der EU gehostet.
Offizielles Docker Container Image für Linux-Server oder Windows 11 mit WSL2. Volle Kontrolle über sensible Messdaten und Netzwerkgrenzen.
Vorkompilierte "Light Version" für ARM-Hardware (32-Bit & 64-Bit). Extrem geringer Speicherverbrauch (≤1 GB) für dezentrale Messstationen.
Standardmäßig in LLM 1 vorkonfiguriert. Bietet exzellentes Preis-Leistungs-Verhältnis und volle DSGVO-Konformität innerhalb der EU. Ideal für tägliche Sensorabfragen und automatisierte Berichte.
Nutzen Sie hunderte Open-Source-Modelle (Qwen 2.5, DeepSeek R1, Llama 3.3) über einen einzigen API-Schlüssel mit Abrechnung nach Token-Verbrauch.
Führen Sie Modelle (9B–14B Parameter) komplett offline und ohne API-Kosten auf eigener Hardware aus. Perfekt für vertrauliche Messdaten und unbegrenzte Testschleifen.
Führen Sie eigene Open-Source KI-Modelle auf dedizierter GPU-Hardware in EU-Rechenzentren von RunPod aus. Wählen Sie zwischen Dedicated Secure Pods (24/7 permanente Leistung) und RunPod Serverless (automatische Skalierung bis auf Null) als Drop-in Replacement für OpenAI APIs.
8000 eintragen.https://<POD_ID>-8000.proxy.runpod.net kopieren.DeepInfra (Kuratierter Katalog): Pre-selected, hostet und optimiert eine bestimmte Modellauswahl. Abrechnung erfolgt rein nach Token-Verbrauch.
RunPod Serverless (Bring Your Own Model): Container-basiert (Docker + vLLM). Sie können jedes beliebige Modell auf Hugging Face hosten (auch private Fine-tunes oder Neuerscheinungen).
HF_TOKEN) als Umgebungsvariable in RunPod hinzu./v1/chat/completions, /v1/completions und /v1/models bereit. Stream-Antworten ("stream": true), Temperature, Max Tokens und Chat Completion Schemas funktionieren 1:1 out-of-the-box.
🇪🇺 RunPod EU Secure Cloud Datacenter Standorte:
Frankreich (EU-FR-1), Niederlande (EU-NL-1), Schweden (EU-SE-1), Tschechien (EU-CZ-1), Rumänien (EU-RO-1).
(Hinweis: Für hochsensible Daten stets "Secure Cloud" statt "Community Cloud" wählen).
Für 95% aller Anwendungsfälle ist DeepInfra drastisch günstiger. Grund: DeepInfra bündelt Tausende Nutzer und rechnet pro Token ab ($0.59 / 1M Tokens für Qwen 2.5 72B), während RunPod Serverless pro GPU-Sekunde abrechnet (A100 80GB ~ $0.00075 / Sekunde).
| Modell-Kategorie | Parameter & Kontext | Optimaler Anwendungsfall in CumulusAI | Empfohlene Modelle |
|---|---|---|---|
| Small / Local Fast | 7B - 14B • 32K Context | Einfache Sensorabfragen ("Zeige Temperatur der letzten 12h"), Schnellprüfungen, Filterung. | mistral-small-latest, llama3.1:8b, qwen2.5:14b |
| Medium Reasoning | 32B - 70B • 64K - 128K Context | Aggregierte Auswertungen, Extremwert-Analysen, vergleichende Stationsstatistiken. | mistral-medium-latest, Qwen2.5-Coder-32B, gpt-4o-mini |
| Large / Skill Reasoning | 70B+ / Frontier • 128K - 2M Context | Komplexe Multi-Agenten-Workflows, umfangreiche Skills (HTML-Report-Generierung, Vorhersagemodelle). | mistral-large-latest, Qwen3.8-Max, claude-3-5-sonnet |
Für schnelle Ad-hoc Fragen im Chat ohne aufwendiges Reporting. Nutzt das Standard-Modell.
Ein schnelles, günstiges Modell (z.B. 14B) prüft Sensor-Schwellenwerte. Bei Auffälligkeiten übergibt es per Bedingung an ein leistungsfähigeres Modell.
Skills enthalten detaillierte Handlungsanweisungen, Layout-Vorgaben und CSS-Templates. Da Skills viel Prompt-Text umfassen, sollten sie mit Reasoning-Modellen kombiniert werden.