Thies Clima Logo Thies Clima Logo THIES CLIMA
← Zurück zum Portal Overview
Knowledge Base 2026
CumulusAI & ThiesCloud Integration

LLM Provider, Model Choice & Workflow Architecture Guide

Maximieren Sie die Effizienz Ihrer KI-gestützten Wetter- und Sensoranalysen. Erfahren Sie, wie Sie den optimalen LLM-Provider wählen, Kontextfenster vs. Modellgröße abstimmen und komplexe Auswertungs-Skills orchestrieren.

System-Architektur & Deployment Übersicht

CumulusAI Ecosystem Architecture

Nahtlose Interaktion zwischen Client-Apps, der zentralen Server-Engine und flexiblen Deployment-Optionen

1. Client Application Layer

CumulusAI – AI Agent UI App

🪟
Windows Native
MSIX App Package
🌐
Web App
Browser Portal (Chrome/Edge)
📱
Mobile App
Android Native & Mobile Web
API Sync & Workflow Control
2. Orchestration & Execution Engine

CumulusAI Server (AI Workflow Scheduler)

🗓️ Schedulable Workflows Zeitgesteuerte & ereignisbasierte Sensor-Auswertungen
🤖 Multi-Agent & Prompts Orchestrierung spezialisierter Sub-Agenten
⚙️ LLM & Tool Configs Dynamische Provider- & MCP Tool Zuweisung
🧠 Skills Storage Zentrale Verwaltung wiederverwendbarer Auswertungs-Skills
Flexible Deployments
Cloud Hosted Default

☁️ ThiesCloud (Standard)

Vollständig verwalteter Cloud-Service auf Thies-Infrastruktur. Keine eigene Serverwartung erforderlich, DSGVO-konform in der EU gehostet.

On-Premise Server Docker

🐳 Own Server / On-Premise

Offizielles Docker Container Image für Linux-Server oder Windows 11 mit WSL2. Volle Kontrolle über sensible Messdaten und Netzwerkgrenzen.

Embedded / Edge ≤ 1 GB RAM

📟 Embedded Edge Devices

Vorkompilierte "Light Version" für ARM-Hardware (32-Bit & 64-Bit). Extrem geringer Speicherverbrauch (≤1 GB) für dezentrale Messstationen.

1. LLM-Provider wählen (LLM 1 & LLM 2)

Mistral AI (via ThiesCloud)
European Cloud Provider (Paris, France) • mistral.ai ↗
Vorkonfiguriert (Default)

Standardmäßig in LLM 1 vorkonfiguriert. Bietet exzellentes Preis-Leistungs-Verhältnis und volle DSGVO-Konformität innerhalb der EU. Ideal für tägliche Sensorabfragen und automatisierte Berichte.

Vorteil: Höchster Datenschutz nach EU-Recht, keine Datennutzung zum Modelltraining. Wählen Sie direkt in CumulusAI zwischen Small, Medium und Large. Website: mistral.ai
Multi-Provider Serverless API • deepinfra.com ↗

Nutzen Sie hunderte Open-Source-Modelle (Qwen 2.5, DeepSeek R1, Llama 3.3) über einen einzigen API-Schlüssel mit Abrechnung nach Token-Verbrauch.

Datenschutz: Erfüllt SOC 2 Type II, ISO 27001, GDPR & HIPAA Standards. Website: deepinfra.com | Privacy: deepinfra.com/privacy.
Ollama (Local Inference)
Lokale Hardware (z.B. Mac Mini M4 Pro / NVIDIA) • ollama.com ↗

Führen Sie Modelle (9B–14B Parameter) komplett offline und ohne API-Kosten auf eigener Hardware aus. Perfekt für vertrauliche Messdaten und unbegrenzte Testschleifen.

Empfehlung: Mac Mini M4 Pro (24 GB Unified Memory) bietet das beste Verhältnis aus Kontextfenster und Inferenz-Geschwindigkeit. Website: ollama.com

1.2 Dedicated Cloud GPU Server & Serverless: RunPod.io (EU Data Centers)

🇪🇺 Volle DSGVO-Konformität in EU-Rechenzentren • Dedicated GPU Pods vs. Serverless • www.runpod.io ↗

Führen Sie eigene Open-Source KI-Modelle auf dedizierter GPU-Hardware in EU-Rechenzentren von RunPod aus. Wählen Sie zwischen Dedicated Secure Pods (24/7 permanente Leistung) und RunPod Serverless (automatische Skalierung bis auf Null) als Drop-in Replacement für OpenAI APIs.

TEIL A Option 1: Dedicated GPU Pod Deployment & vLLM Server Setup

1
Deploy a Dedicated GPU Pod (EU Region)
Hardware bereitstellen und API-Port freigeben:
  • In RunPod anmelden und zu Pods > Deploy navigieren.
  • EU Data Center wählen: Stellen Sie sicher, dass ein Serverstandort innerhalb der Europäischen Union gewählt ist.
  • GPU wählen: Für 7B–14B Modelle ist eine RTX 4090 (24GB) oder RTX A6000 extrem kosteneffizient. Für 32B+ Modelle empfiehlt sich eine A100 (80GB).
  • Offizielles RunPod vLLM Template oder PyTorch Template wählen.
  • Wichtig: Unter Customize Deployment → Expose TCP Ports den Port 8000 eintragen.
2
vLLM API Server starten
Im Web-Terminal oder SSH ausführen:
# Bei PyTorch Standard-Template vLLM installieren:
pip install vllm

# Server mit Zielmodell starten (Port 8000 + API Key Schutz):
vllm serve "Qwen/Qwen2.5-Coder-32B-Instruct" \
  --host 0.0.0.0 \
  --port 8000 \
  --api-key "YOUR_SECRET_TOKEN"
3
Proxy URL kopieren & CumulusAI konfigurieren
Pod-Dashboard > Connect > HTTP Ports: URL https://<POD_ID>-8000.proxy.runpod.net kopieren.
In CumulusAI eintragen:
API Base URL: https://<POD_ID>-8000.proxy.runpod.net/v1
API Key: YOUR_SECRET_TOKEN
Model Name: Qwen/Qwen2.5-Coder-32B-Instruct

TEIL C Modell-Flexibilität (Hugging Face) & vLLM OpenAI-Kompatibilität

DeepInfra (Kuratierter Katalog): Pre-selected, hostet und optimiert eine bestimmte Modellauswahl. Abrechnung erfolgt rein nach Token-Verbrauch.

RunPod Serverless (Bring Your Own Model): Container-basiert (Docker + vLLM). Sie können jedes beliebige Modell auf Hugging Face hosten (auch private Fine-tunes oder Neuerscheinungen).

Hugging Face Integration & Caching:
  • Öffentliche Modelle: Der vLLM Worker lädt Gewichte automatisch von Hugging Face herunter.
  • Private / Gated Modelle: Fügen Sie Ihr Hugging Face Access Token (HF_TOKEN) als Umgebungsvariable in RunPod hinzu.
  • Modell-Caching: Für populäre Modelle lädt RunPod das Modell direkt aus dem Datacenter-Cache (nahezu 0 Downloadzeit).
vLLM OpenAI API Kompatibilität: vLLM stellt native Endpunkte wie /v1/chat/completions, /v1/completions und /v1/models bereit. Stream-Antworten ("stream": true), Temperature, Max Tokens und Chat Completion Schemas funktionieren 1:1 out-of-the-box.

TEIL D EU-Rechenzentren & Kostenvergleich: DeepInfra vs. RunPod für 80B–140B Modelle

🇪🇺 RunPod EU Secure Cloud Datacenter Standorte:
Frankreich (EU-FR-1), Niederlande (EU-NL-1), Schweden (EU-SE-1), Tschechien (EU-CZ-1), Rumänien (EU-RO-1).
(Hinweis: Für hochsensible Daten stets "Secure Cloud" statt "Community Cloud" wählen).

⚖️ Ist Serverless für 80B–140B Modelle (Qwen 72B, DeepSeek 80B+, GLM 140B) günstiger als DeepInfra?

Für 95% aller Anwendungsfälle ist DeepInfra drastisch günstiger. Grund: DeepInfra bündelt Tausende Nutzer und rechnet pro Token ab ($0.59 / 1M Tokens für Qwen 2.5 72B), während RunPod Serverless pro GPU-Sekunde abrechnet (A100 80GB ~ $0.00075 / Sekunde).

Szenario A: Geringer bis mittlerer Traffic (Einzelabfragen)
1 Abfrage = 1.000 Tokens Output @ 40 Tokens/Sek = 25 Sek GPU-Zeit.
RunPod Serverless: 25s × $0.00075 = $0.018 ($18.75 / 1M Tokens)
DeepInfra: ~$0.59 / 1M Tokens
👉 Ergebnis: DeepInfra ist ca. 30-fach günstiger!
Szenario B: Enterprise High-Concurrency (50+ parallele User)
vLLM bündelt 50 parallele Nutzer (Batching) → 2.500 Tokens/Sek.
RunPod Serverless: 20s × $0.00075 = $0.015 für 50k Tokens ($0.30 / 1M Tokens)
DeepInfra: ~$0.59 / 1M Tokens
👉 Ergebnis: RunPod ist erst bei kontinuierlich hoher paralleler Auslastung günstiger.
Fazit für CumulusAI: Für große 80B+ Modelle sind Managed APIs wie DeepInfra (oder EU-Alternativen wie Nebius AI) extrem kosteneffizient. Eigene Serverless GPU-Endpoints lohnen sich finanziell erst bei sehr hoher paralleler Nutzung.

2. Modellgröße, Kontextfenster & Prompt-Zuordnung

📊 Zusammenhänge: Modell-Kategorie vs. Sensor-Anwendungsfall
Modell-Kategorie Parameter & Kontext Optimaler Anwendungsfall in CumulusAI Empfohlene Modelle
Small / Local Fast 7B - 14B • 32K Context Einfache Sensorabfragen ("Zeige Temperatur der letzten 12h"), Schnellprüfungen, Filterung. mistral-small-latest, llama3.1:8b, qwen2.5:14b
Medium Reasoning 32B - 70B • 64K - 128K Context Aggregierte Auswertungen, Extremwert-Analysen, vergleichende Stationsstatistiken. mistral-medium-latest, Qwen2.5-Coder-32B, gpt-4o-mini
Large / Skill Reasoning 70B+ / Frontier • 128K - 2M Context Komplexe Multi-Agenten-Workflows, umfangreiche Skills (HTML-Report-Generierung, Vorhersagemodelle). mistral-large-latest, Qwen3.8-Max, claude-3-5-sonnet

3. Workflow-Typen & Skill-basierte Agenten

⚡ 1. Einfache Sensorabfrage Direkt Prompt

Für schnelle Ad-hoc Fragen im Chat ohne aufwendiges Reporting. Nutzt das Standard-Modell.

// Beispiel-Prompt:
"Hole die aktuellen Daten der letzten 48 Stunden von der Station Lengden, analysiere die Temperatur und zeige die Tiefsttemperatur."
🔄 2. Multi-Agenten Workflow Effizienz & Routing

Ein schnelles, günstiges Modell (z.B. 14B) prüft Sensor-Schwellenwerte. Bei Auffälligkeiten übergibt es per Bedingung an ein leistungsfähigeres Modell.

Agent 1 (Small): Check Frostgefahr an Station A
IF (temp < 0°C) THEN → Route to Agent 2 (Reasoning)
Agent 2: Detaillierte Schadensprognose & Alarm-E-Mail
🎨 3. Skill-basierte HTML-Report Generierung Skill + Reasoning Model

Skills enthalten detaillierte Handlungsanweisungen, Layout-Vorgaben und CSS-Templates. Da Skills viel Prompt-Text umfassen, sollten sie mit Reasoning-Modellen kombiniert werden.

// Ausführung in CumulusAI:
Eingabe-Prompt: "Hole Daten der letzten 48h von Lengden, analysiere Temperatur & erstelle den Bericht."
Mit angehängtem Skill: [Attached Skill: Executive Weather Report Template]
Ergebnis: Wunderschön gestalteter HTML-Jahreszeitenbericht mit Diagrammen, Tabellen und Warnmarkierungen.