Inferenz-API
OpenAI-kompatibler Endpunkt für Open-Weight-Modelle wie GLM und DeepSeek. Prompt-Caching für agentische Workloads. Abrechnung pro Token.
IT-Dienstleistungen aus Wien
Ich betreibe Open-Weight-Sprachmodelle auf eigener Hardware in Österreich und stelle sie Geschäftskunden zur Verfügung. Unternehmen, die KI selbst betreiben wollen, berate ich beim Aufbau.
01 / Rechenleistung
Für Unternehmen, die Open-Weight-Modelle nutzen wollen und deren Daten in der EU bleiben müssen.
OpenAI-kompatibler Endpunkt für Open-Weight-Modelle wie GLM und DeepSeek. Prompt-Caching für agentische Workloads. Abrechnung pro Token.
NVIDIA-Blackwell-Server (HGX B300) in Wien, geplant ab Anfang 2027. Reservierung für 12 bis 36 Monate.
Hardware, Betrieb und Daten bleiben in Österreich. Prompts und Antworten werden nicht gespeichert. Auftragsverarbeitungsvertrag nach DSGVO.
Ein eigener GPU-Server mit zwei NVIDIA RTX PRO 6000 Blackwell bedient GLM 5.3 Flash mit rund 200 Token pro Sekunde je Anfrage.
02 / Leistungen
Alles, was unten steht, betreibe ich selbst produktiv. Kein PowerPoint, kein Reseller-Geschäft.
Inferenz auf Ihrer Hardware. Geplant, deployt, überwacht.
Ein einzelner GPU-Server oder ein Multi-Node-Setup. Modell-Routing, Auto-Scaling, Token-Throughput-Monitoring.
Open-Source-Modelle on-prem. Audit-fähig, optional air-gapped.
Llama, Mistral, Qwen, DeepSeek: gehostet, gerouted, dokumentiert. Konform mit DSGVO und NISG 2026.
Wissens-Retrieval auf eigenen Daten. Aufgesetzt und betrieben.
Embedding-Pipelines, Vector Stores, Re-Ranking, Eval-Loops. Für interne Dokumente, Code-Bases, Support-Tickets – auf Ihrer Infrastruktur.
Claude Code & Co.: eingeführt, abgesichert, gemessen.
Schulung, Workflow-Integration, Review-Pipelines, die KI-Output absichern. Meine Grundregel: Eine Behauptung zählt erst, wenn der Agent sie mit einem Befehl belegt.
SaaS raus, eigene Server rein. Reproduzierbar und dokumentiert.
Mail, Identity, Monitoring, Backups, CI: auf einem Stack ohne Vendor-Lock-in. Proxmox als Basis für alles oben.
03 / Über
Unabhängig, technisch, hands-on.
Seit 2018 selbständig mit IT-Dienstleistungen. Ich betreibe denselben Stack, den ich empfehle: einen 4-Knoten-Proxmox-Cluster, einen GPU-Server mit zwei RTX PRO 6000, souveräne LLMs hinter LiteLLM, eigene CI-Runner, Monitoring, Mail- und Vault-Server.
Einzelunternehmen mit Sitz in Wien. Beratung auf Deutsch und Englisch.
04 / Kontakt
Antwort innerhalb eines Werktages.