Starflinger

IT-Dienstleistungen aus Wien

KI-Inferenz aus Wien, souveräne LLMs, Self-Hosting.

Ich betreibe Open-Weight-Sprachmodelle auf eigener Hardware in Österreich und stelle sie Geschäftskunden zur Verfügung. Unternehmen, die KI selbst betreiben wollen, berate ich beim Aufbau.

01 / Rechenleistung

KI-Inferenz und GPU-Rechenleistung.

Für Unternehmen, die Open-Weight-Modelle nutzen wollen und deren Daten in der EU bleiben müssen.

Inferenz-API

OpenAI-kompatibler Endpunkt für Open-Weight-Modelle wie GLM und DeepSeek. Prompt-Caching für agentische Workloads. Abrechnung pro Token.

Dedizierte GPU-Kapazität

NVIDIA-Blackwell-Server (HGX B300) in Wien, geplant ab Anfang 2027. Reservierung für 12 bis 36 Monate.

EU-Datenresidenz

Hardware, Betrieb und Daten bleiben in Österreich. Prompts und Antworten werden nicht gespeichert. Auftragsverarbeitungsvertrag nach DSGVO.

Heute in Betrieb

Ein eigener GPU-Server mit zwei NVIDIA RTX PRO 6000 Blackwell bedient GLM 5.3 Flash mit rund 200 Token pro Sekunde je Anfrage.

Exportkontrolle und Kundenprüfung

  • Die GPU-Hardware unterliegt der US-Exportkontrolle (EAR, ECCN 3A090 und 4A090) und der EU-Dual-Use-Verordnung. Ich halte beide ein.
  • Jeder Vertragskunde wird vor Vertragsbeginn geprüft: Firmensitz, Eigentümer, Verwendungszweck und Abgleich mit den Sanktionslisten der EU und der USA.
  • Ich erbringe keine Leistungen an Unternehmen mit Sitz oder Muttergesellschaft in Ländergruppe D:5 der EAR oder in Macau, und keine für militärische Zwecke oder Massenvernichtungswaffen.
  • Die Hardware wird nicht weiterverkauft. Die Nutzung wird je Vertrag protokolliert (wer, wann, welche Kapazität), ohne Inhalte.

02 / Leistungen

Beratung: fünf Schwerpunkte.

Alles, was unten steht, betreibe ich selbst produktiv. Kein PowerPoint, kein Reseller-Geschäft.

KI-Infrastruktur

Inferenz auf Ihrer Hardware. Geplant, deployt, überwacht.

Ein einzelner GPU-Server oder ein Multi-Node-Setup. Modell-Routing, Auto-Scaling, Token-Throughput-Monitoring.

  • vLLM
  • SGLang
  • LiteLLM
  • Multi-GPU

Souveräne LLMs

Open-Source-Modelle on-prem. Audit-fähig, optional air-gapped.

Llama, Mistral, Qwen, DeepSeek: gehostet, gerouted, dokumentiert. Konform mit DSGVO und NISG 2026.

  • DSGVO
  • NISG 2026
  • On-Prem
  • Air-Gapped

RAG & Semantische Suche

Wissens-Retrieval auf eigenen Daten. Aufgesetzt und betrieben.

Embedding-Pipelines, Vector Stores, Re-Ranking, Eval-Loops. Für interne Dokumente, Code-Bases, Support-Tickets – auf Ihrer Infrastruktur.

  • pgvector
  • Qdrant
  • BGE / E5
  • Re-Ranking

KI-gestützte Entwicklung

Claude Code & Co.: eingeführt, abgesichert, gemessen.

Schulung, Workflow-Integration, Review-Pipelines, die KI-Output absichern. Meine Grundregel: Eine Behauptung zählt erst, wenn der Agent sie mit einem Befehl belegt.

  • Claude Code
  • Codex
  • Reviews
  • Schulung

Self-Hosting

SaaS raus, eigene Server rein. Reproduzierbar und dokumentiert.

Mail, Identity, Monitoring, Backups, CI: auf einem Stack ohne Vendor-Lock-in. Proxmox als Basis für alles oben.

  • Proxmox
  • Vault
  • Stalwart
  • Wazuh

03 / Über

Stefan Starflinger.

Unabhängig, technisch, hands-on.

Seit 2018 selbständig mit IT-Dienstleistungen. Ich betreibe denselben Stack, den ich empfehle: einen 4-Knoten-Proxmox-Cluster, einen GPU-Server mit zwei RTX PRO 6000, souveräne LLMs hinter LiteLLM, eigene CI-Runner, Monitoring, Mail- und Vault-Server.

Einzelunternehmen mit Sitz in Wien. Beratung auf Deutsch und Englisch.

04 / Kontakt

Kurz schreiben, was Sie vorhaben.

Antwort innerhalb eines Werktages.