
Platform Engineer (m/f/d) Industrial AI Cloud
Skills
About the role
Deine Aufgabe
NVIDIA und die Deutsche Telekom entwickeln gemeinsam die weltweit erste industrielle KI-Cloud für europäische Hersteller. Wir suchen einen Platform Engineer, der die Plattform-Services der Industrial AI Cloud aufbaut, automatisiert und betreibt. Diese Rolle konzentriert sich auf den Betrieb und die Weiterentwicklung großer Kubernetes-Cluster, Container-Orchestrierungsplattformen, CI/CD-Pipelines, GitOps und zugehöriger Automatisierung zur Unterstützung von KI-Workloads. Du wirst Teil des Teams sein, das Kubernetes-Workloads unterstützt, einen reibungslosen Betrieb und die kontinuierliche Verbesserung der Plattformebene sicherstellt und dabei mit Infrastruktur-, Sicherheits- und KI-Teams zusammenarbeitet.
Hauptaufgaben
Betrieb & Weiterentwicklung der Kubernetes-Plattform: Aufbau, Konfiguration und Wartung von Bare-Metal-Hosts und Kubernetes-Clustern für GPU/KI-Workloads.
Design & Betrieb des NVIDIA KI-bezogenen Software-Stacks (Slurm, Run AI)
Bereitstellung von maßgeschneidertem Anwendungssupport für KI-bezogene Workloads
Container-Orchestrierung & Automatisierung: Verwaltung von Helm-Charts, GitOps-Workflows, Ansible-Skripten, möglicherweise Terraform-Code und Automatisierung für die Bereitstellung von Services und KI-Workloads.
Betrieb von Kubernetes-Workloads: Fungiere als primärer Ansprechpartner für alle Kubernetes-bezogenen Themen, einschließlich Troubleshooting, Performance-Tuning und Skalierung.
CI/CD & GitOps: Entwicklung und Wartung von CI/CD-Pipelines mit Jenkins und GitLab; Implementierung von GitOps-Praktiken für konsistente Deployments und Infrastrukturänderungen.
Monitoring & Observability: Betrieb und Verbesserung von Prometheus- und Grafana-Monitoring-Stacks für Bare-Metal-Hosts, Kubernetes und Plattform-Services.
Container-Images & Registries: Erstellung, Optimierung und Absicherung von Container-Images (Docker, Podman); Verwaltung von Registries und Versionierung, Image-Scanning (Trivy).
Object Storage & Persistent Volumes: Integration und Wartung von Object-Storage-Lösungen für KI-Workloads.
Betrieb von KI- & HPC-Workloads: Unterstützung und Betrieb verteilter KI-Workloads in Bare-Metal-Hosts und Kubernetes-Umgebungen.
Zusammenarbeit mit Infrastruktur- & KI-Teams: Enge Koordination mit Infrastructure Engineers, Rechenzentrumsmitarbeitern und KI-Entwicklern, um eine reibungslose Bereitstellung von Services zu gewährleisten.
ITIL-Prozesse: Einhaltung von Incident-, Problem- und Change-Management-Workflows; Erstellung und Pflege operativer Runbooks. Einhaltung der ZERO-Outage-Richtlinien.
Dein Profil
Wir suchen einen Platform Engineer mit ausgeprägter Expertise in Kubernetes, Container-Orchestrierung, CI/CD-Automatisierung und GPU-beschleunigten AI-Workloads. Der ideale Kandidat sollte nachgewiesene Erfahrung im Betrieb großer Kubernetes-Cluster, in der Implementierung von GitOps-Praktiken und in der Unterstützung von NVIDIA AI-Software-Stacks in Produktionsumgebungen mitbringen.
Muss-Kriterien
Kubernetes Certified Administrator (CKA) oder gleichwertige Erfahrung in Produktionsumgebungen
Kenntnisse der NVIDIA GPU-beschleunigten Server-Plattform
Kenntnisse in Data Engineering, Data Transformation und Data Migration Tools
Kenntnisse des NVIDIA AI-Software-Stacks im Zusammenhang mit GPU-Orchestrierung
Kenntnisse des GPU-basierten Cloud-Plattform-Software-Stacks einschließlich seiner Abhängigkeiten zu darunterliegenden Schichten
Fundierte Erfahrung mit CI/CD-Tools (Jenkins, GitLab)
Fundierte Erfahrung mit GitOps-Praktiken
Versiert im Umgang mit Helm Charts und Kubernetes Resource Management
Scripting/Programmierung in Python oder Bash
Infrastructure-as-Code-Erfahrung mit Terraform
Infrastructure-as-Code-Erfahrung mit Ansible
Erfahrung mit Container-Images (Docker, Podman)
Erfahrung mit Image-Scanning-Tools
Vertrautheit mit Object-Storage-Systemen und Persistent-Volume-Management
Kenntnisse in Monitoring- und Observability-Tools (Prometheus, Grafana)
Verständnis für den Betrieb von AI/HPC-Workloads im großen Maßstab
Ausgeprägte Troubleshooting- und Operational-Support-Fähigkeiten in unternehmenskritischen Umgebungen
Von Vorteil
Certified Kubernetes Security Specialist (CKS) Zertifizierung
Fähigkeit, sich wiederholende operative Aufgaben zu automatisieren und Self-Service-Funktionen für Entwickler aufzubauen
Sicherheitsbewusste Haltung im täglichen Betrieb
Ausgezeichnete Kommunikations- und teamübergreifende Koordinationsfähigkeiten
Über uns
Als attraktivster Arbeitgeber Ungarns 2025 (laut repräsentativer Umfrage von Randstad) ist Deutsche Telekom IT Solutions eine Tochtergesellschaft der Deutsche Telekom Gruppe. Das Unternehmen bietet mit mehr als 5300 Mitarbeitern ein breites Portfolio an IT- und Telekommunikationsdienstleistungen. Wir haben Hunderte von Großkunden und Unternehmen in Deutschland und anderen europäischen Ländern.
DT-ITS erhielt 2019 die Auszeichnung „Best in Educational Cooperation" von HIPA und wurde 2019 als ethischstes multinationales Unternehmen anerkannt. Das Unternehmen entwickelt kontinuierlich seine vier Standorte in Budapest, Debrecen, Pécs und Szeged weiter und sucht qualifizierte IT-Fachkräfte, die Teil des Teams werden möchten.
Arbeite an Europas erster industrieller KI-Cloud mit modernsten Technologien
Direkte Zusammenarbeit mit NVIDIA- und Deutsche Telekom-Experten
Hybrides Arbeitsmodell
Weiterbildungsmöglichkeiten
Weitere Details
Du wirst in der Europäischen Union arbeiten, um die Datensicherheits- und Datenschutzanforderungen unserer Kunden zu erfüllen.
Die Möglichkeit zur Remote-Arbeit besteht aufgrund europäischer Steuervorschriften nur innerhalb Ungarns.
Questions about this role
Want AI Applyd to auto-apply to roles like this?
We tailor your resume per posting, fill the forms, and track replies for you.