Jobs Companies Belmont Lavan Ltd Lead / Principal AI Infrastructure Architect

À propos de ce poste Lead / Principal AI Infrastructure Architect chez Belmont Lavan Ltd

Belmont Lavan Ltd · Hybride · Stuttgart, Baden-Württemberg, Germany
Cette offre d’emploi est en German.

Wir suchen einen **Lead / Principal AI Infrastructure Architect**, der die durchgängige Verantwortung für den Entwurf, die Bereitstellung und die Optimierung der Infrastruktur für groß angelegte Workloads im Bereich Künstliche Intelligenz (KI) und maschinelles Lernen (ML) übernimmt.

Der Schwerpunkt der Rolle liegt auf der Architektur hochskalierbarer und kosteneffizienter Rechenumgebungen, einschließlich **GPU-Clustern, Plattformen für verteiltes Training, Infrastruktur für Model-Serving, Netzwerktechnik, Speicherlösungen, Orchestrierung sowie cloudbasierten KI/ML-Plattformen**.

Sie übersetzen Geschäftsziele, Service-Level-Anforderungen, Sicherheitsstandards und technische Rahmenbedingungen in robuste Infrastrukturarchitekturen. Sie evaluieren alternative Lösungen, treffen fundierte Architekturentscheidungen und stellen sicher, dass die Plattformen auf **Leistung, Skalierbarkeit, Zuverlässigkeit, Sicherheit und Kosteneffizienz** ausgelegt sind.

Als technische Führungskraft übernehmen Sie die architektonische Leitung, etablieren Engineering-Standards und Best Practices, betreuen (mentoren) Ingenieure und Architekten und arbeiten eng mit Kunden und Stakeholdern zusammen, um Infrastrukturstrategien und Roadmaps zu definieren.

Requirements

Absolut. Ich habe diese Stellenbeschreibung auf die gleiche Weise bereinigt: Arbeitgeberspezifische Formulierungen und Wiederholungen wurden entfernt, die Sprache gestrafft und **Verantwortlichkeiten, technische Anforderungen sowie Führungserwartungen** klar voneinander abgegrenzt – bei gleichzeitiger Wahrung des Senioritätsniveaus und der Kernanforderungen.

# Lead / Principal AI Infrastructure Architect

## Über die Position

Wir suchen einen **Lead / Principal AI Infrastructure Architect**, der die durchgängige Verantwortung für den Entwurf, die Bereitstellung und die Optimierung der Infrastruktur für groß angelegte Workloads im Bereich Künstliche Intelligenz (KI) und maschinelles Lernen (ML) übernimmt.

Der Schwerpunkt der Rolle liegt auf der Architektur hochskalierbarer und kosteneffizienter Rechenumgebungen, einschließlich **GPU-Clustern, Plattformen für verteiltes Training, Infrastruktur für Model-Serving, Netzwerktechnik, Speicherlösungen, Orchestrierung sowie cloudbasierten KI/ML-Plattformen**.

Sie übersetzen Geschäftsziele, Service-Level-Anforderungen, Sicherheitsstandards und technische Rahmenbedingungen in robuste Infrastrukturarchitekturen. Sie evaluieren alternative Lösungen, treffen fundierte Architekturentscheidungen und stellen sicher, dass die Plattformen auf **Leistung, Skalierbarkeit, Zuverlässigkeit, Sicherheit und Kosteneffizienz** ausgelegt sind.

Als technische Führungskraft übernehmen Sie die architektonische Leitung, etablieren Engineering-Standards und Best Practices, betreuen (mentoren) Ingenieure und Architekten und arbeiten eng mit Kunden und Stakeholdern zusammen, um Infrastrukturstrategien und Roadmaps zu definieren.

## Kernaufgaben

### KI/ML-Infrastrukturarchitektur

* Übernahme der Gesamtverantwortung für Architektur und Design der Infrastruktur für groß angelegte KI/ML-Systeme – vom ersten Konzept bis zur Implementierung und Bereitstellung.

* Entwurf der Infrastruktur für verteiltes KI/ML-Training, Inferenz und Model-Serving-Workloads.

* Architektur und Optimierung des gesamten Rechen-Stacks, einschließlich **Rechenleistung, GPUs/Beschleunigern, Netzwerktechnik, Speicher, Orchestrierung und Model-Serving**.

* Evaluierung von Architekturalternativen und Treffen fundierter Entscheidungen auf der Basis von Leistung, Skalierbarkeit, Zuverlässigkeit, Kosten, Sicherheit und Kundenanforderungen.

* Sicherstellung, dass die Infrastrukturarchitekturen mit vereinbarten geschäftlichen SLAs, technischen Standards und betrieblichen Anforderungen im Einklang stehen.

### GPU- und Distributed Computing

* Entwurf und Optimierung groß angelegter **GPU- und beschleunigerbasierter Cluster** für KI/ML-Workloads.

* Evaluierung und Auswahl geeigneter GPU-/Beschleunigertechnologien basierend auf den Anforderungen der Workloads.

* Entwurf von Hochleistungsnetzwerken und Interconnect-Architekturen für verteiltes Training.

* Architektur von Speicherlösungen, die KI/ML-Workloads mit hohem Durchsatz unterstützen.

* Identifizierung und Behebung von Infrastruktur-Engpässen, die sich auf Training, Inferenz, Durchsatz oder Skalierbarkeit auswirken. * Optimierung der Infrastruktur hinsichtlich Leistung, Energieverbrauch, Auslastung und Kosten.

### Cloud-KI/ML-Architektur

* Fungieren als technischer Experte für mindestens eine der großen Hyperscaler-Plattformen, wie z. B. **AWS, Microsoft Azure oder Google Cloud**.

* Anwendung fundierter Kenntnisse in den Bereichen Cloud-KI/ML-Dienste, Rechenplattformen, Beschleuniger (Accelerators), Netzwerk, Speicher, Orchestrierung und Preismodelle.

* Bewertung von Cloud-Architekturoptionen und Empfehlung von Lösungen, die den Anforderungen an Workload, Sicherheit, Leistung und Kosten entsprechen.

* Entwurf skalierbarer Cloud- und Hybrid-Infrastrukturen für KI/ML-Workloads auf Unternehmens- und Großskalenebene.

* Identifizierung von Möglichkeiten zur Optimierung der Cloud-Auslastung und der Infrastrukturkosten.

### Architekturbewertung und Governance

* Leitung von Bewertungen und Überprüfungen bestehender und geplanter KI/ML-Infrastrukturumgebungen.

* Identifizierung von Architekturlücken, technischen Risiken, Leistungsengpässen, Skalierbarkeitsproblemen und Optimierungspotenzialen.

* Festlegung von Strategien zur Problembehebung und Erarbeitung technischer Empfehlungen.

* Etablierung von Architekturstandards, Mustern (Patterns) und Best Practices für die KI-Infrastruktur.

* Dokumentation von Architekturentscheidungen, Annahmen, Abwägungen (Trade-offs) und technischen Begründungen.

* Sicherstellung der Einhaltung relevanter Sicherheits-, Regulierungs-, Governance- und Kundenstandards.

### Infrastruktur-Roadmap und Kapazitätsplanung

* Definition und Pflege der Technologie-Roadmap für die KI/ML-Infrastruktur.

* Entwicklung von Kapazitätsplänen unter Berücksichtigung der Anforderungen von Geschäftsbereichen, Produkten und KI/ML-Workloads.

* Prognose des Bedarfs an Rechenleistung, Speicher, Netzwerkkapazität und Beschleunigern.

* Entwicklung von Kostenmodellen für die Infrastruktur und Identifizierung von Möglichkeiten zur Kostenoptimierung.

* Planung der technologischen Weiterentwicklung, des Workload-Wachstums und der Plattform-Skalierbarkeit.

### Automatisierung, Bereitstellung und Betrieb

* Entwurf von Bereitstellungs- und Automatisierungsstrategien für eine zuverlässige, reproduzierbare und skalierbare KI/ML-Infrastruktur.

* Etablierung geeigneter **CI/CD- und Infrastructure-as-Code-Ansätze** für KI/ML-Plattformen und -Workloads.

* Unterstützung der automatisierten Bereitstellung von KI-Systemen, Modellen und Datenpipelines in Produktionsumgebungen.

* Definition von Betriebsprozessen zur Gewährleistung von Zuverlässigkeit, Skalierbarkeit und Reproduzierbarkeit.

* Etablierung von Strategien für Monitoring und Observability über Infrastruktur- und MLOps-Umgebungen hinweg.

* Definition und Überwachung von **SLAs**.

Prêt à postuler chez Belmont Lavan Ltd ?
Postuler chez Belmont Lavan Ltd

Emplois similaires

Belmont Lavan Ltd
Solution Architect - LangGraph & Agentic AI
Belmont Lavan Ltd
⚡ Postuler tôt Amsterdam, North Holland, Neth... · lieu restreint
● Nouveau 👁 Vu ✓ Postulé il y a 1 j
Huble
German-Speaking CRM Solutions Architect (Remote | Germany/Austria)
Huble
⚡ Postuler tôt Munich, Bavaria, Germany · lieu restreint
● Nouveau 👁 Vu ✓ Postulé il y a 4 sem.
Trexquant Investment
Senior Data Architect (USA)
Trexquant Investment
⚡ Postuler tôt Stamford, Connecticut, United... Sur site $175,000–$200,000
● Nouveau 👁 Vu ✓ Postulé il y a 4 h
Accellor
AI Application Architect
Accellor
⚡ Postuler tôt San Jose, California, United S... Sur site $200,000–$225,000
● Nouveau 👁 Vu ✓ Postulé il y a 4 h
The San Francisco Compute Company
HPC/ GPU Cluster Architect
The San Francisco Compute Company
⚡ Postuler tôt San Francisco, CA Hybride $220,000–$300,000
● Nouveau 👁 Vu ✓ Postulé il y a 5 h
Replit
AI Agent Security Architect
Replit
⚡ Postuler tôt Foster City, CA Hybride
● Nouveau 👁 Vu ✓ Postulé il y a 5 h
Reliable Robotics Corporation
Systems Architect
Reliable Robotics Corporation
⚡ Postuler tôt Mountain View, CA Sur site $190,000–$300,000
● Nouveau 👁 Vu ✓ Postulé il y a 5 h
OpenGov
Staff HR Technology Solutions Architect
OpenGov
⚡ Postuler tôt India | Pune Sur site
● Nouveau 👁 Vu ✓ Postulé il y a 5 h
Normal Computing Corporation
Hardware Engineer, Lead Architect
Normal Computing Corporation
⚡ Postuler tôt Silicon Valley Hybride $200,000–$400,000
● Nouveau 👁 Vu ✓ Postulé il y a 5 h

Inscrivez-vous pour des suggestions adaptées aux emplois que vous ouvrez et aux recherches que vous enregistrez.

Plus d’emplois chez Belmont Lavan Ltd

Voir tous les emplois chez Belmont Lavan Ltd →

Postuler maintenant
🤖

Doucement — un instant

JobsRadar a été conçu pour de vraies personnes qui traversent une période difficile dans leur recherche d’emploi — pas pour des requêtes automatisées. Vous cliquez beaucoup trop vite et vous êtes maintenant temporairement bloqué.

Revenez plus tard. Si vous cherchez réellement un emploi, nous sommes de votre côté — agissez simplement comme un être humain.

Catch your next role the second it’s posted.

Create a free account and we’ll watch the boards for you — the instant a job matches your search, it lands in your inbox or Telegram. No digging, no refreshing.

Create free account

Free forever · takes 30 seconds · already have one?

Prenez une longueur d’avance dans votre recherche d’emploi.

Rejoignez notre canal Telegram pour ce qui vous aide à décrocher le poste — références salariales, le pouls hebdomadaire du marché et les annonces de nouveautés. Pas de spam, que du signal.

Rejoindre le canal — c’est gratuit