• Español Español Espagnol es
  • English English Anglais en
  • Français Français Français fr
  • Panier Panier
    0Panier
SIXE
  • Services
    • Assistance technique
      • IBM Power (AIX, Linux, IBM i)
      • Ubuntu avec SIXE UP
      • Kubernetes
      • Openstack
      • Red Hat (RHEL)
      • SUSE
      • SUSE et Red Hat Linux
      • SAP
      • Ceph
      • IBM Storage
      • Bases de données
        • DB2
        • Informix
        • MariaDB / PostgreSQL
    • Migrations
      • Vers Ubuntu depuis Red Hat ou SUSE
      • Vers Linux
      • Vers AIX depuis Red Hat ou z/OS
      • Vers OpenStack depuis VMWare et HyperV
      • Vers Red Hat OpenShift depuis VMWare
      • Vers Proxmox VE depuis VMWare
    • Conseil technique
      • Stratégie
        • Radar technologique
        • Technologie durable
        • Ceph
        • PRS
        • vCTO
  • Infra
    • Serveurs
      • IBM LinuxONE 5
      • IBM Power11
      • Supermicro
      • Dell
      • Lenovo
    • Stockage
      • Ceph
      • IBM Flash Storage
      • IBM Storage Scale (GPFS)
      • IBM Storage Fusion | Infrastructure IA pour OpenShift
      • Backup
        • IBM Storage Defender : Résilience des Données & Protection Anti-Ransomware
        • Bacula
        • Trilio
    • Charges de travail
      • Conteneurs
      • Machines virtuelles
      • Cloud privé
      • Bases de données
      • Logiciels IBM
      • Observabilité et AIOps
  • Cybersécurité
    • Sécurité IT
      • Surveillance et Réponse (SIEM & SOAR)
        • Wazuh
        • IBM QRadar
      • Protection des endpoints
        • OpenUEM
      • Protection des informations (IRM et DLP)
        • Sealpath IRM
      • Outils de sécurité IBM
        • IBM PowerSC
    • Sécurité OT
      • Claroty
      • Tenable OT
      • Cybersécurité TI-OT
  • AI ✨
    • Agents IA auditables pour l’entreprise
    • Inférence IA Souveraine
    • Training
    • Service d’automatisation
    • Ceph pour l’IA et le HPC
    • Docling
    • WatsonX
  • Formation
    • Linux | AIX | IBM i
      • Linux
      • AIX
      • IBM i (RPG, Cobol, ILE, DB2)
      • PowerVM
      • PowerHA
    • Iaas & PaaS ☁️
      • OpenShift
      • Docker et kubernetes
      • KVM et Ovirt
      • Virtualisation avec VMWare ESXi et vSphere
      • Red Hat Ansible
      • Foreman / Satellite
    • Infra & Données
      • OpenStack
        • Déploiement et Administration
        • Maintenance et Mise à Jour
        • Production et Migration VMware
      • CEPH
        • Initiation
        • Avancé
        • Expert (Ingénierie de production)
      • HPC
      • Informix
      • Storage
      • DB2
      • IBM Instana et Turbonomic
    • IBM Security
      • IBM QRadar
      • Analyste en cybersécurité
      • IBM Guardium
    • Formation officielle
      • Catalogue formations IBM
      • Catalogue formations Canonical
      • Formation sur mesure
  • Qui sommes-nous
  • Contacter
  • Cliquez pour ouvrir le champ de recherche Cliquez pour ouvrir le champ de recherche Rechercher
  • Menu Menu
Canonical business partner

Rechercher d’autres cours

×

Explorer par domaine de formation

IBM
🖥️ Mainframe et z/OS
z/OS 47CICS 9RPG 2DB2 36
📊 Données et Analytics
Planning Analytics 4Infosphere 31BigInsights 7Datacap 12
🤖 IA et Automatisation
Watson 6IBM AI 14
☁️ Cloud et Infrastructure
Cloud Management 4SmartCloud 5AIX 11IBM i 14IBM Storage 5Linux 16
🔐 Sécurité 5
📁 Gestion de Contenu
FileNet 13Content Navigator 7Case Manager 9Case Foundation 12Enterprise Records 8
⚙️ Développement et Middleware
Integration Bus 3API Connect 4Rational 13DataPower 6Operational Decision Manager 8IBM Decision Server 4
💼 Business et Processus
Business Process Manager 29Sterling 17Curam 13TRIRIGA 5perations Analytics 3IBM Algo One 17
Canonical / Ubuntu
🛠️ Administration système 4🔄 Automatisation 2🛡️ Cybersécurité 2☁️ Cloud 2📦 Conteneurs 1🤖 IA 2💻 Virtualisation 1
HashiCorp
🏗️ Terraform 3🔒 Vault 1
IA et Automatisation
⚡ N8N 2⚡ Zapier 2

Formation big data et Apache Spark pour l’IA

3.075,00€

Formation big data et Apache Spark de 3 jours pour préparer les données d’IA sur ton propre stockage : chaînes reproductibles, qualité, lignage et temps réel.

Catégorie : IA
  • Description

Description

Formation big data avec Apache Spark pour préparer les données qui alimentent les modèles et assistants d’IA sur ton propre stockage : Ceph, stockage compatible S3 ou systèmes de fichiers parallèles, pas un service cloud. On construit une chaîne de traitement qu’on peut relancer sans dupliquer les données et qui explique d’où vient chaque résultat.

Informations sur la formation

Code SIXE : SXIA06Catégorie : Intelligence artificielle / Données
Modalité : En ligne et en présentielDurée : 3 jours

Pour qui

Data engineers, analystes avancés et équipes plateforme qui doivent déplacer et préparer de gros volumes de données pour entraîner ou alimenter des modèles.

Prérequis

Bases de Python et de SQL. Aucune expérience préalable de Spark ou de Hadoop n’est nécessaire.

Ce que tu vas apprendre

  • Concevoir la chaîne de traitement : schémas, contrats de données, formats comme Parquet et contrôles qualité dès l’entrée.
  • Spark de l’intérieur : partitions, shuffle et pourquoi un job est lent ; quand Python suffit et quand distribuer devient rentable.
  • Lire et écrire sur ton stockage : Spark sur un stockage compatible S3 comme Ceph, et l’effet du réseau et des disques sur les performances.
  • Chargements incrémentaux : ne traiter que les nouveautés, relancer sans doublons et reprendre un chargement interrompu.
  • Données en temps réel : événements avec Spark Structured Streaming, fenêtres et données qui arrivent en retard.

On travaille avec trois sources d’exemple (un CSV, une API et un flux d’événements) et tu repars avec une chaîne Spark prête à alimenter un modèle, avec son lignage et ses contrôles.

Ce que tu emportes

  • Une chaîne Spark avec contrats et contrôles qualité.
  • Le registre du lignage et de chaque chargement.
  • Un test de reprise d’un chargement interrompu.

Le stockage est presque toujours le goulot d’étranglement de ces charges : nous l’expliquons dans quel stockage choisir pour l’IA et le HPC. Si tu utilises Ceph, nous proposons une formation Ceph et du support Ceph pour l’IA et le HPC.

Questions fréquentes

Combien de temps dure la formation ?

3 jours.

Est-elle en ligne ou en présentiel ?

Les deux : dans tes locaux ou à distance, avec un formateur en direct.

Que dois-je savoir avant de commencer ?

Bases de Python et de SQL. Aucune expérience préalable de Spark ou de Hadoop n’est nécessaire.

Faut-il un cluster Hadoop ?

Non. Spark tourne en local, sur Kubernetes ou sur un petit cluster. La formation utilise un environnement de laboratoire et explique comment le transposer chez toi.

Est-ce utile sans Ceph ?

Oui. Tout stockage compatible S3 ou système de fichiers partagé convient.

Peut-on l’adapter à mon équipe ?

Oui. Nous adaptons les exemples et les travaux pratiques aux outils et aux processus de l’équipe, et elle peut être combinée avec d’autres formations en IA.

Produits similaires

  • Formation LangChain : RAG et agents en local

    2.240,00€
    Ajouter au panier Ajouter au panier Nº de alumnos Voir les détails Voir les détails Voir les détails
  • Formation Agents IA et Automatisation pour Équipes Techniques

    3.075,00€
    Ajouter au panier Ajouter au panier Nº de alumnos Voir les détails Voir les détails Voir les détails
  • Formation deep learning avec PyTorch et TensorFlow

    3.075,00€
    Ajouter au panier Ajouter au panier Nº de alumnos Voir les détails Voir les détails Voir les détails
  • logo zapier sur sixe

    Zapier cours professionnel niveau débutant : Automatisation des affaires : SIXE

    1.225,00€
    Ajouter au panier Ajouter au panier Nº de alumnos Voir les détails Voir les détails Voir les détails

Blog!

  • Pénurie de RAM : les serveurs augmentent, jusqu’à quand ?
  • IBM Z et Arm : ce que résout un processeur dual-ISA
  • Qu’est-ce qu’une matrice de traçabilité ?
  • LLM en local : monter son propre serveur IA
  • Servir l’IA générative 56x plus vite sans acheter de GPU

Contactez-nous !

Assistance d’urgence 24/7
Matériel et systèmes
Migrations
IA et HPC on-premise
Formation
Cybersécurité

Ressources
Nouveautés
Livres Blancs
Devenez partenaire de SIXE
Demander une démo

Partners

  • Canonical
  • Docker
  • HCL
  • IBM
  • Kaspersky
  • Lenovo
  • Red Hat
  • Sealpath
  • SUSE
  • Tenable

Notre mission

SIXE garantit que vos infrastructures basées sur les technologies IBM®, Red Hat®, Canonical® et SUSE® restent stables, sécurisées et optimisées aussi longtemps que vous en avez besoin.

Chez SIXE, nous nous engageons pour la durabilité. C’est pourquoi nous vous aidons à concevoir, mettre en œuvre et maintenir des solutions technologiques durables et efficaces.

SIXE green energy

+34 91 198 02 43 (UE) | +1 628 900 3024 (EUA) | WhatsApp | Lun–Ven 8h30–16h30 (GMT+1)
© 2026 - SIXE | Formation, conseil, services professionnels et projets clés en main | IBM, Lenovo, Canonical, Red Hat, HCL, Sealpath & SUSE Authorized Business Partner. Entreprise inscrite au catalogue des entreprises de cybersécurité de l'INCIBE.
HQ - Paris | Bruxelles | Madrid | Barcelone  ·  Qui sommes-nous | Devenez partenaire | Contacter
  • Lien vers LinkedIn Lien vers LinkedIn Lien vers LinkedIn
  • Lien vers Facebook Lien vers Facebook Lien vers Facebook
  • Lien vers X Lien vers X Lien vers X
  • politique de cookies (UE)
  • Mentions légales
  • Politique de confidentialité
Lien vers: Formation LangChain : RAG et agents en local Lien vers: Formation LangChain : RAG et agents en local Formation LangChain : RAG et agents en localLien vers: Formation sécurité de l’IA : OWASP LLM et red teaming Lien vers: Formation sécurité de l’IA : OWASP LLM et red teaming Formation sécurité de l’IA : OWASP LLM et red teaming
Faire défiler vers le haut Faire défiler vers le haut Faire défiler vers le haut
SIXE
SIXE
Gérer le consentement aux cookies

Chez SIXE, nous accordons la priorité à votre confort et à votre sécurité. Ces technologies nous aident à optimiser nos services, à personnaliser le contenu et à vous proposer des solutions adaptées à vos besoins réels. Votre vie privée est importante : vous aurez toujours le contrôle de ce que vous partagez avec nous.

Fonctionnel Toujours activé
El almacenamiento o acceso técnico es estrictamente necesario para el propósito legítimo de permitir el uso de un servicio específico explícitamente solicitado por el abonado o usuario, o con el único propósito de llevar a cabo la transmisión de una comunicación a través de una red de comunicaciones electrónicas.
Preferences
El almacenamiento o acceso técnico es necesario para la finalidad legítima de almacenar preferencias no solicitadas por el abonado o usuario.
Statistiques
El almacenamiento o acceso técnico que es utilizado exclusivamente con fines estadísticos. El almacenamiento o acceso técnico que se utiliza exclusivamente con fines estadísticos anónimos. Sin un requerimiento, el cumplimiento voluntario por parte de tu Proveedor de servicios de Internet, o los registros adicionales de un tercero, la información almacenada o recuperada sólo para este propósito no se puede utilizar para identificarte.
Marketing
El almacenamiento o acceso técnico es necesario para crear perfiles de usuario para enviar publicidad, o para rastrear al usuario en una web o en varias web con fines de marketing similares.
  • Gérer les options
  • Gérer les services
  • Gérer {vendor_count} fournisseurs
  • En savoir plus sur ces finalités
Voir les préférences
  • {title}
  • {title}
  • {title}