↓ Aller au contenu
Machine learning : comprendre les bases sans écrire une ligne de code
  1. Articles/

Machine learning : comprendre les bases sans écrire une ligne de code

Sommaire

Votre banque bloque un paiement suspect avant même que vous ayez remarqué quoi que ce soit. Votre boîte mail range toute seule les factures dans un dossier à part. Votre appli photo retrouve toutes les images de votre chien quand vous tapez « chien ». Derrière ces trois petits miracles du quotidien tourne la même mécanique : le machine learning, ou apprentissage automatique en bon français. Le terme impressionne, et les cours qui démarrent par des dérivées partielles n’arrangent rien. Pourtant, la logique se comprend très bien sans équation et sans Python. Mieux : vous pouvez entraîner votre propre modèle ce soir, gratuitement, avec une webcam et dix minutes devant vous.

Apprendre par l’exemple plutôt que par la règle
#

Un programme classique suit des règles écrites par un humain. « Si le montant dépasse 1 000 euros et que la carte est utilisée à l’étranger, alors bloque. » Ça marche tant que le monde reste simple. Dès que les cas se multiplient, c’est l’enfer : il faudrait des milliers de règles, et les fraudeurs s’adaptent plus vite que les développeurs.

Le machine learning renverse la table. Au lieu d’écrire les règles, on donne des exemples à la machine, beaucoup d’exemples, accompagnés de la bonne réponse. À elle de dégager les régularités.

Prenez un agent immobilier avec vingt ans de métier. Il entre dans un appartement, jette un œil à la surface, à l’étage, à la rue, et annonce un prix à 5 % près. Personne ne lui a donné de formule. Il a vu passer des centaines de ventes et sa tête a fini par en tirer un modèle intuitif. Un algorithme de machine learning fait la même chose, en plus besogneux : on lui montre 50 000 ventes passées (surface, quartier, étage, année de construction, prix final) et il ajuste ses calculs jusqu’à ce que ses estimations collent à la réalité.

Trois mots de vocabulaire, et vous aurez déjà de quoi suivre une réunion avec une équipe data :

  • Les variables (ou features) : les informations fournies en entrée. Ici la surface, le quartier, l’étage.
  • L’étiquette (ou label) : la réponse qu’on cherche à prédire. Le prix de vente, dans notre exemple.
  • Le modèle : ce qui reste une fois l’apprentissage terminé. Une sorte de formule géante, que personne n’a écrite à la main, capable de transformer des variables en prédiction.

Si vous voulez replacer tout ça dans le paysage global (IA, deep learning, IA générative), notre introduction à l’intelligence artificielle pour les non-techniques plante le décor.

Les trois grandes familles d’apprentissage
#

Tous les algorithmes n’apprennent pas de la même manière. On distingue trois approches, et savoir les reconnaître suffit pour comprendre l’immense majorité des projets dont vous entendrez parler.

FamillePrincipeExemples concrets
Apprentissage superviséOn fournit des exemples avec la bonne réponseDétecter un spam, estimer un prix, prévoir des ventes
Apprentissage non superviséPas de bonne réponse : la machine cherche des groupes ou des anomaliesSegmenter une base clients, repérer une transaction bizarre
Apprentissage par renforcementLa machine essaie, reçoit récompenses ou pénalités, puis recommenceJouer au go, piloter un robot, régler un chauffage

Le supervisé écrase tout le reste en entreprise. Il recouvre deux types de problèmes. La classification répond à une question à choix fermés : spam ou pas spam, client sur le départ ou client fidèle, tumeur bénigne ou maligne. La régression, elle, prédit un nombre : un prix, une température, un chiffre d’affaires pour le mois prochain.

Le non supervisé sert quand vous n’avez pas d’étiquettes, ce qui arrive plus souvent qu’on ne le croit. Vous avez 20 000 clients et aucune idée de la façon de les regrouper ? Un algorithme de clustering va proposer des familles en se basant sur leurs comportements d’achat. À vous ensuite de leur donner un nom et de juger si ce découpage tient la route. La machine propose, l’humain dispose.

Le renforcement fait rêver (c’est lui qui a battu l’un des meilleurs joueurs de go au monde en 2016), mais soyons honnêtes : vous le croiserez rarement dans une PME. Il réclame un environnement où la machine peut se planter des millions de fois sans conséquence, ce qui n’est pas vraiment le cas de votre service comptabilité.

Comment se fabrique un modèle, étape par étape
#

On imagine volontiers un data scientist qui passe ses journées à peaufiner des algorithmes sophistiqués. La réalité est moins glamour. Un projet de machine learning ressemble plutôt à ça :

  1. Poser une question précise. « Utiliser l’IA pour améliorer les ventes » n’est pas un projet. « Prédire quels clients risquent de résilier dans les 30 jours » en est un.
  2. Rassembler et nettoyer les données. Doublons, dates au mauvais format, champs vides, codes postaux fantaisistes. Cette étape avale facilement les deux tiers du temps, et tous les praticiens vous le confirmeront avec un soupir.
  3. Couper les données en deux paquets. Environ 80 % pour l’entraînement, 20 % mis de côté pour le test. Le modèle ne verra jamais ce second paquet pendant qu’il apprend.
  4. Entraîner. L’algorithme parcourt les exemples, tente des prédictions, mesure ses erreurs et se corrige. Des milliers de fois.
  5. Évaluer sur les données de test. C’est l’examen final, sur des sujets que l’élève n’a jamais vus.
  6. Mettre en service et surveiller. Un modèle vieillit. Les habitudes des clients changent, les prix bougent, et un modèle nourri aux données de 2023 peut raconter n’importe quoi en 2026.

L’étape 3 mérite qu’on s’y arrête, parce que tout le reste en dépend. Imaginez un étudiant qui révise avec les annales et retombe pile sur les mêmes sujets le jour de l’examen. Il décroche 20 sur 20. A-t-il compris le cours ? Mystère. Peut-être a-t-il juste appris les corrigés par cœur. Pour le savoir, il faut lui poser des questions inédites. Le jeu de test sert à ça, et à rien d’autre.

[Schéma à insérer : le cycle de vie d’un modèle, des données brutes au découpage entraînement/test, puis à l’évaluation et à la mise en service]

Astuce : quand un prestataire vous annonce « notre modèle atteint 97 % de bonnes réponses », posez la question qui fâche : mesurées sur quelles données ? Si la réponse est « celles de l’entraînement », le chiffre ne vaut rien.

Les pièges que même les pros ne voient pas toujours venir
#

Le surapprentissage. C’est l’étudiant aux annales dont on vient de parler. En anglais, overfitting. Le modèle a tellement bien mémorisé ses exemples, bruit et coïncidences compris, qu’il ne sait plus généraliser. Brillant à l’entraînement, perdu dans la vraie vie. Le symptôme se repère vite : un gros écart entre le score d’entraînement et le score de test.

Le chiffre flatteur qui ne veut rien dire. Supposons que 1 % des transactions bancaires soient frauduleuses. Un modèle idiot qui répond « pas de fraude » à tous les coups aura raison dans 99 % des cas. Score magnifique, utilité nulle : il ne détecte rien du tout. Voilà pourquoi les équipes data surveillent d’autres indicateurs, comme le rappel (parmi les vraies fraudes, combien en a-t-on attrapé ?) et la précision (parmi les alertes levées, combien étaient justifiées ?).

Les données qui mentent. Un modèle n’a aucun esprit critique. Si votre historique contient des erreurs ou des discriminations, il les reproduira avec application, et à grande échelle. Le vieil adage des informaticiens n’a pas pris une ride : garbage in, garbage out.

La corrélation prise pour une cause. Les ventes de glaces et les noyades grimpent en même temps. Personne n’en conclut qu’il faut interdire les sorbets : les deux dépendent de la chaleur. Un algorithme, lui, ne fait pas la différence. Il repère que deux choses bougent ensemble, point. L’interprétation reste votre boulot.

Attention : le règlement européen sur l’IA range les systèmes utilisés pour le recrutement, l’octroi de crédit ou l’éducation parmi les usages « à haut risque », avec à la clé des obligations de documentation et de contrôle humain. Tester un modèle pour s’amuser ne pose aucun souci ; s’en servir pour trier des candidatures, c’est une autre histoire.

Entraîner son premier modèle sans coder
#

Passons à la pratique. Trois outils gratuits permettent de manipuler du vrai machine learning sans taper une seule instruction.

OutilPour quoi faireInstallationPrix
Teachable Machine (Google)Reconnaître des images, des sons ou des posturesAucune, tout se passe dans le navigateurGratuit
Orange Data MiningExplorer des tableaux de données, classer, regrouperLogiciel à installer (Windows, macOS, Linux)Gratuit, open source
KNIME Analytics PlatformBâtir des chaînes de traitement complètesLogiciel à installerGratuit, open source (offre serveur payante)

Teachable Machine est le meilleur point de départ, et de loin. Le déroulé tient en quatre gestes :

  1. Ouvrez le site et choisissez « Projet Image ».
  2. Créez deux classes, par exemple « Tasse » et « Stylo ». Pour chacune, maintenez le bouton de la webcam enfoncé en faisant tourner l’objet devant l’objectif. Une centaine d’images par classe suffit.
  3. Cliquez sur « Entraîner le modèle ». Trente secondes d’attente, à peu près.
  4. Présentez un objet à la caméra : le modèle affiche en direct son niveau de confiance pour chaque classe.

Le plus instructif vient après, quand vous essayez de le piéger. Montrez-lui une tasse d’une autre couleur. Changez de pièce. Mettez votre main devant. Vous verrez le modèle hésiter, puis se tromper avec aplomb, et vous comprendrez physiquement ce qu’est un jeu d’entraînement trop pauvre. Dix minutes de ce petit jeu valent deux heures de théorie.

[Capture d’écran à insérer : l’interface de Teachable Machine avec deux classes d’images et l’aperçu en direct du niveau de confiance]

Orange monte d’un cran. On y assemble des briques (les widgets) sur un canevas : une pour charger un fichier, une pour séparer les données, une pour l’algorithme, une pour mesurer le résultat. Le logiciel embarque des jeux de données d’exemple, dont le fameux Titanic, où il s’agit de deviner qui a survécu en fonction de l’âge, du sexe et de la classe du billet. En reliant quatre widgets, vous obtenez un arbre de décision lisible à l’œil nu. Personnellement, c’est l’outil que je conseille aux gens à l’aise avec Excel : on y retrouve des tableaux, des colonnes, et la marche n’est pas si haute.

KNIME suit la même logique visuelle, en plus costaud. Il tourne en production dans de vraies entreprises, notamment dans la banque et l’industrie pharmaceutique. L’interface est plus austère, la prise en main plus rude. À garder pour ceux qui ont déjà fait le tour d’Orange.

Et ChatGPT dans tout ça ?
#

Question légitime : à l’heure où un assistant IA répond à tout, le machine learning « classique » garde-t-il un intérêt ? Oui, et pour longtemps.

Les grands modèles de langage sont eux-mêmes du machine learning, version XXL : même principe d’apprentissage par l’exemple, appliqué à des milliards de textes. Mais pour prévoir le stock de la semaine prochaine, noter un risque de crédit ou anticiper une panne sur une machine-outil, les entreprises s’appuient toujours sur des modèles spécialisés, entraînés sur leurs propres chiffres. Ils coûtent moins cher, répondent plus vite, et surtout on peut vérifier leurs performances noir sur blanc.

Les deux mondes se complètent. Un assistant génératif fait d’ailleurs un très bon répétiteur : demandez-lui d’expliquer une matrice de confusion comme si vous aviez quinze ans, il s’en sort bien. Si ce versant vous attire, le guide des formations à ChatGPT et à l’IA générative fait le tri dans l’offre.

Aller plus loin : quelles formations, quel budget
#

Le sujet n’a rien d’une mode passagère. En France, 18 % des entreprises de dix salariés ou plus utilisaient au moins une technologie d’IA en 2025, contre 6 % deux ans plus tôt. Au-delà de 250 salariés, on dépasse la moitié. Comprendre comment ces systèmes apprennent devient une compétence de culture générale professionnelle, au même titre que savoir lire un bilan.

Selon votre objectif, trois paliers.

Pour consolider la culture générale. Elements of AI, le cours en ligne de l’université d’Helsinki, reste une référence : gratuit, disponible en français, une trentaine d’heures, zéro code. Plus de deux millions de personnes l’ont suivi. OpenClassrooms propose aussi des cours d’initiation en accès libre.

Pour comprendre ce qui se passe sous le capot. La Machine Learning Specialization d’Andrew Ng, sur Coursera, est le grand classique. Comptez 49 dollars par mois et deux à trois mois de travail à raison de quelques heures par semaine, soit une centaine de dollars au total. Elle est en anglais et demande de mettre les mains dans Python. Honnêtement, n’y allez pas sans un minimum de bases : commencez par notre guide Python pour débutants, vous gagnerez du temps.

Pour en faire un métier. Là, on parle d’un vrai parcours : statistiques, Python, SQL, puis spécialisation. Un ingénieur machine learning débutant démarre entre 40 000 et 52 000 euros brut par an en France, davantage à Paris. Mais le poste s’adresse à des profils techniques solides. Pour beaucoup de personnes en reconversion, la porte d’entrée réaliste reste l’analyse de données, dont on détaille les compétences clés dans un article dédié.

Par où commencer cette semaine
#

Pas besoin d’un plan sur six mois. Trois actions, dans l’ordre :

  1. Ce soir, vingt minutes sur Teachable Machine. Entraînez un modèle, puis cherchez à le faire échouer.
  2. Ce week-end, installez Orange et déroulez l’exemple du Titanic avec un arbre de décision.
  3. Le mois prochain, attaquez Elements of AI à raison de deux ou trois heures par semaine.

À ce stade, vous ne saurez pas construire un système de recommandation. En revanche, vous saurez poser les bonnes questions quand quelqu’un voudra vous en vendre un : d’où viennent les données, comment le modèle a été testé, que se passe-t-il quand il se trompe. Et dans bien des métiers, c’est justement cette compétence-là qui manque.

Articles connexes

Introduction à l'intelligence artificielle pour les non-techniques

Demandez à dix personnes d’expliquer l’intelligence artificielle, vous obtiendrez onze réponses différentes - dont au moins trois catastrophistes. Depuis que ChatGPT a débarqué fin 2022, le sujet s’est retrouvé partout : à la une des journaux, dans les réunions d’équipe, jusque dans les dîners de famille où votre oncle vous demande si un robot va lui piquer son boulot. Le souci ? Les explications qu’on trouve en ligne sont soit truffées de jargon mathématique, soit tellement simplifiées qu’elles ne veulent plus rien dire. On va essayer de trouver le juste milieu.

Certification Google Data Analytics : programme, coût et avis

Trois millions huit cent mille inscrits, une note de 4,8 sur 5 pour 182 000 avis, et une promesse tenace : devenir data analyst sans diplôme et sans expérience, en six mois, pour moins de 300 euros. Le certificat Google Data Analytics est devenu le point d’entrée par défaut du métier, au point qu’on le retrouve sur un CV junior sur trois. Alors forcément, la question revient : c’est du sérieux ou du marketing bien rodé ?

Les métiers de la data : data analyst, data engineer, data scientist

On range souvent ces trois métiers dans le même sac étiqueté “la data”. Sauf qu’un data analyst, un data engineer et un data scientist ne font pas du tout le même boulot. Pas les mêmes outils, pas les mêmes journées, pas les mêmes salaires non plus. Les mettre dans la même case, ça revient à ranger le maçon, le plombier et l’architecte sous le mot “bâtiment” : oui, ils bâtissent la même maison, mais pas au même moment, et pas avec les mêmes mains.