drt 1 — Transcript
Full transcript
- 0:00Regardez bien ce bien immobilier. Sa
- 0:02superficie est de 96 m². J'ai donné ces
- 0:05caractéristiques à mon premier modèle
- 0:08d'intelligent tielpiton à estimé son
- 0:10prix et imaginez-vous sa prédiction, il
- 0:13me dit 413125
- 0:15€. Mais pourtant son véritable prix est
- 0:18de 377
- 0:20957
- 0:21€. Donc mon modèle a fait une erreur de
- 0:2435169
- 0:26€. Alors la question que je peux me
- 0:28poser, comment est-ce que mon modèle
- 0:30s'est trompé jusqu'à de 35000 € sur ce
- 0:33bien ? Alors, a-t-elle réellement appris
- 0:36à prédire le prix d'une maison ou alors
- 0:39ça produit simplement des chiffres
- 0:41fantais ? Moi c'est William ingénieur
- 0:43logiciel Bas Allemagne. Je suis le
- 0:45fondateur de ces chaîne GM de Code. Ici
- 0:48on parle de l'école, de l'éducation, de
- 0:50l'intelligence artificielle de tous les
- 0:52métiers touchent au numérique. Alors je
- 0:55m'adresse aux parents, aux enseignants,
- 0:58aux jeunes, aux élèves, aux personnes
- 1:00curieuses qui veulent apprendre à coder
- 1:03et aussi aux passionnés de
- 1:05l'informatique et du code. Alors, je
- 1:08reviens ici avec la 4e vidéo avec Python
- 1:11langage programmation Python. On
- 1:13entraîne un modèle d'intelligence
- 1:15artificiel qui permet de prédire le prix
- 1:18d'un bien immobilier. Alors, on va
- 1:21regarder cette démo ensuite je vous
- 1:23reviens après. Voici la partie Python
- 1:25que nous allons utiliser. Alors, ce
- 1:26qu'on va faire, ça c'est juste pour
- 1:28faire une démonstration. Donc je vais
- 1:30utiliser les données synthétiques.
- 1:32Voilà, tout à l'heure je vais un peu
- 1:33expliquer. Alors quand je clique là,
- 1:34alors on peut voir ici les données
- 1:35synthétiques point bien. On peut voir
- 1:38aussi le modèle qui a été entraîné sur
- 1:40500 lignes nettoyé. On voit ici que est
- 1:43de on va voir que mon modèle se trompe
- 1:45de 10712
- 1:47ce qui est un peu différent de de tout à
- 1:49l'heure et son taux d'erreur est de 2,7
- 1:52%. 2,7 %. À noter ici que j'ai séparé,
- 1:55tout à l'heure, je vais montrer dans le
- 1:57dans mon programme, j'ai séparé les
- 1:59données. Donc des 500 données, si j'ai
- 2:01séparé, 80 %, je l'ai je l'ai passé à
- 2:04l'entraînement et 20 % pour les tests et
- 2:08ce qui me donne ici euh une erreur de
- 2:1010000. Donc à chaque fois mon modèle se
- 2:12trompe d'environ 10712 €. Voilà, c'est
- 2:15un peu ça. Et tout à l'heure, on va
- 2:17essayer de comprendre. OK, on va essayer
- 2:19de comprendre encore un peu plus en en
- 2:20profondeur. Alors, c'est quoi le danger
- 2:23avec l'intelligence artificiel ?
- 2:24Justement, le danger, c'est que elle
- 2:26nous livre souvent des prédictions qui
- 2:29peuvent bluffer, c'estàdire le chiffre
- 2:32tellement précis du genre 495640.
- 2:36Quand on voit ce chiffre, on se dit
- 2:38"Mais ce résultat est tellement propre
- 2:40et il doit être juste." C'est pour cela
- 2:42que on appelle toujours à l'esprit
- 2:45critique de l'être humain pour vérifier
- 2:48toujours le résultat d'un prom.
- 2:50Tellement important. On va un peu
- 2:52essayer d'entrer maintenant en
- 2:53profondeur. Ça c'est mon ça c'est mon
- 2:55code. Ça c'est ici que tout se passe.
- 2:57Comme j'ai dit pour cette démo,
- 2:59j'utilise des données synthétiques quoi.
- 3:02Ça veut dire je génère les données là à
- 3:05partir de mon programme informatique.
- 3:06Donc je ne prends pas ces données dans
- 3:08un cadastre et cetera et cetera. Bon on
- 3:11va un peu essayer de comprendre parce
- 3:13que bon j'avais expliqué un peu à quoi
- 3:15c'est panda, à quoi c'est la la ligère
- 3:18régression. Je crois que ça ce sont les
- 3:20choses qu'on a vu. Ça c'est un algorme
- 3:22qui va nous permettre d'entraîner le
- 3:23modèle. Voilà ce que j'avais à dire
- 3:25c'est que nos futurs, c'està-dire que
- 3:27les données d'entrée, on a parlé de la
- 3:29superficie, l'éloignement du bien
- 3:31centreville, on a parlé de l'état du
- 3:34bien, on a parlé de la localisation,
- 3:35c'est dans quel quartier, c'est le bien
- 3:37su à à quel étage et puis ça a quel
- 3:40nombre de pièces. Et là, on a le label,
- 3:43c'est exactement la prédiction, donc
- 3:45c'est la sortie. Ça c'est des choses que
- 3:48on a on a déjà vu. Je veux pas je veux
- 3:50pas trop entrer dans les détails. Je
- 3:51veux juste donner les points plus
- 3:52importants. Le point le plus important,
- 3:54c'est ici justement parce que c'est ici
- 3:55que tout se passe. OK. D'abord ici,
- 3:57j'initialise un peu des choses.
- 3:59J'initialise un peu toutes les choses.
- 4:01OK. Ici, ce qui est intéressant, comme
- 4:03je dis, on va générer comme ça là de
- 4:06manière aléatoire 500 données. Bon, on
- 4:09avait déjà euh la dernière fois, j'avais
- 4:11un peu montré c'est quoi euh à quoi ça
- 4:13serne data frame. Tout commence à là.
- 4:15data frame, ça aide à séparer les futurs
- 4:18et les labels. Et en fait, ce qu'on peut
- 4:20retenir ici, c'est que euh les entrées,
- 4:23c'est les entrées qu'on connaît ici. Et
- 4:26ensuite, je génère en fait pour ma
- 4:28démonstration des lignes de données.
- 4:30Ensuite, j'utilise certaines méthodes
- 4:34pour supprimer les les puisque c'est
- 4:37c'est généré de manière aléatoire. Donc
- 4:39c'est possible qu'il y ait les duplicats
- 4:42les les données dupliquées. Alors avec
- 4:44mon code ici je nettoie parce qu' on a
- 4:47vu ça ici par notamment là avec le clean
- 4:49dataset on avait vu là que comment on
- 4:52analyse les données. C'est important de
- 4:54supprimer de supprimer les lignes qui
- 4:57n'ont pas qui ne font pas sens parce que
- 4:59ça sert à rien d'entraîner un modèle I
- 5:01avec des données qui sont pas bonnes.
- 5:03Donc c'est ce que fait un peu ce code
- 5:05là. En fait, on a on a ce clean dataset
- 5:07pour essayer de récupérer que les
- 5:09données qui font sens même jusqu'à là.
- 5:11Ça veut pas dire qu'après ça va te
- 5:12donner toujours quand même une
- 5:13prédiction qui sera excellente mais déjà
- 5:15tu augmentes quand même la probabilité
- 5:17pour que ça donne des choses excellents.
- 5:18Voilà. Donc ensuite aussi très important
- 5:21aussi, on va voir où je sépare aussi, je
- 5:24réserve 80 % de ces 500 ligne de de
- 5:28données à entraîner. Je sépare ici, je
- 5:31les sépare 80 % pour entraîner et 20 %
- 5:35pour les tests. Ceci OK, donc je sépare
- 5:38donc train test donc je sépare 20 % donc
- 5:41je vais ici avec voilà un size de 20 %
- 5:45pour les tests. Là, voilà. Donc donc en
- 5:48gros, ça c'est juste pour montrer un peu
- 5:50le code. Je veux pas entrer trop dans
- 5:51les détails. Donc ici, c'est pour c'est
- 5:54pour voir en fait que c'est c'est pas
- 5:57les trucs inventés. Voilà. Et je je le
- 6:00redis ici euh ici j'ai produit les
- 6:03données de manière synthétique. Donc ce
- 6:05sont pas les données qui viennent du
- 6:06cadastre. Ça permet juste de faire une
- 6:08démonstration et vous présenter. OK ?
- 6:11Donc c'est ce qu'on peut retenir parce
- 6:12que là on a pu voir à travers les
- 6:14différents démons que le résultat que un
- 6:17prom l'intelligent artificiel nous livre
- 6:19c'est le résultat d'un calcul de
- 6:20probabilité c'est le résultat de de ce
- 6:22calcul qui nous remet alors c'est à nous
- 6:25de tout le temps checker et ça nous
- 6:27permet aussi de parler du prochain
- 6:28danger qui est le surapprentissage. Là
- 6:31aussi, on a vu ici à travers les
- 6:33différentes démonstrations qu'on a, on
- 6:35entraîne notre modèle avec 80 % des
- 6:38données disponibles et 20 % c'est pour
- 6:40les tests. Bon, imagine-toi alors que
- 6:42ton modèle est tellement surentraîné au
- 6:45point où quand tu lui donnes maintenant
- 6:47voilà quand tu passes à 90 % ou bien à
- 6:4998 % des données que tu utilises pour
- 6:51l'apprentissage, quand tu lui donnes les
- 6:53nouvelles données qu'il ne connaît pas,
- 6:55ben il devient son taux d'erreur est
- 6:57très élevé. Donc dans l'entraînement,
- 7:00dans ce processus de machine learning,
- 7:01il faut faire attention de ne pas tomber
- 7:03sur le cas de la surapprentissage.
- 7:07Alors on poursuit avec la on utilise
- 7:09toujours les les données synthétiques.
- 7:10OK, je vérifie. OK ? Après avoir un peu
- 7:13expliqué euh voir un peu quelques
- 7:15prédictions. OK, donc euh comme on dit,
- 7:17ça ce sont les données générer de
- 7:20manière synthétique. Alors, on peut voir
- 7:22un peu aussi euh le prix réel, la
- 7:25prédiction avec les rats absolu. OK ?
- 7:27Donc euh pour voir un peu la qualité de
- 7:30voilà la qualité de mes donné, on peut
- 7:31voir un peu aussi la prédiction. Donc
- 7:34mon modèle, il a prédit 278764.
- 7:38On a une erreur de absolu de 14000.
- 7:42Alors, on peut on peut voir un peu les
- 7:44quelques quelques prédictions puis on
- 7:46peut voir un peu l'erreur. Ici, on voit
- 7:48qu'il s'est lourdement trompé. Voilà, il
- 7:50s'est beaucoup trompé. Il s'est
- 7:51lourdement trompé cette fois-ci avec un
- 7:53taux d'erreur de presque 29184
- 7:57€. OK. Donc
- 8:00donc on peut ça permet quand même de un
- 8:02peu de comprendre, on peut un peu voir
- 8:03un peu qu'on dit on le dit toujours, il
- 8:06faut faire attention avec les résultats
- 8:09des promptes parce que vous voyez
- 8:11vous-même que pour les mêmes données
- 8:13bien euh on voit que ça les prédictions
- 8:17varient. On peut voir ici les
- 8:18préductions varient. Voilà prédiction
- 8:21varie. Ça c'est l'erreur. Non, je veux
- 8:23dire le l'erreur. On voit l'erreur.
- 8:25Tantôt l'erreur est relativement bonne.
- 8:28Tantôt l'erreur est levée. Donc ce tant
- 8:30de choses qui poussent un peu à à
- 8:33réfléchir. Essayons un peu de comprendre
- 8:35un peu ces métrix parce que ess un peu
- 8:38de comprendre ses métriques. C'est quand
- 8:39même bluffant. Alors ce qu'on peut dire
- 8:42c'est quoi ? Euh ça veut dire quoi ? Un
- 8:45un MAE qui a à 10712. En fait ici le mae
- 8:51est l'erreur absolue moyenne. OK ? Donc
- 8:54en fait c'est une erreur qui euh qui
- 8:56signifie que la prédiction du modèle en
- 8:58fait s'éloigne. Donc la quand on voit
- 9:01ça, la production du monnaie s'éloigne
- 9:02de 10712. OK ? Du véritable prix. Donc
- 9:06vousmême pouvez un peu vous pouvez faire
- 9:07vos propres calculs. Donc à chaque fois
- 9:10ça ceci indique quoi. À chaque fois la
- 9:12prédiction et la réalité est de 10712.
- 9:15Ça c'est ça. Maintenant maintenant
- 9:16regardons un peu les mytres. RMSE quoi.
- 9:19Bon galas. Donc en fait ça permet de
- 9:21voir un peu comment le le ce cette
- 9:24valeur si pénalise davantage par exemple
- 9:27les grosses erreurs. Voilà donc elle est
- 9:30toujours supérieure à ça. Donc elle est
- 9:32toujours le le M le RMSE est toujours
- 9:36supérieur à à l'erreur moyen et c'est
- 9:39toujours supérieur à moyen et c'est en
- 9:41fait ça montre que certaines prédictions
- 9:43sont nettement plus éloignées que les
- 9:45autres en fait. Voilà. Voilà. Donc on
- 9:48peut voir c'est nettement plus que les
- 9:49autres. Donc on on peut voir le le map.
- 9:51Ça c'est le le map. En fait le map ici
- 9:54c'est en fait c'est quoi ? C'est exprime
- 9:56un peu de l'erreur moyen en pourcentage.
- 9:58OK dans les précédentes vidéos, on a vu
- 10:00quand c'est entre 3 et 5 généralement
- 10:02c'est une bonne chose mais quand c'est à
- 10:045 c'est que c'est pas bon. Il faut
- 10:06regarder sur toutes tes données, la
- 10:07qualité de données. OK donc ici un
- 10:09modèle qui se trompe en moyenne
- 10:11d'environ 2,70 % par rapport au prix. OK
- 10:16au prix réel. Donc c'est pas mal. OK.
- 10:18Donc on a le R au carré. R au carré en
- 10:21fait c'est le score R carré R est R euh
- 10:23est c'est très proche de 1. Voilà, on
- 10:24voit 0,994.
- 10:27Donc cela signifie que le modèle
- 10:28explique très bien les variations précéd
- 10:31présentes dans ces données. Voilà donc
- 10:33euh c'est quelque chose de très
- 10:35intéressant. Donc quelque chose de très
- 10:37intéressant mais en fait ce qu'il faut
- 10:39faire juste attention que ce score donc
- 10:41il faut faire attention malgré tout ça.
- 10:44Il faut toujours faire attention. Il
- 10:45faut toujours regarder regarder les
- 10:47rendus parce que faut pas dire que bon
- 10:49parce que j'ai un taux de 2,7 % alors
- 10:51mon mon modèle IA est super donc il faut
- 10:55toujours regarder les rendus. Donc
- 10:56l'être humain est toujours la personne
- 10:58qui valide qui doit tout valider. Donc
- 11:00toujours très important de de le
- 11:02préciser que l'être humain est la
- 11:04personne qui valide. Voilà. Voilà. Alors
- 11:06qu'est-ce qu'on a pris aujourd'hui ?
- 11:07Qu'est-ce qu'on a pris ? On a vu le
- 11:09cours de Python qui permet de générer
- 11:11des manières synthétiques juste pour
- 11:12apprendre simuler euh les données. On a
- 11:16ici 500 données. On a vu comment on peut
- 11:18séparer, on doit séparer, on doit
- 11:20séparer les données d'apprentissage avec
- 11:22les données de test. On a vu aussi qu'il
- 11:23faut éviter ce qu'on appelle le
- 11:25surapprentissage. Donc on avait déjà
- 11:28faire 95 % de données de d'apprentissage
- 11:31et laisser très peu de données pour les
- 11:32tests parce qu'après euh le taux
- 11:34d'erreur est très élevé quand c'est
- 11:36comme ça. Donc euh c'est mieux de faire
- 11:3880. OK. Et à la fin, on a aussi appris
- 11:40que il faut faire attention avec les
- 11:43prédictions de l'intelligent. Euh elle
- 11:46peut se tromper et là on peut voir hein,
- 11:48on peut on peut voir peut voir on peut
- 11:50on peut on peut nettement simuler là.
- 11:52Donc pour voir un peu le taux d'erreur.
- 11:54Donc vous voyez vous-même. Donc le taux
- 11:56d'erreur c'est c'est quand même c'est
- 11:58quand même bluffant. Si je change un peu
- 12:01là le nombre de pièces. Voilà, vous
- 12:03voyez que il faut seulement que je je
- 12:04varie un peu là et vous allez vous-même
- 12:07voir que le prix. Euh voilà. Donc ici ce
- 12:10qui est intéressant c'est qu'il faut il
- 12:11faut un peu regarder. Voilà il faut
- 12:12regarder taux d'erreur 2,70. Voilà donc
- 12:16voilà. Merci merci merci pour les
- 12:18personnes qui ont regardé ça. Voilà
- 12:20c'est quoi directement ? Ça me permet de
- 12:21passer au prochain point, le lien avec
- 12:23Je le côte. Alors à travers ces vidéos,
- 12:25on a vu beaucoup de choses. On a on a
- 12:27parlé on a parlé de beaucoup de choses.
- 12:29On a parlé de la régression linéaire qui
- 12:31est un algorithme. Lors des prochaines
- 12:33vidéos, on va changer par exemple
- 12:35l'algorine. On va prendre un autre
- 12:36algorme. Par exemple, l'approche du de
- 12:40rosa neurone. Et on va voir un peu
- 12:43comment est la prédiction. Est-ce
- 12:45qu'elle est meilleure ? Est-ce qu'elle
- 12:46est mauvaise ? Comme je l'ai dit au tout
- 12:48début, tout dépend de ce qu'on veut. La
- 12:51qualité de données est importante aussi.
- 12:53La préduction peut aussi changer avec
- 12:55l'algorine qu'on utilise. Cette fois-ci
- 12:57pour cette vidéo, on a jusqu'à présent
- 13:00utiliser la régression linéaire. Voilà,
- 13:03parce que c'est un cas simple, mais on
- 13:04peut changer, on peut prendre d'autres
- 13:06d'autres d'autres cares, d'autres
- 13:08algorithmes de calcul. On va voir
- 13:09ensemble ça. Ça c'est le but. c'est que
- 13:12dans ces vidéos, dans ces série de
- 13:13vidéos ensemble on essaie de découvrir
- 13:17comment avec le langage de programmation
- 13:19Python une une IA, un modèle IA est
- 13:22entraîné et on compare très important
- 13:25les prédictions et son taux d'erreur.
- 13:28Voilà. Voilà, ce sont les choses qu'on a
- 13:29vu. On a vu que plus le taux d'erreur
- 13:31est bas, plus la prédiction est bonne.
- 13:33Voilà. Donc on a aussi vu très important
- 13:36les données les données sales. On a
- 13:38parlé du garbache in garbache he.
- 13:41Comment c'est important déjà de purifier
- 13:43les données ce sont tant de choses.
- 13:44Alors ce j'aime le côte ce sont des
- 13:46choses qu'on voit ensemble. On apprend
- 13:48déjà on développe cet esprit critique de
- 13:50tout le temps. Checker, regarder,
- 13:53observer voilà booster sa logique.
- 13:56Essayer de comprendre est-ce que ce
- 13:57résultat fait sens oui ou non. C'est cet
- 14:00esprit critique qui est tellement
- 14:02important qu'on développe ce j'aime le
- 14:03co voilà déjà aller à l'âge de 3 ans,
- 14:06vos enfants apprennent déjà à travailler
- 14:08la logique à comprendre que voilà un
- 14:11algorithme c'est quoi un algorithme les
- 14:13étapes voilà quand on change l'ordre des
- 14:16étapes lorsqu'on vous un problème un
- 14:18enfant déjà 2 à 3 ans, il commence à
- 14:20voir ce qui fait sens et ce qui ne le
- 14:22fait pas. Voilà. Alors ça me permet de
- 14:24sortir hein à te je te pose la question
- 14:27alors selon toi euh qu'est-ce que tu as
- 14:29pris ? Alors selon toi, si je te pose la
- 14:31question comme ça pour sortir du pour
- 14:32sortir de ce sujet, si je te dis que
- 14:35est-ce que tu penses que en changeant
- 14:37par exemple l'algorithme qu'on utilise
- 14:39parce que tout à présent j'utilise la
- 14:41régression linéaire, est-ce que tu
- 14:42penses qu'en changeant l'algorithme ça
- 14:44va aussi avoir une influence par exemple
- 14:48sur ma prédiction ou alors en ajoutant
- 14:51un feature ? Future, on a défini le
- 14:54feature comme étant l'un des paramètres
- 14:56d'input comme par exle la superficie du
- 14:59bien, l'éloignement au centreville. Si
- 15:01je change ça, si je change, est-ce que
- 15:03tu penses que l'un de ces paramètres
- 15:05s'il est modifié, s'il est supprimé, ça
- 15:07jouera, ça aura un impact sur la
- 15:09prédiction du prix ? Alors, merci à
- 15:10toutes les personnes qui s'abonnent,
- 15:12merci de partager, d'inviter vos amis,
- 15:14vos enfants, vos connaissances. Yeah.
About this transcript
This page contains the full transcript of drt 1 by williams, generated from the public captions YouTube serves with the video. The transcript has 2,790 words across 405 segments, with the original timestamps preserved so you can click any line to jump to that moment in the embedded player.
What you can do with it
Use the transcript to take notes, quote the speaker, build a study guide, generate a summary with ChatGPT or Claude via the YouTube Summary tool, or export it as a timed subtitle file with YouTube to SRT. You can also re-open it in the transcriber to translate the transcript into 100+ languages.
Free YouTube transcript tool
YouTube2Text is a free YouTube transcript generator — no signup, no daily limit. Paste any YouTube link and get the full transcript instantly, with timestamps, click-to-jump, translation to 100+ languages, AI prompts for ChatGPT, Claude, and Gemini, and exports to TXT, SRT, VTT, or Markdown.