YouTube2Text

drt 1 — Transcript

by williams · 2,790 words · 405 segments · language en · Watch on YouTube

Full transcript

  1. 0:00Regardez bien ce bien immobilier. Sa
  2. 0:02superficie est de 96 m². J'ai donné ces
  3. 0:05caractéristiques à mon premier modèle
  4. 0:08d'intelligent tielpiton à estimé son
  5. 0:10prix et imaginez-vous sa prédiction, il
  6. 0:13me dit 413125
  7. 0:15€. Mais pourtant son véritable prix est
  8. 0:18de 377
  9. 0:20957
  10. 0:21€. Donc mon modèle a fait une erreur de
  11. 0:2435169
  12. 0:26€. Alors la question que je peux me
  13. 0:28poser, comment est-ce que mon modèle
  14. 0:30s'est trompé jusqu'à de 35000 € sur ce
  15. 0:33bien ? Alors, a-t-elle réellement appris
  16. 0:36à prédire le prix d'une maison ou alors
  17. 0:39ça produit simplement des chiffres
  18. 0:41fantais ? Moi c'est William ingénieur
  19. 0:43logiciel Bas Allemagne. Je suis le
  20. 0:45fondateur de ces chaîne GM de Code. Ici
  21. 0:48on parle de l'école, de l'éducation, de
  22. 0:50l'intelligence artificielle de tous les
  23. 0:52métiers touchent au numérique. Alors je
  24. 0:55m'adresse aux parents, aux enseignants,
  25. 0:58aux jeunes, aux élèves, aux personnes
  26. 1:00curieuses qui veulent apprendre à coder
  27. 1:03et aussi aux passionnés de
  28. 1:05l'informatique et du code. Alors, je
  29. 1:08reviens ici avec la 4e vidéo avec Python
  30. 1:11langage programmation Python. On
  31. 1:13entraîne un modèle d'intelligence
  32. 1:15artificiel qui permet de prédire le prix
  33. 1:18d'un bien immobilier. Alors, on va
  34. 1:21regarder cette démo ensuite je vous
  35. 1:23reviens après. Voici la partie Python
  36. 1:25que nous allons utiliser. Alors, ce
  37. 1:26qu'on va faire, ça c'est juste pour
  38. 1:28faire une démonstration. Donc je vais
  39. 1:30utiliser les données synthétiques.
  40. 1:32Voilà, tout à l'heure je vais un peu
  41. 1:33expliquer. Alors quand je clique là,
  42. 1:34alors on peut voir ici les données
  43. 1:35synthétiques point bien. On peut voir
  44. 1:38aussi le modèle qui a été entraîné sur
  45. 1:40500 lignes nettoyé. On voit ici que est
  46. 1:43de on va voir que mon modèle se trompe
  47. 1:45de 10712
  48. 1:47ce qui est un peu différent de de tout à
  49. 1:49l'heure et son taux d'erreur est de 2,7
  50. 1:52%. 2,7 %. À noter ici que j'ai séparé,
  51. 1:55tout à l'heure, je vais montrer dans le
  52. 1:57dans mon programme, j'ai séparé les
  53. 1:59données. Donc des 500 données, si j'ai
  54. 2:01séparé, 80 %, je l'ai je l'ai passé à
  55. 2:04l'entraînement et 20 % pour les tests et
  56. 2:08ce qui me donne ici euh une erreur de
  57. 2:1010000. Donc à chaque fois mon modèle se
  58. 2:12trompe d'environ 10712 €. Voilà, c'est
  59. 2:15un peu ça. Et tout à l'heure, on va
  60. 2:17essayer de comprendre. OK, on va essayer
  61. 2:19de comprendre encore un peu plus en en
  62. 2:20profondeur. Alors, c'est quoi le danger
  63. 2:23avec l'intelligence artificiel ?
  64. 2:24Justement, le danger, c'est que elle
  65. 2:26nous livre souvent des prédictions qui
  66. 2:29peuvent bluffer, c'estàdire le chiffre
  67. 2:32tellement précis du genre 495640.
  68. 2:36Quand on voit ce chiffre, on se dit
  69. 2:38"Mais ce résultat est tellement propre
  70. 2:40et il doit être juste." C'est pour cela
  71. 2:42que on appelle toujours à l'esprit
  72. 2:45critique de l'être humain pour vérifier
  73. 2:48toujours le résultat d'un prom.
  74. 2:50Tellement important. On va un peu
  75. 2:52essayer d'entrer maintenant en
  76. 2:53profondeur. Ça c'est mon ça c'est mon
  77. 2:55code. Ça c'est ici que tout se passe.
  78. 2:57Comme j'ai dit pour cette démo,
  79. 2:59j'utilise des données synthétiques quoi.
  80. 3:02Ça veut dire je génère les données là à
  81. 3:05partir de mon programme informatique.
  82. 3:06Donc je ne prends pas ces données dans
  83. 3:08un cadastre et cetera et cetera. Bon on
  84. 3:11va un peu essayer de comprendre parce
  85. 3:13que bon j'avais expliqué un peu à quoi
  86. 3:15c'est panda, à quoi c'est la la ligère
  87. 3:18régression. Je crois que ça ce sont les
  88. 3:20choses qu'on a vu. Ça c'est un algorme
  89. 3:22qui va nous permettre d'entraîner le
  90. 3:23modèle. Voilà ce que j'avais à dire
  91. 3:25c'est que nos futurs, c'està-dire que
  92. 3:27les données d'entrée, on a parlé de la
  93. 3:29superficie, l'éloignement du bien
  94. 3:31centreville, on a parlé de l'état du
  95. 3:34bien, on a parlé de la localisation,
  96. 3:35c'est dans quel quartier, c'est le bien
  97. 3:37su à à quel étage et puis ça a quel
  98. 3:40nombre de pièces. Et là, on a le label,
  99. 3:43c'est exactement la prédiction, donc
  100. 3:45c'est la sortie. Ça c'est des choses que
  101. 3:48on a on a déjà vu. Je veux pas je veux
  102. 3:50pas trop entrer dans les détails. Je
  103. 3:51veux juste donner les points plus
  104. 3:52importants. Le point le plus important,
  105. 3:54c'est ici justement parce que c'est ici
  106. 3:55que tout se passe. OK. D'abord ici,
  107. 3:57j'initialise un peu des choses.
  108. 3:59J'initialise un peu toutes les choses.
  109. 4:01OK. Ici, ce qui est intéressant, comme
  110. 4:03je dis, on va générer comme ça là de
  111. 4:06manière aléatoire 500 données. Bon, on
  112. 4:09avait déjà euh la dernière fois, j'avais
  113. 4:11un peu montré c'est quoi euh à quoi ça
  114. 4:13serne data frame. Tout commence à là.
  115. 4:15data frame, ça aide à séparer les futurs
  116. 4:18et les labels. Et en fait, ce qu'on peut
  117. 4:20retenir ici, c'est que euh les entrées,
  118. 4:23c'est les entrées qu'on connaît ici. Et
  119. 4:26ensuite, je génère en fait pour ma
  120. 4:28démonstration des lignes de données.
  121. 4:30Ensuite, j'utilise certaines méthodes
  122. 4:34pour supprimer les les puisque c'est
  123. 4:37c'est généré de manière aléatoire. Donc
  124. 4:39c'est possible qu'il y ait les duplicats
  125. 4:42les les données dupliquées. Alors avec
  126. 4:44mon code ici je nettoie parce qu' on a
  127. 4:47vu ça ici par notamment là avec le clean
  128. 4:49dataset on avait vu là que comment on
  129. 4:52analyse les données. C'est important de
  130. 4:54supprimer de supprimer les lignes qui
  131. 4:57n'ont pas qui ne font pas sens parce que
  132. 4:59ça sert à rien d'entraîner un modèle I
  133. 5:01avec des données qui sont pas bonnes.
  134. 5:03Donc c'est ce que fait un peu ce code
  135. 5:05là. En fait, on a on a ce clean dataset
  136. 5:07pour essayer de récupérer que les
  137. 5:09données qui font sens même jusqu'à là.
  138. 5:11Ça veut pas dire qu'après ça va te
  139. 5:12donner toujours quand même une
  140. 5:13prédiction qui sera excellente mais déjà
  141. 5:15tu augmentes quand même la probabilité
  142. 5:17pour que ça donne des choses excellents.
  143. 5:18Voilà. Donc ensuite aussi très important
  144. 5:21aussi, on va voir où je sépare aussi, je
  145. 5:24réserve 80 % de ces 500 ligne de de
  146. 5:28données à entraîner. Je sépare ici, je
  147. 5:31les sépare 80 % pour entraîner et 20 %
  148. 5:35pour les tests. Ceci OK, donc je sépare
  149. 5:38donc train test donc je sépare 20 % donc
  150. 5:41je vais ici avec voilà un size de 20 %
  151. 5:45pour les tests. Là, voilà. Donc donc en
  152. 5:48gros, ça c'est juste pour montrer un peu
  153. 5:50le code. Je veux pas entrer trop dans
  154. 5:51les détails. Donc ici, c'est pour c'est
  155. 5:54pour voir en fait que c'est c'est pas
  156. 5:57les trucs inventés. Voilà. Et je je le
  157. 6:00redis ici euh ici j'ai produit les
  158. 6:03données de manière synthétique. Donc ce
  159. 6:05sont pas les données qui viennent du
  160. 6:06cadastre. Ça permet juste de faire une
  161. 6:08démonstration et vous présenter. OK ?
  162. 6:11Donc c'est ce qu'on peut retenir parce
  163. 6:12que là on a pu voir à travers les
  164. 6:14différents démons que le résultat que un
  165. 6:17prom l'intelligent artificiel nous livre
  166. 6:19c'est le résultat d'un calcul de
  167. 6:20probabilité c'est le résultat de de ce
  168. 6:22calcul qui nous remet alors c'est à nous
  169. 6:25de tout le temps checker et ça nous
  170. 6:27permet aussi de parler du prochain
  171. 6:28danger qui est le surapprentissage. Là
  172. 6:31aussi, on a vu ici à travers les
  173. 6:33différentes démonstrations qu'on a, on
  174. 6:35entraîne notre modèle avec 80 % des
  175. 6:38données disponibles et 20 % c'est pour
  176. 6:40les tests. Bon, imagine-toi alors que
  177. 6:42ton modèle est tellement surentraîné au
  178. 6:45point où quand tu lui donnes maintenant
  179. 6:47voilà quand tu passes à 90 % ou bien à
  180. 6:4998 % des données que tu utilises pour
  181. 6:51l'apprentissage, quand tu lui donnes les
  182. 6:53nouvelles données qu'il ne connaît pas,
  183. 6:55ben il devient son taux d'erreur est
  184. 6:57très élevé. Donc dans l'entraînement,
  185. 7:00dans ce processus de machine learning,
  186. 7:01il faut faire attention de ne pas tomber
  187. 7:03sur le cas de la surapprentissage.
  188. 7:07Alors on poursuit avec la on utilise
  189. 7:09toujours les les données synthétiques.
  190. 7:10OK, je vérifie. OK ? Après avoir un peu
  191. 7:13expliqué euh voir un peu quelques
  192. 7:15prédictions. OK, donc euh comme on dit,
  193. 7:17ça ce sont les données générer de
  194. 7:20manière synthétique. Alors, on peut voir
  195. 7:22un peu aussi euh le prix réel, la
  196. 7:25prédiction avec les rats absolu. OK ?
  197. 7:27Donc euh pour voir un peu la qualité de
  198. 7:30voilà la qualité de mes donné, on peut
  199. 7:31voir un peu aussi la prédiction. Donc
  200. 7:34mon modèle, il a prédit 278764.
  201. 7:38On a une erreur de absolu de 14000.
  202. 7:42Alors, on peut on peut voir un peu les
  203. 7:44quelques quelques prédictions puis on
  204. 7:46peut voir un peu l'erreur. Ici, on voit
  205. 7:48qu'il s'est lourdement trompé. Voilà, il
  206. 7:50s'est beaucoup trompé. Il s'est
  207. 7:51lourdement trompé cette fois-ci avec un
  208. 7:53taux d'erreur de presque 29184
  209. 7:57€. OK. Donc
  210. 8:00donc on peut ça permet quand même de un
  211. 8:02peu de comprendre, on peut un peu voir
  212. 8:03un peu qu'on dit on le dit toujours, il
  213. 8:06faut faire attention avec les résultats
  214. 8:09des promptes parce que vous voyez
  215. 8:11vous-même que pour les mêmes données
  216. 8:13bien euh on voit que ça les prédictions
  217. 8:17varient. On peut voir ici les
  218. 8:18préductions varient. Voilà prédiction
  219. 8:21varie. Ça c'est l'erreur. Non, je veux
  220. 8:23dire le l'erreur. On voit l'erreur.
  221. 8:25Tantôt l'erreur est relativement bonne.
  222. 8:28Tantôt l'erreur est levée. Donc ce tant
  223. 8:30de choses qui poussent un peu à à
  224. 8:33réfléchir. Essayons un peu de comprendre
  225. 8:35un peu ces métrix parce que ess un peu
  226. 8:38de comprendre ses métriques. C'est quand
  227. 8:39même bluffant. Alors ce qu'on peut dire
  228. 8:42c'est quoi ? Euh ça veut dire quoi ? Un
  229. 8:45un MAE qui a à 10712. En fait ici le mae
  230. 8:51est l'erreur absolue moyenne. OK ? Donc
  231. 8:54en fait c'est une erreur qui euh qui
  232. 8:56signifie que la prédiction du modèle en
  233. 8:58fait s'éloigne. Donc la quand on voit
  234. 9:01ça, la production du monnaie s'éloigne
  235. 9:02de 10712. OK ? Du véritable prix. Donc
  236. 9:06vousmême pouvez un peu vous pouvez faire
  237. 9:07vos propres calculs. Donc à chaque fois
  238. 9:10ça ceci indique quoi. À chaque fois la
  239. 9:12prédiction et la réalité est de 10712.
  240. 9:15Ça c'est ça. Maintenant maintenant
  241. 9:16regardons un peu les mytres. RMSE quoi.
  242. 9:19Bon galas. Donc en fait ça permet de
  243. 9:21voir un peu comment le le ce cette
  244. 9:24valeur si pénalise davantage par exemple
  245. 9:27les grosses erreurs. Voilà donc elle est
  246. 9:30toujours supérieure à ça. Donc elle est
  247. 9:32toujours le le M le RMSE est toujours
  248. 9:36supérieur à à l'erreur moyen et c'est
  249. 9:39toujours supérieur à moyen et c'est en
  250. 9:41fait ça montre que certaines prédictions
  251. 9:43sont nettement plus éloignées que les
  252. 9:45autres en fait. Voilà. Voilà. Donc on
  253. 9:48peut voir c'est nettement plus que les
  254. 9:49autres. Donc on on peut voir le le map.
  255. 9:51Ça c'est le le map. En fait le map ici
  256. 9:54c'est en fait c'est quoi ? C'est exprime
  257. 9:56un peu de l'erreur moyen en pourcentage.
  258. 9:58OK dans les précédentes vidéos, on a vu
  259. 10:00quand c'est entre 3 et 5 généralement
  260. 10:02c'est une bonne chose mais quand c'est à
  261. 10:045 c'est que c'est pas bon. Il faut
  262. 10:06regarder sur toutes tes données, la
  263. 10:07qualité de données. OK donc ici un
  264. 10:09modèle qui se trompe en moyenne
  265. 10:11d'environ 2,70 % par rapport au prix. OK
  266. 10:16au prix réel. Donc c'est pas mal. OK.
  267. 10:18Donc on a le R au carré. R au carré en
  268. 10:21fait c'est le score R carré R est R euh
  269. 10:23est c'est très proche de 1. Voilà, on
  270. 10:24voit 0,994.
  271. 10:27Donc cela signifie que le modèle
  272. 10:28explique très bien les variations précéd
  273. 10:31présentes dans ces données. Voilà donc
  274. 10:33euh c'est quelque chose de très
  275. 10:35intéressant. Donc quelque chose de très
  276. 10:37intéressant mais en fait ce qu'il faut
  277. 10:39faire juste attention que ce score donc
  278. 10:41il faut faire attention malgré tout ça.
  279. 10:44Il faut toujours faire attention. Il
  280. 10:45faut toujours regarder regarder les
  281. 10:47rendus parce que faut pas dire que bon
  282. 10:49parce que j'ai un taux de 2,7 % alors
  283. 10:51mon mon modèle IA est super donc il faut
  284. 10:55toujours regarder les rendus. Donc
  285. 10:56l'être humain est toujours la personne
  286. 10:58qui valide qui doit tout valider. Donc
  287. 11:00toujours très important de de le
  288. 11:02préciser que l'être humain est la
  289. 11:04personne qui valide. Voilà. Voilà. Alors
  290. 11:06qu'est-ce qu'on a pris aujourd'hui ?
  291. 11:07Qu'est-ce qu'on a pris ? On a vu le
  292. 11:09cours de Python qui permet de générer
  293. 11:11des manières synthétiques juste pour
  294. 11:12apprendre simuler euh les données. On a
  295. 11:16ici 500 données. On a vu comment on peut
  296. 11:18séparer, on doit séparer, on doit
  297. 11:20séparer les données d'apprentissage avec
  298. 11:22les données de test. On a vu aussi qu'il
  299. 11:23faut éviter ce qu'on appelle le
  300. 11:25surapprentissage. Donc on avait déjà
  301. 11:28faire 95 % de données de d'apprentissage
  302. 11:31et laisser très peu de données pour les
  303. 11:32tests parce qu'après euh le taux
  304. 11:34d'erreur est très élevé quand c'est
  305. 11:36comme ça. Donc euh c'est mieux de faire
  306. 11:3880. OK. Et à la fin, on a aussi appris
  307. 11:40que il faut faire attention avec les
  308. 11:43prédictions de l'intelligent. Euh elle
  309. 11:46peut se tromper et là on peut voir hein,
  310. 11:48on peut on peut voir peut voir on peut
  311. 11:50on peut on peut nettement simuler là.
  312. 11:52Donc pour voir un peu le taux d'erreur.
  313. 11:54Donc vous voyez vous-même. Donc le taux
  314. 11:56d'erreur c'est c'est quand même c'est
  315. 11:58quand même bluffant. Si je change un peu
  316. 12:01là le nombre de pièces. Voilà, vous
  317. 12:03voyez que il faut seulement que je je
  318. 12:04varie un peu là et vous allez vous-même
  319. 12:07voir que le prix. Euh voilà. Donc ici ce
  320. 12:10qui est intéressant c'est qu'il faut il
  321. 12:11faut un peu regarder. Voilà il faut
  322. 12:12regarder taux d'erreur 2,70. Voilà donc
  323. 12:16voilà. Merci merci merci pour les
  324. 12:18personnes qui ont regardé ça. Voilà
  325. 12:20c'est quoi directement ? Ça me permet de
  326. 12:21passer au prochain point, le lien avec
  327. 12:23Je le côte. Alors à travers ces vidéos,
  328. 12:25on a vu beaucoup de choses. On a on a
  329. 12:27parlé on a parlé de beaucoup de choses.
  330. 12:29On a parlé de la régression linéaire qui
  331. 12:31est un algorithme. Lors des prochaines
  332. 12:33vidéos, on va changer par exemple
  333. 12:35l'algorine. On va prendre un autre
  334. 12:36algorme. Par exemple, l'approche du de
  335. 12:40rosa neurone. Et on va voir un peu
  336. 12:43comment est la prédiction. Est-ce
  337. 12:45qu'elle est meilleure ? Est-ce qu'elle
  338. 12:46est mauvaise ? Comme je l'ai dit au tout
  339. 12:48début, tout dépend de ce qu'on veut. La
  340. 12:51qualité de données est importante aussi.
  341. 12:53La préduction peut aussi changer avec
  342. 12:55l'algorine qu'on utilise. Cette fois-ci
  343. 12:57pour cette vidéo, on a jusqu'à présent
  344. 13:00utiliser la régression linéaire. Voilà,
  345. 13:03parce que c'est un cas simple, mais on
  346. 13:04peut changer, on peut prendre d'autres
  347. 13:06d'autres d'autres cares, d'autres
  348. 13:08algorithmes de calcul. On va voir
  349. 13:09ensemble ça. Ça c'est le but. c'est que
  350. 13:12dans ces vidéos, dans ces série de
  351. 13:13vidéos ensemble on essaie de découvrir
  352. 13:17comment avec le langage de programmation
  353. 13:19Python une une IA, un modèle IA est
  354. 13:22entraîné et on compare très important
  355. 13:25les prédictions et son taux d'erreur.
  356. 13:28Voilà. Voilà, ce sont les choses qu'on a
  357. 13:29vu. On a vu que plus le taux d'erreur
  358. 13:31est bas, plus la prédiction est bonne.
  359. 13:33Voilà. Donc on a aussi vu très important
  360. 13:36les données les données sales. On a
  361. 13:38parlé du garbache in garbache he.
  362. 13:41Comment c'est important déjà de purifier
  363. 13:43les données ce sont tant de choses.
  364. 13:44Alors ce j'aime le côte ce sont des
  365. 13:46choses qu'on voit ensemble. On apprend
  366. 13:48déjà on développe cet esprit critique de
  367. 13:50tout le temps. Checker, regarder,
  368. 13:53observer voilà booster sa logique.
  369. 13:56Essayer de comprendre est-ce que ce
  370. 13:57résultat fait sens oui ou non. C'est cet
  371. 14:00esprit critique qui est tellement
  372. 14:02important qu'on développe ce j'aime le
  373. 14:03co voilà déjà aller à l'âge de 3 ans,
  374. 14:06vos enfants apprennent déjà à travailler
  375. 14:08la logique à comprendre que voilà un
  376. 14:11algorithme c'est quoi un algorithme les
  377. 14:13étapes voilà quand on change l'ordre des
  378. 14:16étapes lorsqu'on vous un problème un
  379. 14:18enfant déjà 2 à 3 ans, il commence à
  380. 14:20voir ce qui fait sens et ce qui ne le
  381. 14:22fait pas. Voilà. Alors ça me permet de
  382. 14:24sortir hein à te je te pose la question
  383. 14:27alors selon toi euh qu'est-ce que tu as
  384. 14:29pris ? Alors selon toi, si je te pose la
  385. 14:31question comme ça pour sortir du pour
  386. 14:32sortir de ce sujet, si je te dis que
  387. 14:35est-ce que tu penses que en changeant
  388. 14:37par exemple l'algorithme qu'on utilise
  389. 14:39parce que tout à présent j'utilise la
  390. 14:41régression linéaire, est-ce que tu
  391. 14:42penses qu'en changeant l'algorithme ça
  392. 14:44va aussi avoir une influence par exemple
  393. 14:48sur ma prédiction ou alors en ajoutant
  394. 14:51un feature ? Future, on a défini le
  395. 14:54feature comme étant l'un des paramètres
  396. 14:56d'input comme par exle la superficie du
  397. 14:59bien, l'éloignement au centreville. Si
  398. 15:01je change ça, si je change, est-ce que
  399. 15:03tu penses que l'un de ces paramètres
  400. 15:05s'il est modifié, s'il est supprimé, ça
  401. 15:07jouera, ça aura un impact sur la
  402. 15:09prédiction du prix ? Alors, merci à
  403. 15:10toutes les personnes qui s'abonnent,
  404. 15:12merci de partager, d'inviter vos amis,
  405. 15:14vos enfants, vos connaissances. Yeah.

About this transcript

This page contains the full transcript of drt 1 by williams, generated from the public captions YouTube serves with the video. The transcript has 2,790 words across 405 segments, with the original timestamps preserved so you can click any line to jump to that moment in the embedded player.

What you can do with it

Use the transcript to take notes, quote the speaker, build a study guide, generate a summary with ChatGPT or Claude via the YouTube Summary tool, or export it as a timed subtitle file with YouTube to SRT. You can also re-open it in the transcriber to translate the transcript into 100+ languages.

Free YouTube transcript tool

YouTube2Text is a free YouTube transcript generator — no signup, no daily limit. Paste any YouTube link and get the full transcript instantly, with timestamps, click-to-jump, translation to 100+ languages, AI prompts for ChatGPT, Claude, and Gemini, and exports to TXT, SRT, VTT, or Markdown.