YouTube2Text

Hardware für Lokale KI — Transcript

by AI mit Arnie · 5,351 words · 868 segments · language en · Watch on YouTube

Full transcript

  1. 0:00Minis, Laptops und natürlich auch
  2. 0:03Computer mit dedizierten Grafikkarten.
  3. 0:05Es gibt unendlich viel Geräte, die man
  4. 0:07sich zulegen könnte und die meisten
  5. 0:09dieser Sachen haben zwei Dinge
  6. 0:11gemeinsam. Erstens, sie können lokale KI
  7. 0:14laufen lassen und zweitens, sie sind
  8. 0:16mittlerweile unglaublich teuer. Wir
  9. 0:17haben eine spannende Situation mit den
  10. 0:19Geräten. Einerseits wird diese Hardware
  11. 0:21über Zeit immer besser und die sollte
  12. 0:23auch günstiger werden. Auf der anderen
  13. 0:25Seite wird Hardware aber immer teurer.
  14. 0:27Das liegt in meinen Augen an zwei
  15. 0:28Punkten. Erstens haben wir einen
  16. 0:30Engpass, weil die ganzen großen KI
  17. 0:32Unternehmen alles wegkaufen und zweitens
  18. 0:34kann genau die Hardware, die du gekauft
  19. 0:36hast, automatisch immer bessere Modelle
  20. 0:38laufen lassen. Schau mal, das ist
  21. 0:40official Analysis. Und aktuell haben wir
  22. 0:43hier Quen 3.827B
  23. 0:45in einem Feld, das relativ weit vorne
  24. 0:47mitmischt und das ist ein Modell, dass
  25. 0:49du lokal auf Konsumerh laufen lassen
  26. 0:51kannst. Das heißt, die Hardware vom
  27. 0:53letzten Jahr ist in diesem Jahr deutlich
  28. 0:55wertvoller für dich, falls du KI laufen
  29. 0:57lassen willst. Und weil das Angebot an
  30. 0:59Hardware so groß ist, will ich in diesem
  31. 1:01Video alles aufschlüsseln. Wann lohnt
  32. 1:03sich welches Gerät? Falls du ein neues
  33. 1:05anschaffst, was kannst du auf bereits
  34. 1:06bestehenden Geräten laufen lassen? Wie
  35. 1:08kannst du das Ganze etwas optimieren und
  36. 1:10worauf musst du wirklich achten? Du
  37. 1:12bekommst sogar einen kompletten Prompt
  38. 1:14mit, den kannst du in einen
  39. 1:15Lieblingsagent schmeißen und der wird
  40. 1:17danach für dich abschätzen, welche
  41. 1:18Hardware für dich am meisten Sinn macht.
  42. 1:20Doch später noch mal mehr zu diesem
  43. 1:22Prompt. Fangen wir erstmal mit ein paar
  44. 1:24Gründen an, warum lokale KI überhaupt
  45. 1:26relevant ist. Erstens natürlich bleiben
  46. 1:28die Daten in deinem Haus bzw. auf deinem
  47. 1:31Rechner. Du kannst sogar Dinge hochladen
  48. 1:33wie Verträge, Kundennamen,
  49. 1:35Gesundheitsdaten, deine gesamte
  50. 1:37Codebasis und alles, was du nicht im
  51. 1:40Internet teilen willst. Der zweite Punkt
  52. 1:42ist natürlich Planbarkeit. Die großen
  53. 1:45Cloudmelle, die können über Nacht
  54. 1:46getauscht werden. Ein Kontextfenster
  55. 1:48kann gekürzt werden, Modelle werden
  56. 1:50komplett abgeschaltet oder wir werden
  57. 1:52ausgesperrt, wie es zu fibel der Fall
  58. 1:54war. Und falls sich ein Modell so
  59. 1:56verändert, dass es für dich nicht mehr
  60. 1:58funktioniert wie vorher, dann hast du
  61. 1:59ein Problem. Das Problem hast du mit
  62. 2:01lokaler K auch nicht. Sobald ein Modell
  63. 2:03einmal bei dir läuft, läuft es immer
  64. 2:05gleich. Der nächste Grund ist natürlich,
  65. 2:08du hast keine Limits. Dein Plan wird
  66. 2:10nicht irgendwann fertig und Zeit
  67. 2:13arbeitet für dich. Dieselbe Hardware
  68. 2:15kann heute mehr als vor 6 Monaten. Die
  69. 2:18Modelle wurden einfach besser. Das
  70. 2:19bedeutet, dein Rechner wird nützlicher
  71. 2:21überzeit. Außerdem zahlst du bei den
  72. 2:24meisten Cloudmellen tatsächlich mit 30
  73. 2:26Tage Datenspeicherung. Modelle, die als
  74. 2:29gefährlich eingestuft werden, die werden
  75. 2:31für 30 Tage lang deine gesamten Chats
  76. 2:33speichern und eventuell überwachen. Bei
  77. 2:35den Antropic Modellen sieht man das z.B.
  78. 2:38recht oft. Ich denke vor allem für vier
  79. 2:40Personengruppen ist lokale KI super
  80. 2:42spannend. Die Leute, die den großen
  81. 2:43Anbietern einfach nicht trauen. Die
  82. 2:45Leute, die ihre eigene Daten schützen
  83. 2:47wollen oder müssen. Leute, die basteln
  84. 2:49wollen. Denn falls man sich mit lokaler
  85. 2:51KI beschäftigt, muss man KI auf einem
  86. 2:52ganz anderen Level verstehen. Und all
  87. 2:54jene, die komplett unabhängig sein
  88. 2:56wollen. Lokale KI läuft immer, auch wenn
  89. 2:59das Internet aus ist und ich kann
  90. 3:00niemand aussperren. Dennoch bleibt für
  91. 3:03einige Dinge natürlich Cloud KI besser.
  92. 3:05Falls du öffentliche Inhalte hast, ist
  93. 3:07es egal, was du verwendest. Wenn du
  94. 3:09Videos, Blogposts, Marketing oder was
  95. 3:12ähnliches machst, wo du die Daten nicht
  96. 3:13schützen musst, kannst du eine API
  97. 3:15verbinden oder ein ganz normales Abo.
  98. 3:17Falls du die absolute Spitze willst,
  99. 3:20kannst du dir entweder eine Serverfarm
  100. 3:22anschaffen, die Millionen kostet, oder
  101. 3:24einfach ein günstiges Cloudmell nehmen.
  102. 3:26Außerdem kannst du bei Cloudmellen
  103. 3:28natürlich sofort loslegen. Du kaufst ein
  104. 3:30Abo, boom, das war's. Und du solltest
  105. 3:32auch noch wissen, dass bei reinen Fakten
  106. 3:34wissen die kleinen Modelle teilweise
  107. 3:37etwas hinterher hinken. Je größer das
  108. 3:39Modell, umso mehr reine Fakten werden in
  109. 3:42den Gewichten sozusagen Platz haben. Ein
  110. 3:44Modell wie GPT 5.6 ist natürlich
  111. 3:47riesengroß, das heißt, es ist viel
  112. 3:48Wissen mit eintrainiert. Kleinere
  113. 3:50Modelle, die du lokal laufen lässt, die
  114. 3:52haben natürlich etwas weniger
  115. 3:54Basiswissen, bedeutet aber nicht, dass
  116. 3:56sie nicht nützlich sind. Für alles
  117. 3:58dazwischen gibt es übrigens auch
  118. 4:00Hybridwege. Du könntest z.B. dann Roh
  119. 4:03mit einem lokalen Modell verschlüsseln,
  120. 4:06mit einem großen Modell drüber arbeiten
  121. 4:09und danach wieder lokale Namen
  122. 4:10zurücksetzen. Du solltest also nicht
  123. 4:12immer schwarz und weiß denken. Versuch
  124. 4:14viele Dinge lokal zu machen, aber nicht
  125. 4:16alles. Sehen wir uns mal die Physik an.
  126. 4:18Also, was ist entscheidend, damit bei
  127. 4:20dir gute Modelle laufen? Du brauchst
  128. 4:22zwei Dinge, Speicher und Bandbreite. Bei
  129. 4:26Speicher spricht man hier tatsächlich
  130. 4:28meistens von RAM oder Viram. Die
  131. 4:30Gewichte von den Modellen der KV Cash
  132. 4:33nennen wir das ganze Kontextfenster
  133. 4:35einfach zu lassen. Der Computer und das
  134. 4:38Betriebssystem, das muss natürlich alles
  135. 4:40zusammen in irgende einen schnellen
  136. 4:41Speicher rein und falls es nicht passt,
  137. 4:43dann läuft das nicht oder es ist
  138. 4:45erbärmlich langsam. Falls es in den
  139. 4:47Speicher reinpasst, entscheidet die
  140. 4:49Bandbreite, wie schnell du deine
  141. 4:51Ausgaben zurückbekommst. Hier gibt es
  142. 4:54auch eine grobe Faustregel.
  143. 4:56Speicherbreite geteilt durch Modellgröße
  144. 4:59im Speicher. Ein 17 GB Modell würde auf
  145. 5:02einer RTX 5090, die in etwa diese
  146. 5:05Bandbreite hat, mit in etwa 100 Token
  147. 5:08pro Sekunde laufen und auf einer Dig
  148. 5:10Spark würde sie mit 16 bis 24 Token pro
  149. 5:14Sekunde laufen. Also rechne ganz einfach
  150. 5:17die Größe vom Modell durch die
  151. 5:19Bandbreite. Ein Mensch schließt übrigens
  152. 5:227 Token pro Sekunde. Falls du mit 07
  153. 5:24Token pro Sekunde generierst, ist das
  154. 5:26unglaublich lästig. Falls du mit 15 bis
  155. 5:2920 generierst, nervt es immer noch. Es
  156. 5:32geht so langsam. 30 und aufwärts wird so
  157. 5:35langsam spannend. Außerdem solltest du
  158. 5:37auch noch wissen, dass Agenten natürlich
  159. 5:39Werkzeuge Aufrufe machen, die im Chat
  160. 5:41nie auftauchen. Deshalb ist die
  161. 5:43Geschwindigkeit gefühlt immer noch etwas
  162. 5:44langsamer als gemessen wird. Und man
  163. 5:47muss auch noch dazu sagen, dass lange
  164. 5:49Prompts eingelesen werden müssen.
  165. 5:51Vielleicht hast du schon mal was vom
  166. 5:52Prompt Processing gehört oder Time to
  167. 5:55Token. Das ganze klappt generell
  168. 5:57gesprochen bei Nvidiak Karten viel
  169. 5:59besser. Da ist das Einlesen schneller
  170. 6:01als bei Dingen, wo Unified Memory
  171. 6:04Systeme verbaut sind. Keine Sorge, falls
  172. 6:06du die Sachen noch nicht verstehst, wir
  173. 6:08schlüsseln die noch genauer auf. Sehen
  174. 6:10wir uns mal ganz kurz den wichtigsten
  175. 6:11Unterschied dann zwischen einer GPU und
  176. 6:13einem Mini PC. Falls du eine GPU kaufst,
  177. 6:16dann sind die RAM separat. Und bei den
  178. 6:19meisten neueren Mini PCs hast du etwas,
  179. 6:21das ich Unified Memory nennt. Wir
  180. 6:23starten erstmal beim klassischen PC.
  181. 6:26Wenn du einen PC kaufst, dann ist
  182. 6:27natürlich eine solche Grafikkarte
  183. 6:29drinnen mit verbaut. Und die
  184. 6:31Grafikkarte, die hat separaten VRAM.
  185. 6:33Dieser VRAM ist super schnell. Wir
  186. 6:35kommen danach noch auf die genauen
  187. 6:36Zahlen. Zusätzlich hat ein solcher PC
  188. 6:39natürlich noch RAM und die zwei Dinge
  189. 6:41sind getrennt voneinander. Du könntest
  190. 6:44z.B. falls du einen sehr starken PC
  191. 6:46hast, 128 GB RAM haben und vielleicht
  192. 6:49noch 32 GB VR RAM dazu. Und jetzt kommt
  193. 6:52es drauf an, welche Modelle du hier
  194. 6:54laufen lässt. Ganz generell gesprochen,
  195. 6:56ist ein Modell am schnellsten, falls es
  196. 6:59zu 100% in den schnellen VRAM passt. Du
  197. 7:01kannst die Modelle aber auch aufteilen.
  198. 7:03Du kannst einen Teil vom Modell in die
  199. 7:05RAM reinpacken und den Rest in die VRAM.
  200. 7:08Das funktioniert besonders gut bei
  201. 7:10Mixture of Experts Modellen und damit
  202. 7:12kannst du auf einem solchen PC natürlich
  203. 7:14auch relativ große Modelle laufen
  204. 7:16lassen. Falls du ein sogenanntes Dance
  205. 7:18Modell hast, dann wird das Ganze aber
  206. 7:20fürchterlich. Wir sprechen danach noch
  207. 7:22darüber, welche Modelle wo reinpassen.
  208. 7:25Merkt ihr bis jetzt einfach mal, falls
  209. 7:27ein Modell komplett in die schnellen
  210. 7:29Ramp passt, dann wird es fliegen und es
  211. 7:31gibt Architekturen, wo du die Modelle
  212. 7:33vernünftig aufteilen kannst. Das Ganze
  213. 7:35sieht bei Unified Memory anders aus. Bei
  214. 7:38Unified Memory hast du sozusagen einen
  215. 7:41Bull an Memory und diese Unified Memory
  216. 7:44kann ziemlich groß sein und ist im
  217. 7:45Verhältnis auch günstig. Unified Memory
  218. 7:48siehst du oft mit 128 GB und hier teilt
  219. 7:52sich das gesamte System genau diese
  220. 7:55Memory. Die kann also großteils auch als
  221. 7:58schneller RAM für Modelle verwendet
  222. 8:00werden. Natürlich brauchst du gewisse
  223. 8:02Ressourcen für dein Betriebssystem und
  224. 8:04so weiter. Vielleicht so 20 bis 30 GB
  225. 8:09wirst du brauchen, damit dein
  226. 8:11Betriebssystem gut läuft und alles
  227. 8:13reibungslos funktioniert. Die anderen
  228. 8:15100 GB, die kannst du aber verwenden, um
  229. 8:17Modelle laufen zu lassen. Wie gesagt,
  230. 8:19diese Unified Memory, die ist generell
  231. 8:22größer, die ist günstiger, aber etwas
  232. 8:24langsamer. Dazu kommen danach natürlich
  233. 8:26noch Sachen wie der Softwareck, eine
  234. 8:29GPU, gerade von den Vide CUDA, darauf
  235. 8:31kommen wir später noch mal zu sprechen.
  236. 8:33Bisher musst du nur wissen, dass ein
  237. 8:35Gaming PC mit einer GPU den separaten
  238. 8:39Vram hat und dazu noch die RAM. Du
  239. 8:41kannst Modelle aufteilen, sie werden
  240. 8:43erbärmlich langsam, falls es ein
  241. 8:45Densmodell ist, können aber fliegen,
  242. 8:47falls sie komplett in die Vieram passen
  243. 8:49oder falls es ein Mure of Experts Modell
  244. 8:51ist. Und bei Unified Memory klatschtst
  245. 8:54du einfach alles in deine gesamten
  246. 8:55Memory rein, aber du brauchst etwas
  247. 8:58Speicher für dein Betriebssystem und
  248. 9:00andere Dinge, die laufen. Falls du dich
  249. 9:02fragst, welches Modell sollte ich laufen
  250. 9:04lassen, dann gibt es auch dafür eine
  251. 9:06Formel. Das da ist die genaue Formel,
  252. 9:08also Parameter mal Quantisierungspitz
  253. 9:11geil durch 8* 1,3. Du kannst aber
  254. 9:14einfach auch nur schauen, wie groß das
  255. 9:17Modell ist und das mal 1,3 rechnen. Die
  256. 9:201,3 nimmt man, weil man etwas Overhead
  257. 9:23braucht, damit du auch etwas für das
  258. 9:24Kontextfensterplatz hast. Würde in etwa
  259. 9:27so aussehen, falls du auf Olama kommst
  260. 9:29und du gehst auf dieses Quen Modell,
  261. 9:31dann siehst du, dass das 27 Milliarden
  262. 9:33Parametermodell 18 GB groß ist. Und
  263. 9:37falls du 18 x 1,3 machst, dann solltest
  264. 9:41du in etwa 24 GB haben, damit das Modell
  265. 9:44gut arbeitet und damit du anständige
  266. 9:46Prompts verarbeiten kannst. Falls du auf
  267. 9:48das Modell drauf klickst, dann siehst du
  268. 9:50natürlich auch noch, dass es die großen
  269. 9:52Quantisierungen gibt und die brauchen
  270. 9:54natürlich umso mehr Speicher. Ein
  271. 9:56Shammer Modell in Q4 passt den 8 GB
  272. 9:59recht gut rein. Ein Quen 38 ein Q4 passt
  273. 10:02den 24 GB gut rein. Und so kannst du dir
  274. 10:05das Ganze genauer ansehen. Diese 1,3
  275. 10:08rechnen wir natürlich dazu, weil das
  276. 10:10Kontextfenster bzw. der KV Cash noch
  277. 10:13mehr Rechenleistung frisst, als man sich
  278. 10:15das Ganze erstmal denkt. Und solltest du
  279. 10:17mit die Unified Memory arbeiten, dann
  280. 10:19musst du natürlich auch noch verstehen,
  281. 10:21dass 10 bis 12 GB für das System
  282. 10:24verbraucht werden. Erhöst du z.B. das
  283. 10:26Kontextfenster bei Modellen oder ziehst
  284. 10:28das Ganze runter, dann siehst du da
  285. 10:30oben, dass die GPU Auslastung und auch
  286. 10:32die RAMuslastung natürlich größer und
  287. 10:34kleiner wird. Außerdem solltest du
  288. 10:36verstehen, dass du auch den KV Cash
  289. 10:40quantisieren kannst. Das nennt man Flash
  290. 10:42attention. Falls man das einschaltet,
  291. 10:45kannst du auch hier anstatt der vollen
  292. 10:46Präzision z.B. runter auf Q4 gehen. Das
  293. 10:49kannst du hier bei beiden machen. Falls
  294. 10:51du beides auf Q4 packst, dann wirst du
  295. 10:54relativ viel Rechenleistung sparen. Die
  296. 10:56Modelle arbeiten schneller, sie arbeiten
  297. 10:59effizienter, aber das Ganze kann
  298. 11:01natürlich ab und zu Problemen führen. K
  299. 11:04steht übrigens für Key Value. Bedeutet,
  300. 11:06falls du einen langen Chat hast mit
  301. 11:08deinem Modell, dann werden sich die
  302. 11:09wichtigsten Dinge immer wieder
  303. 11:11rausgesucht. Und die Präzision von
  304. 11:13diesem raussuchen kannst du auch
  305. 11:14quantisieren, also kleiner machen. Dann
  306. 11:17wird mit 4 Bit Genauigkeit gerechnet,
  307. 11:19anstatt mit 16 Bit. Etwas Weiteres, dass
  308. 11:21man verstehen sollte, ist, dass es einen
  309. 11:23Unterschied zwischen dichten Modellen
  310. 11:26gibt und Mixture of Experts Modellen.
  311. 11:28Quen 3.827B
  312. 11:31ist z.B. ein dichtes Modell. Das
  313. 11:33bedeutet, dass bei jedem Token, der
  314. 11:35generiert wird, das gesamte Modell
  315. 11:37feuert. Alle 27 von 27 Milliarden
  316. 11:41Parametern sind aktiv. Dementsprechend
  317. 11:43muss das ganze Modell in den schnellen
  318. 11:46RAM liegen, sonst wird es unglaublich
  319. 11:48langsam. Falls die Hälfte außerhalb vom
  320. 11:50VRAM liegt, z.B. in den normalem RAM,
  321. 11:53dann wird das Ganze unglaublich C.
  322. 11:56Mixture of Experts Modelle sind anders.
  323. 11:58Deepsig V4 Flash ist z.B. ein Mure of
  324. 12:01Experts Modell. Da sind nur 13
  325. 12:03Milliarden Parameter aktiv von den
  326. 12:05insgesamt 284 Milliarden Parametern und
  327. 12:09nur die aktiven Parameter brauchen den
  328. 12:11schnellen Speicher. Kalte Experten, die
  329. 12:14dürfen in den langsamen RAM warten. Sie
  330. 12:16müssen nicht in den Vierram sein. Sie
  331. 12:18könnten teilweise sogar auf der
  332. 12:20SSD-Karte sein, wobei das noch relativ
  333. 12:23experimentell ist. Es gibt tatsächlich
  334. 12:26einige Leute, die es probiert haben, ein
  335. 12:28125 Milliarden Parametermodell auf 24 GB
  336. 12:31laufen zu lassen. Z.B. das Quen 38 Flash
  337. 12:35Next. Das ist ein ziemlich großes Modell
  338. 12:38und ich habe einige Benchmarks gesehen,
  339. 12:40wo es Leute geschafft haben bei diesem
  340. 12:42großen Modell auf ein Kontextfenster von
  341. 12:44bis zu 250.000 Token hochzugehen und
  342. 12:48zwar mit einer einzelnen RTX 4090. Die
  343. 12:52Geschwindigkeit immer noch 21 Token pro
  344. 12:54Sekunde und über 300 Token beim Prompt
  345. 12:57einlesen. Falls man das Modell wechselt
  346. 12:59auf ein dichtes Modell, also nicht ein
  347. 13:01Mixure of Experts Modell, dann bist du
  348. 13:03schnell im CPU Offload und du bist nur
  349. 13:06bei zwei oder drei Token pro Sekunde.
  350. 13:08Hast du also insgesamt wenig VRAM, aber
  351. 13:11viel Systemraam, dann versuche Moei
  352. 13:13Modelle zu verwenden. Sehen wir uns noch
  353. 13:15mal kurz an, wie das mit der
  354. 13:17Quantisierung läuft, denn einige
  355. 13:19Quantisierungen sind super und andere
  356. 13:21weniger super. Ein volles Modell ist
  357. 13:23meistens das BF16 Modell, das ist
  358. 13:26unquantisiert. Wie wir auch vorhin schon
  359. 13:28gesehen haben, hat das Quen 38 Modell in
  360. 13:3127B 24 GB in der vollen Präzision. 54
  361. 13:36natürlich. Falls man runtergeht auf ein
  362. 13:38Q8 Modell, dann ist das in etwa halb so
  363. 13:41groß mit 26 GB und man verliert fast 0%
  364. 13:46Präzision oder Qualität. Falls man
  365. 13:48runtergeht auf Q4, das ist tatsächlich
  366. 13:51meistens Standard. Hast du vielleicht
  367. 13:53auch hier in Olama gesehen, das Modell
  368. 13:55hat hier z.B. 18 GB und man sieht, dass
  369. 13:59es eine Q4 Quantisierung ist, dann
  370. 14:01verliert man auch hier nur 2%. Das ist
  371. 14:04meistens die richtige Wahl. Man kann
  372. 14:06viel Größe sparen, verliert aber nur
  373. 14:08wenig Präzision, falls man danach
  374. 14:10runtergeht zu spezielleren
  375. 14:12Quantisierungen, wie z.B. Q3 oder Q2,
  376. 14:14aber erle spürbaren Präzision. Etwas
  377. 14:18Interessantes ist auch, dass das 3 Bit
  378. 14:21manchmal langsamer ist als das 4 Bit,
  379. 14:23obwohl es weniger Gigabyte groß ist.
  380. 14:26Besonders falls man CPU offloading
  381. 14:28macht, bestraft jede Quantisierung die
  382. 14:30nicht durch zwei teilbar ist. Du musst
  383. 14:33dir das in etwa so vorstellen, dass die
  384. 14:35Dinge immer aufgeteilt werden müssen.
  385. 14:37Besonders falls gewisse Sachen in einen
  386. 14:39RAM liegen und gewisse Sachen in einen
  387. 14:41Vierram. Mit einer ungeraden
  388. 14:43Quantisierung hast du hier einfach mehr
  389. 14:45Probleme. Und wie gesagt, du kannst auch
  390. 14:47den KV Cash auf 4 Bit runterbacken, dann
  391. 14:50sparst du auch anständig Rechenleistung.
  392. 14:52Falls man sich Hardware anschafft, dann
  393. 14:54sollte man wissen, dass kein System
  394. 14:56beides hat. Viel Bandbreite und viel
  395. 14:59Speicher. Sieht man sich z.B. eine RTX
  396. 15:025090 an von Nvidia, dann hat die
  397. 15:04natürlich die größte Bandbreite mit 1792
  398. 15:08GB pro Sekunde, aber sie hat nur 32 GB
  399. 15:12VRAM und die Dinger sind ziemlich teuer.
  400. 15:15Mittlerweile hält man sich eher bei
  401. 15:16diesen Preisen auf, also so 4300 und das
  402. 15:20kann sogar hochgehen bis 5000 €. Die
  403. 15:222000 waren die Starterpreise.
  404. 15:25Falls man zu einer 6000er Karte
  405. 15:27hochgeht, die mittlerweile wohl knapp
  406. 15:29bei 15 000 € liegen sollte, hat man
  407. 15:32immer noch die gleiche Bandbreite und
  408. 15:34ca. 96 GB V RAM. Sieht man sich aber das
  409. 15:37brandneue Mac Studio an, dann hat man
  410. 15:39immer noch eine sehr, sehr hohe
  411. 15:41Bandbreite und man kann mit der Memory
  412. 15:44auch sehr hoch. Im Oktober soll sogar
  413. 15:47ein Gerät kommen mit 512 GB. Die ganz
  414. 15:50großen Geräte werden natürlich super
  415. 15:52teuer werden, aber bei Apple hättest du
  416. 15:54theoretisch die Möglichkeit auf doch
  417. 15:56sehr gute Bandbreite und auch viel RAM
  418. 15:59insgesamt. Du musst verstehen, dass
  419. 16:02Apple mit Unified Memory arbeitet. Das
  420. 16:04heißt, die RAM und VRAM, die sind
  421. 16:07sozusagen miteinander verschweißt, die
  422. 16:09liegen ganz nahe beieinander, die teilen
  423. 16:11sich alles und eine separate Grafikkarte
  424. 16:14hat natürlich nur die VRAM, die super
  425. 16:16schnell sind, die eine gute Bandbreite
  426. 16:18haben und du hast die RAM separat
  427. 16:20laufen. Weitere Karten, die super
  428. 16:22unterschätzt sind, sind RTX 3090er und
  429. 16:25zwar gebrauchte. Die bekommt man
  430. 16:27teilweise für 8 bis 900 € mittlerweile
  431. 16:30auch oft 1200 €. Die haben immer noch
  432. 16:33eine super starke Bandbreite und kosten
  433. 16:36halt nicht so viel wie ein Kleinwagen.
  434. 16:39Die Mac Studios gehen teilweise auch
  435. 16:41hoch bis fast 20.000 € und dann gibt es
  436. 16:44natürlich noch Dinge wie ein McMini, die
  437. 16:46DGX Spark und auch ein Strix Halo.
  438. 16:49Lustigerweise muss man fast sagen, dass
  439. 16:52die Mac Minis für das was sie bieten,
  440. 16:54gar nicht schlecht sind. Die Strix Halo
  441. 16:57hat zwar auch anständig RAM, die
  442. 16:59Bandbreite ist aber etwas schwach und da
  443. 17:01hat man auch mehr Software Probleme als
  444. 17:03bei den Macs und besonders im Vergleich
  445. 17:06zu Nvidia fällt das auf. Hier hast du
  446. 17:09noch mal eine kleine Grafik, welches
  447. 17:11Modell in welche Karten oder Systeme
  448. 17:13reinpassen würde. 24 GB komplette VRAM
  449. 17:17mit guter Bandbreite sind oft
  450. 17:18tatsächlich ein gutes Mittelmaß. Wie
  451. 17:21gesagt ist es bei den Nvidia Grafikfären
  452. 17:23so, dass man Speicher und Tempo
  453. 17:25sozusagen getrennt bezahlen muss. Eine
  454. 17:285090er hat natürlich die absolut beste
  455. 17:31Bandbreite. Dementsprechend teuer ist
  456. 17:33sie auch, aber Speicher bleibt immer
  457. 17:35noch der Engpass, gerade für größere
  458. 17:37Modelle. Will man bei Nvidia hoch auf 96
  459. 17:41GB, ist man ziemlich schnell bei einem
  460. 17:44fünfstelligen Betrag. Will man bei
  461. 17:46Nvidia viel Speicher für einen Preis,
  462. 17:49der noch halbwegs okay ist, dann fällt
  463. 17:51die Bandbreite dramatisch ab, aber man
  464. 17:54hat immer noch K damit dabei, worüber
  465. 17:56wir gleich noch sprechen. Generell
  466. 17:58solltest du auch noch wissen, dass du in
  467. 17:59wieder Grafikkarten auch zusammenstecken
  468. 18:02kannst. Die letzte Karte, die du mit NV
  469. 18:05Link zusammenstecken kannst, ist
  470. 18:07übrigens die RTX 3090.
  471. 18:10Auch falls du z.B. 25090er hast, kannst
  472. 18:13du mit Runtimes wie Lama CPP die Dinge
  473. 18:16zusammen verwenden. Dann werden die
  474. 18:17halben Gewichte vom Modelle auf die eine
  475. 18:19Grafikkarte gepackt und die anderen
  476. 18:21halben Gewichte auf die andere Karte.
  477. 18:23Die können also einigermaßen gut
  478. 18:24zusammenarbeiten, auch ohne Nenk. Erst
  479. 18:27müssen wir zu den Geräten mit Unified
  480. 18:29Memory kommen, denn Unified Memory kauft
  481. 18:32ihr Speicher, den man bei Werfür das
  482. 18:34Geld einfach nicht bekommt. Bei Unified
  483. 18:36Memory sind natürlich die Mac Mini Star,
  484. 18:39die Mac Studios, eine Stak Sa und auch
  485. 18:42eine Nvida DGX Park. Speicher bei diesen
  486. 18:45Geräten geht tatsächlich los bei nur 16
  487. 18:48GB und das geht hoch bis zu 512 GB. Die
  488. 18:52allermeisten, die ernst machen mit
  489. 18:53lokaler KI, die legen sich etwas zu mit
  490. 18:55128 GB. Man sieht aber sofort, dass hier
  491. 18:59die Bandbreite natürlich deutlich
  492. 19:01nachlässt. Der einzige Ausreißer nach
  493. 19:03oben ist das Macstudio M5 Ultra. Solche
  494. 19:06Kisten sind danach natürlich perfekt,
  495. 19:08auch für parallelle Agenten. Weil du den
  496. 19:10ganzen Speicher hast, den das Modell
  497. 19:12verwenden kann, kannst du mehrere
  498. 19:14Agenten machen. Das Kontextfenster von
  499. 19:16allen Agenten kann relativ groß sein,
  500. 19:19aber dadurch, dass die Bandbreite
  501. 19:21kleiner ist, werden die Agenten
  502. 19:23langsamer arbeiten. Etwas, dass du
  503. 19:25aufberechnen solltest, ist, dass solche
  504. 19:27MiniCs deutlich weniger Strom fressen
  505. 19:29werden. Mit 10 € solltest du auskommen
  506. 19:33mit solch Geräten, wobei du bei einer
  507. 19:35großen Karte schnell mal auf 50, 60 € im
  508. 19:38Monat kommen kannst. Wo du aber auch
  509. 19:40große Abstriche machen wirst, ist
  510. 19:42wahrscheinlich Freefil mit Cuder. Das
  511. 19:44heißt, falls du lange Prompts einlesen
  512. 19:46musst, das ist bei diesen Geräten viel
  513. 19:48schwächer, da sind einfach die
  514. 19:50dedizierten Grafikkarten besser. Wir
  515. 19:52müssen auch noch mal kurz über CUDA
  516. 19:55sprechen. Erstmal, was ist CUDA? Kuda
  517. 19:57ist der Softwareestack, der bei Nvidia
  518. 19:59läuft. Und falls du irgendetwas machst,
  519. 20:02das mit Fine Tuning zu tun hat, damit
  520. 20:04Bilder zu erstellen, Videos zu
  521. 20:06erstellen, falls du irgendwas in Confui
  522. 20:09machst, dann wirst du um kuda kam drum
  523. 20:11herumkommen. Warum ist das Ganze so? Die
  524. 20:13ganzen KI Modelle, die gebaut werden,
  525. 20:15werden erstmal für Kuda optimiert, weil
  526. 20:18Kuda ganz viele Bibliotheken hat. Falls
  527. 20:20ein neues Diffusion Modell trainiert
  528. 20:22wird, braucht man meistens Byge und ganz
  529. 20:24ganz viele Bibliotheken und all das ist
  530. 20:27bei CUDA einfach super gut mit
  531. 20:29integriert. Deshalb hat man auch so
  532. 20:31viele Probleme, falls man Confui
  533. 20:33installieren will auf einen AMD Gerät
  534. 20:35und auch auf einem Apple Computer hat
  535. 20:37man da Probleme. Die Software an sich
  536. 20:39läuft zwar, aber falls du da
  537. 20:41verschiedene Notes mit einbauen möchtest
  538. 20:43oder speziellere Sachen machen willst,
  539. 20:45dann werden die Modelle abschmieren und
  540. 20:47man hat einfach keine guten Ergebnisse.
  541. 20:50NVIA hat also den riesengroßen Burgraben
  542. 20:52Kuda und falls einem ernst ist mit
  543. 20:54lokaler KI ist Kuda schon cool zu haben.
  544. 20:57Außer aber man verwendet einen solchen
  545. 20:59Computer nur um Inference für LMS
  546. 21:02auszuführen. Weil wir von LM Inference
  547. 21:05sprechen. Aktuell wäre wahrscheinlich
  548. 21:07die günstigste Kiste, ein Ryzen AI Max
  549. 21:10mit einer Strix Halo mit dabei. Man kann
  550. 21:12hoch auf 128 GB Speicher. Mit Windows
  551. 21:16drauf hast du danach vielleicht noch so
  552. 21:1896 GB frei, um Modelle laufen zu lassen.
  553. 21:21Die Bandbreite ist etwas unter dem DX
  554. 21:24Spark. Der Preis ist dafür günstiger.
  555. 21:27Der ist mittlerweile auch etwas höher
  556. 21:29als hier der obere Raum. Du kannst hier
  557. 21:31bei den Preisen immer etwas mehr drauf
  558. 21:32rechnen. Es ist schon ein klein wenig
  559. 21:34her, dass ich die Präsentation gemacht
  560. 21:36habe, aber darauf lassen sich wunderbar
  561. 21:38ziemlich gute Modelle laufen lassen,
  562. 21:40sogar mit mehreren Agenten parallel.
  563. 21:42Natürlich leidest du dafür bei prefil,
  564. 21:45also sobald die Promps verarbeitet
  565. 21:47werden. Falls du irgendetwas mit Bildern
  566. 21:49oder Fine Tuning machen willst, wirst du
  567. 21:52extrem leiden und du musst
  568. 21:54wahrscheinlich etwas Pflege betreiben.
  569. 21:56Generell gesprochen läuft ein Quen 3827B
  570. 22:00Modell bereits auf 8 GB VRAM. Je nach
  571. 22:02Quantisierung, die du verwendest und ein
  572. 22:05paar Spezialeinstellungen, kannst du das
  573. 22:07tatsächlich hinbekommen. Natürlich läuft
  574. 22:09es deutlich besser, falls du hochgehen
  575. 22:11kannst auf 16 GB. Bevor du irgendetwas
  576. 22:14nachkaufst, solltest du auch versuchen,
  577. 22:16das Tempo erstmal zu erhöhen. Teilweise
  578. 22:19kann es helfen, die Runtime zu wechseln.
  579. 22:22Je nachdem, was du machst, kann es
  580. 22:24passieren, dass Olarama 21 Token pro
  581. 22:27Sekunde liefert und VLM das Vierfache,
  582. 22:31das kommt vor allem vor, falls du das
  583. 22:34Modell für viele Leute bereitstellen
  584. 22:36musst, also falls du 50, 60 Anfragen
  585. 22:39gleichzeitig an die Maschine schickst.
  586. 22:41Danneben solltest du spekulatives
  587. 22:43Decoding aktivieren. Das siehst du auch
  588. 22:46hier direkt in LM Studio. MTP steht für
  589. 22:49Multien Prediction. Das solltest du also
  590. 22:52einschalten und bei dem Max Draft Token
  591. 22:55spielst du zwischen 2 und 3 rum. Das
  592. 22:58bedeutet im Endeffekt, dass drei Token
  593. 23:00zugleich errechnet werden und danach
  594. 23:02kontrolliert ein anderes Modell noch mal
  595. 23:04rüber. Auch das Kontextfenster solltest
  596. 23:07du quantisieren, das habe ich dir vorhin
  597. 23:09schon gezeigt. Das sollte das Ganze auch
  598. 23:11noch mal schneller machen. Und
  599. 23:13vielleicht versuchst du eine native vier
  600. 23:15Bit Quantisierung. Falls du ein NFP4
  601. 23:18findest, sollte das generell gesprochen
  602. 23:21schneller laufen, besonders über VLM.
  603. 23:23Versuch dir erstmal Gedanken zu machen,
  604. 23:25wie große Modelle du laufen lassen
  605. 23:27möchtest. Und falls du bereits schon 8
  606. 23:29GB schnellen RAM hast, der frei ist auf
  607. 23:32deiner Maschine, dann kannst du mit
  608. 23:34Modellen spielen, die entweder wenig
  609. 23:36Parameter haben oder aber die Mixture of
  610. 23:38Experts Modelle sind und den Rest kannst
  611. 23:40du in die RAM auslagern. Falls du 16 GB
  612. 23:43schnellen Speicher hast, dann kannst du
  613. 23:45ein Quen 38 in 27B probieren. Da kannst
  614. 23:49du gut und gerne auf 40 Token pro
  615. 23:51Sekunde kommen mit den richtigen
  616. 23:52Quantisierungen und Einstellungen. Falls
  617. 23:54du einen kompletten PC hast mit Richtung
  618. 23:5724 GB V RAM, z.B. eine 3090er, dann
  619. 24:01kannst du das Kontextfenster weiter
  620. 24:03hochmachen und vielleicht noch ein paar
  621. 24:05Token mehr erwarten. Falls du eine Strix
  622. 24:07Halo oder ein ähnliches Gerät hast mit
  623. 24:09128 GB Unified Memory, dann kannst du
  624. 24:13ziemlich große Modelle laufen lassen,
  625. 24:15auch mehrere Agenten. Das Ganze läuft
  626. 24:17schnell und leise und einfach.
  627. 24:19Allerdings wird es relativ langsam sein.
  628. 24:21Mit mehr Nvidia Grafikkarten wirst du
  629. 24:24bei allem Freude haben. Bild, Video,
  630. 24:26Fine Tuning, was es auch immer ist. Und
  631. 24:29mit einem großen Macstudio wirst du vor
  632. 24:31allem bei LM Inference zufrieden sein.
  633. 24:34Die Reihenfolge ist in meinen Augen
  634. 24:35immer sich zu überlegen, was man machen
  635. 24:37möchte, welches Modell man braucht, wie
  636. 24:39viel Kontext, wie viele Instanzen. Man
  637. 24:42könnte sich den Speicher ausrechnen, die
  638. 24:44Bandbreite gegen das Zeittempo prüfen
  639. 24:47und danach erst die Preise vergleichen.
  640. 24:50Samtstrom, Lautstärke und Aufrübarkeit.
  641. 24:53Etwas ganz Wichtiges, das noch dazu
  642. 24:55kommt, ist, falls du ein Gerät kaufst
  643. 24:57mit Unified Memory, also irgendein
  644. 24:59Miniuter, dann kannst du niemals
  645. 25:02irgendwas ausrüsten. Hier ist RAM und
  646. 25:04Viram sozusagen verlötet. Falls du einen
  647. 25:06großen Standpzel hast, kannst du
  648. 25:08natürlich die Grafikkarte austauschen
  649. 25:10oder eine neue Grafikkarte dazu packen,
  650. 25:13die RAM ausweiten, da bist du viel
  651. 25:15flexibler. Kommen wir noch mal kurz zu
  652. 25:17diesem Prompt. Den werde ich unten
  653. 25:19verlinken. Wie gesagt, den kannst du
  654. 25:20kostenlos runterladen. Dieser Prompt
  655. 25:23wird dir dabei helfen, die richtige
  656. 25:25Hardware für dich auszusuchen oder aber
  657. 25:28die richtigen Modelle auf der Hardware,
  658. 25:30die du bereits hast. Es ist auch genau
  659. 25:32gezeigt, wie du ihn verwendest. Im
  660. 25:33Groben musst du nur den Prompt von hier
  661. 25:35weg kopieren bis ganz unten, also bis
  662. 25:38hier. Und du schmeißt das in einen
  663. 25:40Coding Agent rein. Er wird übrigens
  664. 25:42nicht die Rolle von einem Verkäufer
  665. 25:44annehmen, sondern eher die Rolle. von
  666. 25:46einem Kollegen, der dich einfach etwas
  667. 25:48berätt. Erstmal wird deine bestehende
  668. 25:50Hardware geprüft. Danach werden ganz,
  669. 25:52ganz viele Fragen gefragt und du
  670. 25:54bekommst hoffentlich die richtige
  671. 25:56Antwort zurück. Je nachdem, was du alles
  672. 25:58laufen lassen möchtest, kommt natürlich
  673. 26:00unterschiedliche Hardware in Frage. Also
  674. 26:02probier den Prompt gerne aus. Den Prompt
  675. 26:04findest du in der Community, da
  676. 26:05schreibst du rein Hardware für lokale
  677. 26:09KI. Du schickst da auf suchen und dort
  678. 26:11wird der Prompt im Post verlinkt sein.
  679. 26:13Das ist wie gesagt in der kostenlosen
  680. 26:15Community. Neben der kostenlosen
  681. 26:17Community habe ich natürlich noch die
  682. 26:18Premium Community. Da wird der Prompt
  683. 26:20natürlich auch geteilt und da gibt es
  684. 26:22auch noch persönliche Unterstützung.
  685. 26:24Hier ist generell etwas mehr los. Es
  686. 26:26gibt mehr Aktivität. Im Classroom haben
  687. 26:28wir auch dedizierte Kurse, falls du die
  688. 26:30Sachen wirklich detailliert lernen
  689. 26:31möchtest mit Dingen, die aufeinander
  690. 26:33ausbauen. Und wir haben natürlich immer
  691. 26:36wieder Challenges laufen und treffen uns
  692. 26:38auch regelmäßig in Live Calls und
  693. 26:40quatschen über solche und ähnliche
  694. 26:41Sachen. Ich würde mich natürlich auch
  695. 26:43freuen, dich dort zu begrüßen und
  696. 26:45ansonsten lad dir gerne einfach nur den
  697. 26:47Prompt runter. Und als weiteren kleinen
  698. 26:49Tipp solltest du dir vielleicht was ja
  699. 26:51mal ansehen und vielleicht auch Runpot.
  700. 26:53Generell kannst du hier Grafikkarten
  701. 26:55mieten, also bevor du einen 5090er
  702. 26:58kaufst, miete einfach mal für ein paar
  703. 27:00Stunden, da bezahlst du nur wenige Euro
  704. 27:02und du weißt im Endeffekt, was auf dich
  705. 27:04zukommt, falls du dir selbst eine solche
  706. 27:06Karte kaufst, dann hast du keine bösen
  707. 27:08Überraschungen. Hier findest du so gut
  708. 27:09wie alle Karten, also probier einfach
  709. 27:12mal eine aus, bevor du das ganze Geld
  710. 27:14ausgibst. Falls du dir erstmal nur drei
  711. 27:17Sätze merken möchtest, dann merkt dir
  712. 27:19bitte, dass der Speicher entscheidet, ob
  713. 27:22ein Modell passt, also ob die Gewichte
  714. 27:25der KW Cash, der Buffer und das
  715. 27:27Betriebssystem alle zusammen
  716. 27:28hineinpassen. Das ist das
  717. 27:30allerwichtigste, die RAM der Speicher an
  718. 27:33sich. Danach musst du dir die Bandbreite
  719. 27:36vom Speicher ansehen und du kannst gerne
  720. 27:38noch mal zurück zur Rechnung gehen,
  721. 27:40damit du in etwa abschätzen kannst, wie
  722. 27:42schnell die Dinger bei dir generieren
  723. 27:43werden. Was du dir auch noch merken
  724. 27:45solltest, ist, dass die Software doch
  725. 27:48ziemlich oft wichtig ist. Versuch mal
  726. 27:50die Runtime zu wechseln oder Multien
  727. 27:53Prediction einzuschalten oder KV Cash
  728. 27:55Quantisierung zu aktivieren. Vielleicht
  729. 27:57kannst du selbst damit gut die
  730. 27:59Performance verbessern. Frag am besten
  731. 28:02nicht, welche Hardware die beste ist.
  732. 28:04Frag, welches Problem du lösen musst.
  733. 28:07Ich denke, die entscheidendste Frage
  734. 28:08ist: Willst du nur Textgenerierung
  735. 28:11machen oder auch Bild, Video, Musik und
  736. 28:13Fine Tuning? Falls du alles machen
  737. 28:16möchtest und wirklich tief in KI
  738. 28:17eintauchen willst, dann sind den
  739. 28:19Videograf Grafikkarten mit viel Viram
  740. 28:21einfach das Beste, das geht. Du hast
  741. 28:24Kuda, Kuda ist der Standard. Da hast du
  742. 28:26einfach Freude bei allen Modalitäten. Du
  743. 28:29hast die höchste Bandbreite, du hast den
  744. 28:32schnellsten Prefill, also werden auch
  745. 28:34lange Prompts super schnell verarbeitet,
  746. 28:37aber der Speicher sehr natürlich teuer.
  747. 28:39Falls du sagst, du willst nur Text
  748. 28:41verarbeiten, dafür aber viel davon, dann
  749. 28:43ist dein Mini PC mit viel gemeinsamen
  750. 28:46Speicher die vernünftigere Lösung, weil
  751. 28:48es einfach günstiger ist. Außerdem sind
  752. 28:50die Dinge leise, sparsam und
  753. 28:52dauerlaufig. Das ist ein kompletter
  754. 28:55Server, den du dir hinstellst. Der
  755. 28:57Nachteil ist, wie gesagt kein Kuda und
  756. 28:59der Freefill ist etwas langsam, aber
  757. 29:01dafür sind die Mini PCs wie gesagt
  758. 29:04günstiger. Ein Mac bietet guten Wert für
  759. 29:06sein Geld. Bei Nvidia kannst du
  760. 29:08wahrscheinlich die Preisleiter
  761. 29:09hochgeben, bis der Preis für dich keppt.
  762. 29:12Also Stufe 1 für guten Einstieg, wo man
  763. 29:15wirklich viel Viram bekommt, ist eine
  764. 29:17gebrauchte RTX 3090. mittlerweile eher
  765. 29:201000 € und minimal mehr, aber die hat
  766. 29:23bereits 24 GB V RAM, hat eine gute
  767. 29:26Bandbreite und frisst nicht allzu viel
  768. 29:28Watt. Außerdem kannst du es sogar mit
  769. 29:30Nink erweitern. Du könntest sogar zwei
  770. 29:33davon kaufen, dann hast du fast 50 GB
  771. 29:35VRAM. Falls du High-End Consumer Karte
  772. 29:38gehen willst mit nur einer Karte, ist es
  773. 29:40wahrscheinlich die RTX 5090 und die RTX
  774. 29:43Pro 6000, die ist wahrscheinlich nur
  775. 29:45relevant, falls du das eher in einem
  776. 29:47Unternehmen einsetzen musst. Ich
  777. 29:49bezweifle, dass du das als Privatperson
  778. 29:51kaufen willst. Dazu solltest du dir
  779. 29:53natürlich noch RAM zulegen und auch beim
  780. 29:56RAM zählt danach noch die Bandbreite.
  781. 29:59Ein DDR5 6000 RAM liegt in etwa beim
  782. 30:02doppelten wie ein Single Channel RAM.
  783. 30:05Falls du dich dafür entscheidest mehrere
  784. 30:073090 zusammenzustöpseln, solltest du
  785. 30:09auch noch wissen, dass NVLink nicht auf
  786. 30:11einmal magisch eine 48 GB Karte macht.
  787. 30:15Das Modell muss später weiter aufgeteilt
  788. 30:17werden, falls du das auf die
  789. 30:19Grafikkarten packst. Und bei einer 5090
  790. 30:22solltest du dir vielleicht auch noch
  791. 30:24kurz ansehen, ob es in einem aktuellen
  792. 30:26PC überhaupt noch reinpasst. Sind
  793. 30:28relativ groß. Falls du dich für Weg
  794. 30:30beentscheidest und eher den Speicherweg
  795. 30:33gehst, dann ist wahrscheinlich ein Max
  796. 30:35Studio M5 Max relativ gut für das, was
  797. 30:39du aktuell bekommst. Das einzige was
  798. 30:41fehlt ist Kuda. Du hast aber gute
  799. 30:43Bandbreite. Es verbraucht nicht allzu
  800. 30:45viel Watt und die Preise sind noch
  801. 30:47einigermaßen okay. Ich weiß, die Preise
  802. 30:49sind überall gestiegen, aber im
  803. 30:50Vergleich zu den anderen ist Apple
  804. 30:52aktuell tatsächlich okay. Was mich
  805. 30:54wundert. Die Strix Halo ist vielleicht
  806. 30:56auch okay. Ich persönlich würde da aber
  807. 30:58tatsächlich Apple bevorzugen, denke ich.
  808. 31:01Und die DGX Bark ist in meinen Augen
  809. 31:04deutlich hinterher zu den aktuellen Mac
  810. 31:07Studios, auch bei den Mac Mines
  811. 31:09hinterher. Der einzige Vorteil ist hier
  812. 31:11tatsächlich Kuda, also die DJX Park, die
  813. 31:14hat weder eine super gute Bandbreite,
  814. 31:17noch ist sie günstig. Einzige Vorteil
  815. 31:20ist hier tatsächlich Kuda, also für die
  816. 31:23DJXPK,
  817. 31:24ich denke, da gibt es relativ wenige
  818. 31:27Anwender. Da würde ich tatsächlich
  819. 31:293090er Karten mit anständig separaten
  820. 31:32Rampe bevorzugen und auf Mure of Experts
  821. 31:35Modelle ausweichen. Dann funktioniert
  822. 31:37auch die Fusion etwas besser und auch
  823. 31:39Fine Tuning. Ja, die DJX Park ist
  824. 31:42aktuell im komischen Gewässer. Schreib
  825. 31:45in die Kommentare, was du für Hardware
  826. 31:47hast. Hast du weitere Fragen? Ich weiß,
  827. 31:49das Thema ist relativ komplex. Versucht
  828. 31:51ihr einfach drei Dinge zu merken. Die
  829. 31:53RAM an sich entscheiden, ob das Modell
  830. 31:56passt. Die Bandbreite entscheidet, wie
  831. 31:59schnell das Modell läuft. Zusätzlich
  832. 32:01brauchst du etwas Buffer für
  833. 32:03Betriebssystem, für den KV Cash. Und
  834. 32:06falls du mehrere Agenten parallel laufen
  835. 32:08lassen willst, dann braucht auch jeder
  836. 32:10separate Agenten den KV Cash. Deshalb
  837. 32:12frisst man so schnell so viel Speicher.
  838. 32:15Das absolut schnellste und beste ist so
  839. 32:17viel Viram von Nvidia wie möglich wegen
  840. 32:20CUDA. Das wird aber auch super schnell,
  841. 32:22super teuer. Falls es um alle LMS geht,
  842. 32:24hast du auch die Möglichkeit nicht das
  843. 32:26gesamte Modell in den VRAM zu lagern,
  844. 32:28sondern einen Teil davon in den RAM und
  845. 32:30nur die aktiven Experten in den VRAM,
  846. 32:33dann kannst du immer noch schnell
  847. 32:34arbeiten. Und falls du eine Mini PC hast
  848. 32:36mit zusammengeschweißten RAM und Viram,
  849. 32:38hast du generell mehr Memory, du
  850. 32:40bezahlst aber mit geringerer Bandbreite.
  851. 32:43Falls genau das Thema interessiert, lass
  852. 32:45mir gerne ein Abo da. Ich werde die
  853. 32:47nächste Zeit wahrscheinlich noch ein
  854. 32:49paar Videos veröffentlichen, wie man
  855. 32:50auch auf kleine Hardware Modelle so
  856. 32:52optimiert, dass sie gut laufen. Ich
  857. 32:54weiß, dieses Video war mehr theoretisch.
  858. 32:56Ich wollte aber mal ein paar Gedanken zu
  859. 32:59Hardwrel werden. Und übrigens, falls
  860. 33:00dich das Thema im Detail interessiert,
  861. 33:02schau auch gerne mal in der Premium
  862. 33:04Community vorbei. Da sind wir ganz viele
  863. 33:06Leute, wir quatschen ständig. Im
  864. 33:08Classroom haben wir detaillierte Kurse,
  865. 33:10die alles dur machen, natürlich auch
  866. 33:12lokale KI und wir treffen uns regelmäßig
  867. 33:14in Live Calls zum Quatschen. Wir sehen
  868. 33:16uns spätestens im nächsten Video.

About this transcript

This page contains the full transcript of Hardware für Lokale KI by AI mit Arnie, generated from the public captions YouTube serves with the video. The transcript has 5,351 words across 868 segments, with the original timestamps preserved so you can click any line to jump to that moment in the embedded player.

What you can do with it

Use the transcript to take notes, quote the speaker, build a study guide, generate a summary with ChatGPT or Claude via the YouTube Summary tool, or export it as a timed subtitle file with YouTube to SRT. You can also re-open it in the transcriber to translate the transcript into 100+ languages.

Free YouTube transcript tool

YouTube2Text is a free YouTube transcript generator — no signup, no daily limit. Paste any YouTube link and get the full transcript instantly, with timestamps, click-to-jump, translation to 100+ languages, AI prompts for ChatGPT, Claude, and Gemini, and exports to TXT, SRT, VTT, or Markdown.