Hardware für Lokale KI — Transcript
Full transcript
- 0:00Minis, Laptops und natürlich auch
- 0:03Computer mit dedizierten Grafikkarten.
- 0:05Es gibt unendlich viel Geräte, die man
- 0:07sich zulegen könnte und die meisten
- 0:09dieser Sachen haben zwei Dinge
- 0:11gemeinsam. Erstens, sie können lokale KI
- 0:14laufen lassen und zweitens, sie sind
- 0:16mittlerweile unglaublich teuer. Wir
- 0:17haben eine spannende Situation mit den
- 0:19Geräten. Einerseits wird diese Hardware
- 0:21über Zeit immer besser und die sollte
- 0:23auch günstiger werden. Auf der anderen
- 0:25Seite wird Hardware aber immer teurer.
- 0:27Das liegt in meinen Augen an zwei
- 0:28Punkten. Erstens haben wir einen
- 0:30Engpass, weil die ganzen großen KI
- 0:32Unternehmen alles wegkaufen und zweitens
- 0:34kann genau die Hardware, die du gekauft
- 0:36hast, automatisch immer bessere Modelle
- 0:38laufen lassen. Schau mal, das ist
- 0:40official Analysis. Und aktuell haben wir
- 0:43hier Quen 3.827B
- 0:45in einem Feld, das relativ weit vorne
- 0:47mitmischt und das ist ein Modell, dass
- 0:49du lokal auf Konsumerh laufen lassen
- 0:51kannst. Das heißt, die Hardware vom
- 0:53letzten Jahr ist in diesem Jahr deutlich
- 0:55wertvoller für dich, falls du KI laufen
- 0:57lassen willst. Und weil das Angebot an
- 0:59Hardware so groß ist, will ich in diesem
- 1:01Video alles aufschlüsseln. Wann lohnt
- 1:03sich welches Gerät? Falls du ein neues
- 1:05anschaffst, was kannst du auf bereits
- 1:06bestehenden Geräten laufen lassen? Wie
- 1:08kannst du das Ganze etwas optimieren und
- 1:10worauf musst du wirklich achten? Du
- 1:12bekommst sogar einen kompletten Prompt
- 1:14mit, den kannst du in einen
- 1:15Lieblingsagent schmeißen und der wird
- 1:17danach für dich abschätzen, welche
- 1:18Hardware für dich am meisten Sinn macht.
- 1:20Doch später noch mal mehr zu diesem
- 1:22Prompt. Fangen wir erstmal mit ein paar
- 1:24Gründen an, warum lokale KI überhaupt
- 1:26relevant ist. Erstens natürlich bleiben
- 1:28die Daten in deinem Haus bzw. auf deinem
- 1:31Rechner. Du kannst sogar Dinge hochladen
- 1:33wie Verträge, Kundennamen,
- 1:35Gesundheitsdaten, deine gesamte
- 1:37Codebasis und alles, was du nicht im
- 1:40Internet teilen willst. Der zweite Punkt
- 1:42ist natürlich Planbarkeit. Die großen
- 1:45Cloudmelle, die können über Nacht
- 1:46getauscht werden. Ein Kontextfenster
- 1:48kann gekürzt werden, Modelle werden
- 1:50komplett abgeschaltet oder wir werden
- 1:52ausgesperrt, wie es zu fibel der Fall
- 1:54war. Und falls sich ein Modell so
- 1:56verändert, dass es für dich nicht mehr
- 1:58funktioniert wie vorher, dann hast du
- 1:59ein Problem. Das Problem hast du mit
- 2:01lokaler K auch nicht. Sobald ein Modell
- 2:03einmal bei dir läuft, läuft es immer
- 2:05gleich. Der nächste Grund ist natürlich,
- 2:08du hast keine Limits. Dein Plan wird
- 2:10nicht irgendwann fertig und Zeit
- 2:13arbeitet für dich. Dieselbe Hardware
- 2:15kann heute mehr als vor 6 Monaten. Die
- 2:18Modelle wurden einfach besser. Das
- 2:19bedeutet, dein Rechner wird nützlicher
- 2:21überzeit. Außerdem zahlst du bei den
- 2:24meisten Cloudmellen tatsächlich mit 30
- 2:26Tage Datenspeicherung. Modelle, die als
- 2:29gefährlich eingestuft werden, die werden
- 2:31für 30 Tage lang deine gesamten Chats
- 2:33speichern und eventuell überwachen. Bei
- 2:35den Antropic Modellen sieht man das z.B.
- 2:38recht oft. Ich denke vor allem für vier
- 2:40Personengruppen ist lokale KI super
- 2:42spannend. Die Leute, die den großen
- 2:43Anbietern einfach nicht trauen. Die
- 2:45Leute, die ihre eigene Daten schützen
- 2:47wollen oder müssen. Leute, die basteln
- 2:49wollen. Denn falls man sich mit lokaler
- 2:51KI beschäftigt, muss man KI auf einem
- 2:52ganz anderen Level verstehen. Und all
- 2:54jene, die komplett unabhängig sein
- 2:56wollen. Lokale KI läuft immer, auch wenn
- 2:59das Internet aus ist und ich kann
- 3:00niemand aussperren. Dennoch bleibt für
- 3:03einige Dinge natürlich Cloud KI besser.
- 3:05Falls du öffentliche Inhalte hast, ist
- 3:07es egal, was du verwendest. Wenn du
- 3:09Videos, Blogposts, Marketing oder was
- 3:12ähnliches machst, wo du die Daten nicht
- 3:13schützen musst, kannst du eine API
- 3:15verbinden oder ein ganz normales Abo.
- 3:17Falls du die absolute Spitze willst,
- 3:20kannst du dir entweder eine Serverfarm
- 3:22anschaffen, die Millionen kostet, oder
- 3:24einfach ein günstiges Cloudmell nehmen.
- 3:26Außerdem kannst du bei Cloudmellen
- 3:28natürlich sofort loslegen. Du kaufst ein
- 3:30Abo, boom, das war's. Und du solltest
- 3:32auch noch wissen, dass bei reinen Fakten
- 3:34wissen die kleinen Modelle teilweise
- 3:37etwas hinterher hinken. Je größer das
- 3:39Modell, umso mehr reine Fakten werden in
- 3:42den Gewichten sozusagen Platz haben. Ein
- 3:44Modell wie GPT 5.6 ist natürlich
- 3:47riesengroß, das heißt, es ist viel
- 3:48Wissen mit eintrainiert. Kleinere
- 3:50Modelle, die du lokal laufen lässt, die
- 3:52haben natürlich etwas weniger
- 3:54Basiswissen, bedeutet aber nicht, dass
- 3:56sie nicht nützlich sind. Für alles
- 3:58dazwischen gibt es übrigens auch
- 4:00Hybridwege. Du könntest z.B. dann Roh
- 4:03mit einem lokalen Modell verschlüsseln,
- 4:06mit einem großen Modell drüber arbeiten
- 4:09und danach wieder lokale Namen
- 4:10zurücksetzen. Du solltest also nicht
- 4:12immer schwarz und weiß denken. Versuch
- 4:14viele Dinge lokal zu machen, aber nicht
- 4:16alles. Sehen wir uns mal die Physik an.
- 4:18Also, was ist entscheidend, damit bei
- 4:20dir gute Modelle laufen? Du brauchst
- 4:22zwei Dinge, Speicher und Bandbreite. Bei
- 4:26Speicher spricht man hier tatsächlich
- 4:28meistens von RAM oder Viram. Die
- 4:30Gewichte von den Modellen der KV Cash
- 4:33nennen wir das ganze Kontextfenster
- 4:35einfach zu lassen. Der Computer und das
- 4:38Betriebssystem, das muss natürlich alles
- 4:40zusammen in irgende einen schnellen
- 4:41Speicher rein und falls es nicht passt,
- 4:43dann läuft das nicht oder es ist
- 4:45erbärmlich langsam. Falls es in den
- 4:47Speicher reinpasst, entscheidet die
- 4:49Bandbreite, wie schnell du deine
- 4:51Ausgaben zurückbekommst. Hier gibt es
- 4:54auch eine grobe Faustregel.
- 4:56Speicherbreite geteilt durch Modellgröße
- 4:59im Speicher. Ein 17 GB Modell würde auf
- 5:02einer RTX 5090, die in etwa diese
- 5:05Bandbreite hat, mit in etwa 100 Token
- 5:08pro Sekunde laufen und auf einer Dig
- 5:10Spark würde sie mit 16 bis 24 Token pro
- 5:14Sekunde laufen. Also rechne ganz einfach
- 5:17die Größe vom Modell durch die
- 5:19Bandbreite. Ein Mensch schließt übrigens
- 5:227 Token pro Sekunde. Falls du mit 07
- 5:24Token pro Sekunde generierst, ist das
- 5:26unglaublich lästig. Falls du mit 15 bis
- 5:2920 generierst, nervt es immer noch. Es
- 5:32geht so langsam. 30 und aufwärts wird so
- 5:35langsam spannend. Außerdem solltest du
- 5:37auch noch wissen, dass Agenten natürlich
- 5:39Werkzeuge Aufrufe machen, die im Chat
- 5:41nie auftauchen. Deshalb ist die
- 5:43Geschwindigkeit gefühlt immer noch etwas
- 5:44langsamer als gemessen wird. Und man
- 5:47muss auch noch dazu sagen, dass lange
- 5:49Prompts eingelesen werden müssen.
- 5:51Vielleicht hast du schon mal was vom
- 5:52Prompt Processing gehört oder Time to
- 5:55Token. Das ganze klappt generell
- 5:57gesprochen bei Nvidiak Karten viel
- 5:59besser. Da ist das Einlesen schneller
- 6:01als bei Dingen, wo Unified Memory
- 6:04Systeme verbaut sind. Keine Sorge, falls
- 6:06du die Sachen noch nicht verstehst, wir
- 6:08schlüsseln die noch genauer auf. Sehen
- 6:10wir uns mal ganz kurz den wichtigsten
- 6:11Unterschied dann zwischen einer GPU und
- 6:13einem Mini PC. Falls du eine GPU kaufst,
- 6:16dann sind die RAM separat. Und bei den
- 6:19meisten neueren Mini PCs hast du etwas,
- 6:21das ich Unified Memory nennt. Wir
- 6:23starten erstmal beim klassischen PC.
- 6:26Wenn du einen PC kaufst, dann ist
- 6:27natürlich eine solche Grafikkarte
- 6:29drinnen mit verbaut. Und die
- 6:31Grafikkarte, die hat separaten VRAM.
- 6:33Dieser VRAM ist super schnell. Wir
- 6:35kommen danach noch auf die genauen
- 6:36Zahlen. Zusätzlich hat ein solcher PC
- 6:39natürlich noch RAM und die zwei Dinge
- 6:41sind getrennt voneinander. Du könntest
- 6:44z.B. falls du einen sehr starken PC
- 6:46hast, 128 GB RAM haben und vielleicht
- 6:49noch 32 GB VR RAM dazu. Und jetzt kommt
- 6:52es drauf an, welche Modelle du hier
- 6:54laufen lässt. Ganz generell gesprochen,
- 6:56ist ein Modell am schnellsten, falls es
- 6:59zu 100% in den schnellen VRAM passt. Du
- 7:01kannst die Modelle aber auch aufteilen.
- 7:03Du kannst einen Teil vom Modell in die
- 7:05RAM reinpacken und den Rest in die VRAM.
- 7:08Das funktioniert besonders gut bei
- 7:10Mixture of Experts Modellen und damit
- 7:12kannst du auf einem solchen PC natürlich
- 7:14auch relativ große Modelle laufen
- 7:16lassen. Falls du ein sogenanntes Dance
- 7:18Modell hast, dann wird das Ganze aber
- 7:20fürchterlich. Wir sprechen danach noch
- 7:22darüber, welche Modelle wo reinpassen.
- 7:25Merkt ihr bis jetzt einfach mal, falls
- 7:27ein Modell komplett in die schnellen
- 7:29Ramp passt, dann wird es fliegen und es
- 7:31gibt Architekturen, wo du die Modelle
- 7:33vernünftig aufteilen kannst. Das Ganze
- 7:35sieht bei Unified Memory anders aus. Bei
- 7:38Unified Memory hast du sozusagen einen
- 7:41Bull an Memory und diese Unified Memory
- 7:44kann ziemlich groß sein und ist im
- 7:45Verhältnis auch günstig. Unified Memory
- 7:48siehst du oft mit 128 GB und hier teilt
- 7:52sich das gesamte System genau diese
- 7:55Memory. Die kann also großteils auch als
- 7:58schneller RAM für Modelle verwendet
- 8:00werden. Natürlich brauchst du gewisse
- 8:02Ressourcen für dein Betriebssystem und
- 8:04so weiter. Vielleicht so 20 bis 30 GB
- 8:09wirst du brauchen, damit dein
- 8:11Betriebssystem gut läuft und alles
- 8:13reibungslos funktioniert. Die anderen
- 8:15100 GB, die kannst du aber verwenden, um
- 8:17Modelle laufen zu lassen. Wie gesagt,
- 8:19diese Unified Memory, die ist generell
- 8:22größer, die ist günstiger, aber etwas
- 8:24langsamer. Dazu kommen danach natürlich
- 8:26noch Sachen wie der Softwareck, eine
- 8:29GPU, gerade von den Vide CUDA, darauf
- 8:31kommen wir später noch mal zu sprechen.
- 8:33Bisher musst du nur wissen, dass ein
- 8:35Gaming PC mit einer GPU den separaten
- 8:39Vram hat und dazu noch die RAM. Du
- 8:41kannst Modelle aufteilen, sie werden
- 8:43erbärmlich langsam, falls es ein
- 8:45Densmodell ist, können aber fliegen,
- 8:47falls sie komplett in die Vieram passen
- 8:49oder falls es ein Mure of Experts Modell
- 8:51ist. Und bei Unified Memory klatschtst
- 8:54du einfach alles in deine gesamten
- 8:55Memory rein, aber du brauchst etwas
- 8:58Speicher für dein Betriebssystem und
- 9:00andere Dinge, die laufen. Falls du dich
- 9:02fragst, welches Modell sollte ich laufen
- 9:04lassen, dann gibt es auch dafür eine
- 9:06Formel. Das da ist die genaue Formel,
- 9:08also Parameter mal Quantisierungspitz
- 9:11geil durch 8* 1,3. Du kannst aber
- 9:14einfach auch nur schauen, wie groß das
- 9:17Modell ist und das mal 1,3 rechnen. Die
- 9:201,3 nimmt man, weil man etwas Overhead
- 9:23braucht, damit du auch etwas für das
- 9:24Kontextfensterplatz hast. Würde in etwa
- 9:27so aussehen, falls du auf Olama kommst
- 9:29und du gehst auf dieses Quen Modell,
- 9:31dann siehst du, dass das 27 Milliarden
- 9:33Parametermodell 18 GB groß ist. Und
- 9:37falls du 18 x 1,3 machst, dann solltest
- 9:41du in etwa 24 GB haben, damit das Modell
- 9:44gut arbeitet und damit du anständige
- 9:46Prompts verarbeiten kannst. Falls du auf
- 9:48das Modell drauf klickst, dann siehst du
- 9:50natürlich auch noch, dass es die großen
- 9:52Quantisierungen gibt und die brauchen
- 9:54natürlich umso mehr Speicher. Ein
- 9:56Shammer Modell in Q4 passt den 8 GB
- 9:59recht gut rein. Ein Quen 38 ein Q4 passt
- 10:02den 24 GB gut rein. Und so kannst du dir
- 10:05das Ganze genauer ansehen. Diese 1,3
- 10:08rechnen wir natürlich dazu, weil das
- 10:10Kontextfenster bzw. der KV Cash noch
- 10:13mehr Rechenleistung frisst, als man sich
- 10:15das Ganze erstmal denkt. Und solltest du
- 10:17mit die Unified Memory arbeiten, dann
- 10:19musst du natürlich auch noch verstehen,
- 10:21dass 10 bis 12 GB für das System
- 10:24verbraucht werden. Erhöst du z.B. das
- 10:26Kontextfenster bei Modellen oder ziehst
- 10:28das Ganze runter, dann siehst du da
- 10:30oben, dass die GPU Auslastung und auch
- 10:32die RAMuslastung natürlich größer und
- 10:34kleiner wird. Außerdem solltest du
- 10:36verstehen, dass du auch den KV Cash
- 10:40quantisieren kannst. Das nennt man Flash
- 10:42attention. Falls man das einschaltet,
- 10:45kannst du auch hier anstatt der vollen
- 10:46Präzision z.B. runter auf Q4 gehen. Das
- 10:49kannst du hier bei beiden machen. Falls
- 10:51du beides auf Q4 packst, dann wirst du
- 10:54relativ viel Rechenleistung sparen. Die
- 10:56Modelle arbeiten schneller, sie arbeiten
- 10:59effizienter, aber das Ganze kann
- 11:01natürlich ab und zu Problemen führen. K
- 11:04steht übrigens für Key Value. Bedeutet,
- 11:06falls du einen langen Chat hast mit
- 11:08deinem Modell, dann werden sich die
- 11:09wichtigsten Dinge immer wieder
- 11:11rausgesucht. Und die Präzision von
- 11:13diesem raussuchen kannst du auch
- 11:14quantisieren, also kleiner machen. Dann
- 11:17wird mit 4 Bit Genauigkeit gerechnet,
- 11:19anstatt mit 16 Bit. Etwas Weiteres, dass
- 11:21man verstehen sollte, ist, dass es einen
- 11:23Unterschied zwischen dichten Modellen
- 11:26gibt und Mixture of Experts Modellen.
- 11:28Quen 3.827B
- 11:31ist z.B. ein dichtes Modell. Das
- 11:33bedeutet, dass bei jedem Token, der
- 11:35generiert wird, das gesamte Modell
- 11:37feuert. Alle 27 von 27 Milliarden
- 11:41Parametern sind aktiv. Dementsprechend
- 11:43muss das ganze Modell in den schnellen
- 11:46RAM liegen, sonst wird es unglaublich
- 11:48langsam. Falls die Hälfte außerhalb vom
- 11:50VRAM liegt, z.B. in den normalem RAM,
- 11:53dann wird das Ganze unglaublich C.
- 11:56Mixture of Experts Modelle sind anders.
- 11:58Deepsig V4 Flash ist z.B. ein Mure of
- 12:01Experts Modell. Da sind nur 13
- 12:03Milliarden Parameter aktiv von den
- 12:05insgesamt 284 Milliarden Parametern und
- 12:09nur die aktiven Parameter brauchen den
- 12:11schnellen Speicher. Kalte Experten, die
- 12:14dürfen in den langsamen RAM warten. Sie
- 12:16müssen nicht in den Vierram sein. Sie
- 12:18könnten teilweise sogar auf der
- 12:20SSD-Karte sein, wobei das noch relativ
- 12:23experimentell ist. Es gibt tatsächlich
- 12:26einige Leute, die es probiert haben, ein
- 12:28125 Milliarden Parametermodell auf 24 GB
- 12:31laufen zu lassen. Z.B. das Quen 38 Flash
- 12:35Next. Das ist ein ziemlich großes Modell
- 12:38und ich habe einige Benchmarks gesehen,
- 12:40wo es Leute geschafft haben bei diesem
- 12:42großen Modell auf ein Kontextfenster von
- 12:44bis zu 250.000 Token hochzugehen und
- 12:48zwar mit einer einzelnen RTX 4090. Die
- 12:52Geschwindigkeit immer noch 21 Token pro
- 12:54Sekunde und über 300 Token beim Prompt
- 12:57einlesen. Falls man das Modell wechselt
- 12:59auf ein dichtes Modell, also nicht ein
- 13:01Mixure of Experts Modell, dann bist du
- 13:03schnell im CPU Offload und du bist nur
- 13:06bei zwei oder drei Token pro Sekunde.
- 13:08Hast du also insgesamt wenig VRAM, aber
- 13:11viel Systemraam, dann versuche Moei
- 13:13Modelle zu verwenden. Sehen wir uns noch
- 13:15mal kurz an, wie das mit der
- 13:17Quantisierung läuft, denn einige
- 13:19Quantisierungen sind super und andere
- 13:21weniger super. Ein volles Modell ist
- 13:23meistens das BF16 Modell, das ist
- 13:26unquantisiert. Wie wir auch vorhin schon
- 13:28gesehen haben, hat das Quen 38 Modell in
- 13:3127B 24 GB in der vollen Präzision. 54
- 13:36natürlich. Falls man runtergeht auf ein
- 13:38Q8 Modell, dann ist das in etwa halb so
- 13:41groß mit 26 GB und man verliert fast 0%
- 13:46Präzision oder Qualität. Falls man
- 13:48runtergeht auf Q4, das ist tatsächlich
- 13:51meistens Standard. Hast du vielleicht
- 13:53auch hier in Olama gesehen, das Modell
- 13:55hat hier z.B. 18 GB und man sieht, dass
- 13:59es eine Q4 Quantisierung ist, dann
- 14:01verliert man auch hier nur 2%. Das ist
- 14:04meistens die richtige Wahl. Man kann
- 14:06viel Größe sparen, verliert aber nur
- 14:08wenig Präzision, falls man danach
- 14:10runtergeht zu spezielleren
- 14:12Quantisierungen, wie z.B. Q3 oder Q2,
- 14:14aber erle spürbaren Präzision. Etwas
- 14:18Interessantes ist auch, dass das 3 Bit
- 14:21manchmal langsamer ist als das 4 Bit,
- 14:23obwohl es weniger Gigabyte groß ist.
- 14:26Besonders falls man CPU offloading
- 14:28macht, bestraft jede Quantisierung die
- 14:30nicht durch zwei teilbar ist. Du musst
- 14:33dir das in etwa so vorstellen, dass die
- 14:35Dinge immer aufgeteilt werden müssen.
- 14:37Besonders falls gewisse Sachen in einen
- 14:39RAM liegen und gewisse Sachen in einen
- 14:41Vierram. Mit einer ungeraden
- 14:43Quantisierung hast du hier einfach mehr
- 14:45Probleme. Und wie gesagt, du kannst auch
- 14:47den KV Cash auf 4 Bit runterbacken, dann
- 14:50sparst du auch anständig Rechenleistung.
- 14:52Falls man sich Hardware anschafft, dann
- 14:54sollte man wissen, dass kein System
- 14:56beides hat. Viel Bandbreite und viel
- 14:59Speicher. Sieht man sich z.B. eine RTX
- 15:025090 an von Nvidia, dann hat die
- 15:04natürlich die größte Bandbreite mit 1792
- 15:08GB pro Sekunde, aber sie hat nur 32 GB
- 15:12VRAM und die Dinger sind ziemlich teuer.
- 15:15Mittlerweile hält man sich eher bei
- 15:16diesen Preisen auf, also so 4300 und das
- 15:20kann sogar hochgehen bis 5000 €. Die
- 15:222000 waren die Starterpreise.
- 15:25Falls man zu einer 6000er Karte
- 15:27hochgeht, die mittlerweile wohl knapp
- 15:29bei 15 000 € liegen sollte, hat man
- 15:32immer noch die gleiche Bandbreite und
- 15:34ca. 96 GB V RAM. Sieht man sich aber das
- 15:37brandneue Mac Studio an, dann hat man
- 15:39immer noch eine sehr, sehr hohe
- 15:41Bandbreite und man kann mit der Memory
- 15:44auch sehr hoch. Im Oktober soll sogar
- 15:47ein Gerät kommen mit 512 GB. Die ganz
- 15:50großen Geräte werden natürlich super
- 15:52teuer werden, aber bei Apple hättest du
- 15:54theoretisch die Möglichkeit auf doch
- 15:56sehr gute Bandbreite und auch viel RAM
- 15:59insgesamt. Du musst verstehen, dass
- 16:02Apple mit Unified Memory arbeitet. Das
- 16:04heißt, die RAM und VRAM, die sind
- 16:07sozusagen miteinander verschweißt, die
- 16:09liegen ganz nahe beieinander, die teilen
- 16:11sich alles und eine separate Grafikkarte
- 16:14hat natürlich nur die VRAM, die super
- 16:16schnell sind, die eine gute Bandbreite
- 16:18haben und du hast die RAM separat
- 16:20laufen. Weitere Karten, die super
- 16:22unterschätzt sind, sind RTX 3090er und
- 16:25zwar gebrauchte. Die bekommt man
- 16:27teilweise für 8 bis 900 € mittlerweile
- 16:30auch oft 1200 €. Die haben immer noch
- 16:33eine super starke Bandbreite und kosten
- 16:36halt nicht so viel wie ein Kleinwagen.
- 16:39Die Mac Studios gehen teilweise auch
- 16:41hoch bis fast 20.000 € und dann gibt es
- 16:44natürlich noch Dinge wie ein McMini, die
- 16:46DGX Spark und auch ein Strix Halo.
- 16:49Lustigerweise muss man fast sagen, dass
- 16:52die Mac Minis für das was sie bieten,
- 16:54gar nicht schlecht sind. Die Strix Halo
- 16:57hat zwar auch anständig RAM, die
- 16:59Bandbreite ist aber etwas schwach und da
- 17:01hat man auch mehr Software Probleme als
- 17:03bei den Macs und besonders im Vergleich
- 17:06zu Nvidia fällt das auf. Hier hast du
- 17:09noch mal eine kleine Grafik, welches
- 17:11Modell in welche Karten oder Systeme
- 17:13reinpassen würde. 24 GB komplette VRAM
- 17:17mit guter Bandbreite sind oft
- 17:18tatsächlich ein gutes Mittelmaß. Wie
- 17:21gesagt ist es bei den Nvidia Grafikfären
- 17:23so, dass man Speicher und Tempo
- 17:25sozusagen getrennt bezahlen muss. Eine
- 17:285090er hat natürlich die absolut beste
- 17:31Bandbreite. Dementsprechend teuer ist
- 17:33sie auch, aber Speicher bleibt immer
- 17:35noch der Engpass, gerade für größere
- 17:37Modelle. Will man bei Nvidia hoch auf 96
- 17:41GB, ist man ziemlich schnell bei einem
- 17:44fünfstelligen Betrag. Will man bei
- 17:46Nvidia viel Speicher für einen Preis,
- 17:49der noch halbwegs okay ist, dann fällt
- 17:51die Bandbreite dramatisch ab, aber man
- 17:54hat immer noch K damit dabei, worüber
- 17:56wir gleich noch sprechen. Generell
- 17:58solltest du auch noch wissen, dass du in
- 17:59wieder Grafikkarten auch zusammenstecken
- 18:02kannst. Die letzte Karte, die du mit NV
- 18:05Link zusammenstecken kannst, ist
- 18:07übrigens die RTX 3090.
- 18:10Auch falls du z.B. 25090er hast, kannst
- 18:13du mit Runtimes wie Lama CPP die Dinge
- 18:16zusammen verwenden. Dann werden die
- 18:17halben Gewichte vom Modelle auf die eine
- 18:19Grafikkarte gepackt und die anderen
- 18:21halben Gewichte auf die andere Karte.
- 18:23Die können also einigermaßen gut
- 18:24zusammenarbeiten, auch ohne Nenk. Erst
- 18:27müssen wir zu den Geräten mit Unified
- 18:29Memory kommen, denn Unified Memory kauft
- 18:32ihr Speicher, den man bei Werfür das
- 18:34Geld einfach nicht bekommt. Bei Unified
- 18:36Memory sind natürlich die Mac Mini Star,
- 18:39die Mac Studios, eine Stak Sa und auch
- 18:42eine Nvida DGX Park. Speicher bei diesen
- 18:45Geräten geht tatsächlich los bei nur 16
- 18:48GB und das geht hoch bis zu 512 GB. Die
- 18:52allermeisten, die ernst machen mit
- 18:53lokaler KI, die legen sich etwas zu mit
- 18:55128 GB. Man sieht aber sofort, dass hier
- 18:59die Bandbreite natürlich deutlich
- 19:01nachlässt. Der einzige Ausreißer nach
- 19:03oben ist das Macstudio M5 Ultra. Solche
- 19:06Kisten sind danach natürlich perfekt,
- 19:08auch für parallelle Agenten. Weil du den
- 19:10ganzen Speicher hast, den das Modell
- 19:12verwenden kann, kannst du mehrere
- 19:14Agenten machen. Das Kontextfenster von
- 19:16allen Agenten kann relativ groß sein,
- 19:19aber dadurch, dass die Bandbreite
- 19:21kleiner ist, werden die Agenten
- 19:23langsamer arbeiten. Etwas, dass du
- 19:25aufberechnen solltest, ist, dass solche
- 19:27MiniCs deutlich weniger Strom fressen
- 19:29werden. Mit 10 € solltest du auskommen
- 19:33mit solch Geräten, wobei du bei einer
- 19:35großen Karte schnell mal auf 50, 60 € im
- 19:38Monat kommen kannst. Wo du aber auch
- 19:40große Abstriche machen wirst, ist
- 19:42wahrscheinlich Freefil mit Cuder. Das
- 19:44heißt, falls du lange Prompts einlesen
- 19:46musst, das ist bei diesen Geräten viel
- 19:48schwächer, da sind einfach die
- 19:50dedizierten Grafikkarten besser. Wir
- 19:52müssen auch noch mal kurz über CUDA
- 19:55sprechen. Erstmal, was ist CUDA? Kuda
- 19:57ist der Softwareestack, der bei Nvidia
- 19:59läuft. Und falls du irgendetwas machst,
- 20:02das mit Fine Tuning zu tun hat, damit
- 20:04Bilder zu erstellen, Videos zu
- 20:06erstellen, falls du irgendwas in Confui
- 20:09machst, dann wirst du um kuda kam drum
- 20:11herumkommen. Warum ist das Ganze so? Die
- 20:13ganzen KI Modelle, die gebaut werden,
- 20:15werden erstmal für Kuda optimiert, weil
- 20:18Kuda ganz viele Bibliotheken hat. Falls
- 20:20ein neues Diffusion Modell trainiert
- 20:22wird, braucht man meistens Byge und ganz
- 20:24ganz viele Bibliotheken und all das ist
- 20:27bei CUDA einfach super gut mit
- 20:29integriert. Deshalb hat man auch so
- 20:31viele Probleme, falls man Confui
- 20:33installieren will auf einen AMD Gerät
- 20:35und auch auf einem Apple Computer hat
- 20:37man da Probleme. Die Software an sich
- 20:39läuft zwar, aber falls du da
- 20:41verschiedene Notes mit einbauen möchtest
- 20:43oder speziellere Sachen machen willst,
- 20:45dann werden die Modelle abschmieren und
- 20:47man hat einfach keine guten Ergebnisse.
- 20:50NVIA hat also den riesengroßen Burgraben
- 20:52Kuda und falls einem ernst ist mit
- 20:54lokaler KI ist Kuda schon cool zu haben.
- 20:57Außer aber man verwendet einen solchen
- 20:59Computer nur um Inference für LMS
- 21:02auszuführen. Weil wir von LM Inference
- 21:05sprechen. Aktuell wäre wahrscheinlich
- 21:07die günstigste Kiste, ein Ryzen AI Max
- 21:10mit einer Strix Halo mit dabei. Man kann
- 21:12hoch auf 128 GB Speicher. Mit Windows
- 21:16drauf hast du danach vielleicht noch so
- 21:1896 GB frei, um Modelle laufen zu lassen.
- 21:21Die Bandbreite ist etwas unter dem DX
- 21:24Spark. Der Preis ist dafür günstiger.
- 21:27Der ist mittlerweile auch etwas höher
- 21:29als hier der obere Raum. Du kannst hier
- 21:31bei den Preisen immer etwas mehr drauf
- 21:32rechnen. Es ist schon ein klein wenig
- 21:34her, dass ich die Präsentation gemacht
- 21:36habe, aber darauf lassen sich wunderbar
- 21:38ziemlich gute Modelle laufen lassen,
- 21:40sogar mit mehreren Agenten parallel.
- 21:42Natürlich leidest du dafür bei prefil,
- 21:45also sobald die Promps verarbeitet
- 21:47werden. Falls du irgendetwas mit Bildern
- 21:49oder Fine Tuning machen willst, wirst du
- 21:52extrem leiden und du musst
- 21:54wahrscheinlich etwas Pflege betreiben.
- 21:56Generell gesprochen läuft ein Quen 3827B
- 22:00Modell bereits auf 8 GB VRAM. Je nach
- 22:02Quantisierung, die du verwendest und ein
- 22:05paar Spezialeinstellungen, kannst du das
- 22:07tatsächlich hinbekommen. Natürlich läuft
- 22:09es deutlich besser, falls du hochgehen
- 22:11kannst auf 16 GB. Bevor du irgendetwas
- 22:14nachkaufst, solltest du auch versuchen,
- 22:16das Tempo erstmal zu erhöhen. Teilweise
- 22:19kann es helfen, die Runtime zu wechseln.
- 22:22Je nachdem, was du machst, kann es
- 22:24passieren, dass Olarama 21 Token pro
- 22:27Sekunde liefert und VLM das Vierfache,
- 22:31das kommt vor allem vor, falls du das
- 22:34Modell für viele Leute bereitstellen
- 22:36musst, also falls du 50, 60 Anfragen
- 22:39gleichzeitig an die Maschine schickst.
- 22:41Danneben solltest du spekulatives
- 22:43Decoding aktivieren. Das siehst du auch
- 22:46hier direkt in LM Studio. MTP steht für
- 22:49Multien Prediction. Das solltest du also
- 22:52einschalten und bei dem Max Draft Token
- 22:55spielst du zwischen 2 und 3 rum. Das
- 22:58bedeutet im Endeffekt, dass drei Token
- 23:00zugleich errechnet werden und danach
- 23:02kontrolliert ein anderes Modell noch mal
- 23:04rüber. Auch das Kontextfenster solltest
- 23:07du quantisieren, das habe ich dir vorhin
- 23:09schon gezeigt. Das sollte das Ganze auch
- 23:11noch mal schneller machen. Und
- 23:13vielleicht versuchst du eine native vier
- 23:15Bit Quantisierung. Falls du ein NFP4
- 23:18findest, sollte das generell gesprochen
- 23:21schneller laufen, besonders über VLM.
- 23:23Versuch dir erstmal Gedanken zu machen,
- 23:25wie große Modelle du laufen lassen
- 23:27möchtest. Und falls du bereits schon 8
- 23:29GB schnellen RAM hast, der frei ist auf
- 23:32deiner Maschine, dann kannst du mit
- 23:34Modellen spielen, die entweder wenig
- 23:36Parameter haben oder aber die Mixture of
- 23:38Experts Modelle sind und den Rest kannst
- 23:40du in die RAM auslagern. Falls du 16 GB
- 23:43schnellen Speicher hast, dann kannst du
- 23:45ein Quen 38 in 27B probieren. Da kannst
- 23:49du gut und gerne auf 40 Token pro
- 23:51Sekunde kommen mit den richtigen
- 23:52Quantisierungen und Einstellungen. Falls
- 23:54du einen kompletten PC hast mit Richtung
- 23:5724 GB V RAM, z.B. eine 3090er, dann
- 24:01kannst du das Kontextfenster weiter
- 24:03hochmachen und vielleicht noch ein paar
- 24:05Token mehr erwarten. Falls du eine Strix
- 24:07Halo oder ein ähnliches Gerät hast mit
- 24:09128 GB Unified Memory, dann kannst du
- 24:13ziemlich große Modelle laufen lassen,
- 24:15auch mehrere Agenten. Das Ganze läuft
- 24:17schnell und leise und einfach.
- 24:19Allerdings wird es relativ langsam sein.
- 24:21Mit mehr Nvidia Grafikkarten wirst du
- 24:24bei allem Freude haben. Bild, Video,
- 24:26Fine Tuning, was es auch immer ist. Und
- 24:29mit einem großen Macstudio wirst du vor
- 24:31allem bei LM Inference zufrieden sein.
- 24:34Die Reihenfolge ist in meinen Augen
- 24:35immer sich zu überlegen, was man machen
- 24:37möchte, welches Modell man braucht, wie
- 24:39viel Kontext, wie viele Instanzen. Man
- 24:42könnte sich den Speicher ausrechnen, die
- 24:44Bandbreite gegen das Zeittempo prüfen
- 24:47und danach erst die Preise vergleichen.
- 24:50Samtstrom, Lautstärke und Aufrübarkeit.
- 24:53Etwas ganz Wichtiges, das noch dazu
- 24:55kommt, ist, falls du ein Gerät kaufst
- 24:57mit Unified Memory, also irgendein
- 24:59Miniuter, dann kannst du niemals
- 25:02irgendwas ausrüsten. Hier ist RAM und
- 25:04Viram sozusagen verlötet. Falls du einen
- 25:06großen Standpzel hast, kannst du
- 25:08natürlich die Grafikkarte austauschen
- 25:10oder eine neue Grafikkarte dazu packen,
- 25:13die RAM ausweiten, da bist du viel
- 25:15flexibler. Kommen wir noch mal kurz zu
- 25:17diesem Prompt. Den werde ich unten
- 25:19verlinken. Wie gesagt, den kannst du
- 25:20kostenlos runterladen. Dieser Prompt
- 25:23wird dir dabei helfen, die richtige
- 25:25Hardware für dich auszusuchen oder aber
- 25:28die richtigen Modelle auf der Hardware,
- 25:30die du bereits hast. Es ist auch genau
- 25:32gezeigt, wie du ihn verwendest. Im
- 25:33Groben musst du nur den Prompt von hier
- 25:35weg kopieren bis ganz unten, also bis
- 25:38hier. Und du schmeißt das in einen
- 25:40Coding Agent rein. Er wird übrigens
- 25:42nicht die Rolle von einem Verkäufer
- 25:44annehmen, sondern eher die Rolle. von
- 25:46einem Kollegen, der dich einfach etwas
- 25:48berätt. Erstmal wird deine bestehende
- 25:50Hardware geprüft. Danach werden ganz,
- 25:52ganz viele Fragen gefragt und du
- 25:54bekommst hoffentlich die richtige
- 25:56Antwort zurück. Je nachdem, was du alles
- 25:58laufen lassen möchtest, kommt natürlich
- 26:00unterschiedliche Hardware in Frage. Also
- 26:02probier den Prompt gerne aus. Den Prompt
- 26:04findest du in der Community, da
- 26:05schreibst du rein Hardware für lokale
- 26:09KI. Du schickst da auf suchen und dort
- 26:11wird der Prompt im Post verlinkt sein.
- 26:13Das ist wie gesagt in der kostenlosen
- 26:15Community. Neben der kostenlosen
- 26:17Community habe ich natürlich noch die
- 26:18Premium Community. Da wird der Prompt
- 26:20natürlich auch geteilt und da gibt es
- 26:22auch noch persönliche Unterstützung.
- 26:24Hier ist generell etwas mehr los. Es
- 26:26gibt mehr Aktivität. Im Classroom haben
- 26:28wir auch dedizierte Kurse, falls du die
- 26:30Sachen wirklich detailliert lernen
- 26:31möchtest mit Dingen, die aufeinander
- 26:33ausbauen. Und wir haben natürlich immer
- 26:36wieder Challenges laufen und treffen uns
- 26:38auch regelmäßig in Live Calls und
- 26:40quatschen über solche und ähnliche
- 26:41Sachen. Ich würde mich natürlich auch
- 26:43freuen, dich dort zu begrüßen und
- 26:45ansonsten lad dir gerne einfach nur den
- 26:47Prompt runter. Und als weiteren kleinen
- 26:49Tipp solltest du dir vielleicht was ja
- 26:51mal ansehen und vielleicht auch Runpot.
- 26:53Generell kannst du hier Grafikkarten
- 26:55mieten, also bevor du einen 5090er
- 26:58kaufst, miete einfach mal für ein paar
- 27:00Stunden, da bezahlst du nur wenige Euro
- 27:02und du weißt im Endeffekt, was auf dich
- 27:04zukommt, falls du dir selbst eine solche
- 27:06Karte kaufst, dann hast du keine bösen
- 27:08Überraschungen. Hier findest du so gut
- 27:09wie alle Karten, also probier einfach
- 27:12mal eine aus, bevor du das ganze Geld
- 27:14ausgibst. Falls du dir erstmal nur drei
- 27:17Sätze merken möchtest, dann merkt dir
- 27:19bitte, dass der Speicher entscheidet, ob
- 27:22ein Modell passt, also ob die Gewichte
- 27:25der KW Cash, der Buffer und das
- 27:27Betriebssystem alle zusammen
- 27:28hineinpassen. Das ist das
- 27:30allerwichtigste, die RAM der Speicher an
- 27:33sich. Danach musst du dir die Bandbreite
- 27:36vom Speicher ansehen und du kannst gerne
- 27:38noch mal zurück zur Rechnung gehen,
- 27:40damit du in etwa abschätzen kannst, wie
- 27:42schnell die Dinger bei dir generieren
- 27:43werden. Was du dir auch noch merken
- 27:45solltest, ist, dass die Software doch
- 27:48ziemlich oft wichtig ist. Versuch mal
- 27:50die Runtime zu wechseln oder Multien
- 27:53Prediction einzuschalten oder KV Cash
- 27:55Quantisierung zu aktivieren. Vielleicht
- 27:57kannst du selbst damit gut die
- 27:59Performance verbessern. Frag am besten
- 28:02nicht, welche Hardware die beste ist.
- 28:04Frag, welches Problem du lösen musst.
- 28:07Ich denke, die entscheidendste Frage
- 28:08ist: Willst du nur Textgenerierung
- 28:11machen oder auch Bild, Video, Musik und
- 28:13Fine Tuning? Falls du alles machen
- 28:16möchtest und wirklich tief in KI
- 28:17eintauchen willst, dann sind den
- 28:19Videograf Grafikkarten mit viel Viram
- 28:21einfach das Beste, das geht. Du hast
- 28:24Kuda, Kuda ist der Standard. Da hast du
- 28:26einfach Freude bei allen Modalitäten. Du
- 28:29hast die höchste Bandbreite, du hast den
- 28:32schnellsten Prefill, also werden auch
- 28:34lange Prompts super schnell verarbeitet,
- 28:37aber der Speicher sehr natürlich teuer.
- 28:39Falls du sagst, du willst nur Text
- 28:41verarbeiten, dafür aber viel davon, dann
- 28:43ist dein Mini PC mit viel gemeinsamen
- 28:46Speicher die vernünftigere Lösung, weil
- 28:48es einfach günstiger ist. Außerdem sind
- 28:50die Dinge leise, sparsam und
- 28:52dauerlaufig. Das ist ein kompletter
- 28:55Server, den du dir hinstellst. Der
- 28:57Nachteil ist, wie gesagt kein Kuda und
- 28:59der Freefill ist etwas langsam, aber
- 29:01dafür sind die Mini PCs wie gesagt
- 29:04günstiger. Ein Mac bietet guten Wert für
- 29:06sein Geld. Bei Nvidia kannst du
- 29:08wahrscheinlich die Preisleiter
- 29:09hochgeben, bis der Preis für dich keppt.
- 29:12Also Stufe 1 für guten Einstieg, wo man
- 29:15wirklich viel Viram bekommt, ist eine
- 29:17gebrauchte RTX 3090. mittlerweile eher
- 29:201000 € und minimal mehr, aber die hat
- 29:23bereits 24 GB V RAM, hat eine gute
- 29:26Bandbreite und frisst nicht allzu viel
- 29:28Watt. Außerdem kannst du es sogar mit
- 29:30Nink erweitern. Du könntest sogar zwei
- 29:33davon kaufen, dann hast du fast 50 GB
- 29:35VRAM. Falls du High-End Consumer Karte
- 29:38gehen willst mit nur einer Karte, ist es
- 29:40wahrscheinlich die RTX 5090 und die RTX
- 29:43Pro 6000, die ist wahrscheinlich nur
- 29:45relevant, falls du das eher in einem
- 29:47Unternehmen einsetzen musst. Ich
- 29:49bezweifle, dass du das als Privatperson
- 29:51kaufen willst. Dazu solltest du dir
- 29:53natürlich noch RAM zulegen und auch beim
- 29:56RAM zählt danach noch die Bandbreite.
- 29:59Ein DDR5 6000 RAM liegt in etwa beim
- 30:02doppelten wie ein Single Channel RAM.
- 30:05Falls du dich dafür entscheidest mehrere
- 30:073090 zusammenzustöpseln, solltest du
- 30:09auch noch wissen, dass NVLink nicht auf
- 30:11einmal magisch eine 48 GB Karte macht.
- 30:15Das Modell muss später weiter aufgeteilt
- 30:17werden, falls du das auf die
- 30:19Grafikkarten packst. Und bei einer 5090
- 30:22solltest du dir vielleicht auch noch
- 30:24kurz ansehen, ob es in einem aktuellen
- 30:26PC überhaupt noch reinpasst. Sind
- 30:28relativ groß. Falls du dich für Weg
- 30:30beentscheidest und eher den Speicherweg
- 30:33gehst, dann ist wahrscheinlich ein Max
- 30:35Studio M5 Max relativ gut für das, was
- 30:39du aktuell bekommst. Das einzige was
- 30:41fehlt ist Kuda. Du hast aber gute
- 30:43Bandbreite. Es verbraucht nicht allzu
- 30:45viel Watt und die Preise sind noch
- 30:47einigermaßen okay. Ich weiß, die Preise
- 30:49sind überall gestiegen, aber im
- 30:50Vergleich zu den anderen ist Apple
- 30:52aktuell tatsächlich okay. Was mich
- 30:54wundert. Die Strix Halo ist vielleicht
- 30:56auch okay. Ich persönlich würde da aber
- 30:58tatsächlich Apple bevorzugen, denke ich.
- 31:01Und die DGX Bark ist in meinen Augen
- 31:04deutlich hinterher zu den aktuellen Mac
- 31:07Studios, auch bei den Mac Mines
- 31:09hinterher. Der einzige Vorteil ist hier
- 31:11tatsächlich Kuda, also die DJX Park, die
- 31:14hat weder eine super gute Bandbreite,
- 31:17noch ist sie günstig. Einzige Vorteil
- 31:20ist hier tatsächlich Kuda, also für die
- 31:23DJXPK,
- 31:24ich denke, da gibt es relativ wenige
- 31:27Anwender. Da würde ich tatsächlich
- 31:293090er Karten mit anständig separaten
- 31:32Rampe bevorzugen und auf Mure of Experts
- 31:35Modelle ausweichen. Dann funktioniert
- 31:37auch die Fusion etwas besser und auch
- 31:39Fine Tuning. Ja, die DJX Park ist
- 31:42aktuell im komischen Gewässer. Schreib
- 31:45in die Kommentare, was du für Hardware
- 31:47hast. Hast du weitere Fragen? Ich weiß,
- 31:49das Thema ist relativ komplex. Versucht
- 31:51ihr einfach drei Dinge zu merken. Die
- 31:53RAM an sich entscheiden, ob das Modell
- 31:56passt. Die Bandbreite entscheidet, wie
- 31:59schnell das Modell läuft. Zusätzlich
- 32:01brauchst du etwas Buffer für
- 32:03Betriebssystem, für den KV Cash. Und
- 32:06falls du mehrere Agenten parallel laufen
- 32:08lassen willst, dann braucht auch jeder
- 32:10separate Agenten den KV Cash. Deshalb
- 32:12frisst man so schnell so viel Speicher.
- 32:15Das absolut schnellste und beste ist so
- 32:17viel Viram von Nvidia wie möglich wegen
- 32:20CUDA. Das wird aber auch super schnell,
- 32:22super teuer. Falls es um alle LMS geht,
- 32:24hast du auch die Möglichkeit nicht das
- 32:26gesamte Modell in den VRAM zu lagern,
- 32:28sondern einen Teil davon in den RAM und
- 32:30nur die aktiven Experten in den VRAM,
- 32:33dann kannst du immer noch schnell
- 32:34arbeiten. Und falls du eine Mini PC hast
- 32:36mit zusammengeschweißten RAM und Viram,
- 32:38hast du generell mehr Memory, du
- 32:40bezahlst aber mit geringerer Bandbreite.
- 32:43Falls genau das Thema interessiert, lass
- 32:45mir gerne ein Abo da. Ich werde die
- 32:47nächste Zeit wahrscheinlich noch ein
- 32:49paar Videos veröffentlichen, wie man
- 32:50auch auf kleine Hardware Modelle so
- 32:52optimiert, dass sie gut laufen. Ich
- 32:54weiß, dieses Video war mehr theoretisch.
- 32:56Ich wollte aber mal ein paar Gedanken zu
- 32:59Hardwrel werden. Und übrigens, falls
- 33:00dich das Thema im Detail interessiert,
- 33:02schau auch gerne mal in der Premium
- 33:04Community vorbei. Da sind wir ganz viele
- 33:06Leute, wir quatschen ständig. Im
- 33:08Classroom haben wir detaillierte Kurse,
- 33:10die alles dur machen, natürlich auch
- 33:12lokale KI und wir treffen uns regelmäßig
- 33:14in Live Calls zum Quatschen. Wir sehen
- 33:16uns spätestens im nächsten Video.
About this transcript
This page contains the full transcript of Hardware für Lokale KI by AI mit Arnie, generated from the public captions YouTube serves with the video. The transcript has 5,351 words across 868 segments, with the original timestamps preserved so you can click any line to jump to that moment in the embedded player.
What you can do with it
Use the transcript to take notes, quote the speaker, build a study guide, generate a summary with ChatGPT or Claude via the YouTube Summary tool, or export it as a timed subtitle file with YouTube to SRT. You can also re-open it in the transcriber to translate the transcript into 100+ languages.
Free YouTube transcript tool
YouTube2Text is a free YouTube transcript generator — no signup, no daily limit. Paste any YouTube link and get the full transcript instantly, with timestamps, click-to-jump, translation to 100+ languages, AI prompts for ChatGPT, Claude, and Gemini, and exports to TXT, SRT, VTT, or Markdown.