LLMはどう知識を記憶しているか | Chapter 7, 深層学習 — Transcript
Full transcript
- 0:00大規模言語モデルに例えばマイケル
- 0:02ジョーダンがするスポーツはという文を
- 0:04与えるとモデルはバスケットボールが次に
- 0:06来ると正しく予測することができますこれ
- 0:09はつまりモデルのどこかに何千おの
- 0:12パラメーターの中に特定の人物と特定の
- 0:14スポーツについての知識が保存されている
- 0:17ということになりますねそして一般にこう
- 0:20したモデルを触ったことがある方ならご
- 0:22存知だと思いますがモデルはたくさんの
- 0:24ことを記憶していますさてモデルはどの
- 0:26ようにこれらの知識を扱っているの
- 0:28でしょうかどこにした知識があるん
- 0:30でしょう
- 0:31[音楽]
- 0:34か昨年12月GoogleDEEP
- 0:37mindの研究者たちはこの疑問について
- 0:40投稿していましたそこではアスリートと
- 0:42そのスポーツを対応させるという事例を
- 0:44扱っていました事実や知識がどのように
- 0:47管理されているかの完全な仕組みの解明に
- 0:49は至らなかったものの興味深い結果が得
- 0:51られましたざっくり言うとこうした知識は
- 0:54ネットワークの特定の部分多層
- 0:56パーセプトロン略してMLPと呼ばれる
- 0:59部分に保存されているようでした前回の
- 1:02動画まで私たちは大規模言語モデルや他の
- 1:05多くのAIの基礎となるアーキテクチャ
- 1:08トランスフォーマーについて詳しく見てき
- 1:10ましたね前回の動画ではアテンションと
- 1:12いう部分に注目していました今回は
- 1:15ネットワークの残りの大部分を占める多層
- 1:17パーセプトロンにおいて何が起こっている
- 1:19のか見ていきたいと思いますここでの計算
- 1:23はアテンションと比べると単純です基本的
- 1:25には行列の計算と他のあるものの
- 1:28組み合わせでできています
- 1:30しかしこうした計算を解釈することは
- 1:32極めて難しいものになり
- 1:35ます今回のゴールはこの計算を順に追って
- 1:38理解することですこうしたブロックが
- 1:41少なくとも原理的に知識を保存できると
- 1:43いうことを具体例を見ながら考えていき
- 1:45たいと思います具体的にはマイケル
- 1:48ジョーダンはバスケットボール選手である
- 1:50という知識に注目しますこの構成は
- 1:53グラント
- 1:58サンダーソンファームズ皆さんが前回まで
- 2:00の2つのチャプターをご覧になったか
- 2:02トランスフォーマーについての基本的な
- 2:04理解がある前提で進めますが念のため手
- 2:07身近におさいをしておきましょう
- 2:09かモデルはテキストの一部を受け取って次
- 2:12に何が続くかを予測し
- 2:14ます入力テキストはまずトークンと呼ば
- 2:17れる小さな部分単語やそれよりも小さい
- 2:20部分に分割されそれぞれのトークンが高
- 2:23次元のベクトル長い数のリストに対応して
- 2:25い
- 2:26ますこの1続きのベクトルは繰り返し2つ
- 2:30の演算を通ることになりますアテンション
- 2:32ではベクトル同士が情報を渡し合います
- 2:36それから今回見ていく多層パーセプトロン
- 2:38そしてその間には正規化のステップがあり
- 2:41ます1続きのベクトルがこうして両方の
- 2:44ブロックを繰り返し通ってきた後それぞれ
- 2:46のベクトルはコンテキストつまり入力に
- 2:49ある他の単語それから学習を通して重みに
- 2:52保存された一般的な知識から情報を吸収し
- 2:56ます最後にはここから次のトークンが何か
- 2:59推測できるようになってい
- 3:01ます思い出して欲しい重要な考え方はこれ
- 3:05らのベクトルは非常に高次元の空間にあっ
- 3:07てこの空間の異なる方向がある意味異なる
- 3:10意味を表しているということでし
- 3:15た例えば女性という単語の埋め込みから
- 3:18男性の埋め込みを引き算してそれを他の
- 3:21男性の名刺例えば叔父に足すと対応する
- 3:24女性の名刺葉に非常に近くなるんでし
- 3:28たある意味の特定の方向が性別の情報を
- 3:31持っていることになり
- 3:33ますこのようにこの高次元空間の他の
- 3:36異なる方向もモデルが表したい他の特徴に
- 3:39対応するということ
- 3:42ですトランスフォーマーではこれらの
- 3:45ベクトルは1つの単語の意味を超えた情報
- 3:48を持つことになりますネットワークを通っ
- 3:50ていくとトークンは周りのコンテキスト
- 3:52全てとモデルの知識からずっと豊かな意味
- 3:55を吸収し
- 3:57ます最後には次に来るものを足できないと
- 4:00いけないのでそれぞれのベクトルは1つの
- 4:02単語よりもずっとずっと多い情報を持つ
- 4:04ことになり
- 4:05ますすでにアテンションブロックが
- 4:08コンテキストをどう活用するかを見てき
- 4:10ましたが実はモデルのパラメーターの大
- 4:12多数はこのMLPブロックにありますこの
- 4:16部分が知識を保存する容量を追加している
- 4:19と考えてみても良いかもしれませんさて
- 4:21今回はマイケルジョーダンは
- 4:23バスケットボール選手であるという知識が
- 4:25どう扱われるかの例を見ていくんでし
- 4:28たここでこの高次元空間についていくつか
- 4:31の過程をしますまずある方向がマイケルと
- 4:34いう名前を表してい
- 4:36てそれとほとんど垂直な方向に苗字の上段
- 4:40があっ
- 4:42てそして3つ目の方向にバスケットボール
- 4:45があるということ
- 4:46[音楽]
- 4:48です例えばこのネットワークから処理中の
- 4:51ベクトルを1つ引き抜いて持ってきて見て
- 4:53みることにしますねこのベクトルと
- 4:56マイケルという名前の方向の内積が1なら
- 4:59このベクトルはこの名前の情報を持って
- 5:01いるという風に考え
- 5:04ますそれ以外の場合内積が0や負の値で
- 5:08ある時はベクトルがその方向を向いてい
- 5:11ないことになります簡単にするため内積が
- 5:141より大きい時は何なんだという質問は
- 5:16ここでは考えないことにします同様に他の
- 5:19方向との内積はこのベクトルが上段という
- 5:22苗字
- 5:24やバスケットボールの情報を持つかどうか
- 5:27を表しますなので例えばベクトルでフル
- 5:29ネームのマイケルジョーダンを表したかっ
- 5:31たらこれら両方の方向との内積が1になっ
- 5:34ていないといけないことになります
- 5:36マイケルジョーダンというテキストは2つ
- 5:38のトークンからなるのでこの前の
- 5:40アテンションブロックで2つ目のベクトル
- 5:42に両方の名前が表せるようにうまく情報が
- 5:45渡されたという過程もしないといけません
- 5:49ねではこれらの過程の元で今回の内容に
- 5:52入っていきましょう多層パーセプトロンで
- 5:54は何が起こっているのでしょうか
- 5:57[音楽]
- 6:001つきのベクトルがこのブロックの中を
- 6:02流れていくと考えますおさいですが
- 6:04それぞれのベクトルは元々入力のトークに
- 6:07対応したものでしたここではそれぞれの
- 6:09ベクトルにいくつかの計算をしていきます
- 6:12内容はすぐ後で見ていき
- 6:14[音楽]
- 6:15ましょうそして最後に来ると同じ次元数の
- 6:18別のベクトルが得られますこのベクトルが
- 6:20元々ブロックに入ってきたベクトルに加え
- 6:23られてこの我がブロックから出てくる結果
- 6:25になりますこれらの計算は1つ好きの
- 6:28ベクトル入力の遠君に対応する1つ1つに
- 6:31ついて並列で処理します特にこのステップ
- 6:34ではベクトルはお互いに情報を交換せずに
- 6:36ある意味1人1人自分のことをしている
- 6:38ような感じですということはこのブロック
- 6:40の中でこうしたベクトルのうちの1つに何
- 6:43が起こっているかを理解すれば全ての
- 6:45ベクトルについて何が起こっているか理解
- 6:47できるということになりますこのブロック
- 6:50がマイケルジョーダンはバスケットボール
- 6:52選手であるという知識を持つというのは
- 6:54どういうことかと言うとあるベクトルが
- 6:56入ってきて名前がマイケルで苗字が冗談と
- 6:59いう情報を持っていたらこれらの計算は
- 7:01バスケットボールの方向を含む何かしらの
- 7:03ベクトルを作り出してこれが元のベクトル
- 7:06に足されることになるということですさて
- 7:08最初のステップはベクトルと巨大な行列の
- 7:11掛け算の見た目をしていますま深層学習
- 7:13ですから驚きはないですねこの行列はこれ
- 7:16まで見てきた他の行列のようにデータから
- 7:18学習されるモデルのパラメーターでできて
- 7:21いますモデルの振舞を決め調整するつまみ
- 7:24やダイヤルのように考えることができます
- 7:26ねさて行列の掛け算はこのように考える
- 7:29こともできます行列のそれぞれの行をそれ
- 7:32自体ベクトルとして考えてこれらの行と
- 7:34処理されるベクトルの内積をたくさん取っ
- 7:37ていきます処理されるベクトルはここでは
- 7:39Eで表しています例えばこの最初の行が
- 7:43マイケルという名前の方向があるとして
- 7:44これに等しかったとしましょうすると出力
- 7:48の最初の成分この内積はもしこのベクトル
- 7:51がマイケルという名前の情報を持ってい
- 7:53たら1になってそうでなければ0や負の値
- 7:56になりますさらにこの最初の行がマイケル
- 7:59上段の方向だったらどうなるでしょう
- 8:03か分かりやすくM+Jと書くことにし
- 8:07[音楽]
- 8:08ますするとこの埋め込みEとの内積は綺麗
- 8:12に分配されてM.E+J.Eのようになり
- 8:16ますすると最終的な値はベクトルがフル
- 8:19ネームのマイケルジダの情報を持ってい
- 8:21たら2になってそうでなければ1やより
- 8:24小さな値になります他の全ての行も並行し
- 8:28てある意味質問を聞いているように処理さ
- 8:31れるベクトルの様々な特徴を調べている
- 8:33ように考えられ
- 8:37ますまたここでは出力にさらに別の
- 8:40ベクトルを足すことも多いですこれも
- 8:42データから学習したモデルのパラメーター
- 8:44ですねこのもう1つのベクトルはバイアス
- 8:46と言いますこの例ではこのバイアスの1つ
- 8:49目の成分の値が-1であると想像して
- 8:52くださいすると最終的な出力は対応する
- 8:55内積の値-1になりますもちろんなぜ
- 8:58そんなことするのかと思うかもしれません
- 9:01ここでベクトルがフルネームのマイケル
- 9:03ジョーダンの情報を持っている時にのみ値
- 9:05が正になってその他の場合0や不だと
- 9:08嬉しいんですがすぐにその理由は説明し
- 9:10ますねこの行列の行の数はある意味質問の
- 9:13数みたいな感じですが私たちが例にしてき
- 9:16たGPT3の場合には5万よりやや少ない
- 9:19くらいですこれは埋め込み空間の次元の数
- 9:22のちょうど4倍になっていますまこれは
- 9:24単なるデザインチョイスですね多くしても
- 9:26少なくしても良いですが整数倍だと
- 9:28ハードウェアに優しいことが多いみたい
- 9:30ですこの行列はたくさんの重みでより高い
- 9:33次元の空間にベクトルを移すのでWupと
- 9:36表記することにします処理されるベクトル
- 9:38はEそれからこのバイアスのベクトルはB
- 9:41アと呼ぶことにしてこのように下の図に
- 9:43書いておき
- 9:45ましょうさてここまでの問題点として計算
- 9:48が純粋に線形なのに対して言語はとても非
- 9:51線形なプロセスであるということがあり
- 9:53ます我々が測っている成分がマイケル+
- 9:56ジダンについて高い値ならこれはマイケル
- 9:58フェルとかアレクシスタスジダとかについ
- 10:01ても少なからず反応することになります
- 10:04しかしこれらは実際には概念的に無関係
- 10:06ですねここで欲しいのはフルネームについ
- 10:09ての単純なイエスかノかの答えですそこで
- 10:12次のステップではこの大きな処理中の
- 10:14ベクトルを非常に単純な非線形関数に通し
- 10:17ますこの関数でよく選ばれるのは負の値を
- 10:21全部0にして正の値をそのまま変えずに
- 10:23残すという関数ですこのとっても単純な
- 10:27関数はレクティファイリニアユニットと
- 10:29略してレルというそんなに単純じゃない
- 10:31名前がついていますグラフの見た目は
- 10:33こんな感じです先ほどの例を思い出すと
- 10:36この処理中のベクトルの最初の成分はフル
- 10:39ネームがマイケルジョーダンの時のみ1で
- 10:41そうでなければ0や2の値でしたこれを
- 10:44レルに通すと0Yoの値が全部
- 10:46クリッピングされて0になって綺麗な値が
- 10:49得られますなのでこの出力はフルネームが
- 10:51マイケルジョーダンなら1そうでなければ
- 10:540になります言い換えるとこれはアンド
- 10:56ゲートのフマを真似しています
- 11:01よくレルの代わりにこれを少し滑らかにし
- 11:03たジェルという関数の方が使われますが
- 11:06今回私たちが見ていくにはレルを使った方
- 11:08が分かりやすいでしょうまた
- 11:10トランスフォーマーのニューロンというの
- 11:12はこれらの値のことを言い
- 11:15ます一般的なニューラルネットワークの図
- 11:18で丸がたくさん層になって層をつなげる線
- 11:21がたくさん書いてあるものがありますね
- 11:23このシリーズでもありましたこれはこの
- 11:25線形の行列の席のステップとその後のレル
- 11:28のような単純な高ごとの非線形関数の処理
- 11:31を表現していますこのニューロンが正の値
- 11:35ならアクティブ活性であるといい0なら不
- 11:38活性であると言い
- 11:40ます次のステップは1つ目のステップに似
- 11:43ています巨大な行列と掛け算してバイアス
- 11:46を加え
- 11:47ます今回は出力の次元の数は埋め込み空間
- 11:51のサイズに戻ってきますなのでこれを
- 11:53ダウンプロジェクション行列と呼ぶことに
- 11:55し
- 11:56ましょうそして今度は行ごとに考えるより
- 11:59も列ごとに考えた方が分かりやすいです
- 12:03行列の掛け算のもう1つの考え方は行列を
- 12:06列ごとに取ってきてベクトルの対応する
- 12:08成分と掛け算してこれらの項を全て
- 12:10足し合わせ
- 12:17ますなぜこう考えると良いかと言うとここ
- 12:20では列は埋め込み空間と同じ次元数を持っ
- 12:23ているのでこれらの列を空間の方向として
- 12:26考えることができるからです例えばモデル
- 12:29がこの最初の列を我々が今存在を仮定して
- 12:32いるバスケットボールの方向として学習し
- 12:34たとしましょうするとこの最初の位置に
- 12:37対応したニューロンが活性の時この列が
- 12:39計算結果に足されることになりますもし
- 12:43このニューロンが不活性ならつまり値が0
- 12:45ならこの部分は何の影響も及ぼさないこと
- 12:48になりますそしてこれはバスケットボール
- 12:50以外にもモデルがフルネームのマイケル
- 12:52ジダに関連付けたい特徴を表すことができ
- 12:57ます同時にこの行列の他のそれぞれの列も
- 13:01対応するニューロンが活性の時計算結果に
- 13:03何が足されるかを表してい
- 13:07ますここでバイアスがある場合は
- 13:10ニューロンの値に関わらず毎回足している
- 13:12ものだと考えることができ
- 13:14ますこれが具体的に何をしているのかは
- 13:17パラメーターからなる他の部品同様解釈が
- 13:20難しいですもしかしたらネットワークが
- 13:22何かしらの情報管理をしているのかもしれ
- 13:25ませんが今は無視して大丈夫です今度も
- 13:27書き方をもう少し簡単ににするためにこの
- 13:30大きな行列をWダウンバイアのベクトルを
- 13:33Bダウンと書いて図に戻しておきましょう
- 13:36先ほど見たようにこの計算結果は初め
- 13:39ブロックに入ってきた対応するベクトルに
- 13:41足されこれが最終的な計算結果になり
- 13:45ます例えば入力のベクトルが名前の
- 13:48マイケルと苗字のジョーダンの両方の情報
- 13:50を持っていたらこの一連の計算でアン
- 13:54ゲートがオンになってバスケットボールの
- 13:56情報が足さ
- 13:57れ出力はこれら全ての情報を持った
- 14:00ベクトルになりますそしてこれはたくさん
- 14:03の並列の処理の1つでしたねGPT3の数
- 14:06で言うとこのブロックには5万ニューロン
- 14:08だけでなく5万か入力のトークンの数だけ
- 14:12のニューロンがあることになり
- 14:15[音楽]
- 14:19ますというわけでこれが全体の計算です
- 14:23それぞれバイアスが足される2つの行列
- 14:25計算と単純なクリッピングの関数ですね
- 14:28シリーズの最初のの動画を見た方は今見た
- 14:30ものが以前お話ししたニューラル
- 14:32ネットワークの最も基本的な形だとお
- 14:34気づきでしょう今回トランスフォーマーと
- 14:37大規模言語モデルに関してはこれは大きな
- 14:39アーキテクチャの1部分ですこれが具体的
- 14:43に何をしているのかのどんな解釈も高次元
- 14:45の埋め込み空間のベクトルで情報を表す
- 14:48ことと深く関係してい
- 14:51ますここまでがメインの内容ですがここ
- 14:54からは2点だけ少し戻って確認していき
- 14:57たいと思います1つ目はこれまでしてきた
- 14:59パラメータ数のカウントで2つ目は高次元
- 15:02についての重要な事実
- 15:03[音楽]
- 15:05ですここまでGPT3のパラメーターの数
- 15:08を数えてきましたから手近にこれを完成さ
- 15:11せ
- 15:12ましょう先ほど見た通りこのWup行列は
- 15:15およそ5万の行があってそれぞれの行の長
- 15:18さは埋め込み空間の次元数GPT3の場合
- 15:221228ですこれらを掛け算してこの1つ
- 15:26の行列で合計6億400万のパターが使わ
- 15:29れていますWダウンの行列も同じ数の
- 15:32パラメーターが横に倒したような形で使わ
- 15:35れていますなので合わせて12億の
- 15:37パラメーターが使われていますバイアスの
- 15:40ベクトルに使われるパラメーターの数は
- 15:42全体からすると大した割合ではないのでお
- 15:44見せする必要もないでしょうGPT3では
- 15:47埋め込みのベクトルは1つではなく96の
- 15:50異なる多層パーセプトロンブロックを通り
- 15:52ますなのでこれらのブロックの
- 15:54パラメーター数は全部で110億ほどに
- 15:57なります
- 15:59これは大体ネットワーク全体の
- 16:01パラメーター数の2/3ほどですここまで
- 16:04見てきたアテンションブロックや埋め込み
- 16:07掘り出しその他を全て合わせると最初に見
- 16:09たパラメーター数1750が得られ
- 16:13ますもちろん今回の説明では飛ばした正規
- 16:16化のステップに使われるパラメーターや
- 16:18先ほどのバイアスのようにもうちょっと
- 16:20パラメーター数はありますが全体で見た時
- 16:22の割合は非常に小さいもの
- 16:24[音楽]
- 16:26ですさて2点目ですがここまで見てきた例
- 16:29が実際にllmが知識を記録してる方法な
- 16:32のかと皆さん疑問に思うところでしょう
- 16:35まず1つ目の行列の行が埋め込み空間の
- 16:38方向として考えられてつまりそれぞれの
- 16:41ニューロンのアクティベーションが処理さ
- 16:42れるベクトルがどれだけ特定の方向に揃っ
- 16:45ているかを示しているというのはこれは
- 16:46あっていますそれから2つ目の行列の列が
- 16:49そのニューロンが活性の時足されるものを
- 16:51表しているというのもあっていますこれら
- 16:54はただの数学的な事実ですしかし実際には
- 16:58それぞれのロはマイケルジョーダンのよう
- 17:00に綺麗に1つの特徴を表していないことが
- 17:03ほとんどですそしてこれにはスーパー
- 17:05ポジション重ね合わせという現象が関連し
- 17:08てい
- 17:09ますこれは仮説でモデルの解釈がなぜ
- 17:13難しくそれからなぜうまくスケールするか
- 17:15の説明に役に立つかもしれないと言われて
- 17:17いますN事件空間があってこの空間の中で
- 17:21互いに垂直な方向を使って異なる特徴を
- 17:24表現することを考えましょうつまりある
- 17:27方向の成分を足してもそれが他の方向に
- 17:29影響を与えないということ
- 17:31ですするとちょうどこれができるベクトル
- 17:34の数は次元の数のNだけになりますねと
- 17:38いうか数学的にはこれが次元の定義でも
- 17:40ありますしかしここでこの制限を少しだけ
- 17:43緩くしてノイズを許容すると面白いことが
- 17:46起こりますぴったり直行するベクトルでは
- 17:49なくてほぼ直行している例えば89°から
- 17:5291°のベクトルで特徴を表すとし
- 17:57ましょうこれが2次元や3次元だったら
- 18:00ほとんど違いはありません全然ベクトルを
- 18:02詰められる余裕がないですからねしかし
- 18:05直感に反するかもしれませんが高次元では
- 18:08これは大きく異なってい
- 18:09ますPythonを使ってちょっとした
- 18:12資格化をしてみましょうランダムに100
- 18:14次元のベクトルのリストを作ることにし
- 18:16ますそしてこのリストは1万の異なる
- 18:19ベクトルを含むことにします次元の数の
- 18:22100倍です
- 18:23ねこの図はこれらのベクトルのペアについ
- 18:26て角度の分布を表しています
- 18:29ランダムに始めたのでこれらの角度は0
- 18:31から180°の何でもあり得るわけですが
- 18:34すでにランダムなベクトルについても
- 18:3690°あたりに固まる傾向があるのが見
- 18:38られます
- 18:40ね次にとある最適化のプロセスを実行して
- 18:43これらのベクトルを繰り返し少しずつ
- 18:46ずらしてあげて互いに垂直に近づくように
- 18:48してあげますこれを何度も繰り返すと角度
- 18:52の分布はこんな風になります拡大してみて
- 18:55みると全てのベクトルのペアについての
- 18:57角度はこの8°から91°の狭い範囲に
- 19:01あることが分かり
- 19:02[音楽]
- 19:04ます一般にこうした結果はジョンソン
- 19:06リンデストロースの補題と呼ばれますこの
- 19:09ように互いにほぼ垂直に空間に押し込める
- 19:12ベクトルの数は次元の数について指数的に
- 19:15増えるようです独立したそれぞれの概念を
- 19:19ほぼ垂直な方向に対応させるllmにおい
- 19:22てこれは非常に重要になりますつまり
- 19:25llmが空間の次元の数よりもずっとず
- 19:28多くの概念を記録することができることに
- 19:31なりますこれはモデルの性能がサイズと共
- 19:34にうまくスケールする理由の1つかもしれ
- 19:36ません10倍の次元数の空間は10倍より
- 19:40ずっとずっと多くの独立した概念を記録
- 19:42でき
- 19:44ますこれはモデルに流れるベクトルがいる
- 19:47埋め込み空間だけでなく先ほど見た多層
- 19:50パーセプトロンブロックの途中の
- 19:52ニューロンがたくさんのベクトルについて
- 19:53も同様です例えばGPT3のサイズでは
- 19:575万の特徴についって調べているのでは
- 19:59なくこの空間でほぼ垂直な方向を活用する
- 20:02ことで処理されるベクトルのずっと
- 20:04たくさんの特徴を調べている可能性があり
- 20:07ますその場合1つ1つの特徴は1つの
- 20:11ニューロンの点灯のようには見えないこと
- 20:12になります代わりにこれらのニューロンの
- 20:14特定の組み合わせの見た目重ね合わせに
- 20:17なります興味のある方へこれに関連する
- 20:21キーとなる用語はスパースオートエ講座
- 20:23ですこれら全てのニロについて重ね合わせ
- 20:26が起こっていても実際の特徴量につつて
- 20:28調べられる方法ですいくつかアンソロ
- 20:31ピックの投稿を概要欄に貼っておきます
- 20:34ここまでトランスフォーマーの全てでは
- 20:36ありませんが重要な部分を見てきまし
- 20:39た次のチャプターでは学習のプロセスを見
- 20:42ていき
- 20:43ます学習は基本的にバック
- 20:46プロパゲーション逆電波でこれまでの
- 20:48シリーズでもすでに扱ったものですしかし
- 20:51言語モデルに使われる特定のコスト関数や
- 20:53人間のフィードバックを使った強化学習に
- 20:56よるファインチューニングそして
- 20:57スケーリング速などともう少しお話しし
- 20:59たいと思い
- 21:01ますところで機械学習以外にも制作されて
- 21:04いる動画はあるのでシリーズの次の
- 21:06チャプターは少し先になるかもしれません
- 21:08が是非他のトピックもご覧になってお待ち
- 21:27くださいDET
- 21:31[音楽]
About this transcript
This page contains the full transcript of LLMはどう知識を記憶しているか | Chapter 7, 深層学習 by 3Blue1BrownJapan, generated from the public captions YouTube serves with the video. The transcript has 484 words across 484 segments, with the original timestamps preserved so you can click any line to jump to that moment in the embedded player.
What you can do with it
Use the transcript to take notes, quote the speaker, build a study guide, generate a summary with ChatGPT or Claude via the YouTube Summary tool, or export it as a timed subtitle file with YouTube to SRT. You can also re-open it in the transcriber to translate the transcript into 100+ languages.
Free YouTube transcript tool
YouTube2Text is a free YouTube transcript generator — no signup, no daily limit. Paste any YouTube link and get the full transcript instantly, with timestamps, click-to-jump, translation to 100+ languages, AI prompts for ChatGPT, Claude, and Gemini, and exports to TXT, SRT, VTT, or Markdown.