私の推測では、何らかの方法でトークナイザーを変更したのだと思います。しかし、仲間のAI愛好家からの見解も聞きたいです。
Back to Forum




4
13
Comments (4)
Sign in to comment

zhezhe2 months ago

rjhuantan2 months ago
少し背景を説明すると、Opusは2兆パラメータだったので、Mythosは約5倍大きかったことになります。しかし、それらのパラメータがどのように使われているかは正確にはわかりません。内部で何らかの混合専門家アプローチが使われているため、常にすべてのパラメータを使用するわけではない最適化があるかもしれません。

sanqi2 months ago
Mythos/FableはOpusの約10倍の大きさで、より大きなモデルです。大まかな目安として、Mythosは約10T、Opusは約1T、Sonnetは約100Bと考えられます。

Emma Tcherkezian2 months ago
短いバージョン: 1) データ、トレーニング、モデルアーキテクチャ、RLに関する多くの小さな秘密の技術的改善。一つのブレークスルーではない。2) ただ非常に大きなモデルである。
長いバージョン: Amodeiはインタビューで、能力の向上のほとんどは、パズルのすべてのピースに対する多くの小さな改善の組み合わせから来ると述べた。より良いkv-cacheルックアップ、より良いアテンション機構、より高品質なデータ、より良いRLHF手法、それらがすべて積み重なり、通常は一つの大きなブレークスルーはない。
大きなサイズがおそらく「神話」の「すごい」要素のほとんどを生み出している。KarpathyはTwitterで、Fableと話すと「大きなモデル」の感覚を得ると述べた。これは(科学的ではないが)既知の現象である:小さなモデルが大きなモデルにベンチマークで近づいているにもかかわらず、大きなモデルには「ただ理解する」能力、ますます曖昧で悪いプロンプトから良い仕事をする能力があり、それは非常に測定しにくい。Fableはまた非常に高価で、トークンの生成が遅い。これも「大きなモデルである」ことを示している。

10兆のパラメータ自体は問題ではありません。また、タスク実行に relentless になるよう訓練されており、Opus 4.6の個性と文章力、Opus 4.8のビジョン、UI、エージェント工学の知識のバランスが優れています。
これは優れた万能の知能であり、ほとんどすべてのコードやデザインタスクを難なく処理できます。