我猜他们以某种方式改变了分词器。但我想听听其他AI爱好者的看法。
4
13
我猜他们以某种方式改变了分词器。但我想听听其他AI爱好者的看法。


为了提供一些背景信息,Opus 有 2 万亿参数,所以 Mythos 大约大了 5 倍。但我们不知道这些参数具体是如何使用的。它采用了某种内部的专家混合方法,因此可能有一些优化,不会一直使用所有参数。

Mythos/Fable ??? Opus ? 10 ????????????????Mythos ??? 10T?Opus ? 1T?Sonnet ? 100B?

简短版:1) 对数据、训练、模型架构和强化学习进行了许多微小且秘密的技术改进,并非单一突破。2) 它只是一个非常大的模型。
详细版:Amodei 在一次采访中提到,大部分能力提升来自于对每个环节的许多小改进的组合。更好的 kv-cache 查找、更好的注意力机制、更高质量的数据、更好的 RLHF 方法,所有这些加起来,通常不是单一的重大突破。
大尺寸可能是大多数神话般“哇”因素的来源。Karpathy 在推特上说,与 Fable 交谈时他感受到了“大模型”的感觉。这是一个已知(即使不是科学)的现象:尽管较小的模型在基准测试中更接近较大的模型,但大模型在“直接理解”事物方面有所不同,能够从越来越模糊和糟糕的提示中做好工作,这很难衡量。Fable 也非常昂贵,生成令牌速度慢,这也指向“它是一个大模型”。
10万亿参数本身并不有害。它还被训练成在任务执行上毫不松懈,并且兼具Opus 4.6的个性和写作能力与Opus 4.8的视觉、UI和代理工程智慧。
这是一个出色的全能智能体,几乎可以轻松处理所有代码和设计任务。