HuaRenCa
Back to Forum
Community

¿Puede un especialista en IA explicar por qué o qué hizo especiales a los modelos de clase mythos?

meisan
meisan

2 months ago

Mi suposición es que cambiaron el tokenizador de una forma u otra. Pero me gustaría tener la perspectiva de otros entusiastas de la IA.

4
13

Comments (4)

Your avatar
Sign in to comment
zhezhe
zhezhe2 months ago

10 billones de parámetros por sí solos no hacen daño. También ha sido entrenado para ser implacable en la ejecución de tareas, y tiene un gran equilibrio entre la personalidad y la capacidad de escritura de Opus 4.6 con la visión, la interfaz de usuario y el ingenio agéntico de Opus 4.8.

Es una inteligencia general excelente, que puede manejar casi todas las tareas de código y diseño sin sudar.

rjhuantan
rjhuantan2 months ago

Para añadir un poco de contexto, Opus tenía 2 billones de parámetros, por lo que Mythos era aproximadamente 5 veces más grande. Pero no sabemos exactamente cómo se utilizan esos parámetros. Hay algún tipo de enfoque interno de mezcla de expertos, por lo que podría tener algunas optimizaciones donde no usa todos los parámetros todo el tiempo.

sanqi
sanqi2 months ago

Mythos/Fable son aproximadamente 10 veces más grandes que Opus, son modelos más grandes. Mythos probablemente tenga ~10T, Opus ~1T, Sonnet ~100B, como una estimación muy aproximada.

Emma Tcherkezian
Emma Tcherkezian2 months ago

Versión corta: 1) muchas mejoras técnicas pequeñas y secretas en datos, entrenamiento, arquitectura del modelo y RL. No un gran avance. 2) es solo un modelo MUY GRANDE

Versión larga: Amodei dijo en una entrevista que la mayoría de las ganancias de capacidad provienen de la combinación de muchas pequeñas mejoras en cada pieza del rompecabezas. Mejor búsqueda en caché kv, un mejor mecanismo de atención, datos de mayor calidad, mejores métodos RLHF, y todo suma, generalmente no hay un gran avance.

El gran tamaño es probablemente de donde proviene la mayor parte del factor 'wow' del mito. Karpathy dijo en Twitter que siente la sensación de 'modelo grande' al hablar con Fable. Este es un fenómeno conocido (aunque no científico): a pesar de que los modelos más pequeños se acercan más a los grandes en benchmarks, hay algo diferente en los modelos grandes en su capacidad para 'simplemente entender' las cosas, la capacidad de hacer buen trabajo a partir de indicaciones cada vez más vagas y malas, que es muy difícil de medir. Fable también es realmente caro y genera tokens lentamente, lo que TAMBIÉN apunta a 'es un modelo grande'.