It's kind of funny how we went full circle from every model going from really big to really small because small is the future
To we want to generate a lot of tokens because a lot of tokens make it better
To actually massive models generating fewer tokens is way better
Token efficiency for GPT-6 Astra is beyond impressive..




