After this, people kept asking us how @modal is able to serve agent inference so well.
So we wrote it all down.
New blog: "How to serve trillions of tokens for trillion-parameter coding agents".
https://modal.com/blog/trillion-tokens-trillion-parameters