Hackernews
new
show
ask
jobs
Math identity that applied at model-load time, makes MLA decode at 71,000 tok/s
2 points
posted 5 hours ago
by bnayak25
(efficientagent.substack.com)
1 Comments
user
5 hours ago
[deleted]