Meet FreeToken: An Edge-Native MoE Serving Engine that Runs 753B GLM-5.2 on a Single Workstation GPU
UC Berkeley and UT Austin researchers propose FreeToken, a serving engine that treats a personal machine as a unified inference platform to run frontier models locally.











