纯 .NET 手写 CUDA kernel,GLM-5.3-Flash decode 跑出 llama.cpp 的 2 倍 - 张善友

Wait 5 sec.

【摘要】如果你所在的团队是 .NET 技术栈,又想把大模型推理收进自己的进程里,这篇文章值得你花五分钟。 8 月 26 日,智谱 GLM-5.3-Flash(MIT 许可,首日开源)和阿里 Qwen3.8-Flash-Next 同日发布。三天后,纯 .NET 推理引擎 TensorSharp 把两者都接进了 阅读全文