智谱 GLM-5.3-FlashX 正式上线!最高 200token/s,国产大模型提速
智谱上新 GLM-5.3-FlashX,官方标注最高速度可达200 token / 秒,企业开发者迎来高速推理版本。
该模型前身就是海外开发者圈热度很高的 GLM-5.3-Flash(曾用代号 Ox Alpha),本身在同规格模型里智能表现亮眼,调用量持续暴涨。
面对激增的业务需求,智谱依托10 万张国产芯片搭建的推理算力集群,持续优化底层基建与推理引擎。这次的 FlashX 最大亮点:不再单纯堆速度,做到能力、成本、响应速度三者兼顾。
✅ API 现已正式上线模型标识:GLM-5.3-FlashX
很多企业落地大模型,最头疼就是响应慢、等待久。200token/s 的吞吐,在保持原有模型智能水平不变的基础上,大幅压低接口延迟,适合各类生产业务场景。
国产大模型推理基建持续发力,后续在企业业务落地应该会越来越顺手。你觉得高速推理模型,会最先在哪些行业大规模落地?
|
|
|
|
|
|
|