
趋境科技与清华共同开源的高性能异构推理框架KTransformers,其论文《KTransformers:Unleashing the Full Potential of CPU/GPU Hybrid Inference for MoE Models》近日到手入选 “计较机系统鸿沟奥斯卡”SOSP 2025。这符号着其异构计较技能取得寰球顶尖学术与工业界的招供。

KTransformers专注于高效愚弄底层GPU、CPU、内存等千般化算力,让大模子在更低算力、更活泼的硬件架构上高效初始。在大模子推理中,趋境科技淡薄了一条不同以往的谈路:一套面向CPU+GPU异构架构的MoE推理系统决议,让蓝本只可依赖不菲多卡GPU的大模子,能在CPU参与的硬件环境中完竣接近同等性能的推理体验。技能层面上,它通过一系列系统级翻新,让GPU厚爱防卫力和骨干网罗的高并行计较,CPU则承担疏淡群众模块的推理任务,完竣了高效的CPU+GPU协同履行。
11月6日,月之暗面发布Kimi-K2-Thinking模子后,KTransformers已完成对该模子的全面适配,救济用户在单卡环境下完成推理任务。同期,趋境科技也已完成了该模子在昇腾NPU上的全面适配,提供了完善的世界产化推融会决决议。
针对模子微调,KTransformers与LLaMA-Factory深度集成,救济用户使用LoRA等轻量级微调纪律,在极一丝GPU资源下完成模子定制。传统上,LoRA微调千亿模子资本高达数百万,趋境科技提供的异构微调才气将资源需求裁减到单个破费级GPU(如RTX 4090)起,这使得高校、中微型实验室、初创公司以致个东谈主成就者齐有契机参与进来。该微调决议在较小鸿沟的MoE模子(DeepSeek-14B)上头也展现了高出传统决议1.8倍的费解、显存占用裁减 82%,成为破费级显卡上微调超大参数MoE模子的独一可行决议。
KTransformers已成为一个被成就者、厂商与开源社区渊博复用的共建式底层框架。寰球头部开源模子方面,如Qwen、Kimi、智谱AI等多个主流大模子,齐在模子发布首日就保举KTransformers算作推理引擎救济;其工程践诺与兼容性也被多家一体机居品线遴选。趋境科技是异构阶梯的中枢推动者,已与多个国产CPU、GPU硬件平台互助,共同鞭策世界产高性价比决议;为数十家行业成就伙伴提供算力底座,徐徐完竣算力普惠。趋境但愿。让AI才气不再专属于少数企业,让大模子信得过为业务所用。
南边+记者 郜小平