人工智能 2026年稀疏化与混合专家模型(MoE)实战:如何解决大模型推理成本与效率的平衡问题 背景痛点 Transformer 全参数推理的显存瓶颈 传统 Transformer 模型在推理时需要加载全部…