据媒体报道,Google近期发布了KV快取(KV Cache)量化压缩技术TurboQuant,引发了存储器市场的广泛关注。尽管韩国产学界对该技术的实际应用仍存疑虑,但在AI推论需求的推动下,存储器市场前景依然被看好。
被称为“HBM之父”的韩国科学技术院(KAIST)教授金正浩(音译)表示,未来10到30年内,AI系统所需的存储器总容量可能增长千倍。他认为,AI时代的竞争力已从硬件规格转向存储器与软件的管理能力。存储器需求的快速增长主要源于文本长度的增加和KV快取需求的激增,这将形成严峻的存储器瓶颈。例如,序列长度从1K扩展到128K时,存储器需求将从0.5GB骤增至64GB。
此外,代理式AI(Agentic AI)的兴起也进一步推高了存储器需求。单一用户请求可能需要5到15个代理同步运作,上下文记忆时间从分钟级延长至天级。在多视窗、多模型并行使用的情境下,存储器需求可能达到单工作阶段的8倍以上。
TurboQuant技术采用两阶段压缩方法,第一阶段通过“Polar Quant”重新排列数据结构,第二阶段利用“QJL(Quantized Johnson-Lindenstrauss)”进行误差修正,可在不重新训练模型的情况下,将32位元浮点数压缩至3位元,从而将存储器使用量缩减至原来的六分之一。然而,金正浩指出,该技术的验证基于参数规模约30亿的小型模型,上下文长度仅为8K,难以反映长文本的真实表现。在自动驾驶或实体AI(Physical AI)等对精度要求极高的领域,TurboQuant的应用空间有限。
韩国存储器业界认为,即使KV快取量化技术成熟,存储器需求仍将持续增长。SK海力士在2026年第一季度财报中表示,技术进步将推动AI生态系统的扩展,但最终仍需更多存储器资源支持。IC设计新创公司Hyperaccel技术长李真元(音译)表示,TurboQuant若能通过学术验证,将有助于降低企业导入AI模型的成本,从而促进半导体消费。
韩国业界在AI量化技术方面也有不少研究,部分已实现商用。例如,Quantum AI开发的“QuantumQuant”采用simplex空间中的组合量化方法,可对超高维上下文矢量进行实时高精度量化。新创公司ENERZAi则能将主流大型语言模型(LLM)在几乎不影响精度的情况下压缩至1.58-bit,并已与LG U+合作开发IPTV专用终端AI模型。
专家认为,以TurboQuant为代表的软件效率提升与存储器硬件扩张并非对立关系。对三星电子和SK海力士等企业而言,存储器技术研发、产能扩充以及后Transformer模型的崛起仍是关键变量。