据韩媒ZDNet Korea报道,Google Research近期发布了一项名为“TurboQuant”的存储器压缩技术,声称可将AI推理所需的KV Cache容量压缩至原来的六分之一。这一技术引发了市场高度关注,但韩国AI半导体与系统架构专家对此持不同看法,认为市场对其本质存在误解。
韩国AI芯片新创公司Dinoticia的CEO郑茂庆(音译)将“KV Cache”比作人类解答复杂问题时的“工作记忆”。他指出,AI在解决复杂问题时需要更大的存储容量,类似于在书桌上摆放更多参考书。通过TurboQuant技术,企业并不会减少存储器使用量,而是选择在相同硬件空间中塞入更多数据,从而提升AI的智能水平。
韩国LLM专用IC设计新创公司HyperAccel的技术长李振元引用经济学中的“杰文斯悖论”表示,效率提升后,人们通常不会减少硬件使用,反而会尝试扩大规模。汉阳大学融合电子工程学系教授金志勋(音译)也指出,存储器需求量减少的同时,企业会转向使用更大的模型和更长的序列,进一步推动存储器需求增长。
此外,代理式AI(Agentic AI)的兴起可能让存储器需求呈指数级增长。KAIST教授暨新创业者Panmnesia的CEO郑明秀(音译)表示,代理式AI在逻辑推演中会反复循环,导致KV Cache需求量暴增数十倍甚至数百倍。
业界人士普遍认为,TurboQuant这类压缩技术虽然能在一定程度上缓解存储压力,但无法从根本上抑制长期存储器需求。此外,该技术仅能缩减存储空间,对运算效率无帮助,甚至可能因解压缩过程增加额外运算负荷,导致AI运行速度下降。