芯片算力这几年涨得很猛。从CPU到GPU再到专用AI加速器,硬件性能的提升速度在整个半导体历史上都算快的。
但有一个问题被严重低估了:算力不等于智能,数据质量才是天花板。
做过芯片验证的人都知道,测试向量的质量直接决定验证结果的可信度。你可以跑几百万个仿真周期,但如果测试向量本身设计得有问题,覆盖率再高也是假的。
AI训练数据的逻辑完全一样。
喂进去的数据有偏差,模型学到的就是有偏差的规律。喂进去的标注是错的,模型就会把错误当成正确答案反复强化。这个过程没有任何自我纠错机制,垃圾进,垃圾出。
训练数据的质量,决定了模型能学到什么上限。
数据背后是人。数据是人标注的,数据集是人筛选的,训练目标是人定义的。所以归根结底,AI的能力边界,是由参与构建它的那批人的认知水平决定的。
一个对芯片设计理解不深的团队,标注出来的训练数据,最多只能训练出一个"看起来懂芯片"的模型。它能复述教科书上的内容,能处理标准场景,但遇到真正复杂的corner case,大概率会给出一个自信满满的错误答案。
时序问题、功耗异常、跨时钟域处理——这些问题的判断需要深度的工程经验,经验本身又很难被准确标注进数据集。
所以现阶段,AI工具在芯片设计里能做的事,和它不能做的事,边界其实很清晰。
重复性高、规则明确、有大量历史数据支撑的任务,AI能做得不错。
但涉及到架构决策,现有模型的训练数据根本撑不起来,强行用只会引入错误判断。
决定AI能力上限的,不是芯片算力,而是构建它的人和数据。
算力是基础设施,可以用钱堆。但高质量的领域数据和真正懂行的工程师,没有捷径。