共 1 篇相关内容
语言模型的评测几乎是即时的。训练一停,把测试集丢给 GPU,几秒钟就能拿到一串分数,好还是不好,一眼就能看出来。 换成机器人的「大脑」就完全是另一回事了。一个 VLA 模型刚迭代出新版本,研究员没法在屏幕前把它评完——他们得把新策略刷进真机…