不進行引擎測試去「感覺」孰強孰弱可靠嗎?
「感覺 xx 不如 yy」「我感覺 xx 殺不動 yy 所以棋力差不多」「xx 算不出來這麼簡單的局所以 xx 不行」「xx 和棋局面打分這麼高所以 xx 不行」「xx 這局面算得沒有 yy 快所以 xx 不如 yy」「xx 分數太飄虛高所以不如分數更穩的 yy」……此類言論都是極度片面的。
人類的「感覺」很離譜,一些人可以根據感覺得出各種離譜結論,除非兩個引擎相差實在太多,感覺都可以輕易感覺得出來。
引擎的棋力並不能單靠個別局面中的表現來衡量。每個引擎都存在盲區,且不同引擎的盲區不一定完全重合。即使某個引擎無法解出一些局面,而另一引擎可以解出這些局面,由於樣本量過少,也無法得出該引擎棋力不如另一引擎的結論。
和棋是很正常的,需要更多的統計資料,並且注意開局庫因素。即使是測試也需要大樣本,幾局幾十局的測試可以得出任何所謂的「結論」。
引擎不是神,也有很多的不完善,打個比方就是引擎是越野車,它在絕大多數場景下比人優越,但要是遇到一堵需要爬的牆就不如人類了——這個例子中,這個「牆」就相當於一些排局,但這不代表引擎的棋力差。
引擎的分數波動更不代表棋力如何,實際上將引擎的原始分數乘一個係數(比如乘 3),那麼很多人就會感覺引擎變弱了、分數太飄了虛高,實際上棋力完全一致。
