"Tự học" của mạng nơ-ron là gì?
Ở các engine cờ phổ biến, mạng nơ-ron đều thuộc loại học có giám sát ngoại tuyến (offline).
Tác giả trước hết cho engine tự đấu với chính mình để sinh dữ liệu (kỳ phổ).
Lấy việc chạy kỳ phổ cho NNUE làm ví dụ, dữ liệu này chứa thế cờ của từng nước, điểm số, kết quả của ván đó, v.v., thường được sinh ra khi tự đấu với mỗi nước đi tìm vài tầng hoặc vài nghìn, vài chục nghìn nút.
Sau khi sinh đủ dữ liệu thì đem đi huấn luyện. Quá trình huấn luyện có thể hiểu đơn giản là điều chỉnh lượng khổng lồ tham số trong mạng nơ-ron để đầu ra của mạng gần với dữ liệu hơn. Ví dụ một thế cờ có 100 điểm, huấn luyện sẽ thay đổi tham số mạng nơ-ron để điểm đánh giá tiến gần tới 100 điểm này.
Vì là học ngoại tuyến, phụ thuộc vào việc tác giả huấn luyện rồi phát hành, nên khi bạn dùng engine thì không thể khiến engine "học" (mà cờ cũng hoàn toàn không phù hợp với học trực tuyến). Còn engine có bảng hash, một nơi lưu thông tin tạm thời, nên khi tháo cờ bạn sẽ cảm thấy engine có chức năng ghi nhớ, nhưng sau khi nạp lại thì trí nhớ đó mất đi.
Vì vậy các engine mạnh hiện nay không thể vừa dùng vừa học, mà phụ thuộc vào việc tác giả huấn luyện xong rồi phát hành.
