誠實揭露 1——收斂但非保證:本頁固定種子(seed=4)跑 16 次迭代後,root 推薦動作收斂到 minimax 的精確解「取 2」,但這是這個種子、這個迭代數下的實測結果,換一顆種子或迭代數不夠,MCTS 完全可能收斂到錯誤動作或根本不收斂——MCTS 本質是統計逼近,不是精確演算法,不保證任何單次執行都 收斂到真值。
誠實揭露 2——過程並非單調收斂:本頁推薦動作的逐迭代序列是 [取1, 取1, 取2, 取2, 取2, 取1, 取2, 取2, 取2, 取2, 取2, 取2, 取2, 取2, 取2, 取2]——第 6 次 迭代(iter5)一度從「取 2」搖擺回「取 1」(小樣本下單次 rollout 結果的雜訊),第 7 次迭代起才穩定 收斂在「取 2」。這正是「估計」的真實面貌:即使最終收斂,過程未必單調,教學上刻意保留這個搖擺, 不做美化。
誠實揭露 3——rollout 次數 ≠ 迭代數:上方「rollout 模擬次數」最終停在 8,而不是迭代數 16——因為每次迭代若選擇止步於既有終局節點(終局捷徑),勝者由盤面直接決定,不需要、也不會擲骰 模擬,本頁誠實地不把這種情況計入 rollout 次數。
教學縮尺:本頁選用可用 minimax 精確解算出來的小型 Nim(pile=5),只為了讓「MCTS 估計 vs 真值」的對照可行;MCTS 真正的優勢場景是圍棋/西洋棋/agent 規劃等狀態空間大到無法窮舉精確解的 賽局——那些場景根本沒有 minimax 精確解可供對照,本頁能對照全靠賽局刻意縮小,這是教學上的簡化, 不是 MCTS 規模優勢的示範。
root 子節點統計 vs minimax 精確解對照
| 走法 | visits | wins(父視角) | winRate(父視角) | minimax 對照 |
|---|