1v1 镜像决斗

你和机器人完全相同:同样的血量、同样的冲锋枪、同样的移速
唯一的区别——它的大脑是一个真的神经网络,每局训练一次
这些倾向不是预设的,是网络自己练出来的——每局结束按胜负强化/弱化当时的决策,打法会慢慢变化。

📖 说明

WASD 移动 鼠标 瞄准 左键 射击 R 换弹 P 暂停 ESC 认输

绝对对称:双方都是 100 血、移速 3.2、同一把冲锋枪(12 伤害 / 30 发弹匣 / 1.4 秒换弹)。没有任何强化、没有任何数值差异。

🧠 它的大脑是真的网络:12 个感知输入(距离/双方血量/弹药/方位/视线/来袭子弹威胁/受击记忆/视野丢失时长/是否卡住…)→ 12 个隐层神经元 → 7 个输出(追击·拉开·左移·右移 × 连发·点射·停火)。每 0.15 秒思考一次,头顶显示它当前的决策。贴墙卡住时有本能的绕行反射;你刚躲进掩体的 1.5 秒内它会朝你的方向盲射压制。

训练是 Actor-Critic (A2C):Actor(策略网络)看局面做决策;Critic(价值网络)评估局面好坏。每步用优势函数 A = r + γV(s') − V(s) 更新——比预期好的决策被强化,差的被弱化。击中你 +1、被你击中 −1 的奖励挂在当时的决策上,局末统一结算。两个网络共享感知、一起进化,大脑存在浏览器里。

你和它之间唯一的区别:你有操作,它有学习。

🧠 神经网络已更新