Skip to main content

Algorithms

方法学习对象学习发生在主要信号典型特点
Q-Learning状态-动作价值函数单个智能体在交互过程中每一步奖励、折扣回报经典离策略强化学习,适合离散动作空间
SARSA状态-动作价值函数单个智能体在交互过程中当前策略下的奖励与 Q-Learning 类似,但更偏向在策略学习
Policy Gradient策略参数与环境交互的采样回合中累积回报直接优化策略,适合连续动作控制
Actor-Critic策略与价值函数交互采样与更新循环中奖励、优势函数、TD 误差结合策略梯度与价值估计,训练更稳定
PPO策略与价值函数多轮采样后的批量更新中优势函数、裁剪目标受限策略更新,常用于稳定的在线强化学习
SAC随机策略与价值函数连续控制的经验回放中奖励、熵、TD 误差最大熵离策略方法,样本效率较高
DQN深度神经网络参数经验回放与批量训练时奖励、TD 误差将 Q-Learning 扩展到深度网络
MCTS(UCT/PUCT)搜索树与动作估值每次决策时的在线搜索中模拟回报、价值与策略先验通过选择、扩展、评估、回传规划动作
NEAT神经网络权重和结构一代代种群之间个体适应度通过进化同时搜索结构与参数
rtNEAT网络权重和结构世界持续运行时实时适应度面向在线进化,适合实时交互系统
Genetic Algorithm参数、结构或规则多代种群进化过程中适应度通用黑箱优化方法,常用于搜索和调参
Transformer序列表示与输出分布预训练 + 微调阶段轨迹、文本、奖励、示范擅长处理长依赖,可做行为克隆或序列决策
Behavior Cloning策略映射监督学习阶段专家示范数据用模仿学习直接学习动作映射
RLHF策略与偏好对齐预训练后的人类反馈阶段人类偏好、奖励模型常用于对齐大模型输出
Evolution Strategies参数向量多次采样评估中任务回报基于随机扰动的黑箱优化,易并行

Top 10 Machine Learning Algorithms

  1. Naïve Bayes Classifier Algorithm
  2. K Means Clustering Algorithm
  3. Support Vector Machine Algorithm
  4. Apriori Algorithm
  5. Linear Regression
  6. Logistic Regression
  7. Artificial Neural Networks
  8. Random Forests
  9. Decision Trees
  10. Nearest Neighbours

String