多目标优化

多目标优化

wen 118

奖励模型训练

奖励模型训练

wen 67

PPO算法稳定

PPO算法稳定

wen 99

DPO直接偏好优化

DPO直接偏好优化

wen 106

RLHF成本高

RLHF成本高

wen 97

Reinforcement Learning

Reinforcement Learning

wen 57

人类反馈对齐

人类反馈对齐

wen 92

LangChain框架

LangChain框架

wen 68

Tool调用接口

Tool调用接口

wen 110

Agent推理链条

Agent推理链条

wen 62