PPO算法稳定

PPO算法稳定

wen 35

DPO直接偏好优化

DPO直接偏好优化

wen 39

RLHF成本高

RLHF成本高

wen 36

Reinforcement Learning

Reinforcement Learning

wen 28

人类反馈对齐

人类反馈对齐

wen 38

LangChain框架

LangChain框架

wen 36

Tool调用接口

Tool调用接口

wen 36

Agent推理链条

Agent推理链条

wen 32

Few-shot in-context

Few-shot in-context

wen 33

对话记忆管理

对话记忆管理

wen 36