Training Agents 4: From reward functions to environments.
Hugging Face의 에이전트 트레이닝 세션 4로, 보상 함수에서 실제 환경으로의 전환을 다룬다. Gym의 reset()/step() 계약에서부터 LLM 에이전트, OpenEnv 환경 구축, TRL의 GRPOTrainer를 이용한 실제 코딩 에이전트 학습까지 다룬다.
Hugging Face의 에이전트 트레이닝 세션 4로, 보상 함수에서 실제 환경으로의 전환을 다룬다. Gym의 reset()/step() 계약에서부터 LLM 에이전트, OpenEnv 환경 구축, TRL의 GRPOTrainer를 이용한 실제 코딩 에이전트 학습까지 다룬다.