Agent Lightning
실제 도구 환경을 그대로 두고 에이전트를 강화 학습시키는 틀
pip install agentlightning에이전트를 실제로 쓰는 환경 그대로 두고 강화 학습으로 훈련시키는 가벼운 틀입니다. 코드가 3500줄 남짓이고 단순함을 첫 원칙으로 삼았다고 밝히고 있습니다. 에이전트는 프록시를 통해 모델과 대화하기 때문에 도구와 맥락, 제어 흐름, 환경을 그대로 유지한 채 코드를 한 줄도 고치지 않고 학습 대상이 됩니다. 훈련기와 API 게이트웨이, 실행 제어기 세 부분으로 나뉘고 쿠버네티스 작업으로 에이전트를 직접 돌립니다. 6천 건의 학습 표본으로 코딩 벤치마크 점수를 14.6포인트 올린 전체 파이프라인을 공개했습니다.
판단
이럴 때 씁니다
- 에이전트를 실제 도구 환경 그대로 학습시켜야 할 때
- 코드를 고치지 않고 기존 에이전트를 학습 대상으로 삼고 싶을 때
- 쿠버네티스에서 학습 실행을 돌려야 할 때
이럴 땐 쓰지 마세요
- GPU 환경이 없으면 시작할 수 없습니다
- 프롬프트 조정으로 충분한 문제에는 과합니다
- 1.0 에서 완전히 다시 만들어 이전 판 자료가 통하지 않습니다
차별점
- 에이전트 코드를 고치지 않고 프록시를 통해 학습 데이터를 모읍니다.
- 도구와 맥락, 제어 흐름을 학습 과정에 그대로 유지합니다.
- 쿠버네티스 작업으로 에이전트를 직접 돌려 외부 샌드박스가 필요 없습니다.
- 코드가 3500줄 규모로 작아 읽어 볼 수 있습니다.
워크플로
- 01GPU 환경에 의존성을 맞춥니다.
- 02학습 스택 설치 스크립트를 돌립니다.
- 03에이전트가 프록시를 거쳐 모델을 부르게 합니다.
- 04훈련기가 실행을 만들고 제어기가 에이전트를 띄웁니다.
- 05게이트웨이가 오간 내용을 학습 데이터로 바꿉니다.
주요 명령
| 명령 | 설명 |
|---|---|
uv sync | 의존성을 맞춥니다. |
bash scripts/setup_verl.sh 0.8.0 cu130 | 학습 스택을 GPU 환경에 맞춰 설치합니다. |
함정
설치 전에 확인하세요
- 1.0 에서 전면 재작성됐습니다. 이전 판 자료는 별도 브랜치에 있고 구조가 다릅니다.
- 설치가 CUDA 판과 학습 스택 판에 묶여 있습니다. 환경이 다르면 스크립트 인자를 맞춰야 합니다.
- 공개한 성능 향상 수치는 특정 모델과 데이터 규모에서 나온 것입니다. 재현하려면 같은 파이프라인이 필요합니다.
- 보상 조작을 막는 처리를 파이프라인에 따로 넣었습니다. 학습을 직접 설계할 때 이 부분을 빼면 결과가 왜곡됩니다.
비교
에이전트 학습 틀은 대체로 학습용으로 단순화한 환경을 만들고 거기서 훈련합니다. 그러면 실제 도구 환경과 차이가 생깁니다. 이쪽은 프록시를 끼워 실제 하네스를 그대로 두는 방식이라 그 간극이 줄어듭니다. 대신 GPU 학습 스택을 갖춰야 합니다.
최근 변경
코딩 에이전트가 다른 에이전트를 개선하도록 돕는 스킬이 처음 정식으로 공개됐습니다. 고칠 수 있는 에이전트와 벤치마크를 주면 프롬프트와 도구, 흐름, 모델, 추론 설정을 체계적으로 개선하도록 안내합니다.