Agent Lightning

실제 도구 환경을 그대로 두고 에이전트를 강화 학습시키는 틀

pip install agentlightning

에이전트를 실제로 쓰는 환경 그대로 두고 강화 학습으로 훈련시키는 가벼운 틀입니다. 코드가 3500줄 남짓이고 단순함을 첫 원칙으로 삼았다고 밝히고 있습니다. 에이전트는 프록시를 통해 모델과 대화하기 때문에 도구와 맥락, 제어 흐름, 환경을 그대로 유지한 채 코드를 한 줄도 고치지 않고 학습 대상이 됩니다. 훈련기와 API 게이트웨이, 실행 제어기 세 부분으로 나뉘고 쿠버네티스 작업으로 에이전트를 직접 돌립니다. 6천 건의 학습 표본으로 코딩 벤치마크 점수를 14.6포인트 올린 전체 파이프라인을 공개했습니다.

판단

이럴 때 씁니다

  • 에이전트를 실제 도구 환경 그대로 학습시켜야 할 때
  • 코드를 고치지 않고 기존 에이전트를 학습 대상으로 삼고 싶을 때
  • 쿠버네티스에서 학습 실행을 돌려야 할 때

이럴 땐 쓰지 마세요

  • GPU 환경이 없으면 시작할 수 없습니다
  • 프롬프트 조정으로 충분한 문제에는 과합니다
  • 1.0 에서 완전히 다시 만들어 이전 판 자료가 통하지 않습니다

차별점

  • 에이전트 코드를 고치지 않고 프록시를 통해 학습 데이터를 모읍니다.
  • 도구와 맥락, 제어 흐름을 학습 과정에 그대로 유지합니다.
  • 쿠버네티스 작업으로 에이전트를 직접 돌려 외부 샌드박스가 필요 없습니다.
  • 코드가 3500줄 규모로 작아 읽어 볼 수 있습니다.

워크플로

  1. 01GPU 환경에 의존성을 맞춥니다.
  2. 02학습 스택 설치 스크립트를 돌립니다.
  3. 03에이전트가 프록시를 거쳐 모델을 부르게 합니다.
  4. 04훈련기가 실행을 만들고 제어기가 에이전트를 띄웁니다.
  5. 05게이트웨이가 오간 내용을 학습 데이터로 바꿉니다.

주요 명령

명령설명
uv sync의존성을 맞춥니다.
bash scripts/setup_verl.sh 0.8.0 cu130학습 스택을 GPU 환경에 맞춰 설치합니다.

함정

설치 전에 확인하세요

  • 1.0 에서 전면 재작성됐습니다. 이전 판 자료는 별도 브랜치에 있고 구조가 다릅니다.
  • 설치가 CUDA 판과 학습 스택 판에 묶여 있습니다. 환경이 다르면 스크립트 인자를 맞춰야 합니다.
  • 공개한 성능 향상 수치는 특정 모델과 데이터 규모에서 나온 것입니다. 재현하려면 같은 파이프라인이 필요합니다.
  • 보상 조작을 막는 처리를 파이프라인에 따로 넣었습니다. 학습을 직접 설계할 때 이 부분을 빼면 결과가 왜곡됩니다.

비교

에이전트 학습 틀은 대체로 학습용으로 단순화한 환경을 만들고 거기서 훈련합니다. 그러면 실제 도구 환경과 차이가 생깁니다. 이쪽은 프록시를 끼워 실제 하네스를 그대로 두는 방식이라 그 간극이 줄어듭니다. 대신 GPU 학습 스택을 갖춰야 합니다.

최근 변경

코딩 에이전트가 다른 에이전트를 개선하도록 돕는 스킬이 처음 정식으로 공개됐습니다. 고칠 수 있는 에이전트와 벤치마크를 주면 프롬프트와 도구, 흐름, 모델, 추론 설정을 체계적으로 개선하도록 안내합니다.