9월에 하나씩 공개되는 개발도구 13종: 터미널 에이전트부터 에이전트 운영체제까지

이번 달 개발도구 목록에 올릴 후보를 고르면서 스타 수 순으로 정렬해 놓고 보니 상위권이 전부 코딩 에이전트였습니다. 몇 주째 같은 화면을 보다가 패턴 하나가 눈에 들어왔습니다.
스타 수는 무엇이 유행인지는 알려 주지만, 내게 필요한지는 답하지 않습니다. 그래서 이번 13종은 "언제 쓰고 언제 피하는가"를 기준으로 다섯 묶음으로 나눴습니다.

새 도구가 매주 쏟아질 때 무엇부터 볼지 정하는 기준

이 글의 13종은 9월 5일부터 10월 5일까지 2~3일 간격으로 개발도구 목록에 올라갑니다. 매회 한국 시간 오전 10시 20분에 한 건씩 공개되고, 각 건은 8월 30일 기준으로 저장소와 문서, 설치 명령을 다시 확인한 상태입니다.
고르는 기준은 세 가지였습니다. 저장소가 무엇을 못 한다고 스스로 밝히는지, 설치 한 줄로 시작되는지, 이미 쓰는 도구와 겹치지 않고 어떤 상황을 새로 여는지입니다.
스타 수는 정렬 기준이 아니라 참고값으로만 썼습니다. 이번 목록에서 스타가 가장 적은 SIE 와 Bumblebee 는 각각 자체 추론 클러스터와 공급망 점검이라는, 대체재가 드문 자리를 차지합니다.
9월 5일부터 10월 5일까지 13종의 공개 예정일을 한 줄 타임라인에 배치하고 이미 공개된 두 건을 따로 표시한 일정표
13종 공개 일정. 녹색은 이 글이 나가는 시점에 이미 공개된 도구
이 글이 나가는 시점에는 oh-my-pi 와 SIE 두 건이 공개돼 있습니다. 나머지 11종은 공개 예정일만 적었고, 상세 페이지 링크는 공개 뒤에 이 글에 덧붙이겠습니다.

터미널에서 에이전트를 부리는 방식이 바뀌고 있습니다

oh-my-pi(9월 5일)는 편집 위치를 해시 앵커로 고정합니다. 모델이 고칠 줄을 다시 타이핑하는 대신 앵커를 가리키기 때문에, 공백이 어긋나 문자열을 못 찾는 루프가 줄어듭니다. LSP 조작 14개와 디버거 조작 28개를 내장해 이름 변경 전파와 실행 중 디버깅까지 에이전트가 직접 합니다.
주의할 점은 Pi 의 포크라 원본과 철학이 다르다는 것입니다. 원본이 최소 도구 집합을 지향하는 반면 이쪽은 기능을 기본 탑재하므로 Pi 문서를 그대로 참고하면 어긋납니다. 릴리스 주기가 짧아 팀에서 쓰려면 버전을 고정해야 합니다.
T3 Code(9월 10일)는 에이전트가 아니라 제어 계층입니다. Claude Code, Codex, Cursor, Grok Build, OpenCode 를 로컬 서버 하나가 묶고, 데스크톱과 브라우저, iOS 와 안드로이드 앱에서 진행 중인 스레드를 조종합니다. 격리된 워크트리에서 작업하고 끝나면 같은 화면에서 PR 로 넘깁니다.
버전이 0.0.x 대라 릴리스마다 기본 UI 가 바뀌고, 원격 접속을 쓰려면 코드와 터미널에 닿는 로컬 서버를 외부에 열어야 합니다. 노출 범위를 통제할 수 없는 환경이라면 미루는 편이 안전합니다.
Open Interpreter(9월 15일)는 저장소를 열어 보면 파이썬이 아니라 Rust 소스가 있습니다. OpenAI Codex 를 포크해 Rust 로 다시 쓴 것이라 옛 자료의 설치법이 맞지 않습니다. 핵심은 하네스 전환입니다. 명령 하나로 native, claude-code, kimi-code, qwen-code, swe-agent 하네스를 바꿔 가며 Kimi K3 같은 저비용 오픈 모델의 실력을 끌어냅니다.
AOS Community Edition(10월 5일)은 Unicity 가 공개한 에이전트 운영체제의 커뮤니티 판입니다. aos 명령과 HTTP API, 캡슐 묶음을 제품이 소유하는 경로 아래 함께 설치하고 오프라인 초기화를 지원합니다. 모든 릴리스에 체크섬과 Sigstore 서명, 빌드 출처 증명이 딸려 나옵니다. 다만 캡슐 개수가 README 와 릴리스 노트에서 다르게 적혀 있어 릴리스 매니페스트를 직접 봐야 합니다.
네 도구의 공통점은 더 똑똑한 모델이 아니라 편집 위치, 세션, 하네스, 설치 경로처럼 모델 바깥의 마찰을 줄이는 데 있습니다. 모델을 바꾸지 않고도 결과가 달라지는 지점이 그곳입니다.
13종을 터미널 에이전트, 코드로 막는 보안, 자체 추론, 실행 환경 실험, 에이전트 스킬 다섯 구역으로 나눠 배치한 지도
다섯 묶음과 소속 도구

프롬프트로 "하지 마" 라고 해도 안 될 때, 코드로 막는 도구들

프롬프트에 금지 문장을 넣어 두고도 나중에 로그에서 그 동작을 발견한 적이 있다면, 문제는 모델의 말귀가 아니라 집행 지점입니다. 이 묶음의 세 도구는 그 지점을 프롬프트 밖으로 옮깁니다.
Agent Governance Toolkit(9월 12일)은 마이크로소프트가 공개한 정책 집행 툴킷입니다. 도구 호출과 메시지 발송, 위임을 모델의 의도가 나가기 전에 결정적인 애플리케이션 코드에서 가로채기 때문에, 정책이 막은 동작은 어렵게 되는 것이 아니라 구조적으로 불가능해집니다. YAML 정책 파일 하나와 두 줄짜리 래핑으로 시작하고 PyPI, npm, NuGet 으로 배포됩니다.
공개 프리뷰라 GA 전 파괴적 변경이 예고돼 있고, 기본 휠에는 거버넌스 모듈이 없어 full 엑스트라를 따로 받아야 합니다. v4 에서 v5 로 가는 정책 마이그레이션은 단방향이라 되돌릴 계획을 먼저 세워야 합니다.
Strix(9월 20일)는 취약점을 나열하는 스캐너가 아니라 실제로 실행되는 PoC 로 검증하는 침투 테스트 도구입니다. 정찰과 익스플로잇, 후속 침투를 나눠 맡는 에이전트들이 발견을 공유하고, OpenAPI 명세가 있으면 크롤링 대신 선언된 엔드포인트를 전수 점검합니다.
Docker 가 반드시 떠 있어야 하고 LLM 제공자 API 키와 토큰 비용이 듭니다. 실제 익스플로잇을 실행하므로 권한 없는 대상에 돌리면 법적 문제가 됩니다. 결과 디렉터리 자체가 취약점 정보라 저장소에 커밋되지 않게 막아야 합니다.
Bumblebee(9월 25일)는 Perplexity 가 공개한 읽기 전용 공급망 점검 도구입니다. 패키지 매니저를 실행하지 않고 잠금 파일과 설치 메타데이터, 에디터 확장 매니페스트, MCP 설정만 읽어 알려진 침해 사례에 노출됐는지 확인합니다. Go 단일 바이너리이고 결과는 NDJSON 으로 나옵니다. 노출 카탈로그 없이 돌리면 재고 목록만 나오므로 무엇을 찾는지 아는 상태에서 써야 합니다.
세 도구는 같은 질문에 다른 층에서 답합니다. Agent Governance Toolkit 은 에이전트가 무엇을 할 수 있는가를, Strix 는 내 앱이 어디서 뚫리는가를, Bumblebee 는 내 개발 장비에 무엇이 깔려 있는가를 봅니다.
어두운 방에서 긴 로그 출력이 흐르는 넓은 모니터를 바라보는 사람의 뒷모습, 한 줄만 녹색으로 강조돼 있음

API 비용이 무서워서 모델을 내 손에 두고 싶을 때

월말 청구서가 먼저 알려 줍니다. 에이전트가 도구 호출을 반복하면 모델 호출 수가 사람이 직접 대화할 때의 몇 배로 늘어나고, 그 호출이 여러 서버와 여러 제공자에 흩어져 있으면 어디서 새는지 보이지 않습니다.
SIE(9월 7일)는 Superlinked 가 공개한 추론 엔진입니다. 검색과 재순위, 문서를 마크다운으로 바꾸는 변환, 스키마를 지키는 구조화 출력, 콘텐츠 안전 판정, 에이전트 루프까지 서버 하나가 맡습니다. 100개가 넘는 모델을 필요할 때 올리고 LRU 로 내리며, OpenAI 호환 엔드포인트라 기존 코드는 base URL 만 바꾸면 됩니다. 로드밸런싱 게이트웨이와 KEDA 오토스케일링, Grafana 대시보드, Terraform 모듈까지 같은 Apache-2.0 으로 나옵니다.
익명 사용 데이터 수집이 기본으로 켜져 있어 SIE_TELEMETRY_DISABLED=1 로 꺼야 하고, 생성 작업은 별도 sglang 이미지로 같은 포트에 다시 올려야 합니다. 모델 한 종류만 쓸 계획이면 온디맨드 로딩이 값을 못 하고, Kubernetes 없이 프로덕션 스택 전체를 원하면 맞지 않습니다. 추론 인프라라는 말이 가리키는 층이 정확히 이 자리입니다.
freellmapi(9월 22일)는 29개 제공자의 무료 엔드포인트 358개를 OpenAI 호환 주소 하나 뒤로 모으고, 한 제공자가 한도에 걸리면 다음으로 넘깁니다. 프론티어 모델은 없고 SLA 도 없습니다. 상위 모델이 일일 한도를 소진하는 늦은 시간대에는 품질이 눈에 띄게 떨어졌다가 UTC 자정에 회복됩니다. 제공자별 무료 티어 약관이 달라 상업적 용도 전에 직접 확인해야 하고, 모델 카탈로그 자동 갱신은 연 19달러 유료입니다.
Pocket TTS(9월 30일)는 Kyutai Labs 의 CPU 전용 음성 합성 모델입니다. 파라미터 1억 개 규모라 코어 두 개로 돌고, M4 맥북 에어 기준 실시간의 약 6배 속도로 첫 오디오 조각을 약 200밀리초 만에 내놓습니다. 음성 복제와 스트리밍, 길이 제한 없는 입력을 지원합니다. 지원 언어는 영어, 프랑스어, 독일어, 포르투갈어, 이탈리아어, 스페인어 여섯 개이고 한국어는 아직 목록에 없습니다. 목소리마다 라이선스가 달라 배포 전에 개별 확인이 필요합니다.
세 도구는 "내 손에 둔다"의 뜻이 서로 다릅니다. SIE 는 인프라를, freellmapi 는 청구서를, Pocket TTS 는 하드웨어 요구 사항을 내 쪽으로 가져옵니다.
13종의 이름 옆에 런타임, 라이선스, GitHub 스타 수를 막대로 나란히 놓은 비교표
13종의 런타임, 라이선스, 스타 수 비교. 8월 30일 기준

파일시스템과 컴파일러를 갈아 끼우는 실험들

두 저장소의 README 는 첫 문단에서 스스로 선을 긋습니다. Cloudflare Computer 는 PREVIEW ONLY, scriptc 는 실험 단계라고 적어 두었습니다. 그 문장을 읽고 나서야 이 묶음의 쓰임새가 프로토타입 범위라는 것이 분명해졌습니다.
Cloudflare Computer(9월 17일)는 Durable Object 안에서 도는 가상 파일시스템입니다. 권위 있는 상태는 SQLite 가 들고, 실행 진입점 exec 하나로 컨테이너의 FUSE 마운트와 Dynamic Worker 안의 격리 셸을 같은 코드로 바꿔 끼웁니다. 실행 환경을 버려도 파일시스템이 남는다는 것이 핵심이고, 백엔드 없이 파일시스템만 단독으로 쓸 수도 있습니다. FUSE 마운트는 메타데이터가 많은 작업에서는 빠르지만 큰 순차 입출력에서는 실제 디스크에 뒤지고, docs 아래 명세는 현재 코드가 아니라 앞을 내다본 문서입니다.
scriptc(9월 27일)는 TypeScript 와 JavaScript 를 네이티브 실행 파일과 WebAssembly 모듈로 컴파일합니다. 타입 검사는 TypeScript 컴파일러가 그대로 맡고 결과를 LLVM IR 로 내보내 clang 이 컴파일합니다. 만들어진 실행 파일에는 Node 도 자바스크립트 엔진도 들어가지 않고, 정적으로 컴파일할 수 없는 코드는 숨기지 않고 진단으로 보고합니다. coverage 명령이 그 비율을 수치로 보여 줍니다. WASI 대상에서는 네트워크와 자식 프로세스, 시그널, 파일 감시가 링크 전에 실패하고, 크로스 타깃 빌드에는 Zig 가 따로 필요합니다.
두 실험이 여는 질문은 에이전트에게 어떤 실행 환경을 줄 것인가입니다. 상태가 남는 파일시스템과 런타임 없는 바이너리는 각각 그 질문의 한쪽 답입니다.

스킬 하나가 도구 하나인 시대: img2threejs 가 보여주는 배포 단위

img2threejs(10월 2일)의 설치 명령은 바이너리 다운로드가 아니라 git clone 을 스킬 폴더로 하는 것입니다. 참조 이미지 한 장을 받아 사진 측량이나 메시 추출 없이 기본 도형과 절차적 셰이더로 Three.js 팩토리 코드를 만들고, 피벗과 소켓, 충돌체를 갖춘 런타임 계층까지 함께 냅니다. Claude Code 와 Codex, OpenCode 에서 돕니다.
정체성을 이루는 세부 목록을 먼저 세우고 그것이 완성되기 전에는 생성을 막는 게이트가 있고, 검증은 결정적인 파이썬 스크립트가 맡습니다. 보이지 않는 면은 지어내지 않고 낮은 신뢰도로 남기므로 결과물에 빈 곳이 생길 수 있습니다. v1.5 는 스크립트만의 베타이고, README 배지의 버전이 실제 태그보다 낮아 릴리스 탭을 기준으로 봐야 합니다.
바이너리도 패키지도 아닌, 에이전트가 읽는 절차 문서가 배포 단위가 됐습니다. 설치가 clone 한 줄이라는 것은 업데이트도 pull 한 줄이고, 검증은 쓰는 사람 몫이라는 뜻입니다.

13종 발행 일정표와 각 도구를 써 볼 순서

써 볼 순서는 발행일이 아니라 내 상황으로 정하는 편이 낫습니다.
이미 코딩 에이전트를 둘 이상 쓰고 있다면 T3 Code 부터, 하나만 쓰는데 편집 실패 루프가 잦다면 oh-my-pi 부터입니다. 저비용 오픈 모델로 비용을 낮추려면 Open Interpreter 의 하네스 전환을 먼저 시험합니다.
에이전트에게 파괴적 작업을 맡기고 있다면 Agent Governance Toolkit 을 먼저 얹고, 외부에 공개된 앱이 있다면 Strix 를 승인 범위 안에서 돌립니다. 공급망 권고가 떴을 때는 Bumblebee 하나면 됩니다.
모델 호출이 여러 서버에 흩어져 있다면 SIE, 개인 실험이라면 freellmapi, 음성이 필요한데 GPU 가 없다면 Pocket TTS 입니다. 다만 한국어 음성은 아직 지원 목록에 없습니다.
Cloudflare Computer 와 scriptc 는 프로토타입 범위에서만, img2threejs 는 웹 3D 결과물이 필요할 때만 순서에 넣습니다. AOS Community Edition 은 에이전트 실행 환경을 통째로 받고 싶을 때 마지막에 봅니다.
내 상황을 묻는 다섯 갈래 질문에서 출발해 각 갈래가 어느 도구로 이어지는지 보여 주는 결정 흐름
상황별로 먼저 써 볼 도구를 고르는 순서
text
109-05 oh-my-pi 터미널 코딩 에이전트
209-07 SIE 자체 추론 엔진
309-10 T3 Code 에이전트 제어 계층
409-12 Agent Governance Toolkit 에이전트 정책 집행
509-15 Open Interpreter 오픈 모델 코딩 에이전트
609-17 Cloudflare Computer Durable Object 가상 파일시스템
709-20 Strix 자동 침투 테스트
809-22 freellmapi 무료 티어 프록시
909-25 Bumblebee 공급망 점검, 읽기 전용
1009-27 scriptc TypeScript 네이티브 컴파일러
1109-30 Pocket TTS CPU 음성 합성
1210-02 img2threejs 이미지를 Three.js 코드로 만드는 스킬
1310-05 AOS Community Edition 에이전트 운영체제
책상 위에 빈 메모지를 순서대로 늘어놓고 다음 장을 끝에 붙이는 손, 옆에 닫힌 노트북
13종 가운데 넷은 저장소가 스스로 프리뷰나 실험, 베타 단계라고 밝힙니다. 그 문장을 지우지 않고 그대로 옮긴 이유는 도구를 고르는 기준이 스타 수가 아니라 무엇을 못 한다고 밝히는가에 있다고 보기 때문입니다.

자주 묻는 질문

스타 수가 많으면 좋은 도구인가요?

아닙니다. 이번 13종에서 스타가 5천 미만인 Bumblebee 는 공급망 권고가 떴을 때 개발 장비의 설치 상태를 읽기 전용으로 확인하는 자리에서 대체재가 드뭅니다. 반대로 스타가 가장 많은 Open Interpreter 와 Strix 는 각각 하네스 선택과 Docker, API 키, 점검 대상 승인이라는 전제가 없으면 값을 하지 못합니다.

예약된 도구는 왜 한 번에 공개하지 않나요?

각 건을 8월 30일 기준으로 저장소와 문서, 설치 명령을 다시 검증한 뒤 순차 공개하는 운영 방식입니다. 한 번에 올리면 검증 시점과 공개 시점의 차이가 건마다 달라져 오래된 정보가 섞이고, 나중에 공개되는 건일수록 릴리스가 바뀌었을 가능성이 커집니다.

이 목록은 어떻게 골랐나요?

8월 30일 GitHub 수집에서 활동 지표로 후보를 추린 뒤, 저장소가 밝히는 제한 사항과 설치 경로, 이미 등록된 도구와의 중복 여부를 사람이 검토해 13종으로 좁혔습니다. 스타 수는 정렬에 쓰지 않았습니다.

이 글의 사양과 주의점은 2026년 8월 30일에 각 저장소와 공식 문서를 확인한 내용입니다. 공개 전 릴리스가 바뀌면 개별 상세 페이지에서 갱신합니다.

참고·근거

관련 글