AI로 작업을 자동화하는 것은 모델에게 "모든 것을 다 하라"고 요청하는 것이 아닙니다. 작업을 컨텍스트, 규칙, 실행이라는 세 가지 계층으로 분리할 때 제대로 작동합니다. 모델은 무엇을 할지 결정하고, 규칙은 어떻게 행동할지 제약하며, 샌드박스가 위험한 단계를 수행합니다.
이러한 분리는 코딩 워크플로에서 가장 중요합니다. 좋은 에이전트는 저장소를 검사하고, 계획을 수립하고, 파일을 편집하고, 테스트를 실행하고, 결과가 충분히 좋으면 중단할 수 있습니다. 반면 약한 에이전트는 긴 답변만 생성하고 나머지는 사용자에게 맡깁니다.
AI 작업 자동화의 실제 의미
AI 작업 자동화는 명확한 목표와 측정 가능한 완료 기준을 가지고 반복 가능한 작업을 수행하기 위해 모델을 사용하는 것입니다. 실제로는 보통 다음을 의미합니다:
- 저장소나 문서 읽기
- 관련 컨텍스트 추출
- 다음 작업 계획 수립
- 파일 편집 또는 생성
- 결과 검증
핵심은 모델이 추측해서는 안 된다는 점입니다. 모델은 제한된 작업, 소수의 규칙, 정의된 출력 형식을 기반으로 작동해야 합니다.
프롬프트가 아닌 컨텍스트부터 시작하세요
에이전트 계획이 시작되기 전에, 작업에 실제로 필요한 컨텍스트만 수집하세요.
좋은 컨텍스트는 다음과 같습니다:
- 저장소 구조
- 변경 가능성이 가장 높은 파일
- 스타일 가이드 또는 가드레일
- 최근 오류, 로그 또는 실패한 테스트
- 완료 조건
나쁜 컨텍스트는 다음과 같습니다:
- 전체 코드베이스 덤프
- 이전 대화 내용 전체
- 관련 없는 티켓
- “더 좋게 만들어라” 같은 모호한 목표
모델에 너무 많은 노이즈가 있으면 계획을 잘못 세웁니다. 너무 적으면 지나치게 일반화합니다.
규칙을 문서화하세요
규칙은 짧고 명시적이며 기계가 읽을 수 있어야 합니다. 의도 대신 경계를 설명할 때 가장 효과적입니다.
예시:
{
"goal": "실패한 태스크 러너 수정",
"constraints": [
"태스크 러너 파일만 수정",
"공개 API는 변경하지 않음",
"각 코드 변경 후 태스트 실행",
"디프가 관련 없는 모듈에 영항을 미치면 중단"
],
"done_when": [
"테스트 통과",
"로그가 깨끗함",
"출력이 예상된 태스크 순서와 일치"
]
}
이런 구조는 에이전트가 올바른 방향을 유지하는 데 도움이 됩니다.
계획 수립에는 오픈 모델을 사용하세요
폐쇄형 소스 옵션과 경쟁할 수 있는 오픈 모델을 원한다면, Novita의 GPT-OSS-120B가 강력한 선택입니다: Novita의 GPT-OSS 비교글에 따르면 GPT-4o와 경쟁할 만한 성능을 보입니다. Novita의 GPT-OSS 엔드포인트 성능 보고서에서 호스팅된 엔드포인트는 AIME 및 GPQA에서 최고 성능을 기록했으며, 이는 계획 중심 자동화에 정확히 필요한 신호입니다.
계획 단계에서는 실행 전에 투명한 모델 스택을 원할 때 openai/gpt-oss-120b를 사용하세요.
이는 작업 자동화에 유용한 이유는 계획 수립이 단순히 유창한 출력이 아닌 체계적인 추론을 필요로 하기 때문입니다. 계획 모델은 모호한 요청을 구체적인 일련의 작업으로 변환해야 합니다.
실행은 샌드박스로 이동하세요
계획이 명확해지면 위험한 작업을 Novita Agent Sandbox에 넘기세요.
다음과 같은 작업에 적합한 곳입니다:
- 명령 실행
- 파일 편집
- 의존성 설치
- 로그 확인
- 출력 검증
모델이 결정해야 합니다. 샌드박스가 실행해야 합니다. 이러한 계층을 분리하면 자동화가 더 안전해지고 디버깅하기 쉬워집니다.
실용적인 워크플로
- 목표를 한 문장으로 정의합니다.
- 문제 해결에 필요한 최소 컨텍스트를 추가합니다.
- 짧은 규칙 세트를 작성합니다.
- 모델에게 단계별 계획을 요청합니다.
- 샌드박스에서 계획을 실행합니다.
- 결과를 확인한 후 진행합니다.
작업이 자주 반복된다면 계획을 템플릿으로 만드세요. 이것이 일회성 에이전트가 워크플로가 되는 방법입니다.
좋은 자동화의 모습
좋은 AI 자동화는 가장 좋은 의미에서 지루합니다. 예측 가능하고, 범위가 좁으며, 검토하기 쉽습니다. 다음 질문에 답할 수 있어야 합니다:
- 모델이 무엇을 알고 있었니?
- 모델이 무엇을 하면 안 되었니?
- 샌드박스 내부에서 무엇이 실행되었니?
- 출력이 올바른지 어떻게 알 수 있니?
이러한 질문에 답할 수 없다면 해당 워크플로는 아직 자동화되지 않은 것입니다. 단지 보조된 것뿐입니다.
관련 빌딩 블록
이를 실제 시스템으로 전환하려면 다음 글들을 읽어보세요: What Are Coding Agents?, Agent Runtime vs Code Interpreter, What Is MCP?. 실행 루프, 런타인 경계, 자동화를 안정적으로 만드는 도구 연결 계층을 다룹니다.
결론
AI로 작업을 자동화하려면 계획을 작게 유지하고, 규칙을 엄격하게 유지하며, 실행을 격리된 상태로 유지하세요. 모델 계층에는 Novita AI를 사용하고, 오� 웨이트 계획 옵션이 필요할 때는 openai/gpt-oss-120b를 사용하며, 실제 파일이나 명령을 건드려야 하는 작업에는 Novita Agent Sandbox를 사용하세요.
이 워크플로의 전체 코딩 에이전트 버전을 원한다면 What Are Coding Agents?, Agent Runtime vs Code Interpreter, MCP Server Sandbox: Isolated MCP Servers with Filesystem, Secrets, and Network Controls를 읽어보세요.
FAQ
AI로 작업을 자동화하는 가장 좋은 방법은 무엇인가요?
좁은 범위의 작업부터 시작하고, 명시적인 규칙을 추가하며, 계획 수립과 실핼을 분리하세요.
AI 작업 자동화에 샌드박스를 사용하는 이유는 무엇인가요?
파일 편집과 명령 실핼이 모델 자체의 프롬프트가 아닌 격리된 환결에서 이뤄져야 하기 때입니다.
언제 오� 웨이트 모델를 사용해야 하나요?
계획 계층에 대한 더 많은 제어와 추론하기 쉬운 스택이 필요할 때 사용하세요.
추천 자료
