Novita AI Agent Sandbox, CI/CD

StarSling이 Novita Agent Sandbox로 자체 개선형 CI를 구축하는 방법

StarSling이 Novita Agent Sandbox로 자체 개선형 CI를 구축하는 방법

StarSling은 GitHub Actions 파이프라인이 과도한 빌드 부하, 긴 대기 시간, 복잡한 테스트 워크플로에 직면한 R&D 팀을 위한 AI 네이티브 CI 플랫폼입니다. 목표는 더 빠른 CI만이 아니라 스스로 계속 개선되는 CI입니다: 실행을 분석하고, 최적화를 제안하고, 안전하게 테스트하고, 성공한 변경을 프로덕션 준비가 된 pull request로 전환하는 것입니다. 그 루프를 실용적으로 만들기 위해 StarSling은 Novita Agent Sandbox를 격리된 microVM, 탄력적 컴퓨트, 에이전트 실험, 재현 가능한 평가를 위한 실행 계층으로 사용합니다.

이 조합이 중요한 이유는 CI 최적화가 본질적으로 실험적이기 때문입니다. 캐싱, 병렬화, 테스트 샤딩 또는 워크플로 구조에 대한 변경은 한 저장소에는 도움이 되고 다른 저장소에는 해가 될 수 있습니다. StarSling은 고객 시스템을 위험에 빠뜨리지 않으면서 실제 조건에 맞서 변경을 시도할 방법이 필요합니다. Novita Agent Sandbox는 각 실험에 통제된 작업 공간을 제공한 다음, 승격 결정은 증거와 리뷰에 맡깁니다.

이 사례 연구에서는 CI 최적화를 자동화하기 어려운 이유, StarSling이 에이전트 루프를 실행하는 방법, 격리된 실행이 바꾸는 것, 그리고 동일한 아키텍처가 다른 AI 워크플로에 어떻게 적용되는지 살펴봅니다.

CI 최적화를 자동화하기 어려운 이유

많은 엔지니어링 팀은 느린 CI가 무엇을 초래하는지 이미 알고 있습니다: 지연된 머지, 유휴 리뷰 주기, 느린 피드백, 제품 작업에 쓸 시간 감소입니다. 일반적인 해결책도 익숙합니다. 의존성을 캐시하고, 테스트를 샤딩하고, 작업을 병렬화하고, 중복 작업을 줄이고, 불안정한 검사를 제거하고, 중요한 피드백이 더 일찍 도착하도록 파이프라인을 재구성하는 것입니다.

어려운 부분은 그런 아이디어를 나열하는 것이 아닙니다. 특정 저장소에 어떤 변경이 안전하고 효과적인지 증명하는 것입니다. 워크플로 파일에는 로그만으로는 분명하지 않을 수 있는 역사적 제약, 조직의 선호, 타이밍 가정, 의존성이 담겨 있습니다. 비슷한 빌드 시간을 가진 두 팀이 서로 다른 해결책을 필요로 할 수 있습니다. 한 팀은 더 나은 캐싱이 필요할 수 있고, 다른 팀은 테스트 격리, 더 많은 병렬화 또는 더 작은 임계 경로가 필요할 수 있습니다.

수동 최적화 역시 많은 저장소와 고객 전반으로 확장하기 어렵습니다. 누군가는 로그를 검사하고, 가설을 세우고, 워크플로를 편집하고, 작업을 다시 실행하고, 결과를 비교하고, 반복해야 합니다. 이 과정은 전문가의 시간을 소모하며 파이프라인이 진화함에 따라 효과가 있었던 것을 보존하기 어렵게 만듭니다.

여기서 AI 에이전트가 도움이 될 수 있지만, 안전한 실행 경계가 있을 때만 그렇습니다. StarSling의 에이전트는 워크플로와 텔레메트리를 검사하고, 최적화 변경을 생성하고, 제안하기 전에 그 변경을 테스트합니다. 그 루프를 프로덕션 CI 내부에서 직접 실행하면 실험이 위험해지고 통제하기 어려워집니다. 에이전트는 운영상 위험이 되지 않으면서 행동하고, 실패하고, 재시도하고, 측정할 수 있어야 합니다.

StarSling이 최적화 루프를 실행하는 방법

StarSling은 CI를 스스로 관찰하고 개선할 수 있는 시스템으로 취급합니다. 워크플로는 증거에서 시작합니다: 빌드 시간, 테스트 동작, 로그, 리소스 사용량, 파이프라인 구조입니다. 그 증거로부터 StarSling은 반복되는 설정 작업, 잘못 샤딩된 테스트, 불필요한 직렬화, 또는 필요 이상으로 시간을 소비하는 워크플로 단계와 같은 후보 병목을 식별할 수 있습니다.

다음 단계는 실험입니다. StarSling은 제안된 최적화를 만들고 그것이 실제로 파이프라인을 개선하는지 확인합니다. 실제 경과 시간을 줄이나요? 비용을 낮추나요? 정확성을 보존하나요? 조건이 바뀌면 깔끔하게 실패하나요? 이런 질문에는 정적 분석만이 아니라 실행이 필요합니다.

실험이 성공하면 결과는 리뷰할 수 있는 구체적인 변경이 될 수 있습니다: 워크플로 업데이트, 캐시 조정, 테스트 샤딩 변경 또는 다른 파이프라인 개선입니다. 그 출력을 pull request에 유지하면 엔지니어가 프로덕션에 도달하기 전에 검사할 명확한 아티팩트를 얻습니다.

StarSling은 고객들이 CI가 최대 6배 더 빨라지고 최대 13배 더 저렴해지는 것을 확인했다고 보고합니다. 이는 고객 결과이며 보편적인 보장이 아닙니다. 결과는 저장소 형태, 테스트 스위트, 인프라, 존재하는 병목 유형에 따라 달라집니다. 그래도 이 패턴은 유용합니다. 자동화를 측정과 결합하여 개선이 추측이 아니라 관찰된 파이프라인 동작으로 뒷받침되도록 하십시오.

Novita Agent Sandbox가 제공하는 것

Novita Agent Sandbox는 StarSling에 에이전트 워크로드를 위한 격리된 microVM을 제공합니다. 고객 CI 시스템이나 내부 서비스와 실행을 직접 공유하는 대신, 각 에이전트 실행은 자체 통제된 환경을 가질 수 있습니다. 이 분리는 탐색적 명령, 의존성 또는 실패한 실험이 다른 작업을 방해할 가능성을 줄입니다.

두 번째 속성은 탄력성입니다. CI 최적화 실험은 버스트성이 있습니다: 조사 중에는 많은 실행이 있고, 변경이 리뷰 준비되면 더 적을 수 있습니다. 샌드박스 컴퓨트를 사용하면 StarSling은 제한된 내부 리소스 때문에 모든 고객 구현이 기다리게 하지 않고 필요할 때 실험을 실행할 수 있습니다.

세 번째 속성은 재현성입니다. 실험을 재현하면 실제 개선과 노이즈를 구분하는 데 도움이 됩니다. 격리된 환경을 통해 StarSling은 일관된 조건에서 에이전트 작업을 평가하고, 변경을 검증하고, 최적화를 더 자신 있게 진행할 준비가 되었는지 결정할 수 있습니다.

이러한 속성은 함께 에이전트 루프를 임시 스크립트가 아니라 실용적인 제품 워크플로로 만듭니다. 샌드박스는 인간의 결정이 사라지는 곳이 아닙니다. 유용한 결정을 내릴 수 있을 만큼 후보를 안전하게 테스트할 수 있는 곳입니다.

AI 네이티브 CI를 위한 결과

이 접근 방식은 서로 연결된 세 가지 이점을 만듭니다.

더 빠른 최적화 실험. StarSling은 병목을 식별하고 수정을 배포하기까지의 시간을 단축할 수 있습니다. 수동 조사 주기를 기다리는 대신 후보 변경이 제안, 실행, 측정, 리뷰의 구조화된 루프를 거칩니다.

안정적인 에이전트 실행. 격리된 환경은 에이전트 기반 자동화가 확장될 때 운영 위험을 줄입니다. 에이전트는 반복적으로 실행되고 안전하게 실패할 수 있으며, 이는 워크플로 자체가 CI 변경을 테스트하는 책임을 질 때 필수적입니다.

더 쉬운 다중 고객 확장. Novita Agent Sandbox는 실제 CI 파이프라인에 AI 최적화를 배포하는 장벽을 낮춥니다. StarSling은 모든 새 저장소나 사용 사례마다 실행 기반을 다시 구축하지 않고도 더 많은 고객을 지원할 수 있습니다.

StarSling CTO Daniel Worku는 운영 효과를 다음과 같이 설명했습니다:

“Novita Sandbox는 우리가 CI 워크로드를 대규모로 안전하고 재현 가능하게 실행할 수 있는 격리된 환경을 제공했습니다. 그들의 엔지니어는 세계적 수준이며 우리가 요청하는 모든 것을 몇 주가 아니라 며칠 만에 제공합니다.”

그 인용문은 더 넓은 교훈을 가리킵니다: 에이전트 기반 자동화가 유용해지려면 에이전트 인프라가 먼저 안정적이어야 합니다. 격리, 탄력성, 반복 가능성은 구현 세부 사항이 아니라 AI 워크플로가 프로덕션 시스템 가까이에서 작동할 수 있게 하는 조건입니다.

이 아키텍처를 적용하는 방법

실제 시스템을 안전하게 변경해야 하는 모든 에이전트 워크플로에 이 패턴을 재사용할 수 있습니다.

첫째, 분석 영역과 실행 영역을 분리하십시오. 로그와 메트릭은 후보 변경에 정보를 줄 수 있지만, 변경은 프로덕션에 도달하기 전에 제한된 환경에서 테스트되어야 합니다.

둘째, 리뷰 대상 아티팩트를 정의하십시오. CI 최적화에서는 일반적으로 워크플로 diff 또는 구성 변경입니다. 코드 생성에서는 패치일 수 있습니다. 데이터 작업에서는 쿼리, 노트북 또는 보고서일 수 있습니다. 리뷰 가능한 아티팩트는 에이전트의 작업을 감사 가능하게 만듭니다.

셋째, 전후를 측정하십시오. CI의 경우 기간, 비용, 실패율, 불안정한 테스트, 대기열 시간, 피드백까지의 시간을 추적하십시오. 단일 속도 수치는 다른 곳의 회귀를 숨길 수 있습니다.

넷째, 권한을 좁게 유지하십시오. 최적화 에이전트에는 무제한 네트워크 액세스, 프로덕션 시크릿 또는 병합 권한이 필요하지 않습니다. 실험을 실행하고 증거를 생성하는 데 필요한 최소한의 액세스만 부여하십시오.

다섯째, 승격을 위한 사람의 승인 게이트를 유지하십시오. 샌드박스는 변경이 테스트 조건에서 예상대로 작동했는지 확인할 수 있습니다. 사람과 기존 리뷰 프로세스가 그 변경이 프로덕션에 적절한지 여전히 결정해야 합니다.

자주 묻는 질문

StarSling이란 무엇인가요?

StarSling은 AI 네이티브 CI 플랫폼입니다. CI 워크로드를 분석하고, 캐싱, 병렬화, 테스트 샤딩과 같은 개선을 제안하며, 엔지니어링 팀을 위한 최적화 pull request를 생성합니다.

StarSling은 Novita Agent Sandbox를 어떻게 사용하나요?

StarSling은 Novita Agent Sandbox를 사용해 격리된 microVM에서 에이전트 워크플로를 실행하고, 반복 실험을 위한 탄력적 컴퓨트에 액세스하고, 재현 가능한 조건에서 CI 최적화 변경을 평가합니다.

6배 속도 향상이 모든 CI 파이프라인에 적용되나요?

아니요. StarSling은 일부 고객이 CI가 최대 6배 더 빨라지고 최대 13배 더 저렴해지는 것을 확인했다고 보고합니다. 결과는 파이프라인, 테스트 스위트, 저장소 구조, 관련된 병목에 따라 달라집니다.

CI 최적화 에이전트에 샌드박스가 필요한 이유는 무엇인가요?

샌드박스는 에이전트가 고객 CI 시스템이나 공유 인프라를 직접 방해하지 않고 명령을 실행하고 변경을 테스트할 장소를 제공합니다. 또한 실험 간 더 깨끗한 비교를 지원합니다.

추천 글

출처

관련 게시글