AWS, 오픈소스 Strands Harness로 AI 에이전트 사전 조립 지원
2026년 9월 23일, AWS는 Apache‑2.0 라이선스로 제공되는 Strands Harness를 공개했습니다. 이 환경은 도구, 컨텍스트 처리 및 다중 모델 지원이 내장된 AI 에이전트를 즉시 제공해 토큰 사용량을 최대 28 % 절감합니다.

AWS는 2026년 9월 23일 Strands Harness의 공개 출시를 발표했습니다. 이 프로젝트는 Apache 2.0 라이선스 하에 오픈소스로 제공되어 개발자가 코드를 자유롭게 다운로드, 검토 및 수정할 수 있습니다.
Strands Harness는 즉시 사용 가능한 에이전트 프레임워크로 설계되었습니다. 단일 임포트만으로 쉘, 파일 읽기·쓰기 기능, 웹 액세스, 세션 간 메모리, 작업 목록, 보조 에이전트 및 추가 스킬 로드를 위한 플러그인 시스템을 갖춘 완전 조립형 AI 에이전트를 제공합니다.
핵심 구성 요소와 기본 모델
이 하네스는 기본 모델 제공자로 Amazon Bedrock을 사용하지만, 개발자는 간단한 설정 플래그를 통해 Anthropic, OpenAI, Google 또는 Ollama 모델로 전환할 수 있습니다. 이러한 유연성은 에이전트 로직을 다시 작성하지 않고도 다양한 LLM 백엔드를 실험할 수 있게 합니다.
각 에이전트 인스턴스에는 미세 조정 가능한 시스템 프롬프트, 대화 기록을 추적하는 컨텍스트 매니저, 도구 실행 전후에 사용자 정의 코드를 호출하는 훅이 포함됩니다. 이는 프로덕션 수준의 자율 어시스턴트를 구축하는 데 필요한 엔지니어링 노력을 크게 줄이도록 설계되었습니다.
토큰 효율성 메커니즘
Byline에 따르면, 이 하네스는 장시간 실행 도구의 출력을 자동으로 약 1 500 토큰으로 요약합니다. 전체 컨텍스트 창이 용량의 약 85 %에 도달하면, 압축 루틴이 오래된 메시지를 정리해 새로운 상호작용을 위한 공간을 확보합니다.
AWS는 6개의 벤치마크 스위트 전반에 걸쳐 평균 토큰 감소율이 28 %에 달하면서도 답변 정확도를 유지하거나 향상시킨다고 주장합니다. 방법론을 상세히 설명한 기술 논문은 추후 공개될 예정입니다.
특정 모델에 대한 성능 주장
Fable 5 모델과 결합했을 때, AWS는 유사 작업 부하에서 Claude Code 대비 비용이 77 % 낮다고 보고했습니다. 동일 구성은 Terminal Bench 2.1 벤치마크에서도 높은 점수를 얻었으나, 해당 수치는 제공자의 내부 테스트 결과입니다.
이 하네스는 Python과 TypeScript 두 언어로 구현되어 기존 코드베이스와 폭넓게 통합할 수 있습니다. 컨테이너화된 Linux 환경 어디에서든 배포 가능하며, 필요에 따라 기본 SDK를 커스터마이징할 수 있는 유연성을 제공합니다.
- 단일 임포트로 쉘 및 파일 시스템 접근 기능 제공
- 다중 모델 지원: Bedrock, Anthropic, OpenAI, Google, Ollama
- 자동 도구 출력 요약 (~1 500 토큰)
- 컨텍스트 창 85 % 사용 시 압축 수행
- Python 또는 TypeScript 기반, 모든 Linux 컨테이너에서 배포 가능
Strands Harness의 오픈소스 특성 덕분에 커뮤니티 기여를 통해 새로운 훅, 스킬 로더 또는 메모리 전략을 추가할 수 있습니다. AWS는 이슈, 풀 리퀘스트 및 문서 업데이트를 공개적으로 관리하는 GitHub 저장소를 개설했습니다.
이미 AWS 서비스를 활용하고 있는 조직에게 이 하네스는 기존 Bedrock 배포와 자율 에이전트를 손쉽게 통합할 수 있는 경로를 제공하며, 라이선스나 비용 문제 발생 시 대체 공급자로 전환할 옵션도 유지합니다.
Strands Harness가 제공하는 자동 요약 및 컨텍스트 압축 메커니즘은 토큰 소비를 절감하면서도 대화 흐름을 유지하도록 설계되었습니다. 이 과정에서 요약 알고리즘은 도구 실행 결과를 핵심 내용만 보존하도록 재구성하고, 오래된 메시지는 압축 루틴에 의해 선택적으로 정리됩니다. 이러한 접근은 토큰 제한에 도달했을 때 발생할 수 있는 응답 지연이나 오류를 예방하고, 장기적인 작업 흐름에서도 일관된 성능을 보장하는 데 기여합니다.
프레임워크에 내장된 시스템 프롬프트와 컨텍스트 매니저는 에이전트의 행동을 일관되게 제어하면서도 필요에 따라 사용자 정의 코드를 삽입할 수 있는 훅을 제공합니다. 이러한 구조는 개발자가 복잡한 로직을 별도 구현하지 않고도 특정 상황에 맞는 응답을 조정할 수 있게 하며, 결과적으로 엔지니어링 비용과 유지 보수 부담을 크게 경감시킵니다. 다만, 훅의 빈번한 사용은 실행 흐름을 복잡하게 만들 수 있어 디버깅 난이도가 상승할 가능성이 존재합니다.
다중 모델 지원은 모델 교체 시 에이전트 로직을 재작성할 필요 없이 플래그만 변경하면 된다는 장점을 제공합니다. 이는 비용 효율성 측면에서 모델 가격 변동이나 특정 모델의 서비스 종료에 대비할 수 있는 유연성을 부여합니다. 그러나 모델마다 프롬프트 최적화와 출력 형식이 다를 수 있기 때문에, 동일한 설정이라도 성능 차이가 발생할 가능성을 염두에 두어야 합니다.
오픈소스 특성 덕분에 커뮤니티가 새로운 훅, 스킬 로더, 메모리 전략 등을 추가할 수 있습니다. 이러한 외부 기여는 프레임워크의 기능을 지속적으로 확장하고, 다양한 사용 사례에 맞는 맞춤형 솔루션을 빠르게 제공하게 합니다. 반면, 비공식적인 기여물은 품질 관리와 보안 검증이 충분히 이루어지지 않을 위험이 있어, 프로덕션 환경에 적용하기 전에는 철저한 검증 절차가 필요합니다.
배포 측면에서 Python과 TypeScript 양쪽 언어를 지원하고, 컨테이너화된 Linux 환경 어디에서든 실행 가능하도록 설계된 점은 인프라 선택의 자유도를 높입니다. 이는 기존 CI/CD 파이프라인에 쉽게 통합될 수 있어 운영 효율성을 향상시킵니다. 다만, 컨테이너 이미지 크기와 의존성 관리가 복잡해질 경우 초기 설정 비용이 증가할 수 있으며, 이를 최소화하기 위한 이미지 최적화 전략이 요구됩니다.
실제 조직에서 Strands Harness를 도입할 경우, 토큰 최적화와 모델 교체 유연성 덕분에 클라우드 비용 절감과 공급자 종속성 감소라는 두 가지 주요 이점을 기대할 수 있습니다. 동시에, 자동 요약과 압축 로직이 응답 정확도에 미치는 영향을 지속적으로 모니터링하고, 필요 시 커스텀 압축 파라미터를 조정함으로써 품질 저하를 방지해야 합니다. 이러한 운영 검증과 피드백 루프가 마련될 때, 장기적인 비용 효율성과 안정성을 동시에 확보할 수 있습니다.
실제로 한국 기업은 이제 몇 분 만에 완전 기능의 AI 어시스턴트를 가동할 수 있으며, 내장된 토큰 최적화 덕분에 클라우드 컴퓨팅 비용이 절감됩니다. 또한 LLM 공급자를 자유롭게 교체할 수 있어 가격 변동이나 모델 폐기에 대비한 미래 보장도 가능합니다.
출처
- Strands harnessStrands Agents · 2026년 9월 23일
- AWS, AI 에이전트 실행환경 스트랜즈 하네스 공개Byline Network · 2026년 9월 23일



