1 of 14

Daeun Kim

M.S. Student

dekim@seoultech.ac.kr

Agent System

AI Agent Study

2 of 14

2/13

Contents

  1. Agent 시스템의 구성요소
  2. Model
  3. Tool
  4. Memory
  5. Orchestration
  6. Agent architecture: Single-Agent vs. Multi-Agent
  7. 설계 trade-off

3 of 14

3/13

Agent System의 구성요소

User

Model

Tool

Memory

Orchestration

4 of 14

4/13

    • agent의 의사결정, 상호작용, 학습 역량 등을 결정함
      • 시스템의 성능, 확장성, 지연시간, 비용에 직접적인 영향을 미침

Model

Large model

복잡한 추론, 예외 처리, 창의적 생성이 필요한 개방형 환경에 적합

small model

빠른 응답, 낮은 운영 비용으로 �구조화된 환경에 적합

LIama 3.2(1B/3B)

5 of 14

5/13

    • agent가 특정 작업을 수행하고 문제를 해결할 수 있게 함

    • 로컬 도구
      • 외부 의존성 없이 내부 로직과 계산만으로 작업 수행
      • 수학 계산, 로컬 데이터베이스 조회 등 규칙 기반이거나 사전에 정의된 함수를 실행하는 방식

    • API 기반 도구
      • 외부 서비스나 데이터 소스와 상호작용 가능
      • 날씨 정보, 주식 가격 등 실시간 데이터를 조회하거나 외부 시스템을 통해 로컬 환경 너머의 기능을 수행할 수 있음

    • MCP (Model Context Protocol)
      • 표준 스키마를 통해 사용자 프로필, 대화 이력 같은 구조화된 실시간 context를 prompt에 직접 전달’
      • 표준화된 방식으로 도구 호출

Tool

6 of 14

6/13

    • agent가 정보를 저장하고 검색할 수 있게 함

    • 단기 메모리
      • 현재 작업이나 대화와 관련된 정보를 저장하고 관리
      • agent가 실시간으로 일관된 의사결정을 내릴 수 있음

Memory

내일 부산 가는 KTX 찾아줘

오전 10시 이후

몇 시 출발을 원하세요?

destination: 부산

date: 내일

time: 오전 10시 이후

agent의 메모리

예약 작업이 끝나면 메모리가 사라짐

여행 예약 agent

7 of 14

7/13

    • 장기 메모리
      • 오랜 기간에 걸쳐 지식과 경험을 저장하도록 하여 과거 정보를 바탕으로 향후 행동을 결정할 수 있게 함
      • 데이터베이스, knowledge graph, 파인튜닝된 모델을 통해 구현됨

Memory

메모리를 지속적으로 저장하고 다음 작업에도 사용

8 of 14

8/13

    • LLM, Tool, Memory 등 agent의 구성요소가 어떤 순서로, 어떤 조건에서 실행될지 조정함

Orchestration

내일 부산 가는 KTX 찾아줘

오전 10시 이후

몇 시 출발을 원하세요?

여행 예약 agent

User의 질문

LLM (의도 파악)

Tool (항공 API 검색)

Memory (이전 대화 참고)

LLM (결과 정리)

User 답변

9 of 14

9/13

    • Single-Agent
      • 하나의 agent가 시스템 내 모든 작업을 관리하고 실행함
      • ex) 기본적인 고객 문의 (FAQ, 주문 조회 등)에 대응하는 간단한 챗봇

    • Multi-Agent
      • 여러 agent가 공동의 목표를 달성하기 위해 협력
      • 각 agent는 작업의 성격에 따라 독립적으로, 병렬적으로, 조율된 방식으로 작동 가능

Agent architecture: Single-Agent vs. Multi-Agent

10 of 14

10/13

Agent architecture: Single-Agent vs. Multi-Agent

11 of 14

11/13

설계 trade-off

    • 설계 trade-off: 성능, 확장성, 신뢰성, 비용 사이의 다양한 trade-off를 균형 있게 조정해야 함
      • 성능: 빠른 속도 vs 완벽한 정확도
      • 확장성: GPU를 효율적으로 활용해야 함
        • 동적 GPU 할당 기법: 실시간 수요에 따라 GPU를 배정해 필요할 때만 사용해 유휴 시간을 줄임
        • 탄력적 GPU 프로비저닝: 은프레미스 GPU 클러스트를 이용해 현재 workload에 따라 자동으로 리소스 확장/축소
        • 우선 순위 큐잉+지능형 작업 스케줄링: 중요한 작업에 즉시 GPU 접근 권한 부여, 덜 중요한 작업은 대기시켜 놓음으로써 효율성 높임

12 of 14

12/13

설계 trade-off

    • 설계 trade-off: 성능, 확장성, 신뢰성, 비용 사이의 다양한 trade-off를 균형 있게 조정해야 함
      • 지연 시간: 실시간으로 상호작용해야 하는 경우 최소 지연으로 작동해야 함
        • 비동기 작업 실행: GPU 작업 병렬 처리 -> 작업 간 유휴 시간 최소화
        • 동적 로드 밸런싱: 활용률 낮은 GPU로 작업 분산시켜 병목 줄임
      • 신뢰성: 예상치 못한 오류에도 시스템 멈추지 않고 복구/작동 가능하도록 설계
      • 비용: 얻을 수 있는 가치와 운영 비용 적절하게

13 of 14

Summary

    • agent의 구성 요소
      • Model, Tool, Memory와 이를 조정하고 관리하는 orchestration으로 이루어져 있음

    • Model: 다양한 model이 존재, 상황에 맞게 사용하면 됨

    • Tool: 특정 작업을 수행하고 문제를 해결할 수 있음
      • 로컬 도구, API 기반 도구, MCP

    • Memory: 정보를 저장하고 검색할 수 있음
      • 단기 메모리, 장기 메모리

    • Orchestration: agent의 구성요소가 어떤 순서로, 어떤 조건에서 실행될지 조정

    • Agent architecture
      • Single-Agent vs. Multi-Agent

14 of 14

감사합니다

Daeun Kim

M.S. Student

dekim@seoultech.ac.kr