크레딧 기반 청구가 가능한 엔터프라이즈 멀티 모델 AI 채팅 플랫폼
한 조직은 팀이 여러 AI 모델(GPT, Claude, Gemini, Grok, Perplexity)에 접근할 수 있는 통합 플랫폼이 필요했습니다. 이 플랫폼은 엔터프라이즈급 보안, 사용 추적 및 비용 관리를 제공합니다.
프로젝트 상담하기
과제
팀은 중앙 집중화나 비용 통제 없이 여러 AI 도구를 사용하고 있었습니다:
- 각 팀원은 다른 AI 제공자에 개별 구독을 가지고 있었습니다
- 조직 전체에 통합된 대화 기록이나 지식 공유가 없었습니다
- AI 사용 비용이나 사용자별 소비에 대한 가시성이 없었습니다
- 엔터프라이즈 보안 및 GDPR 준수 요구 사항을 소비자 도구로 충족할 수 없었습니다
- 모델 출력을 비교하려면 여러 인터페이스를 전환해야 했습니다
우리의 솔루션
우리는 크레딧 기반 청구, 역할 기반 접근 제어 및 GDPR 준수를 갖춘 프로덕션급 멀티 모델 AI 채팅 플랫폼을 구축했습니다.
아키텍처
- 프론트엔드: React 18 + TypeScript + Vite with Tailwind CSS
- 백엔드: Node.js/Express with TypeScript and Prisma ORM
- 데이터베이스: PostgreSQL (60+ 테이블) with Redis 캐싱
- 인증: AWS Cognito with JWT 기반 RBAC
- 청구: LemonSqueezy with 크레딧 기반 소비 추적
- 큐: BullMQ for 백그라운드 작업 처리
- 인프라: AWS (ECS/Fargate, RDS, ElastiCache, S3, KMS, SES)
AI 통합
- OpenAI GPT 모델
- Anthropic Claude 모델
- Google Gemini 모델
- xAI Grok 모델
- 웹 검색을 위한 Perplexity
- AI 음악 생성을 위한 Suno
주요 기능
- 멀티 모델 채팅 - 대화당 AI 제공자 전환
- 분할 화면 비교 - 모델 출력의 나란히 비교
- 워크플로 자동화 - LangGraph 기반 단계별 AI 워크플로
- GPT 마켓플레이스 - 사용자 정의 GPT 발견, 생성 및 공유
- 아티팩트 - 대화 내에서 샌드박스된 코드/HTML 미리보기
- 크레딧 시스템 - 자동 충전 및 관리자 부여가 가능한 사용량 기반 결제
- GDPR 준수 - 자동 삭제, 데이터 내보내기, AES-256-GCM 암호화
- 콘텐츠 모더레이션 - 부적절한 콘텐츠에 대한 자동 분류 시스템
- 그룹 채팅 - 단일 대화에서 여러 AI 참가자
- 웹 검색 - 최신 정보를 제공하는 Perplexity 통합
결과
기술 스택
caseStudyDetail.more 사례 연구
더 많은 기술 구현 사례를 살펴보세요
자주 묻는 질문
MicrocosmWorks는 작업 유형, 복잡성 및 토큰 요구 사항에 따라 들어오는 프롬프트를 평가하는 지능형 라우팅 계층을 설계했으며, GPT-4, Claude, Llama 또는 전문 미세 조정 모델이든 관계없이 가장 적절한 모델로 디스패치합니다. 이러한 접근 방식은 더 간단한 쿼리는 더 빠르고 저렴한 모델로 처리하고 복잡한 추론 작업은 더 유능한 모델로 보내기 때문에 응답 품질과 비용을 모두 최적화합니다.
MicrocosmWorks는 다양한 AI 제공업체의 토큰당 가변 비용을 추상화하여 엔터프라이즈 고객이 대량으로 구매하는 단일 내부 통화로 변환하는 통합 크레딧 시스템을 구현했습니다. 각 모델 상호작용은 실제 API 비용에 구성 가능한 마진을 더한 것에 비례하여 크레딧을 차감하며, 이를 통해 관리자는 단일 대시보드에서 사용량을 추적하고, 부서별 예산을 설정하고, 차지백 보고서를 생성할 수 있습니다.
네, MicrocosmWorks는 어떤 하위 LLM이 쿼리를 처리하든 상관없이 일관된 데이터 처리 정책을 강제하는 중앙 집중식 거버넌스 레이어를 구축했습니다. 모든 대화는 저장 시 암호화되며, 역할 기반 접근 제어가 어떤 팀이 어떤 모델에 접근할 수 있는지 결정하고, 구성 가능한 보존 정책이 귀하의 규정 준수 요구 사항에 따라 대화 기록을 자동으로 삭제합니다.
MicrocosmWorks는 라우팅 계층을 최적화하여 요청당 50 milliseconds 미만의 오버헤드를 추가했습니다. 이는 일반적인 LLM 응답 시간인 1-10 seconds와 비교할 때 무시할 수 있는 수준입니다. 해당 플랫폼은 connection pooling, 각 공급자와의 사전 인증된 세션, 그리고 async streaming을 사용하여 선택된 모델이 tokens 생성을 시작하는 즉시 user interface에 표시되기 시작하도록 합니다.
MicrocosmWorks는 시간당 $30-$50의 개발 요율로 엔터프라이즈 멀티모델 채팅 플랫폼을 구축합니다. 이는 대형 컨설팅 회사가 유사한 AI 인프라 프로젝트에 청구하는 비용의 일부에 불과합니다. 총 범위는 모델 통합 수, 인증 및 SSO 요구 사항, 그리고 대화 분기, 프롬프트 라이브러리 또는 미세 조정 파이프라인과 같은 기능이 필요한지 여부에 따라 달라집니다.