오늘 NVIDIA NIM/NeMo와의 새로운 통합을 발표하게 되어 기쁩니다. 이번 블로그 포스트에서는 다음과 기반한 대화형 챗봇의 솔루션 개념을 소개합니다. 검색 증강 생성 (RAG) Couchbase Capella를 벡터 데이터베이스로 활용하는 아키텍처. RAG 파이프라인의 검색 및 생성 단계는 다음을 통해 가속화됩니다: NVIDIA NIM/NeMo 단 몇 줄의 코드.
다양한 산업군의 기업들은 고객에게 최고의 고객 서비스를 제공하기 위해 노력하고 있습니다. 이를 달성하기 위해 응급실 간호사, 매장 판매 직원, 헬프 데스크 직원과 같은 최일선 근로자들에게 관련성과 최신 정보를 신속하게 검색할 수 있는 AI 기반 대화형 질의응답(QA) 챗봇을 제공하고 있습니다.
챗봇은 대개 다음을 기반으로 합니다. RAG, 기업의 지식 베이스에서 사실을 검색하여 가장 정확하고 최신 정보에 기반하여 LLM 응답을 생성하는 데 사용되는 AI 프레임워크인 는, 가장 관련성이 높은 컨텍스트의 검색으로 시작되는 세 가지 고유한 단계를 포함합니다. 벡터 검색, 사용자의 쿼리를 컨텍스트로 보강한 다음, 마지막으로 LLM을 사용하여 관련 응답을 생성하는 것입니다.
기존 RAG 파이프라인의 문제는 사용자 프롬프트를 벡터로 변환하기 위해 검색 단계에서 임베딩 서비스 호출이 상당한 지연을 유발하여 상호 작용이 필요한 애플리케이션의 속도를 저하시킬 수 있다는 점입니다. 수백만 개의 PDF, 문서 및 기타 지식 베이스로 구성된 문서 말뭉치를 벡터화하는 데는 오랜 시간이 걸릴 수 있으며, 이로 인해 RAG에 오래된 데이터를 사용할 가능성이 높아집니다. 또한 사용자는 챗봇 애플리케이션의 응답 시간을 줄이기 위해 비용 효율적으로 추론(초당 토큰 수)을 가속화하는 데 어려움을 겪고 있습니다.
그림 1은 쉽게 개발할 수 있게 해주는 고성능 스택을 보여줍니다. 인터랙티브 고객 서비스 챗봇입니다. 이것은 Streamlit 애플리케이션 프레임워크, 오케스트레이션을 위한 LangChain, 벡터 색인 및 검색을 위한 Couchbase Capella, 그리고 검색 및 생성 단계를 가속화하기 위한 NVIDIA NIM/NeMo로 구성되어 있습니다.

고성능 데이터베이스 서비스(DBaaS)인 Couchbase Capella를 사용하면 JSON의 유연성을 활용하면서 운영, 벡터, 텍스트, 시계열, 지리 공간 데이터를 빠르게 저장, 색인화 및 쿼리할 수 있습니다. Capella를 손쉽게 통합하여 벡터 검색 시맨틱 검색을 위해 별도의 벡터 데이터베이스 없이 다음과 같은 오케스트레이션 프레임워크를 통합하여 랑체인 또는 라마인데ックス 프로덕션 RAG 파이프라인에 도입할 수 있습니다. 이는 하이브리드 검색 벡터 검색과 전통적인 검색을 결합하여 검색 성능을 크게 향상시키는 기능입니다. 나아가 엣지 AI 사용 사례를 위해 Couchbase 모바일을 사용하여 벡터 검색을 엣지까지 확장할 수 있습니다.
Capella 벡터 검색을 구성한 후, 다음 중에서 성능이 우수한 모델을 선택할 수 있습니다. 엔비디아 API 카탈로그, 오픈소스, NVIDIA AI 파운데이션, 그리고 커스텀 모델을 아우르는 광범위한 파운데이션 모델 스펙트럼을 제공하며, NVIDIA 가속 인프라에서 최고의 성능을 제공하도록 최적화되어 있습니다. 이 모델들은 다음과 같이 배포됩니다. 엔비디아 님 단일 명령어를 통해 사용하기 쉬운 사전 제작된 컨테이너를 사용하여 온프레미스 또는 클라우드 환경 모두에서 실행할 수 있습니다. NeMo Retriever, NVIDIA NeMo의 일부분, 가장 낮은 지연 시간, 최고 처리량, 그리고 최대의 데이터 프라이버시를 갖춘 정보 검색을 제공합니다.
앞서 언급한 기술 스택을 사용하여 개발한 챗봇을 통해 다음이 가능합니다: PDF 문서를 업로드하고 대화형으로 질문하세요. 이것은 사용합니다 NV-QA-Embed, 질문-답변 검색에 사용되는 GPU 가속 텍스트 임베딩 모델인 라마 3 – 70B, NIM으로 패키지화되어 NVIDIA 인프라에서 가속되는 랑체인-엔비디아-AI-엔드포인트 이 패키지는 NVIDIA NIM의 모델을 사용하여 애플리케이션을 구축하기 위한 LangChain 통합 기능을 포함하고 있습니다. 프로토타이핑 목적으로 NVIDIA 호스팅 엔드포인트를 사용해 왔지만, 다음을 참고하여 자체 호스팅 NIM 사용을 고려하는 것을 권장합니다. NIM 문서 프로덕션 배포용.
이 솔루션을 사용하여 다음과 같은 빠른 정보 검색이 필요한 유스 케이스를 지원할 수 있습니다:
- 응급실 간호사들이 관련 의료 정보에 신속하게 접근하여 분류(트리아지)를 신속하게 처리할 수 있도록 지원함으로써, 응급실 과밀화, 진료 대기 시간 장기화, 그리고 낮은 환자 만족도를 완화합니다.
- 내부 지식 베이스 챗봇을 통해 고객 서비스 상담원이 관련 지식을 빠르게 찾아 통화 대기 시간을 단축하도록 지원합니다. 이는 CSAT(고객 만족도) 점수를 높일 뿐만 아니라 높은 통화량을 관리하는 데도 도움이 됩니다.
- 쇼핑 경험을 향상시키기 위해, 매장 내 판매 직원이 쇼핑객이 요청했으나 현재 품절된 상품의 사진이나 설명과 유사한 상품을 상품 카탈로그에서 빠르게 찾아 추천할 수 있도록 돕습니다.
결론적으로, Couchbase Capella 기반 RAG를 사용하여 챗봇과 같은 대화형 GenAI 애플리케이션을 기반이 탄탄하고 관련성 높은 응답으로 개발할 수 있으며, NVIDIA NIM/NeMo를 사용하여 이를 가속화할 수 있습니다. 이 조합은 확장성, 신뢰성, 그리고 사용 편의성을 제공합니다. 보안 및 개인정보 보호 요구 사항이 더 엄격한 유스케이스의 경우, DBaaS 환경을 위해 Capella와 함께 배포하는 것 외에도, NIM/NeMo를 온프레미스 또는 퍼블릭 클라우드의 자체 관리형 Couchbase와 함께 VPC 내에 배포할 수 있습니다. 추가적으로, 다음을 사용할 수 있습니다 네모 가드레일 귀사가 부적절하다고 간주하는 콘텐츠에 대해 LLM의 출력을 제어하기 위해.
챗봇 애플리케이션의 세부 사항은 Couchbase에서 확인할 수 있습니다. 개발자 포털 ~와 함께 전체 코드. 회원 가입을 해 주세요. 카펠라 체험 계정, 무료 NVIDIA NIM 계정, 그리고 GenAI 애플리케이션 개발을 시작하세요.

댓글 남기기
댓글을 달기 위해서는 로그인해야합니다.