大規模言語モデルやAIモデルを本番環境にデプロイするには、適切なGPUインスタンスと量子化戦略の選択から、低レイテンシの推論パイプラインの構築まで、専門的な知識が必要です。当社はAI企業がRunPod上にモデルをデプロイできるよう、実際のプロダクショントラフィックに対してコスト、レイテンシ、スループットのバランスが取れた最適化されたサービングインフラストラクチャを提供します。
当社は、vLLM、NVIDIA Triton Inference Server、およびカスタムのFastAPIエンドポイントを使用して、RunPod PodsとServerless GPUにモデルをデプロイします。当社のスタックには、最大推論パフォーマンスのためのPyTorch、Hugging Face Transformers、CUDA最適化、およびTensorRTが含まれています。これをRunPodのオートスケーリングと組み合わせて、費用対効果の高い本番環境でのサービングを実現します。
このサービスは、RunPodで本番環境レベルの推論が必要なLLM、拡散モデル、またはカスタムAIモデルをデプロイするAI企業向けです。ファインチューニングされたLlamaモデル、カスタムビジョンモデル、またはマルチモーダルパイプラインのいずれを提供する場合でも、当社はお客様のレイテンシとスループット要件を満たす最適化されたデプロイメントを提供します。
モデルアーキテクチャ、推論要件、レイテンシ目標、およびトラフィックパターンを分析します。
GPU選択、量子化戦略、およびスケーリング構成を含むサービングインフラストラクチャを設計します。
vLLMまたはTritonを使用してモデルをデプロイし、カスタムエンドポイントを構築し、RunPod Serverlessを構成します。
レイテンシとスループットをベンチマークし、Flash Attentionやバッチ戦略などの最適化を適用します。
モデルバージョン管理、A/Bテストパイプライン、監視、およびオートスケーリングポリシーを設定します。
本番環境スケール向けに構築された最適化されたサービングインフラストラクチャにより、RunPodへのLLMおよびAIモデルデプロイに関する専門家の支援を受けましょう。
はい、MicrocosmWorksは、Llama 3、Mistral、Mixtral、QwenなどのオープンソースLLMをRunPod上にデプロイします。vLLM、TGI、またはTensorRT-LLMのような最適化された推論サーバーを使用して、最大のスループットと最低のレイテンシーを実現します。
7Bから13Bのパラメータモデルには、通常、A40またはRTX 4090ポッドを推奨しています。70B以上のモデルには、tensor parallelismを備えたA100 80GBまたはH100ポッドを構成し、コストに敏感なワークロード向けには、下位層のGPUにquantized modelsをセットアップします。
MicrocosmWorksは、RunPod上でのLLMデプロイのコンサルティングおよびセットアップに対して、1時間あたり25ドルから50ドルを請求します。これには、推論サーバーの最適化、APIエンドポイントの設定、負荷テスト、およびドキュメント作成が含まれます。ほとんどのデプロイは20〜40時間以内に完了します。
はい、私たちはRunPod Serverless上でvLLMまたは類似のサーバーを使用してOpenAI互換のAPIエンドポイントを設定します。これにより、streaming、function calling、およびchat completion formatsを含む自己ホスト型モデルとOpenAI APIコールをドロップインで置き換えることが可能になります。
もちろん可能です。MicrocosmWorksは、ファインチューニングされたLoRAアダプターや完全にマージされたカスタムモデルをRunPod上にデプロイし、QdrantやWeaviateのようなベクターデータベースを使用してRAGパイプラインと統合することで、お客様の独自データを用いたコンテキスト拡張生成を実現します。