大規模言語モデルやAIモデルをプロダクションにデプロイするには、適切なGPUインスタンスの選択や量子化戦略から低レイテンシーの推論パイプラインの構築まで、専門的な知識が必要です。私たちはAI企業がRunPodでモデルを最適化されたサービングインフラストラクチャでデプロイし、コスト、レイテンシー、スループットのバランスを取りながら実際のプロダクショントラフィックに対応できるよう支援します。
私たちは、vLLM、NVIDIA Triton Inference Server、カスタムFastAPIエンドポイントを使用してRunPod PodsとServerless GPUにモデルをデプロイします。私たちのスタックには、PyTorch、Hugging Face Transformers、CUDA最適化、TensorRTが含まれ、最大の推論性能を実現します。これにRunPodの自動スケーリングを組み合わせ、コスト効率の高いプロダクションサービングを提供します。
このサービスは、RunPodでLLM、拡散モデル、またはカスタムAIモデルをデプロイし、プロダクショングレードの推論が必要なAI企業向けです。ファインチューニングされたLlamaモデル、カスタムビジョンモデル、またはマルチモーダルパイプラインを提供する場合でも、私たちはレイテンシーとスループットの要件を満たす最適化されたデプロイメントを提供します。
モデルアーキテクチャ、推論要件、レイテンシー目標、トラフィックパターンを分析します。
GPU選択、量子化戦略、スケーリング構成を含むサービングインフラストラクチャを設計します。
vLLMまたはTritonを使用してモデルをデプロイし、カスタムエンドポイントを構築し、RunPod Serverlessを構成します。
レイテンシーとスループットをベンチマークし、Flash Attentionやバッチング戦略などの最適化を適用します。
モデルバージョニング、A/Bテストパイプライン、モニタリング、自動スケーリングポリシーを設定します。
プロダクションスケール用に構築された最適化されたサービングインフラストラクチャで、RunPodにLLMとAIモデルをデプロイするための専門的なサポートを受けましょう。
はい、MicrocosmWorksは、Llama 3、Mistral、Mixtral、QwenなどのオープンソースLLMをRunPod上にデプロイします。vLLM、TGI、またはTensorRT-LLMのような最適化された推論サーバーを使用して、最大のスループットと最低のレイテンシーを実現します。
7Bから13Bのパラメータモデルには、通常、A40またはRTX 4090ポッドを推奨しています。70B以上のモデルには、tensor parallelismを備えたA100 80GBまたはH100ポッドを構成し、コストに敏感なワークロード向けには、下位層のGPUにquantized modelsをセットアップします。
MicrocosmWorksは、RunPod上でのLLMデプロイのコンサルティングおよびセットアップに対して、1時間あたり25ドルから50ドルを請求します。これには、推論サーバーの最適化、APIエンドポイントの設定、負荷テスト、およびドキュメント作成が含まれます。ほとんどのデプロイは20〜40時間以内に完了します。
はい、私たちはRunPod Serverless上でvLLMまたは類似のサーバーを使用してOpenAI互換のAPIエンドポイントを設定します。これにより、streaming、function calling、およびchat completion formatsを含む自己ホスト型モデルとOpenAI APIコールをドロップインで置き換えることが可能になります。
もちろん可能です。MicrocosmWorksは、ファインチューニングされたLoRAアダプターや完全にマージされたカスタムモデルをRunPod上にデプロイし、QdrantやWeaviateのようなベクターデータベースを使用してRAGパイプラインと統合することで、お客様の独自データを用いたコンテキスト拡張生成を実現します。