在生产环境中部署大型语言模型和 AI 模型需要专业知识——从选择合适的 GPU 实例和量化策略,到构建低延迟推理管道。我们帮助 AI 公司在 RunPod 上部署模型,并提供优化的服务基础设施,以平衡实际生产流量的成本、延迟和吞吐量。
我们在 RunPod Pods 和 Serverless GPU 上使用 vLLM、NVIDIA Triton Inference Server 和自定义 FastAPI 端点部署模型。我们的技术栈包括 PyTorch、Hugging Face Transformers、CUDA 优化和 TensorRT,以实现最大推理性能。我们将其与 RunPod 的自动扩缩功能结合,实现经济高效的生产服务。
此服务适用于需要在 RunPod 上进行生产级推理的 AI 公司,这些公司正在部署 LLM、扩散模型或自定义 AI 模型。无论您是服务微调的 Llama 模型、自定义视觉模型还是多模态管道,我们都能提供满足您延迟和吞吐量要求的优化部署。
分析模型架构、推理要求、延迟目标和流量模式。
设计服务基础设施,包括 GPU 选择、量化策略和扩缩配置。
使用 vLLM 或 Triton 部署模型,构建自定义端点,并配置 RunPod Serverless。
对延迟和吞吐量进行基准测试,并应用 Flash Attention 和批处理策略等优化。
设置模型版本控制、A/B 测试管道、监控和自动扩缩策略。
是的,MicrocosmWorks 在 RunPod 上部署 Llama 3、Mistral、Mixtral、Qwen 以及其他模型等开源 LLM,并使用 vLLM、TGI 或 TensorRT-LLM 等优化过的推理服务器,以实现最大吞吐量和最低延迟。
对于 7B-13B 参数模型,我们通常推荐 A40 或 RTX 4090 pod。对于 70B+ 模型,我们配置 A100 80GB 或 H100 pod,并采用 tensor parallelism。对于成本敏感型工作负载,我们会在较低级别的 GPU 上设置 quantized models。
MicrocosmWorks 在 RunPod 上进行 LLM 部署咨询和设置的收费为每小时 25-50 美元,其中包括推理服务器优化、API 端点配置、负载测试和文档。大多数部署在 20-40 小时内完成。
是的,我们使用 vLLM 或类似的服务器在 RunPod Serverless 上配置 OpenAI 兼容的 API 端点,从而实现使用您自托管的模型即插即用式替换 OpenAI API 调用,包括流式传输、函数调用和聊天完成格式。
当然可以。MicrocosmWorks 在 RunPod 上部署微调的 LoRA 适配器和完全合并的定制模型,并使用 Qdrant 或 Weaviate 等向量数据库将其与 RAG 管道集成,以利用您的专有数据进行上下文增强的生成。