This document provides an organized comparison of GPU architectures, deployment platforms, LLMs, and speech models (TTS/STT) relevant for deploying a voice agent. It also includes pricing and feature comparisons across popular GPU cloud providers.

GPU Architecture Comparison

ArchitectureRelease YearExample GPUsTensor Core GenSpecial PrecisionApprox. Tensor TFLOPSOther Notable Features
Turing2018T4, RTX 20 series1st GenFP16, INT8~65 TFLOPS (T4, FP16)First Tensor Cores, RT cores for RTX
Ampere2020A100, A10G, RTX 30 series3rd GenTF32, FP16, BF16, INT8~312 TFLOPS (A100, FP16)TF32 precision mode for training
Ada Lovelace2022/23L4, L40S, RTX 40 series4th GenFP16, BF16, INT8, sparsity~180 TFLOPS (L40S, FP16)Improved efficiency, higher clocks
Hopper2022H100, H200Transformer EngineFP8, FP16, BF16, INT8~1000 TFLOPS (H100, FP8)Dynamic mixed-precision (FP8)
Blackwell2024+B200Next Transformer EngineFP4, FP8, FP16, INT8~2000 TFLOPS (FP4/FP8 est.)Lower precision for LLMs

GPU Cloud Platforms Comparison

FeatureLightning AIModalKoyebRunPodFal AICerebrium AI
GPU TypesT4, L4, L40S, A100, H100, H200, B200T4, L4, A10G, A100 (40/80GB), L40S, H100, H200, B200RTX 4000, L4, A6000, L40S, A100, H100, Tenstorrent N300A4000, A5000, A6000, A100, H100, H200, B200, RTX 3090/4090A6000, A100, H100, H200, B200T4, L4, A10, A100, H100, H200, Trainium, Inferentia
Monthly Fees50 free GPU hours, 30)$250 compute/month$29/mo
Pricing (T4/A100/H100)T4: 2.71/hr, H100: $5.52/hrT4: 2.50/hr, H100: $3.95/hrT4-like: 2/hr, H100: $3.3/hrA100(80GB): 4.47/hrA100(40GB): 1.89/hr, H200: $2.10/hrT4: 2.50/hr, H100: $3.95/hr
StorageFree: 50GB, Pro: 200GBNo direct charge$0.50/GB/mo$0.05–0.20/GB/moEphemeral (7-day)$0.05/GB/mo
Cold Start78–537s1–4s<200ms~200ms–12s”Near-instant” (benchmarks: 222–537s)~2s (GPU)
Docker/ContainerizationCustom Docker, autoscalingCustom Docker, 1s spin-upGitHub deploysFull Docker, serverlessfal deploy or DockerCustom Docker
VPC / NetworkingEnterprise VPCInternal mesh onlyNo external VPCInternal VPCNo external VPCRegion isolation
Security & ComplianceSOC2, HIPAAHIPAA (BAA)Private meshSOC2/HIPAA (in progress)Custom licensesSOC2, HIPAA

Large Language Models (LLMs)

ModelParametersGPUOther Info
Llama 3.1 8B Instruct8B~16GB128k context length, JSON tool calls supported

Domain Models (Medical)

ModelParametersGPUBenchmark / Notes
OpenBioLLM70B, 7B–13BA100 80GBSOTA results, outperforms GPT-4/Gemini/Med-PaLM-2; Llama 3 License (commercial use under 700M MAU)
Meditron70B70.2% accuracy on USMLE-style Qs, better than GPT-3.5
Me-LLaMA70BBeats ChatGPT on 7/8 datasets, GPT-4 on 5/8

Text-to-Speech (TTS)

ModelParametersGPU MemoryQuantization
Kokoro82M326MBFP32

Speech-to-Text (STT)

ModelParametersGPU MemoryQuantization
Whisper-Medium769M~5GBFP16

Deployment Cost Estimation

ProviderModel / SetupCost per Hour30-Day 24/7 Estimate
Lightning AIH100 (80GB) – 26 CPU / 1 GPU, 1513 TPS$2.70/hr$1944
Lightning AIA100 (80GB) – 30 CPU / 312 TPS$1.55/hr
Together AILlama$0.88 per 1M tokens
Together AIWhisper$0.09/hr
Cluster (Kubernetes)H100 (80GB, 208 CPU)$3.19/hr
Dedicated Deployment$27/hr
ModalA100 (40GB)$2.10/hr
ModalH1000.0473 CPU/hr

🌐 Enterprise GPU Hosting Summary

ProviderGPU OptionsH100 $/hrA100 $/hrT4 $/hrREST APIWebSocketDockerAutoscalingServerless GPUScale-to-ZeroVPCBillingFree TierEnterprise Features
Lightning AIH100, A100, L40S, T4, A10G$0.42+$0.42+$0.42+Per-second50 GPU-hrsSOC2, HIPAA
Cerebrium AIH100, H200, A100, L40S, L4$4.68$2.48$0.58Per-second$30 creditSOC2, HIPAA
ModalB200, H200, H100, A100, L40S$3.95$2.50$0.58Per-second$30 creditHIPAA, SSO
KoyebH100, A100, L40S, A6000$3.30$2.00Per-second$10 creditISO27001
RunPodH100–T44.472.720.58Per-secondCreditsEnterprise
Fal AIH100, A100, A6000, B200$1.89$0.99Per-secondCreditsEnterprise
ReplicateH100, A100, L40S, T4$5.49$5.04$0.81Per-secondCreditsEnterprise
AnyscaleH100, A100, V100, T4ContactContactContactPer-useContactSOC2
Together AIH100, A100, L40S, T4ContactContactContactPer-tokenContactSOC2
PaperspaceH100, A100, V100, RTX$5.95$3.09–3.18$0.56Per-hourFreeEnterprise