Reasoning Models

  • OpenAI o3 / o3-mini

    • description: Step-by-step reasoning model for complex problem-solving across technical domains
    • architecture: Transformer with Chain-of-Thought training
    • key_features: External tool integration, web search, file analysis, Python execution
    • use_cases: Science, programming, mathematics, business, education
  • Gemini 2.5 Pro

    • description: Multimodal reasoning model with Deep Think mode for hypothesis evaluation
    • architecture: Transformer (multimodal)
    • key_features: 1M+ token context, self-fact-checking, multimodal (text/image/audio/video)
    • use_cases: Long-context synthesis, mathematical proofs, complex reasoning
  • Claude 4 Opus / 3.7 Sonnet

    • description: Advanced reasoning model with nuanced, human-like responses
    • architecture: Transformer
    • key_features: 200K token context, prompt caching, code execution tool, strong safety
    • use_cases: Long-running tasks, agent workflows, coding, complex reasoning
  • Grok 3

    • description: Real-time reasoning model with X (Twitter) integration
    • architecture: Transformer
    • key_features: Real-time data access, Think mode, DeepSearch capability
    • use_cases: Real-time information retrieval, step-by-step reasoning
  • DeepSeek-R1

    • description: Open-source reasoning model optimized for cost-efficiency
    • architecture: Mixture-of-Experts (MoE) Transformer
    • key_features: 671B total / 37B active parameters, open-source, competitive performance
    • use_cases: Reasoning, coding tasks, research applications

General-Purpose LLMs

  • GPT-4o / GPT-5

    • description: Most powerful general-purpose model with multimodal capabilities
    • architecture: Transformer (estimated ~1.8T parameters for GPT-4o)
    • key_features: Real-time text/audio/video processing, multimodal understanding
    • use_cases: General reasoning, coding, content generation, conversational AI
  • Gemini 2.5 Pro

    • description: Google’s flagship multimodal model with ultra-long context
    • architecture: Transformer (multimodal)
    • key_features: 1M+ token context, native multimodal, Google ecosystem integration
    • use_cases: Long documents, multimodal tasks, enterprise workflows
  • Claude 4 Opus

    • description: Safety-focused model with excellent long-context handling
    • architecture: Transformer
    • key_features: 200K token context, strong alignment, precise instruction following
    • use_cases: Long-context tasks, safety-critical applications, content generation
  • LLaMA 4 (Meta)

    • description: Open-source multimodal model with Scout, Maverick, Behemoth variants
    • architecture: Transformer
    • key_features: Multimodal input, long-context reasoning, flexible deployment scales
    • use_cases: Research, commercial applications, on-device to enterprise-scale
  • Mistral Large 2

    • description: Open-source European model with strong coding capabilities
    • architecture: Transformer (123B parameters)
    • key_features: Open weights, multilingual, strong code generation
    • use_cases: RAG applications, general-purpose tasks, coding

Image Generation Models

  • Imagen 4 (Google)

    • description: Leading photorealistic image generation with advanced lighting and texture
    • architecture: Diffusion Model (U-Net backbone)
    • key_features: High-quality photorealism, complex lighting handling, texture variations
    • use_cases: Product visuals, advertising, concept art
  • DALL-E 3 (OpenAI)

    • description: Text-to-image generation with natural language understanding
    • architecture: Diffusion Model
    • key_features: Precise prompt following, safety filters, integration with ChatGPT
    • use_cases: Creative design, content creation, visual storytelling
  • Midjourney v6

    • description: Artistic image generation with high aesthetic quality
    • architecture: Diffusion Model
    • key_features: Cinematic quality, artistic style control, community platform
    • use_cases: Digital art, creative projects, design inspiration
  • Stable Diffusion XL

    • description: Open-source image generation with customization options
    • architecture: Latent Diffusion Model (U-Net + VAE)
    • key_features: Open weights, customizable, LoRA fine-tuning support
    • use_cases: Custom models, research, local deployment
  • FLUX.1 Pro

    • description: Efficient lightweight image generation model
    • architecture: Diffusion Model (12B parameters)
    • key_features: High efficiency, quality-speed balance, minimal compute
    • use_cases: Fast generation, resource-constrained environments

Vision-Language Models

  • Gemini 2.5 Pro

    • description: State-of-the-art multimodal model for vision-language tasks
    • architecture: Transformer (multimodal encoder-decoder)
    • key_features: Video/image/text understanding, 1M+ token context
    • use_cases: Visual reasoning, image analysis, video understanding
  • InternVL3-78B

    • description: Advanced MLLM with 78B parameters for vision-language tasks
    • architecture: Hybrid (InternViT-6B + Qwen2.5-72B)
    • key_features: 72.2 MMMU score, 32K context, 100+ languages, tool usage
    • use_cases: GUI agents, industrial analysis, 3D vision perception
  • Qwen2.5-VL-72B

    • description: Open-source multimodal model with strong benchmark performance
    • architecture: Vision-Language Transformer
    • key_features: 70.2 MMMU score, image/video understanding, agent functions
    • use_cases: Visual question answering, document understanding
  • GPT-4o (Vision)

    • description: OpenAI’s multimodal model with real-time processing
    • architecture: Transformer (multimodal)
    • key_features: Real-time image/video understanding, conversational vision
    • use_cases: Visual assistance, image captioning, multimodal chat
  • GLM-4.5V

    • description: Vision-language model with MoE architecture
    • architecture: Mixture-of-Experts Transformer (106B total, 12B active)
    • key_features: Efficient inference, strong visual reasoning
    • use_cases: Visual understanding, multimodal reasoning

Reranking Models

  • Zerank-1 (ZeroEntropy)

    • description: Leading reranker with highest accuracy and speed
    • architecture: Cross-encoder Transformer
    • key_features: 95% accuracy retention, 60% cost reduction, fastest latency
    • use_cases: RAG systems, search optimization, document retrieval
  • Voyage Rerank 2.5

    • description: Balanced reranker with quality-speed optimization
    • architecture: Cross-encoder
    • key_features: 2x faster than competitors, high quality, production-ready
    • use_cases: RAG pipelines, semantic search
  • Cohere Rerank v3.5

    • description: Multilingual reranker with enterprise features
    • architecture: Cross-attention Transformer
    • key_features: 100+ languages, handles semi-structured data (tables, JSON, code)
    • use_cases: Enterprise search, multilingual retrieval
  • Qwen3-Reranker-8B

    • description: Open-source reranker for scientific literature
    • architecture: Transformer (8B parameters)
    • key_features: 32K context length, 100+ languages, scientific focus
    • use_cases: Scientific literature search, academic research
  • bge-reranker-large

    • description: Open-source reranker with strong performance
    • architecture: Cross-encoder
    • key_features: Open weights, good accuracy-speed balance
    • use_cases: General reranking, RAG applications

Embedding Models

  • Qwen3-Embedding-8B

    • description: Top multilingual embedding model with 100+ language support
    • architecture: Transformer encoder
    • key_features: Multilingual, high MTEB scores, instruction-following
    • use_cases: Semantic search, RAG systems, multilingual applications
  • NVIDIA llama-embed-nemotron-8b

    • description: Latest embedding model with strong multilingual understanding
    • architecture: Transformer (fine-tuned from Llama-3.1-8B)
    • key_features: Multilingual, research license, powerful text understanding
    • use_cases: Multilingual RAG, research applications
  • OpenAI text-embedding-3-large

    • description: High-quality commercial embedding for RAG
    • architecture: Transformer encoder
    • key_features: Dense, multilingual, optimized for retrieval
    • use_cases: RAG pipelines, semantic search, enterprise applications
  • Cohere Embed v3

    • description: Commercial embedding with long-context support
    • architecture: Transformer
    • key_features: 100+ languages, long context, balanced recall/precision
    • use_cases: Enterprise search, multilingual RAG
  • BGE-M3

    • description: Open trilingual embedding model
    • architecture: Transformer encoder
    • key_features: Chinese-English-Japanese, optimized for RAG and clustering
    • use_cases: Asian language applications, open-source RAG

Text-to-Speech Models

  • ElevenLabs

    • description: Leading TTS with natural, expressive voice generation
    • architecture: Neural TTS (proprietary)
    • key_features: Voice cloning, emotion control, multilingual, high naturalness
    • use_cases: Audiobooks, content creation, voice assistants
  • Google Cloud TTS (WaveNet)

    • description: Enterprise TTS with 40+ languages and custom voices
    • architecture: WaveNet (autoregressive neural network)
    • key_features: Neural TTS, custom voice creation, flexible integration
    • use_cases: Apps, IVR systems, accessibility tools
  • Fish Speech V1.5

    • description: Open-source multilingual TTS with DualAR architecture
    • architecture: DualAR (dual autoregressive transformer)
    • key_features: 1339 ELO score, 3.5% WER English, multilingual (300K+ hours)
    • use_cases: Multilingual applications, research
  • CosyVoice2-0.5B

    • description: Ultra-low latency streaming TTS
    • architecture: Neural TTS (0.5B parameters)
    • key_features: 150ms streaming latency, real-time synthesis
    • use_cases: Real-time applications, voice agents
  • Azure AI Speech

    • description: Enterprise TTS with HD neural voices
    • architecture: Neural TTS
    • key_features: Emotional tone control, custom voices, SSML support
    • use_cases: Chatbots, audiobooks, accessibility, virtual assistants

Speech-to-Text Models

  • Canary Qwen 2.5B

    • description: Top open-source ASR with lowest WER
    • architecture: Speech-Augmented Language Model (SALM) - hybrid ASR+LLM
    • key_features: 5.63% WER, 418x real-time speed, 234K hours training data
    • use_cases: English transcription, real-time applications
  • Whisper Large V3 / V3 Turbo

    • description: OpenAI’s multilingual STT with 99+ language support
    • architecture: Transformer encoder-decoder (1.55B parameters)
    • key_features: 99+ languages, zero-shot capability, 680K hours training
    • use_cases: Multilingual transcription, diverse acoustic environments
  • Deepgram Nova-3

    • description: Real-time multilingual transcription with ultra-low latency
    • architecture: End-to-end neural network
    • key_features: Sub-200ms latency, streaming, customizable for domains
    • use_cases: Live transcription, conversational AI agents
  • Google Cloud Chirp

    • description: Enterprise STT with 125+ languages
    • architecture: Transformer foundation model
    • key_features: 125+ languages, speaker diarization, word-level timestamps
    • use_cases: Batch transcription, enterprise applications
  • AssemblyAI Universal-2

    • description: High-accuracy commercial STT with speech intelligence
    • architecture: Neural network
    • key_features: Sub-5% WER, 99+ languages, sentiment analysis, PII detection
    • use_cases: Enterprise transcription, customer service

Document Parsing Models

  • OmniParser (Microsoft)

    • description: Vision-based GUI and document parsing for structured extraction
    • architecture: YOLOv8 (detection) + Fine-tuned Florence-2 (description)
    • key_features: UI screenshot parsing, 16-point polygon detection, OCR integration
    • use_cases: GUI automation, document understanding, screen parsing
  • Donut (Document Understanding Transformer)

    • description: End-to-end document understanding without OCR
    • architecture: Vision Transformer (encoder-decoder)
    • key_features: OCR-free, handles complex layouts, multilingual
    • use_cases: Document classification, information extraction
  • LayoutLM / LayoutLMv3

    • description: Multimodal document understanding with layout awareness
    • architecture: Transformer with layout embeddings
    • key_features: Text + layout + image features, pre-trained on millions of docs
    • use_cases: Form understanding, document QA, receipt parsing
  • Tesseract 5.x (with LSTM)

    • description: Open-source OCR engine with neural network support
    • architecture: LSTM-based neural network
    • key_features: 100+ languages, open-source, customizable
    • use_cases: Text extraction, document digitization
  • PaddleOCR

    • description: Multilingual OCR with high accuracy
    • architecture: CNN + RNN
    • key_features: 80+ languages, lightweight, fast inference
    • use_cases: Text recognition, document processing

Video Generation Models

  • Google Veo 3

    • description: State-of-the-art video generation with 1080p output
    • architecture: Diffusion Model (transformer-based)
    • key_features: 8-second clips, 1080p resolution, native audio, 24fps
    • use_cases: Cinematic content, creative animation, dialogue-driven scenes
  • OpenAI Sora 2

    • description: High-fidelity text-to-video with long sequences
    • architecture: Diffusion Transformer
    • key_features: Extended duration, temporal consistency, physics understanding
    • use_cases: Storytelling, creative content, video synthesis
  • Runway Gen-4.5

    • description: Professional video generation with advanced controls
    • architecture: Diffusion Model
    • key_features: HD video, motion control, cinematic quality, physics understanding
    • use_cases: Content creation, advertising, creative projects
  • Pika 2.1

    • description: 1080p video generation with scene integration
    • architecture: Diffusion Model
    • key_features: Pikadditions (object insertion), 1080p HD, scene blending
    • use_cases: Social content, quick video creation
  • Kling 2.5 Turbo

    • description: Fast video generation with physics-aware realism
    • architecture: Diffusion Model
    • key_features: Advanced camera control, physics simulation, prompt adherence
    • use_cases: Cinematic videos, technical demonstrations

Code Generation Models

  • GPT-4o / GPT-5

    • description: Leading general-purpose code generation model
    • architecture: Transformer
    • key_features: Multi-language support, context-aware suggestions, debugging
    • use_cases: All-around coding, complex algorithms, refactoring
  • Claude 4 Sonnet 4.5

    • description: Best for large refactors and careful reasoning
    • architecture: Transformer
    • key_features: Repository-scale edits, safe for high-risk changes
    • use_cases: Large codebases, sensitive edits, careful reasoning
  • Qwen2.5-Coder-32B

    • description: Versatile open-source coding model
    • architecture: Transformer (32B parameters)
    • key_features: 91% HumanEval, 128K context, Apache 2.0 license
    • use_cases: All coding tasks, local deployment, commercial use
  • Codestral-22B (Mistral AI)

    • description: Speed-optimized code generation
    • architecture: Transformer (22B parameters)
    • key_features: Lightning-fast inference, 80+ languages, fill-in-the-middle
    • use_cases: Fast code generation, code completion, production workflows
  • StarCoder2-15B

    • description: Open-source code completion specialist
    • architecture: Transformer (15B parameters)
    • key_features: 16K context, optimized for completion, IDE integration
    • use_cases: Code completion, bug fixing, documentation

AI Agent Frameworks

  • LangChain

    • description: Modular open-source framework for building LLM applications
    • architecture: Framework (Python/JavaScript)
    • key_features: RAG support, memory management, tool integration, broad ecosystem
    • use_cases: Custom agents, RAG applications, complex workflows
  • AutoGen (Microsoft)

    • description: Multi-agent conversation framework
    • architecture: Event-driven multi-agent system
    • key_features: Agent-to-agent collaboration, self-reflection, LLM-agnostic
    • use_cases: Data science pipelines, agent collaboration, research
  • CrewAI

    • description: Role-based team-of-agents orchestration
    • architecture: Role-based framework
    • key_features: Visual design, simple setup, collaborative workflows
    • use_cases: Customer service, marketing automation, service tasks
  • OpenAI Agents SDK

    • description: API-first GPT-centric agent builder
    • architecture: API-based framework
    • key_features: Tool calling, seamless model upgrades, built-in guardrails
    • use_cases: GPT assistants, rapid prototyping
  • Vellum

    • description: Unified visual builder with enterprise governance
    • architecture: Visual builder + SDK
    • key_features: Built-in evals, RBAC, audit trails, flexible deployment
    • use_cases: Enterprise agents, team collaboration, governance