Salta el contingut

Models actuals: GPT-4o, Claude 3.5, Gemini, LLaMA

Comparativa de models el 2025

Model Empresa Paràmetres Context Open Source Punt fort
GPT-4o OpenAI ~200B (estim.) 128K tokens No Equilibri general, multimodal
GPT-4o mini OpenAI ~8B (estim.) 128K tokens No Cost-efectivitat
o3 OpenAI Desconegut 200K tokens No Raonament matemàtic
Claude 3.5 Sonnet Anthropic Desconegut 200K tokens No Documents llargs, codi
Claude 3.5 Haiku Anthropic Desconegut 200K tokens No Velocitat, cost
Gemini 1.5 Pro Google ~500B (estim.) 1M tokens No Context ultra-llarg, multimodal
Gemini 1.5 Flash Google ~70B (estim.) 1M tokens No Velocitat, cost
LLaMA 3.1 405B Meta 405B 128K tokens Open source, privadesa
LLaMA 3.1 70B Meta 70B 128K tokens Rendiment/cost local
Mistral Large 2 Mistral ~70B (estim.) 128K tokens Parcialment Multilingüe, europeu
Phi-3 Medium Microsoft 14B 128K tokens Model petit d'alta qualitat
Gemma 2 27B Google 27B 8K tokens Accés obert de qualitat

Executar LLMs localment amb Ollama

Ollama és la forma més senzilla de córrer models oberts localment (privadesa total, sense cost d'API):

# Instal·lar Ollama (Linux/macOS)
curl -fsSL https://ollama.ai/install.sh | sh

# Descarregar i córrer LLaMA 3.1 (8B, ~5GB)
ollama pull llama3.1:8b
ollama run llama3.1:8b

# O directament amb Docker
docker run -d --name ollama \
  -p 11434:11434 \
  -v ollama:/root/.ollama \
  ollama/ollama

# Descarregar el model dins del contenidor
docker exec -it ollama ollama pull llama3.1:8b

# Provar via API REST
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1:8b",
  "prompt": "Explica en català que és la intel·ligència artificial",
  "stream": false
}'