Models actuals: GPT-4o, Claude 3.5, Gemini, LLaMA
Comparativa de models el 2025
| Model | Empresa | Paràmetres | Context | Open Source | Punt fort |
|---|---|---|---|---|---|
| GPT-4o | OpenAI | ~200B (estim.) | 128K tokens | No | Equilibri general, multimodal |
| GPT-4o mini | OpenAI | ~8B (estim.) | 128K tokens | No | Cost-efectivitat |
| o3 | OpenAI | Desconegut | 200K tokens | No | Raonament matemàtic |
| Claude 3.5 Sonnet | Anthropic | Desconegut | 200K tokens | No | Documents llargs, codi |
| Claude 3.5 Haiku | Anthropic | Desconegut | 200K tokens | No | Velocitat, cost |
| Gemini 1.5 Pro | ~500B (estim.) | 1M tokens | No | Context ultra-llarg, multimodal | |
| Gemini 1.5 Flash | ~70B (estim.) | 1M tokens | No | Velocitat, cost | |
| LLaMA 3.1 405B | Meta | 405B | 128K tokens | Sí | Open source, privadesa |
| LLaMA 3.1 70B | Meta | 70B | 128K tokens | Sí | Rendiment/cost local |
| Mistral Large 2 | Mistral | ~70B (estim.) | 128K tokens | Parcialment | Multilingüe, europeu |
| Phi-3 Medium | Microsoft | 14B | 128K tokens | Sí | Model petit d'alta qualitat |
| Gemma 2 27B | 27B | 8K tokens | Sí | Accés obert de qualitat |
Executar LLMs localment amb Ollama
Ollama és la forma més senzilla de córrer models oberts localment (privadesa total, sense cost d'API):
# Instal·lar Ollama (Linux/macOS)
curl -fsSL https://ollama.ai/install.sh | sh
# Descarregar i córrer LLaMA 3.1 (8B, ~5GB)
ollama pull llama3.1:8b
ollama run llama3.1:8b
# O directament amb Docker
docker run -d --name ollama \
-p 11434:11434 \
-v ollama:/root/.ollama \
ollama/ollama
# Descarregar el model dins del contenidor
docker exec -it ollama ollama pull llama3.1:8b
# Provar via API REST
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "Explica en català que és la intel·ligència artificial",
"stream": false
}'