作者: Jakub Rusinowski · 最后更新: 2024年12月18日
Technology Innovation Institute在14万亿token上训练的最新一代模型。Falcon 3在同等参数量上达到SOTA水平,采用完全宽松的Apache 2.0许可证,是商业部署的最佳选择之一。
| Licence | What it permits | Applies to |
|---|---|---|
Apache-2.0 | Commercial use permitted Commercial use permitted. No usage restrictions beyond attribution. | Falcon 3 3B Instruct, Falcon 3 7B Instruct, Falcon 3 10B Instruct |
| Falcon 3 3B Instruct | Min 3 GB VRAM · Q4_K_M · 32,768 ctx · ollama run falcon3:3b |
| Falcon 3 7B Instruct | Min 5 GB VRAM · Q4_K_M · 32,768 ctx · ollama run falcon3:7b |
| Falcon 3 10B Instruct | Min 7 GB VRAM · Q4_K_M · 32,768 ctx · ollama run falcon3:10b |
The cheapest GPU that runs Falcon 3 locally (min 3 GB VRAM) is the Intel Arc B570 (10 GB).
Install Ollama then run: ollama run falcon3:3b
Minimum VRAM: 3 GB. For best results use Q4_K_M quantization.
Falcon 3 needs about 3 GB VRAM at Q4_K_M quantization for its smallest variant. Variants: Falcon 3 3B Instruct (3 GB, Q4_K_M); Falcon 3 7B Instruct (5 GB, Q4_K_M); Falcon 3 10B Instruct (7 GB, Q4_K_M). On Apple Silicon, unified memory counts toward this requirement.
Yes — Falcon 3 runs on an RTX 4090 (24 GB) and other 24 GB cards such as the RTX 3090. Smaller variants also fit comfortably on 8–16 GB GPUs at Q4_K_M.
Q4_K_M is the best balance of quality and VRAM for Falcon 3 in most cases. Choose Q8_0 for near-lossless quality if you have spare VRAM, or smaller quants (Q3/Q2) only when memory is tight.
Install Ollama, then run: ollama run falcon3:3b. This downloads Falcon 3 and starts a local, OpenAI-compatible endpoint — no internet connection is needed after the initial download.