Twój lokalny AI,
wreszcie pod kontrolą

Llama Control to pulpit zarządzania dla llama.cpp. Zarządzaj modelami GGUF, rozmawiaj z AI, testuj wydajność, automatycznie stroj flagi serwera i przeglądaj HuggingFace, wszystko w jednym interfejsie.

Gotowe w 4 krokach

Bez linii komend. Bez plików konfiguracyjnych. Bez problemów. Pobierz i rozpocznij czat z AI w mniej niż 5 minut.

01

Pobierz i zainstaluj

Pobierz instalator dla swojej platformy z GitHub Releases — Windows lub macOS (Apple Silicon). Jedno pobranie, bez konieczności zakładania konta.

02

Wskaż folder z modelami

Otwórz Ustawienia i wskaż Llama Control folder z modelami GGUF. Aplikacja automatycznie wykrywa LM Studio i powszechne ścieżki. Skanuje wszystkie pliki .gguf i wyświetla ich metadane.

03
llama.cpp

Zainstaluj llama.cpp

Użyj wbudowanego instalatora llama.cpp w Ustawieniach, aby pobrać odpowiednią wersję dla Twojego GPU (CUDA, Vulkan lub CPU). Jeden klik, bez ręcznego rozpakowywania.

04

Uruchom i czatuj

Wybierz model, opcjonalnie użyj Auto-Tune do optymalizacji flag, i kliknij start. Rozmawiaj z lokalnym AI natychmiast, bez terminala, bez plików konfiguracyjnych, bez linii komend.

Zobacz to w akcji

Pełny przegląd — od uruchomienia lokalnego modelu po użycie go w agencie kodującym do zbudowania prawdziwej strony docelowej, całkowicie offline.

Niektóre fragmenty nagrania zostały przyspieszone.

Sześć potężnych narzędzi, jeden interfejs

Od zarządzania modelami po AI-owe automatyczne strojenie, Llama Control daje Ci pełną kontrolę nad lokalnym AI.

Organizuj i zarządzaj

Biblioteka modeli

Przeglądaj lokalne modele GGUF z bogatym podglądem metadanych. Edytuj nazwy, opisy i tagi modeli. Uruchamiaj lub zatrzymuj llama-server dla każdego modelu, zarządzaj flagami uruchomieniowymi i organizuj modele w kolekcje.

Dowiedz się więcej
Rozmawiaj z AI

Czat

Rozmawiaj z lokalnym modelem w czasie rzeczywistym. Edytuj prompt systemowy, zarządzaj historią rozmów i przejdź do terminala z xterm.js dla zaawansowanych użytkowników.

Dowiedz się więcej
HuggingFace
Odkrywaj i pobieraj

HuggingFace

Wyszukuj, przeglądaj i pobieraj modele GGUF bezpośrednio z HuggingFace. Otrzymuj wskazówki dopasowania VRAM na podstawie Twojego GPU, sprawdzaj miejsce na dysku przed pobraniem i pobieraj pliki bezpośrednio do folderu modeli.

Dowiedz się więcej
Wydajność i jakość

Benchmark

Uruchom testy szybkości llama-bench, aby zmierzyć tokeny/sekundę. Oceń jakość za pomocą 18 zadani deterministycznych obejmujących matematykę, logikę, kod i wiedzę. Oceniaj wyniki z pomocą AI (Claude, OpenAI, Gemini).

Dowiedz się więcej
Optymalizacja z AI

Auto-Tune

Niech AI zbada najlepsze flagi uruchomieniowe dla Twojego modelu, a następnie automatycznie je przetestuje. KV cache quantization, rozmiary chunków, dopasowanie do VRAM, wszystko optymalizowane automatycznie.

Dowiedz się więcej
Analiza użycia

Analityka

Śledź wzorce użycia AI za pomocą kompleksowego dashboardu. Monitoruj liczbę czatów, wiadomości, czas odpowiedzi i liczbę znaków. Identyfikuj najbardziej aktywne dni i najlepsze rozmowy.

Dowiedz się więcej

Twoje modele GGUF, pięknie uporządkowane

Przeglądaj lokalne pliki GGUF z bogatym parsowaniem metadanych. Edytuj nazwy, opisy i tagi. Uruchamiaj lub zatrzymuj serwer dla każdego modelu z własnymi flagami i organizuj kolekcję z ulubionymi i własnymi folderami.

  • Jeden klik do uruchomienia llama-server z flagami dla modelu
  • Parser metadanych GGUF — architektura, kwantyzacja, parametry
  • Profile serwera do szybkiego przełączania flag
  • Statystyki użycia GPU VRAM, CPU i RAM w czasie rzeczywistym
  • Duplikuj, eksportuj i usuwaj modele

Lokalne modele

4 modele
Llama-3.1-8B-Instruct
Q4_K_M - 4.9 GB - 6.1 GB VRAM
Uruchomiony
Mistral-7B-Instruct
Q5_K_M - 5.6 GB - 6.8 GB VRAM
Qwen2.5-72B-Instruct
Q3_K_S - 35.2 GB - 38.4 GB VRAM
Phi-3.5-mini-instruct
Q4_K_M - 2.2 GB - 3.0 GB VRAM
Czat
Explain how KV cache quantization works in llama.cpp
KV cache quantization reduces memory usage by storing key and value tensors in lower precision (e.g., Q4, Q8).
Napisz wiadomość...

Czatuj z lokalnym AI

Strumieniowane odpowiedzi od uruchomionego llama-servera. Zarządzaj wieloma sesjami czatu, edytuj prompt systemowy i przejdź do trybu terminala z xterm.js dla zaawansowanych scenariuszy.

  • Strumieniowane odpowiedzi w czasie rzeczywistym od lokalnego modelu
  • Wiele sesji z pełną historią
  • Konfigurowalne prompty systemowe
  • Tryb terminala z wieloma sesjami xterm.js
  • Wyświetlanie tokenów rozumowania dla modeli CoT

Przeglądaj i pobieraj z HuggingFace

Wyszukuj modele GGUF bezpośrednio z HuggingFace. Otrzymuj wskazówki dopasowania VRAM na podstawie Twojego GPU, sprawdzaj miejsce na dysku przed pobraniem i pobieraj pliki bezpośrednio do folderu modeli z możliwością wznowienia.

  • Wyszukiwanie zapytaniem, kategorią lub popularnością
  • Wskazówki VRAM na podstawie Twojego GPU
  • Sprawdzanie miejsca na dysku przed pobraniem
  • Pobieranie multi-GB z możliwością wznowienia
  • Badge'y dostawców GGUF
llama-3.1 8b instruct
Llama-3.1-8B-Instruct-Q4_K_M
Q4_K_M~6.1 GB VRAMdown 12.4K
Llama-3.1-8B-Instruct-Q5_K_M
Q5_K_M~6.8 GB VRAMdown 8.7K
Llama-3.1-8B-Instruct-Q3_K_S
Q3_K_S~4.1 GB VRAMdown 3.2K
  • Llama
  • Mistral
  • Qwen
  • Gemma
  • DeepSeek
  • Nemotron

Wyniki benchmarku

Wydajność: 47.3 tokens/s
Math92%
Logic88%
Code76%
Knowledge95%
Format84%
Traps71%
Ocena AI Judge91.2/100

Mierz. Porównuj. Optymalizuj.

Uruchom testy szybkości llama-bench, aby zmierzyć tokeny/sekundę. Oceń jakość za pomocą 18 zadań deterministycznych obejmujących matematykę, logikę, kod i wiedzę. Oceniaj wszystko z pomocą AI.

  • Benchmark szybkości llama-bench (tokeny/s)
  • 18 zadań jakości: matematyka, logika, kod, format, wiedza, pułapki
  • Test perplexity (wikitext-2)
  • Ocena jakości AI przez Claude/OpenAI/Gemini
  • Gniazda do porównywania wielu modeli

Niech AI stroi Twój serwer

Zapomnij o ręcznym strojeniu flag. Faza badania AI sugeruje optymalne flagi uruchomieniowe, a następnie automatycznie testuje każdego kandydata przez pętlę prób. KV cache quantization, rozmiary chunków, dopasowanie do VRAM, wszystko optymalizowane automatycznie.

  • Faza badania AI sugeruje optymalne kandydatki flag
  • Automatyczna pętla testów benchmarkowych
  • Testowanie drabiny kwantyzacji KV cache
  • Strojenie rozmiaru kontekstu i chunków
  • Automatyczne dopasowanie do VRAM

Auto-Tune Pipeline

01
Badanie AI
Analizuje model i GPU, sugerując optymalne kandydatki flag
02
Pętla prób
Testuje każdego kandydata przez automatyczne benchmarki llama-bench
03
Wybór
Wybiera zwycięzcę na podstawie metryk szybkości i jakości
Najlepsza konfiguracjaq8_0 | --ngl 35 | --batch 2048

Analityka użycia

247
Łączne czaty
1.2s
Śr. odpowiedź
12.4K
Wiadomości
2.1M
Generowane tokeny
Aktywność tygodniowa

Poznaj swoje nawyki AI

Śledź wzorce użycia AI za pomocą kompleksowego dashboardu. Monitoruj liczbę czatów, wiadomości, czas odpowiedzi i liczbę znaków. Identyfikuj najbardziej aktywne dni i najlepsze rozmowy.

  • Liczba czatów i wiadomości
  • Podział wiadomości użytkownika vs asystenta
  • Średni i medianowy czas odpowiedzi
  • Proporcja wygenerowanych do wysłanych znaków
  • Śledzenie najbardziej aktywnych dni
Lista zmian

Co nowego w v0.1.63

  • Wsparcie dla macOS (Apple Silicon) — Llama Control działa teraz natywnie na Makach z M1 i nowszych
  • Czat z modelami z telefonu: włącz „Zdalny dostęp" w Ustawieniach i sparuj urządzenia w tej samej sieci Wi-Fi kodem QR lub PIN-em — na telefonie nie trzeba niczego instalować
  • Nowa zakładka Wtyczki, a w niej Ekstraktor JSON — wklej tekst, zdefiniuj schemat (lub pozwól modelowi zaproponować go na podstawie tekstu) i otrzymaj ustrukturyzowany JSON gwarantowanie zgodny ze schematem
  • Przycisk „Podłącz narzędzie kodujące" w Czacie generuje gotową do wklejenia konfigurację OpenCode/Crush wskazującą na Twój lokalny serwer
  • Przy starcie pojawia się teraz ekran konfiguracji, jeśli llama.cpp nie jest jeszcze zainstalowane, zamiast pozostawiać aplikację w niedziałającym stanie
  • Panel boczny można teraz zwinąć do wąskiego paska z ikonami, by zyskać więcej miejsca na ekranie
  • Wyszukiwanie HuggingFace doładowuje teraz kolejne wyniki podczas przewijania i pokazuje datę dodania każdego modelu
  • Dodano przycisk odświeżania na liście zapisanych czatów
  • Dodano wyjaśnienie, dlaczego scroll myszą może nie działać w panelu terminala OpenCode, wraz z poprawką konfiguracji

Najczęściej zadawane pytania

Wszystko, co musisz wiedzieć o Llama Control.

Gotowy, aby przejąć kontrolę?

Pobierz Llama Control za darmo i zacznij zarządzać swoim lokalnym AI już dziś. Windows 10+ lub macOS (Apple Silicon), bez konieczności zakładania konta.

v0.1.63 — Windows 10/11 (~110 MB) lub macOS Apple Silicon (~130 MB)