Вот пошаговое руководство для установки AI сервера на Debian:
## Способ 1: Установка Ollama (рекомендуется для новичков)
**Установка:**
1. Загрузите и установите Ollama:
```bash
curl -fsSL https://ollama.ai/install.sh | sh
```
2. Запустите сервис:
```bash
ollama serve
```
3. В отдельном терминале загрузите модель (например, Mistral или Llama 2):
```bash
ollama pull mistral
```
4. Используйте API (по умолчанию на `http://localhost:11434`):
```bash
curl http://localhost:11434/api/generate -d '{"model":"mistral","prompt":"Hello"}'
```
---
## Способ 2: LLaMA с вебинтерфейсом (text-generation-webui)
**Предварительные требования:**
```bash
sudo apt update
sudo apt install git python3-pip python3-venv nvidia-cuda-toolkit
```
**Установка:**
```bash
git clone https://github.com/oobabooga/text-generation-webui
cd text-generation-webui
pip install -r requirements.txt
python server.py
```
Откройте браузер на `http://localhost:7860`
---
## Способ 3: FastAPI + Hugging Face (для кастомных решений)
**Установка зависимостей:**
```bash
sudo apt install python3-pip python3-venv
python3 -m venv venv
source venv/bin/activate
pip install fastapi uvicorn transformers torch
```
**Создайте файл `server.py`:**
```python
from fastapi import FastAPI
from transformers import pipeline
app = FastAPI()
nlp = pipeline("text-generation", model="gpt2")
@app.post("/generate")
def generate_text(prompt: str):
return nlp(prompt, max_length=100)
```
**Запуск:**
```bash
uvicorn server.py:app --host 0.0.0.0 --port 8000
```
---
## Способ 4: Docker контейнер
```bash
sudo apt install docker.io docker-compose
docker pull ollama/ollama
docker run -d -p 11434:11434 ollama/ollama
```
---
## Рекомендации
- **Ollama** — самый простой способ для начинающих
- Убедитесь, что у вас достаточно **ОЗУ** (минимум 4 ГБ, лучше 8+)
- Для **GPU ускорения** установите поддержку CUDA или ROCm
- Используйте **smaller модели** (Mistral, Neural Chat) для слабого железа
Какой способ вас интересует больше всего? Я могу дать более подробные инструкции по конкретному подходу.
Ollama
Re: Ollama
Установка собственного ИИ-сервера на Debian зависит от ваших целей (простое общение с моделью или создание API для приложений) и вашего оборудования. Самый простой и популярный способ сегодня — использование Ollama, так как она берет на себя управление моделями и оптимизацию под ваше железо.
1. Подготовьте оборудование и систему. Для комфортной работы рекомендуется видеокарта NVIDIA с достаточным объемом видеопамяти (VRAM) — от 8 ГБ и выше. Если видеокарты нет, модель будет работать на процессоре (CPU), но значительно медленнее. Обновите систему до актуального состояния: `sudo apt update && sudo apt upgrade`.
2. Установите драйверы NVIDIA и CUDA (если есть GPU). В Debian по умолчанию отключены несвободные репозитории. Отредактируйте файл `/etc/apt/sources.list`, добавив `contrib non-free non-free-firmware` к основным веткам репозиториев. После этого выполните `sudo apt update` и установите драйверы командой `sudo apt install nvidia-driver cuda`. Перезагрузите сервер, чтобы драйверы вступили в силу.
3. Установите Ollama. Это самый быстрый способ запустить LLM. Выполните команду установки: `curl -fsSL https://ollama.com/install.sh | sh`. После завершения установки сервис Ollama будет автоматически работать в фоне.
4. Запустите выбранную модель. Для проверки работоспособности можно запустить одну из популярных моделей, например Llama 3 или Mistral. Введите в терминале `ollama run llama3`. Программа сама скачает веса модели и откроет чат прямо в консоли.
5. Разверните веб-интерфейс. Чтобы не пользоваться консолью, рекомендуется установить Open WebUI, который предоставляет интерфейс, похожий на ChatGPT. Проще всего это сделать через Docker. Сначала установите Docker: `sudo apt install docker.io`. Затем запустите контейнер с интерфейсом, связав его с локальным сервером Ollama:
`docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main`
После этого интерфейс будет доступен в браузере по адресу `http://ip-вашего-сервера:3000`.
Если вам нужен более профессиональный инструмент для высоконагруженного API, рассмотрите vLLM или LocalAI. Они требуют более сложной настройки через Docker и Python-окружение, но обеспечивают большую пропускную способность и совместимость с форматом OpenAI API.
1. Подготовьте оборудование и систему. Для комфортной работы рекомендуется видеокарта NVIDIA с достаточным объемом видеопамяти (VRAM) — от 8 ГБ и выше. Если видеокарты нет, модель будет работать на процессоре (CPU), но значительно медленнее. Обновите систему до актуального состояния: `sudo apt update && sudo apt upgrade`.
2. Установите драйверы NVIDIA и CUDA (если есть GPU). В Debian по умолчанию отключены несвободные репозитории. Отредактируйте файл `/etc/apt/sources.list`, добавив `contrib non-free non-free-firmware` к основным веткам репозиториев. После этого выполните `sudo apt update` и установите драйверы командой `sudo apt install nvidia-driver cuda`. Перезагрузите сервер, чтобы драйверы вступили в силу.
3. Установите Ollama. Это самый быстрый способ запустить LLM. Выполните команду установки: `curl -fsSL https://ollama.com/install.sh | sh`. После завершения установки сервис Ollama будет автоматически работать в фоне.
4. Запустите выбранную модель. Для проверки работоспособности можно запустить одну из популярных моделей, например Llama 3 или Mistral. Введите в терминале `ollama run llama3`. Программа сама скачает веса модели и откроет чат прямо в консоли.
5. Разверните веб-интерфейс. Чтобы не пользоваться консолью, рекомендуется установить Open WebUI, который предоставляет интерфейс, похожий на ChatGPT. Проще всего это сделать через Docker. Сначала установите Docker: `sudo apt install docker.io`. Затем запустите контейнер с интерфейсом, связав его с локальным сервером Ollama:
`docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main`
После этого интерфейс будет доступен в браузере по адресу `http://ip-вашего-сервера:3000`.
Если вам нужен более профессиональный инструмент для высоконагруженного API, рассмотрите vLLM или LocalAI. Они требуют более сложной настройки через Docker и Python-окружение, но обеспечивают большую пропускную способность и совместимость с форматом OpenAI API.
Re: Ollama
LocalAI — это более мощная и гибкая альтернатива Ollama, которая создает полноценный API, полностью совместимый с OpenAI. Это означает, что любое приложение, поддерживающее OpenAI API, можно переключить на ваш собственный сервер, просто изменив URL-адрес.
1. Установите Docker и NVIDIA Container Toolkit. Поскольку LocalAI сложен в ручной компиляции, Docker является рекомендуемым способом установки. После установки обычного Docker необходимо установить NVIDIA Container Toolkit, чтобы контейнер мог использовать ресурсы видеокарты:
`sudo apt install -y nvidia-container-toolkit`
После этого перезапустите Docker: `sudo systemctl restart docker`.
2. Создайте папку для данных и конфигураций. LocalAI хранит модели и настройки в файлах, поэтому важно создать постоянный том на диске:
`mkdir -p ~/local-ai/models`
3. Запустите LocalAI с помощью Docker. Для базового запуска с поддержкой GPU используйте следующую команду:
`docker run -d --name local-ai -p 8080:8080 --gpus all -v ~/local-ai/models:/models localai/localai:latest-gpu-cuda-12`
Если видеокарты нет, замените образ на `localai/localai:latest` и удалите флаг `--gpus all`.
4. Установите модели. В отличие от Ollama, где модель скачивается одной командой, LocalAI использует конфигурационные YAML-файлы. Самый простой способ — использовать встроенную галерею в веб-интерфейсе (доступен по адресу `http://ip-сервера:8080`), где можно выбрать нужную модель и нажать Install. Либо можно отправить запрос через curl для установки конкретной модели из репозитория LocalAI.
5. Настройте доступ к API. Теперь ваш сервер работает как клон OpenAI. Вы можете использовать любой клиент (например, BetterGPT или TypingMind), указав в настройках:
- API Base URL: `http://ip-вашего-сервера:8080/v1`
- API Key: любое значение (по умолчанию LocalAI не требует ключа, но клиенты часто просят его заполнить).
6. Оптимизируйте производительность. Если вы заметили медленную работу, проверьте файл конфигурации модели в папке `~/local-ai/models`. В LocalAI можно детально настроить количество используемых потоков процессора (`threads`) и распределение слоев модели между GPU и CPU (`gpu_layers`), что позволяет запускать даже очень большие модели на ограниченном железе за счет частичного переноса вычислений в оперативную память.
1. Установите Docker и NVIDIA Container Toolkit. Поскольку LocalAI сложен в ручной компиляции, Docker является рекомендуемым способом установки. После установки обычного Docker необходимо установить NVIDIA Container Toolkit, чтобы контейнер мог использовать ресурсы видеокарты:
`sudo apt install -y nvidia-container-toolkit`
После этого перезапустите Docker: `sudo systemctl restart docker`.
2. Создайте папку для данных и конфигураций. LocalAI хранит модели и настройки в файлах, поэтому важно создать постоянный том на диске:
`mkdir -p ~/local-ai/models`
3. Запустите LocalAI с помощью Docker. Для базового запуска с поддержкой GPU используйте следующую команду:
`docker run -d --name local-ai -p 8080:8080 --gpus all -v ~/local-ai/models:/models localai/localai:latest-gpu-cuda-12`
Если видеокарты нет, замените образ на `localai/localai:latest` и удалите флаг `--gpus all`.
4. Установите модели. В отличие от Ollama, где модель скачивается одной командой, LocalAI использует конфигурационные YAML-файлы. Самый простой способ — использовать встроенную галерею в веб-интерфейсе (доступен по адресу `http://ip-сервера:8080`), где можно выбрать нужную модель и нажать Install. Либо можно отправить запрос через curl для установки конкретной модели из репозитория LocalAI.
5. Настройте доступ к API. Теперь ваш сервер работает как клон OpenAI. Вы можете использовать любой клиент (например, BetterGPT или TypingMind), указав в настройках:
- API Base URL: `http://ip-вашего-сервера:8080/v1`
- API Key: любое значение (по умолчанию LocalAI не требует ключа, но клиенты часто просят его заполнить).
6. Оптимизируйте производительность. Если вы заметили медленную работу, проверьте файл конфигурации модели в папке `~/local-ai/models`. В LocalAI можно детально настроить количество используемых потоков процессора (`threads`) и распределение слоев модели между GPU и CPU (`gpu_layers`), что позволяет запускать даже очень большие модели на ограниченном железе за счет частичного переноса вычислений в оперативную память.
Re: Ollama
Ollama 0.34.2>>> API Ollama теперь доступно по адресу 127.0.0.1:11434.
>>> Установка завершена. Запустите команду «ollama» из командной строки.
▸ Запустить Claude Code (установить)
Инструмент для программирования от Anthropic с субагентами
Запустить OpenCode (установить)
Агент для программирования с открытым исходным кодом от Anomaly
Запустить Hermes Agent (установить)
Самосовершенствующийся ИИ-агент, разработанный Nous Research
Запустить OpenClaw (установить)
Персональный ИИ с более чем 100 навыками
Запустить Hermes Desktop (установить)
Настольное приложение для Hermes Agent от Nous Research
Запустить Codex CLI (не установлено)
Агент для программирования с открытым исходным кодом от OpenAI
https://developers.openai.com/codex/cli/
Запустить Copilot CLI (не установлено)
ИИ-агент для программирования от GitHub для терминала
https://github.com/features/copilot/cli/
Запустить Oh My Pi (не установлено)
ИИ-агент для программирования с интеграцией в IDE
https://omp.sh
Запустить Cline (установить)
Автономный агент для программирования с параллельным выполнением
https://docs.factory.ai/cli/getting-started/quickstart
Запустить Droid (не установлено)
Агент для программирования от Factory, работающий как в терминале, так и в IDE
Запустить DeepSeek Harness (установить)
Набор инструментов для агентов с открытым исходным кодом от DeepSeek
Запустить Pi (установить)
Минимальный набор инструментов для ИИ-агентов с поддержкой плагинов
Запустить Poolside (не установлено)
Программный агент от Poolside для корпоративной разработки
https://github.com/poolsideai/pool
▸ Запустить Qwen Code (установить)
ИИ-агент для программирования от Qwen с возможностью использования инструментов
Код: Выделить всё
apt install npmКод: Выделить всё
gt@ollama:~$ export NVM_DIR="$HOME/.nvm"
[ -s "$NVM_DIR/nvm.sh" ] && \. "$NVM_DIR/nvm.sh"
gt@ollama:~$ nvm --version
0.39.0
gt@ollama:~$ nvm install 22
Downloading and installing node v22.23.2...
Downloading https://nodejs.org/dist/v22.23.2/node-v22.23.2-linux-x64.tar.xz...
#################################################################################################################### 100.0%
Computing checksum with sha256sum
Checksums matched!
Now using node v22.23.2 (npm v10.9.8)
gt@ollama:~$ mkdir -p ~/.npm-global
gt@ollama:~$ npm config set prefix '~/.npm-global'
gt@ollama:~$ export PATH=~/.npm-global/bin:$PATH
gt@ollama:~$ echo 'export PATH=~/.npm-global/bin:$PATH' >> ~/.bashrc
source ~/.bashrc
Your user’s .npmrc file (${HOME}/.npmrc)
has a `globalconfig` and/or a `prefix` setting, which are incompatible with nvm.
Run `nvm use --delete-prefix v22.23.2 --silent` to unset it.
gt@ollama:~$ npm install -g @qwen-code/qwen-code@latest
added 16 packages in 27s
3 packages are looking for funding
run `npm fund` for details
Re: Ollama
Загрузка обновлений для qwen
Запустить интерактивно
После этого Qwen будет доступна локально на localhost:11434
Код: Выделить всё
ollama pull qwen:latestКод: Выделить всё
ollama run qwenRe: Ollama
Код: Выделить всё
curl http://localhost:11434/api/generate -d '{
"model": "qwen",
"prompt": "Привет, как дела?",
"stream": false
}'
Код: Выделить всё
{"model":"qwen","created_at":"2026-09-23T08:24:31.937989912Z","response":"Привет! Я как-то хорошо, спасибо. Что у вас?","done":true,"done_reason":"stop","context":[151644,872,198,53645,26991,8178,11,51670,129691,30,151645,198,151644,77091,198,53645,26991,8178,0,128557,51670,12,24634,133097,11,83614,17953,1802,126394,13,130802,13932,129998,30],"total_duration":5979012646,"load_duration":3100071268,"prompt_eval_count":15,"prompt_eval_cached_count":0,"prompt_eval_duration":960214000,"eval_count":20,"eval_duration":1915085000}Код: Выделить всё
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui ghcr.io/open-webui/open-webui:latestRe: Ollama
Запуск (и установка, если не установлена) модель
список установленных моделей
Код: Выделить всё
ollama run gemma4:26bКод: Выделить всё
ollama list