Whisper AI локално: инсталация стъпка по стъпка за безплатна транскрипция и субтитри (2026)
Ако редовно обработваш видео или аудио — обаждания, интервюта, YouTube клипове — и ти писна да плащаш за облачна транскрипция или да качваш чувствителни записи в чужд облак, Whisper AI на OpenAI може да работи изцяло локално на твоя компютър. Безплатно, без лимит на минути, без интернет връзка по време на самата транскрипция.
В това ръководство минаваме през реална инсталация стъпка по стъпка, сравняваме моделите на Whisper, показваме конкретни команди и малък скрипт за автоматизация на цяла папка с файлове — точно както бих го направил, ако трябва да обработя записи от поддръжка или видео анализ на работа.
- Защо локално, а не облачна услуга
- Изисквания
- Инсталация стъпка по стъпка
- Кой модел на Whisper да избереш
- Как да транскрибираш файл
- Автоматизация на цяла папка
- Чести грешки и решения
- Въпроси и отговори
Защо локално, а не облачна услуга
Облачните инструменти за субтитри (Vizard, Descript, различни онлайн генератори) са удобни, но имат три общи ограничения: месечен лимит на минути, качване на файла към чужд сървър и абонамент. Локалният Whisper няма нито едно от трите:
- Поверителност — записът никога не напуска компютъра ти. Важно, ако транскрибираш обаждания на клиенти или вътрешни срещи.
- Без лимит — можеш да пуснеш 10 часа видео наведнъж, ако имаш търпение (или добра видеокарта).
- Безплатно завинаги — моделът е с отворен код, плащаш само електричество.
- Работи офлайн — веднъж изтеглен моделът, интернет не е нужен.
Изисквания
| Компонент | Минимум | Препоръчително |
|---|---|---|
| Операционна система | Windows 10/11, macOS, Linux | Windows 11 / Linux |
| Python | 3.9 | 3.10 или 3.11 |
| Място на диска | ~2 GB | ~10 GB (за по-големи модели) |
| RAM | 8 GB | 16 GB+ |
| GPU | Не е задължително | NVIDIA с 6 GB+ VRAM (много по-бързо) |
| FFmpeg | Задължително | — |
Без GPU Whisper работи на процесора — по-бавно, но перфектно използваемо за модели tiny/base/small.
Инсталация стъпка по стъпка (Windows)
- Инсталирай Python от python.org — при инсталация отбележи Add python.exe to PATH.
- Инсталирай FFmpeg. Най-лесно през Chocolatey:
choco install ffmpegАко нямаш Chocolatey, свали статичен build от gyan.dev и добави папката
binв PATH ръчно. - Създай виртуална среда (препоръчително, за да не се сблъскат версии на библиотеки):
python -m venv whisper-env whisper-envScriptsactivate - Инсталирай Whisper:
pip install -U openai-whisper - (По желание) Инсталирай PyTorch с CUDA, ако имаш NVIDIA видеокарта — ускорява транскрипцията 5-10 пъти:
pip install torch --index-url https://download.pytorch.org/whl/cu121 - Провери инсталацията:
whisper --helpАко видиш списък с параметри — готово.
На Linux/macOS стъпките са идентични, само активирането на виртуалната среда е
source whisper-env/bin/activate, а FFmpeg се инсталира сsudo apt install ffmpegилиbrew install ffmpeg.
Кой модел на Whisper да избереш
Whisper предлага пет основни размера. По-голям модел = по-точен резултат, но по-бавен и по-тежък за хардуера. За български език препоръчвам поне small, а идеално medium — по-малките модели грешат забележимо повече при кирилица.
| Модел | Параметри | Нужна VRAM | Скорост (спрямо large) | Препоръка |
|---|---|---|---|---|
tiny |
39M | ~1 GB | ~32x | Бърз тест, английски |
base |
74M | ~1 GB | ~16x | Чернова, английски |
small |
244M | ~2 GB | ~6x | Минимум за български |
medium |
769M | ~5 GB | ~2x | Най-добър баланс за BG |
large-v3 |
1550M | ~10 GB | 1x | Максимална точност |
Ако нямаш видеокарта, стартирай с small — medium на чист процесор може да отнеме няколко пъти повече от продължителността на самия запис.
Как да транскрибираш файл
Базова команда за файл на български, с експорт на субтитри:
whisper razgovor.mp3 --model medium --language Bulgarian --output_format srt
Полезни флагове:
| Флаг | Какво прави |
|---|---|
--language Bulgarian |
Пропуска автоматичното разпознаване на език (по-бързо и по-точно) |
--output_format |
txt, srt, vtt, json или all |
--task translate |
Превежда директно на английски вместо да транскрибира |
--fp16 False |
Задължително, ако работиш само на CPU |
--output_dir |
Папка, в която да се запишат резултатите |
За видео файл (.mp4, .mkv) командата е същата — Whisper извлича аудиото автоматично през FFmpeg.
Автоматизация на цяла папка
Ако обработваш повече от един файл наведнъж (например записи от support обаждания за седмицата), не е нужно да пускаш командата ръчно за всеки. Малък Python скрипт върши работа:
import os, subprocess
INPUT_DIR = "zapisi"
MODEL = "medium"
for filename in os.listdir(INPUT_DIR):
if filename.lower().endswith((".mp3", ".wav", ".mp4", ".m4a")):
path = os.path.join(INPUT_DIR, filename)
subprocess.run([
"whisper", path,
"--model", MODEL,
"--language", "Bulgarian",
"--output_format", "srt",
"--output_dir", "subtitri"
])
print("Готово — виж папка 'subtitri'.")
За по-голяма скорост на batch обработка си струва да пробваш faster-whisper — преработка на същите модели върху CTranslate2, до 4 пъти по-бърза при същата точност. За машини без видеокарта пък whisper.cpp е по-лек C++ вариант, оптимизиран за CPU.
Чести грешки и решения
| Грешка | Причина | Решение |
|---|---|---|
FileNotFoundError: ffmpeg |
FFmpeg не е в PATH | Преинсталирай през Chocolatey или добави ръчно папката bin в системния PATH |
CUDA out of memory |
Моделът е твърде голям за наличната VRAM | Мини на по-малък модел (small вместо medium) |
| Много бавна обработка | Работи на CPU без оптимизация | Пробвай faster-whisper или намали модела |
| Грешно разпознат език | Автоматичното разпознаване е сгрешило | Задай изрично --language Bulgarian |
| Странни символи в субтитрите | Грешно кодиране при отваряне | Отвори .srt файла в редактор с UTF-8, не с Notepad по подразбиране |
Въпроси и отговори
Безплатен ли е Whisper AI?
Да, напълно. Кодът и моделите на OpenAI Whisper са с отворен лиценз (MIT). Плащаш само за електричество на собствения си компютър — няма абонамент и няма лимит на минути.
Задължителна ли е видеокарта?
Не. Whisper работи и на чист процесор, особено с по-малките модели (tiny/base/small). Видеокарта просто ускорява процеса значително, което си струва при по-големи обеми.
Колко добре разпознава български език?
Прилично от модел small нагоре, а medium и large-v3 дават резултат, близък до ръчна транскрипция при ясен звук. По-малките модели (tiny/base) правят забележимо повече грешки на кирилица.
Как се различава от облачни услуги като Vizard или Descript?
Локалният Whisper няма лимит на минути и не изпраща записа никъде — идеален за поверителни разговори. В замяна няма готов интерфейс с drag-and-drop и стилизирани субтитри — това го правиш ръчно или с допълнителен скрипт.
Мога ли да го ползвам за автоматизация на работен процес?
Да — точно за това е скриптът по-горе. Може да го включиш в по-голяма автоматизация (например: нов запис в папка → автоматична транскрипция → преглед на текста за ключови думи) чрез cron задача (Linux) или Task Scheduler (Windows).
Последна проверка на инструкциите: август 2026. Whisper се обновява периодично — при проблем с инсталацията провери официалния GitHub за текущите изисквания.