Whisper AI локално: инсталация стъпка по стъпка за безплатна транскрипция и субтитри (2026)

Ако редовно обработваш видео или аудио — обаждания, интервюта, YouTube клипове — и ти писна да плащаш за облачна транскрипция или да качваш чувствителни записи в чужд облак, Whisper AI на OpenAI може да работи изцяло локално на твоя компютър. Безплатно, без лимит на минути, без интернет връзка по време на самата транскрипция.

В това ръководство минаваме през реална инсталация стъпка по стъпка, сравняваме моделите на Whisper, показваме конкретни команди и малък скрипт за автоматизация на цяла папка с файлове — точно както бих го направил, ако трябва да обработя записи от поддръжка или видео анализ на работа.

Защо локално, а не облачна услуга

Облачните инструменти за субтитри (Vizard, Descript, различни онлайн генератори) са удобни, но имат три общи ограничения: месечен лимит на минути, качване на файла към чужд сървър и абонамент. Локалният Whisper няма нито едно от трите:

  • Поверителност — записът никога не напуска компютъра ти. Важно, ако транскрибираш обаждания на клиенти или вътрешни срещи.
  • Без лимит — можеш да пуснеш 10 часа видео наведнъж, ако имаш търпение (или добра видеокарта).
  • Безплатно завинаги — моделът е с отворен код, плащаш само електричество.
  • Работи офлайн — веднъж изтеглен моделът, интернет не е нужен.

Изисквания

Компонент Минимум Препоръчително
Операционна система Windows 10/11, macOS, Linux Windows 11 / Linux
Python 3.9 3.10 или 3.11
Място на диска ~2 GB ~10 GB (за по-големи модели)
RAM 8 GB 16 GB+
GPU Не е задължително NVIDIA с 6 GB+ VRAM (много по-бързо)
FFmpeg Задължително

Без GPU Whisper работи на процесора — по-бавно, но перфектно използваемо за модели tiny/base/small.

Инсталация стъпка по стъпка (Windows)

  1. Инсталирай Python от python.org — при инсталация отбележи Add python.exe to PATH.
  2. Инсталирай FFmpeg. Най-лесно през Chocolatey:
    choco install ffmpeg

    Ако нямаш Chocolatey, свали статичен build от gyan.dev и добави папката bin в PATH ръчно.

  3. Създай виртуална среда (препоръчително, за да не се сблъскат версии на библиотеки):
    python -m venv whisper-env
    whisper-envScriptsactivate
  4. Инсталирай Whisper:
    pip install -U openai-whisper
  5. (По желание) Инсталирай PyTorch с CUDA, ако имаш NVIDIA видеокарта — ускорява транскрипцията 5-10 пъти:
    pip install torch --index-url https://download.pytorch.org/whl/cu121
  6. Провери инсталацията:
    whisper --help

    Ако видиш списък с параметри — готово.

На Linux/macOS стъпките са идентични, само активирането на виртуалната среда е source whisper-env/bin/activate, а FFmpeg се инсталира с sudo apt install ffmpeg или brew install ffmpeg.

Кой модел на Whisper да избереш

Whisper предлага пет основни размера. По-голям модел = по-точен резултат, но по-бавен и по-тежък за хардуера. За български език препоръчвам поне small, а идеално medium — по-малките модели грешат забележимо повече при кирилица.

Модел Параметри Нужна VRAM Скорост (спрямо large) Препоръка
tiny 39M ~1 GB ~32x Бърз тест, английски
base 74M ~1 GB ~16x Чернова, английски
small 244M ~2 GB ~6x Минимум за български
medium 769M ~5 GB ~2x Най-добър баланс за BG
large-v3 1550M ~10 GB 1x Максимална точност

Ако нямаш видеокарта, стартирай с smallmedium на чист процесор може да отнеме няколко пъти повече от продължителността на самия запис.

Как да транскрибираш файл

Базова команда за файл на български, с експорт на субтитри:

whisper razgovor.mp3 --model medium --language Bulgarian --output_format srt

Полезни флагове:

Флаг Какво прави
--language Bulgarian Пропуска автоматичното разпознаване на език (по-бързо и по-точно)
--output_format txt, srt, vtt, json или all
--task translate Превежда директно на английски вместо да транскрибира
--fp16 False Задължително, ако работиш само на CPU
--output_dir Папка, в която да се запишат резултатите

За видео файл (.mp4, .mkv) командата е същата — Whisper извлича аудиото автоматично през FFmpeg.

Автоматизация на цяла папка

Ако обработваш повече от един файл наведнъж (например записи от support обаждания за седмицата), не е нужно да пускаш командата ръчно за всеки. Малък Python скрипт върши работа:

import os, subprocess

INPUT_DIR = "zapisi"
MODEL = "medium"

for filename in os.listdir(INPUT_DIR):
    if filename.lower().endswith((".mp3", ".wav", ".mp4", ".m4a")):
        path = os.path.join(INPUT_DIR, filename)
        subprocess.run([
            "whisper", path,
            "--model", MODEL,
            "--language", "Bulgarian",
            "--output_format", "srt",
            "--output_dir", "subtitri"
        ])
print("Готово — виж папка 'subtitri'.")

За по-голяма скорост на batch обработка си струва да пробваш faster-whisper — преработка на същите модели върху CTranslate2, до 4 пъти по-бърза при същата точност. За машини без видеокарта пък whisper.cpp е по-лек C++ вариант, оптимизиран за CPU.

Чести грешки и решения

Грешка Причина Решение
FileNotFoundError: ffmpeg FFmpeg не е в PATH Преинсталирай през Chocolatey или добави ръчно папката bin в системния PATH
CUDA out of memory Моделът е твърде голям за наличната VRAM Мини на по-малък модел (small вместо medium)
Много бавна обработка Работи на CPU без оптимизация Пробвай faster-whisper или намали модела
Грешно разпознат език Автоматичното разпознаване е сгрешило Задай изрично --language Bulgarian
Странни символи в субтитрите Грешно кодиране при отваряне Отвори .srt файла в редактор с UTF-8, не с Notepad по подразбиране

Въпроси и отговори

Безплатен ли е Whisper AI?

Да, напълно. Кодът и моделите на OpenAI Whisper са с отворен лиценз (MIT). Плащаш само за електричество на собствения си компютър — няма абонамент и няма лимит на минути.

Задължителна ли е видеокарта?

Не. Whisper работи и на чист процесор, особено с по-малките модели (tiny/base/small). Видеокарта просто ускорява процеса значително, което си струва при по-големи обеми.

Колко добре разпознава български език?

Прилично от модел small нагоре, а medium и large-v3 дават резултат, близък до ръчна транскрипция при ясен звук. По-малките модели (tiny/base) правят забележимо повече грешки на кирилица.

Как се различава от облачни услуги като Vizard или Descript?

Локалният Whisper няма лимит на минути и не изпраща записа никъде — идеален за поверителни разговори. В замяна няма готов интерфейс с drag-and-drop и стилизирани субтитри — това го правиш ръчно или с допълнителен скрипт.

Мога ли да го ползвам за автоматизация на работен процес?

Да — точно за това е скриптът по-горе. Може да го включиш в по-голяма автоматизация (например: нов запис в папка → автоматична транскрипция → преглед на текста за ключови думи) чрез cron задача (Linux) или Task Scheduler (Windows).


Последна проверка на инструкциите: август 2026. Whisper се обновява периодично — при проблем с инсталацията провери официалния GitHub за текущите изисквания.