Локальный ИИ-ассистент для встреч: диаризация, граф знаний и нулевое облако
Представьте инструмент, который записывает ваши видеоконференции, распознаёт, кто и что говорит, позволяет задавать вопросы по ходу встречи и автоматически строит сеть связанных заметок — и всё это работает на вашем Mac без отправки данных в облако. Именно такой проект под названием «Локальный ИИ-ас

Представьте инструмент, который записывает ваши видеоконференции, распознаёт, кто и что говорит, позволяет задавать вопросы по ходу встречи и автоматически строит сеть связанных заметок — и всё это работает на вашем Mac без отправки данных в облако. Именно такой проект под названием «Локальный ИИ-ассистент для встреч» опубликовал разработчик под ником vzblk. Это open-source решение, доступное на GitHub под лицензией Apache 2.0, которое объединяет несколько современных технологий искусственного интеллекта для полной автономии и конфиденциальности.
Как устроен локальный ассистент
В основе ассистента лежит связка из нескольких открытых компонентов. За распознавание речи отвечает модель Whisper от OpenAI, запущенная локально — она преобразует аудиопоток в текст с высокой точностью. Диаризация, то есть разделение голосов участников, реализована через библиотеку PyAnnote: она анализирует аудио и присваивает каждому фрагменту метку говорящего. Для ответов на вопросы по содержанию встречи используется языковая модель Llama 2 или Mistral, запущенная через Ollama — это позволяет задавать уточняющие вопросы в реальном времени. Граф знаний строится на основе Obsidian: заметки связываются в сеть понятий, которая автоматически обновляется после каждой встречи, создавая структурированное представление обсуждаемых тем.
Какие технологии используются для диаризации и распознавания речи?
Диаризация — ключевой элемент, позволяющий понять, кто из участников что сказал. PyAnnote работает на основе нейронных сетей, обученных на больших корпусах аудиоданных. Однако на практике возникают сложности: иногда алгоритм создаёт до 23 «голосов» для одной встречи из-за фрагментации аудио — например, когда участники перебивают друг друга или делают паузы. Разработчик решил эту проблему постобработкой с пороговыми значениями длительности сегментов: слишком короткие фрагменты объединяются с соседними. Другая трудность — «ловушка обращений»: когда ассистент неправильно присваивает имя говорящему, если тот обращается к другому участнику по имени. Здесь применяются эвристики на основе контекста, но идеального решения пока нет. Whisper, в свою очередь, использует модель large-v3, которая требует около 3 ГБ оперативной памяти и обеспечивает высокое качество распознавания даже при фоновом шуме.
Предыстория и контекст
Проблема конфиденциальности облачных сервисов для видеоконференций становится всё острее. Крупные компании, такие как Zoom, Microsoft Teams и Google Meet, предлагают встроенные ИИ-функции для транскрибации и анализа встреч, но они требуют передачи аудиоданных на серверы, что вызывает опасения у пользователей, работающих с чувствительной информацией. Локальные альтернативы существуют, но обычно они сложны в настройке и требуют глубоких технических знаний. Проект vzblk решает эту задачу, предлагая готовую сборку с открытым исходным кодом, которая работает полностью на устройстве. Разработчик отмечает, что вдохновлялся идеей «zero-cloud» — полной автономии без интернета, что особенно актуально в условиях ограниченного доступа к некоторым облачным сервисам, например, в России и СНГ.
С какими проблемами столкнулся разработчик?
Главная трудность — кластеризация голосов. При диаризации PyAnnote иногда создаёт до 23 «голосов» для одной встречи из-за фрагментации аудио. Решение — постобработка с пороговыми значениями длительности сегментов: сегменты короче 0,5 секунды объединяются с соседними. Другая проблема — «ловушка обращений»: когда ассистент неправильно присваивает имя говорящему, если тот обращается к другому участнику. Разработчик применил эвристики на основе контекста, но идеального решения пока нет. Также возникают сложности с выделением оперативной памяти: для работы требуется Mac с процессором M1 или новее и минимум 16 ГБ RAM, при этом Whisper и Ollama могут потреблять до 9 ГБ в сумме, что требует тщательной настройки.
Технические детали и настройка
Для работы ассистента требуется Mac с процессором M1 или новее и минимум 16 ГБ оперативной памяти. Whisper использует модель large-v3, которая занимает около 3 ГБ RAM. Ollama выделяет контекст (numctx) в зависимости от модели: для Llama 2 7B рекомендуется 2048 токенов, что потребляет около 6 ГБ. Разработчик советует настраивать бюджет RAM через параметры Ollama, чтобы избежать свопинга и замедления системы. Граф знаний в Obsidian строится через специальный плагин, который анализирует размеченные заметки и создаёт связи между упомянутыми сущностями — например, если на встрече обсуждался проект X и упоминался клиент Y, в графе появляется связь между этими понятиями. Для установки необходимо склонировать репозиторий с GitHub, установить зависимости через pip и настроить конфигурационные файлы. Разработчик предоставил подробную инструкцию, но для неопытных пользователей процесс может показаться сложным.
Кого затронет и как
Инструмент полезен для разработчиков, менеджеров и исследователей, которые проводят много встреч и хотят сохранять контекст без утечки данных. В России и СНГ, где доступ к некоторым облачным сервисам ограничен, локальное решение становится особенно актуальным. Для обычных пользователей настройка может показаться сложной, но автор обещает упростить процесс в будущих версиях, возможно, добавив графический интерфейс и установщик «в один клик». Пока что проект ориентирован на технически подкованную аудиторию, но его потенциал огромен: от корпоративных внедрений до индивидуального использования.
Что будет дальше
Разработчик планирует добавить поддержку Windows и Linux, улучшить точность диаризации за счёт fine-tuning моделей на русскоязычных данных, а также интегрировать ассистента с другими менеджерами заметок, такими как Notion или Roam. В долгосрочной перспективе — создание универсального плагина для браузеров, который будет работать с любыми видеоконференциями, включая Zoom, Google Meet и Яндекс.Телемост. Также рассматривается возможность добавления суммаризации встреч и автоматического создания задач на основе обсуждений.
Итог
Локальный ИИ-ассистент для встреч — это шаг к приватному и автономному ведению заметок. Проект показывает, что современные open-source модели способны заменить облачные сервисы без потери качества. Разработчикам стоит обратить внимание на код — он может стать основой для корпоративных решений, особенно в условиях повышенных требований к конфиденциальности. Если вы ищете способ автоматизировать запись встреч без компромиссов по безопасности, этот проект — отличная отправная точка.