Лицензия FMLL: как copyleft распространяется на ИИ-модели и датасеты
Лицензия FMLL (Free Machine Learning License) — это copyleft-лицензия, разработанная для машинного обучения, которая требует, чтобы все производные работы, включая модели, датасеты и пайплайны, распространялись под той же лицензией. Она решает проблему, когда открытые модели используются в закрытых

Лицензия FMLL (Free Machine Learning License) — это copyleft-лицензия, разработанная для машинного обучения, которая требует, чтобы все производные работы, включая модели, датасеты и пайплайны, распространялись под той же лицензией. Она решает проблему, когда открытые модели используются в закрытых системах, и предлагает механизм, аналогичный GPL, но адаптированный под ИИ. В отличие от традиционных open-source лицензий, FMLL охватывает не только код, но и веса, архитектуру, данные и RAG-компоненты, обеспечивая полную свободу всех элементов системы.
Что такое FMLL и как она работает
FMLL — это copyleft-лицензия, специально созданная для машинного обучения. Её ключевая особенность — требование, что любая модифицированная или производная работа должна распространяться под той же лицензией. Это касается не только исходного кода, но и обученных весов, архитектуры, датасетов, документов, RAG (Retrieval-Augmented Generation) и других инструментов. По сути, если вы дообучили модель на своих данных, вы обязаны выпустить результат под FMLL.
Первая версия лицензии уже доступна на GitHub. Автор подчёркивает, что FMLL не является юридически завершённым документом — это рабочий черновик, который требует обсуждения и доработки с сообществом. Однако сама идея уже вызвала оживлённые дискуссии: сможет ли такая лицензия реально защитить открытые ИИ-проекты от коммерческого захвата?
Предыстория и контекст
Проблема, которую решает FMLL, давно витает в воздухе. Традиционные open-source лицензии (MIT, Apache, GPL) плохо применимы к ИИ. Код библиотеки — да, но модель как набор чисел — нет. Кроме того, многие компании выпускают модель с открытыми весами, но закрывают датасеты или пайплайны, что фактически делает модель несвободной. Meta, например, выпустила Llama 2 с ограничениями, а не под настоящей open-source лицензией. В ответ появились инициативы вроде OpenRAIL, но они не являются чисто copyleft.
FMLL пытается закрыть эту брешь. Если проект использует модель под FMLL, весь стек — от данных до вывода — должен оставаться свободным. Это может стать мощным инструментом для сообществ, которые хотят предотвратить использование их разработок в проприетарных продуктах.
Чем FMLL отличается от OpenRAIL и других лицензий
OpenRAIL (Open Responsible AI License) от BigScience и других организаций — это не copyleft, а лицензия с дополнительными ограничениями (например, запрет на вредоносное использование). FMLL же строго требует, чтобы все производные работы были под той же лицензией. Это делает её более радикальной: она не просто запрещает определённые виды использования, а гарантирует, что код и данные остаются открытыми для всех модификаций.
Другое отличие — охват. FMLL включает не только код и модель, но и датасеты, RAG, документацию. Это важно, потому что многие проекты используют открытую модель, но закрывают данные, на которых она обучалась или дообучалась. FMLL закрывает эту лазейку.
Технические подробности лицензии
Текст лицензии определяет «Произведение» как результат машинного обучения, включая веса, архитектуру, код вывода, датасеты, RAG-системы и документацию. «Обработка» означает любое использование, модификацию или распространение. Ключевое условие: если вы распространяете произведение, основанное на оригинале, вы обязаны сделать его доступным под FMLL.
Лицензия также содержит положения о патентных правах: если вы патентуете изобретение, связанное с произведением, вы должны предоставить лицензию всем, кто использует произведение. Это стандартная практика для copyleft.
Важно, что FMLL не запрещает коммерческое использование. Напротив, вы можете продавать услуги или продукты на основе модели — но обязаны открыть все изменения. Это делает её похожей на AGPL, но адаптированной под ИИ.
Кого затронет и как
Разработчики open-source ИИ-проектов могут использовать FMLL, чтобы защитить свои наработки от корпораций, которые берут открытую модель, дообучают на своих данных и закрывают результат. Например, стартап, выпустивший медицинскую модель под FMLL, может быть уверен, что любой, кто улучшит её, обязан поделиться улучшениями.
Для бизнеса FMLL создаёт риски: если вы используете модель под FMLL в своём продукте, вам придётся открыть все связанные компоненты. Это может быть неприемлемо для проприетарных проектов. С другой стороны, для компаний, которые хотят строить экосистему на открытых технологиях, FMLL может стать основой.
В России и СНГ интерес к таким лицензиям растёт. Несколько проектов в области NLP и компьютерного зрения уже обсуждают возможность перехода на FMLL. Однако юридическая сила лицензии в российской юрисдикции пока неясна — потребуется адаптация.
Какие риски для бизнеса при использовании FMLL?
Использование FMLL в коммерческом продукте означает, что все модификации модели, датасетов и связанных компонентов должны быть открыты. Это может нарушить бизнес-модели, основанные на закрытых данных, и потребовать пересмотра стратегии интеллектуальной собственности. Однако для компаний, ориентированных на open-source, FMLL может стать конкурентным преимуществом, привлекая сообщество разработчиков.
Что будет дальше
Автор планирует собрать обратную связь от сообщества и юристов, чтобы выпустить стабильную версию 1.0. Вероятно, лицензия будет дорабатываться с учётом замечаний. Уже сейчас на GitHub открыты issue для обсуждения. Если FMLL получит поддержку, она может стать стандартом для открытых ИИ-проектов, аналогично тому, как GPL стала стандартом для открытого кода.
Однако конкуренция с OpenRAIL и другими лицензиями будет жёсткой. Кроме того, крупные компании вряд ли примут FMLL — им выгоднее сохранять контроль над данными. Поэтому успех лицензии зависит от сообщества: если крупные open-source проекты (например, Hugging Face) начнут её использовать, это может изменить баланс сил.
Итог
FMLL — смелая попытка применить принципы свободного программного обеспечения к машинному обучению. Она решает реальную проблему: открытые модели часто являются лишь частью системы, а остальные компоненты остаются закрытыми. Если лицензия получит распространение, она может значительно повысить уровень свободы в ИИ-экосистеме, но её принятие потребует времени и юридической доработки.