Training Data Provenance

Катерина Дубас Legal IT Group
Катерина Дубас
Голова практик приватності та кібербезпеки, адвокатка
Звернутися
Технічно відстежуємо походження кожного датасету у вашому тренувальному наборі: звідки взято, які права, чи є згода або ліцензія, та створюємо систему маркування датасетів і реєстр джерел (за AI Act)
Катерина Дубас

Чому ми

Бо «ми думаємо, що це fair use» без документації — вразлива позиція

Сертифіковані privacy-engineering та IP-фахівці, які будують технічну систему обліку джерел даних, а не разову табличку
  • Команда трьох FIP

    Сертифіковані privacy-фахівці: CISSP, CIPP/E, CIPP/US, CIPM, CIPT, FIP
    icon
  • IP + privacy в одному рев'ю

    Дивимося і на копірайт/ліцензії, і на персональні дані в датасетах, бо це різні правові системи
    about_icon2
  • Legal + tech в одній команді

    Інтегруємо реєстр у ваш реальний пайплайн
    about_icon3
  • Field-level, а не «загалом ліцензовано»

    Будуємо облік на рівні джерела з ID та часовими мітками
    about_icon4
Надіслати запит
decor
Кібербезпека та privacy engineering - Legal IT Grpup

Допомагаємо AI-командам довести походження кожного тренувального датасету: щоб на запит регулятора чи в суді ви показали задокументований, відтворюваний ланцюг джерел, ліцензій і згод, а не намагалися реконструювати його заднім числом


title_icon

Наші послуги

  • Інвентаризація тренувальних датасетів

    icon-vectors
    Складаємо повний живий реєстр усіх наборів даних у вашому тренувальному пайплайні: звідки кожен компонент (named repositories, ліцензовані корпуси, web-scraped матеріали, внутрішні дані), коли отримано, який обсяг.
  • Аналіз прав per source (копірайт, ліцензії, згода, законний інтерес)

    icon-vectors
    Для кожного джерела визначаємо правову підставу: умови ліцензії, TDM-виняток (і який саме), задокументований дозвіл правовласника або згода субʼєкта даних. Розділяємо два різні режими: копірайт/IP (чи можна взагалі використовувати контент) і персональні дані (GDPR-підстава). Позначаємо high-risk джерела: піратські роботи, свіжий креативний контент без дозволу, дані з robots.txt opt-out тощо.
  • Система маркування датасетів (data labeling / lineage)

    icon-vectors
    Проєктуємо технічну схему тегів, яка йде разом із даними через увесь пайплайн: chain of custody від моменту збору до тренувального снапшоту має бути відтворюваним. Restricted-source прапорці (біометрія, дані неповнолітніх, спеціальні категорії) заводимо в словник на рівні поля, а не датасету загалом.
  • Реєстр джерел під AI Act transparency

    icon-vectors
    Готуємо реєстр у форматі, придатному для регуляторних вимог (особливо для провайдерів GPAI-моделей): походження, джерело й склад тренувальних, валідаційних і тестових наборів. Ваш реєстр стає основою для Model Documentation Form та публічного summary і живе далі як living inventory.


Сертифіковані експерти

Маємо сертифікацію в сфері приватності та кібербезпеки

Міжнародно підтверджена експертиза.

FIP_Dubas
Катерина Дубас_кібербезпека
FIP_Tarasiuk

blog_iconАктуальні та практичні статті

  • Data protection officer
  • AI compliance officer
  • Data privacy compliance
  • Дія.City
  • Digital Millennium copyright Act
  • Торгова марка в IT
Перейти до блогу

Пишемо про те, що практикуємо

IP, GDPR, контракти та спори, а також про правові аспекти імплементації таких технологій, як штучний інтелект чи кращі практики реалізації конкретних юридичних рішень.