Европейският борд за защита на данните ( Европейски комитет по защита на данните, EDPB) е независим европейски орган, който гарантира еднаквото прилагане на правилата за защита на данните в ЕС. Този месец EDPB прие Насоки по повод обучението за целите на AI – Guidelines 03/2026 on web scraping in the context of generative AI
Web Scraping е процесът на събиране на суровия материал, на суровите данни от интернет, в официални източници в българската езикова версия се използва терлмин “извличане на данни”, но трябва да се прави разлика от извличане на информацията (TDM) – TDM е процесът на дълбочинен анализ и обработка с цел генериране на нови знания или обучение на изкуствен интелект=
Web Scraping – ът засяга само публичното онлайн пространство (уебсайтове), докато TDM e на базата на всякакви данни, отворени и затворени бази. TDM е интелигентният анализ.
Web Scraping – ът е често използвана техника и мащабна дейност по обработка на данни и често се случва без субектите да са наясно с това. В тези данни е вероятно да се съдържат и лични данни, което е довело до Насоките на борда. Създават се рискове за правата и свободите на индивида, и по-специално правото на защита на личните данни.
Насоките се фокусират върху ситуации, при които данните се извличат от интернет източници, в контекст на обучение генеративен AI. Засяга се само Scraping , извършван от частни субекти. GDPR се прилага за Scraping, когато включва операции по обработване на лични данни, като събиране, съхранение, организация и извличане.
Администраторът трябва да спазва принципа за ограничаване според целите, както и прозрачността като принцип. Това включва задължението да информира субекта на данните за обработване на личните им данни.