این ملاحظه تأکید می‌کند که کیفیت داده‌ها نقش تعیین‌کننده‌ای در عملکرد و ایمنی سیستم‌های هوش مصنوعی پرخطر دارد و برای جلوگیری از تبعیض و خطا، داده‌های آموزشی، آزمون و اعتبارسنجی باید مرتبط، نماینده و تا حد امکان بدون خطا باشند. همچنین باید سازوکارهای حاکمیت داده و شفافیت، به‌ویژه در مورد داده‌های شخصی، رعایت شود و سوگیری‌های احتمالی ناشی از داده‌های تاریخی یا حلقه‌های بازخورد شناسایی و کاهش یابند. در عین حال، استفاده از فناوری‌های حفظ حریم خصوصی و خدمات تأیید انطباق نیز مجاز و قابل اتکاست، مشروط بر رعایت کامل الزامات مقرره.  

قانون هوش مصنوعی اروپا: متن ملاحظه 67

داده‌های باکیفیت و دسترسی به داده‌های باکیفیت نقش حیاتی در ایجاد ساختار و تضمین عملکرد بسیاری از سیستم‌های هوش مصنوعی ایفا می‌کنند، به‌ویژه هنگامی که از روش‌های مبتنی بر آموزش مدل‌ها استفاده می‌شود؛ با هدف اطمینان از اینکه سیستم هوش مصنوعی پرخطر مطابق مقصود طراحی‌شده عمل کرده و ایمن باشد و به منبع تبعیض ممنوع‌شده تحت حقوق اتحادیه تبدیل نشود. مجموعه‌داده‌های باکیفیت برای آموزش، اعتبارسنجی و آزمون مستلزم اجرای شیوه‌های مناسب حاکمیت و مدیریت داده هستند. این مجموعه‌داده‌ها، از جمله برچسب‌ها، باید مرتبط، به‌قدر کافی نماینده، و تا حد امکان عاری از خطا و کامل با توجه به هدف مورد نظر سیستم باشند.

به‌منظور تسهیل انطباق با حقوق اتحادیه در زمینه حفاظت از داده‌ها، مانند مقرره (EU) 2016/679، شیوه‌های حاکمیت و مدیریت داده باید در مورد داده‌های شخصی شامل شفافیت درباره هدف اولیه جمع‌آوری داده باشند. مجموعه‌داده‌ها همچنین باید دارای ویژگی‌های آماری مناسب باشند، از جمله در خصوص اشخاص یا گروه‌هایی که سیستم برای آنان طراحی شده است، با توجه ویژه به کاهش سوگیری‌های احتمالی در داده‌ها که ممکن است بر سلامت و ایمنی افراد اثر بگذارد، به حقوق بنیادین آسیب بزند یا موجب تبعیض ممنوعه شود؛ به‌ویژه زمانی که خروجی داده‌ها بر ورودی عملیات آینده تأثیر می‌گذارد (حلقه‌های بازخورد).


سوگیری‌ها ممکن است در خود مجموعه‌داده‌ها ذاتی باشند، به‌خصوص هنگامی که از داده‌های تاریخی استفاده می‌شود، یا در زمان پیاده‌سازی در محیط واقعی ایجاد شوند. نتایج سیستم‌های هوش مصنوعی ممکن است تحت تأثیر این سوگیری‌ها قرار گیرد و به‌تدریج تشدید شده و تبعیض موجود را تداوم و تقویت کند، به‌ویژه علیه گروه‌های آسیب‌پذیر مانند گروه‌های نژادی یا قومی. الزام به کامل بودن و عاری بودن از خطا بودن داده‌ها تا حد امکان نباید مانع استفاده از تکنیک‌های حفظ حریم خصوصی در توسعه و آزمون سیستم‌های هوش مصنوعی شود.


مجموعه‌داده‌ها باید متناسب با هدف مورد نظر، ویژگی‌ها و شرایط خاص جغرافیایی، رفتاری یا کاربردی محیطی که سیستم در آن استفاده می‌شود را در نظر بگیرند. الزامات مربوط به حاکمیت داده می‌تواند از طریق استفاده از اشخاص ثالث ارائه‌دهنده خدمات تأیید انطباق، شامل بررسی حاکمیت داده، یکپارچگی مجموعه‌داده‌ها و فرآیندهای آموزش، اعتبارسنجی و آزمون داده‌ها، رعایت شود، مشروط بر اینکه الزامات این مقرره رعایت گردد.
 

تحلیل ملاحظه 67

این ملاحظه یکی از بنیادی‌ترین بخش‌های قانون‌گذاری هوش مصنوعی است، چون مستقیماً به «سوخت اصلی AI» یعنی داده می‌پردازد. منطق اصلی این است که کیفیت خروجی یک سیستم هوش مصنوعی، به‌طور مستقیم تابع کیفیت داده‌های ورودی آن است؛ بنابراین اگر داده‌ها ناقص، جانبدارانه یا غیرنماینده باشند، سیستم حتی اگر از نظر فنی پیشرفته باشد، می‌تواند تصمیم‌های ناعادلانه یا خطرناک تولید کند.

در سطح حقوقی، این بند ارتباط مستقیم میان مقررات هوش مصنوعی و قوانین حفاظت از داده‌ها مثل GDPR برقرار می‌کند. قانون‌گذار تأکید می‌کند که شفافیت درباره منشأ و هدف جمع‌آوری داده‌ها، یک الزام فنی صرف نیست، بلکه یک الزام حقوقی مرتبط با حقوق بنیادین افراد است. این پیوند نشان می‌دهد که AI در اتحادیه اروپا صرفاً یک موضوع فناوری نیست، بلکه بخشی از حقوق عمومی و حقوق بشر محسوب می‌شود.

نکته مهم دیگر، تمرکز بر «سوگیری سیستماتیک» و «حلقه‌های بازخورد» است. قانون‌گذار به‌درستی تشخیص می‌دهد که تبعیض در AI اغلب تصادفی نیست، بلکه می‌تواند از داده‌های تاریخی یا طراحی نادرست سیستم تشدید شود و به‌صورت ساختاری بازتولید گردد. این نگاه، رویکردی پیشگیرانه است، نه صرفاً واکنشی.

در نهایت، این Recital انعطاف‌پذیری نیز در خود دارد: اجازه استفاده از فناوری‌های حفظ حریم خصوصی و همچنین استفاده از خدمات شخص ثالث برای ارزیابی داده‌ها. این نشان می‌دهد که هدف، محدود کردن نوآوری نیست، بلکه ایجاد چارچوبی است که نوآوری در آن «قابل اعتماد» باقی بماند.


منبع: ترجمه شده توسط بخش فناوری های نوین سایت راسخون