تيك كرنش - 12 ديسمبر 2024
تعد تكلفة بيانات تدريب الذكاء الاصطناعي مرتفعة جدًا، مما يجعلها ملائمة فقط للشركات التقنية ذات الميزانيات الضخمة. ولهذا السبب، تخطط جامعة هارفارد لإطلاق مجموعة بيانات تحتوي على حوالي مليون كتاب ضمن الملكية العامة، تشمل مواضيعا مختلفة ولغات متعددة وأعمالاً لمؤلفين مثل تشارلز ديكنز ودانتي وويليام شكسبير، حيث لم تعد محمية بحقوق الطبع والنشر بسبب تقادمها.
رغم أن المجموعة الجديدة لم تُطلق بعد، ولم يُحدد موعد أو كيفية إصدارها، فإنها تتضمن كتبًا مستخرجة من مشروع جوجل الطويل الأمد لمسح الكتب، المعروف باسم Google Books، مما يعني أن جوجل ستكون شريكة في نشر هذا ""الكنز الثمين"" على نطاق واسع.
وقد أعلنت هارفارد عن مبادرة البيانات المؤسسية (Institutional Data Initiative – IDI) لأول مرة في مارس الماضي، مشيرة إلى خططها لإنشاء ""قناة موثوقة للبيانات القانونية لاستخدامها في الذكاء الاصطناعي"". لكن لم تُسمع أخبار كثيرة عن المبادرة منذ ذلك الحين حتى إطلاقها الرسمي اليوم، والذي تضمن تأكيدًا على تلقي IDI دعمًا ماليًا من مايكروسوفت و OpenAI.
وصرح المدير التنفيذي للمبادرة، غريغ ليبرت، بأن تصميم مجموعة البيانات يهدف إلى ""تحقيق تكافؤ الفرص"" من خلال إتاحتها لأي جهة — سواء كانت مختبرات بحثية أو شركات ناشئة تعمل في مجال الذكاء الاصطناعي — ترغب في تدريب نماذجها اللغوية الكبيرة (LLMs).
المصدر: تيك كرنش
