گزارش ویژه

وقتی کتاب‌های قدیمی به داده‌های هوش مصنوعی تبدیل می‌شوند فرصتی جدید برای صنعت چاپ، یا نه؟

خرید فله ای مرموز کتاب های دست دوم یک سوال جالب را ایجاد می کند: آیا شرکت های هوش مصنوعی کتاب های چاپ شده را به داده های آموزشی تبدیل می کنند؟
برای چاپخانه ها، ناشران و صنعت گسترده‌تر هنرهای گرافیکی، این داستان ارزش جدید غیرمنتظره‌ای را برای صفحه چاپ شده برجسته می‌کند. برای سال‌ها، صنعت نشر بحث می‌کرد که آیا رسانه‌های دیجیتال در نهایت کتاب‌های چاپی را کمتر مرتبط می‌کنند یا خیر؟
اکنون، هوش مصنوعی ممکن است به کتاب‌های قدیمی ارزش کاملاً جدیدی بدهد. کتاب‌فروشان دست دوم در بریتانیا، ایرلند، ایالات متحده، استرالیا و جاهای دیگر اخیراً از افزایش سفارش‌های عمده غیرمعمول گزارش کرده‌اند. این خریدها اغلب شامل صدها یا حتی هزاران کتاب می شود که موضوعات به ظاهر نامرتبط را پوشش می دهد – کتابچه راهنمای فنی قدیمی، زندگی نامه، رمان های زبان خارجی، کتاب های مرجع قدیمی و نشریات تخصصی که ممکن بود سال ها در قفسه ها باقی بمانند. هویت و هدف بسیاری از این خریداران نامشخص است.
اما یک توضیح در حال جلب توجه است: برخی از کتاب ها ممکن است به داده های آموزشی برای هوش مصنوعی تبدیل شوند. هنوز هیچ مدرکی وجود ندارد که ثابت کند هر سفارش انبوه مرموز به هوش مصنوعی متصل است. با این حال، اسناد دادگاه مربوط به توسعه‌دهنده هوش مصنوعی Anthropic قبلاً نشان داده است که ایده شرکت‌ها برای خرید کتاب‌های چاپی، دیجیتالی کردن آنها و استفاده از محتوای آنها برای هوش مصنوعی بسیار واقعی است. و این پیامدهای مهمی برای ناشران، چاپخانه‌ها، کتابخانه‌ها و صنعت چاپ گسترده‌تر دارد.

میلیون‌ها کتاب به داده تبدیل شدند

شرکت آنتروپیک، شرکت پشت خانواده مدل‌های هوش مصنوعی کلود، پس از آنکه اسناد مربوط به دعاوی حق چاپ، جزئیات یک برنامه داخلی موسوم به پروژه پاناما را فاش کرد، به مرکز بحث تبدیل شد. طبق گزارش‌ها، این شرکت ده‌ها میلیون دلار برای خرید میلیون‌ها کتاب فیزیکی هزینه کرده است.

برخی از آنها در دسته‌های بسیار بزرگ از تأمین‌کنندگان کتاب‌های دست دوم خریداری شدند. هدف ایجاد یک کتابخانه شرکتی متعارف نبود. در عوض، کتاب‌ها به متن دیجیتال قابل خواندن توسط ماشین تبدیل شدند.

این فرآیند شامل چیزی بود که به عنوان اسکن مخرب شناخته می‌شود. به جای قرار دادن دقیق هر کتاب روی یک اسکنر کتاب سنتی، می‌توان صحافی را به صورت مکانیکی جدا کرد و صفحات را جدا کرد. سپس صفحات آزاد می‌توانند به سرعت از تجهیزات اسکن صنعتی عبور کنند و حجم عظیمی از مواد را دیجیتالی کنند.

اسناد دادگاه طرح‌هایی را نشان داد که قادر به پردازش صدها هزار – به طور بالقوه میلیون‌ها – کتاب در عرض چند ماه هستند. پس از اسکن، کتاب‌های فیزیکی را می‌توان برای بازیافت ارسال کرد. از دیدگاه صنعتی، این یک فرآیند تبدیل بسیار کارآمد است: یک محصول چاپی به یک مجموعه داده دیجیتال تبدیل می‌شود. اما همچنین رابطه سنتی بین چاپ و فناوری دیجیتال را تغییر می‌دهد. کتاب دیگر صرفاً با محتوای دیجیتال رقابت نمی‌کند. در واقع می‌تواند به ماده خامی تبدیل شود که هوش دیجیتال جدید از آن ساخته می‌شود.

چرا هوش مصنوعی کتاب‌های چاپی می‌خواهد

مدل‌های بزرگ زبانی برای یادگیری زبان، الگوهای استدلال، حقایق و سبک‌های نوشتاری به مقادیر عظیمی از مطالب نوشتاری نیاز دارند. اینترنت بخش زیادی از این داده‌ها را فراهم کرده است. اما محتوای آنلاین مشکلات متعددی را ایجاد می‌کند. صفحات وب می‌توانند ضعیف نوشته شده، تکراری، ناقص، نادرست یا بسیار کوتاه باشند. به طور فزاینده‌ای، مطالب آنلاین نیز ممکن است توسط خود هوش مصنوعی تولید شده باشند. کتاب‌ها چیز متفاوتی ارائه می‌دهند.

کتاب‌های حرفه‌ای معمولاً قبل از رسیدن به چاپخانه، از میان نویسندگان، ویراستاران، مصححان، طراحان و ناشران عبور می‌کنند. محتوای آنها عموماً ساختار یافته، منسجم و به طور قابل توجهی طولانی‌تر از مطالب وب معمولی است. آنها همچنین حاوی اطلاعات تخصصی هستند که ممکن است هرگز به صورت رایگان به صورت آنلاین در دسترس نبوده باشند.

یک کتابچه راهنمای مهندسی قدیمی، کتابچه راهنمای شیمی، اثر مرجع تاریخی یا راهنمای چاپ فنی ممکن است تقریباً هیچ ارزش تجاری در بازار دست دوم نداشته باشد. اما اگر اطلاعات آن در پایگاه داده موجود یک شرکت هوش مصنوعی وجود نداشته باشد، می‌تواند ناگهان مفید شود. شاید از همه مهم‌تر، کتاب‌های چاپی قدیمی‌تر چیزی را ارائه می‌دهند که تضمین آن در اینترنت امروزی دشوارتر می‌شود: محتوای ساخته‌ی دست بشر.

کتابی که در سال ۱۹۸۵ چاپ شده، به وضوح از ChatGPT قدیمی‌تر است. یک راهنمای فنی که در سال ۱۹۹۷ منتشر شده، نمی‌تواند توسط هوش مصنوعی مولد مدرن تولید شده باشد. این امر باعث می‌شود که مطالب چاپی پیش از هوش مصنوعی به عنوان منبعی از زبان انسانی معتبر، بالقوه ارزشمند باشند.

مشکل آموزش هوش مصنوعی در هوش مصنوعی

با رایج شدن روزافزون هوش مصنوعی مولد، محتوای اینترنتی بیشتری توسط هوش مصنوعی ایجاد یا بازنویسی می‌شود. این امر چالشی را برای توسعه‌دهندگان آینده هوش مصنوعی ایجاد می‌کند. اگر مدل‌های جدید هوش مصنوعی به طور فزاینده‌ای بر روی مطالبی که توسط مدل‌های قدیمی‌تر هوش مصنوعی به جای انسان‌ها تولید می‌شوند، آموزش ببینند، چه اتفاقی می‌افتد؟

محققان پدیده‌ای را که اغلب به عنوان فروپاشی مدل توصیف می‌شود، بررسی کرده‌اند، که در آن آموزش مکرر مدل‌ها بر روی داده‌های مصنوعی می‌تواند به تدریج غنا و تنوع اطلاعاتی را که تولید می‌کنند کاهش دهد. این مسئله پیچیده‌تر از گفتن ساده “هوش مصنوعی نمی‌تواند از هوش مصنوعی یاد بگیرد” است. تحقیقات نشان می‌دهد که داده‌های مصنوعی می‌توانند زمانی مفید باشند که با دقت مدیریت و با اطلاعات دنیای واقعی با کیفیت بالا ترکیب شوند.

اما این بحث، ارزش مطالب قابل اعتماد تولید شده توسط انسان را تقویت می‌کند. و منابع کمی، آرشیو تاریخی واضح‌تری از نوشته‌های انسانی نسبت به کتاب‌های چاپی تولید شده قبل از دوران هوش مصنوعی مولد ارائه می‌دهند. از این نظر، انبارهای پر از کتاب‌های قدیمی می‌توانند به چیزی شبیه به ذخایر داده تبدیل شوند.

چرا خریداران عناوین عجیب و غریب را انتخاب می کنند؟

الگوی خریدهای گزارش شده به ویژه جالب است. کتابفروشان خریدارانی را که درخواست ترکیبی از عناوین بدون رابطه آشکار را دارند، توصیف کرده اند: کشاورزی، مهندسی، زندگی نامه، انتشارات تاریخی، کتابچه راهنمای نرم افزار، داستان و کتاب به زبان های مختلف.

برای یک کتابفروش معمولی، انتخاب ممکن است تصادفی به نظر برسد. با این حال، برای یک شرکت هوش مصنوعی که یک مجموعه داده ایجاد می کند، ممکن است کاملاً منطقی باشد. هدف ممکن است به دست آوردن محبوب ترین کتاب ها نباشد. عناوین محبوب اغلب از قبل به شکل دیجیتال در دسترس هستند. ارزش واقعی می تواند در کتاب هایی باشد که در پایگاه های داده موجود وجود ندارند.

بنابراین، یک کتاب راهنمای مهندسی مکانیک مبهم از دهه 1970 می‌تواند برای جمع‌آوری داده‌ها ارزشمندتر از یک کتاب پرفروش بین‌المللی مدرن باشد. این امر اقتصاد متعارف انتشار را معکوس می کند. کتابی که تقریباً هیچ تقاضای خرده فروشی ندارد، همچنان می تواند ارزش اطلاعاتی قابل توجهی داشته باشد.

نقش غیرمنتظره چاپ در اقتصاد هوش مصنوعی

برای صنعت چاپ، این شاید جذاب ترین قسمت داستان باشد. چاپ به طور سنتی به عنوان مرحله نهایی تولید محتوا در نظر گرفته می شود. نویسندگان محتوا تولید می کنند، ناشران آن را آماده می کنند و چاپگرها محصول فیزیکی را تولید می کنند. هوش مصنوعی ممکن است یک رابطه دایره ای ایجاد کند. مواد چاپی ایجاد شده چند دهه پیش اکنون می توانند دیجیتالی شوند و به سیستم هایی بازگردانده شوند که محتوای جدید تولید می کنند.

این بدان معناست که صنعت چاپ به طور ناخواسته یک آرشیو آفلاین عظیم از دانش بشری ایجاد کرده است – آرشیو که ممکن است شرکت‌های هوش مصنوعی اکنون بخواهند به آن دسترسی داشته باشند. برای چاپگرها و ناشران کتاب، توسعه همچنین سوالاتی را در مورد مدیریت حقوق آینده ایجاد می کند.

اگر کتاب‌ها نه تنها به‌عنوان محصولاتی که به خوانندگان فروخته می‌شوند، بلکه به‌عنوان مواد آموزشی برای سیستم‌های هوش مصنوعی ارزش دارند، آیا ناشران باید مدل‌های مجوز جدیدی را برای یادگیری ماشین ایجاد کنند؟

آیا آرشیو نشریات چاپ نشده می تواند به دارایی داده های تجاری تبدیل شود؟

و آیا ممکن است ناشران در نهایت مجموعه‌های دیجیتال مجاز و با کیفیت بالا را مستقیماً در اختیار توسعه‌دهندگان هوش مصنوعی قرار دهند، نه اینکه اجازه دهند نسخه‌های فیزیکی خریداری و به‌طور مخرب اسکن شوند؟

این احتمالات می تواند یک جریان درآمد کاملاً جدید برای بخش هایی از صنعت نشر ایجاد کند.

 

اما چه اتفاقی برای کتاب فیزیکی می افتد؟

همچنین یک جنبه نه چندان راحت در داستان وجود دارد. اسکن مخرب ممکن است برای کتاب‌های بازار انبوه که هزاران نسخه از آنها باقی مانده است، عملی باشد. اما همین رویکرد هنگام برخورد با مطالب قدیمی تر، غیرمعمول یا با نسخه محدود بحث برانگیز می شود. اسکن دیجیتال کلمات و تصاویر را حفظ می کند. لزوماً شیء فیزیکی را حفظ نمی کند.

موجودی کاغذ، روش های چاپ، صحافی، تایپوگرافی، یادداشت های دست نویس، علائم مالکیت و سایر مشخصات فیزیکی می توانند اهمیت تاریخی داشته باشند. بنابراین یک کتاب ممکن است دو ارزش متفاوت داشته باشد. برای یک توسعه دهنده هوش مصنوعی، بخش ارزشمند ممکن است متن آن باشد. برای یک کتابخانه، مجموعه دار، چاپگر یا مورخ، خود کتاب می تواند یک مصنوع باشد. پس از نابودی، آن تاریخچه فیزیکی را نمی توان به سادگی از یک PDF بازسازی کرد.

آنتروپیک گفته است که برنامه های کسب آن کتاب های کمیاب یا باستانی را برای تخریب هدف قرار نمی دهد. با این وجود، نگرانی در میان کتابفروشان نشان می‌دهد که وقتی انتشارات فیزیکی به بخشی از پروژه‌های دیجیتالی‌سازی در مقیاس بزرگ تبدیل می‌شوند، نیاز به اقدامات حفاظتی وجود دارد.

سوالات مربوط به کپی رایت دور از حل و فصل هستند

آموزش هوش مصنوعی همچنین باعث ایجاد اختلافات عمده در مورد حق چاپ شده است. در ایالات متحده، یک قاضی فدرال در سال 2025 حکم داد که استفاده آنتروپیک از کتاب‌های به دست آمده قانونی برای آموزش هوش مصنوعی می‌تواند به عنوان استفاده منصفانه در شرایط آن مورد خاص واجد شرایط باشد. با این حال، همان دعوای قضایی تمایز مهمی را بین کتاب‌های خریداری شده قانونی و نسخه‌های به‌دست‌آمده از کتابخانه‌های آنلاین غیرمجاز برجسته کرد.

ادعاهای مربوط به میلیون ها کتاب دزدی در نهایت منجر به تسویه حساب به ارزش 1.5 میلیارد دلار شد. بنابراین پیام این صنعت این نیست که شرکت‌های هوش مصنوعی آزادی نامحدودی برای استفاده از کتاب دارند. در عوض، چشم انداز قانونی حول مسائل مربوط به کسب، مالکیت کپی رایت، مجوز، استفاده منصفانه و جبران خسارت در حال توسعه است. برای ناشران، نویسندگان و صاحبان محتوا، این سوالات به طور فزاینده ای مهم خواهند شد.

از صفحه چاپی تا هوش دیجیتال

خیلی زود است که نتیجه گیری کنیم که شرکت های هوش مصنوعی پشت هر سفارش مرموزی هستند که در حال حاضر به کتابفروشی های دست دوم می رسد. بسیاری از خریداران ناشناس باقی می‌مانند، در حالی که واسطه‌های مرتبط با برخی از تراکنش‌ها، منابع آگاهانه کتاب‌هایی را برای اسکن هوش مصنوعی مخرب رد کرده‌اند. اما روند گسترده تر غیرقابل انکار است. کتاب های چاپی در عصر هوش مصنوعی اهمیت استراتژیک جدیدی پیدا کرده اند.

برای چندین دهه، صنعت نگران بود که فناوری دیجیتال جایگزین چاپ شود. در عوض، یکی از پیشرفته‌ترین فناوری‌های دیجیتال جهان ممکن است اکنون به دهه‌ها مطالب چاپی به عنوان منبع ارزشمند دانش نگاه کند. کتابچه راهنمای فنی غبارآلود، رمان فراموش شده یا کتاب مرجع تخصصی که در قفسه ای دست دوم نشسته است ممکن است دیگر صرفاً یک نشریه قدیمی در انتظار خواننده نباشد. همچنین می تواند داده باشد. و این صفحه چاپ شده را در موقعیتی غیرمنتظره در قلب انقلاب هوش مصنوعی قرار می دهد.

 

نمایش بیشتر

نوشته های مشابه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

دکمه بازگشت به بالا