• امروز : افزونه جلالی را نصب کنید.
  • برابر با : Wednesday - 2 September - 2026
0

تبدیل داده به پایدارترین مزیت چین در رقابت هوش مصنوعی

  • کد خبر : 13641
  • 11 شهریور 1405 - 8:00
تبدیل داده به پایدارترین مزیت چین در رقابت هوش مصنوعی
رقابت جهانی در حوزه هوش مصنوعی دیگر تنها به تراشه‌ها یا مدل‌های زبانی محدود نمی‌شود؛ بلکه به‌طور فزاینده‌ای بر سر داده، به‌ویژه منابع زبانی که برای آموزش و تغذیه این مدل‌ها به کار می‌روند، جریان دارد.

به گزارش ساوت چاینا مورنینگ پست، پکن این حوزه را به‌عنوان یکی از جبهه‌های راهبردی جدید شناسایی کرده و با سرعت در حال ایجاد یک اکوسیستم ملی از داده‌های زبان چینی برای هوش مصنوعی است. این برنامه همه‌چیز را در بر می‌گیرد؛ از پیکره‌های متنی پایه و مجموعه‌داده‌های باکیفیت برای آموزش مدل‌ها گرفته تا تدوین استانداردهای فنی و چارچوب‌های حکمرانی داده.

با وجود تشدید محدودیت‌های آمریکا بر صادرات تراشه‌ها و فناوری‌های پیشرفته، منابع داده زبانی به عرصه‌ای تبدیل شده‌اند که چین شانس بیشتری برای موفقیت در آن دارد؛ هرچند این مسیر همچنان با چالش‌هایی همچون کمبود داده، کیفیت پایین برخی منابع، نبود استانداردهای یکپارچه و مسائل مربوط به حکمرانی داده مواجه است.

این رویکرد از باور فزاینده چین ناشی می‌شود که منابع زبانی دیگر صرفاً دارایی‌های پژوهشی نیستند، بلکه به زیرساختی راهبردی برای تحقق اهداف این کشور در حوزه هوش مصنوعی، حکمرانی دیجیتال و افزایش نفوذ فرهنگی تبدیل شده‌اند.

ضرورت این اقدامات از عدم توازن آشکار در منابع زبانی موجود برای آموزش مدل‌های هوش مصنوعی ناشی می‌شود.

مدل‌های زبانی بزرگ با پردازش حجم عظیمی از داده‌ها آموزش می‌بینند و میزان دسترسی، کیفیت و تنوع منابع زبانی به یکی از عوامل کلیدی در تعیین عملکرد این مدل‌ها تبدیل شده است.

در حال حاضر، زبان انگلیسی بر داده‌های مورد استفاده برای آموزش بیشتر مدل‌های مطرح جهان سلطه دارد، در حالی که زبان چینی همچنان به‌طور ساختاری کمتر از ظرفیت واقعی خود در این داده‌ها حضور دارد.

نزدیک به ۶۰ درصد محتوای وب جهان به زبان انگلیسی است، در حالی که سهم زبان چینی تنها حدود ۱.۳ درصد است؛ این در حالی است که بیش از یک میلیارد نفر در جهان به این زبان سخن می‌گویند.

این عدم توازن باعث شده است که پیشرفته‌ترین سامانه‌های هوش مصنوعی امروز عملاً دارای یک «زبان مادری» باشند و کسانی که به آن زبان سخن نمی‌گویند، به شکلی نامحسوس اما تأثیرگذار در موقعیت نامناسب‌تری قرار گیرند.

پژوهش‌های پیشین نشان داده‌اند که برخی مدل‌های متن‌باز چینی به‌شدت به مجموعه‌داده‌های وبِ مبتنی بر زبان انگلیسی متکی بوده‌اند و در نتیجه، سوگیری‌ها و ظرافت‌های زبانی انگلیسی را به ارث برده‌اند؛ ویژگی‌هایی که لزومأ با بافت کاربردی زبان چینی سازگار نیستند.

محتوای تولیدشده توسط هوش مصنوعی به زبان‌های چینی و عربی، در تمامی شاخص‌های کیفیت، امتیاز پایین‌تری نسبت به محتوای انگلیسی کسب می‌کند؛ موضوعی که باعث می‌شود کاربران غیرانگلیسی‌زبان خروجی‌هایی «کمتر کاربردی و کم‌خلاقیت‌تر» دریافت کنند. این شکاف به‌ویژه در وظایف فنی و تخصصی بیش از همه مشهود است.

زبان مادری یک مدل هوش مصنوعی حاصل یک تصمیم آگاهانه و راهبردی در تخصیص منابع است و کشورهایی که چنین سرمایه‌گذاری‌ای انجام ندهند، ناچار خواهند بود با افت ساختاری کیفیت روبه‌رو شوند؛ ضعفی که شاید حتی به‌طور کامل از آن آگاه نباشند.

واکنش چین؛ تمرکز بر داده‌های بومی

توسعه‌دهندگان چینی هوش مصنوعی از هم‌اکنون به این چالش واکنش نشان داده‌اند.

بر اساس اعلام اداره ملی داده‌های چین در اوت سال گذشته، بیش از ۶۰ درصد داده‌های آموزشی مورد استفاده در اغلب مدل‌های هوش مصنوعی چینی به زبان چینی است و در برخی مدل‌ها این سهم حتی به ۸۰ درصد نیز می‌رسد.

راهنمای رسمی منتشرشده در سال ۲۰۲۵ درباره تقویت پروژه «چین دیجیتال» نیز بر دیجیتالی‌سازی منابع زبان چینی و گسترش داده‌های زبانی تأکید کرده و هدف‌گذاری کرده است که تا سال ۲۰۲۷ یک پیکره ملی زبان و پایگاه اطلاعاتی راهبردی منابع زبانی ایجاد شود.

چین همچنین امیدوار است تا سال ۲۰۳۵ حضور زبان چینی در سناریوهای جهانی دیجیتال و هوش مصنوعی مولد به شکل چشمگیری افزایش یابد.

پکن اکنون داده‌ها را حوزه‌ای می‌داند که می‌تواند از طریق آن ضعف خود در حوزه تراشه‌ها را جبران کند.

با ادامه محدودیت‌های صادراتی آمریکا بر نیمه‌رساناهای پیشرفته، داده‌های زبانی به عرصه‌ای تبدیل شده‌اند که چین شانس بیشتری برای موفقیت در آن دارد؛ زیرا این کشور از یک بازار داخلی عظیم و همچنین توانایی دولت در بسیج و یکپارچه‌سازی داده‌ها میان شرکت‌ها و نهادهای مختلف برخوردار است؛ ظرفیتی که کمتر کشوری از آن بهره‌مند است.

حتی می‌توان استدلال کرد که در برخی موارد، داده‌ها از تراشه‌ها نیز تعیین‌کننده‌تر شده‌اند. با همگرایی معماری مدل‌ها و فراگیر شدن مدل‌های متن‌باز، منابع زبانی باکیفیت می‌توانند به مزیتی رقابتی و پایدارتر تبدیل شوند؛ زیرا عمق منابع علمی، ادبیات تخصصی و پیکره‌های دانشی یک زبان را نمی‌توان به‌سادگی بازتولید کرد.

حکمرانی داده؛ چالش بعدی چین

ایجاد منابع زبانی باکیفیت صرفاً به گردآوری داده محدود نمی‌شود، بلکه مستلزم تصمیم‌گیری درباره دسترسی، پردازش، استانداردسازی و حکمرانی داده‌ها است.

داده‌های خبری باکیفیت بخش مهمی از منابع زبانی محسوب می‌شوند، زیرا روزنامه‌نگاری حرفه‌ای اطلاعاتی دقیق، مستند و ارزشمند برای آموزش سامانه‌های هوش مصنوعی فراهم می‌کند.

با این حال، تحلیلگران معتقدند در حالی که اکوسیستم انگلیسی‌زبان طی دهه‌ها از انباشت طبیعی منابع دیجیتال مانند مقالات علمی، ویکی‌پدیا و انجمن‌های برنامه‌نویسی بهره‌مند شده است، بسیاری از منابع دانشی ارزشمند به زبان چینی هنوز یا به‌سختی قابل دسترسی هستند یا به‌طور نظام‌مند وارد مجموعه‌داده‌های مناسب برای آموزش هوش مصنوعی نشده‌اند.

حکمرانی منابع زبانی همچنان یکی از چالش‌های اصلی چین است. چین باید چارچوبی منسجم‌تر برای حل مسائلی همچون حق نشر، اشتراک‌گذاری داده‌ها، پراکندگی استانداردهای فنی و مخاطرات مربوط به حریم خصوصی و امنیت ایجاد کند.

از سوی دیگر، استانداردهای فنی از جمله کدگذاری نویسه‌ها، برچسب‌گذاری معنایی و یکپارچه‌سازی داده‌های چندرسانه‌ای، به یکی از عوامل کلیدی رقابت جهانی در حوزه هوش مصنوعی تبدیل شده‌اند.

عقب ماندن چین در استانداردهای پایه مربوط به منابع زبان چینی، پیامدهای مستقیمی برای امنیت فرهنگی، حاکمیت داده و توانایی این کشور در اثرگذاری بر استانداردهای بین‌المللی خواهد داشت.

اگر این استانداردهای بنیادین در اختیار دیگران قرار گیرد، چین ممکن است هم در حکمرانی دیجیتال جهانی جایگاه خود را از دست بدهد و هم دامنه نفوذ فرهنگ چینی در فضای دیجیتال محدود شود.

دو الگوی متفاوت حکمرانی

یکی از تفاوت‌های اصلی میان اکوسیستم هوش مصنوعی چینی و انگلیسی، شیوه حکمرانی بر منابع زبانی است؛ دو الگویی که هر یک با ملاحظات و مصالحه‌های متفاوتی روبه‌رو هستند.

توسعه منابع زبان چینی علاوه بر ملاحظات فنی، شامل پالایش ایدئولوژیک نیز می‌شود؛ زیرا دولت چین الزام کرده است که داده‌های آموزشی با «ارزش‌های بنیادین سوسیالیستی» همخوانی داشته باشند.

در مقابل، حکمرانی در اکوسیستم انگلیسی‌زبان بیشتر تحت تأثیر عواملی مانند دعاوی مربوط به حق نشر، الزامات شفافیت و مسائل مرتبط با رضایت صاحبان داده قرار دارد.

این سازوکارها عمدتاً از طریق دادگاه‌ها و سازوکارهای بازار عمل می‌کنند، نه از طریق فیلتر محتوای هدایت‌شده توسط دولت؛ در نتیجه، چشم‌انداز داده‌ها در این اکوسیستم متنوع‌تر است.

هرچه هوش مصنوعی بیش از پیش به واسطه اصلی دسترسی مردم به دانش، حل مسائل فنی و تصمیم‌گیری تبدیل شود، تفاوت در منابع زبانی می‌تواند به تفاوت در فرصت‌های اقتصادی و توانمندی‌های فناورانه نیز بینجامد.

کاربران غیرانگلیسی‌زبان از نظر ایمنی نیز در معرض خطر بیشتری قرار دارند؛ زیرا پژوهش‌ها نشان داده‌اند که مدل‌های هوش مصنوعی در زبان‌های کم‌منبع، محتوای زیان‌بار بیشتری تولید کرده و دستورات کاربران را با دقت کمتری اجرا می‌کنند، در حالی که اغلب چارچوب‌های بین‌المللی ایمنی هوش مصنوعی هنوز توجه کافی به موضوع چندزبانی ندارند.

در شرایطی که بسیاری از دولت‌ها در حال اجرای برنامه‌های «هوش مصنوعی حاکمیتی» برای تقویت توانمندی‌های داخلی خود هستند، داشتن یک مدل ملی به‌تنهایی کافی نیست.

اغلب از هوش مصنوعی به‌عنوان فناوری‌ای یاد می‌شود که می‌تواند زمین بازی را برای همه برابر کند؛ اما یافته‌های نشان می‌دهد که از منظر زبانی، ممکن است دقیقاً عکس این اتفاق رخ دهد؛ مگر آنکه سرمایه‌گذاری هدفمند و مستمری برای توسعه مدل‌ها و داده‌های فراگیر از نظر زبانی انجام شود.

منبع: scmp

لینک کوتاه : https://techchina.ir/?p=13641

ثبت دیدگاه

قوانین ارسال دیدگاه
  • دیدگاه های ارسال شده توسط شما، پس از تایید توسط تیم مدیریت در وب منتشر خواهد شد.
  • پیام هایی که حاوی تهمت یا افترا باشد منتشر نخواهد شد.
  • پیام هایی که به غیر از زبان فارسی یا غیر مرتبط باشد منتشر نخواهد شد.