به گزارش چاینادیلی، این سامانه با نام آئوچانگ (Aocang S&T Corpus ) توسط کتابخانه ملی علوم آکادمی علوم چین (CAS) با همکاری نزدیک به ۱۰۰ مؤسسه توسعه یافته و به عنوان زیرساخت ملی دادههای تخصصی، استاندارد و آماده استفاده برای هوش مصنوعی در تمامی رشتههای اصلی علمی طراحی شده است.
نام «آئوچانگ» از بزرگترین انبار غله دولتی دوران سلسله چین (Qin) در فاصله سالهای ۲۲۱ تا ۲۰۶ پیش از میلاد گرفته شده است؛ انباری که در استان کنونی ههنان برای تأمین غلات امپراتوری تازهتأسیس چین ساخته شده بود. این نام نماد همان منطق راهبردی در عصر دیجیتال است؛ یعنی ایجاد زیرساختی حیاتی برای پشتیبانی از توسعه ملی.
رونمایی از این سامانه در شرایطی انجام میشود که هوش مصنوعی برای علم به یکی از اولویتهای راهبردی چین تبدیل شده و رهبران علمی این کشور بر ضرورت توسعه پژوهشهای مبتنی بر هوش مصنوعی برای تبدیل چین از یک مشارکتکننده جهانی به یک پیشگام نوآوری علمی تأکید دارند.
برخلاف دادههای عمومی اینترنت، دادههای علمی معمولاً ساختارمند، دانشمحور و پراکنده میان مؤسسات مختلف هستند و ایجاد مجموعههای داده علمی قابل اعتماد به یکی از چالشهای مشترک پژوهشگران هوش مصنوعی در سراسر جهان تبدیل شده است.
سامانه آئوچانگ با هدف رفع این مشکل، منابع علمی ناهمگون را به مجموعه دادههای استاندارد و آماده استفاده برای کشف علمی مبتنی بر هوش مصنوعی تبدیل میکند.
آئوچانگ از نظر تقویت زیرساخت دادهای توسعه هوش مصنوعی ملی و دستیابی به خوداتکایی علمی و فناوری در سطح بالا، ارزش بنیادین، راهبردی و غیرقابل جایگزینی دارد.
این سامانه با تکیه بر مخازن اطلاعاتی آکادمی علوم چین، بیش از ۳۲۰ پتابایت داده علمی، ۱۵۰ میلیون مقاله پژوهشی، ۱۲۰ میلیون پتنت و ۵ میلیون کتاب علمی را یکپارچه کرده است.
این پایگاه در قالب یک کتابخانه هسته ملی و چندین پایگاه داده تخصصی سازماندهی شده و تمامی رشتههای اصلی علمی، از فیزیک پایه تا نوآوری صنعتی، را پوشش میدهد. همچنین از قالبهای متنوع داده، از جمله متن، فرمولهای علمی، طیفها و شکلموجها، پشتیبانی میکند.
برای تبدیل دادههای خام به دانش قابل درک برای ماشین، توسعهدهندگان یک چارچوب سهمرحلهای پالایش داده طراحی کردهاند که مجموعه دادههای اولیه را به منابعی غنی از دانش و ویژگیهای تخصصی تبدیل میکند. این فرآیند چگالی معنایی دادهها را بهطور قابل توجهی افزایش داده و آنها را به مواد آموزشی «آماده برای هوش مصنوعی» تبدیل کرده است.
این مجموعه دادههای با تراکم بالای دانش و معنا میتوانند خلأهای دانش تخصصی مدلهای بزرگ زبانی را برطرف کنند، سوگیریهای موجود در استدلال منطقی آنها را اصلاح کرده و درک واقعی از رشتههای علمی و توانایی استدلال بلندمدت را در اختیار آنها قرار دهند.
سامانه آئوچانگ با اتکا به بیش از ۵۲۰ ابزار نرمافزاری اختصاصی، یک زنجیره کاملاً خودکار برای پردازش داده، کنترل کیفیت و اشتراکگذاری مطمئن دادهها ایجاد کرده است.
این پلتفرم به گونهای طراحی شده که با مشارکت جامعه علمی جهانی بهطور مستمر توسعه یابد.
نتایج اولیه نشان میدهد که آئوچانگ توانایی استدلال مدل پایه علمی ScienceOne، توسعهیافته توسط آکادمی علوم چین، را بهبود بخشیده است.
این مجموعه داده همچنین در حال ادغام با مدلهای تجاری بزرگ، از جمله دائوبائو، Qwen و مدل پزشکی هوش مصنوعی شرکت آنت است.
در مرحله نخست، این پروژه قصد دارد بیش از ۳۶ میلیارد رکورد علمی را در قالب ۲۸۸۳ مجموعه داده علمی باکیفیت و ۶۸ پتابایت داده پژوهشی یکپارچه کرده و از بیش از ۵۰۰ سناریوی کاربردی پشتیبانی کند.
آکادمی علوم چین به توسعه اکوسیستم این پایگاه، تقویت توانمندیهای پردازش داده و بررسی مدلهای ترکیبی بهرهبرداری که دسترسی عمومی را با سازوکارهای تجاری پایدار تلفیق میکنند، ادامه خواهد داد.
منبع: chinadaily


