تیم پژوهشی دانشکدگان علوم دانشگاه تهران موفق شد با تمرکز بر معماری نوین میکسر ماتریسی و بهره‌گیری از روش توکن‌سازی داده‌ها، به نتایج پیشرو در حوزه طبقه‌بندی سری‌های زمانی دست یابد؛ دستاوردی که می‌تواند افق‌های تازه‌ای در تحلیل داده‌های پیچیده زمانی بگشاید.

به گزارش روابط‌عمومی دانشگاه تهران، این تیم پژوهشی متشکل از دکتر باقر باباعلی، دانشیار دانشکده ریاضی، آمار و علوم کامپیوتر، و محمدمهدی عزیزی، دانشجوی دکترای علوم کامپیوتر دانشکدگان علوم، در قالب پژوهشی با عنوان «توجه به توکن‌سازی» ابعاد نظری و کاربردی این دستاورد را بررسی کرده‌اند.

🔹 نقش کلیدی توکن‌سازی در مدل‌های پیشرفته

دکتر باباعلی با اشاره به موفقیت مدل‌های مبتنی بر مکانیزم توجه (Attention) در حوزه‌هایی مانند تشخیص پزشکی و پیش‌بینی مالی گفت: موفقیت این مدل‌ها بیش از هر عامل دیگری به شیوه هوشمندانه قطعه‌بندی داده‌های سری زمانی و درک معنای آن‌ها وابسته است؛ فرآیندی که کلید غلبه بر تنوع و پیچیدگی داده‌های زمانی به شمار می‌رود.

وی افزود: تنوع بالا در نویز، مقیاس، فرکانس و ماهیت داده‌های سری زمانی، دستیابی به یک مدل پایه جهانی را به یکی از چالش‌های اساسی هوش مصنوعی تبدیل کرده بود، اما این پژوهش با بازتعریف چارچوب میکسر ماتریسی به‌عنوان یک جعبه‌ابزار انعطاف‌پذیر، گامی ساختاریافته در مسیر حل این چالش برداشته است.

🔹 Patch Embedding؛ عامل جهش دقت مدل‌ها

سرپرست تیم پژوهشی با تأکید بر اهمیت مرحله توکن‌سازی یا Patch Embedding تصریح کرد: صرف استفاده از معماری‌های قدرتمندی مانند ترنسفورمر کافی نیست. توکن‌سازی در واقع مرحله ترجمه داده خام به زبانی قابل فهم برای مدل است و اگر این ترجمه به‌درستی انجام نشود، حتی قوی‌ترین مدل‌ها نیز روی داده‌های نادرست آموزش می‌بینند. تمرکز این تحقیق بر بهینه‌سازی دقیق این مرحله، عامل اصلی ارتقای چشمگیر دقت مدل‌ها بوده است.

🔹 برتری Attention در داده‌های پیچیده

دکتر باباعلی در مقایسه روش‌های ادغام اطلاعات زمانی گفت: مکانیزم Attention به مدل امکان می‌دهد روابط کوتاه‌مدت و بلندمدت بین قطعات مختلف داده را به‌صورت پویا شناسایی و وزن‌دهی کند؛ مزیتی که در مقایسه با روش‌هایی مانند MLP-Mixer، به‌ویژه در داده‌های پیچیده‌ای نظیر سیگنال‌های مغزی، نقشی تعیین‌کننده دارد.

🔹 آینده پژوهش؛ توکن‌سازی تطبیقی

وی درباره مسیر آینده این پژوهش‌ها افزود: حرکت به سمت توکن‌سازی تطبیقی و هوشمند یکی از پرسش‌های عمیق پژوهشی در تقاطع یادگیری ماشین و پردازش سیگنال است. دستیابی به این هدف می‌تواند تحولی اساسی در تحلیل داده‌های زیستی و صنعتی ایجاد کند.

🔹 نتایج عددی قابل توجه

دکتر باباعلی در پایان خاطرنشان کرد: دستیابی به دقت متوسط ۸۶ درصد در حالت خودنظارتی روی بنچ‌مارک‌های معتبر نشان می‌دهد که مدل توانسته بدون نیاز به داده‌های برچسب‌دار پرهزینه، مفاهیم نهفته در سری‌های زمانی را به‌خوبی بیاموزد؛ ویژگی‌ای بسیار ارزشمند برای کاربردهای واقعی با داده‌های محدود.

این دستاورد نشان می‌دهد که تلفیق بینش‌های آماری، علوم داده و معماری‌های نوین یادگیری عمیق می‌تواند نقش مهمی در هوشمندسازی تحلیل داده‌های پیوسته ایفا کند.