Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
مدل Vision-Language مایکروسافت بنام Florence-2
شاخصههای مهم این کار:
* خیلی سَبُکه. خبری از بیلیون پارامتر نیست!
* یک شبکه همه کاره هست؛ یعنی، دیتکشن، سگمنتیش و غیره
* یک دیتاست هیولا برای آموزش مدل ساخته شده!
محققها میخواستن یه مدلی بسازن که بتونه از عهده تسکهای متنوع ویژن مثل دیتکشن، سگمنتیشن، کپشنینگ و غیره بربیاد.
خب، دو مقوله اینجا مطرح میشه؛ یکی معماری شبکه و دیگری دیتاست آموزش. معماری شبکه نکته جدیدی نداره. شبیه سایر VLM-های امروزیه. دو نسخه مدل Base با 230 و Large با 770 میلیون پارامتر معرفی شده.
اما، دیتاست اوه اوه! دیتاستی بنام FLD-5B ساختن که شامل 126 میلیون تصویر با 5 بیلیووون Annotation هست! 🤯 این کار رو به صورت دستی هم که انجام ندادن، به نظرم، اصل ایده مقاله همین بخش ساخت دیتاست هست. در مقاله، پایپلاین ساخت دیتاست رو در بخش Data Engine توضیح دادن.
یکسری تصویر از خروجی مدل Large براتون گذاشتیم که نگاه کنید؛ عجب دنیایی شده! دیگه یه مدل مخصوص دیتکشن یا سگمنتیشن بای بای...
مقاله CVPR | نوتبوک کولب | هاگینگ فیس
tgoop.com/pytorch_howsam/538
Create:
Last Update:
Last Update:
Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
مدل Vision-Language مایکروسافت بنام Florence-2
شاخصههای مهم این کار:
* خیلی سَبُکه. خبری از بیلیون پارامتر نیست!
* یک شبکه همه کاره هست؛ یعنی، دیتکشن، سگمنتیش و غیره
* یک دیتاست هیولا برای آموزش مدل ساخته شده!
محققها میخواستن یه مدلی بسازن که بتونه از عهده تسکهای متنوع ویژن مثل دیتکشن، سگمنتیشن، کپشنینگ و غیره بربیاد.
خب، دو مقوله اینجا مطرح میشه؛ یکی معماری شبکه و دیگری دیتاست آموزش. معماری شبکه نکته جدیدی نداره. شبیه سایر VLM-های امروزیه. دو نسخه مدل Base با 230 و Large با 770 میلیون پارامتر معرفی شده.
اما، دیتاست اوه اوه! دیتاستی بنام FLD-5B ساختن که شامل 126 میلیون تصویر با 5 بیلیووون Annotation هست! 🤯 این کار رو به صورت دستی هم که انجام ندادن، به نظرم، اصل ایده مقاله همین بخش ساخت دیتاست هست. در مقاله، پایپلاین ساخت دیتاست رو در بخش Data Engine توضیح دادن.
یکسری تصویر از خروجی مدل Large براتون گذاشتیم که نگاه کنید؛ عجب دنیایی شده! دیگه یه مدل مخصوص دیتکشن یا سگمنتیشن بای بای...
مقاله CVPR | نوتبوک کولب | هاگینگ فیس
BY PyTorch Howsam





Share with your friend now:
tgoop.com/pytorch_howsam/538