Sora چیست؟ به نظر میرسد سرعت پیشرفت هوش مصنوعی به سمت نقطهای فراتر از درک و توان انسان در حرکت است. در همین امر، سیستم تبدیل متن به ویدیو Sora از شرکت Open AI بهعنوان جدیدترین عملکرد این حوزه، توجه دنیای فناوری را به خود جلب کرده است و ثابت کرده است که تحولات مرتبط با هوش مصنوعی در حال وقوع هستند.
مقدمه
شرکت OpenAI، که از قبل با ابزار هوشمندChatGPT شناخته میشد، سال گذشته از ابزار پیشرفتهای به نام Sora برای تبدیل متن به ویدیو رونمایی کرد. این ابزار هم اکنون به صورت عمومی در دسترس مردم قرار گرفته و کاربران میتوانند از آن استفاده کنند. بررسی ویدیوهای انتشار یافته نشان میدهد که Sora نسبت به بقیه فناوریهای مشابه در حوزه تولید ویدیو از نوشتار، پیشرفت قابل توجهی داشته و خروجیهای آن بسیار واقعی و طبیعی به نظر میرسند؛ موضوعی که اکنون میتواند هم هیجانانگیز و هم نگرانکننده باشد.
Sora چیست؟
مانند بقیه ابزارهای تولیدی هوش مصنوعی مانند DALL-E و MidJourney، ابزار هوش مصنوعی Sora هم پیامهای متنی را از کاربر دریافت می کند و آنها را به یک خروجی قابل مشاهده تبدیل میکند. با این تفاوت که برخلاف ابزارهایی که تصویر ثابت تولید میکنند، Sora یک ویدیوی کوتاه کامل ارائه میدهد که شامل حرکت، زاویههای مختلف دوربین، جهتگیری و سایر ویژگیهایی است که از یک ویدیوی معمولی انتظار میرود.
با بررسی نمونههای منتشر شده در وبسایت Sora نشان میدهد که ویدیوهای تولیدشده با این ابزار، در موارد بسیاری از ویدیوهای واقعی و حرفهای، غیرقابل تشخیص هستند. این شباهت، محدودهی وسیعی از ویدیوهای مختلف را شامل می شود؛ از صحنههایی که شبیه به تصاویرهای هوایی که با پهبادهای گران قیمت گرفته شده است، تا فیلمهایی با کیفیت بالا با حضور بازیگران و جلوههای ویژه، به طور کامل، توسط هوش مصنوعی ساخته شدهاند.
هوش مصنوعی Sora اولین فناوری تبدیل نوشتار به ویدیو نیست. بلکه قبل از آن، معروفترین آن در این حوزه RunwayML بود که خدمات خود را با دریافت هزینه به صورت عمومی ارائه میداد. همچنین، حتی در بهترین حالت، ویدیوهای تولید شده توسط RunwayML بیشتر شبیه به نسخههای اولیهی تصاویر ثابت در MidJourney هستند، تصاویر از پایداری کافی برخوردار نیستند و قوانین فیزیکی در آنها به درستی رعایت نمیشود، در عین حال طولانیترین ویدویی که این ابزار تولید میکند فقط ۱۶ ثانیه است.
پرامپت نوشته شده برای این ویدیو:
Video of an eye-iris, where the iris expands. Video has to be a close-up
ابزار دیگری به نام Lumiere که دو سال پیش معرفی شد و ادعا کرد که میتواند ویدیوهایی با کیفیت بالاتر نسبت به نسخههای قبلی خود تولید کند. با این حال، به نظر میرسد که Sora حداقل در اکثر زمینهها از Lumiere نیز قدرتمندتر عمل میکند. همچنین Sora میتواند ویدیوهایی با حداکثر وضوح 1920 در 1080 پیکسل و در ابعادهای مختلف ایجاد کند.
برترین خروجیهای Sora کاملا پایدار هستند، قوانین فیزیکی در آنها طوری نمایش داده میشوند که برای ذهن انسان منطقی و قابل درک است، و تایم ویدیوها نیز میتواند تا یک دقیقه برسد. ویدیوهایی که Sora تولید میکند بیصدا هستند، ولی ابزارهای هوش مصنوعی دیگری وجود دارند که میتوان از آنها برای اضافه کردن موسیقی، افکتهای صوتی و گفتار به این ویدیوها استفاده کرد.
با این حساب نمیتوان از جهش قابل توجهی که Sora در مقایسه با نسلهای قبلی، ویدیوهای مبتنی بر هوش مصنوعی تولید کرده چشم پوشی کرد. تنها یک سال پیش، ویدیوهای تولیدشده با هوش مصنوعی جلوهی غیرواقعی و غیرقابل باور داشتند، اما الان با انتشار پیش نمایش Sora، تاثیر بزرگی به جامعهی اکتیو حوزهی هنرهای بصری وارد شده است. Sora قادر است کل صنعت ویدیو را، از پروژههای بزرگ با هزینههای بالا، از تولیدکنندگان مستقل بگیرد و تحت تأثیر قرار دهد و این شروع دوران واقعی فیلمسازی مصنوعی با Sora است.
sora چگونه کار می کند؟
با عنایت به Sora چیست؟ Sora بر پایهی تجربیاتی که شرکتهایی مانند OpenAI در توسعهی فناوریهایی مانند ChatGPT و DALL-E کسب کردهاند. این سیستم برای تولید ویدیو، آن را به اجزایی که شباهت زیادی به توکنهای مورد استفاده در مدلهای زبانی مانند ChatGPT دارند، تقسیم میکند. از آنجایی که اندازهی این توکنها یکسان است، ویژگیهایی مثل طول ویدیو، نسبت تصویر و وضوح آن، برای Sora محدودیتی ایجاد نمیکنند.
همچنین، این فناوری از همان عملکرد گستردهی تبدیل (Transformation) بهرهمند میشود که در مدلهای هوش مصنوعی زبانی مانند ChatGPT و گوگل Gemini بهکار میرود. ساختار ترانسفورمرها اولینبار در سال ۲۰۱۷ توسط گوگل معرفی شد. این مدلها در ابتدا برای تحلیل الگوها در دادههای متنی طراحی شده بودند، ولی Sora با استفاده از این عملکرد، اکنون از نشانههایی بهره میبرد که اجزای کوچکی از فضا و زمان را نمایش میدهند.
در فرآیند آموزش، Sora به مجموعهای از توکنهای تصویری که با نویز پوشش داده شدهاند نگاه میکند و سعی میکند نسخهی بدون نویز آنها را پیش بینی کند. با مقایسهی این پیشبینی با حقیقت موجود، مدل به مرور، ساختار زبانی ویدیویی را یاد میگیرد و با قرار دادن توکنها در کنار هم، یک ویدیوی کامل تولید میشود. همین یک فرآیند آموزش است که باعث شده نمونههای منتشرشده در وبسایت Sora تا این حد واقعی و دقیق به نظر برسند.
علاوه بر توانایی چشمگیر Sora در تولید ویدیو، این ابزار برای فریمهایی که بر اساس آنها آموزش دیده، دارای توصیف های دقیق و تنظیم شدهای است. همین موضوع از دلیل اصلی قدرت Sora در تغییر و تولید ویدیوها بر اساس درخواستهای متنی کاربران است.
توانایی Sora در شبیهسازی دقیق قوائد فیزیکی در ویدیوها، یکی از ویژگیهای اصلی آن است که از آموزش روی میلیونها ویدیو حقیقی، که در آنها حرکتها بر پایهی قوائد فیزیک واقعی صورت میگیرد، بهدست آمده است. در این سیستم، ثبات اجسام بسیار بالاست؛ طوری که، حتی زمانی که اشیا از قاب خارج میشوند یا بهطور موقت با تکیه بر عناصر دیگر قرار میگیرند، حضورشان در تصویر محفوظ است و با تغییر زوایای دوربین بدون هیچگونه اختلالی دوباره ظهور میشود.
ولی بعضی مواقع، زمانی که عناصر متعدد در ویدیو با یکدیگر تعامل دارند، Sora در فهم علت این ارتباط دچار اختلال میشود و ممکن است به خطا در بازآفرینی برخی اجسام منجر شود. همچنین این ابزار در تشخیص جهتها مانند چپ و راست دچار اشتباه میشود. با وجود این نواقص جزئی، آن چیزی که تا به الان از تواناییهای Sora نمایش داده شده، نه تنها کاربردی و قابل استفاده در زمان حال است، بلکه از نظر فنی نیز در سطحی پیشرفته قرار گرفته است.
نحوه دسترسی به هوش مصنوعی Sora
بیصبرانه منتظر این روز بودیم، ابزار هوش مصنوعی Sora از سوی شرکت OpenAI به صورت عمومی عرضه شده است و همه میتوانند از آن استفاده کنند. این فناوری پیشرفته که برای تبدیل متن به ویدیو طراحی شده است، اکنون در اختیار کاربران قرار دارد و بدون نیاز به ابزارهای پیشرفتهی تصویربرداری یا جلوههای ویژه، امکان ساخت ویدیوهایی حقیقی و چشمگیر را فراهم میکند.
تا چندی پیش، Sora فقط در اختیار اعضای تیم قرمز و برخی تولیدکنندگان محتوای انتخابی قرار داشت تا از نظر امنیت، قابلیتها و میزان سواستفاده پذیری مورد بررسی و آزمایش قرار گیرد. اما اکنون، پس از گذر از این مرحله و دریافت بازخوردهای لازم، OpenAI این ابزار را به مرحلهی عرضه عمومی رسانده است. این اتفاق نه تنها تحول بزرگ در توسعه فناوریهای تولید ویدیو محسوب میشود، بلکه فراهم کنندهی انقلابی در تولید محتوا برای آموزش، تبلیغات، سرگرمی و حتی کاربردهای علمی خواهد بود.
ثبت نام در Sora
پس از وارد شدن به چت جی بی تی از نوار سمت چپ و یا از طریق این لینک [+] میتوانید وارد محیط Sora شوید.
پس از ورود به Sora و تایید ایمیل اولین بخشی که وارد میشوید اکسپلور است.
در این بخش میتوانید تصاویر و ویدیوهایی که توسط دیگر کاربران ایجاد شدهاند مشاهده و لایک کنید. همچنین میتوانید پرامپتی که برای آن نوشته شده است مشاهده نمایید. در پایین صفحه بخش پرامپت نویسی قرار دارد که گزینههای آن بسته به اینکه میخواهید تصویر یا ویدیو ایجاد کنید متفاوت است؛ اما به طور کلی سایز، تعداد و کیفیت فایلی که میخواهید ایجاد کنید در این بخش قابل تنظیم خواهد بود.
در قسمت سمت چپ به منوهای مختلف دسترسی دارید. همانطور که مشاهده میکنید، در اینجا هم میتوانید جستجو کنید، و هم تصاویر و ویدیوها را به صورت جداگانه مشاهده کنید؛ همچنین در بخش Top تصاویری که بیشترین لایک را توسط کاربران جذب کردهاند ببینید و همچنین در بخش Likes تصاویری که خودتان لایک کردهاید نیز قرار دارد.
در بخش Library نیز فایلهایی که ایجاد کردهاید و سطل زباله و پوشههایی که ایجاد کردهاید قابل دسترسی هستند.
نوشتن پرامپت در Sora
برای ایجاد تصویر یا ویدیو در Sora بهتر است از دستورات انگلیسی استفاده نمایید، چرا که این هوش مصنوعی هنوز به طور کامل زبان فارسی را درک نمیکند. برای نوشتن پرامپت در کادر پایین صفحه کلیک کنید و دستور خود را به هوش مصنوعی بدهید و در ادامه گزینه فلش یا تایید را کلیک نمایید.
در ادامه باید یک نام کاربری یا username برای اکانت خود انتخاب کنید، پس از این تصاویر شما با این نام کاربری ایجاد و در کتابخانه شما ذخیره خواهند شد. پس از انتخاب یک نام کاربری یکتا در ادامه گزینه create یا ایجاد را کلیک نمایید.
مثال ایجاد تصویر در هوش مصنوعی Sora
در این مثال از پرامپت زیر استفاده شده است:
A cat is showing it’s adorable eyes to attract and make the viewer feel aware and hold’s a board that says “گربه ها هم به مانند تو حق زندگی روی این کره خاکی را دارند”
تصویر خروجی به صورت زیر خواهد بود:
همانطور که مشاهده میکنید هوش مصنوعی Sora هنوز به طور کامل نمیتواند با زبان فارسی ارتباط برقرار کند، به همین دلیل نمیتوان از این هوش مصنوعی برای ایجاد تصاویری که دارای متن فارسی هستند استفاده کرد.
قابلیت های فناوری تبدیل متن به ویدیو
تولید محتوای ویدیویی تا قبل از این اغلب با فیلمبرداری در دنیای واقعی یا با استفاده از جلوههای ویژهی پیچیده انجام میشد. فرآیندی که زمانبر و هزینهبر بودند. اما اکنون با عرضهی عمومی ابزار Sora، توسط شرکت OpenAI، این روند تغییر یافته است. کاربران اکنون میتوانند فقط با توضیح متنی یک صحنه، ویدیوهایی حقیقی و باورپذیر براساس ایده ذهنی تولید کنند که تنها در چند دقیقه و کمتر از هزینهی گذشته امکانپذیر شده است.
با عنایت به تواناییهای بی نظیر Sora، این ابزار اینک برای قابلیتهایی مثل تولید ویدیوهای تبلیغاتی، محتوای آموزشی و سرگرمی مورد استفاده قرار میگیرد. مقالهی فنی OpenAI با عنوان (مدلهای تولید ویدیو همانند شبیه سازهای جهان) نشان میدهد که این فناوری فقط یک ابزار تولید ویدیو نیست، بلکه با توانایی بازآفرینی رفتار اشیا، انسانها و حتی حیوانات در شرایط مختلف، قدمی به سوی شبیهسازی دنیای فیزیکی و دیجیتال است.
هرچند رسیدن به شبیهسازی کامل دنیای واقعی هنوز موانع بزرگی دارد، اما ارائه عمومی Sora شروع یک مسیری است که میتواند در آینده با به کارگیری آن در علوم، آموزش، رسانه و حتی مطالعات اجتماعی را امکانپذیر کند. ولی اینک تولید ویدیوهای حقیقی از یک ایده ساده در دسترس عموم قرار گرفته است.

چالش ها و دغدغه های اخلاقی
دغدغههای مهم و اخلاقی درمورد ابزارهایی مانند Sora حول تاثیرات اجتماعی و اخلاقی آنها شکل گرفته است. در دنیایی که الان با حجم گستردهای از اطلاعات غلط مواجه است، فناوریهایی مثل Sora میتوانند این وضعیت را حتی دشوارتر و خطرناکتر کنند. قدرت تولید ویدیوهای بسیار حقیقی از هر صحنهای که توضیح داده شود، میتواند به راحتی برای انتشار اخبار غلط و باورپذیر، یا ایجاد شک و شبهه نسبت به ویدیوهای واقعی مورد سواستفاده قرار گیرد. همچنین ممکن است سلامت عمومی را به خطر بیندازد، تاثیرات منفی بر جامعه بگذارد و حتی دستگاه قضایی را با شواهد غلط به چالش بکشد.
تولیدکنندگان ویدیو ممکن است با ساخت دیپ فیکهای مخرب، تهدیدهای مستقیم برعلیه مردم ایجاد کنند که این امر میتواند عواقب سنگین برای قربانیان و خانوادههایشان داشته باشد. علاوه بر این، مباحث کپیرایت و مالکیت معنوی نیز دغدغههای مهمی هستند. ابزارهای تولید هوش مصنوعی برای آموزش به حجم زیادی از اطلاعات نیاز دارند، اما OpenAI تابحال جزئیات دقیقی دربارهی منابع دادههای آموزشی Sora منتشر نکرده است.
با وجود همهی این دغدغهها، طبق تجربیات گذشته انتظار نمیرود که فرآیند توسعهی فناوری تولید ویدیو متوقف شود. OpenAI قبل از ارائهی عمومی Sora، اقدامات مهمی برای افزایش ایمنی انجام داده و با کارشناسان همکاری میکند تا از انتشار اطلاعات غلط جلوگیری کرده و ابزارهایی برای شناسایی محتوای مخرب توسعه دهد.
نتیجه گیری
با بهرهوری از موضوع Sora چیست؟ یک پیشرفت چشمگیر در فناوری هوش مصنوعی را نشان میدهد که سرعت پیشرفت در این حوزه بسیار فراتر از چیزی است که تصور میکنیم. این نوع هوش مصنوعی اینک میتواند از توضیحهای متنی، ویدیوهایی تولید کند که تشخیص آنها از فیلمهای واقعی بسیار سخت و حتی غیرممکن است.
ما به ناچار بر لبهی عصر جدیدی در نوآفرینیها در دنیای فناوری ایستادهایم و اکنون زمانی است که باید به جای مقابله و ترس از فناوری، تلاش کنیم هوش مصنوعی را در کنترل خود درآوریم و از آن در جهت مثبت استفاده کنیم. تبدیل نوشتار به ویدیو که در آینده میتواند بسیار سادهتر هم باشد، فرصتهای خلاقانهی زیادی را برای فیلمسازان، تولیدکنندگان محتوا، هنرمندان دیجیتال و برای عموم باز میکند تا ایدههای خلاقانهی را به سادهترین روش به صورت بصری و تجسمی درآورند.
اگر جامعهی انسانی این چالش را با خلاقیت و ظرافت پیش ببرد، شبیهسازهای قدرتمند مثل Sora میتوانند منظرههای غیرقابل تصوری را برای داستانسرایی بصری باز کنند و صداهای متعددی را برای گفتن داستانهایی که پیش از این توسط انسانها یا ماشینها تصور نمیشد، تولید کنند.


















