Skip to main content

انقلاب گوگل در تولید و ویرایش ویدیو با Gemini Omni

گوگل سال‌هاست که درباره هوش مصنوعی چندوجهی (Multimodal AI) صحبت می‌کند. متن، تصویر، صدا، ویدیو، کدنویسی، جستجو و عامل‌های هوشمند (Agents): همه و همه به آرامی در حال کشیده شدن به مدار یکپارچه‌ی خانواده‌ی Gemini هستند.

معرفی Gemini Omni به عنوان گام بعدی و بدیهی در این مسیر احساس می‌شود، اما همزمان این گام به طرز عجیبی جاه‌طلبانه است.

این سیستم که در کنفرانس Google I/O 2026 معرفی شد، خانواده مدل جدید گوگل برای ایجاد و ویرایش رسانه از طریق ورودی‌های ترکیبی است. اولین نسخه منتشر شده از این خانواده، Gemini Omni Flash نام دارد و گوگل کار خود را مستقیما با «ویدیو» آغاز کرده است.

این بخش آخر بسیار مهم است. Omni صرفا یک ارتقای ساده برای چت‌بات‌ها نیست. این مدل، تلاش بلندپروازانه‌ی گوگل برای فروپاشی و ادغام چندین جریان کاری خلاقانه مبتنی بر هوش مصنوعی در یک مدل واحد است: تبدیل متن به ویدیو (Text-to-video)، تبدیل تصویر به ویدیو (Image-to-video)، ویرایش ویدیو، تولید محتوای حساس به صدا (Audio-aware generation)، انتقال سبک، ساخت آواتار و در نهایت پشتیبانی از انواع خروجی‌های دیگر.

اگر پیگیر مقایسه‌ی نسل فعلی تولیدکنندگان ویدیوی هوش مصنوعی بوده‌اید، باید بدانید که Omni در تلاش است تا این دسته‌بندی را از «تولید یک‌باره» به چیزی بسیار «قابل ویرایش‌تر» و تعاملی‌تر تبدیل کند.

اگر این همه قابلیت برای یک مدل، بیش از حد سنگین و زیاد به نظر می‌رسد، باید بگوییم: بله، حق با شماست؛ و دقیقا نکته اصلی ماجرا همین است!

Gemini Omni چیست؟

Gemini Omni مدل جدید و چندوجهی گوگل برای تولید محتواست. گوگل این سیستم را به عنوان نقطه‌ای توصیف می‌کند که در آن «توانایی استدلال Gemini با توانایی خلق کردن تلاقی پیدا می‌کند

از منظر کاربردی، Omni می‌تواند انواع مختلفی از ورودی‌ها، از جمله متن، تصویر، صدا و ویدیو را دریافت کرده و سپس بر اساس آن ورودی‌ها، ویدیوی جدیدی تولید یا ویرایش کند.

به عنوان مثال، شما می‌توانید موارد زیر را به آن بدهید:

  • یک کلیپ ویدیویی کوتاه
  • یک تصویر به عنوان مرجع
  • یک فایل صوتی یا صدای ضبط شده به عنوان مرجع (در صورت پشتیبانی)
  • یک دستورالعمل و پرامپت متنی

سپس می‌توانید از آن بخواهید ویدیوی جدیدی تولید کند که از حرکت کلیپ اصلی پیروی کند، با سبک و استایل تصویر مرجع مطابقت داشته باشد، به صدای مرجع واکنش نشان دهد و بخش‌های خاصی از صحنه را تغییر دهد.

این همان بخشی است که گوگل به شدت روی آن مانور می‌دهد: Omni فقط درباره تولید یک چیز از صفر نیست. بلکه درباره ویرایش از طریق مکالمه است.

شما می‌توانید از این هوش مصنوعی بخواهید یک شیء را تغییر دهد، زاویه دوربین را تنظیم کند، یک شخصیت را به محیط متفاوتی منتقل کند، جلوه‌های ویژه اضافه کند یا یک صحنه را در طول چندین پرامپتِ متوالی اصلاح و پالایش کند. به گفته گوگل، این مدل به گونه‌ای طراحی شده است که در طول یک ویرایش چندمرحله‌ای (Multi-turn edit)، شخصیت‌ها را ثابت نگه دارد، بافت صحنه را حفظ کند و دقیقا بفهمد که پیش از این چه اتفاقی افتاده است.

اولین مدل: Gemini Omni Flash

اولین عضو خانواده Omni، مدل Gemini Omni Flash است. گوگل در حال حاضر این مدل را برای مشترکین سرویس‌های Google AI Plus، Pro و Ultra از طریق اپلیکیشن Gemini و پلتفرم Google Flow عرضه می‌کند. همچنین از همان هفته‌ی معرفی، این قابلیت به صورت رایگان برای کاربران 18 سال به بالایِ نرم‌افزار YouTube Create و بخش YouTube Shorts Remix در دسترس قرار گرفته است.

توسعه‌دهندگان و مشتریان سازمانی بلافاصله به آن دسترسی نخواهند داشت. گوگل اعلام کرده است که دسترسی به رابط برنامه‌نویسی (API) در ماه‌های آینده فراهم خواهد شد.

این نحوه عرضه اطلاعات زیادی درباره دیدگاه گوگل نسبت به اولین کاربرد این سیستم به ما می‌دهد. Omni پیش از آنکه به یک مدل پلتفرمی برای برنامه‌نویسان و توسعه‌دهندگان تبدیل شود، به عنوان یک ابزار خلاقانه برای کاربران عادی، تولیدکنندگان محتوا و جریان‌های کاری ویدیویی در حال راه‌اندازی است.

emini Omni چه کارهایی می‌تواند انجام دهد؟

نسخه کوتاه: Gemini Omni می‌تواند با استفاده از ترکیبی از ورودی‌های متنی، تصویری، صوتی و ویدیویی، ویدیوهای جدید بسازد و ویرایش کند.

نسخه جذاب‌تر: نحوه ترکیب این ورودی‌ها با یکدیگر است.

1. ویرایش ویدیو از طریق پرامپت (دستور متنی)

بارزترین ویژگی این مدل، ویرایش ویدیو با استفاده از زبان طبیعی است. به جای باز کردن یک تایم‌لاین (Timeline) در نرم‌افزارهای سنتی مثل پریمیر (Premiere Pro)، ماسک کردن دستی اشیاء، افزودن افکت‌ها و تنظیم لایه‌ها، شما به سادگی چیزی را که می‌خواهید تغییر کند، توصیف می‌کنید.

مثال‌های گوگل شامل پرامپت‌هایی از این دست است:

  • “مجسمه را از حباب بساز.”
  • “نور اتاق را کم کن.”
  • “زاویه دوربین را طوری تغییر بده که از روی شانه نوازنده ویولن باشد.”
  • “ویولن را نامرئی کن.”

این مدل می‌تواند دستورالعمل‌های قبلی را به خاطر بسپارد و روی آن‌ها بسازد؛ بنابراین فرآیند ویرایش کاملا به صورت محاوره‌ای درمی‌آید. شما یک تغییر ایجاد می‌کنید، به نتیجه نگاه می‌کنید و سپس بدون نیاز به شروع مجدد از صفر، درخواست تغییر دیگری می‌دهید.

اگر این قابلیت همان‌طور که نشان داده شده است کار کند، می‌تواند یکی از مفیدترین بخش‌های Omni باشد. اکثر ابزارهای ویدیوییِ هوش مصنوعی در تولید یک کلیپ اولیه خوب عمل می‌کنند، اما زمانی که شما یک تغییر خاص می‌خواهید، کلافه‌کننده می‌شوند. Omni به وضوح در تلاش است تا «بازبینی و اصلاح» را به بخشی از جریان کاری هسته‌ای تبدیل کند.

2. ترکیب منابع مرجع (References)

Omni می‌تواند به طور همزمان از چندین ورودی استفاده کند. شما می‌توانید تصویری از یک شخصیت، عکسی به عنوان مرجع استایل (Style reference)، یک ویدیوی موجود و یک ترک صوتی ارائه دهید، سپس از مدل بخواهید کلیپ جدیدی تولید کند که همه این قطعات را در یک خروجی واحد ترکیب کند.

این موضوع درها را به سوی جریان‌های کاری بسیار کنترل‌شده‌تر باز می‌کند. به جای اینکه از یک مدل هوش مصنوعی بخواهید “یک ویدیوی علمی-تخیلی بسازد” و امیدوار باشید که درست حدس بزند، می‌توانید نتیجه را با مراجع و رفرنس‌های واقعی لنگر کنید.

این قابلیت مخصوصا برای سازندگانی که از قبل دارایی‌هایی (Assets) دارند بسیار مفید است: طرح‌های اولیه (Sketches)، عکس‌های محصول، فیلم‌های تستی، مودبوردها (Moodboards)، موسیقی یا انیمیشن‌های خام. Omni می‌تواند از این موارد به عنوان دستورالعمل‌های خلاقانه استفاده کند، نه صرفا به عنوان یک فایل پیوست.

3. درک حرکت، فیزیک و زمینه (Context)

گوگل همچنین Omni را به عنوان مدلی با “درک بهتر از جهان فیزیکی” معرفی می‌کند. در مثال‌ها به گرانش، انرژی جنبشی، دینامیک سیالات، حرکت دوربین و تداوم صحنه اشاره شده است. به زبان ساده: فرض بر این است که این مدل درک می‌کند اشیاء چگونه باید در دنیای واقعی حرکت کنند، نه اینکه فقط یک ویدیو فریم به فریم چگونه باید به نظر برسد.

این دقیقا همان نقطه‌ضعف واقعی در هوش مصنوعی‌های ویدیویی فعلی است. بسیاری از کلیپ‌های تولید شده در ثانیه اول چشمگیر به نظر می‌رسد، اما بعد از آن ناگهان دست‌ها ذوب می‌شوند، اشیاء جابجا می‌شوند، قوانین فیزیک نقض می‌گردد یا صحنه به آرامی قوانین منطقی خود را فراموش می‌کند.

گوگل ادعا می‌کند که Omni شهود و درک قوی‌تری برای تداوم  دارد. البته ما هنوز برای درک میزان موفقیت این ادعا به آزمایش‌های دنیای واقعی نیاز داریم، اما مسیر کاملا مشخص است: “کلیپ‌های زیباتر” دیگر کافی نیستند. نسل بعدی مدل‌های ویدیویی باید در یک سیستم واحد، بیشتر شبیه به یک کارگردان، تدوین‌گر، انیماتور و شبیه‌ساز آگاه به فیزیک عمل کنند.

4. ساخت ویدیوهای توضیحی 

یکی از کاربردی‌ترین مثال‌های ارائه شده توسط گوگل، استفاده از Gemini Omni برای ساخت ویدیوهای آموزشی و توضیحی است. به جای تولید صرفا یک صحنه سینمایی، Omni می‌تواند یک پرامپت کوتاه را به یک توضیح بصری تبدیل کند. گوگل نمونه‌هایی مانند یک ویدیوی توضیحی به سبک خمیری (Claymation) درباره تا شدن پروتئین‌ها، و یک ویدیوی استاپ‌موشن درباره عملکرد هیپوکامپ مغز را به نمایش گذاشت.

این دقیقا همان جایی است که Omni می‌تواند فراتر از تولیدکنندگان محتوای فانتزی که به دنبال جلوه‌های سورئال هستند، برای اقشار دیگر نیز مفید واقع شود. معلمان، بازاریابان، تیم‌های محصول و نویسندگان فنی زمان زیادی را صرف تبدیل ایده‌های پیچیده به تصاویر بصری می‌کنند. اگر Omni بتواند ویدیوهای توضیحی دقیق و قابل ویرایشی را از روی پرامپت‌های کوتاه و مطالب مرجع تولید کند، به ابزاری کاملا متفاوت از یک تولیدکننده ویدیوی سرگرم‌کننده تبدیل می‌شود.

البته مشکل اصلی در اینجا “دقت علمی” است. یک مدل می‌تواند یک ویدیوی توضیحی را بسیار متقاعدکننده جلوه دهد، در حالی که هنوز علم یا مکانیک پشت آن را اشتباه متوجه شده است. برای هرگونه محتوای آموزشی، پزشکی، قانونی یا فنی، خروجی Omni همچنان به بازبینی دقیق انسانی نیاز خواهد داشت.

5. پشتیبانی از آواتارهای شخصی

گوگل همچنین Omni را به آواتارها گره می‌زند. در زمان راه‌اندازی، کاربران می‌توانند ویدیوهایی با صدای خودشان از طریق ویژگی Avatars گوگل (که یک نسخه دیجیتالی از کاربر ایجاد می‌کند) بسازند. گوگل می‌گوید قابلیت‌های گسترده‌تر ویرایش صدا و گفتار، پیش از انتشار عمومی همچنان در حال آزمایش هستند.

این یکی از حوزه‌هایی است که پیامدهای ایمنی و امنیتی آن کاملا واضح است. مدلی که می‌تواند ویدیو را ویرایش کند، گفتار را تغییر دهد و محتوای آواتار واقع‌گرایانه (Deepfake) تولید کند، به کنترل‌های هویتی بسیار قوی نیاز دارد. گوگل می‌گوید ویدیوهای ساخته شده توسط Omni دارای واترمارک غیرقابل حذف SynthID هستند. بخش Google DeepMind نیز اعلام کرده محتوایی که با Omni در اپلیکیشن Gemini، پلتفرم Google Flow یا YouTube ایجاد یا ویرایش می‌شود، دارای اعتبارنامه‌های محتوایی استاندارد C2PA است.

اگرچه این امر تمام مشکلات سوءاستفاده را حل نمی‌کند، اما حداقل به پلتفرم‌ها و کاربران راهی برای شناسایی محتوای تولید شده یا ویرایش شده توسط هوش مصنوعی می‌دهد.

ویژگی کلیدی شرح عملکرد در Gemini Omni کاربرد اصلی
ویرایش محاوره‌ای تغییر عناصر ویدیو با چت کردن متوالی اصلاح سریع بدون نیاز به نرم‌افزارهای پیچیده تدوین
ورودی چندوجهی ترکیب همزمان متن، عکس، صدا و ویدیو کنترل دقیق استایل و حرکت در خروجی
درک فیزیک شبیه‌سازی منطقی جاذبه، مایعات و دوربین جلوگیری از تغییر شکل‌های عجیب (مورفینگ) در ویدیوها
تولید محتوای توضیحی تبدیل متون پیچیده به ویدیوهای آموزشی (مثل استاپ‌موشن) آموزش، بازاریابی و ارائه محصول
واترمارک SynthID درج نامرئی اطلاعات منبع در ویدیو جلوگیری از دیپ‌فیک و اخبار جعلی

Gemini Omni را کجا می‌توان استفاده کرد؟

در زمان راه‌اندازی، Gemini Omni Flash از طریق این پلتفرم‌ها در دسترس است:

  • اپلیکیشن Gemini
  • پلتفرم Google Flow
  • بخش YouTube Shorts Remix
  • اپلیکیشن YouTube Create

گوگل اعلام کرده است که در دسترس بودن این قابلیت به سطح اشتراک کاربر و منطقه جغرافیایی او بستگی دارد. مشترکین پولیِ Google AI Plus، Pro و Ultra به طور پیش‌فرض در عرضه اولیه اپلیکیشن Gemini و Flow گنجانده شده‌اند. همچنین بخش‌های YouTube Shorts Remix و YouTube Create از همان هفته معرفی، بدون هزینه برای کاربران بالای 18 سال فعال شده‌اند.

همان‌طور که گفته شد، دسترسی به API برای توسعه‌دهندگان به زودی منتشر می‌شود، اما گوگل هنوز قیمت‌گذاری عمومی یا تاریخ دقیق انتشار آن را اعلام نکرده است.

آیا Gemini Omni همان Veo است؟

نه دقیقا.

Veo خط تولید مدل‌های تولید ویدیوی گوگل است. اما Gemini Omni یک مدل ایجاد محتوای چندوجهی و بسیار گسترده‌تر است که توانایی‌های استدلالی Gemini را با تولید و ویرایش رسانه‌ها ترکیب می‌کند.

تفاوت مهم در جریان کاری (Workflow) است. Veo عمدتا به عنوان یک مدل «تولید ویدیو» شناخته می‌شود. اما Omni به عنوان یک مدل «خلق و ویرایشِ همه‌کاره با هر نوع ورودی» معرفی می‌شود که کار خود را با ویدیو آغاز کرده، اما برای همیشه محدود به آن نخواهد بود. گوگل می‌گوید نسخه‌های آینده Omni از سایر روش‌های خروجی، از جمله تصویر و صدا نیز پشتیبانی خواهند کرد.

بنابراین بهترین راه برای درک این تفاوت این است: Veo به گوگل کمک کرد تا در رقابت تولید ویدیوی هوش مصنوعی (در برابر شرکت‌هایی مثل OpenAI) حضور داشته باشد. اما Gemini Omni تلاش گوگل است تا تولید ویدیو، ویرایش ویدیو، پرامپت‌نویسی چندوجهی و استدلال خلاقانه را به یک جریان کاری پیوسته و یکپارچه تبدیل کند.

آدرس ایمیل شما نمایش داده نخواهد شد.