
گوگل سالهاست که درباره هوش مصنوعی چندوجهی (Multimodal AI) صحبت میکند. متن، تصویر، صدا، ویدیو، کدنویسی، جستجو و عاملهای هوشمند (Agents): همه و همه به آرامی در حال کشیده شدن به مدار یکپارچهی خانوادهی Gemini هستند.
معرفی Gemini Omni به عنوان گام بعدی و بدیهی در این مسیر احساس میشود، اما همزمان این گام به طرز عجیبی جاهطلبانه است.
این سیستم که در کنفرانس Google I/O 2026 معرفی شد، خانواده مدل جدید گوگل برای ایجاد و ویرایش رسانه از طریق ورودیهای ترکیبی است. اولین نسخه منتشر شده از این خانواده، Gemini Omni Flash نام دارد و گوگل کار خود را مستقیما با «ویدیو» آغاز کرده است.
این بخش آخر بسیار مهم است. Omni صرفا یک ارتقای ساده برای چتباتها نیست. این مدل، تلاش بلندپروازانهی گوگل برای فروپاشی و ادغام چندین جریان کاری خلاقانه مبتنی بر هوش مصنوعی در یک مدل واحد است: تبدیل متن به ویدیو (Text-to-video)، تبدیل تصویر به ویدیو (Image-to-video)، ویرایش ویدیو، تولید محتوای حساس به صدا (Audio-aware generation)، انتقال سبک، ساخت آواتار و در نهایت پشتیبانی از انواع خروجیهای دیگر.
اگر پیگیر مقایسهی نسل فعلی تولیدکنندگان ویدیوی هوش مصنوعی بودهاید، باید بدانید که Omni در تلاش است تا این دستهبندی را از «تولید یکباره» به چیزی بسیار «قابل ویرایشتر» و تعاملیتر تبدیل کند.
اگر این همه قابلیت برای یک مدل، بیش از حد سنگین و زیاد به نظر میرسد، باید بگوییم: بله، حق با شماست؛ و دقیقا نکته اصلی ماجرا همین است!
Gemini Omni چیست؟
Gemini Omni مدل جدید و چندوجهی گوگل برای تولید محتواست. گوگل این سیستم را به عنوان نقطهای توصیف میکند که در آن «توانایی استدلال Gemini با توانایی خلق کردن تلاقی پیدا میکند.»
از منظر کاربردی، Omni میتواند انواع مختلفی از ورودیها، از جمله متن، تصویر، صدا و ویدیو را دریافت کرده و سپس بر اساس آن ورودیها، ویدیوی جدیدی تولید یا ویرایش کند.

به عنوان مثال، شما میتوانید موارد زیر را به آن بدهید:
- یک کلیپ ویدیویی کوتاه
- یک تصویر به عنوان مرجع
- یک فایل صوتی یا صدای ضبط شده به عنوان مرجع (در صورت پشتیبانی)
- یک دستورالعمل و پرامپت متنی
سپس میتوانید از آن بخواهید ویدیوی جدیدی تولید کند که از حرکت کلیپ اصلی پیروی کند، با سبک و استایل تصویر مرجع مطابقت داشته باشد، به صدای مرجع واکنش نشان دهد و بخشهای خاصی از صحنه را تغییر دهد.
این همان بخشی است که گوگل به شدت روی آن مانور میدهد: Omni فقط درباره تولید یک چیز از صفر نیست. بلکه درباره ویرایش از طریق مکالمه است.
شما میتوانید از این هوش مصنوعی بخواهید یک شیء را تغییر دهد، زاویه دوربین را تنظیم کند، یک شخصیت را به محیط متفاوتی منتقل کند، جلوههای ویژه اضافه کند یا یک صحنه را در طول چندین پرامپتِ متوالی اصلاح و پالایش کند. به گفته گوگل، این مدل به گونهای طراحی شده است که در طول یک ویرایش چندمرحلهای (Multi-turn edit)، شخصیتها را ثابت نگه دارد، بافت صحنه را حفظ کند و دقیقا بفهمد که پیش از این چه اتفاقی افتاده است.
- سیری یا جمنای، کدام یک برای iOS بهتر است؟
- دریافت پرامتهای آماده و رایگان از این سایتها
- پنهان کردن AI Overviews از نتایج جستجوی گوگل
اولین مدل: Gemini Omni Flash
اولین عضو خانواده Omni، مدل Gemini Omni Flash است. گوگل در حال حاضر این مدل را برای مشترکین سرویسهای Google AI Plus، Pro و Ultra از طریق اپلیکیشن Gemini و پلتفرم Google Flow عرضه میکند. همچنین از همان هفتهی معرفی، این قابلیت به صورت رایگان برای کاربران 18 سال به بالایِ نرمافزار YouTube Create و بخش YouTube Shorts Remix در دسترس قرار گرفته است.
توسعهدهندگان و مشتریان سازمانی بلافاصله به آن دسترسی نخواهند داشت. گوگل اعلام کرده است که دسترسی به رابط برنامهنویسی (API) در ماههای آینده فراهم خواهد شد.
این نحوه عرضه اطلاعات زیادی درباره دیدگاه گوگل نسبت به اولین کاربرد این سیستم به ما میدهد. Omni پیش از آنکه به یک مدل پلتفرمی برای برنامهنویسان و توسعهدهندگان تبدیل شود، به عنوان یک ابزار خلاقانه برای کاربران عادی، تولیدکنندگان محتوا و جریانهای کاری ویدیویی در حال راهاندازی است.
emini Omni چه کارهایی میتواند انجام دهد؟
نسخه کوتاه: Gemini Omni میتواند با استفاده از ترکیبی از ورودیهای متنی، تصویری، صوتی و ویدیویی، ویدیوهای جدید بسازد و ویرایش کند.
نسخه جذابتر: نحوه ترکیب این ورودیها با یکدیگر است.
1. ویرایش ویدیو از طریق پرامپت (دستور متنی)
بارزترین ویژگی این مدل، ویرایش ویدیو با استفاده از زبان طبیعی است. به جای باز کردن یک تایملاین (Timeline) در نرمافزارهای سنتی مثل پریمیر (Premiere Pro)، ماسک کردن دستی اشیاء، افزودن افکتها و تنظیم لایهها، شما به سادگی چیزی را که میخواهید تغییر کند، توصیف میکنید.
مثالهای گوگل شامل پرامپتهایی از این دست است:
- “مجسمه را از حباب بساز.”
- “نور اتاق را کم کن.”
- “زاویه دوربین را طوری تغییر بده که از روی شانه نوازنده ویولن باشد.”
- “ویولن را نامرئی کن.”

این مدل میتواند دستورالعملهای قبلی را به خاطر بسپارد و روی آنها بسازد؛ بنابراین فرآیند ویرایش کاملا به صورت محاورهای درمیآید. شما یک تغییر ایجاد میکنید، به نتیجه نگاه میکنید و سپس بدون نیاز به شروع مجدد از صفر، درخواست تغییر دیگری میدهید.
اگر این قابلیت همانطور که نشان داده شده است کار کند، میتواند یکی از مفیدترین بخشهای Omni باشد. اکثر ابزارهای ویدیوییِ هوش مصنوعی در تولید یک کلیپ اولیه خوب عمل میکنند، اما زمانی که شما یک تغییر خاص میخواهید، کلافهکننده میشوند. Omni به وضوح در تلاش است تا «بازبینی و اصلاح» را به بخشی از جریان کاری هستهای تبدیل کند.
2. ترکیب منابع مرجع (References)
Omni میتواند به طور همزمان از چندین ورودی استفاده کند. شما میتوانید تصویری از یک شخصیت، عکسی به عنوان مرجع استایل (Style reference)، یک ویدیوی موجود و یک ترک صوتی ارائه دهید، سپس از مدل بخواهید کلیپ جدیدی تولید کند که همه این قطعات را در یک خروجی واحد ترکیب کند.
این موضوع درها را به سوی جریانهای کاری بسیار کنترلشدهتر باز میکند. به جای اینکه از یک مدل هوش مصنوعی بخواهید “یک ویدیوی علمی-تخیلی بسازد” و امیدوار باشید که درست حدس بزند، میتوانید نتیجه را با مراجع و رفرنسهای واقعی لنگر کنید.
این قابلیت مخصوصا برای سازندگانی که از قبل داراییهایی (Assets) دارند بسیار مفید است: طرحهای اولیه (Sketches)، عکسهای محصول، فیلمهای تستی، مودبوردها (Moodboards)، موسیقی یا انیمیشنهای خام. Omni میتواند از این موارد به عنوان دستورالعملهای خلاقانه استفاده کند، نه صرفا به عنوان یک فایل پیوست.
3. درک حرکت، فیزیک و زمینه (Context)
گوگل همچنین Omni را به عنوان مدلی با “درک بهتر از جهان فیزیکی” معرفی میکند. در مثالها به گرانش، انرژی جنبشی، دینامیک سیالات، حرکت دوربین و تداوم صحنه اشاره شده است. به زبان ساده: فرض بر این است که این مدل درک میکند اشیاء چگونه باید در دنیای واقعی حرکت کنند، نه اینکه فقط یک ویدیو فریم به فریم چگونه باید به نظر برسد.
این دقیقا همان نقطهضعف واقعی در هوش مصنوعیهای ویدیویی فعلی است. بسیاری از کلیپهای تولید شده در ثانیه اول چشمگیر به نظر میرسد، اما بعد از آن ناگهان دستها ذوب میشوند، اشیاء جابجا میشوند، قوانین فیزیک نقض میگردد یا صحنه به آرامی قوانین منطقی خود را فراموش میکند.

گوگل ادعا میکند که Omni شهود و درک قویتری برای تداوم دارد. البته ما هنوز برای درک میزان موفقیت این ادعا به آزمایشهای دنیای واقعی نیاز داریم، اما مسیر کاملا مشخص است: “کلیپهای زیباتر” دیگر کافی نیستند. نسل بعدی مدلهای ویدیویی باید در یک سیستم واحد، بیشتر شبیه به یک کارگردان، تدوینگر، انیماتور و شبیهساز آگاه به فیزیک عمل کنند.
4. ساخت ویدیوهای توضیحی
یکی از کاربردیترین مثالهای ارائه شده توسط گوگل، استفاده از Gemini Omni برای ساخت ویدیوهای آموزشی و توضیحی است. به جای تولید صرفا یک صحنه سینمایی، Omni میتواند یک پرامپت کوتاه را به یک توضیح بصری تبدیل کند. گوگل نمونههایی مانند یک ویدیوی توضیحی به سبک خمیری (Claymation) درباره تا شدن پروتئینها، و یک ویدیوی استاپموشن درباره عملکرد هیپوکامپ مغز را به نمایش گذاشت.
این دقیقا همان جایی است که Omni میتواند فراتر از تولیدکنندگان محتوای فانتزی که به دنبال جلوههای سورئال هستند، برای اقشار دیگر نیز مفید واقع شود. معلمان، بازاریابان، تیمهای محصول و نویسندگان فنی زمان زیادی را صرف تبدیل ایدههای پیچیده به تصاویر بصری میکنند. اگر Omni بتواند ویدیوهای توضیحی دقیق و قابل ویرایشی را از روی پرامپتهای کوتاه و مطالب مرجع تولید کند، به ابزاری کاملا متفاوت از یک تولیدکننده ویدیوی سرگرمکننده تبدیل میشود.
البته مشکل اصلی در اینجا “دقت علمی” است. یک مدل میتواند یک ویدیوی توضیحی را بسیار متقاعدکننده جلوه دهد، در حالی که هنوز علم یا مکانیک پشت آن را اشتباه متوجه شده است. برای هرگونه محتوای آموزشی، پزشکی، قانونی یا فنی، خروجی Omni همچنان به بازبینی دقیق انسانی نیاز خواهد داشت.
![]()
5. پشتیبانی از آواتارهای شخصی
گوگل همچنین Omni را به آواتارها گره میزند. در زمان راهاندازی، کاربران میتوانند ویدیوهایی با صدای خودشان از طریق ویژگی Avatars گوگل (که یک نسخه دیجیتالی از کاربر ایجاد میکند) بسازند. گوگل میگوید قابلیتهای گستردهتر ویرایش صدا و گفتار، پیش از انتشار عمومی همچنان در حال آزمایش هستند.
این یکی از حوزههایی است که پیامدهای ایمنی و امنیتی آن کاملا واضح است. مدلی که میتواند ویدیو را ویرایش کند، گفتار را تغییر دهد و محتوای آواتار واقعگرایانه (Deepfake) تولید کند، به کنترلهای هویتی بسیار قوی نیاز دارد. گوگل میگوید ویدیوهای ساخته شده توسط Omni دارای واترمارک غیرقابل حذف SynthID هستند. بخش Google DeepMind نیز اعلام کرده محتوایی که با Omni در اپلیکیشن Gemini، پلتفرم Google Flow یا YouTube ایجاد یا ویرایش میشود، دارای اعتبارنامههای محتوایی استاندارد C2PA است.
اگرچه این امر تمام مشکلات سوءاستفاده را حل نمیکند، اما حداقل به پلتفرمها و کاربران راهی برای شناسایی محتوای تولید شده یا ویرایش شده توسط هوش مصنوعی میدهد.
| ویژگی کلیدی | شرح عملکرد در Gemini Omni | کاربرد اصلی |
| ویرایش محاورهای | تغییر عناصر ویدیو با چت کردن متوالی | اصلاح سریع بدون نیاز به نرمافزارهای پیچیده تدوین |
| ورودی چندوجهی | ترکیب همزمان متن، عکس، صدا و ویدیو | کنترل دقیق استایل و حرکت در خروجی |
| درک فیزیک | شبیهسازی منطقی جاذبه، مایعات و دوربین | جلوگیری از تغییر شکلهای عجیب (مورفینگ) در ویدیوها |
| تولید محتوای توضیحی | تبدیل متون پیچیده به ویدیوهای آموزشی (مثل استاپموشن) | آموزش، بازاریابی و ارائه محصول |
| واترمارک SynthID | درج نامرئی اطلاعات منبع در ویدیو | جلوگیری از دیپفیک و اخبار جعلی |
Gemini Omni را کجا میتوان استفاده کرد؟
در زمان راهاندازی، Gemini Omni Flash از طریق این پلتفرمها در دسترس است:
- اپلیکیشن Gemini
- پلتفرم Google Flow
- بخش YouTube Shorts Remix
- اپلیکیشن YouTube Create
گوگل اعلام کرده است که در دسترس بودن این قابلیت به سطح اشتراک کاربر و منطقه جغرافیایی او بستگی دارد. مشترکین پولیِ Google AI Plus، Pro و Ultra به طور پیشفرض در عرضه اولیه اپلیکیشن Gemini و Flow گنجانده شدهاند. همچنین بخشهای YouTube Shorts Remix و YouTube Create از همان هفته معرفی، بدون هزینه برای کاربران بالای 18 سال فعال شدهاند.

همانطور که گفته شد، دسترسی به API برای توسعهدهندگان به زودی منتشر میشود، اما گوگل هنوز قیمتگذاری عمومی یا تاریخ دقیق انتشار آن را اعلام نکرده است.
- انقلاب خاموش در ChatGPT: سه قابلیت شگفتانگیز در سال 2026
- برنامه نویسی بدون کد با هوش مصنوعی: جنگ جمنای Flash در برابر جمنای Pro
آیا Gemini Omni همان Veo است؟
نه دقیقا.
Veo خط تولید مدلهای تولید ویدیوی گوگل است. اما Gemini Omni یک مدل ایجاد محتوای چندوجهی و بسیار گستردهتر است که تواناییهای استدلالی Gemini را با تولید و ویرایش رسانهها ترکیب میکند.
تفاوت مهم در جریان کاری (Workflow) است. Veo عمدتا به عنوان یک مدل «تولید ویدیو» شناخته میشود. اما Omni به عنوان یک مدل «خلق و ویرایشِ همهکاره با هر نوع ورودی» معرفی میشود که کار خود را با ویدیو آغاز کرده، اما برای همیشه محدود به آن نخواهد بود. گوگل میگوید نسخههای آینده Omni از سایر روشهای خروجی، از جمله تصویر و صدا نیز پشتیبانی خواهند کرد.
بنابراین بهترین راه برای درک این تفاوت این است: Veo به گوگل کمک کرد تا در رقابت تولید ویدیوی هوش مصنوعی (در برابر شرکتهایی مثل OpenAI) حضور داشته باشد. اما Gemini Omni تلاش گوگل است تا تولید ویدیو، ویرایش ویدیو، پرامپتنویسی چندوجهی و استدلال خلاقانه را به یک جریان کاری پیوسته و یکپارچه تبدیل کند.