Google का नया AI: अब फोन पर बोलकर एडिट करें स्टूडियो लेवल VFX, आप भी बना पाएंगे बॉलीवुड जैसे वीडियो
Gemini Omni:
टेक दिग्गज गूगल ने अपना नया मल्टीमोडल एआई मॉडल 'जेमिनी ओमनी' पेश कर दिया है। यह एक ऐसा स्मार्ट टूल है जो आपकी आवाज और टेक्स्ट को समझकर पलक झपकते ही वीडियो बना और एडिट कर सकता है। वीडियो में नया कैरेक्टर जोड़ने से लेकर अपना खुद का 'डिजिटल अवतार' बनाने तक, यह सब कुछ चुटकियों में करता है। डीपफेक से बचाव और खास वाटरमार्क (SynthID) की सुरक्षा के साथ, जानिए यह नया टूल आपके लिए कब रोलआउट हो रहा है।

विस्तार
गूगल ने अपनी आर्टिफिशियल इंटेलिजेंस (एआई) की दुनिया में एक बड़ा कदम उठाते हुए Gemini Omni को लॉन्च किया है। यह एआई मॉडल्स की एक नई सीरीज है जो टेक्स्ट के साथ-साथ मल्टीमीडिया यानी कि फोटो, ऑडियो और वीडियो को एक साथ समझने और बनाने में माहिर है। गूगल का अंतिम लक्ष्य आर्टिफिशियल जनरल इंटेलिजेंस (AGI) बनाना है और यह मॉडल उसी दिशा में एक बड़ा कदम है।
इस सीरीज का पहला टूल Gemini Omni Flash है। इसे सीधे Gemini एप, Google Flow और YouTube Shorts में शामिल किया जा रहा है। अभी यह मुख्य रूप से वीडियो बनाने पर फोकस कर रहा है। लेकिन गूगल का कहना है कि भविष्य में यह सीधे इमेज और ऑडियो भी जनरेट कर सकेगा।
कैसे काम करता है Gemini Omni?
Gemini Omni एक मल्टीमोडल इंजन की तरह काम करता है। आसान भाषा में समझें तो यह अलग-अलग तरह के वीडियो या ऑडियो को पहले टेक्स्ट में नहीं बदलता। बल्कि उन सबको एक साथ सीधे तौर पर समझ लेता है। गूगल के अनुसार, इसके तीन मुख्य काम करने के तरीके हैं:
1. बोलकर या टाइप कर होगी वीडियो एडिट
अब आपको वीडियो एडिट करने के लिए किसी भारी-भरकम और मुश्किल सॉफ्टवेयर की जरूरत नहीं है। अब आप केवल अपनी आम भाषा में बोलकर या टाइप करके वीडियो एडिट कर सकते हैं। इस सिस्टम की सबसे बड़ी खूबी इसकी स्मार्ट मेमोरी है, जो आपकी पिछली बातों को याद रखती है।
इसके चलते, जब आप लगातार कई निर्देश देते हैं तो एआई वीडियो में कैरेक्टर, बैकग्राउंड और कैमरे के एंगल को पूरी तरह से सटीक और व्यवस्थित बनाए रखता है। आप इस टूल को वीडियो में किसी खास चीज को बदलने, बैकग्राउंड हटाने, नया कैरेक्टर जोड़ने या पूरे वीडियो का विजुअल स्टाइल बदलने का निर्देश दे सकते हैं। इसकी झलक गूगल के सीईओ सुंदर पिचाई ने Google I/O 2026 से पहले X पर साझा की थी। ये दर्शाता है कि वीडियो क्रिएशन का भविष्य कितना सरल होने वाला है।
2. मोशन के लिए लेता है भौतिकी की मदद
Gemini Omni केवल विजुअल पैटर्न की नकल नहीं करता, बल्कि यह किसी सीन के पीछे की भौतिकी को भी गहराई से समझता है। यह ग्रेविटी, फ्लुइड डायनेमिक्स और गति के नियमों की गणना करता है। इससे जनरेट किया गया मोशन बिल्कुल वास्तविक लगता है। इसके अलावा, यह अलग-अलग स्रोतों से मिली जानकारी को एक साथ जोड़ने में सक्षम है।
आप इसे एक कैरेक्टर की फोटो, किसी जगह का टेक्स्ट विवरण और किसी खास आर्ट स्टाइल वाला वीडियो क्लिप इनपुट के तौर पर दे सकते हैं और यह उन सभी संदर्भों को बड़ी कुशलता से मिश्रित करके एक बेहतरीन और यूनीफाइड वीडियो तैयार कर देता है।
3. अपना डिजिटल अवतार भी बना सकते हैं
Gemini Omni की एक रोमांचक क्षमता आपका अपना डिजिटल अवतार बनाना है, जो बिल्कुल आपकी तरह दिखेगा और आपकी आवाज में बात करेगा। हालांकि, डीपफेक और गलत जानकारी के बढ़ते खतरों के प्रति सचेत रहते हुए, गूगल ने इसके वॉयस-एडिटिंग फीचर्स को अभी आम जनता के लिए सीमित रखा है। ताकि इनकी पूरी तरह से टेस्टिंग की जा सके।
साथ ही, सुरक्षा के प्रति अपनी प्रतिबद्धता दिखाते हुए गूगल ने इसमें 'SynthID' तकनीक को शामिल किया है। इस एआई के जरिए जनरेट किए गए हर वीडियो में एक अदृश्य डिजिटल वाटरमार्क छिपा होता है। इसे इंसानी आंखें तो नहीं देख सकतीं, लेकिन गूगल सर्च या जेमिनी एप के जरिए यह आसानी से पता लगाया जा सकता है कि वीडियो एआई के जरिए बनाया गया है या असली है।
किसे मिलेगा ये फीचर?
गूगल इस हफ्ते से Gemini Omni Flash को अलग-अलग चरणों में रोलआउट करना शुरू कर रहा है। इसके तहत, Google AI Plus, Pro, या Ultra का सब्सक्रिप्शन लेने वाले प्रीमियम यूजर्स के लिए यह फीचर अभी से Gemini एप और Google Flow पर उपलब्ध हो गया है।
वहीं, आम यूज़र्स के लिए यह सेवा इसी हफ्ते YouTube Shorts और YouTube Create एप के जरिए पूरी तरह से मुफ्त में उपलब्ध करा दी जाएगी। इसके अतिरिक्त, आने वाले कुछ हफ्तों के भीतर यह तकनीक APIs के माध्यम से डेवलपर्स और कॉर्पोरेट ग्राहकों के लिए भी उपलब्ध हो जाएगी।