בשבוע האחרון התעמקתי ב"ננו בננה", מודל בינה מלאכותית שזמין ב-LM Arena, Gemini ובפלטפורמות נוספות. זה לא עוד מודל שמייצר תמונות מאפס, אלא מודל שמתמחה בעריכה מדויקת של תמונות קיימות לפי הוראות טקסט. עד לפני כמה ימים לא היה ברור מי עומד מאחורי המודל הזה, היו שמועות שהוא קשור לגוגל אבל לא היה שם רשמי מאחוריו. לאחרונה המודל נכנס לשימוש רישמי בכלים של גוגל ובדקתי אותו לעומק כדי לראות אם הוא באמת עומד בהבטחות. ספויילר: התוצאות היו מרשימות.
ראיתי כבר מודלים של עריכה בעבר, מה כל כל מיוחד בו?
הבסיס לכל מודל כזה הוא שימוש ברשתות נוירונים, מעין מערכת מחשב שמזהה דפוסים בתמונות, קצת כמו שהמוח שלנו מבין מה הוא רואה. כשמעלים תמונה וכותבים מה לשנות, כמו להחליף צבע של חולצה, הוא מפרק את התמונה לפיקסלים, שהם הנקודות הקטנות שמרכיבות אותה, ומשנה רק את מה שצריך. הבעיה העיקרית עם כלים כאלה היום היא שלמרות שהתוצאה שהם נותנים טובה,הם עדיין עושים שינויים לא נחוצים בתמונה כמו עיוותים קלים בפרצופים, שינויים קומפוזיציה וכו'.
דוגמאות לעריכות שנוצרו במודל. החלפת תאורה או סגנון עיצובידוגמאות לעריכות שנוצרו במודל. צביעת תמונות ויצירת שינוייםדוגמאות לעריכות שנוצרו במודל. שינוי מזג אויר או שעה ביום
איך משתמשים במודל החדש וכמה זה עולה?
ב-LM Arena, ננו בננה זמין בחינם להתנסות, מה שהופך אותו לנגיש לכולם. יש מגבלה על מספר הבקשות היומיות כדי לא להעמיס על השרתים, אבל זה מספיק כדי לבדוק אותו לעומק. בנוסף הכלי זמין גם בתוך Gemini וגם בתוך Google AI Studio.
נכון לעכשיו, ננו בננה נחשב לאחד המודלים המתקדמים ביותר בעולם לעריכת תמונות באמצעות בינה מלאכותית. המערכת מאפשרת רמת שליטה גבוהה מאוד בפרטים הקטנים, כך שניתן לבצע שינויים מורכבים בקלות יחסית, מבלי לאבד את האותנטיות והמראה הטבעי של התמונה.
בבדיקות שביצעתי, ברוב הבקשות קיבלתי תוצאות מדויקות ומרשימות במיוחד תוך שניות ספורות, החל מהוספה או הסרה של אובייקטים, דרך שיפור איכות התמונה ורמת הפירוט, ועד ליצירת וריאציות חדשות לחלוטין שמרגישות מציאותיות.