Revolution in der digitalen Bildbearbeitung 05.06.2023, 10:38 Uhr

KI-Bildbearbeitung: Macht DragGAN bald Photoshop Konkurrenz?

Künstliche Intelligenz erobert derzeit unsere Welt wie im Flug, auch in Sachen Bildbearbeitung sind enorme Fortschritte zu beobachten. Gerade wurde mit DragGAN ein Tool vorgestellt, dass die Nachbearbeitung von Fotos auf ein ganz neues Level heben könnte und das dazu noch ganz einfach zu bedienen ist.

DragGAN

DragGAN ermöglicht ein Ändern der Blickrichtung oder des Gesichtsausdrucks ganz einfach per Drag & Drop.

Foto: MPI-INF

Adobe Photoshop ist bislang das Maß aller Dinge, wenn es um die Bildbearbeitung geht. Allerdings kann die Nutzung von Photoshop für viele Benutzerinnen und Benutzer recht komplex sein. Das soll bei DragGAN anders sein. Die Software wurde von einem internationalen Forschungsteam unter der Leitung des Saarbrücker Max-Planck-Instituts für Informatik entwickelt. Durch den Einsatz von maschinellem Lernen eröffnet DragGAN völlig neue Möglichkeiten für die Bildbearbeitung. Diese Technologie verspricht eine benutzerfreundliche Anwendung und ermöglicht es Anwendern, ihre Fotos auf eine bisher unerreichte Weise zu bearbeiten.

Bildbearbeitung per Drag & Drop

Dank der Fortschritte in der künstlichen Intelligenz lassen sich mit Tools wie Dall-E, Midjourney und Stable Diffusion heute selbst die absurdesten Bildideen umsetzen. Früher musste man solche Ideen mühsam in Photoshop zusammenbasteln, doch nun erledigen diese Tools diese Aufgaben in Sekundenschnelle. Auch im Bereich der Bildbearbeitung haben KI-Algorithmen bereits seit einiger Zeit einen wertvollen Beitrag geleistet. Allerdings stoßen sie immer noch an gewisse Grenzen, insbesondere wenn es darum geht, ein fotografiertes Objekt aus einer völlig anderen Perspektive zu präsentieren oder einen Gesichtsausdruck zu verändern.

Top Stellenangebote

Zur Jobbörse
Stadtbetrieb Wetter (Ruhr)-Firmenlogo
Bauingenieur/in (m/w/d) Fachrichtung Tiefbau / Straßenbau Stadtbetrieb Wetter (Ruhr)
Wetter (Ruhr) Zum Job 
Stadtwerke München GmbH-Firmenlogo
Brandschutzbeauftragte*r mit Zusatzfunktionen Tram (m/w/d) Stadtwerke München GmbH
München Zum Job 
Die Autobahn GmbH des Bundes-Firmenlogo
Planungsingenieur (w/m/d) Streckenplanung Die Autobahn GmbH des Bundes
Uwe Wenzel WW-Personalkonzepte e.K.-Firmenlogo
Entwicklungsingenieur (m/w/d) Wärmepumpensysteme und Regelungen Uwe Wenzel WW-Personalkonzepte e.K.
Großraum Hamburg Zum Job 
Landeshauptstadt München-Firmenlogo
Verkehrsingenieur*innen für die Verkehrswende (w/m/d) Landeshauptstadt München
München Zum Job 
Framatome-Firmenlogo
Ingenieur (m/w/d) für nukleare Entsorgung Framatome
Karlstein am Main, Erlangen Zum Job 
Die Autobahn GmbH des Bundes-Firmenlogo
Bauingenieur als Bauwerksprüfer (w/m/d) Die Autobahn GmbH des Bundes
Berliner Stadtreinigungsbetriebe (BSR)-Firmenlogo
Projektingenieurin / Projektingenieur (w/m/d) Verfahrenstechnik Berliner Stadtreinigungsbetriebe (BSR)
Technische Universität Graz-Firmenlogo
Universitätsprofessur für Nachhaltige Antriebssysteme und angewandte Thermodynamik (m/w/d) Technische Universität Graz
Graz (Österreich) Zum Job 
Berliner Stadtreinigungsbetriebe (BSR)-Firmenlogo
Projektingenieurin / Projektingenieur (w/m/d) Elektrotechnik Berliner Stadtreinigungsbetriebe (BSR)
Lübeck Zum Job 
Die Autobahn GmbH des Bundes-Firmenlogo
(Umwelt-)Ingenieur (w/m/d) für Boden, Abfall, Altlasten und Georisiken Die Autobahn GmbH des Bundes
Nürnberg Zum Job 
Fuest Familienstiftung-Firmenlogo
Bauzeichner, Bautechniker oder Innenarchitekt (m/w/d) Fuest Familienstiftung
Timm Technology GmbH-Firmenlogo
Sales Manager / Vertriebsingenieur (m/w/d) Timm Technology GmbH
Reinbek Zum Job 
Caljan GmbH-Firmenlogo
Maschinenbauingenieur / Konstrukteur Sondermaschinenbau (m/w/d) Caljan GmbH
Halle (Westfalen) Zum Job 
Stadtwerke München GmbH-Firmenlogo
(Senior) Projektmanager*in Niederspannung (m/w/d) Stadtwerke München GmbH
München Zum Job 
DFS Deutsche Flugsicherung GmbH-Firmenlogo
Ingenieur* Produktmanagement für Navigationsdienste DFS Deutsche Flugsicherung GmbH
Langen (Hessen) Zum Job 
VAHLE-Firmenlogo
Ingenieur Automatisierungs- und Steuerungstechnik (m/w/d) VAHLE
Kamen, Großraum Dortmund Zum Job 
Grünecker Patent- und Rechtsanwälte PartG mbB-Firmenlogo
Patentingenieur (m/w/d) der Fachrichtung Physik und/oder Elektrotechnik mit der Möglichkeit zur Ausbildung zum "European Patent Attorney (m/w/d/)" Grünecker Patent- und Rechtsanwälte PartG mbB
München Zum Job 
DFS Deutsche Flugsicherung GmbH-Firmenlogo
Flugsicherungsingenieur (w/m/d) DFS Deutsche Flugsicherung GmbH
Grünecker Patent- und Rechtsanwälte PartG mbB-Firmenlogo
Europäischer Patentanwalt (m/w/d) der Fachrichtung Physik, Informatik, Elektrotechnik oder Nachrichtentechnik Grünecker Patent- und Rechtsanwälte PartG mbB
München Zum Job 

Zukünftig wird es wahrscheimlich möglich sein, komplexe Bildbearbeitungsaufgaben mithilfe einer einfachen Drag & Drop-Funktion und ein paar Mausbewegungen zu erledigen. Dies ist zumindest das vielversprechende Vorhaben von Wissenschaftlerinnen und Wissenschaftlern des Max-Planck-Instituts für Informatik, des Saarbrücken Research Center for Visual Computing, Interaction and Artificial Intelligence, des MIT und der Universität Pennsylvania. Durch ihre Forschung und Entwicklung arbeiten sie daran, eine benutzerfreundliche Lösung zu schaffen, die es Anwendern ermöglicht, Bilder auf intuitive und zeitsparende Weise zu bearbeiten.

Bildbearbeitungen, die mithilfe der Methode DragGAN

Verschiedene Bildbearbeitungen, die mithilfe der Methode DragGAN durchgeführt wurden.

Foto: MPI-INF

Neue Methode hat das Zeug, die digitale Bildbearbeitung für immer zu verändern

„Mit ‚DragGAN‘ entwickeln wir derzeit ein Werkzeug, dass es dank einer übersichtlichen Nutzeroberfläche auch Laien ermöglicht, komplexe Bildbearbeitungen vorzunehmen. Sie müssen nur die Stellen im Foto markieren, die sie verändern möchten. Dann geben sie in einem Menü an, welcher Art die Veränderung sein soll – und mit nur wenigen Mausklicks kann jeder Laie dank KI-Unterstützung die Pose, den Gesichtsausdruck, die Blickrichtung oder den Blickwinkel auf einem Foto, beispielsweise von einem Haustier, anpassen“, erklärt Christian Theobalt, geschäftsführender Direktor des Max-Planck-Instituts für Informatik, Direktor des Saarbrücken Research Center for Visual Computing, Interaction, and Artifical Intelligence und Professor an der Universität des Saarlandes am Saarland Informatics Campus.

Möglich wird das alles durch Künstliche Intelligenz, genauer gesagt durch GANs, das steht für  „Generative Adversarial Networks“. „Wie der Name sagt, handelt es sich bei GANs um generative Modelle, also solche, die neue Inhalte wie Bilder synthetisieren können. ‚Adversarial‘ zeigt an, dass es sich um ein KI-Modell handelt, in dem zwei Netzwerke gegeneinander spielen“, erklärt der Erstautor des Papers, Xingang Pan, Postdoktorand am Max-Planck-Institut für Informatik und am Saarbrücker VIA-Center.

Wie funktionierten GANs?

GANs bestehen aus einem Generator, der Bilder erzeugt, und einem Discriminator, der entscheidet, ob die Bilder vom Generator oder echt sind. Dieses System wird trainiert, bis der Discriminator keine Unterscheidung mehr treffen kann.

Die Anwendungsmöglichkeiten sind vielfältig: Neben der offensichtlichen Verwendung des Generators zur Bildgenerierung sind GANs auch gut darin, Bilder vorherzusagen. Ein Beispiel dafür ist die Video-Frame-Prediction, bei der das nächste Bild eines Videos prognostiziert wird, um den Datenbedarf beim Videostreaming zu reduzieren. Darüber hinaus können GANs niedrig aufgelöste Bilder hochskalieren und die Bildqualität verbessern, indem sie die Position der zusätzlichen Pixel in den neuen Bildern vorhersagen. Dies ermöglicht eine Verbesserung der Bildschärfe und Details.

„In unserem Fall erweist sich diese Eigenschaft von GANs als vorteilhaft, wenn in einem Bild zum Beispiel die Blickrichtung eines Hundes geändert werden soll. Das GAN berechnet dann im Grunde das ganze Bild neu und antizipiert, wo welches Pixel im Bild mit der neuen Blickrichtung landen muss. Ein Nebeneffekt davon ist, dass DragGAN auch Dinge berechnen kann, die vorher etwa durch die Kopfposition des Hundes verdeckt waren. Oder wenn der Nutzer die Zähne des Hundes darstellen will, kann er dem Hund auf dem Bild die Schnauze öffnen“, erklärt Xingang Pan.

Einsatz im privaten und professionellen Kontext

Mit DragGAN lassen sich nicht nur private Schnappschüsse nachbearbeiten, es könnte auch im professionellen Kontext genutzt werden. Modedesigner könnten in Zukunft mit der Software den Zuschnitt von Kleidungsstücken auf Fotos nachträglich anpassen. Ebenso könnten Fahrzeughersteller mithilfe weniger Mausklicks verschiedene Design-Konfigurationen für geplante Fahrzeuge ausprobieren.

Hier wird Ihnen ein externer Inhalt von youtube.com angezeigt.

Mit der Nutzung des Inhalts stimmen Sie der Datenschutzerklärung von youtube.com zu.

DragGAN ist in der Lage, verschiedene Objektkategorien wie Tiere, Autos, Menschen und Landschaften zu bearbeiten. Bisher wurden die meisten Ergebnisse jedoch mit GAN-generierten, synthetischen Bildern erzielt. Es besteht jedoch das Potenzial, DragGAN auf reale Fotos auszudehnen und somit eine breitere Anwendungspalette zu ermöglichen.

Ist das der nächste große Schritt in der KI-gestützten Bildbearbeitung?

Das kürzlich von den Saarbrücker Informatikern entwickelte Tool hat innerhalb weniger Tage nach Veröffentlichung des Preprints in der internationalen Tech-Community viel Aufmerksamkeit erregt. Es wird von vielen als der nächste große Schritt in der KI-gestützten Bildbearbeitung angesehen. Während Tools wie Midjourney dazu dienen, neue Bilder zu erstellen, erleichtert DragGAN die Nachbearbeitung von Bildern erheblich.

Die Autoren des Papers mit dem Titel „Drag Your GAN: Interactive Pointbased Manipulation on the Generative Image Manifold“ sind neben Professor Christian Theobalt und Xingang Pan auch Thomas Leimkühler (MPI INF), Lingjie Liu (MPI INF und University of Pennsylvania), Abhimitra Meka (Google) und Ayush Tewari (MIT CSAIL). Das Paper wurde von der ACM SIGGRAPH-Konferenz akzeptiert, der weltweit größten Fachkonferenz für Computergrafik und interaktive Technologien, die vom 6. bis 10. August 2023 in Los Angeles stattfinden wird. Dadurch erhält das Projekt eine wertvolle Plattform, um die Ergebnisse der Forschung einem breiten Fachpublikum zu präsentieren.

Ein Beitrag von:

  • Dominik Hochwarth

    Redakteur beim VDI Verlag. Nach dem Studium absolvierte er eine Ausbildung zum Online-Redakteur, es folgten ein Volontariat und jeweils 10 Jahre als Webtexter für eine Internetagentur und einen Onlineshop. Seit September 2022 schreibt er für ingenieur.de.

Zu unseren Newslettern anmelden

Das Wichtigste immer im Blick: Mit unseren beiden Newslettern verpassen Sie keine News mehr aus der schönen neuen Technikwelt und erhalten Karrieretipps rund um Jobsuche & Bewerbung. Sie begeistert ein Thema mehr als das andere? Dann wählen Sie einfach Ihren kostenfreien Favoriten.