Revolution in der digitalen Bildbearbeitung 05.06.2023, 10:38 Uhr

KI-Bildbearbeitung: Macht DragGAN bald Photoshop Konkurrenz?

Künstliche Intelligenz erobert derzeit unsere Welt wie im Flug, auch in Sachen Bildbearbeitung sind enorme Fortschritte zu beobachten. Gerade wurde mit DragGAN ein Tool vorgestellt, dass die Nachbearbeitung von Fotos auf ein ganz neues Level heben könnte und das dazu noch ganz einfach zu bedienen ist.

DragGAN

DragGAN ermöglicht ein Ändern der Blickrichtung oder des Gesichtsausdrucks ganz einfach per Drag & Drop.

Foto: MPI-INF

Adobe Photoshop ist bislang das Maß aller Dinge, wenn es um die Bildbearbeitung geht. Allerdings kann die Nutzung von Photoshop für viele Benutzerinnen und Benutzer recht komplex sein. Das soll bei DragGAN anders sein. Die Software wurde von einem internationalen Forschungsteam unter der Leitung des Saarbrücker Max-Planck-Instituts für Informatik entwickelt. Durch den Einsatz von maschinellem Lernen eröffnet DragGAN völlig neue Möglichkeiten für die Bildbearbeitung. Diese Technologie verspricht eine benutzerfreundliche Anwendung und ermöglicht es Anwendern, ihre Fotos auf eine bisher unerreichte Weise zu bearbeiten.

Bildbearbeitung per Drag & Drop

Dank der Fortschritte in der künstlichen Intelligenz lassen sich mit Tools wie Dall-E, Midjourney und Stable Diffusion heute selbst die absurdesten Bildideen umsetzen. Früher musste man solche Ideen mühsam in Photoshop zusammenbasteln, doch nun erledigen diese Tools diese Aufgaben in Sekundenschnelle. Auch im Bereich der Bildbearbeitung haben KI-Algorithmen bereits seit einiger Zeit einen wertvollen Beitrag geleistet. Allerdings stoßen sie immer noch an gewisse Grenzen, insbesondere wenn es darum geht, ein fotografiertes Objekt aus einer völlig anderen Perspektive zu präsentieren oder einen Gesichtsausdruck zu verändern.

Top Stellenangebote

Zur Jobbörse
Bundesbau Baden-Württemberg-Firmenlogo
Versorgungstechnik-Ingenieure (m/w/d) Bundesbau Baden-Württemberg
Karlsruhe Zum Job 
Honda R&D Europe (Deutschland) GmbH-Firmenlogo
Entwicklungsingenieur (m/w/d) intelligente Energienetze und Smart Home Honda R&D Europe (Deutschland) GmbH
Offenbach am Main Zum Job 
Stadtwerke München GmbH-Firmenlogo
Fachkraft für Arbeitssicherheit (m/w/d) Stadtwerke München GmbH
München Zum Job 
Die Autobahn GmbH des Bundes-Firmenlogo
Ingenieur (w/m/d) Straßenplanung und Straßenentwurf Die Autobahn GmbH des Bundes
Dillenburg Zum Job 
Berliner Wasserbetriebe-Firmenlogo
Bauingenieur:in Maßnahmenentwicklung Netze (w/m/d) Berliner Wasserbetriebe
Deutsche Rentenversicherung Bund-Firmenlogo
lngenieur*in Elektrotechnik/ Starkstromtechnik (m/w/div) Deutsche Rentenversicherung Bund
IMS Messsysteme GmbH-Firmenlogo
Projektleiter (m/w/i) Vertrieb IMS Messsysteme GmbH
Heiligenhaus Zum Job 
Deutsche Rentenversicherung Bund-Firmenlogo
Projektingenieur*in für Versorgungstechnik (m/w/div) Deutsche Rentenversicherung Bund
HS Elektronik Systeme GmbH-Firmenlogo
Projekt Controller (m/w/d) HS Elektronik Systeme GmbH
Nördlingen Zum Job 
THU Technische Hochschule Ulm-Firmenlogo
W2-Professur "Ingenieurmathematik" THU Technische Hochschule Ulm
Die Autobahn GmbH des Bundes-Firmenlogo
Projektingenieur (w/m/d) Telematik-Infrastruktur (IT-Netz) Die Autobahn GmbH des Bundes
Frankfurt am Main Zum Job 
Deutsche Rentenversicherung Bund-Firmenlogo
Ingenieur*in Energieeffizienz technische Gebäudeausrüstung HLS (m/w/div) Deutsche Rentenversicherung Bund
Berliner Wasserbetriebe-Firmenlogo
Bauingenieur:in Bebauungsplan (w/m/d) Berliner Wasserbetriebe
Berliner Wasserbetriebe-Firmenlogo
Automatisierer:in / PLS-Techniker:in (w/m/d) Klärwerk Waßmannsdorf Berliner Wasserbetriebe
Schönefeld Zum Job 
Die Autobahn GmbH des Bundes-Firmenlogo
Bauingenieur / Wirtschaftsingenieur (m/w/d) Grundsätze im Bereich Straßenbetriebsdienst Die Autobahn GmbH des Bundes
Hitachi Energy-Firmenlogo
Projektmanager (w/m/d) Gasisolierte Schaltanlagen Hitachi Energy
Mannheim Zum Job 
Die Autobahn GmbH des Bundes-Firmenlogo
Bauingenieur Streckenplanung (w/m/d) Die Autobahn GmbH des Bundes
Regensburg Zum Job 
Die Autobahn GmbH des Bundes-Firmenlogo
Bauingenieur:in / Verkehrsingenieur:in als IT-Fachanwendungs-Produktgruppenleitung (m/w/d) Planung Die Autobahn GmbH des Bundes
Berlin, deutschlandweit Zum Job 
iba AG-Firmenlogo
Systemarchitekt Cloud-basierte Speicherung im technischen Produktmanagement (m/w/d) iba AG
Die Autobahn GmbH des Bundes-Firmenlogo
Bauingenieur:in / Verkehrsingenieur:in als IT-Fachanwendungs-Produktgruppenleitung (m/w/d) Bau Die Autobahn GmbH des Bundes
Berlin, deutschlandweit Zum Job 

Zukünftig wird es wahrscheimlich möglich sein, komplexe Bildbearbeitungsaufgaben mithilfe einer einfachen Drag & Drop-Funktion und ein paar Mausbewegungen zu erledigen. Dies ist zumindest das vielversprechende Vorhaben von Wissenschaftlerinnen und Wissenschaftlern des Max-Planck-Instituts für Informatik, des Saarbrücken Research Center for Visual Computing, Interaction and Artificial Intelligence, des MIT und der Universität Pennsylvania. Durch ihre Forschung und Entwicklung arbeiten sie daran, eine benutzerfreundliche Lösung zu schaffen, die es Anwendern ermöglicht, Bilder auf intuitive und zeitsparende Weise zu bearbeiten.

Bildbearbeitungen, die mithilfe der Methode DragGAN

Verschiedene Bildbearbeitungen, die mithilfe der Methode DragGAN durchgeführt wurden.

Foto: MPI-INF

Neue Methode hat das Zeug, die digitale Bildbearbeitung für immer zu verändern

„Mit ‚DragGAN‘ entwickeln wir derzeit ein Werkzeug, dass es dank einer übersichtlichen Nutzeroberfläche auch Laien ermöglicht, komplexe Bildbearbeitungen vorzunehmen. Sie müssen nur die Stellen im Foto markieren, die sie verändern möchten. Dann geben sie in einem Menü an, welcher Art die Veränderung sein soll – und mit nur wenigen Mausklicks kann jeder Laie dank KI-Unterstützung die Pose, den Gesichtsausdruck, die Blickrichtung oder den Blickwinkel auf einem Foto, beispielsweise von einem Haustier, anpassen“, erklärt Christian Theobalt, geschäftsführender Direktor des Max-Planck-Instituts für Informatik, Direktor des Saarbrücken Research Center for Visual Computing, Interaction, and Artifical Intelligence und Professor an der Universität des Saarlandes am Saarland Informatics Campus.

Möglich wird das alles durch Künstliche Intelligenz, genauer gesagt durch GANs, das steht für  „Generative Adversarial Networks“. „Wie der Name sagt, handelt es sich bei GANs um generative Modelle, also solche, die neue Inhalte wie Bilder synthetisieren können. ‚Adversarial‘ zeigt an, dass es sich um ein KI-Modell handelt, in dem zwei Netzwerke gegeneinander spielen“, erklärt der Erstautor des Papers, Xingang Pan, Postdoktorand am Max-Planck-Institut für Informatik und am Saarbrücker VIA-Center.

Wie funktionierten GANs?

GANs bestehen aus einem Generator, der Bilder erzeugt, und einem Discriminator, der entscheidet, ob die Bilder vom Generator oder echt sind. Dieses System wird trainiert, bis der Discriminator keine Unterscheidung mehr treffen kann.

Die Anwendungsmöglichkeiten sind vielfältig: Neben der offensichtlichen Verwendung des Generators zur Bildgenerierung sind GANs auch gut darin, Bilder vorherzusagen. Ein Beispiel dafür ist die Video-Frame-Prediction, bei der das nächste Bild eines Videos prognostiziert wird, um den Datenbedarf beim Videostreaming zu reduzieren. Darüber hinaus können GANs niedrig aufgelöste Bilder hochskalieren und die Bildqualität verbessern, indem sie die Position der zusätzlichen Pixel in den neuen Bildern vorhersagen. Dies ermöglicht eine Verbesserung der Bildschärfe und Details.

„In unserem Fall erweist sich diese Eigenschaft von GANs als vorteilhaft, wenn in einem Bild zum Beispiel die Blickrichtung eines Hundes geändert werden soll. Das GAN berechnet dann im Grunde das ganze Bild neu und antizipiert, wo welches Pixel im Bild mit der neuen Blickrichtung landen muss. Ein Nebeneffekt davon ist, dass DragGAN auch Dinge berechnen kann, die vorher etwa durch die Kopfposition des Hundes verdeckt waren. Oder wenn der Nutzer die Zähne des Hundes darstellen will, kann er dem Hund auf dem Bild die Schnauze öffnen“, erklärt Xingang Pan.

Einsatz im privaten und professionellen Kontext

Mit DragGAN lassen sich nicht nur private Schnappschüsse nachbearbeiten, es könnte auch im professionellen Kontext genutzt werden. Modedesigner könnten in Zukunft mit der Software den Zuschnitt von Kleidungsstücken auf Fotos nachträglich anpassen. Ebenso könnten Fahrzeughersteller mithilfe weniger Mausklicks verschiedene Design-Konfigurationen für geplante Fahrzeuge ausprobieren.

Hier wird Ihnen ein externer Inhalt von youtube.com angezeigt.

Mit der Nutzung des Inhalts stimmen Sie der Datenschutzerklärung von youtube.com zu.

DragGAN ist in der Lage, verschiedene Objektkategorien wie Tiere, Autos, Menschen und Landschaften zu bearbeiten. Bisher wurden die meisten Ergebnisse jedoch mit GAN-generierten, synthetischen Bildern erzielt. Es besteht jedoch das Potenzial, DragGAN auf reale Fotos auszudehnen und somit eine breitere Anwendungspalette zu ermöglichen.

Ist das der nächste große Schritt in der KI-gestützten Bildbearbeitung?

Das kürzlich von den Saarbrücker Informatikern entwickelte Tool hat innerhalb weniger Tage nach Veröffentlichung des Preprints in der internationalen Tech-Community viel Aufmerksamkeit erregt. Es wird von vielen als der nächste große Schritt in der KI-gestützten Bildbearbeitung angesehen. Während Tools wie Midjourney dazu dienen, neue Bilder zu erstellen, erleichtert DragGAN die Nachbearbeitung von Bildern erheblich.

Die Autoren des Papers mit dem Titel „Drag Your GAN: Interactive Pointbased Manipulation on the Generative Image Manifold“ sind neben Professor Christian Theobalt und Xingang Pan auch Thomas Leimkühler (MPI INF), Lingjie Liu (MPI INF und University of Pennsylvania), Abhimitra Meka (Google) und Ayush Tewari (MIT CSAIL). Das Paper wurde von der ACM SIGGRAPH-Konferenz akzeptiert, der weltweit größten Fachkonferenz für Computergrafik und interaktive Technologien, die vom 6. bis 10. August 2023 in Los Angeles stattfinden wird. Dadurch erhält das Projekt eine wertvolle Plattform, um die Ergebnisse der Forschung einem breiten Fachpublikum zu präsentieren.

Ein Beitrag von:

  • Dominik Hochwarth

    Content Manager im VDI Verlag. Nach dem Studium machte er eine Ausbildung zum Online-Redakteur, es folgten ein Volontariat und jeweils 10 Jahre als Webtexter für eine Internetagentur und einen Onlinshop. Seit September 2022 schreibt er für ingenieur.de.

Zu unseren Newslettern anmelden

Das Wichtigste immer im Blick: Mit unseren beiden Newslettern verpassen Sie keine News mehr aus der schönen neuen Technikwelt und erhalten Karrieretipps rund um Jobsuche & Bewerbung. Sie begeistert ein Thema mehr als das andere? Dann wählen Sie einfach Ihren kostenfreien Favoriten.