17 LLMs für Spezialdomänen
Spezialisierte LLMs können (für die richtigen Menschen) zu Kraftmultiplikatoren werden.Chaosamran_Studio | shutterstock.com
Die Zeiten, in denen Large Language Models (LLMs) für offene Münder sorgten, einfach nur weil sie ganze Sätze generieren, sind längst vorbei. Inzwischen liegt der Fokus vor allem darauf, KI-Modellen tiefgehendes Fachwissen „beizubringen“. Der beste Weg, um das zu erreichen, ist Spezialisierung: Anstatt ein „One-Size-Fits-All“-Modell zu entwickeln, wird gezielt ein spezialisiertes für Fachgebiete aufgebaut – etwa die Medizin, das Rechts- oder das Bankwesen.
Dieser Trend zur Spezialisierung wird ebenso sehr von Effizienz wie von Qualität getrieben: Fokussierte KI-Modelle verursachen geringere Betriebskosten – und auch ihr Training kann sich weniger kostenintensiv gestalten, zumindest wenn ein solider Korpus an Trainingsdaten vorhanden ist. Das ist eine Herausforderung für sich, der nicht wenige Teams damit begegnen, dedizierte Experten an Bord zu holen, um Ontologien aufzubauen und Antworten doppelt zu überprüfen. Und das aus gutem Grund: Bei generalistischen (Consumer-)LLMs sind ein paar Halluzinationen unter Umständen noch verschmerzbar – wenn es um medizinische oder rechtliche Fragen geht, ist das nicht akzeptabel.
In diesem Artikel stellen wir Ihnen 17 interessante LLM-Optionen vor, die sich besonders gut für ganz spezifische Aufgabenbereiche eignen.
BioGPT
Microsoft hat BioGPT entwickelt, indem es ein Transformer-Modell auf Basis der GPT-2-Architektur mit Millionen von PubMed-Zusammenfassungen trainiert hat. Das Ziel war es, ein generatives Tool zu schaffen, das fundierte und verständliche Antworten auf Fragen im Bereich Biomedizin liefern kann.
Inzwischen wurden auch erweiterte Versionen des LLM entwickelt – etwa BioGPT-Large und BioGPT-Large-PubMedQA. Diese liefern noch bessere Outputs, allerdings auf Kosten einer vier- bis fünffachen Erhöhung der Parameterzahl.
BioMistral
Das Mistral-Team hat auf Grundlage seines Mistral 7B Instruct v0.1-Grundmodells BioMistral entwickelt. Da das Grundmodell darauf ausgelegt ist, Anweisungen zu befolgen, eignet es sich besonders gut, um bei Standard-Tasks zu unterstützen – etwa Zusammenfassungen zu generieren.
Die Mehrsprachigkeit des Basismodells eröffnet zudem globale Möglichkeiten. 4-Bit- und 8-Bit-Versionen realisieren zudem den Einsatz bei Deployments mit eingeschränkten Ressourcen. Mistral bietet zudem mehrere experimentelle Versionen des LLMs (DARE, TIES und SLERP) an, die mithilfe verschiedener Algorithmen entwickelt wurden, um neue medizinische Informationen einzubinden.
BloombergGPT
Investoren und Trader, die ein Bloomberg-Abo besitzen, können auch BloombergGPT befragen.
Das KI-Finanzmodell mit 50 Milliarden Parametern wurde auf der umfangreichen Dokumentensammlung des Unternehmens trainiert, die über gut eine halbe Dekade zusammengestellt wurde.
ChatGPT Health
OpenAI hat ChatGPT Health entwickelt, um Patienten ein Tool an die Hand zu geben, das dabei unterstützen kann, sich auf Arzttermine vorzubereiten und Diagnosen zu interpretieren. Darüber hinaus beantwortet dieses LLM auch einige allgemeine Fragen, etwa zur Nutzung von Gesundheits-Apps wie Apple Health.
Neben dem Zweck, medizinische Informationen zu liefern wurde das Modell auch mit dem Ziel entwickelt, sich leicht in andere Softwarelösungen integrieren zu lassen. Laut OpenAI steht der Datenschutz dabei im Vordergrund. Nichtsdestotrotz ist es (unter anderem) für Deutschland derzeit noch nicht freigegeben.
ClimateBERT
ClimateBERT wurde mit klimabezogenen Texten, Forschungsarbeiten und Berichten von Unternehmen vortrainiert. Dieses LLM ermöglicht es den Benutzern, Absätze in Texten zu finden und zu analysieren, in denen klimarelevante Themen diskutiert werden.
Das Modell ist nicht nur dazu in der Lage, diese Diskussionen zu lokalisieren, sondern auch deren Sentiment zu klassifizieren.
COiN
JP Morgan Chase hat das COiN-Modell entwickelt, um die verschiedenen Geschäftsdokumente zu analysieren, die die Beziehungen zu seinen Kunden und Partnern regeln. Der Fokus lag dabei vor allem auf den im Vertragsrecht üblichen sprachlichen Strukturen. Damit kann das LLM verschiedenen Dokumente auf rechtliche Schwachstellen analysieren.
Schätzungen zufolge kann dieses KI-Modell einer Rechtsabteilung 30 Prozent Zeit einsparen und Vertragsverhandlungen beschleunigen. Anmerkung: JP Morgan verfügt auch über einen Krypto-Token namens COIN, der jedoch nicht mit dem LLM in Verbindung steht.
CyLens
Ein Team von Wissenschaftlern hat CyLens entwickelt, um Security-Profis dabei zu unterstützen, Cyber Threats zu bekämpfen.
Dazu haben die Macher mehrere hunderttausend Threat Reports zu einem Trainingsdatensatz zusammengefasst. Dadurch ist das LLM etwa in der Lage, Bedrohungen zu attribuieren oder Angriffskampagnen zu analysieren.
DeepSeek-R1 Legal
Diverse Benutzer haben das Grundmodell von DeepSeek mit verschiedenen juristischen Dokumenten feinabgestimmt und das Ergebnis anschließend quantisiert.
Dabei war die Zielsetzung, das „Chain-of-Thought“-Modell klein genug zu halten, um es lokal betreiben zu können – etwa in Anwaltskanzleien.
Earth-2
Die Earth-2-LLMs wurden von Nvidia entwickelt, um multivariable Wettervorhersagen zu realisieren oder atmosphärische Bedingungen auf Stadtebene zu simulieren – inklusive einer Visualisierung die dem Ruf Nvidia als Grafik-Krösus gerecht wird.
Zum „Paket“ gehören mehrere verschiedene Modelle, die entweder auf unmittelbare Vorhersagen (Earth-2 Nowcasting) oder auf längerfristige globale Prognosen (Earth-2 Medium Range) abgestimmt sind.
FinGPT
Das Team der AI4Finance Foundation hat FinGPT als Open-Source-Alternative für alle entwickelt, die Antworten auf Fragen zur Unternehmensfinanzierung und zu den Wertpapiermärkten benötigen.
Insofern ist dieses LLM darauf optimiert, die historische Wertentwicklung von Aktien zu analysieren – und Prognosen für die nahe Zukunft zu erstellen. Das Tool ist nur eines von vielen, die von der AI4Finance Foundation entwickelt wurden.
GNoME
Die Idee hinter GNoME (kurz für „Graph Networks for Materials Exploration“) besteht darin, das menschliche Wissen über Moleküle und Kristallstrukturen zu organisieren. Das soll es Wissenschaftlern und Ingenieuren erleichtern, das richtige Material für eine spezifische Aufgabe zu finden.
Hierbei handelt sich nicht um ein LLM im eigentlichen Sinn, sondern um ein „Graph Neural Network“, das auf Tausenden bekannter Molekülstrukturen trainiert wurde.
MedGemma
Diese Open-Weight-Modelle von Google sollen dabei unterstützen, medizinische Bilder und Texte in Krankenakten zu entschlüsseln. Bilddaten von Röntgenaufnahmen oder höherdimensionalen Quellen wie CT-Scans können ebenfalls ausgewertet werden.
Die Modelle können als nützliche Bausteine für die Forschung oder für komplexere KI-Pipelines fungieren. Sie stehen auch über Google Cloud sowie über Hugging Face und andere Open-Weight-Repositories zur Verfügung.
Meditron-70B
Das Team der École Polytechnique Fédérale de Lausanne hat dieses medizinische Open-Weight-LLM entwickelt, das auf Llama-2-70B aufbaut. Der Trainingsdatensatz für das Modell wurde auf Basis von PubMed-Artikeln und -Abstracts sowie einigen standardmäßigen, klinischen Guidelines zusammengestellt
Die Zielsetzung war dabei ein Modell, das viele Standardfragen aus der medizinischen Ausbildung beantworten und gleichzeitig Ärzte unterstützen kann, die sich tiefgehender mit einer Diagnose auseinandersetzen müssen.
Med-PaLM
Med-PaLM wurde von Google mit einer speziellen Architektur entwickelt. Diese ist darauf optimiert, präzise Antworten zu liefern, auf die sich Ärzte verlassen können. Das auf dem Transformer-Modell basierende System wird in allen Phasen des Datenverarbeitungsprozesses so abgestimmt, dass die Genauigkeit im Vordergrund steht und gleichzeitig das Risiko für unzureichende Outputs minimiert wird.
Im Ergebnis hat dieses LLM hervorragende Ergebnisse bei umfassenden Tests seines klinischen Wissens sowie bei Messungen der Widerstandsfähigkeit gegenüber Adversarial-Angriffen geliefert. Google vertreibt dieses Modell zwar nicht, vermarktet es jedoch als Teil der MedLM-Modellfamilie für Gesundheitsdienstleister.
OpenDAC
Das OpenDAC-Modell wurde von Wissenschaftlern entwickelt, die sich mit Projekten zur Eindämmung des Klimawandels beschäftigen. Das Ziel dabei war es, ein Modell zu entwickeln, das bei der Suche nach den besten Chemikalien zur Absorption von CO2 helfen kann.
Dabei handelt es sich um eine sehr spezifische Herausforderung, die jedoch ein großes Problem darstellt. Denn diese Chemikalien müssen sowohl wirtschaftlich vertretbar als auch effektiv sein.
Sec-PaLM 2
Google hat sein PaLM-2-Modell mit einer Sammlung von Dokumenten trainiert, die Beispiele für Sicherheitsbedrohungen und schadhaften Code sind.
So ist das Sec-PaLM-2-LLM in der Lage, Sicherheitsprobleme in natürlicher Sprache mit jedem zu „besprechen“, der Fragen zu Anomalien in Logdateien oder E-Mail-Anhängen haben könnte. Das Unternehmen integriert das Modell in andere Google-Produkte wie die Vertex AI Workbench oder das Gemini Security Command Center.
WiseYield
Diese KI-gestützte Prognose-Engine unterstützt Landwirte bei der Entscheidung, wann der beste Zeitpunkt ist, um Saatgut auszubringen – oder zu ernten.
Dazu stützt sich das LLM auf Wettervorhersagen sowie historische Daten. (fm)
Dieser Artikel ist im Original bei unserer Schwesterpublikation Infoworld.com erschienen.
Hier finden Sie den kompletten Artikel: