Beobachtetes Signal · 7. März 2024 · Research Report · Quelle: Trending Topics · Relevanz: 2/5 · Sentiment: Neutral
Claude-3 übertrifft ChatGPT-4 mit IQ von 101 in KI-Test
Der Blogger Maxim Lott hat aktuelle KI-Modelle einem IQ-Test unterzogen, der auf einer verbalen Übersetzung des norwegischen Mensa-IQ-Tests mit 35 matrizioiden Fragen basiert und primär logisches Denken bewertet. Anthropics Claude-3 erreichte dabei einen IQ von 101 und ist damit die erste künstliche Intelligenz, die den menschlichen Durchschnitts-IQ von 100 übertrifft. Damit schlug das Modell OpenAIs ChatGPT-4, das einen Wert von 85 erzielte. Microsofts Bing Copilot erreichte 79, während Googles Gemini bei 77,5 und Gemini Advanced bei 77 lagen. Die Ergebnisse verdeutlichen die rasante Entwicklung über verschiedene Modellgenerationen hinweg, wobei sich Anthropic kontinuierlich von Claude-1 mit einem IQ von 64 über Claude-2 mit 82 bis hin zu Claude-3 steigern konnte. Lott prognostiziert, dass das kommende Claude-Modell innerhalb der nächsten 12 bis 16 Monate einen IQ von 120 erreichen könnte.
Das IQ-Benchmark-Ranking liefert wertvolle Einblicke in die Leistungsfähigkeit von Large Language Models, die zunehmend die Automatisierung in AdTech und MarTech antreiben, stellt jedoch primär eine verbrauchernahe Nischenstudie statt eines marktumwälzenden Ereignisses dar.
Marktsignale zu Anthropic in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Anthropics Claude-3 erreichte in einem verbalen Mensa-basierten Test einen IQ von 101 und knackte als erste KI die menschliche Durchschnittsmarke von 100.
- OpenAIs ChatGPT-4 erzielte im selben Test einen IQ-Wert von 85.
- Microsofts Bing Copilot erreichte einen Wert von 79, Googles Gemini landete bei 77,5.
- Blogger Maxim Lott entwickelte den Test durch verbale Übersetzung des norwegischen Mensa-IQ-Tests mit 35 Matrix-Fragen.
- Anthropics Modellreihen zeigten eine kontinuierliche Leistungssteigerung von Claude-1 (IQ 64) über Claude-2 (82) bis zu Claude-3 (101).
Verknüpfte Unternehmen
4 verknüpfte Unternehmen“Claude-3 von Anthropic schlägt seine Rivalen, darunter ChatGPT-4 von OpenAI, und ist außerdem die erste KI, die den IQ von 100 überschreitet...”
“Im Durchschnitt hat das Modell von OpenAI beim norwegischen Mensa-Test einen IQ von 85 ergeben....”
“Auf Platz Vier liegt Bing Copilot von Microsoft mit einem IQ von 79....”
“Auf Platz Fünf steht Gemini von Google mit einem IQ von 77,5....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Entlassene OpenAI-Forscher bestreiten Fehlverhalten und warnen vor Einschüchterung
Drei OpenAI-Sicherheitsforscher – Jasmine Wang, Tomek Korbak und Mikita Balesni –, die letzte Woche entlassen wurden, haben einen offenen Brief veröffentlicht, in dem sie die Vorwürfe des Missbrauchs sensibler Informationen bestreiten. Sie warnen, dass ihre Entlassung einen abschreckenden Effekt habe, der die Sicherheitsarbeit und den offenen Dialog im Unternehmen behindere. Die Forscher erklären, sie hätten in gutem Glauben und im Rahmen der damaligen Unternehmensnormen gehandelt, und die Gründe für ihre Entlassung seien unklar. Sie appellieren an OpenAI, seine Zusagen bezüglich externer Sicherheitsauditoren einzuhalten und eine transparente Kultur zu bewahren. OpenAI antwortete mit einem internen Memo, das Vergeltungsmaßnahmen bestreitet und betont, dass Mitarbeiter nicht für das Ansprechen von Bedenken entlassen werden, ohne jedoch auf spezifische Richtlinienverstöße oder Umstände der Entlassung einzugehen. Der Konflikt beleuchtet Spannungen zwischen interner Sicherheitsforschung und Kommunikationsrichtlinien, während OpenAI wegen Sicherheitsvorfällen in der Kritik steht.
Ben Afflecks KI-Wissen geht viral
Ben Affleck, der Schauspieler, der sein KI-Filmmaking-Startup für angeblich 587 Millionen Dollar an Netflix verkauft hat, ging viral, weil er in Interviews tiefes Verständnis für KI-Technologie zeigte. Er sprach über maschinelles Lernen, neuronale Netze und gab zu, Python-Skripte zu schreiben. Affleck beschrieb seinen Weg vom analogen zum digitalen Film, seinen Einsatz von KI in der visuellen Effektproduktion und die Erstellung eines proprietären Datensatzes für ethische KI-Filmarbeit. Er besuchte auch OpenAI und nutzte seinen Promi-Status für Einblicke in neue Technologien. Affleck äußerte Bedenken über die Auswirkungen von KI auf Bildung und erlernte Hilflosigkeit, nicht über existenzielle Bedrohungen. Er nutzte KI in seinem Film 'Animals' und betonte die additive Natur von KI in der Filmbranche.
AI-Ranking Arena sammelt 200 Mio. USD bei 3,1 Mrd. USD Bewertung
Arena, die KI-Ranking-Plattform, die als Forschungsprojekt der UC Berkeley entstand, hat eine Series-B-Finanzierung in Höhe von 200 Mio. USD zu einer Bewertung von 3,1 Mrd. USD abgeschlossen. Die Runde wurde von Lightspeed Venture Partners und Khosla Ventures angeführt, mit Beteiligung von Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis und anderen. Dies folgt auf die Ankündigung des Unternehmens im Juni, einen annualisierten Run-Rate-Umsatz von 100 Mio. USD erreicht zu haben. Arena bietet eine Crowdsourcing-Plattform, auf der Nutzer die Ausgaben von KI-Modellen bewerten, und hat ein kommerzielles Produkt namens AI Evaluations eingeführt, das detaillierte Leistungsanalysen bietet. Das Unternehmen hat außerdem eine neue Kategorie 'Alignment' zu seinem Leaderboard hinzugefügt, die Modelle anhand von Problemen wie unbefugten Aktionen und betrügerischer Abschlüsse bewertet. Die Bewertung von Arena hat sich in etwa 10 Monaten fast verdoppelt, von 1,7 Mrd. USD nach der Finanzierung im Januar auf nun 3,1 Mrd. USD.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
