Grok 4.6 liderem CursorBench 3.2 – i to przy wyraźnie niższych kosztach

xAI ·

Grok 4.6 liderem CursorBench 3.2 – i to przy wyraźnie niższych kosztach

Grok 4.6 zajął pierwsze miejsce w najnowszej edycji CursorBench 3.2, benchmarku mierzącego skuteczność modeli w zadaniach agentowych (głównie kodowaniu).

Wykres CursorBench 3.2: Grok 4.6 Extra High 70,8% przy 2,81 dolara za zadanie
CursorBench 3.2: Grok 4.6 Extra High na czele — 70,8% przy 2,81 $ za zadanie. Fable i Opus są tuż za wynikiem, ale kilka razy droższe.

Wyniki topowych modeli

  • Grok 4.6 Extra High — 70,8% | 2,81 $ za zadanie
  • Fable 5 Max — 70,5% | 17,32 $
  • Opus 5 Max — 70,0% | 8,23 $
  • GPT-5.6 Sol Max — 67,2% | 5,69 $

Grok osiągnął najwyższy wynik przy koszcie około sześciokrotnie niższym niż Fable 5 Max i niemal trzykrotnie niższym niż Opus 5 Max.

To właśnie ta kombinacja — topowa jakość przy wyraźnie lepszej efektywności kosztowej — jest w tym przypadku najważniejsza. W zastosowaniach agentowych, gdzie modele wykonują długie sekwencje zadań programistycznych, różnica w koszcie na zadanie szybko się kumuluje.

Wykres pokazuje wyraźnie, że Grok 4.6 wypada najlepiej pod względem stosunku wyniku do ceny. Przy podobnym lub wyższym poziomie skuteczności zużywa wyraźnie mniej zasobów.

Dla użytkowników budujących agentów kodujących to konkretna przewaga: model nie tylko dobrze radzi sobie z zadaniami, ale też pozwala dłużej pracować przy rozsądnych kosztach.

← Wszystkie wpisy

Komentarze

Zamieszczając komentarz, publikujesz go pod podanym imieniem. Nie prosimy o maila.

Wczytuję…

Czytaj również

Grok Bot będzie wybierał do każdego zadania najlepszy model, także Claude Opus 5.5 od Anthropica

Elon Musk zapowiedział, że Grok Bot będzie korzystał z najlepszego modelu do zadania, także z Claude Opus 5.5, Midjourney i Suno. Bot przeszukuje już X bez konektora, a od sierpnia dostał m.in. Team Boty w Slacku, 1Password, głos, rutyny i dostęp do finansów.

Musk i Huang w Białym Domu wskazują prąd jako główne ograniczenie rozwoju SI

Musk w Białym Domu: każde 5 GW dodatkowego prądu to ok. 1 proc. PKB USA, a Starship ma wynosić na orbitę setki gigawatów mocy obliczeniowej rocznie. Huang pokazał OpenShell i BlueField do pilnowania agentów SI, Tom Brown mówił o Claude Opus 5.5, a szefowie firm podpisali deklarację o czterech poziomach kontroli.

Terafab wylewa fundamenty pół roku po ogłoszeniu, a nasze CPK potrzebowało na to dziewięciu lat

W hrabstwie Grimes w Teksasie większość stóp fundamentowych Terafabu jest już zalana betonem, pół roku po ogłoszeniu projektu. Budowa terminala CPK wciąż czeka na pozwolenie, prawie dziewięć lat po przyjęciu koncepcji.