Inception Labs Mercury – modele językowe oparte na dyfuzji
Aktualności

Inception Labs i Mercury – modele językowe oparte na dyfuzji, które są 5x szybsze

Inception Labs tworzy modele językowe oparte na dyfuzji (dLLM) zamiast tradycyjnego podejścia autoregresyjnego. Ich rodzina Mercury osiąga ponad 1000 tokenów na sekundę – 5x szybciej niż konwencjonalne LLM-y.

Inception Labs to startup AI ze Stanford, który postanowił zmienić fundamenty generowania tekstu. Zamiast tradycyjnego podejścia autoregresyjnego – token po tokenie – firma stosuje dyfuzję, tę samą technologię, która napędza generatory obrazów jak MidJourney czy Sora. Efekt? Modele Mercury generują tekst z prędkością ponad 1000 tokenów na sekundę.

Inception Labs Mercury – modele językowe oparte na dyfuzji

Czym jest Inception Labs?

Inception Labs to firma założona przez badaczy ze Stanford, UCLA i Cornell, w tym twórców fundamentalnych technologii AI: modeli dyfuzyjnych (które napędzają Sora i MidJourney), Flash Attention (kluczowy algorytm dla wydajności GPU w LLM) oraz Direct Preference Optimization (jedno z głównych podejść do alignacji modeli z ludzkimi preferencjami). Zespół pochodzi również z Google DeepMind, Meta AI, Microsoft AI i OpenAI.

Firma wdraża swoje modele dyfuzyjne u klientów z listy Fortune 500 i jest dostępna przez AWS Bedrock oraz Azure AI Foundry.

Jak działają modele dyfuzyjne (dLLM)?

Tradycyjne modele językowe (GPT, Claude, Gemini, Llama) generują tekst sekwencyjnie – jeden token naraz, od lewej do prawej. To podejście jest dokładne, ale z natury powolne, ponieważ każdy token musi zostać wygenerowany zanim model przejdzie do następnego.

Modele dyfuzyjne (dLLM) działają inaczej. Zamiast pisać token po tokenie jak na maszynie do pisania, model startuje z losowym szumem i stopniowo go „oczyszcza" (denoising) w kilku krokach, generując wiele tokenów równolegle. To bardziej przypomina edytora poprawiającego cały szkic naraz, niż kogoś piszącego od zera litera po literze.

Kluczowe różnice dLLM vs autoregresyjne LLM

  • Generacja równoległa – wiele tokenów jednocześnie zamiast sekwencyjnie
  • 5–10x większa prędkość – ponad 1000 tokenów/s na GPU NVIDIA
  • Niższe koszty – lepsze wykorzystanie GPU przekłada się na niższe koszty wnioskowania
  • Lepsza kontrola – model może modyfikować tokeny w dowolnej kolejności, co pozwala korygować halucynacje i dostosować się do formatów
  • Jakość rozumowania – globalna poprawa jakości poprzez jednoczesną modyfikację wielu tokenów

Rodzina modeli Mercury

Mercury 2 – najszybszy reasoning LLM

Mercury 2 to flagowy model Inception Labs, wprowadzony w maju 2026 roku. Jest to pierwszy reasoning dLLM – model dyfuzyjny z możliwością rozumowania, który osiąga jakość porównywalną z modelami takimi jak GPT-5.2 czy Claude Sonnet 4.5, ale przy znacznie wyższej prędkości.

  • Prędkość: 1009 tokenów/s na NVIDIA Blackwell GPUs
  • Cena: $0.25 / 1M tokenów wejściowych, $0.75 / 1M tokenów wyjściowych
  • Okno kontekstowe: 128K tokenów
  • Funkcje: regulowany reasoning, natywne tool use, strukturalne wyjście JSON

Mercury Edit 2 – model do edycji kodu

Mercury Edit 2 to mniejszy, zoptymalizowany pod kątem kodowania dLLM. Jest idealny do autouzupełniania kodu i sugestii następnej edycji – scenariuszy, gdzie opóźnienie jest krytyczne, bo programista jest w środku pracy i każda pauza przerywa flow.

  • Okno kontekstowe: 32K tokenów
  • Zastosowania: autocomplete, next-edit suggestions
  • Cena: $0.25 / 1M tokenów wejściowych, $0.75 / 1M tokenów wyjściowych

„Inception's Mercury 2 demonstrates what's possible when new model architecture meets NVIDIA AI infrastructure. Surpassing 1,000 tokens per second on NVIDIA GPUs underscores the performance, scalability, and versatility of our platform to power the full spectrum of AI workloads."

- Shruti Koparkar, Senior Manager of Product, Accelerated Computing Group at NVIDIA

Gdzie Mercury 2 sprawdza się w produkcji?

Programowanie i edycja kodu

Autouzupełnianie, sugestie następnej edycji, refaktoryzacja, interaktywne agenty kodu – to workflow, gdzie programista jest w pętli i każda pauza przerywa flow. Jak mówi Max Brunsfeld, współzałożyciel edytora Zed: „Sugestie pojawiają się wystarczająco szybko, by czuć się jak część własnego myślenia, nie coś, na co trzeba czekać."

Pętle agentowe (agentic loops)

Agenty AI łączą dziesiątki wywołań modelu w jednym zadaniu. Obniżenie opóźnienia na każdym kroku nie tylko oszczędza czas – zmienia to, ile kroków można sobie pozwolić i jak dobre staje się końcowe wyjście. Skyvern raportuje, że Mercury 2 jest co najmniej dwa razy szybszy niż GPT-5.2.

Interakcja głosowa w czasie rzeczywistym

Interfejsy głosowe mają najciaśniejszy budżet opóźnienia w AI. Mercury 2 sprawia, że jakość na poziomie reasoning jest osiągalna w naturalnym tempie mowy. Firmy takie jak Happyverse AI (awatary wideo AI) i OpenCall (agenci głosowi) już korzystają z Mercury 2 w swoich stosach głosowych.

Wyszukiwanie i RAG

Wielokrokowe wyszukiwanie (multi-hop retrieval), reranking i summarizacja – opóźnienia rosną szybko. Mercury 2 pozwala dodać reasoning do pętli wyszukiwania bez przekraczania budżetu opóźnienia.

Dostępność i API

Modele Mercury są kompatybilne z API OpenAI – można je użyć jako drop-in replacement w istniejących aplikacjach bez konieczności przebudowy. Dostępne są przez biblioteki takie jak AISuite, LiteLLM i LangChain.

Po założeniu konta na platformie Inception Labs i wygenerowaniu klucza API, każdy nowy klucz otrzymuje 10 milionów darmowych tokenów do testowania wszystkich modeli. To pozwala wolnie wypróbować Mercury 2 i Mercury Edit 2 bez żadnych kosztów.

Po wyczerpaniu darmowego limitu firma oferuje plan Developer (płatność za użycie: $0.25 / 1M tokenów wejściowych, $0.025 / 1M tokenów z cache, $0.75 / 1M tokenów wyjściowych) oraz plan Enterprise (SLA, bezpieczeństwo, ceny hurtowe).

Mercury jest również dostępny przez AWS Bedrock, Azure AI Foundry i Amazon SageMaker, co ułatwia wdrożenia enterprise. Modele wspierają fine-tuning (SFT/RLHF) zarówno w chmurze, jak i w wdrożeniach on-premise.

Podsumowanie

Inception Labs udowadnia, że podejście autoregresyjne nie jest jedyną drogą do wydajnych modeli językowych. Modele dyfuzyjne oferują fundamentalnie inną krzywą prędkości – z zachowaniem jakości porównywalnej z wiodącymi modelami speed-optimized. Jeśli AI produkcyjne ewoluuje w stronę agentów, pętli i interakcji w czasie rzeczywistym, szybkość generacji staje się kluczowym wyróżnikiem. Mercury 2 z ponad 1000 tokenów/s pokazuje, że dyfuzja może być odpowiedzią.