Przejdź do treści
Wszystkie studia przypadków
2024 — 2026Współzałożyciel · produkt i inżynieria

CosmicUp.me

Zamiast siedmiu subskrypcji AI jedna — 30+ modeli, 10 000 użytkowników, 80% niższy koszt inferencji.

Zrealizowane w LumaUp sp. z o.o.
Zrzut ekranu strony głównej CosmicUp.me
Działający produkt, uchwycony z publicznej strony.
10,000
zarejestrowanych użytkowników
30+
dostępnych modeli
−80%
koszt inferencji po pracy nad kontekstem

Kontekst

Konsumencka platforma AI, która daje dostęp do 30+ modeli tekstowych, graficznych i audio w ramach jednej subskrypcji za 16,99 €/mies. — na web, iOS i Androidzie. Działa w pełni serverless, ma 10 000 zarejestrowanych użytkowników i pozostaje rentowna przy stałej cenie dzięki temu, co dzieje się przed wywołaniem modelu: retrievalowi, rerankingowi i kompresji kontekstu, a nie większemu budżetowi.

Produkt

Co sprzedaje
Jedną subskrypcję zamiast ChatGPT Plus, Claude, Gemini, Grok i kilku narzędzi do obrazu i audio naraz.
Kto kupuje
Konsumenci i małe zespoły, które chcą modeli z najwyższej półki, nie płacąc za pięć osobnych subskrypcji.
Cennik
Darmowy plan, Plus za 16,99 €/mies. lub 169,90 €/rok — wprost skonfrontowany z ok. 240 $/rok za sam ChatGPT Plus.
Dowód
10 000 zarejestrowanych użytkowników, 5/5 na Product Hunt, 4,1/5 na Trustpilocie oraz program afiliacyjny jako drugi kanał pozyskania.

Problem

Ludzie chcieli korzystać z kilku modeli AI, ale nie z kilku subskrypcji, kilku interfejsów i kilku relacji rozliczeniowych. Trudną częścią nie był interfejs, tylko obsługa nieprzewidywalnego, skokowego ruchu inferencyjnego przy stałej cenie miesięcznej — a to znaczy, że każda decyzja architektoniczna jest jednocześnie decyzją o marży.

Architektura

Architektura — uproszczona
Vue.jsweb · iOS · AndroidPipeline żądaniamodel wybiera użytkownikretrieval + rerankingkompresja kontekstucache promptówOpenAIAnthropicGoogle · xAIobraz · audiobezpośrednia integracja z każdym dostawcąFirebaseauth · dane · zużycie−80%koszt inferencjistrumieniowana odpowiedź

Przewiń w bok, aby zobaczyć cały schemat

Nie ma tu jednej normalizującej bramy — każdy dostawca jest zintegrowany ze swoim własnym API, bo spłaszczenie ich kosztowałoby dokładnie te możliwości, dla których ludzie wykupują subskrypcję. Dźwignia leży wcześniej: retrieval, reranking i kompresja decydują, co model faktycznie widzi, i stamtąd bierze się zarówno jakość odpowiedzi, jak i ~80% oszczędności.

Specyfikacja techniczna

Katalog modeli
30+ modeli tekstowych, 11 graficznych i 2 własne agenty audio, pogrupowane w plany Free, Plus i Thunder.
Dostawcy
Bezpośrednie integracje z OpenAI, Anthropic, Google, xAI oraz wyspecjalizowanymi usługami graficznymi i audio.
Pipeline kontekstu
Składanie per żądanie: RAG z rerankingiem, kompresja kontekstu i cache promptów przed wywołaniem modelu.
Okna kontekstu
Do 1 000 000 tokenów w zależności od modelu; wejście przyjmuje PDF, DOC, DOCX i 9 kolejnych formatów, wyjście zapisuje PDF, DOC, CSV i TXT.
Rozliczanie fair use
2 000 000 znaków wejściowych miesięcznie z pełną prędkością, potem łagodne zejście do wolniejszej kolejki (2–10 min) zamiast twardego odcięcia — stała cena wytrzymuje ciężkich użytkowników.
Strumieniowanie
Strumieniowanie server-sent na całej ścieżce, więc odczuwalne opóźnienie jest niskie nawet przy wolnym modelu.
Uruchamianie kodu
Runtime Pythona w piaskownicy (AI Code Run) wywoływany jako narzędzie z poziomu czatu.
Platformy
Web, iOS i Android z jednej bazy kodu, opublikowane jako CosmicUp.me w obu sklepach.
Płatności
Stripe na webie, natywne zakupy w aplikacji na iOS i Androidzie.
Infrastruktura
W pełni serverless na Firebase i funkcjach Node.js — żadnych serwerów działających non stop, bezczynność nic nie kosztuje.

Jak to zbudowałem

  1. Zdefiniowałem roadmapę produktu i zbudowałem całość na stacku serverless — Vue.js na froncie, funkcje Node.js i Firebase pod spodem — tak, żeby bezczynność nic nie kosztowała.

  2. Każdego dostawcę zintegrowałem z jego własnym API — OpenAI, Anthropic, Google, xAI oraz usługi graficzne i audio — zamiast chować je za jedną abstrakcją na poziomie najmniejszego wspólnego mianownika. Model wybiera użytkownik, więc szerokość katalogu jest produktem.

  3. Wysiłek inżynierski przeniosłem przed wywołanie modelu: kontekst każdego żądania powstaje w locie z retrievalu, rerankingu i kompresji, żeby model czytał to, co istotne, i nic więcej.

  4. Dołożyłem do tego cache promptów, co razem z pracą nad kontekstem obniżyło koszt inferencji o około 80% — ten sam katalog, te same odpowiedzi, jedna piąta rachunku.

  5. Ustawiłem strumieniowanie jako domyślne, żeby odczuwalne opóźnienie było niskie nawet wtedy, gdy pracuje wolny model.

  6. Zaprojektowałem rozliczanie fair use, które degraduje zamiast odcinać: po przekroczeniu limitu żądanie trafia do wolniejszej kolejki, zamiast się nie udać — dzięki temu stała cena wytrzymuje zużycie różniące się o rzędy wielkości.

  7. Wypuściłem web, iOS i Androida z jednej bazy kodu, we własnym natywnym opakowaniu, więc funkcja trafia na wszystkie platformy w jednym wydaniu zamiast w trzech.

  8. Wzrostem zajmowałem się sam — analiza rynku, reklamy na TikToku i w Google oraz bezpośrednia obsługa klienta — a to, co przychodziło na support, trafiało prosto do roadmapy. Projektowanie interfejsu to praca mojego wspólnika, nie moja.

  9. Logi wykorzystuję jako narzędzie kontroli nadużyć: nietypowe wzorce zużycia sprawdzam, tych, którzy faktycznie nadużywają, blokuję, a kiedy anomalia okazuje się naszym własnym błędem — poprawiam błąd.

Rezultat

  • 10 000 zarejestrowanych użytkowników na infrastrukturze bez serwerów działających non stop i bez zespołu ops.
  • Koszt inferencji niższy o około 80% dzięki RAG-owi, kompresji kontekstu i cache'owi promptów — to ta jedna zmiana, dzięki której stała subskrypcja stała się rentowna.
  • Konstrukcja rozliczeń utrzymała stałą cenę przy zużyciu różniącym się między użytkownikami o rzędy wielkości.
  • Jedna baza kodu obsługująca web, iOS i Androida, więc katalog i funkcje pozostają zsynchronizowane na wszystkich trzech.
  • Rozmowy z klientami zamieniały się bezpośrednio we wdrożone funkcje — pętla była krótka, bo ta sama osoba czytała zgłoszenia i pisała kod.

Szukasz kogoś, kto ogarnie całość?

Etat, projekt kontraktowy albo architektura, która potrzebuje drugiej pary oczu — opisz kształt sprawy. Jeśli nie jestem właściwą osobą, powiem to od razu.

Napisz do mnie