CosmicUp.me
Zamiast siedmiu subskrypcji AI jedna — 30+ modeli, 10 000 użytkowników, 80% niższy koszt inferencji.

- 10,000
- zarejestrowanych użytkowników
- 30+
- dostępnych modeli
- −80%
- koszt inferencji po pracy nad kontekstem
Kontekst
Konsumencka platforma AI, która daje dostęp do 30+ modeli tekstowych, graficznych i audio w ramach jednej subskrypcji za 16,99 €/mies. — na web, iOS i Androidzie. Działa w pełni serverless, ma 10 000 zarejestrowanych użytkowników i pozostaje rentowna przy stałej cenie dzięki temu, co dzieje się przed wywołaniem modelu: retrievalowi, rerankingowi i kompresji kontekstu, a nie większemu budżetowi.
Produkt
- Co sprzedaje
- Jedną subskrypcję zamiast ChatGPT Plus, Claude, Gemini, Grok i kilku narzędzi do obrazu i audio naraz.
- Kto kupuje
- Konsumenci i małe zespoły, które chcą modeli z najwyższej półki, nie płacąc za pięć osobnych subskrypcji.
- Cennik
- Darmowy plan, Plus za 16,99 €/mies. lub 169,90 €/rok — wprost skonfrontowany z ok. 240 $/rok za sam ChatGPT Plus.
- Dowód
- 10 000 zarejestrowanych użytkowników, 5/5 na Product Hunt, 4,1/5 na Trustpilocie oraz program afiliacyjny jako drugi kanał pozyskania.
Problem
Ludzie chcieli korzystać z kilku modeli AI, ale nie z kilku subskrypcji, kilku interfejsów i kilku relacji rozliczeniowych. Trudną częścią nie był interfejs, tylko obsługa nieprzewidywalnego, skokowego ruchu inferencyjnego przy stałej cenie miesięcznej — a to znaczy, że każda decyzja architektoniczna jest jednocześnie decyzją o marży.
Architektura
Przewiń w bok, aby zobaczyć cały schemat
Nie ma tu jednej normalizującej bramy — każdy dostawca jest zintegrowany ze swoim własnym API, bo spłaszczenie ich kosztowałoby dokładnie te możliwości, dla których ludzie wykupują subskrypcję. Dźwignia leży wcześniej: retrieval, reranking i kompresja decydują, co model faktycznie widzi, i stamtąd bierze się zarówno jakość odpowiedzi, jak i ~80% oszczędności.
Specyfikacja techniczna
- Katalog modeli
- 30+ modeli tekstowych, 11 graficznych i 2 własne agenty audio, pogrupowane w plany Free, Plus i Thunder.
- Dostawcy
- Bezpośrednie integracje z OpenAI, Anthropic, Google, xAI oraz wyspecjalizowanymi usługami graficznymi i audio.
- Pipeline kontekstu
- Składanie per żądanie: RAG z rerankingiem, kompresja kontekstu i cache promptów przed wywołaniem modelu.
- Okna kontekstu
- Do 1 000 000 tokenów w zależności od modelu; wejście przyjmuje PDF, DOC, DOCX i 9 kolejnych formatów, wyjście zapisuje PDF, DOC, CSV i TXT.
- Rozliczanie fair use
- 2 000 000 znaków wejściowych miesięcznie z pełną prędkością, potem łagodne zejście do wolniejszej kolejki (2–10 min) zamiast twardego odcięcia — stała cena wytrzymuje ciężkich użytkowników.
- Strumieniowanie
- Strumieniowanie server-sent na całej ścieżce, więc odczuwalne opóźnienie jest niskie nawet przy wolnym modelu.
- Uruchamianie kodu
- Runtime Pythona w piaskownicy (AI Code Run) wywoływany jako narzędzie z poziomu czatu.
- Platformy
- Web, iOS i Android z jednej bazy kodu, opublikowane jako CosmicUp.me w obu sklepach.
- Płatności
- Stripe na webie, natywne zakupy w aplikacji na iOS i Androidzie.
- Infrastruktura
- W pełni serverless na Firebase i funkcjach Node.js — żadnych serwerów działających non stop, bezczynność nic nie kosztuje.
Jak to zbudowałem
Zdefiniowałem roadmapę produktu i zbudowałem całość na stacku serverless — Vue.js na froncie, funkcje Node.js i Firebase pod spodem — tak, żeby bezczynność nic nie kosztowała.
Każdego dostawcę zintegrowałem z jego własnym API — OpenAI, Anthropic, Google, xAI oraz usługi graficzne i audio — zamiast chować je za jedną abstrakcją na poziomie najmniejszego wspólnego mianownika. Model wybiera użytkownik, więc szerokość katalogu jest produktem.
Wysiłek inżynierski przeniosłem przed wywołanie modelu: kontekst każdego żądania powstaje w locie z retrievalu, rerankingu i kompresji, żeby model czytał to, co istotne, i nic więcej.
Dołożyłem do tego cache promptów, co razem z pracą nad kontekstem obniżyło koszt inferencji o około 80% — ten sam katalog, te same odpowiedzi, jedna piąta rachunku.
Ustawiłem strumieniowanie jako domyślne, żeby odczuwalne opóźnienie było niskie nawet wtedy, gdy pracuje wolny model.
Zaprojektowałem rozliczanie fair use, które degraduje zamiast odcinać: po przekroczeniu limitu żądanie trafia do wolniejszej kolejki, zamiast się nie udać — dzięki temu stała cena wytrzymuje zużycie różniące się o rzędy wielkości.
Wypuściłem web, iOS i Androida z jednej bazy kodu, we własnym natywnym opakowaniu, więc funkcja trafia na wszystkie platformy w jednym wydaniu zamiast w trzech.
Wzrostem zajmowałem się sam — analiza rynku, reklamy na TikToku i w Google oraz bezpośrednia obsługa klienta — a to, co przychodziło na support, trafiało prosto do roadmapy. Projektowanie interfejsu to praca mojego wspólnika, nie moja.
Logi wykorzystuję jako narzędzie kontroli nadużyć: nietypowe wzorce zużycia sprawdzam, tych, którzy faktycznie nadużywają, blokuję, a kiedy anomalia okazuje się naszym własnym błędem — poprawiam błąd.
Rezultat
- 10 000 zarejestrowanych użytkowników na infrastrukturze bez serwerów działających non stop i bez zespołu ops.
- Koszt inferencji niższy o około 80% dzięki RAG-owi, kompresji kontekstu i cache'owi promptów — to ta jedna zmiana, dzięki której stała subskrypcja stała się rentowna.
- Konstrukcja rozliczeń utrzymała stałą cenę przy zużyciu różniącym się między użytkownikami o rzędy wielkości.
- Jedna baza kodu obsługująca web, iOS i Androida, więc katalog i funkcje pozostają zsynchronizowane na wszystkich trzech.
- Rozmowy z klientami zamieniały się bezpośrednio we wdrożone funkcje — pętla była krótka, bo ta sama osoba czytała zgłoszenia i pisała kod.