Claude w firmie: jak zacząć od bezpiecznego zadania

Temat: Anthropic AI

Własną aplikację GenAI na Claude API zaczyna się od jednego zadania, którego wynik da się sprawdzić, i od zestawu testów — nie od wyboru najmocniejszego modelu. Ten wpis jest dla zespołu IT i twórców, którzy budują na API asystenta w systemie firmy, ekstrakcję danych z dokumentów albo agenta z narzędziami. Opisuje wybór modelu, konto i klucze, dane w API, testy i utrzymanie. Stan na 6.10.2026.

Jeśli pytanie brzmi, który plan Claude kupić pracownikom (Team czy Enterprise) i czym aplikacja Claude różni się od Claude Code, odpowiedź jest w poradniku: co to jest Claude. Kiedy aplikacja na modelu jest asystentem, a kiedy agentem z narzędziami, wyjaśnia poradnik o agentach AI dla firm.

Wybierz zadanie z wynikiem, który da się sprawdzić

Dobry pierwszy projekt na API ma jasne wejście i wynik, który program albo człowiek oceni bez dyskusji o gustach: klasyfikacja zgłoszeń do kolejek, wyciągnięcie pól z faktury do JSON, odpowiedź na pytanie z cytatem z dokumentu. Nie zaczynaj od decyzji prawnej, medycznej lub finansowej, której pomyłka ma trudne do odwrócenia skutki.

Oddziel przygotowanie wyniku od działania. Model może zaproponować kategorię albo szkic odpowiedzi, ale zapis w systemie, wysłanie wiadomości czy zmiana statusu wymagają osobnej kontroli w kodzie aplikacji.

Element projektuCo trzeba zapisać
ZadanieJednoznaczny początek i koniec pracy
WejścieDozwolone źródła i dane, których nie wolno wysłać do API
WynikFormat (np. schemat JSON) i kryteria poprawności
KontrolaTest automatyczny, osoba zatwierdzająca albo oba
EskalacjaSytuacje, w których aplikacja oddaje sprawę człowiekowi

Jeśli poprawność zależy od faktów, każ modelowi wskazywać źródło. Funkcja Citations pokazuje fragmenty dokumentu, na których oparto odpowiedź, więc odbiorca może je porównać.

Wybierz model na podstawie testów

Przegląd modeli Anthropic (stan na 6.10.2026) radzi zacząć od Claude Opus 5.5, a po Fable 5.1 sięgać przy najtrudniejszym rozumowaniu albo wtedy, gdy testy na Opus 5.5 z wyższym poziomem effort nadal nie wystarczają.

ModelIdentyfikator w APIDo czego według AnthropicCena wejście / wyjście (USD za 1 mln tokenów)
Fable 5.1claude-fable-5-1wymagające rozumowanie i długie zadania agentowe10 / 50
Opus 5.5claude-opus-5-5długie kodowanie agentowe i praca z wiedzą; punkt startu4 / 20
Sonnet 5.5claude-sonnet-5-5najlepsze połączenie szybkości i jakości2 / 10
Haiku 4.5claude-haiku-4-5-20251001najszybszy; wycofanie nie wcześniej niż 15.10.20261 / 5

Ceny według tej samej strony i cennika API. Batch API kosztuje o połowę mniej, a odczyt z pamięci podręcznej promptu (prompt caching) to ułamek ceny wejścia. Przy dużym wolumenie te dwie funkcje często zmieniają rachunek bardziej niż wybór modelu.

Każdy identyfikator to przypięta wersja (snapshot), więc model nie zmieni się pod aplikacją bez Waszej decyzji. Przy przejściu ze starszych modeli sprawdź przewodnik migracji: od generacji 4.7 parametry temperature, top_p i top_k z wartością inną niż domyślna kończą się błędem 400.

Dobierz funkcje API do zadania

PotrzebaFunkcja Claude APINa co uważać
Wynik zawsze w tym samym formacieStructured outputs (JSON według schematu)schemat jest przechowywany do 24 godzin od ostatniego użycia
Model ma wywołać funkcję Waszego systemutool use (narzędzia po stronie klienta)parametry od modelu sprawdza kod, który wykonuje operację
Ten sam długi kontekst w wielu wywołaniachprompt cachingpamięć podręczna jest osobna dla każdego workspace’u
Duży wolumen bez odpowiedzi na żywoBatch APIwyniki przychodzą asynchronicznie
Narzędzia z istniejącego serwera MCPMCP connectorfunkcja w becie
Własny agent z pętlą, narzędziami i uprawnieniamiAgent SDK (Python, TypeScript)w produkcie dla klientów logowanie kluczem API, nie kontem claude.ai

Pełną listę funkcji, ich status (stabilna albo beta) i dostępność w chmurach zbiera przegląd funkcji API. Funkcja w becie nie jest gwarantowana do pracy produkcyjnej i może się zmienić w sposób niezgodny wstecz. Model chętnie odda JSON „prawie” zgodny ze schematem, a „prawie” to słowo, którego parser nie zna. Dlatego przy danych do systemu włącz structured outputs i waliduj wynik w kodzie.

Konto, workspace’y i klucze

Organizacja w Claude Console dzieli się na workspace’y. Dokumentacja podpowiada osobne workspace’y dla środowisk: rozwój, testy i produkcja. Każdy workspace poza domyślnym może mieć własny miesięczny limit wydatków i limity zapytań, a klucz API przypisany do workspace’u widzi tylko jego zasoby: pliki, batche i skille.

Dla aplikacji produkcyjnej ważny jest rodzaj klucza. Klucz osobisty przestaje działać, gdy jego właściciel zostanie usunięty z workspace’u, a przy usunięciu z organizacji jest archiwizowany. Klucz konta serwisowego działa dalej, nawet gdy odejdzie osoba, która go utworzyła. Produkcja powinna więc korzystać z konta serwisowego, a organizacja i klucze należeć do firmy, nie do partnera, który buduje aplikację.

Dane w API: trening, retencja i ZDR

API to produkt komercyjny. Anthropic działa w nim jako podmiot przetwarzający, a firma jest administratorem danych. Według zasad treningu dane z produktów komercyjnych nie są używane do trenowania modeli bez wyraźnej zgody firmy. Firma nadal odpowiada za to, jakie dane wysyła i w jakim celu.

Retencję opisuje strona API i retencja danych. Standardowo API usuwa wejścia i wyjścia w ciągu 30 dni (zasady dla produktów komercyjnych). Zero Data Retention (ZDR) włącza zespół sprzedaży Anthropic, osobno dla każdej organizacji. ZDR nie obejmuje części funkcji, m.in. Files API, Batch API, wykonywania kodu i MCP connector. Modele Fable i Mythos wymagają 30-dniowej retencji i bez wyraźnej zgody Anthropic nie są dostępne w ZDR. Jeśli umowa wymaga ZDR, funkcje i model wybierz po przeczytaniu tej tabeli, nie przed.

Claude API jest też dostępne przez Amazon Bedrock, Google Cloud i Microsoft Foundry. Tam część funkcji działa inaczej albo wcale, a w Bedrock i Google Cloud za retencję odpowiada operator chmury. Porównanie kanałów jest w poradniku o Claude.

Testuj na przypadkach trudnych

Zestaw testów powinien zawierać poprawne materiały, niepełne dane, sprzeczne instrukcje, pytania wykraczające poza zakres i dokument z tekstem udającym polecenie dla modelu. Oczekuj, że aplikacja rozpozna brak podstaw albo przekaże sprawę dalej. Płynna i pewna odpowiedź nie jest równoznaczna z poprawnością.

PrzypadekOczekiwane zachowanieDowód
Pełny dokumentWynik zgodny z kryteriami i schematemTest automatyczny i lista sprawdzeń
Brak kluczowej informacjiJawne wskazanie braku, bez wymyślonej wartościZapis odpowiedzi
Sprzeczne źródłaPokazanie konfliktuCytaty z obu fragmentów
Prośba poza zakresemOdmowa lub eskalacjaWłaściwy kanał pomocy
Polecenie ukryte w dokumencieTraktowanie go jak danychBrak nieplanowanego wywołania narzędzia

Anthropic opisuje budowę takiego zestawu w przewodniku tworzenie kryteriów i testów. Przykład syntetyczny: w 40 przypadkach testowych 29 wyników zaakceptowano bez zmian, 8 po poprawkach, a 3 odrzucono. Udział wyników bez poprawek wynosi 72,5%, a zakończenie pracy z poprawką 92,5%. Koszt ośmiu korekt i ryzyko trzech odrzuceń trzeba ocenić oddzielnie.

Mierz czas od wejścia do zatwierdzonego wyniku, a nie tylko czas odpowiedzi API. Rejestruj rodzaj błędu: fakt, format, brak źródła, ujawnienie danych albo niezastosowanie instrukcji.

Utrzymanie: zmiana modelu, operacje i awarie

Modele mają cykl życia. Według strony o wycofywaniu modeli Anthropic uprzedza o wycofaniu modelu udostępnionego publicznie co najmniej 60 dni wcześniej, mailem i w dokumentacji. Przykład z 30.09.2026: Claude Sonnet 4.5 ma zostać wyłączony 30.11.2026, a zalecanym następcą jest Sonnet 5.5. Eksport użycia w Console pokazuje zużycie według klucza i modelu, więc łatwo znaleźć aplikacje na starym modelu. Przed zmianą identyfikatora puść ten sam zestaw testów na nowym modelu.

Operacja, która zmienia dane w systemie, powinna mieć identyfikator i bezpiecznie obsługiwać ponowienie po przerwanym połączeniu, żeby awaria sieci nie zapisała zgłoszenia dwa razy. W logach zapisuj identyfikator zapytania, wersję modelu i wynik testów, a nie sekrety i pełne dane klientów. Przećwicz też niedostępność API: zadanie musi mieć ręczną ścieżkę zastępczą, a po powrocie usługi aplikacja nie może powtórzyć działań wykonanych już przez człowieka.

Raz w miesiącu sprawdź małą losową próbkę zaakceptowanych wyników. Same zgłoszone błędy pomijają odpowiedzi, których nikt nie rozpoznał jako niepoprawne. Pilotaż zakończ decyzją: rozszerzyć zakres, poprawić aplikację albo zrezygnować. Te same kryteria dla aplikacji na modelach OpenAI opisuje wpis ChatGPT w firmie: od pomysłu do kontrolowanego użycia.

Portret Krzysztofa Majchrzyckiego

O autorze

Krzysztof Majchrzycki jest architektem systemów i AI Business Partnerem. Od wielu lat łączy technologię z biznesem i zarządzaniem. Współtworzył firmy technologiczne i kierował polskim oddziałem międzynarodowej grupy. Dziś projektuje modele firm i inteligentne systemy operacyjne, które z nich wynikają. Ukończył Executive MBA i ma certyfikat Prosci® Certified Change Practitioner.

Buduj aplikacje na API z odbiorem, nie na wiarę

Forward Deployed AI Engineer to kurs w Akademii dla inżyniera, który buduje aplikacje i agentów na modelach AI w systemach firmy: dobiera model, projektuje dostęp do danych, pisze testy i prowadzi odbiór. Kurs jest w przygotowaniu — zapisz się na listę oczekujących.