środa, 29 lipca 2026

Testy wersji 3.4

Narzędzie mam "gotowe".

Gotowe na jakimś etapie, testy już robiłem ale wyniki nie są dla mnie zadowalające, bo samo określenie tego czym jest wynik jest kiepskie. Bo właściwe pytanie jakie powinno paść, jaki jest cel?

Dobre pytanie, nie wiem.

Na początek miał być skill do analizy, potem się rozrósł do orkiestratora i etapu big picture i process level z oceną wsadu i dokładniejszą realizacją poszczególnych kroków. Teraz okazało się, że nie generują się dodatkowe zdarzenia w big picture co też było jedną z podstaw ale dlatego, że działałem na dużym zbiorze wsadowym to tego nie zauważyłem.

Po za tym mam kilka trybów i liczyłem na taki agentowy automatyczny, bo jestem leniwy ale z tego trybu wiele nie uzyskam, wydaje się, że lepszym będzie tryb pół automatyczny w którym będę razem z LLM przechodził po kolei przez proces. To podejście już testowałem przy któreś wersji.

Reszta trybów to tylko dodatek, który rozwijany gdzieś obok  przy okazji mógłby być.

Tylko pojawił się problem z oceną wyjścia.

System oceniania.

Z oceną był problem od samego początku, ale natchnął mnie film z MIT Sloan Management Review Polska (materiał nie jest o tym, ale ta część mnie zaciekawiła) gdzie była wzmianka o systemie oceniania.

Ja taki system spróbuje sobie zaimplementować, będzie on działał na przynajmniej trzech poziomach.

  1. Ocena narzędzia,
  2. Ocena wyjścia na podstawie wejścia,
  3. Ocena procesu.
Pokrótce przedstawię jak to widzę, potem będzie zderzenie z rzeczywistością.

Ocena narzędzia

Moje narzędzie czyli orkiestrator, działa na podstawie kroków, musi je wykonać w pewnej sekwencji, prawie zawsze, te prawie zawsze zależy od trybu i jakości wsadu ale te kroki można ubrać w ocenę narzędzia i wyznaczyć czy za każdym przejściem wykonuje kroki, które przewidziałem po wybraniu danej ścieżki. 

Pamiętam, że przy któreś wersji to badałem ale bez napisania takiego systemu ocennego. Teraz powinienem też skupić się nad logowaniem poszczególnych kroków chociaż istnieje już plik który się generuje na podstawie działania orkiestratora czyli session.md.

Na początek jakieś założenia?:
  • determinizm, czyli powtarzalność procesu, tu muszę zaznaczyć, że powtarzalność dla wybranych opcji, więc tak powtarzalność ale zależy co wybiorę
  • ocena na poziomie true/false, jest/ nie ma, czyli podejście najprostsze nie wymagające dodatkowych interpretacji,
  • tu będę musiał rozpisać scenariusze, czyli kroki procesu jaki powinien być wygenerowany jako wynik
Na razie więcej założeń nie przychodzi mi do głowy
Pojawiło się kilka pytań, które razem z LLM rozstrzygnąłem, wnioski:
  • testowanie pełnej ścieżki,
  • testowanie tylko orkiestratora, bez danych,
  • nie zmieniam testu póki sam proces nie ulegnie zmianie, i nie wymusi zmiany,
Tu pojawia się problem testowanie tylko orkiestratora, trzeba by zrobić mocka do danych, to może być ciekawe.

Na tę chwilę skupie się na zbudowaniu "czegoś" co posłuży do wykonania kroku pierwszego, potem reszta. Przy okazji zbiorę też jakie dodatkowe informacje jak by to miało działać, jak spełnie te podstawowe kroki i sprawdzę czy to działa wtedy można kontynuować. 
Nie zamierzam od razu robić wszystkich trzech etapów ale skupić się na jednym.




Brak komentarzy:

Prześlij komentarz

Testy wersji 3.4

Narzędzie mam "gotowe". Gotowe na jakimś etapie, testy już robiłem ale wyniki nie są dla mnie zadowalające, bo samo określenie teg...