Data Adventures

343
Статистика
Статистика
343
Статистика темы
  • Популярность
    Топ-40
  • Постов
    1,038
  • Просмотров
    188,051
  • Подписок
    343
  • Карма автора
    +12,998
1 50 51 52
  •  ZiingRR, накидывая документацию ты конечно пытаешься себе плюсиков добавить к сообщению , НО

    хочется просто реальное мнение услышать людей а не вот там сказали тут эксперты там эксперты , ЛЛМ основана на математике 80-90 х годов  https://habr.com/ru/companies/bothub/articles/909092/... те математики которые это придумали и не думали даже о том что получится из этого сделать в будущем... 

    прогнозы очевидно очень плохие ... 

    неужели кто-то думает что за 200 баксов в месяц в подписке будет модель которая сделает вас миллионером ... 

    очевидно такая подписка должна стоить больше миллиона долларов ) 

    ну а если такой модели не будет в подписке то какая будет ? )

    Сообщение отредактировал c00l0ne - 12.8.2026, 23:34
    Ответить Цитировать
    168/169
    + 1
  •  SnowBeaver, илон маск сказал, что через 3-5 лет деньги отменят и все будут жить богато. Не может же он обманывать?

    Ответить Цитировать
    1/1
    + 6
  • nukanuka @ 13.08.26 

     SnowBeaver, илон маск сказал, что через 3-5 лет деньги отменят и все будут жить богато. Не может же он обманывать?

    Илон святой, он не может обмануть наши ожидания. Просто надо правильно трактовать. Деньги отменят у одних, а богато будут жить другие.

    Ответить Цитировать
    481/491
    + 10
  • c00l0ne @ 12.08.26 

    неужели кто-то думает что за 200 баксов в месяц в подписке будет модель которая сделает вас миллионером ... 

    Некоторых блокнотик + ручка сделали миллионерами за 10 баксов. Кого-то озолотило IDE за 80 баксов в год по подписке. Если использовать как инструмент, а не как шайтан-машину, которая за тебя думает, то проблем не возникает.

    Ответить Цитировать
    482/491
    + 1
  • SnowBeaver @ 13.08.26  

    блокнотик + ручка сделали миллионерами за 10 баксов

    есть пара идей про омаху... но пока ИИ "не смог" ... ждем более умные ии)

    SnowBeaver @ 13.08.26  

    Деньги отменят

    продуктовые карточки введут ? 

    халява от Manus : 

     

    Ответить Цитировать
    169/169
    + 0
  • c00l0ne @ 13.08.26  

    есть пара идей про омаху... но пока ИИ "не смог" ... ждем более умные ии)

    у меня есть неплохие результаты, для которых хватило opus 4.7. Но я думаю как упростить историю длинной в 3 месяца экспериментов. Та, которой я у тебя ещё в блоге хвастался. Но я уже купил бухла с очень хорошей выдержкой, так что должно хватить для написания статьи. Миллионером меня врядли сделает, но уже есть кто готов купить и использовать.

    Ответить Цитировать
    483/491
    + 4
  • Итак, показываю по шагам как сделать качественный MDA в покере на коленке с помощью claude code (ну или на чём вы там ещё вайбкодите). В целом я с самого начала блога обещал показать настоящий ML процесс (ну вернее как-то рассказать про него), но как-то всегда было не до того. Либо проект принадлежал не мне, и заказчик не горел желанием увидеть результаты в паблике, либо я был слишком ленив описывать фактический результат, т.к. для описания надо прям сильно упрощать и ещё и делать хоть сколько-то интересным крайне скучные вещи. Сейчас хотябы появилась возможность быстро клепать картинки по любой теме, что снимает с авторов часть рутины. 

    Я стартовал здесь https://forum.gipsyteam.ru/index.php?viewtopic=172401&view=findpost&p=8055582 описав, что такое “предиктор”, и там же некая вводная задачи восстановления диапазонов по майнингу. Сейчас же у меня некоторое количество предикторов собирается в цельную систему байесовского вывода. Вообще с терминами туго когда делаешь что-то такое. У ML-щиков как у химиков по органике часто используется ебанина наводящая страх одним названием. Например вот текущую систему можно было бы окрестить "факторизованной ланентно-переменной моделью поведения". Но ML-щики в основном говорят на английском и для ближайших аналогов надо гуглить "EM-trained factored policy model with Bayesian latent-hand inference". По человечески если описать, то я сделал систему, которая обучается на майнинге, а выдаёт реальные (восстановленные) диапазоны игроков. Изначально цель была восстановить префлоп, но вошёл во вкус и восстановил на всех улицах. 

    Изначальная цель была поставлена - построить модель без использования опоры на GTO. Т.е. ни в каком виде данные из солверов не попали в модель в процессе обучения и она "чистая". То что смогла распознать в майнинге, то и показывает. Я всегда знал примерные шаги для такой модели, но увы процесс этот глубоко-экспериментальный. Ни одно самое умное AI не сделает вам эту систему с одного захода. В моём случае пришлось два месяца непрерывно гонять арендованный сервер и проделать пару сотен вычислительных экспериментов. В какой-то момент я тестировал нейросети, от которых отказался как от не подходящих под задачу, тестировал генетические алгоритмы, т.к. очень их люблю со времён написания диплома, но в итоге остановился в качестве деревьев решений как модели предиктора. Но как я писал ранее - конкретный алгоритм предиктора менее важен чем данные, и на хорошем обучающем массиве данных любая модель сходится. Если вы когда-то заходите попробовать повторить подобную работу не надо прям жёстко фиксироваться на том, что у SnowBeaver отработал хорошо LightGBM. С таким же успехом мог бы выйти в топы CatBoost (он кстати и вышел, просто он дороже). 

    Я работал с claude code последовательно создавая спеки экспериментов основанные на результатах предыдущих. Что-то вычитывал полностью, где-то доверялся AI, и потом уже смотрел количественные метрики. В целом процесс работы ML-щика остался ровно таким же, что и до LLM, но теперь не надо писать руками код. Итерации стали быстрее. У меня ушло всего два месяца на работу, которая в предыдущей жизни отожрала бы наверное год в хобби режиме (или полгода на фултайме). Так что надо быть честным, с помощью LLM я очень сильно бустанул. И в целом я бы не сказал, что хоть на каком-то этапе я делал что-то настолько сложное что бы требовало углублённых знаний ML. Все методы уровня учебника, любой может с нуля их освоить с помощью LLM если будет иметь достаточно мотивации. 

    Единственное что, мотивации у вас должно быть прям реально дохрена. Вот джипси подсветил интересный блог https://forum.gipsyteam.ru/index.php?viewtopic=151539&view=findpost&p=8277094 я кайфанул от идеи и подхода автора. Но так могут не все. Многие себе представляют вайбкодинг иначе, чем он на самом деле есть. Страдать вам придётся немало если нет программерской базы. Но если вы как автор этого блога способны ебашить 3 месяца в подряд без останова по 12 часов, то я вас уверяю, у вас получится :) 

    Итак, собственно к рутине ML-щика - шанс на то дойдёте ли вы до результата зависит от того поставили ли вы честные количественные измерения чего хотите получить и того насколько вы готовы при этом получать негативные результаты в процессе экспериментов. То для чего я дальше привожу инфографику это версия 2 системы. Была также 0 и 1 которые целиком ушли в мусорку, и даже в этой второй версии я через месяц нашёл критические ошибки, которые заставили переписать её заново и потерять месяц вычислений на сервере. ML это часто недешевое удовольствие, особенно если вы пока шишки не набили и любите дорогие модели на старте. 

     

    Вот так выглядит timeline проекта. Снизу квадратики это дни. Adopted это когда удалось подтвердить идею экспериментов и сохранить в коде, rejected, когда эксперимент неудачный. Diaglostic findings это когда я хоть и не улучшил модель, но получил инфу, которая позволила сдвинуться с текущей точки и попробовать что-то ещё. Milestones это истории, которые уже точно напрямую фиксируются в текущем виде в итоговой системе. 

    можно видеть, что на старте процесс шёл легко, и зелёные дни очень частые. Так бывают плюс минус всегда, когда у вас хорошая стартовая гипотеза для создания какой-то ML системы. Потом успешные улучшения начинают случаться всё реже. с какого-то момента мы решаем стабилизировать текущее решение на достигнутой точке и фиксируем то что пойдёт в prod. Каждый эксперимент это отдельный spec в проекте полностью оформленный по правилам spec-driven разработки. 

     

    Что по итогу и нахера вообще всё это?

     

    По итогу мы имеем (например) честный префлоп поля, против которого можем построить эксплойт с локами реальных диапазонов, а не frequencies. Берём HRC, лочим все позиции кроме одной какой-то, считаем, и так по кругу для каждой позиции. Получаем эксплуатирующий префлоп, нарезаем на чарты, отправляем лошадкам студентам школы. Разумеется я не верю, что в мире есть много игроков, кто сам способен просто для себя повторить такую систему, но как знать... вайбкодинг открыл какие-то запертые прежде двери.

    Сообщение отредактировал SnowBeaver - 13.8.2026, 23:48
    Ответить Цитировать
    484/491
    + 14
  • Ну и да, в этот раз пост очень тяжёлый вышел. Да я ещё и пытался очень сжато описать процесс. Если хотите чтобы я раскрыл какие-то детали, то мне не сложно. Только кому это нахер нужно, ведь все пришли чекнуть чё я бухнул же, да? 

     

    Я спецом пошёл в магаз и спросил что есть самое выдержанное. Мне предложили мавриканский ром New Grove 1969. Это не бог весть какой элитный напиток, но всё же обещают что какая-то часть спиртов в нём прям урожая 1969 года. Самые молодые 2008. Т.е. это напиток 20+

    Внутри коробки карта навевающая настроение дальних странствий. 

    жирная точка на карте справа это Ирада Зейналова

    По вкусу ощущается будто вы старый дед, не знаете на что уже тратить деньги и танцуете с креолкой

    New Grove Emotion 1969 - World best rum 2020 - Rhum Ile Maurice

    на фото не я

    Сообщение отредактировал SnowBeaver - Вчера, 0:05
    Ответить Цитировать
    485/491
    + 6
  •  SnowBeaver, возможно тупой вопрос, но как решал проблему того, что до шд доходят (= мы видим) только определенные категории рук, а остальные отваливаются? Или у тебя майнинг с полностью открытыми картами?

     

    И самое интересное не описано - как ты проверял "реальный префлоп диапазон" и точность предиктора по нему (я не МЛщик и даже не аналитик, может это очевидно).

    Ответить Цитировать
    3/4
    + 1
  •  Smozgly, абсолютно очевидная и самая важная часть. ты уловил самую суть. И ровно для её анализа вся система и делалась. Реальный префлоп диапазон я могу померить только на тех данных, где у меня вскрыты карты, т.е. для hero, который наиграл солидную дистанцию. И это данные валидации, которые участвуют в метриках, но не попадают в обучение, т.к. цель научиться на обычном майнинге без вскрытых карт. Да и самих данных хиро редко бывает миллионы рук. Т.е. метрики можно считать на открытых раздачах, а обучать систему нет. Других проектов в сети, которые бы делали тоже самое в покере я не нашёл. Даже крупные проекты вроде snapmda или mdademon эти моменты обходят и в основном показывают только частоты. 

     

    Как это устроено технически. Обучается модель на обычном майнинге, где карт нет,  и там она не пытается угадать конкретную руку игрока, а держит все возможные комбинации сразу и взвешивает их по линии: одними руками так открывают/колируют/рейзят часто, другими почти никогда. Дальше это уточняется по кругу: чем лучше модель понимает, как поле играет разными руками, тем точнее она взвешивает скрытые руки, и наоборот, делается несколько таких проходов по всей базе. Руки, которые всё же дошли до вскрытия, служат опорными точками, чтобы эти веса не оторвались от реальности.

    А проверка на hero-данных выглядит так: модель получает только то, что видел бы оппонент за столом - позицию, стеки, линию действий, борд, но НЕ карты hero. Она выдаёт диапазон, а я сравниваю его с фактической рукой, которая мне известна. Метрика - какую вероятность модель систематически даёт реально сыгранным рукам на десятках тысяч решений: её невозможно подогнать, хорошее число получается только если диапазоны реально угадываются. Отдельно сверяю частотные профили: как часто, по мнению модели, конкретная рука играется данным действием в данной позиции против того, как hero и поле реально её играют. И важная деталь, эти валидационные раздачи в обучение не попадают вообще, на них ничего не настраивается, иначе проверка превратилась бы в самообман.

     

    отправная точка по теории - кандидатская чувака с непроизносимым именем из Нидерландов написанная в 2010 году. Если вдруг захочется, то можно подрочить её с помощью AI. Просто в лоб я её в своё время месяц изучал пока всё не понял. Именно в ней описывается фундамент того, что такое EM-цикл по Байесу.  

    https://www.ai.rug.nl/~mwiering/Tom_van_der_Kleij_Thesis.pdf

     

    дико завидую чувакам на западе, которые могли выбрать себе покер как предмет исследований в универе, а не то говно что приходилось мне.

    Сообщение отредактировал SnowBeaver - Вчера, 13:55
    Ответить Цитировать
    486/491
    + 3
  • Если кто-то изучает префлоп работая просто скажем на h2n и не делает никакой коррекции, то видит картинку слева-сверху. Считать против неё эксплойт я бы не рекомендовал. 

    реальная же картинка у диапазона была справа сверху. можем видеть их расхождение. Снизу модель учится предсказывать данный диапазон на открытых картах (справа) и на закрытых (слева), Видим что модель учится с такой же точностью как если бы она видела здесь открытые карты хиро. События постфлоп позволяют догадаться до того, что было на префлопе. остаточная ошибка MAE (Mean Absolute Error) это то с чем можно продолжить бороться. Понять не шум ли это в данных, добавить ещё фич в предикторы и т.д. Но в целом оно уже неплохо работает и можно использовать в солвере для эксплойт стратегий.

    Ответить Цитировать
    487/491
    + 1
  • SnowBeaver @ 14.08.26 

    Реальный префлоп диапазон я могу померить только на тех данных, где у меня вскрыты карты, т.е. для hero, который наиграл солидную дистанцию.

    Так и думал. Тогда следующий вопрос - а как мы понимаем, что модель корректно предиктит поляну, а не только конкретного хиро? Сколько хиро было использовано?

    Ответить Цитировать
    4/4
    + 1
  • Smozgly @ 14.08.26  

    Так и думал. Тогда следующий вопрос - а как мы понимаем, что модель корректно предиктит поляну, а не только конкретного хиро? Сколько хиро было использовано?

    прилично. у меня разные алиасы есть. Но контроль поляны происходит в основном по непрямым метрикам. Да, мы не можем посмотреть как контбетит поляна напрямую, но мы скажем можем посчитать что предиктит модель на спаренных флопах для контбета и как это играет поле по частотам. Сам метод никак эти числа не использует в процессе оптимизации (хотя есть способы), просто использует как контрольную проверку чтобы понять если я пошёл куда-то не туда с EM-циклом.

     

    Грубо говоря, представь если модель тебе предсказала те же вскрытия, что и поле показало (основная метрика), плюс совпала с частотами основных действий с какой-то приличной выборкой. Да, она разумеется имеет погрешность, но это в практическом плане лучшее, что можно сделать.


    Ну и в принципе байесовские методы работают много где кроме покера, и я в целом не изобретал здесь велосипеда. Тут на входе у меня для каждой раздачи из базы есть на префлопе вектор из 1326 значений от 0 до 1. для известных рук со вскрытием у этого вектора одна единичка, остальные нули. Для неизвестного по умолчанию равномерное распределение, которое цикл за циклом по алгоритму выстраивается в максимально правдоподобную форму (минимально противоречащую историям раздач). Т.е. я получаю оценку диапазона в каждой руке таким образом, а диапазон в целом для поля это просто усреднение. И да, чем качественнее разбиение игроков на типы, тем лучше метрики по точности.

    Сообщение отредактировал SnowBeaver - Вчера, 14:45
    Ответить Цитировать
    488/491
    + 2
  •  SnowBeaver, а для пло планируешь похожее делать?

    Ответить Цитировать
    4/4
    + 1
  •  Lisenook, да, всегда ставлю цель дойти до омахи. Просто эксперименты на ней дорого ставить.

    Ответить Цитировать
    489/491
    + 2
  •  SnowBeaver, очень качественный контент на форуме.

     

    Два вопроса, если не в лом:

     

    1) ЕМ ведь приходит в ближайший локальный оптимум, а не в глобальный, и стартовая точка на это влияет. Гонял ли на разных кусках базы, и диапазоны получаются плюс-минус одни или расходятся? 


    И отдельно про отказ от ГТО: мотив понятен, не загрязнять данные. Но поле-то само частично учится по солверам, ты об этом и пишешь. Не пробовал взять ГТО как стартовую точку, от которой данные все равно попляшут туда, где поле отклоняется? Или в экспериментах это ухудшало метрики?

     

    2) Ты пишешь, что переход из одной касты в другую болезненный и требует смены нарративов в голове. Но чарт отвечает на вопрос "что делать", а не "почему поле так играет". Когда эксплоиты префлоп уходят в школу, дальше кто то объясняет ученикам логику за цифрами, или чарт идет как есть? 

    Интересно, где в цепочке живёт объяснение и что происходит, когда оно расходится с солвером, к которому человек привык.

     

    Спрашиваю не праздно: копаю в соседнюю сторону, работаю с тренерскими разборами, и как раз упираюсь в то, что цифра без объяснения не усваивается, а объяснение без цифры не проверяется.

    Сообщение отредактировал Hungry - Сегодня, 0:10
    Ответить Цитировать
    4/4
    + 0
  • Hungry @ 14.08.26  

    1) ЕМ ведь приходит в ближайший локальный оптимум, а не в глобальный, и стартовая точка на это влияет. Гонял ли на разных кусках базы, и диапазоны получаются плюс-минус одни или расходятся? 

    очень много всего... думаю где-то четверть экспериментов про это. В итоге в прод ушёл далеко не чистый EM, и инициализацию хотя я описал как со случайных (или равномерных весов), на практике всё же reach-скорректированные. Но вообще конечно оно зависит на каком куске базы запустил, для этого и есть общие метрики, в которые надо попадать. Поработать ещё есть над чем, но я там точность уже далеко не в разы увеличиваю. И если с разной базы беру куски для обучения, то да, они более менее стабильные. Скажем у меня база в 21 миллион рук, я могу рандомно выбирать 2 ляма рук, и префлоп будет уже стабилен. На постфлопе есть в каких-то местах вопросы. 

    И отдельно про отказ от ГТО: мотив понятен, не загрязнять данные. Но поле-то само частично учится по солверам, ты об этом и пишешь. Не пробовал взять ГТО как стартовую точку, от которой данные все равно попляшут туда, где поле отклоняется? Или в экспериментах это ухудшало метрики?

    для любого исследователя будет забавным сюрпризом насколько поле "учится" солверным линиям. То что я пока пробовал (не в рамках данного эксперимента) говорило, что GTO крайне далеко от поля. Вот скажем тут по целевой игре, для которой мне нужен промежуточный результат поле вроде как повторяет частоты открытия. Но если локнуть диапазоны в HRC и построить против поля эксплойт, то баттон надо играть на 20 процентных пунктов лузовее. 

     

    Экспериментировать никто не мешает. Подмешивать например в какие-то недопредставленные точки руки сгенерированные по GTO. много чего можно сделать. Вообще процесс глубоко творческий. Проблема с GTO в первую очередь такая, что на разном рейке, разном формате игр и ещё много чём оно будет отличаться и его надо считать. А если метод исключает использование этого сигнала, то я могу учить широкий ассортимент игр. Хочу MTT в коротких стеках, хочу игры со страддлом и т.д. Т.е. я бы мог рассмотреть GTO как какой-то файнтюнинг уже работающей модели по какую-то игре, где хочу поднять точность. Но без гарантий, что это бы сработало. Надо пробовать, жечь процессорное время, ждать, оценивать. 

     

    модель, которая справляется без опоры на GTO для меня ценее более точной гибридной модели. Потому что это легко оборачивается в функционал, где пользователь кидает в систему свою базу наигранную и получает на выходе что-то самостоятельно работающее. Мне не надо соревноваться с крупными конторами в ресурсах потраченных на вычисления, их одиночке никогда не превзойти. 

    2) Ты пишешь, что переход из одной касты в другую болезненный и требует смены нарративов в голове. Но чарт отвечает на вопрос "что делать", а не "почему поле так играет". Когда эксплоиты префлоп уходят в школу, дальше кто то объясняет ученикам логику за цифрами, или чарт идет как есть? 

    Интересно, где в цепочке живёт объяснение и что происходит, когда оно расходится с солвером, к которому человек привык.

     

    Спрашиваю не праздно: копаю в соседнюю сторону, работаю с тренерскими разборами, и как раз упираюсь в то, что цифра без объяснения не усваивается, а объяснение без цифры не проверяется.

    ну это вообще фундаментальная проблема, которую обычно пытаются смазать. Типа вот тебе gtowizard, сиди дрочи. Современный покерный мейстрим заточен на запоминание, а не понимание. Я не знаю универсального решения. Сам лично люблю строить деревья на основе матрицы бакетов, и потом упрощать их. Типа вот такого https://forum.gipsyteam.ru/index.php?viewtopic=172401&view=findpost&p=7663977 , но я не могу похвастаться что кому-то продал метод :) Тренеры (и игроки) уже какое-то время живут с GTO и научились общим каким-то принципам из этих решений. Эту работу надо проделывать заново под эксплойт, искать паттерны. Ну если типа хочешь денег, а не месить рейк. Легко не бывает. Но в принципе можно здесь тоже LLM поиспользовать контроллируемо. Я как-то делал прототип https://forum.gipsyteam.ru/index.php?viewtopic=172401&view=findpost&p=8149468 - мы строим деревья решений на основе матриц для двух сравнимых точек (наприме GTO vs Exploit), просим LLM рассказать нам тезисно где решения расходятся. Особенно в омахе оно нужно, где у тебя нет возможности легкой визуализации диапазона.

    Сообщение отредактировал SnowBeaver - Сегодня, 5:00
    Ответить Цитировать
    490/491
    + 1
  •  SnowBeaver, А ты где-то выкладываешь свои проекты?

    Ответить Цитировать
    1/1
    + 0
  • MartinIJL @ 15.08.26  

     SnowBeaver, А ты где-то выкладываешь свои проекты?

    обычно нет. Раньше до того как все стали программистами мог какой-то кусок кода показать. А сейчас вроде как уже не за чем. Всё что здесь выкладываю это либо часть рабочего процесса на кого-то, это оплатили и не стремятся превратить в opensource, либо я сохраняю для себя чтобы потом кому-то предложить из будущих заказчиков из категории "смотри как я умею". Да и не думаю что хоть чего-то из представленого имеет в текущем виде практическую ценность. Скорее возможность подглядеть и сделать также.

    Ответить Цитировать
    491/491
    + 2
1 50 51 52
1 человек читает эту тему (1 гость):
Зачем регистрироваться на GipsyTeam?
  • Вы сможете оставлять комментарии, оценивать посты, участвовать в дискуссиях и повышать свой уровень игры.
  • Если вы предпочитаете четырехцветную колоду и хотите отключить анимацию аватаров, эти возможности будут в настройках профиля.
  • Вам станут доступны закладки, бекинг и другие удобные инструменты сайта.
  • На каждой странице будет видно, где появились новые посты и комментарии.
  • Если вы зарегистрированы в покер-румах через GipsyTeam, вы получите статистику рейка, бонусные очки для покупок в магазине, эксклюзивные акции и расширенную поддержку.