Дневник c00l0ne

91
91
Статистика темы
  • Популярность
    Топ-2697
  • Постов
    11,212
  • Просмотров
    1,029,036
  • Подписок
    91
  • Карма автора
    +1,145
1 553 554 555 556 561
  • про ИИшку : поюзал  на огромных проектах с кодовой базой 40к+ строк кода и  могу  сказать что  работает очень хорошо,  математику понимает глубокую, задачи понимает  глубоко ... код пишет на удивление чисто ...  абсолютно без тестов работаю... очень мало ошибок ,  крайне  мало ,  не знаю где  люди берут эти все  галлюцинации...  но я за  последние 2  месяца  косяков  не видел  ...  и  это в  проектах  с  40к +  строк  кода  ...  программирование  умерло окончательно  и  бесповоротно ... 

    классическое где  ты  сидишь идею обмусоливаешь  месяц,  потом  подходишь к  компу  и  пишешь код еще  неделю  и потом неделю еще  отладкой  занимаешься  )))  

    теперь 5 минут назад возникшая мысль влетает  в  чат  к  gpt -5.5 pro  который через  10 минут дает  наполеоновский план  "по захвату  мира"  мощнейшего проекта  со строгой  математикой,  который  через  1  час лежит в папочке ... написанный  codexом ... 

    а вот  чемпионом олимпиад : gemini  3.1  pro  не  пользуюсь 

    пользуюсь подпиской openai, а opus 4.7  через  api идет ... 

    рабочая лошадка gpt-5.5  (теоретическая  база  проекта остается  за  gpt-5.5  pro ) 

    обычно беру  какую-нибудь интересную статью  с arxiv и прогоняю через модельку gpt-5.5  pro , она дает скелет  и уже закидываю  этот скелет  в  codex с gpt-5.5  которая пишет код , а  потом уже этот код могу закинуть  в opus 4.7 на проверочку)

     

    несколько тысяч  долларов залудил в  эти иишки через api ,   сейчас подписку  только купил ...  

     

    1. что можно сделать в  будущем ,  если появиться доступ  к 1000  ядрам можно китайский посчитать стартера полностью 

    (прям с учетом всего  всея  ,  каждого сброса и каждой стратегической  механики ) 

    простенькие споты можно и сейчас попробовать посчитать , выше приводил пример

    2. есть солвер  холдемовский в паблике , можно  его покрутить и сделать челоГТО, без весов , т.е. 1 или 0  на каждой руке и  сравнить например с  оригинальной весовой гто... 

    3. посчитать  эксплойты на базах  чем  занимается SnowBeaver... 

    4. склонировать платные программы icmizer'ы  и тому подобные 

    5. сделать трекеры крутые ака pokertracker 4 или  holdem manager  какой там  сейчас версии последний  3?

    6. прочий прикладной софт  ... всякие ежедневники, напоминалки, туду листы... сайты ,форумы ... да все что в  голову АБЦ придет ... 

     

    сложных проектов  не  бывает,  только SOTA какие-то  ...  

    все упирается в производительность вычислительную  и  человекочасы ...  


    в целом прилично набросал  на вентилятор ... ) snowbeaver твой выход )

    ТЕМА ЗАКРЫТА
    7635/7738
    + 0
  • Любителям холдему, кто играет стратегию без рандомайзера:

    Те могут быть эксплуатированы на 70/100 бб

    Хех:

    ПивоСолвер такое не показывает

     

    70/100 многовато что то надо искать ошибки что там ИИ находил...

    Сообщение отредактировал c00l0ne - 12.5.2026, 4:45
    ТЕМА ЗАКРЫТА
    7636/7738
    + 0
  •  c00l0ne, мой опыт работы с солверами и равновесными стратегиями обширный... собственно может быть он топовый в русскоязычном сегменте. За наиболее сложными задачами приходят обычно ко мне, т.к. никто больше не предоставляет таких услуг. может гоню, у меня просто нет таких контактов кто бы занимался в таком же объёме как и я. 

     

    что касается чистой игры по гто, то тут есть несколько утверждений, которые я проверял, доказывал на данных и т.д. под гто пока понимаем равновесную стратегию без локов (дефолт типа как в gtowizard)

     

    1. чем короче столы, тем более применима gto стратегия напрямую. В HU это разъёб. В спинах тоже работает, но надо играть ещё мультивеи и некоторое количество постфлопа, которого в gto префлоп-стратегиях не будет. Точное количество для спинов не считал. Но думаю процентов 15-20 рук не покрывается gto в 3-max игре. Как в HU так и в спинах даже базовая подстройка к частотам поля бустит твой винрейт столь значительно, что люди прекращают там играть гто-шные стратегии (префлоп) при получении отсчитанных эксплойтных префлопов. Научиться играть префлоп по паку из солвера не сложно. 

     

    2. в 6max играх GTO-шные стратегии покрывают плюс минус 60% рук на постфлопе. Да и на префлопе ты не будешь знать как играть против 3х лимперов или колд-кола 3бета в холодную. Даже на тех 60% рук, что покрыты чистая gto игра даёт винрейт около нуля после вычета рейка. Т.е. такая игра не имеет смысла. 

     

    3. да, это прикольно из академического интереса сравнить gto стратегию против эксплойта с целью образования и улучшения навыков. Но тут есть два "но" - первое "но" - если ты изучил эксплойт, то тебе gto нужно только для оценки ev твоей эксплуатирующей стратегии, ты играть по нему уже никогда не будешь, т.е. интерес плюс-минус праздный, хотя это конечно полезно знать при аналитике где важны количественные характеристики для сравнения. Но это очень сложно, и большинство команд обходятся. Ну или имеют представление о стратегиях в "бакетированном" виде (типа флашдро + пара ставит в GTO и т.д. переход к эвристикам от просмотра паков). Второе "но" - как только ты перешёл на постфлоп, то ты это скорее всего сделал не по gto (твой оп уж точно). И судить что там будет на ривере с помощью gtowizard некорректно. Может совпасть, а может быть с точностью до наоборот. Диапазоны то другие на входе в каждую следующую улицу. 

     

    4*. Даже в базовых документах описывающих CFR и вообще равновесные решения указывается, что в играх на много игроков данные стратегии работают хуже, если вообще применимы. Но все в покерном сообществе это проскипали. Их право вобщем-то. 

     

    5*. Избыточное внимание к gto пакам в 2026 увы приводит к ухудшению винрейтов у уже успешно играющих игроков если делать это бездумно и просто думать, что gtowizard это правильно. Я пока не знаю ни одного примера регуляра, кто бы скажем катал 5bb/100, а потом начал задрачивать gto и стал бы играть скажем 8bb/100. Возможно такие люди есть, просто ну вот не знаю прецедентов. А наоборот знаю. Имхо хорошая практика (полезная) это самому сидеть в солверах, ковырять диапазоны согласно своему представлению об игре оппонента что-то лочить, и смотреть ответ. Но это муторно, занимает время, а люди хотят всегда попроще. Но практики проще не дают прироста винрейта. Если в какой-то момент ты чувствуешь, что сильно упростил себе жизнь, то тут всегда надо изучать какова цена за это упрощение. Очень часто это потеря реальных существующих навыков. 

     

    хочешь верь, хочешь нет :) это база, но её мало кто знает

     

    p.s. иметь baseline всегда хорошо если у тебя есть что с ним сравнивать. Если нет - то это надо сдавать в музей "мер и весов". И GTO это стратегия игры от защиты. Сама по себе она много денег не приносит. Но да, если ты понимаешь в каком-то споте GTO игру, то можешь меньше потерять против сильного и\или неизвестного игрока. Но имхо, лучше заранее пройти стадию MDA и иметь инфу о температуре по больнице.

    Сообщение отредактировал SnowBeaver - 12.5.2026, 7:05
    ТЕМА ЗАКРЫТА
    93/125
    + 2
  • Пока спал, цифортки подтвердились

    Без рандомайзера стратегия дырявая на 60-70 бб/100 (о май гад, ведь многие играют без рандомайзера)

    С одним доп весом 0.5 на 20бб/100

    С двумя доп весами 0;0.33;0.66;1 на 11бб/100

    С тремя доп весами (.25;.5;.75) на 7бб/100

    Дальше думаю бессмысленно, человек никогда не сможет запомнить

    Спот такой:buvsbb 50eff (5bb банк)

     

    ps чистое гто vs дискретное считается

    думаю порядка 20 бб/100 будет при одном весе, порядка 15 бб /100 при  двух весах 

    и при трех 10бб/100 

    почему больше  чем эксплуатируемость, потому  что у чистого гто стратегия  более емкая  чем у дискретных 

    думаю она на 5 бб на сто где  то глубже ... 

    ждем кодекс кодит ...

    Сообщение отредактировал c00l0ne - 12.5.2026, 15:55
    ТЕМА ЗАКРЫТА
    7637/7738
    + 0
  • а пока новости робототехники  : 

    всего 650к стоит зеленых , надо  брать деткам поиграться в дубаях 

    робот высотой  4 метра  где-то 

    подмигни два раза  

     

    ТЕМА ЗАКРЫТА
    7638/7738
    + 0
  • Про музыку

     

     

    c00l0ne @ 12.05.26  

     

    чистое гто vs дискретное считается

    думаю порядка 20 бб/100 будет при одном весе, порядка 15 бб /100 при  двух весах 

    и при трех 10бб/100 

    почему больше  чем эксплуатируемость, потому  что у чистого гто стратегия  более емкая  чем у дискретных 

    думаю она на 5 бб на сто где  то глубже ... 

    ждем кодекс кодит ...

     

    Короче это не так совсем работает как я думал, оказывается любая посчитанная стратегия в солвере уже равновесная и она отличается только эксплуатируемостью 

     

    Потому что выше эксперименты против весовой ГТО дискретная показывает ровно 0 различий, потому что дискретная это тоже ГТО(в которой отключил я веса), но которое содержит дыры которые можно эксплойтить из-за того что нельзя весами ходить

     

    Такие вот открытия , т.е. в теории Фиш потенциально льющий 70 бб на сто может против ГТО сыграть в ноль, угадав равновесную стратегию ... Жесть?

    ТЕМА ЗАКРЫТА
    7639/7738
    + 0
  • Расходимся камрады

    CFR гамно

    Завтра нормальной оптимизацией попробую ещё и можно сдаваться)

    Шучу, "никогда не сдавайся"

    Дожмем холдем

    Выше оценки все не верные потому что cfr насчитал там гамно

    ТЕМА ЗАКРЫТА
    7640/7738
    + 0
  •  оч  круто  смотреть на  попытки  codex  пробиться  в гто стратегию квантованную в 0  и  1  

    эксплуатируемость с 0.7  он  уже понизил до 0.5  ...

    но  дальше только полное решение предлагает ...

    30 часов  уже  бьется  ...

     

    иногда просыпаешься такой  ,  а  вот сейчас спутниковый интернет, gprs включу покачаю фильмы потратив  пару дней  , музычку  ,  потом  послушаю  посмотрю,  на  ебай  что  нибудь закажу перепродам )) (2002 год)  ... 

    НО  НЕТ ,  просыпаешься и окуеваешь  2026  год  на дворе , быстрей  к codex 'у  что он там наделал  за  ночь ...

    первый вопрос  "чем  занимаешься AI?  " "что за  ночь получилось сделать ?" ... 

    вау эффект every day


     


    про  мтт  покердома :  джокеры кто -  нибудь побил в мтт ?  или тупо  рулетка, всегда есть  20-30%  вылететь  с раздачи

    имхо покердом испортил  мтт когда  ввел  джокеры,  не рекомендую  в них  играть

    ТЕМА ЗАКРЫТА
    7641/7738
    + 0
  •  про mythos(модель обновили):

     

    ТЕМА ЗАКРЫТА
    7642/7738
    + 0
  • c00l0ne @ 13.05.26  

    пробиться  в гто стратегию квантованную в 0  и  1  

    Не справился gpt-5.5 pro пробиться туда ну и не должен был, все же комбинаторный взрыв и не решаемая задача на современном оборудовании, ка стартера в китайском

    Остаётся только cfr 

    Ну и эксплойты 

    Все реги кто играет без рандомайзера подвержены автоматическому эксплойту в 5-30 бб/100 от гто

    Фиши там вообще пропасть

    SnowBeaver не считал детерминированное ГТО? Что-то ты промолчал на эту тему) ты вообще всегда молчишь когда дело жаркое

     

    Ладно расскажу, короче можно сделать 3-10 бб на сто будет погрешность , но нужен суперкомпьютер и оч большой и крутой ядер 10к+ лучше 100к+

    Вот тогда можно посчитать детерминированное ГТО, которое каждый Фиш сможет освоить, ну а пока три миллиона весов надо запомнить чтобы быть гтошником

    В целом  был эксперимент "cfr солвер испытать на максималках"- тест пройден, как gpt5.5 pro обращается с ним, как с калькулятором) оч круто смотреть на это...

    Сообщение отредактировал c00l0ne - 14.5.2026, 6:44
    ТЕМА ЗАКРЫТА
    7643/7738
    + 0
  •  Upd дожал

     codex за ночь посчитал для терна

    Полным перебором

    Для флопа нереалистично

    Ну это победа

    ГТО без весов 3бб/100 на терне

    GtoWizard курит в сторонке)

    ТЕМА ЗАКРЫТА
    7644/7738
    + 0
  • отдых до 

    если есть идеи что еще можно посчитать (любые алгоритмы любая сложность)

    чиркните сюда или в лс 

    желательно что-то очень сложное)

    ТЕМА ЗАКРЫТА
    7645/7738
    + 0
  • robot figure 

     "на  работе"

     

    ТЕМА ЗАКРЫТА
    7646/7738
    + 0
  • заметили  :

     

    ТЕМА ЗАКРЫТА
    7647/7738
    + 0
  • подскину наработки, вдруг тут есть кто продолжит, codex недельку пыхтел но не справился: 

    холдем, пуризация стратегий (есть такая проблема, возьмем любой солвер он считает гто , а гто это смесь весов и даже малейшее нарушение вызывает сильное расхождение с посчитанной стратегией, открываются дырочки и уже есть сильный эксплойт) , к тому же запомнить сложно и понять сложно логически, весовые стратегии человеку сложны ...  

       но можно сделать ГТО без весов , когда стратегия раскладывается на "чистые" руки , рандомизация происходит через масти... 

    это так называемые "топовые" стратегии гтошные , которые вы увидите на самых высоких лимитах 

    солвера для "чистого" гто я не видел 

     

    была поставлена задача codex : переделать солвер cfr (в данном случае алгоритм discount cfr в pure "чистый" solver ) 

    мат часть от opus 4.7 с моими комментариями

    это очень слабый метод , piosolver делает так да в целом любой нуб кто с солвером дружит делает так , но эксплуатация под 50бб/100 , при оптимизации 10-15бб на сто 

    очень слабый метод 

    это то же самое с откидыванием низа 

    это тоже самое чуть чуть получше 

     

    у меня codex дошел  до алгоритма double oracle  или psro его называют 

    кратко строится cfr mixed решение и окруляется в квант Q1

    далее от этого кванта стартуем пытаясь погасить эксплуатируемость против Best Response стратегий : 

    сходимость не понятная 

    алгоритм выбран в принципе правильно 

    строиться таблица мешится из кучки BR стратегий и собственно находиться mix vs CFR + BR(n)

    проблема в том что сходимость не доказана , потому что мы переходим в Q1 квантованную стратегию где 0 и 1 вероятности ходов , в этом пространстве CFR бессилен  , ему нужно гладкость функций а в дискретном мире все происходит очень резко , но в целом к чему то там сходиться , что то там улучшается , короче тяп ляп да работало 

    далее ради эксперимента интересно было куда отправяться нейронки в поисках более точных решений : 

    нейронки пошли адаптацию делать 

    ну это дефолт стратегия в таких случаях 

    предложено было от чистой стратегии отказаться  : 

     

    далее psro на мешах 

    далее exact локальный поиск  : 

    ну грубо говоря это полный перебор 

    да холдем тоже решается точно только полным перебором ... если вам нужна чистая стратегия ... 

    лично мое мнение это самый сильный и точный метод ( вообще  единственно правильный, все остальное выглядит тыкну пальцем в небо ) 

    дальше вода от нейронки , сложная задача бла бла бла 

    fictitious play : 

    неплохой локальный метод предлагает

    далее инерцию вводит : 

    усреднение : 

    мастевые рандомайзеры и карточные : 

    все вместе 

     

    ну а дальше еще конкретно реализацию очень долго мучает но в  целом приходит к локальной средненькой оптимизации , так и не решив полностью задачу
     

     

     

    пс потом напишу свое мнение про все эти ИИ и тыды тыпы 

    кратко в сложных алгоритмах ИИ работают, но уровень еще не высок

    на примере полного решения холдема пока пасуют

     

    ps если кто -то решит я думаю такой солвер стоит от  1 млн $ :) чиркните в лс

    алгоритмы на которые нужно смотреть 

    1. Monte Carlo Security Check

    2. Deep PSRO(старкрафт им решали кстати)

    3. Абстракции ( но это уже не интересно)

    Сообщение отредактировал c00l0ne - 18.5.2026, 13:13
    ТЕМА ЗАКРЫТА
    7648/7738
    + 0
  • c00l0ne @ 18.05.26  

    кратко в сложных алгоритмах ИИ работают, но уровень еще не высок

    Ага, и крутишь потом 2к+ итерации того, что сошлось уже на ~30. RIP проц.

    В целом, если нужны идеи которые с обучением помогут тебе (если собрался играть холдем):

    1) Можешь банду агентов попросить добавить функционал в этот опен-сорсный солвер, например Incentives как в PIO. Помимо топорного функционала, Incentives потом можно конвертнуть в поиск "эмуляции стратегии поля". Если по CFR кажет Fold/Call/Raise 40/45/15, а у поля 50/40/10 можно через: 

    "сменить Incentive по алгоритму->resolve->сравнить частоты с таргетными" 

    находить и типа страту поля, и свой ответ. Incentive менять через самые простые шаги: больше чем надо = -5, меньше чем надо = +5. Одно из действий поди нужно оставлять нетронутым, Fold и Check пропускать, Call/Rase и Bet править incentivеами.

     

    2) Из той же оперы, но более изощрённое:

    ### 2. Constrained CFR (Theoretical Foundation)

    The paper **"Solving Large Extensive-Form Games with Strategy Constraints"** by Trevor Davis (2018) provides the theoretical foundation for exactly what you're trying to do. This paper introduces **Generalized CFR** that can handle **any feasible set of convex constraints**, including fixed action frequencies.

    **Key insight from the paper:**
    - Standard CFR uses regret matching to select strategies from the **probability simplex** (unconstrained except for probabilities summing to 1)
    - Constrained CFR replaces the simplex with a **convex feasible set** defined by your constraints
    - The algorithm uses **projected regret minimization** instead of standard regret matching

    **Mathematical approach:**
    Instead of standard regret matching:
    $$\sigma^{t+1}(I, a) = \frac{R^t_+(I, a)}{\sum_{a'} R^t_+(I, a')}$$

    You use **projected gradient descent** onto your constrained set:
    $$\sigma^{t+1} = \text{Proj}_{\Delta_{\text{constrained}}}(\sigma^t + \eta \cdot \text{regret})$$

    Where $\Delta_{\text{constrained}}$ is the simplex intersected with your frequency constraints (e.g., $\sigma(\text{Fold}) = 0.5$, $\sigma(\text{Call}) = 0.4$, $\sigma(\text{Raise}) = 0.1$).

     

    ### 4. Augmented Lagrangian / Penalty Method

    For a more sophisticated approach that allows "soft" constraints (where you penalize deviation from target frequencies rather than hard-locking):

    **Mathematical formulation:**
    Add a penalty term to the optimization objective:
    $$\mathcal{L}(\sigma, \lambda, \rho) = \text{Exploitability}(\sigma) + \lambda^T(c(\sigma) - b) + \frac{\rho}{2}\|c(\sigma) - b\|^2$$

    Where:
    - $c(\sigma)$ are the action frequencies
    - $b$ are your target frequencies
    - $\lambda$ are Lagrange multipliers
    - $\rho$ is a penalty parameter

    This is the **augmented Lagrangian method**, which iteratively:
    1. Solves the game with current penalties
    2. Updates $\lambda$ based on constraint violation
    3. Increases $\rho$ if needed

    Я колхозный Лагранж делал и префлоп и постфлоп, но это впринципе интересная штука для получения эксплойта, где мы подстроились к подстройке оппа. В самом простом варианте на префлопе можно в HRC провернуть:

    а) Против дефолтной защиты ББ от нита у нас пролазит 100% стил.

    б) Понятно, что если мы начнём стилить 100% это легко заметить и дефолтная защита нита изменится.

    в) В ХРЦ или локаем пару его частот или делаем ему "ожидаемую подстройку" и лочим все частоты. В итоге стил уже 75%.

    г) Даже у 75% все худшие комбинации в 0 или - при тестах в игре.

    Поэтому это гораздо более гибкий и полезный подход, чем абсолютизм локов, который сейчас абсолютно везде. И ты должен знать как кто играет (ну ок база/майнинг есть) и как кто подстраивается. И можно с помощью весов выстроить страту, которая ориентируется на солверную, но стремится в частотах к более реальной. 

    А на эксплуатируемость и потери ЕВ тупо забить. Потому что в анализе данных на постфлопе с рейзами: если у тебя 6%(нит) оппы оверфолдят, если 10%(таг) норма, если 18%(лаг) как вс нормы ответ, вс 25+% начинают жёстче отвечать. Т.е. единственная зона халявы(в плане ответа оппа)  у лагов, и можно просто стремится к их частоте. 

    С весами это проще реализовать, и рейнджи будут более адекватные, т.к. тяжелее сломать самое предпочитаемое солвером действие. А не как сейчас "лочим в ХРЦ/PIO частоту, получаем 20 комб которые можно рейзить с 5% частотой в блеф". СПАСИБО!

     

    3) Фриз страты оппа. Опять пропуск недостатков из 2-го пункта. Но вот на примере округлённой страты (где ставим 0 или 1, или там 0.25, 0.5, 0.75 шаги), это как раз то, что ей не хватало. Можно солвануть дефолтно (с любыми частотами), потом зафризить оппа и уже себе делать округление через новый (второй) солв. Так и сходиться будет быстрее. А то как ты делал, где или оба округлённые, или ты округлённый а опп тебя потрошит идеальными 5.6789% частотами, страдает из-за динамических подстроек. А так получится, что оппа ты локнул на "дефолтное ГТО", а сам округляешься против него и разводишь пограничные комбинации по действиям. 

    В итоге если комбобакеты визуализируешь, там мешанины не будет и гораздо удобнее запоминать, как играть какой-то конкретный спот. 

    Или если нужно рейнджи набирать под какой то %, у тебя есть пул комбинаций из суб-оптимального решения. Я сравнивал для тёрна потерю ЕВ для такого типа рейнджей, где сам рейндж ГТОшного размера (7.3%), но композиция набиралась из этих (0 или 1 вес/частота) комбинаций. Там очень слабые потери ЕВ, потому что:

    а) сильные комбы отправляются в колл полным весом, а не на 0.85

    б) подстройка к этому у оппа должна происходить на предыдущей улице (флоп), а у него уже просто его рейндж тёрна.

    В итоге часто его беты и рейзы вообще откатываются ниже ГТОшных значений. И его подстройка получается "чел не миксует, поэтому я играю пассивнее". Люди вообще так не рассуждают, а наоборот всегда связывают неумение миксовать с оверфолдами+недорейзами+предсказуемостью.

    Так что у топорной страты даже преимущества могут быть в реальных условиях.

     

    Главный минус у неё, что не видно эти комбинации, которые в солвере предпочитают рейз на <=33%. Просто спрашивая себя "Почему?" можно неплохо постфлоп прокачать. Если ИИ в АФК режиме будут фэйлить, можешь вот этим напару с ними заняться. Давать им все параметры (отравленные/чистые ранауты, чистое эквити и т.д.) и смотреть разберутся они или нет с логикой. Я пробовал на более простой задаче с "флопами с схожей стратегией в солвере", но они так и не объяснили, почему аутлаеры сходятся/различаются по страте, т.к. у них нет тренинга о том, что наполнение рейнджа ранками напрямую влияет на стратегии. Даже простой пример с смена туза на короля у "флоп-сосед" на наводит их на мысли, что в дуэли рейнджей наполнение по тузу и королю разное будет. 

    А так, может эти навороченные модели выдадут то, что и реги не понимают. Тем более что у регов анализ масс флопов по стратам это:

    а) аггрегат репорт........................ 

    б) группировка по великим категориям (хай кард, сьютед, спаренная)

    Так что есть непаханная целина для жестянок.

    ТЕМА ЗАКРЫТА
    3/3
    + 2
  • c00l0ne @ 18.05.26  

    думаю такой солвер стоит от  1 млн $

    Оказывается такие солвера уже существуют 

    Например Gurobi 

    От компании IBM CPLEX ещё есть...

    Короче от топ команд и самое интересное стоимость ) 200к баксов в год)

    Удалось чуть чуть попользоваться Gurobi ,  хз что там внутри, но оно работает оч быстро и невероятно на размерностях 3^100000, страшно представить сколько десятков лет это оптимизировали...

    Ценник конский само собой...

    ТЕМА ЗАКРЫТА
    7649/7738
    + 0
  •  ExeRco, привет,

    Попозже прочитаю внимательно твое сообщение и отвечу тебе

    Краем глаза посмотрел : вы упор делали на Best Response, вы не считали эксплойт, вы считали Best Response , который считается мгновенно, чтобы считать эксплойт нужен солвер выше приведенный, они стоят по 20к баксов в мес потому что работают с гигантскими размерностями оч быстро...

    Ты же из команды awake...?

    1) cfr и поляна это две разные стратегии, нету смысла в cfr весовой стратегии искать частоты поля) их банально можно задать из базы майнинга... Как делает SnowBeaver 

    2) ты пишешь без эксплуптируемости считал, дело в том что ты не можешь предполагать с уверенностью в какую сторону оппонента клонит... Поэтому если его отклонит в другую сторону против которой у тебя cfr этот посчитан, то этот оппонент пробьет твою стратегию в около best response ) с винрецтом +30бб/100)" главное в борьбе с монстрами не стать самим монстром" т е в попытке эксплойтить не подставиться самому

    3) это колхоз нагороженный попозже отвечу 

    Ну и дальше ты в другую сторону мыслишь из-за колхозных расчетов

     

    Ну ИИ это приближенные расчеты, я такими не занимаюсь, только точные академические расчеты обоснованные математической теорией

    Сообщение отредактировал c00l0ne - 20.5.2026, 19:13
    ТЕМА ЗАКРЫТА
    7650/7738
    + 0
  • ExeRco @ 20.05.26  

     

    3) Фриз страты оппа. Опять пропуск недостатков из 2-го пункта. Но вот на примере округлённой страты (где ставим 0 или 1, или там 0.25, 0.5, 0.75 шаги), это как раз то, что ей не хватало. Можно солвануть дефолтно (с любыми частотами), потом зафризить оппа и уже себе делать округление через новый (второй) солв. Так и сходиться будет быстрее. А то как ты делал, где или оба округлённые, или ты округлённый а опп тебя потрошит идеальными 5.6789% частотами, страдает из-за динамических подстроек. А так получится, что оппа ты локнул на "дефолтное ГТО", а сам округляешься против него и разводишь пограничные комбинации по действиям. 

    В итоге если комбобакеты визуализируешь, там мешанины не будет и гораздо удобнее запоминать, как играть какой-то конкретный спот. 

    Или если нужно рейнджи набирать под какой то %, у тебя есть пул комбинаций из суб-оптимального решения. Я сравнивал для тёрна потерю ЕВ для такого типа рейнджей, где сам рейндж ГТОшного размера (7.3%), но композиция набиралась из этих (0 или 1 вес/частота) комбинаций. Там очень слабые потери ЕВ, потому что:

    а) сильные комбы отправляются в колл полным весом, а не на 0.85

    б) подстройка к этому у оппа должна происходить на предыдущей улице (флоп), а у него уже просто его рейндж тёрна.

    В итоге часто его беты и рейзы вообще откатываются ниже ГТОшных значений. И его подстройка получается "чел не миксует, поэтому я играю пассивнее". Люди вообще так не рассуждают, а наоборот всегда связывают неумение миксовать с оверфолдами+недорейзами+предсказуемостью.

    Так что у топорной страты даже преимущества могут быть в реальных условиях.

     

    это   самая  интересная тема тобой поднятая : ну это подсчет эксплойта 

    допустим мы знаем стратегию оппонета , а как же эксплойтить ...  CFR посчитает  Best Response , он не посчитает тебе эксплойт , либо тебе придется файн тюнить ГТОшку как выше я уже писал SnowBeaver'у ,  кажется он не понял идею вообще ... 

    на   CFR   против фиксированной  стратегии  ты посчитаешь  Best Response , CFR подойдет  с одной  стороны  и  сделает макс  ев , а все другие стороны останутся оголенными  и будет сильный эксплойт  с них ,   это проблема CFR что  она усредняется и не исследует хорошо стратегии  ... например как полный перебор exact методы ... которые уже дыр не оставляют ... или какие то локальные патчи стратегий ... 

    "там 0.25, 0.5, 0.75 шаги"

     

    это все для ботов и рта считается весовые CFR , никогда ты человек не сможешь запомнить никакие частоты постфлоп, извини конечно что сомневаюсь в  твоих способностях  но это нереально запоминать тысячи цифр ради  гто  )

    проще запомнить  вот это фиш с него добираем, а это ссаные реги катает аккуратно , этого уже достаточно чтобы зарабатывать )

    везде где используются веса я   бы  сразу метил челов либо ботом либо "псевдогтошником" который не понимает что делает

    ExeRco @ 20.05.26  

    А то как ты делал, где или оба округлённые, или ты округлённый а опп тебя потрошит идеальными 5.6789% частотами, страдает из-за динамических подстроек.

    мэн ты  ошибаешься , чистая  стратегия  не  проигрывает гтошке, она играет  с ней в  околонуля... гтошка  не пробивает чистую ... у чистой есть проблема, она не считается с помощью CFR , а если считается то остается гора эксплойта ... которую  очень сложно закрыть , потому что когда происходит округление, теряются тонкие механики, доли весов обнуляются, блефы теряются тонкие велью , а чтобы их восполнить , нужно заново пересобирать стратегию , а это опять дерево трясти , а кто этим будет заниматься ? CFR не умеет, оно опять веса потрясет и опять округление и опять сбилась стратегия если в квант 0 и 1 делать ... понятно что добавив веса эти проблемы исчезают ну хотя бы в 2 бита это 0 0.5 1 ... но это уже весовая стратегия...  остается полный перебор или локальные патчи, полный перебор = не возможен в холдеме, локальные патчи = не правят стратегию глобально ... остаются крутые солвера mip которые стоят по 20к баксов в мес) и как то умудряются это считать )

    вот к чему я пришел ...

     

    немного крутых расчетов : 

     

    гтошка рейзит именно эти тройки с минусовой ЕВШКОЙ чтобы иметь блефы в линии ) потому что другие руки открывают большие дыры ... вот именно такие дыры CFR не сможет залатать против фиксированной стратегии...

    эта стратегия mip солвером посчитана...

    Сообщение отредактировал c00l0ne - 20.5.2026, 20:03
    ТЕМА ЗАКРЫТА
    7651/7738
    + 0
  • ExeRco @ 20.05.26  

    Главный минус у неё, что не видно эти комбинации, которые в солвере предпочитают рейз на <=33%. Просто спрашивая себя "Почему?" можно неплохо постфлоп прокачать. Если ИИ в АФК режиме будут фэйлить, можешь вот этим напару с ними заняться. Давать им все параметры (отравленные/чистые ранауты, чистое эквити и т.д.) и смотреть разберутся они или нет с логикой. Я пробовал на более простой задаче с "флопами с схожей стратегией в солвере", но они так и не объяснили, почему аутлаеры сходятся/различаются по страте, т.к. у них нет тренинга о том, что наполнение рейнджа ранками напрямую влияет на стратегии. Даже простой пример с смена туза на короля у "флоп-сосед" на наводит их на мысли, что в дуэли рейнджей наполнение по тузу и королю разное будет. 

     ну  смотри там чтобы этому научить иишку нужно триллиард  раздач ,   а такое обучение будет  стоить около gpt  4 , миллионы долларов ,если  трансформер  учить без   фич

    но можно  пойти "простым"  путем) делаешь локальный солвер веток и начинаешь  вместо фич и  вот этого всего гавна на  вход  подавать уже евшку локально решенных задач , вот тогда  твоя сетка ухватится за тонкие механики , но опять же  это  очень дорого и локальный  солвер  тоже должен  быть  точным иначе  это все обучение превратиться в "давай выучи его ошибки"


    это  не только в холдеме  это в  любой  задаче где есть  тонкие механики, в  китайском тоже  есть belief блокеры , сброс    например прячешь и стратегии меняются ... в омахе  так вообще максималка  твои карты неизвестные  максимально влияют  на  ренжи ...  корочче  везде  где есть  скрытая  информация   ...

    ТЕМА ЗАКРЫТА
    7652/7738
    + 0
1 553 554 555 556 561
3 человека читают эту тему (3 гостя):
Зачем регистрироваться на GipsyTeam?
  • Вы сможете оставлять комментарии, оценивать посты, участвовать в дискуссиях и повышать свой уровень игры.
  • Если вы предпочитаете четырехцветную колоду и хотите отключить анимацию аватаров, эти возможности будут в настройках профиля.
  • Вам станут доступны закладки, бекинг и другие удобные инструменты сайта.
  • На каждой странице будет видно, где появились новые посты и комментарии.
  • Если вы зарегистрированы в покер-румах через GipsyTeam, вы получите статистику рейка, бонусные очки для покупок в магазине, эксклюзивные акции и расширенную поддержку.