[/b/] [/d/] [/tu/] [/a/] [/ph/] [/wa/] [/cg/] [/t/] [/p/]

[Burichan] [Foliant] [Futaba] [Greenhell] [Gurochan] [Photon] - [Home] [Manage] [Archive]

[Return]
Posting mode: Reply
Leave these fields empty (spam trap):
Name
Link
Subject
Comment
File
Verification
Password (for post and file deletion)
  • Supported file types are: GIF, JPG, PDF, PNG
  • Maximum file size allowed is 30720 KB.
  • Images greater than 200x200 pixels will be thumbnailed.

File: 1787774565420.jpg -(53928 B, 757x428) Thumbnail displayed, click image for full size.
53928 No.239531  

а есть тут ламадрочеры? в смысле дрочеры в llama.cpp

ну вот, например, вопрос: я упёрся в предел 16 GPU. нет, я не ограбил банк, просто это майнинговые говнократы на ядрах pascal которые я взял по 50 баксов, когда они стоили 50 баксов года 4 назад

они висят на 1х райзерах и распределены по RPC нодам

и это даже работает!

кстати, хочешь возоржать? у меня одна нода на orange pi 5 с 16 гигами RAM и она, конечно, в разы отстаёт от паскалей и e5-2696 v3, но в целом её присутствие в кластере имеет смысл. варианты запуска Qwen3.5-122B-A10B-Opus-Reasoning-Q6_K.gguf с участием апельсинки, ксеона и части паскалей даёт 4.5 токена в секунду, а если заменить апельсинку паскалями, то 6. просто как эксперимент.

так вот: я упёрся даже не в 16 GPU, а в 16 бэкэндов и просто менять константы в llama.cpp перед компиляцией не помогает. у меня просто тупо получаются лишние карты, а в наше время это лютое расточительство

а может быть мне надо что-то другое? там Petals на Hivemind или ещё что-то такое?

апишку не предлагать, потому что объемы инференса конские - дешевле железо купить даже по тем ценам которые есть сейчас

ну а про длительные автономные задачи можно поговорить отдельно. ну или здесь, потому что я прекрасно понимаю, что единственный человек, который ебёт в душе, что там накручено в алгоритме раскидывания слоёв по бэкэндам - это сам Герганов

в какой-то момент я, конечно, натравлю агента на репу llama.cpp, но пока этого не случилось

про райзера, кстати, могу отдельную кулстори запилить, я мерял разные райзера таким прибором как LiteVNA и обнаружил, что бывают райзера хорошие, а бывают плохие. а раньше были только плохие. может быть кто-то припоминает, как я тут лет 8 назад выл про синие "USB" райзеры. теперь я точно знаю что с ними не так - децибелл затухания с ними не так и никакой осциллограф на 20 гигасемплов тут не нужен, LiteVNA вполне доступный прибор, который прендазначен для анализа именно этой проблемы

>> No.239532  

>>239531

> в llama.cpp

Ты про >>236620 ?

> 4.5 токена в секунду

Помоему она на чистом CPU может давать больше, если учесть что у меня Qwen3.6-35B в cpu-only варианте выдает около 8 t/s.

> я упёрся даже не в 16 GPU, а в 16 бэкэндов и просто менять константы в llama.cpp перед компиляцией не помогает
> объемы инференса конские

Почему бы тогда тупо не пустить несколько инстансов лламы с разными картами и не разбросать запросы по ним?

>> No.239533  
File: 1787781615720.jpg -(80558 B, 500x400) Thumbnail displayed, click image for full size.
80558
>>Ты про >>236620

определённо да, но тред ещё за май, не видел я его

в мае я вообще ничего не видел, сейчас уже лучше

>>на чистом CPU может давать больше,

>>35B
ясен красен больше, если взять 8B будет ещё больше. CPU начинается когда кончается VRAM, а потом кончается всё и я думаю, где взять ещё, а взять негде. в 4.5 токенах в секунду поучаствовали cpu на двух разных нодах, а так же gpu, тоже на двух, ну и сеть между ними, разумеется

настраивается, кстати просто. самый сложный этап квеста - cuda+драйвер, но и он не рокет саенс, все ставили, я думаю

если что, llama.cpp использует ОБА вида памяти для одного инстанса одновременно, и да, cpu действительно не такой медленный, как можно подумать. а есть ещё и оффлоуд на ssd, но это уже совсем медленно

и да, CPU годится не всякий, обязательно нужно ну хотя бы первый AVX, иначе будет сопоставимо с SSD

всё просто - чем больше слоёв - тем больше вычислений + накладные расходы на передачу(время). там есть неочевидный момент - следующий токен не заходит, пока не вышел из пайпа предыдущий, по-этому все сетевые задержки и задержки на райзерах суммируются, но в принципе там понты. даже 100 мегабит нормально работает, хотя gemini кричит что нужно 40 гигабит и не меньше, потому что у него в чугунной голове зашит tensor parallel а это что-то на богатом, начиная от h100 с NVLink и нужно в основном что бы учить с нуля, а это вообще отдельная история, которая начинается с покупки земли под датацентры

"Почему бы тогда тупо не пустить несколько инстансов лламы с разными картами и не разбросать запросы по ним?" - ну это я в итоге и сделаю + фабл на внешнем апи, но "разбросать" - это конечно красиво звучит, а ты умеешь разбросать? этож надо иерархию выстроить с субординацией, что бы дурак мог делать грязную работу, мидл умную, а сениор был архитектором всего, резолвером опасных дилем и ответственнных транзакций. autogen сейчас для этого смотрю

и вот сейчас пробую Qwen3.5-122B-A10B-Opus-Reasoning-Q6_K.gguf лезет, а Qwen3.5-122B-A10B-Opus-Reasoning-Q8_0.gguf не лезет. хер его знает почему, вроде разница не такая и большая и фактически памяти у меня в два раза больше чем весит q8, в пределах лимита лламы получилось насобирать 256 гигов и ещё где-то 60-70 осталось за бортом. можно там какого-нибудь дурачка запустить, который годится в лучшем случае в качестве продвинутого грепа, что бы не жечь дорогие токены, но и то полезно

а, кстати, есть ещё такая штука как graphrag, пока у меня openclaw не сломался, я ему поручил прочитать рандомную книгу на 22000 слов и собрать по ней graphrag и это работает! только есть один нюанс: собирал я его посредством fable через апи и стоило это 50 долларов денег. дорогой эксперимент. по итогам он мне выдал выжимку из всей книги и смог ответить на некий вопрос касаемо её содержания и это выглядело прям убедительно. но 50 баксов это 50 баксов)) не знаю что, будет если попытаться сделать это ну хотя бы дипсиком, будет ли оно так же четко и по существу работать. попробую как руки дойдут. но в принципе это возможно! причем делал мне это от и до дипсик, я только смотрел. то есть модель для самого анализа была fable 5, а работу по подготовке окружения и входных данных от и до выполнил deepseek, и он же запустил прогон и тестовые запросы. и всё получилось! но потом openclaw сломался и я понял что хватит его чинить и пошёл искать альтернативы. вот, ищу.

>> No.239534  

>>239533

> ясен красен больше, если взять 8B будет ещё больше

Я больше про то, что разница не то чтобы прямо радикальная.

> и да, CPU годится не всякий, обязательно нужно ну хотя бы первый AVX, иначе будет сопоставимо с SSD

Там же вроде шина памяти узкое место а не вычислительная способность этого самого cpu.

> а ты умеешь разбросать? этож надо иерархию выстроить с субординацией

Да просто одинаковые сетки пустить и инстансы агентов на них поподвязывать.

> Qwen3.5-122B-A10B-Opus-Reasoning-Q6_K.gguf

Зачем ты вообще на него вяжешься, когда 3.6 не сильно глупее не смотря на меньший размер?

> 22000 слов

Это же вполне лезет в контекст того же квена целиком, без всяких rag.

> хватит его чинить и пошёл искать альтернативы. вот, ищу.

Меня кстати удивило что opencode может не только в code.

>> No.239535  
File: 1787786048708.jpg -(63594 B, 1280x767) Thumbnail displayed, click image for full size.
63594
>Я больше про то, что разница не то чтобы прямо радикальная.

я про то же, но когда у тебя кончается память у тебя кончается память

>Там же вроде шина памяти узкое место а не вычислительная способность этого самого cpu.

если есть AVX2. если DDR3 - то просто AVX. я так понял. а если AVX нет, то упираешься в проц и неслабо. а есть этот AVX далеко не во всём, что можно добыть задешево. и он прям критичен. хотя... это со слов того же gemini, который допустил много других ошибок. но здесь всё звучит внутренне непротиворечиво. впрочем, будет ещё возможность померять. у меня как раз валяется тут старый больной proliant gen6 и avx у него, увы, нет и проапгрейдить нельзя.

а проблема паскалей в том что да, векторные операции для них нативны, но при деквантовании начинаются проблемы другого рода. реально большие модели принято квантовать по дефолту, т.к. они, в силу самого масштаба, от кванта почему-то не лоботомируются, в отличие от мелких, но старые ядра не умеют оперировать квантованными значениям нативно и перегоняют 4битное число в 32битное, производят операцию и перегоняют обратно. а ядро паскаль и без того старое и немощное. хотя, с другой стороны, узкое место всё равно память, вроде бы, поскольку память там, кажется, ещё медленнее.

ну, по крайней мере я так понял. кто понял лучше - я бы послушал

то есть всё это медленно, но пользоваться можно. а вот можно ли пользоваться чем-то запущенным на проце без AVX вообще - вот этого я пока просто не проверял

в orange pi 5 avx как такового нет, но там свой эквивалент векторной числодробилки, которая реально хороша в свои деньги. как я понял, mac mini убедительно тащат локальные модели по той же причине, хотя arm в них, конечно, другой

>Да просто одинаковые сетки пустить и инстансы агентов на них поподвязывать

ну это я как бы понимаю, но как заинтерфейсить их с задачей и анально при этом огородить, что бы они не захватили планету или, по меньшей мере, мою файлопомоечку

>Зачем ты вообще на него вяжешься, когда 3.6 не сильно глупее не смотря на меньший размер?

а как ты это понял? по метрикам из релиза? а ты заметил, что в метриках из релиза они всегда и все умнее абсолютно всех? чудеса бывают, но редко. а вообще у меня 3.5 больше как бэнчмарк пока, я кластер отлаживю, так-то нужен hermes, полагаю, а в модели маленького размера я не верю. то есть своя ниша у них есть, конечно, но они с больше вероятностью доставят проблемы, чем сделают что-то полезное на практике. это греп на стероидах - да, полезен, но оставлять его надолго без присмотра может и не сильно опасно, но и не сильно полезно

>Это же вполне лезет в контекст того же квена целиком, без всяких rag

ну не хватало ещё что бы он сожрал 100500 баксов, вместо 50. это был просто тест концепции на работоспособность, а суть в том, что этот подход масштабируется на текст вообще любого объема, тогда как контекст мало того что не резиновый, так ещё и не очень-то хорошо видит семантические связи. то есть само наличие какого-то словосочетания в глубине контекста он не потеряет, но семантическую связь между сущностями он не вспомнит пока ты не переместишь эту часть контекста в конец этого самого конекста(или в начало), что полностью инвалидирует кэш и для дальнейшего разбора потребует большое количество таких итераций. так вот в graphrag это буквально сделано заранее и закэшировано. за то и деньги взяты. и на голом контексте это работать не будет, нужна какая-то итеративность по тексту и grahrag, как я понял, это что-то типа закэшированной итеративности, причем она ещё в и виде векторов лежит, кажется. надо дальше разбираться. но это мастхэв.

и кроме того - да, контекст сам по себе вещь глубоко не бесплатная. размер контекста можно выбирать при запуске и большой контекст начинает жрать сильно много памяти. в моём бэнчмарке контекст 256k, но это больше ради самого бэнчмарка. на самом деле, при заливке такого контекста она начинает неистово жрать розетку и греться. 2кВт. и это долго! лучше разбивать задачу, там где это возможно. просто по экономическим соображениям. контекст дорогой и семантические связи в его середине неустойчивы, такие вот вещи я постиг

>opencode

этого не пробовал. пробовал openclaw и aider, сейчас думаю что пробовать дальше

open interpreter интересный, но я понимаю что мне нужно несколько агентов

smolagent даже интереснее, там агент - это питоновский объект, но мне пока другое нужно, мне важнее что бы он нативно контактировал с системными тулзами

>> No.239536  

Можно ли на авито накупить железа поцене 10 облезлых енотов, чтобы анимировать изображения хотя бы за 10 минут на 4-секундную анимацию?

>> No.239537  
File: 1787806223879.png -(1194154 B, 1024x1024) Thumbnail displayed, click image for full size.
1194154

В твоём случаее, действительно, рекомендую мониторить авито, и не на что-то конкретное, а на все что угодно, что может подойти. Там бывают очень дешевые варианты железа. Я бы то же много чего себе хотел, но больше конкретные вещи присматриваю, потом просто охреневаю от цены и остаётся только пускать слюни. Тебе же нужно, что бы работало. Так что отложи буферную копейку и мониторь авито, может повезёт.

А если нужен быстрый результат, то арендуй сервер с крутой видюхой. Как раз недавно так сделал, и даже хочется повторить. Где-то 1500 поиграться за выходные и это за 96ГБ vram, 48 и 24 в разы дешевле. Это как на выходных в кино с девушкой сходить по ценнику. Я там особо не разбирался просто взял виртуальную машину с ubuntu, и можно делать все что хочешь.

Я понимаю что цели разные бывают.

>> No.239538  
File: 1787808446374.png -(1050397 B, 1024x1024) Thumbnail displayed, click image for full size.
1050397

Мне, например, интересно, что если взять серверную материнку поставить туда какой-нибудь бронзовый проц и напихать под завязку обычной операты, как он себя покажет в целях для неронок. В принципе если взять правильную матеренку то и видюх туда потом напихать можно будет.

>> No.239539  
File: 1787810929056.png -(1155603 B, 1024x1024) Thumbnail displayed, click image for full size.
1155603

>>239537
За выходные я только разогреваюсь. И если результат будет примерно как у тебя, то мне даже на пробу будет жаль столько отдавать. Такое я и на бесплатных ломаных андроид-аппах нагенерил бы (если бы их все почти не прикрыли)

>> No.239540  

>>239535

> я про то же, но когда у тебя кончается память у тебя кончается память

Да, но на cpu ее хотябы докупить можно.

> хотя... это со слов того же gemini, который допустил много других ошибок

Не стоит ему так доверять в этом вопросе.

> но как заинтерфейсить их с задачей и анально при этом огородить, что бы они не захватили планету или, по меньшей мере, мою файлопомоечку

Я просто на виртуалке пускаю, там пусть хоть обзахватываются.

> а как ты это понял? по метрикам из релиза?

По практическим задачам, разницы не заметно.

> это греп на стероидах

Греп на стероидах это 4B/9B модели. Они влетают в дешевую видеокарту целиком и при этом выдают тысячи t/s препроцессинга. Но вот агентов уже не тянут, увы.

> а суть в том, что этот подход масштабируется на текст вообще любого объема

Фокус в том что rag тем больше лажает, чем больше "знаний" ты в него напихаешь. Тут как раз таки тот самый "греп на стероидах" которому по очереди скармливаются куски текста показывает себя значительно лучше.

> так ещё и не очень-то хорошо видит семантические связи

Этим древние модели грешили, сейчас с этим куда лучше.

> размер контекста можно выбирать при запуске и большой контекст начинает жрать сильно много памяти

Но с маленьким контекстом агенты малополезны. Бесконечный compaction который ни разу не lossy делает все сильно хуже. На практике пустить модель с 250k контекстом чтобы она сделала всю задачу целиком в одном контекстном окне куда продуктивней.

>> No.239541  

>>239537
Сорян, что нагрубил. Наверное, не все твои мисаты дерпнулись.

>> No.239542  
File: 1787827699378.png -(197615 B, 701x683) Thumbnail displayed, click image for full size.
197615

>>239538
всё правильно думаешь. только смотри что бы проц был минимум с AVX2, а видяхи можно и на райзерах. только, говорят, новые hp с этим не очень, у них вроде как склонность игнорировать сторонние устройства, тогда как dell либеральнее в этом плане. но здесь я тебе пересказываю gemini, у меня лично в hp работет гора видеокарт, только вот он старый и карты старые. в новых вроде всё стало хуже, как обычно

ещё есть опция huananzhi, но в серверных всё равно слотов распаяно больше + сервера дома никому не нужны и когда они устаревают их отдают почти даром

и не проебись с памятью, ранговость, каналы, частоты, вот всё вот это. бери там где можно обменять либо будь готов выставить её на продажу если не встанет

но в целом ты всё верно понял, видеокарты это просто одна из опций. процы уступают по скорости но из плюсов - у них не заканчивается поддержка, флопсы на ватт едва ли не лучше, они чисто физически значительно надёжнее, памяти одному процу доступно несоизмеримо больше, ну и универсальность - хочешь прон генери, а хочешь zip-архивы сжимай и разжимай. и никаких слотов, райзеров и намертво распаянной памяти. лично я для себя пришёл к выводу что видеокарт я вообще больше покупать не буду. видеокарта никак не даст тебе нескольких терабайт на одно устройство, а серверная платформа - запросто. там грядки из планок гигантские и стоит это даже дешевле чем десктопный эквивалент(с определённого момента)

а если карты решишь, то райзер бери как пикрилэйтед. не с точностью до брэнда, а что бы кабель был плоский, но в оболочке(не как IDE). такие как на пикрелейтед у меня работают железобетонно стабильно, главное "USB" не бери - эти соврешенно точно никогда не работают вообще

>> No.239543  
File: 1787829988193.jpg -(304682 B, 721x1280) Thumbnail displayed, click image for full size.
304682
>Да, но на cpu ее хотябы докупить можно.

можно. но видеокарты тоже можно в цепочки собирать. вопрос что доступнее в моменте. сейчас и в будущем скорее всего будет доступнее CPU память, а скорость обычно не критична

>Не стоит ему так доверять в этом вопросе.

о да. но если факты друг другу не противоречат иногда целесообразнее поверить, чем не иметь информации вообще

>Я просто на виртуалке пускаю, там пусть хоть обзахватываются.

я тоже, но как натравить более одного агента на одну задачу?

>По практическим задачам, разницы не заметно.

практики бывают разные. больше тебе скажу - иногда модель поменьше в чем-то показывает себя лучше. самое узкое место это понимание человеческого здравого смысла и пространственное воображение. особенно последнее - в этом сосут вообще все, кроме кожаных мешков. а код генерировать много ума не надо, как показала практика. но разбираться с багажником для велосипеда или разводкой платы тебе придётся самому. может быть fable поможет, а может быть и нет - я не уверен, не проверял, дорого. кожаный мешок сделает это быстрее, лучше, а главное что дешевле. то есть да, именно что дешевле! бытовые и механические задачи уровня "почини калитку во дворе" почему-то стоят дешево, а какой-нибудь сраный дизайн базы или скрипт автоматизации - так это нужен его величество ПРОГРАММИСТ-НАНОСЕК с рафом на лавандовом молоке, который за наносек высосет твой бюджет в ноль

впрочем да, не стоит забывать что и среди кожаных дураков хватает, что поделать. к модели хотя бы метрики есть, а что в голове у сварщика которому ты переварку порогов доверил - это хз, как фишка ляжет

>Но с маленьким контекстом агенты малополезны. Бесконечный compaction который ни разу не lossy делает все сильно хуже. На практике пустить модель с 250k контекстом чтобы она сделала всю задачу целиком в одном контекстном окне куда продуктивней.

твоя правда есть, но всё относительно. во-первых graphrag это не просто тупой compaction, а это граф связей между сущностями, который делается за большое количество проходов и да, он сам по себе требователен к модели

и это не панацея. вариант в котором задача помещается в контекст, наверное, может поспорить по качеству, но дофига задач, где предмет рассмотрения не лезет в контекст вообще, а если и лезет, то впритык, дорого и медленно. если тебе нужно найти что-то в многолетней переписке, то тебе либо придётся загружать её в контекст чанками и компактить, либо осознать, что это по факту уже "графраг дома" и можно взять "внатуре графраг" сына маминой подруги и сделать то же самое лучше

не говоря уже о том, что можно засрать огромный контекст графрагом и получить выигрыш от синергии обоих подходов

а если это например какая-то юридическая работа, в духе "проанализировать хуиллиард томов уголовного дела", ну представь. а это работа нужная и качественное её выполнение чужими мозгами как минимум не дешево, если вообще возможно.

хотя... ну всё это мои умозаключения основанные на поверхностных экспериментах, либо на хрупкой теории, которая пока ещё толком не сформировалась. практика покажет.

>> No.239544  

>>239543

> но видеокарты тоже можно в цепочки собирать

Только такие цепочки дают очень сильную просадку по производительности. Собственно твои 4.5t/s тому пример. И вообще у меня травма ранних версий лламы, когда размазывание на cpu+gpu давало меньшую производительность чем cpu-only.

> а скорость обычно не критична

Если скорость не критична то вообще можно с nvme читать.

> но если факты друг другу не противоречат

Они не противоречат, да действиетльно с avx считается быстрее, но вот не факт что узким местом будет именно отсуствие avx а не шина памяти.

> но как натравить более одного агента на одну задачу?

Им можно просто разные задачи дать. Или на худой конец разбить задачу на подзадачи.

> практики бывают разные

Это правда.

> понимание человеческого здравого смысла

Вот тут кстати 3.6 показала себя лучше чем 3.5.

> загружать её в контекст чанками

Собственно этот подход отлично работает. И даже компактить не надо, просто делаешь один и тот же запрос для разных чанков.

>> No.239545  
File: 1787834770656.jpg -(114662 B, 1280x960) Thumbnail displayed, click image for full size.
114662
>Только такие цепочки дают очень сильную просадку по производительности. Собственно твои 4.5t/s тому пример.

а сколько даст 122B модель на cpu? не забывай что это замер с двумя сетевыми пересылками(одна из которых 100 мегабит) и почти исключительно на 1х райзерах, причем карт там было почти максимальное количество, около 16.

нет, cpu неплох и экономически целесообразен, но gpu всё-таки быстрее и они у меня от майнинга остались

посмотрим сколько они будут стоить в будущем, но cpu подкупает безгеморностью

но давай будем трезвы, если я соберу грядку на пару терабайт даже в рамках одного сервака - kimi k3 даст единицы токенов в секунду. но: меня это устроит

>Если скорость не критична то вообще можно с nvme читать.

не выйдет. на триллионных моделях можно как нефиг получить один токен за 10 минут, если не хуже. чтоб ты понимал, для одного токена проц должен прочитать с SSD ВСЮ МОДЕЛЬ. ДЛЯ ОДНОГО! кулстори про запуск нейронок на айфонах это кулстори вида "хвост модели на ssd", причем этот хвост там пару в гигабайт. работать будет, но это будет не дипсик и не кими

>но вот не факт что узким местом будет именно отсуствие avx а не шина памяти.

тут нужен эксперимент

>Или на худой конец разбить задачу на подзадачи.

подзадачи обычно решаются последовательно, так что одновременной работы двух моделей в этом кейсе не будет. а нужна именно она. нужен поток чего-то однотипного - тогда это будет работать, но такие задачи ещё найти надо

>Вот тут кстати 3.6 показала себя лучше чем 3.5.

вот тут верю. ещё gemma в своё время удивила, но всё равно размер имеет значение, при идентичной архитектуре и датасете маловероятна победа модели меньшего размера. если 3.6 в чем-то уделывает 3.5, то где-то грустит 3.6 большего размера.

вообще есть проблема: отсутствие современных моделей 100+B, выпускаются или малыши или гиганты, а средняя весовая категория остаётся без обновлений

>> No.239546  

>>239545

> а сколько даст 122B модель на cpu?

Для Qwen3.5-122B-A10B я ожидаю что-то в районе 3 t/s.

> один токен за 10 минут, если не хуже. чтоб ты понимал, для одного токена проц должен прочитать с SSD ВСЮ МОДЕЛЬ

Ну у меня вычитка ~250G с nvme это порядка минуты. И это только один nvme, без страйпа.

> а нужна именно она. нужен поток чего-то однотипного

Не нужен поток чего-то однотипного. Одну модель просишь исправить один баг, другую модель просишь исправить другой баг и они вместе работают впараллель.

> при идентичной архитектуре и датасете

Это ключевой момент. Архитектуры и датасеты не стоят на месте, так что нет ничего удивительного в том что то, с чем вчера не могла справится 120B модель, сейчас справляется 35B.

> вообще есть проблема: отсутствие современных моделей 100+B,

Есть же nemotron, у него кстати целый лям контекста. И там qwen3.8 flash обещают как раз в 100B варианте.



Delete Post []
Password

[/b/] [/d/] [/tu/] [/a/] [/ph/] [/wa/] [/cg/] [/t/] [/p/]