Чот в гугле мало инфы
Или всё фигня ?
Идёшь сюда https://huggingface.co/ , ищешь gguf модели, скачиваешь/тестируешь. На русском языке та же llama и codellama умеют общаться
0iStalker
мде, уже нашёл их, но чот жиденько по сравнению с халявным гпт из гугла(там много мутных сайтов всплывает)
Советую koboldcpp как интерфейс для запуска GGUF'ок. Один EXE и весит всего лишь полгига. Исходные коды вроде бы как открыты, но на всякий случай выключаю интернет во время использования.
Когда будете искать модели на huggingface, читайте описания. Потому что они весьма специализированные могут быть. Например одна модель может помогать писать рассказы, другая модель - справочник, третья - программист, четвёртая - болтушка, пятая - NSFW, шестая - ещё что-нибудь.
0iStalker
> На русском языке та же llama и codellama
На русском общаются практически все, но не все хорошо.
Хорошая поддержка русского языка у моделей на базе mistral от французских разрабов.
iw4nna.rock
> Хорошая поддержка русского языка у моделей на базе mistral от французских разрабов.
Вот прям реально хорошая ? А то они какую то фигню по сравнению с GPT пишут и повторяются если повторять один и тот же вопрос. Как будто это не нейронка, а тупой генератор из середины нулевых.
Пробовал три модели через консольный ollama, одна вообще циклится с ответами, т.е. повторяет аутпут зацикленно пока процесс не остановишь вручную, хз что за баг.
endeavour_pr
с чатгпт локальные не сравнятся. он все-таки коммерческий продукт, там и размеры побольше чем можно на одной видюхе запустить и обучен получше. Ну и плюс на английском все которые я видел отвечают поадекватнее русского.
А что циклится - да, это норма для нейронок. кобольдцпп умеет с этим бороться так что лучше через него запускать.
endeavour_pr
> сравнению с GPT
Это тот же самый GPT - Generative Pre-trained Transformer. А чатгпт, который вы скорее всего имели в виду, - это проприетарный GPT, кототрый запущен на суперкомпьютере.
У вас есть локальный сурепкомпютер дома с оперативкой и vram размером несколько терабайт? Если нет, то берите что дают и не жалуйтесь.
Лично я на своём железе запускаю модели от 8B до 16B и они отлично справляются с задачами.
Вообще, не плохо бы поведать для каких целей вам нужна локальная GPT? Собираетесь писать книгу? Ищете помощи по программированию? Если последнее, то берите нейросеть потяжелее, гигабайтов 15-20 или больше и с высоким квантованием Q8, если позволяет железо, и не абы какую, а специальную, deepseek-coder или аналогичное.
endeavour_pr
> А то они какую то фигню по сравнению с GPT пишут и повторяются если повторять один и тот же вопрос.
Сравним с гпт по метрикам только claude самый жирный, а все эти локальные гпт которые влазят в 3060 12 гб мусор хуже гпт 3.5, ну или если они зафайнтюнены под конкретную задачу - примерно уровня гпт 3.5
Super_inoy
> claude
А он в оффлайне работает локально на компе ?
endeavour_pr
> А он в оффлайне работает локально на компе ?
Нет.
У тебя там как ферма из 8 х 4090 завалялась? Потому что если нет - то скорость будет неприемлема.
Ну или будут эти замечательные модели с уровнем интеллека алисы, которые бредят и повторяются.
Super_inoy
Ясно, я просто думал что уже давно есть оффлайновые, а вот оно как.
https://huggingface.co/bartowski/Qwen2.5.1-Coder-7B-Instruct-GGUF
В сеть утекла классная новая LLM 7B моделька, которая работает оффлайн, Qwen Coder модель от китайского гиганта Алибаба.
По тестам новый Qwen2.5.1 Coder 7B теперь всего на пару процентов ниже, чем старенькая gpt-4-1106-preview — для модели такого размера, это невероятно клевые результаты.
ecta
качнул погонять
А какой GUI под LLaMA лучше ?
Мне он в принципе не очень нужен, но нужна копипаста туда и обратно, ну и вывод в каком то нормальном виде, т.е. не в терминале и не в файл
Тема в архиве.