#onnx — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #onnx, aggregated by home.social.
-
От капстоуна к продакшену: fail‑fast, structured logs, Prometheus и Docker‑образ 8.15GB → 1.35GB
У меня есть RAG‑сервис: проверяет фактологические утверждения в бизнес‑отчётах против реальных источников — SEC EDGAR, World Bank, FRED, Wikipedia. Это капстоун LLM Zoomcamp (DataTalksClub). Курс закончился, оценку поставили (peer review, 42/42), а я решил дотянуть проект до состояния «не стыдно показать на собеседовании как рабочий код», а не просто «закрыл критерии оценки курса».
https://habr.com/ru/articles/1071230/
#docker_image_size #onnx #sentencetransformers #fastapi #prometheus #grafana #structlog #mlops #RAG
-
Released a Q4 ONNX Runtime GenAI conversion of inclusionAI/Ling-3.0-tiny 🚀
• 7.9B total / 1.3B active parameters
• Hybrid KDA + MLA architecture preserved
• Sparse 128-expert MoE with top-8 routing
• 4.85 GB download
• CUDA inference
• Tested end-to-end on RTX 5090Model + quickstart:
https://huggingface.co/webbrain-one/Ling-3.0-tiny-ONNX -
📊 Leads every instruction-following benchmark and nearly all tool-use benchmarks against models up to 4x its size, trailing only #Qwen3_5 9B on BFCLv4 — coding remains the weaker area
🔧 Day-one support for #llamacpp (GGUF), #MLX, #vLLM, #SGLang and #ONNX across Apple, AMD, Qualcomm and NVIDIA hardware
-
I created this free open source dashcam app
It turns your phone into an on device computer vision police detector, spotting patrol vehicles on the road in real time
-
14× faster embeddings: how we rebuilt the ONNX path in Manticore
https://manticoresearch.com/blog/onnx-embeddings-speedup/
#HackerNews #ONNX #Manticore #embeddings #speedup #AI #research
-
В 14 раз быстрее: как мы ускорили генерацию эмбеддингов в Manticore через ONNX
Когда мы выпустили Auto Embeddings — функцию автоматического преобразования текстов в векторные представления — без развёртывания отдельного сервиса для работы с ML-моделью, — главный запрос пользователей касался скорости работы. Ранее для генерации эмбеддингов использовался только стек SentenceTransformers поверх Candle (Rust-рантайм Hugging Face для ML-инференса), и ресурсы CPU использовались далеко не полностью: в большинстве сценариев нагрузки показатель QPS держался на уровне нескольких десятков документов в секунду независимо от способа подачи данных, а параллельные запросы обрабатывались последовательно в рамках одной сессии модели. Поэтому мы в течение нескольких недель оптимизировали механизм запуска ONNX-моделей в Manticore. Новый бэкенд ONNX Runtime доступен начиная с Manticore Search 27.1.5 . ONNX (Open Neural Network Exchange) — переносимый формат моделей, в котором уже публикуется большинство популярных open-source моделей для эмбеддингов: MiniLM, BGE, E5 и другие. В результате получилось решение, которое в среднем в 14 раз быстрее прежней реализации SentenceTransformers/Candle на том же оборудовании (обычный недорогой сервер с 16 ядрами / 32 потоками), с той же моделью и теми же весами, если усреднить по всей матрице замеров threads × batch , — и это преимущество сохраняется как при одном клиентском потоке, так и при тридцати двух. Предыдущая реализация во всём диапазоне нагрузок показывала 5–11 документов/с; новая реализация работает в диапазоне 70–230 документов/с.
https://habr.com/ru/articles/1051864/
#onnx #onnx_runtime #onnxruntime #embeddings #эмбеддинги #инференс #векторный_поиск #vector_search
-
Per anni l'audio su Linux ha significato scegliere tra PulseAudio e JACK, e farli litigare.
PipeWire 1.6 ha chiuso la partita: un solo sistema, e funziona. 👇
https://gomoot.com/dal-caos-pulseaudio-jack-alla-maturita-di-pipewire-1-6/ -
Как я завёл нормальный голос в детское приложение, не разорившись и не заставив никого лезть в настройки
Я в одиночку делаю детское приложение, где дети учат английский через рисование: рисуют слова, а оно распознаёт рисунок и отвечает голосом. В MVP голос был системный — бесплатный, но звучит как робот из нулевых, пока сам не зайдёшь в настройки и не докачаешь нормальный. Я сделал модалку с инструкцией. Угадайте, сколько людей ей воспользовались. Короче, примерно никто. Значит, хороший голос должен достаться всем сразу, без единого телодвижения юзера. И при этом дёшево — причём не только по деньгам. Рассказываю, как я завёл озвучку через ElevenLabs так, что в проде она почти ничего не стоит, работает офлайн и отвечает мгновенно. Ключ оказался в одном наблюдении: всё, что приложение когда-либо скажет, известно заранее. А ещё — почему, когда ты соло и кодишь в паре с агентом, главные проверки в пайплайне работают за ту команду, которой у тебя нет. Как это устроено
https://habr.com/ru/articles/1047888/
#TTS #ElevenLabs #React_Native #Expo #Cloudflare_Workers #детские_приложения #ONNX #TDD #AIразработка #Claude_Code
-
Компиляция yolov8n в формат HEF для Hailo-8L на Raspberry Pi 5
Подготовка модели Yolo для запуска на базе Hailo чипа для Raspberry Pi 5 AI HAT+. Если есть интерес к легким аппаратным решениям в области ИИ, то добро пожаловать. В статье я затрагиваю вопрос подготовки модели детекции к работе на компактной малинке.
https://habr.com/ru/articles/1048976/
#onnx #hailo #hailo8 #raspberry #ultralytics #yolo #yolo8 #ml #mlops #ai
-
I'm writing a C# app with ONNX for facial detection and in part of it doing `tensor[0, 2, y, x] = r`. After running the app for a day it used almost 8 GB memory. I coudldn't really find any obvious memory leaks, but found that the indexer actually created a temporary `int[]`. I refactored the indexer to `tensor[2 * width * height + y * width + x] = r`, and did some other (unrelated changes). And now a day later it's at 0.4 GB. Is that how this works?
To pharaphrase the Haskell saying:
> The [garbage collector] should have protected me from this! -
Трансформер в on-premise AppSec: как мы встроили ML-модель для классификации секретов в продукт без GPU
Рассказываем, как мы интегрировали CodeBERT-based модель классификации секретов в production-продукт с жёсткими ограничениями по железу, сократив время инференса с 320 до 90 секунд и размер модели с ~600 до ~130 МБ — без дискретных ускорителей и тяжёлых зависимостей.
https://habr.com/ru/companies/codescoring/articles/1040968/
#appsec #onnx #mlops #opensource #оптимизация #codescoring #ml
-
Govorun PC: переносим офлайн-диктовку с Android на Windows за один вечер (с Claude)
На Android у меня живёт Govorun Lite — офлайн-диктовка на русском. Нажал кнопку, сказал, текст вставился. Никаких облаков, никакой отправки голоса на серверы. Работает через GigaAM v2 от Сбера. Проблема одна: на ПК такого нет. Встроенная Windows-диктовка — онлайн. Whisper — либо медленный, либо требует видеокарту. Сторонние сервисы — снова облако. Я решил портировать Govorun на Windows, и для ускорения взял Claude как пару-программиста. Что из этого вышло — в этой статье.
https://habr.com/ru/articles/1031240/
#python #speechrecognition #onnx #windows #llm #голосовой_ввод
-
🍏🔪 #Apple thinks it's clever by running #ONNX in a browser, promising AI-powered Gaussian Splats—because nothing screams cutting-edge tech like mathematical blobs. 🖥️🤖 GitHub's turning into a buzzword bingo, but hey, at least the navigation menu's toggle switch works. 🎉🙄
https://github.com/bring-shrubbery/ml-sharp-web #AI #GaussianSplats #GitHub #BuzzwordBingo #TechNews #HackerNews #ngated -
Apple's Sharp Running in the Browser via ONNX Runtime Web
https://github.com/bring-shrubbery/ml-sharp-web
#HackerNews #Apple #ONNX #Runtime #Web #Machine #Learning #Browser #Tech
-
Приложение real-time face swap на чистом Rust: ONNX Runtime, lock-free потоки и 60 кадров в секунду
Большинство инструментов для замены лиц это Python-скрипты, склеенные из PyTorch, OpenCV и надежды. Они работают, но тащат за собой гигабайты зависимостей, требуют правильно настроенного CUDA и разваливаются в тот момент, когда ты пытаешься запустить их в реальном времени. Мне стало интересно: можно ли собрать весь пайплайн на чистом Rust? Без Python. Без PyTorch. Без обёрток. Один бинарник, который скачал, распаковал и запустил. Оказалось, можно. 60 fps на веб-камере. Пайплайн На каждом кадре последовательно отрабатывают четыре нейросети. RetinaFace находит лица и извлекает пять ключевых точек. ArcFace вычисляет 512-мерный эмбеддинг исходного лица. InSwapper принимает регион целевого лица и эмбеддинг источника, на выходе отдаёт заменённое лицо. GFPGAN опционально улучшает результат для более высокого качества. Все четыре модели работают через ONNX Runtime. Никаких кастомных CUDA-ядер, никакого оверхеда фреймворков. Тензор на вход, тензор на выход. Архитектура потоков Три потока, ноль блокировок на горячем пути. Поток захвата получает кадры с веб-камеры через nokhwa и публикует их через ArcSwap. Поток пайплайна подхватывает новые кадры, прогоняет инференс и публикует обработанные кадры через второй ArcSwap. Поток UI читает актуальный буфер и рендерит через egui. Никаких мьютексов на данных кадра. Никаких каналов. Никакого async. Только атомарные счётчики поколений и lock-free замена указателей. Структуры разделяемого состояния занимают ровно по 64 байта каждая и выровнены по кэш-линиям, чтобы исключить false sharing между ядрами. Это проверяется compile-time ассертами.
https://habr.com/ru/articles/1024700/
#Rust #ONNX #Machine_Learning #Computer_Vision #Face_Detection #egui #Open_Source #lockfree #multithreading #realtime