What does GitHub’s security team even do?

Right now, there are thousands of repositories on GitHub distributing malware. Any of you can find these repositories, and you don’t need any special knowledge to do so. All you have to do is use the standard search function on the GitHub website.

These repositories have been around for two years. GitHub has billions of dollars, a security team, and artificial intelligence. Why haven’t they solved this problem in two years?


First, we’ll look at the repositories we’ve already found, identify common patterns within them, and then use those patterns to find other repositories.

Take a look at these repositories; in each one, the readme contains a link to a zip archive containing a Trojan:

Link to download the zip archive containing the Trojan

If we download this zip archive and submit individual files from it to VirusTotal, we’ll see the following results:

Scanning files from the zip archive on VirusTotal

Even a quick glance at these repositories shows that they have the same structure, nearly identical headings, and every heading contains an emoji. That’s all the information we need to find other repositories.

Let’s use the heading "📥 Download" and search for that string on GitHub. But we don’t want to search the entire codebase — just the readme files. Go to github.com and enter the following in the search bar at the top:

path:readme.md "## 📥 Download"

The number of results will always vary. At first, it showed me 9k repositories, but when I went to page 2, there were only 109 repositories. After refreshing the page, it was back to 9k repositories.

In the search output, you’ll need to visually filter out the results that contain any other text besides just the heading. The heading variations will look something like this:

  • ## 📥 Download Now
  • ## 📥 Download Now Again
  • ## 📥 Download the Software
  • ## 📥 Download & Install
Results of the first search

Open these repositories. They will have a link to a zip archive containing a Trojan.

However, the search results will include many legitimate repositories. We can improve the search by adding a search for zip archives. The search string will look like this:

path:readme.md "## 📥 Download" ".zip"

This will significantly improve the results. Now, right in the search results, we can see which repositories contain the heading we need and a link to a zip archive.

Results of the second search

But these results still include legitimate repositories. How else can we refine the search query?

All links to zip archives lead to githubusercontent.com or github.com. Also, the zip archive contains a version number, for example, "Software-3.6.zip". So we just need to write a regular expression to search for such links. But as I said at the beginning, you don’t need any specialized knowledge for this. Any free AI model can handle it. We feed it 10 such links, and after a few iterations, we get this result:

path:README.md /raw\.githubusercontent\.com\/.*\d+\.\d+\.zip|github\.com\/.*\/raw\/refs\/heads\/.*\d+\.\d+\.zip/

Enter this query, and you’ll get the repositories that are distributing the zip archive containing the Trojan. The number of repositories varies. In my case, sometimes there are 111, sometimes 4.4k.

Results of the third search

But this entire search only worked because we had an initial list of repositories from which we were able to derive a general search pattern.

Maybe GitHub’s security team didn’t have these repositories?
Maybe they don’t know about this general pattern?

A month ago, I published an article in which I analyzed this scheme in detail. I wrote a script that found 10,000 such repositories. I published the list of all the repositories and the script on GitHub.

The article made it to the Hacker News front page. Other cybersecurity websites wrote about this scheme.

Here is the full list of actions GitHub took:

  1. They deleted all 10k repositories that the script found.

That’s it. They didn’t do anything else.

What’s more, a few hours later I ran the script again; it found new repositories, and I added them to the article. They weren’t blocked for an entire month. Even though all they had to do was open my article again, grab the new links, and block those repositories. That turned out to be too difficult for them.

But there’s one conclusion we can draw: they’re well aware of this malware distribution scheme.

No matter how hard I try, I can’t find an answer to why this is happening. Microsoft is a corporation with billions in revenue. They have thousands of employees, limitless resources, and artificial intelligence. All they needed to do was allocate a few days for any regular employee so they could use Copilot to find all these repositories and block them.

I’ve never worked at a large company. And I can’t imagine how decisions are made specifically at GitHub, or what bureaucratic nightmare managers have to go through to start combating malicious repositories.

But they deleted all 10k repositories just a few hours after the first article was published.

Why did they stop and take no further action?

Чем вообще занимается служба безопасности GitHub?

В гитхабе прямо сейчас есть тысячи репозиториев, которые распространяют вирусы. Любой из вас может найти такие репозитории и для этого вам не нужны какие-то специальные знания. Вам достаточно воспользоваться обычным поиском на сайте гитхаба.

Такие репозитории существуют уже 2 года. У гитхаба есть миллиарды долларов, служба безопасности и искусственный интеллект. Почему они за 2 года не решили эту проблему?


Сначала мы посмотрим на уже найденные репозитории, найдем в них одинаковые паттерны, а затем по этим паттернам найдем другие репозитории.

Посмотрите на эти репозитории, в каждом из них в readme находится ссылка на zip архив с трояном:

Ссылка на скачивание zip архива с трояном

Если мы скачаем этот zip архив и отправим отдельные файлы из него в VirusTotal, то получим такую картину:

Проверка файлов из zip архива в VirusTotal

Даже при беглом просмотре этих репозиториев мы увидим, что у них одинаковая структура, почти одинаковые заголовки, и в каждом заголовке есть эмодзи. Это вся информация которая нам нужна для поиска других репозиториев.

Давайте возьмем заголовок "📥 Download" и сделаем поиск по этой строке в гитхабе. Но нам нужно искать не по всему коду, а только по readme файлам. Откройте сайт github.com и сверху в строке поиска введите:

path:readme.md "## 📥 Download"

Количество результатов будет всегда разным. У меня он сначала показал 9К репозиториев, а когда я перешел на 2 страницу, то уже было 109 репозиториев. После обновления страницы снова 9К репозиториев.

В выдаче вам нужно визуально отбросить результаты, в которых есть какой-то другой текст, а не только заголовок. Варианты заголовков будут примерно такие:

  • ## 📥 Download Now
  • ## 📥 Download Now Again
  • ## 📥 Download the Software
  • ## 📥 Download & Install
Результаты первого поиска

Откройте эти репозитории. В них будет ссылка на zip архив с трояном.

Но в результатах поиска будет много легитимных репозиториев. Мы можем улучшить поиск, добавив поиск по zip архиву. Строка поиска получится такой:

path:readme.md "## 📥 Download" ".zip"

Это гораздо улучшит выдачу. Теперь прямо в поиске мы видим, в каких из репозиториев есть нужный нам заголовок и ссылка на zip архив.

Результаты второго поиска

Но и в этих результатах есть легитимные репозитории. Как еще можно улучшить поисковый запрос?

Все ссылки на zip архивы ведут на githubusercontent.com или на github.com. Также zip архив содержит номер версии, например "Software-3.6.zip". Значит нам просто нужно написать регулярное выражение для поиска таких ссылок. Но как я и говорил в начале, вам не нужны знания для этого. С этим справится любая бесплатная ИИ модель. Отправляем ей 10 таких ссылок, и через несколько итераций получаем такой результат:

path:README.md /raw\.githubusercontent\.com\/.*\d+\.\d+\.zip|github\.com\/.*\/raw\/refs\/heads\/.*\d+\.\d+\.zip/

Вводим этот запрос и получаем репозитории, которые распространяют zip архив с трояном. Количество репозиториев всегда разное. В моем случае иногда 111, иногда 4.4К.

Результаты третьего поиска

Но ведь весь этот поиск сработал только потому, что у нас был изначальный список репозиториев, из которых мы смогли составить общий паттерн для поиска.

Может у службы безопасности гитхаба не было этих репозиториев?
Может они не знают об этом общем паттерне?

Месяц назад я опубликовал статью, в которой подробно разобрал эту схему. Я написал скрипт, который нашёл 10,000 таких репозиториев. Список всех репозиториев и этот скрипт я опубликовал на гитхаб.

Статья попала на главную страницу Hacker News. Об этой схеме написали другие сайты по кибербезопасности.

Вот полный список действий, которые предприняли в GitHub:

  1. Они удалили все 10К репозиториев, которые нашёл скрипт.

Всё. Больше они ничего не сделали.

Более того, спустя несколько часов я снова запустил скрипт, он нашёл новые репозитории, я добавил их в статью. За целый месяц их не заблокировали. Хотя им нужно было просто еще раз открыть мою статью, взять новые ссылки и заблокировать эти репозитории. Для них это оказалось слишком сложно.

Но мы можем сделать вывод: они прекрасно знают об этой схеме распространения вирусов.

Сколько бы я не пытался, я не могу найти ответа на вопрос, почему так происходит. Microsoft это корпорация с миллиардными доходами. У них тысячи сотрудников, безграничные возможности и искусственный интеллект. Всё что им нужно было это выделить несколько дней любого штатного сотрудника, чтобы он с помощью Copilot нашёл все эти репозитории и заблокировал их.

Я никогда не работал в крупных компаниях. И я не представляю, как принимаются решения именно в гитхабе и какой бюрократический ад менеджерам нужно пройти, чтобы начать борьбу с вредоносными репозиториями.

Но ведь они за несколько часов после публикации первой статьи удалили все 10К репозиториев.

Почему они остановились и больше не предприняли никаких действий?

Проблемы с почасовой и попроектной оплатой

Представьте, вы работаете с почасовой оплатой. Как бы вы ответили на эти вопросы?

  1. Вам пришла в голову идея, которая может улучшить финансовое состояние компании. Она пришла из ниоткуда, вы даже не думали над ней, а занимались своими повседневными делами. Компания не покупает отдельные идеи, она платит только по часам. За сколько часов она должна оплатить, если вы потратили на эту идею 0 часов?
  2. Вам поставили задачу сделать какой-то функционал. Вы вспоминаете, что вы уже делали этот функционал раньше и на реализацию потратили 50 часов. Вы переносите это решение в текущий проект за 10 минут. Всё работает, задача сделана. Компания должна оплатить за 50 часов или за 10 минут?
  3. С появлением ИИ агентов стало еще интереснее. Вы умеете их эффективно использовать и делегируете им задачу, которую сами бы делали 10 часов. Агент расписывает план, вы проверяете, он выполняет его, вы ревьювите. Несколько таких итераций и задача сделана за 30 минут. Компания должна оплатить за 10 часов или за 30 минут?
  4. Вы потратили 10 часов на решение, а потом поняли, что вы вообще всё делали неправильно, и кажется что вы в самом начале могли догадаться об этом и выбрать совсем другое решение. Должна ли компания оплачивать за это время?

Здесь есть 2 решения для исполнителя:

  1. Не работать с компаниями, которые платят по часам.
  2. Искусственно рисовать в отчёте желаемое количество часов.

Если вы выберете первый вариант, то потеряете половину потенциальных клиентов.
Если вы хотите сохранить клиентов и получать желаему оплату, то вам придётся выбрать второй вариант.

Если вы используете готовое решение и выполняете задачу за 30 минут, то распишите в отчёте, как вы потратили на решение задачи 50 часов. Таким образом на удалёнке можно совмещать 2-4 фуллтайм работы одновременно. Вы работаете 30 часов, в отчёте указываете 150 часов, получаете оплату за 150 часов.

Почему я вообще говорю про отчёты? Менеджеры компаний, которые платят по часам, хотят видеть отчет о том, куда были потрачены эти часы. Если вы просто скажете, что на задачу ушло 50 часов, без каких-либо подробностей, скорее всего к вам появятся вопросы. Но если вы правдоподобно выдумаете на что ушло время, то эфективный менеджер откроет таблицу, увидит красивую информацию с разбивкой по часам, и его это устроит.

Можно сколько угодно говорить о том, что это нечестно. Но если мы посмотрим на реальный мир, то окажется, что деньги в большинстве случаев являются способом достижения комфортной жизни. Чем больше вы зарабатываете, тем лучше вы живёте. Конечно вы можете выбрать честный путь и надеяться, что вашу честность оценят по достоинству и в будущем дадут вам какие-то бонусы за это. Готовы ли вы жертвовать своим текущим доходом ради гипотетического будущего?

Для защиты от этого компании иногда используют приложения для автоматического скриншота экрана каждые 15 минут и просят заполнять отчет после каждого отработанного часа. Таким образом отсеиваются опытные и уверенные в себе исполнители. Остаются только те, у кого явные проблемы с поиском работы и они согласны почти на любые условия. Какое качество выполнения задач компания получит, если выберет этот подход?

Есть еще способ, чтобы не записывать в 3 раза больше часов. Просто называйте цену за час в 3 раза больше. Но если вы за час хотите 300$, а другой хочет 100$, то компания, которая выбирает сотрудника по цене, выберет другого, а не вас. Даже если платить она ему будет столько же, потому что он будет указывать в 3 раза больше часов, чем было в реальности. Тогда ваша честность и большая ставка за час оставят вас без работы.

С идеями конечно так не получится. Есть мнение, что идеи ничего не стоят, а ценность имеет только реализация. Поэтому если вам пришла гениальная идея решения какой-то проблемы, то компания не будет за это платить. Руководители считают, что эта идея уже включена в ваше оплаченное время. Если ваш час стоит 60$, а на идею вы потратили минуту, то так уж и быть, вам заплатят за идею 1$. И вы не можете в отчёте расписать, как вы придумывали эту идею десятки часов. Вы ведь не проводили никакое исследование. Это часто является причиной, почему сотрудники вообще не рассказывают о каких-то идеях руководству, которые могли бы помочь развитию компании.

Если столько проблем с оплатой по часам, почему бы просто не договориться об оплате за проект или за каждую задачу? Это решает одни проблемы, но создаёт новые:

  1. Заказчику нужно детально расписывать задачи перед началом выполнения. Что если после начала выполнения заказчик захочет поменять требования или добавить что-то? Нужно заново обсуждать условия с исполнителем.
  2. Исполнителю нужно каким-то образом правильно оценить сроки и цену. При этом он еще не знает, какие сложности возникнут в процессе выполнения. Если он ошибётся в рассчетах и выполнение займёт в 3 раза больше времени, что ему делать? Попытаться обсудить новые условия или выполнить работу на текущих условиях?
  3. Иногда на оценку проекта может уйти много часов. Заказчик может не согласиться с этими условиями, и тогда выходит, что исполнитель зря потратил своё время на оценку.
  4. Разные исполнители могут дать оцень разные оценки за один и тот же проект. Это зависит от опыта исполнителя, качества его работы, загруженности, и десятка других параметров. Как заказчику выбрать наилучшего исполнителя для проекта?

За редкими исключениями, я никогда не работаю с оплатой за каждую задачу или за проект. Ни в роли исполнителя, ни в роли заказчика. Но и с оплатой по часам я тоже не работаю.

Я выбрал для себя подход с оплатой за неделю или за месяц с очень короткими отчётами или вообще без них. Это очень хорошо работает для стартапов с маленькими командами.

Когда я ищу сотрудника, я обсуждаю с ним желаему оплату за неделю. Каждые несколько недель я смотрю на то, какую пользу принёс этот сотрудник. Я смотрю не только на выполненные задачи, но и на идеи, которые он предложил, или на его помощь другим сотрудникам, или на любую другую ценность. Мне вообще не важно сколько часов он работал. И мне не важен его отчет, потому что я всегда знаю чем были заняты сотрудники.

Этот подход решает все проблемы, которые есть с почасовой и проектной оплатой. Но если вы исполнитель, то с этим подходом вы потеряете много клиентов. У клиента появляется вопрос: за что я вообще должен платить? Ведь он не знает, какие задачи вы выполните за этот срок и сколько именно часов вы потратите на работу. Ему в большинстве случаев нужно видеть красивый и подробный отчёт. Если вы работаете в такой компании, врядли вы сможете как-то повлиять на процесс. Руководство работает так, как оно привыкло работать, и считает свой стиль управления правильным.

Представьте еще такую ситуацию. Компания договорилась с исполнителем на оплату за каждую неделю без учёта часов. Сотрудник работал несколько месяцев, хорошо справлялся с задачами, руководство им очень довольно. Но предыдущую неделю сотрудник не работал. Должна ли компания оплатить ему за эту неделю?

Problems with hourly and project-based pay

Imagine you’re working on an hourly basis. How would you answer these questions?

  1. An idea popped into your head that could improve the company’s financial situation. It came out of nowhere — you weren’t even thinking about it; you were just going about your daily routine. The company doesn’t buy individual ideas; it only pays by the hour. How many hours should the company pay you if you spent 0 hours on this idea?
  2. You’ve been assigned the task of implementing a certain feature. You remember that you’ve already built this feature before and spent 50 hours on it. You reuse that solution in the current project in 10 minutes. Everything works. The task is complete. Should the company pay for 50 hours or for 10 minutes?
  3. With the advent of AI agents, things have gotten even more interesting. You know how to use them effectively and delegate a task to them that would have taken you 10 hours to complete yourself. The agent draws up a plan, you review it, the agent carries it out, and you review it. After a few such iterations, the task is completed in 30 minutes. Should the company pay for 10 hours or for 30 minutes?
  4. You spent 10 hours working on a solution, only to realize that you’d been doing everything wrong all along, and it seems you could have figured this out right from the start and chosen a completely different solution. Should the company pay for that time?

There are two options for the contractor here:

  1. Don’t work with companies that pay by the hour.
  2. Artificially inflate the number of hours in your report.

If you choose the first option, you’ll lose half of your potential clients.
If you want to keep your clients and get paid what you want, you’ll have to choose the second option.

If you use a ready-made solution and complete a task in 30 minutes, write in your report that you spent 50 hours on it. This way, when working remotely, you can juggle 2-4 full-time jobs at the same time. You work 30 hours, report 150 hours, and get paid for 150 hours.

Why am I even talking about reports? Managers at companies that pay by the hour want to see a report detailing where those hours were spent. If you simply say that a task took 50 hours without providing any details, you’ll most likely get questions. But if you come up with a plausible explanation of how you spent your time, an effective manager will open the spreadsheet, see the neatly organized information broken down by the hour, and be satisfied with it.

You can argue all you want that this isn’t fair. But if we look at the real world, it turns out that, in most cases, money is a way to live comfortably. The more you earn, the better you live. Of course, you can choose the honest path and hope that your honesty will be properly recognized and that you’ll get some bonus for it down the line. Are you willing to sacrifice your current income for the sake of a hypothetical future?

To prevent this, companies sometimes use apps that automatically take a screenshot of the screen every 15 minutes and ask workers to fill out a report after every hour worked. This weeds out experienced and confident workers. Only those who clearly have trouble finding work — and are willing to accept almost any conditions — remain. What quality of work will the company get if it chooses this approach?

There’s another way to avoid logging three times as many hours. Just set your hourly rate three times higher. But if you want $300 an hour and someone else wants $100, a company hiring based on price will choose the other person, not you. Even if the company ends up paying that other person the same amount, because he’ll report three times as many hours as he actually worked. In that case, your honesty and higher hourly rate will leave you without a job.

Of course, this doesn’t work with ideas. There’s a belief that ideas are worthless, and that only their implementation has value. So if you come up with a brilliant idea to solve a problem, the company won’t pay you for it. Managers believe that this idea is already included in your billable hours. If your hourly rate is $60 and you spent one minute on the idea, then so be it — you’ll get a whopping $1 for the idea. And you can’t write in a report that you spent dozens of hours coming up with that idea. After all, you didn’t conduct any research. This is often why employees don’t share ideas with management at all — ideas that could actually help the company grow.

If there are so many problems with hourly billing, why not simply agree to pay per project or per task? This solves some problems but creates new ones:

  1. The client must specify the tasks in detail before work begins. What if, after work has started, the client wants to change the requirements or add something? The client will have to renegotiate the terms with the contractor.
  2. The contractor needs to accurately estimate the timeline and price. However, they don’t yet know what challenges will arise during the project. If their estimates are off and the work takes three times as long, what should they do? Try to negotiate new terms or complete the work under the current terms?
  3. Sometimes, estimating a project can take many hours. The client may not agree to these terms, in which case the contractor ends up wasting their time on the estimate.
  4. Different contractors can provide very different estimates for the same project. This depends on the contractor’s experience, the quality of their work, their current workload, and a dozen other factors. How can a client choose the best contractor for a project?

With rare exceptions, I never work on a per-task or per-project basis — neither as a freelancer nor as a client. But I also don’t work on an hourly basis.

I’ve chosen an approach where I’m paid weekly or monthly, with very brief reports or none at all. This works very well for startups with small teams.

When I’m looking for an employee, I discuss their target weekly pay with them. Every few weeks, I assess the value they’ve delivered. I look not only at the tasks they’ve completed, but also at the ideas they’ve proposed, the help they’ve given to other employees, or any other value they’ve added. I don’t care at all how many hours they worked. And I don’t care about their timesheet, because I always know what my employees have been working on.

This approach solves all the problems associated with hourly and project-based billing. But if you’re a contractor, you’ll lose a lot of clients with this approach. The client will ask: what exactly am I paying for? After all, they don’t know what tasks you’ll complete during that period or exactly how many hours you’ll spend on the work. In most cases, they need to see a pretty, detailed report. If you work at a company like this, you have zero leverage over the process. Management works the way it’s always worked and considers its management style to be the right one.

Consider another scenario. A company has agreed with a contractor to pay on a weekly basis, regardless of hours worked. The contractor has been working for several months, has performed well, and the client is very satisfied with their work. But they didn’t work last week. Should the company pay them for that week?

Коучи

Подписываюсь на блогера по крипте, но вижу, что у него почти все посты про успешный успех. Он летает бизнес-классом, дарит жене подарки, обедает в дорогих ресторанах. Но если бы я хотел посмотреть на твои фотки, я бы подписался на твой инстаграм, не так ли?

В описании профиля указано, что ты научишь меня торговать криптой. Я подписался, чтобы узнать что-то новое, но пролистал месяц твоих постов и увидел только 1 совет от ИИ. Чем именно мне поможет просмотр всех твоих фотографий? Как это убедит меня что-то у тебя купить? Почему у меня должно появиться к тебе доверие?

Фотографии успеха никак не объясняют, откуда этот успех появился. Люди могли зарегистрироваться по твоим реферальным ссылкам, слить деньги после твоих советов, а ты бы заработал комиссию от их потерь.

Ок, ты завлек внимание людей, которые хотят такую же успешную жизнь. Но как ты добьешься внимания миллионеров? Они живут гораздо успешнее тебя. Ты их не завлечёшь красивой жизнью.